A ChatGPT kitalál referenciákat? Mit találtak a fabrikációs vizsgálatok
Hat vizsgálat, négy szakterület, három év. Az arány, amellyel a ChatGPT kitalál egy hivatkozást, az egyszámjegyű értékektől jóval a feléig terjed, és ez a szám semmit sem jelent a modellverzió és a hozzá kapcsolt dátum nélkül.
2025 júniusában a Deakin University kutatói arra kérték a GPT-4o-t, hogy írjon hat irodalmi áttekintést mentális egészség témákról. A 176 hivatkozás közül, amelyet létrehozott, 35 egyáltalán nem létezett. További 64 valós tanulmányokra mutatott, de hibás adatokkal. Ez minden ötödik hivatkozásnál egy teljesen kitalált tételt jelent, egy olyan modellből, amelyet több mint egy évvel azután adtak ki, hogy a ChatGPT hivatkozási problémáját először nyomtatásban mérték.
Kitalál-e a ChatGPT hivatkozásokat? Igen, és ez 2026-ban is így van, a jelenlegi modelleken, nemcsak azon a verzión, amely 2023-ban címlapokra került. A nyitott kérdés soha nem az volt, hogy ez megtörténik-e. Inkább az, hogy milyen gyakran, és ez az érték a modelltől, a verziótól, a szakterülettől és a teszt futtatásának dátumától függően változik.
Kitalál-e a ChatGPT hivatkozásokat?
Igen. Egy nyelvi modell a korábbi szöveg alapján megjósolja a következő valószínű szót. Nem keres rá semmire, hacsak a termékbe nem épít be lekérdezési vagy keresési lépést. Ha arra hagyják, hogy megjósolja, hogyan néz ki egy hivatkozás, olyat fog létrehozni, amely helyesnek tűnik: szerző neve, év, folyóirat címe, kötetszám, DOI, anélkül, hogy ellenőrizné, ezek bármelyike megfelel-e egy valós publikációnak. Néhány ezek közül véletlenül vagy bemagolt minták alapján pontos lesz. Mások teljesen a semmiből lesznek kitalálva, és pontosan ugyanúgy fognak kinézni.
Miért van szükség a kitalálási arányhoz modellverzióra és dátumra
Mert az arány nem egyetlen szám. Ebben az egyik legtöbbet idézett vizsgálatban a ChatGPT-3.5 a rövid irodalmi áttekintésekből álló mintában a hivatkozások 55 százalékát fabrikálta, míg a ChatGPT-4, amelyet ugyanazok a kutatók ugyanazon 42 témán teszteltek, 18 százalékot fabrikált. Ugyanaz a vizsgálat, ugyanazok az utasítások, ugyanaz a tesztelési nap. Az egyetlen dolog, ami változott, a modell volt, és az arány kétharmaddal csökkent.
A dátum legalább annyira számít, mint a modell neve. A GPT-4 abban a tanulmányban azt jelentette, amit az OpenAI 2023 közepén éppen szolgáltatott. Egy 2026-os tanulmány tíz aktuális modellről és kutatási ügynökről, amely összesen több mint 220,000 hivatkozási linket ellenőrzött, 3 százaléktól 13 százalékig terjedő fabrikációs arányokat talált, a pontos érték pedig az adott modelltől és attól függött, hogy a termék keresési megalapozást vagy mély kutatási módot használt-e. Egyik szám sem hibás. Különböző dolgokat írnak le, amelyeket csaknem három év különbséggel mértek.
A szakterület is számít, a modelltől függetlenül. Gazdaságtani kutatásban is, amelyet ugyanazon GPT-3.5 és GPT-4 párosításon futtattak, a GPT-3.5 hivatkozásainak több mint 30 százaléka kitaláltnak bizonyult, a GPT-4 esetében pedig az arány még mindig 20 százalék fölött volt, közel ahhoz, amit a multidiszciplináris tanulmány talált, míg az orvosi szisztematikus áttekintéses tanulmány, amely kifejezetten a GPT-4 2023 márciusi változatának címkézett buildjét tesztelte, 28.6 százalékot mért egy teljesen eltérő feladaton, meglévő szisztematikus áttekintésekhez tartozó hivatkozások kinyerésén, nem pedig új irodalmi összefoglalók nulláról való megírásán.
Mit találtak a publikált tanulmányok
Hat tanulmány, amelyeket 2023 és 2026 között végeztek, az orvostudomány, a jog, a közgazdaságtan és az általános tudományos írás területén, ugyanarra a megállapításra jut, amelyet hat különböző módon fogalmaztak meg: ellenőrizzen minden hivatkozást, amelyet egy AI eszköz ad Önnek, függetlenül attól, hogy melyik modell állította elő, vagy mikor.
| Tanulmány és szakterület | Modell és verzió | Tesztelés dátuma | Minta | Fabrikációs arány |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidiszciplináris) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 hivatkozás, 42 téma | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (közgazdaságtan) | GPT-3.5 and GPT-4 | 2023 | Journal of Economic Literature témákból származó promptok | 30% felett (3.5), 20% felett (4) |
| Chelli et al, JMIR (orvosi szisztematikus áttekintések) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 hivatkozás, 11 áttekintés | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (jog) | ChatGPT-4 and Llama 2 | 2024 | Véletlenszerű szövetségi bírósági ügykérdések | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (mentális egészségügyi áttekintések) | GPT-4o | Tested June 2025 | 176 hivatkozás, 6 áttekintés | 19.9% teljesen fabrikált, 56% fabrikált vagy hibás |
| Rao, Wong and Callison-Burch, arXiv preprint (több terület, deep research ügynökök) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Több mint 220,000 hivatkozási URL | 3% to 13% modelltől függően |
A jogi tanulmány olyan részletet tesz hozzá, amelyet a nyers százalék nem ragad meg: ugyanez a kutatás azt találta, hogy a modellek nehezen tudják előre jelezni saját hallucinációikat, és hajlamosak elfogadni a felhasználó egy ügyre vonatkozó helytelen előfeltevését, ahelyett hogy kijavítanák azt. Egy fabrikált hivatkozás egyetlen hibamód. Az a modell, amely saját bizonytalanságát sem tudja jelezni, nehezebb probléma, és ez leginkább éppen abban a szakterületben jelenik meg, ahol egy hibás hivatkozásnak a legnagyobb a költsége.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Jobb lett-e a ChatGPT 2023 óta?
Valamelyest, és egyenetlenül. A legvilágosabb egyetlen előtte és utána különbség magában a Walters és Wilder tanulmányban látható, GPT-3.5-ről GPT-4-re, ugyanazon a napon, a fabrikáció 55 százalékról 18 százalékra csökkent. Ha továbblépünk a GPT-4o-ra 2025 közepén, és a Linardon csapata által mért arányra, az 19.9 százalék volt, egy nehezebb és szűkebb feladaton, hat irodalmi áttekintés egyetlen kutatási területen, nem pedig rövid összefoglalók 42 egymástól független témán. Ha ismét továbblépünk a keresési vagy deep-research funkcióval bekapcsolt modellekre, amelyeket 2026 elején teszteltek, az érték a legtöbbnél egy számjegyűre csökken, 3 és 9 százalék közé, bár egy deep-research mód még mindig elérte a 13.3 százalékot.
Ennek semmi sem egyenes lefelé tartó vonal. A Linardon-féle érték a 2023-as GPT-4 adat és a 2023-as GPT-3.5 adat között helyezkedik el, egy olyan modellen, amelyet több mint egy évvel mindkettő után adtak ki, mert nehezebb feladaton tesztelték, valódi irodalmi áttekintés generálásán egy olyan területen, ahol a forrásanyag nagy része önmagában is nehezen található meg. A fabrikációs arány egy modellt ír le egy feladaton, egy adott napon. Ha a három tényező bármelyikét megváltoztatjuk, az érték elmozdul, néha jelentősen.
A modellcsalád nem az egyetlen változó, amely ma is mozgatja az értéket. Egy 2025-ös tanulmány, amely nyolc ingyenes chatbotot, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat és Perplexity értékelt, 400 hivatkozáson, öt tudományterületen, azt találta, hogy az összes generált hivatkozásnak csak 26.5 százaléka volt teljesen helyes. Grok és DeepSeek ebben a tesztben nulla fabrikált hivatkozást produkált. Claude, Copilot és Perplexity a leggyengébben teljesítők közé tartoztak. Két, összehasonlítható mögöttes technológiára épülő termék, amelyeket ugyanabban a hónapban, ugyanazokkal a promptokkal teszteltek, a tartomány két ellentétes végére került, és ez ugyanaz a tanulság, mint a fenti modell és dátum táblázaté, csak itt termékre alkalmazva, nem verzióra.
Miért tűnnek valósnak a fabrikált hivatkozások
A fabrikált hivatkozás nem nyilvánvaló helykitöltő. Walters és Wilder megállapították, hogy kitalált bejegyzéseik valódi szerzőneveket tartalmaztak, olyanokét, akik a tényleges szakterületen publikálnak, és ezek olyan folyóiratcímekhez kapcsolódtak, amelyek valóban léteznek, valamint elég jól voltak formázva ahhoz, hogy átmenjenek egy gyors vizuális ellenőrzésen. Linardon csapata ennél élesebb dolgot talált: a GPT-4o által előállított 35 fabrikált hivatkozás közül 33 DOI-val érkezett, és ezeknek a DOI-knak a 64 százaléka egy valódi, publikált tanulmányhoz vezetett, amely teljesen független témáról szólt, tehát nem halott linkről és nem hibaoldalról volt szó, hanem valaki más tényleges kutatása állt be egy nem létező forrás helyére.
Hogyan ellenőrizhető, hogy egy ChatGPT hivatkozás valódi-e
A pontos címet keresse meg a Google Scholarban vagy a folyóirat saját oldalán, ne csak a DOI-ra hagyatkozzon, mivel egy működő DOI teljesen rossz tanulmányra is mutathat. Ellenőrizze, hogy a szerzők listája, az évszám és a folyóirat megegyezik-e azzal, ami ténylegesen megjelenik, ne csak azzal, hogy valami megjelenik. Ezt minden egyes hivatkozásnál tegye meg, amelyet egy chatbot ad, ne csak azoknál, amelyek ismeretlennek tűnnek, mivel ezekben a vizsgálatokban a fabrikált bejegyzéseket kifejezetten úgy készítették, hogy hétköznapinak tűnjenek.
Az ismeretlen vagy szűk témát nagyobb kockázatúnak kell tekinteni, mint a fősodorbeli témát. Linardon csapata egy jól kutatott állapot, a major depressive disorder esetében körülbelül 6 százalékos fabrikálást talált, ugyanazon áttekintéskészlet két kevésbé kutatott témájánál pedig közel 30 százalékot. A minta a mentális egészségen kívül is érvényes: egy modellnek egy zsúfolt területen több valódi szöveg áll rendelkezésére, amelyből mintázatokat vonhat le, és egy ritkább területen több tere van arra, hogy hihetően találjon ki dolgokat.
Egy AI hivatkozásellenőrző, amely minden bejegyzést egy valódi tudományos adatbázissal vet össze automatizálja ezt a keresést, ahelyett hogy minden egyes hivatkozásnál manuális ellenőrzésre hagyatkozna, márpedig ezt a részt a legtöbben határidőnyomás alatt kihagyják, éppen abban az állapotban, amelyben a fabrikált hivatkozás a legnagyobb valószínűséggel átjut a végleges változatba.
Egy kész bibliográfiában való megtalálásuk önálló eljárás, és külön oldala van. Azoknál a hivatkozásoknál, amelyek valódiak, a ChatGPT hivatkozása APA szerint lépésről lépésre van bemutatva.
Ez semmit sem változtat azon, hogyan formáz egy hivatkozást, miután megerősítette, hogy az valódi. Ez egy külön kérdés: A ChatGPT idézése lefedi az APA, MLA, Chicago és IEEE formátumot magára a párbeszédre vonatkozóan, és egy hivatkozásgenerátor ugyanúgy kezeli a szokásos hivatkozást, függetlenül attól, hogy melyik stílusban ír. Amit egyetlen hivatkozási formátum sem tud kijavítani, az egy olyan forrásra való hivatkozás, amelyet soha nem publikáltak. Ezt az ellenőrzést a formázás előtt kell elvégezni, minden egyes hivatkozásnál, függetlenül attól, hogy melyik modell írta a vázlatot, vagy hogy a címke melyik verziót állítja.
Frequently Asked Questions
A ChatGPT kitalál referenciákat? Igen, az eddig tesztelt minden modellen, és minden 2023 és 2026 közötti publikált vizsgálatban. Az arány rendkívül eltérő a modellverzió, a szakterület és a dátum szerint, nagyjából 3 százaléktól a legújabb, megalapozott modelleken egészen jóval a feléig GPT-3.5 esetében 2023-ban, ezért egyetlen szám soha nem ad teljes választ.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.