Academic Writing

ChatGPT inventează referințe? Ce au arătat studiile despre fabricație

Șase studii, patru domenii, trei ani. Rata cu care ChatGPT inventează o referință variază de la procente de o singură cifră la peste jumătate, iar numărul nu înseamnă nimic fără versiunea modelului și data asociată lui.

6 min
Does ChatGPT make up references: a table of studies by model version and year

În iunie 2025, cercetătorii de la Deakin University i-au cerut lui GPT-4o să scrie șase recenzii de literatură pe teme de sănătate mintală. Dintre cele 176 de citări pe care le-a produs, 35 nu existau deloc. Alte 64 indicau lucrări reale, dar cu detalii greșite atașate. Asta înseamnă o referință din cinci inventată pe loc, de către un model lansat la mai bine de un an după ce problema citărilor din ChatGPT a fost măsurată pentru prima dată în formă tipărită.

ChatGPT inventează referințe? Da, și încă o face în 2026, pe modelele actuale, nu doar pe versiunea care a făcut titluri în 2023. Întrebarea deschisă nu a fost niciodată dacă acest lucru se întâmplă. Este cât de des, iar acest număr variază în funcție de model, versiune, domeniu și data la care a fost rulat testul.

ChatGPT Inventează Referințe?

Da. Un model lingvistic prezice următorul cuvânt plauzibil pe baza a tot ceea ce a apărut înainte. Nu caută nimic nicăieri, decât dacă adăugați un pas de recuperare sau de căutare în produsul dumneavoastră. Dacă este lăsat să prezică cum arată o citare, va produce una care pare corectă: numele autorului, anul, titlul revistei, numărul volumului, DOI, fără a verifica dacă vreunul dintre aceste elemente corespunde unei publicații reale. O parte dintre ele vor fi exacte din întâmplare sau prin memorare mecanică. O parte vor fi inventate de la zero și vor arăta exact la fel.

De Ce o Rată de Fabricare Are Nevoie de o Versiune a Modelului și de o Dată

Pentru că rata nu este un singur număr. În cel mai citat studiu pe această temă, ChatGPT-3.5 a fabricat 55 percent din citările dintr-un set de recenzii scurte de literatură, iar ChatGPT-4, testat de aceiași cercetători pe aceleași 42 de teme, a fabricat 18 percent. Același studiu, aceleași prompturi, aceeași zi de testare. Singurul lucru care s-a schimbat a fost modelul, iar rata a scăzut cu două treimi.

Data contează la fel de mult ca numele modelului. GPT-4 în acel studiu însemna orice servea OpenAI la mijlocul anului 2023. Un studiu din 2026 asupra a zece modele actuale și agenți de cercetare, care a verificat în total peste 220,000 de legături de citare, a constatat rate de fabricație de la 3 la sută la 13 la sută, cifra exactă depinzând de modelul specific și de faptul dacă produsul folosea căutare cu fundamentare sau un mod de cercetare aprofundată. Niciuna dintre cifre nu este greșită. Ele descriu lucruri diferite, măsurate la aproape trei ani distanță.

Domeniul contează și el, independent de model. Am avut, de asemenea, cercetări în economie rulate prin aceeași pereche GPT-3.5 și GPT-4, care au găsit peste 30 la sută dintre citările GPT-3.5 inventate și o rată încă peste 20 la sută pentru GPT-4, apropiată de ceea ce a constatat studiul multidisciplinar, în timp ce studiul de revizuire sistematică medicală, care a testat în mod specific ceea ce era etichetat drept versiunea din martie 2023 a GPT-4, a măsurat 28.6 la sută într-o sarcină complet diferită: extragerea referințelor pentru revizuiri sistematice existente, mai degrabă decât redactarea de la zero a unor noi sinteze de literatură.

Ce au constatat studiile publicate

Șase studii, derulate între 2023 și 2026, în medicină, drept, economie și scriere academică generală, converg asupra aceleiași constatări formulate în șase moduri diferite: verificați fiecare referință pe care vi-o oferă un instrument AI, indiferent de modelul care a produs-o sau de momentul în care a fost produsă.

Studiu și domeniuModel și versiuneData testăriiEșantionRata de fabricație
Walters și Wilder, Scientific Reports (multidisciplinar)ChatGPT-3.5 și ChatGPT-42023636 de citări, 42 de subiecte55% (3.5) versus 18% (4)
Buchanan, Hill și Shapoval, The American Economist (economie)GPT-3.5 și GPT-42023Prompturi din subiecte Journal of Economic LiteraturePeste 30% (3.5), peste 20% (4)
Chelli et al, JMIR (revizuiri sistematice medicale)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Interogat în iulie 2023471 de referințe, 11 revizuiri39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun și Ho, Journal of Legal Analysis (drept)ChatGPT-4 și Llama 22024Întrebări aleatorii despre cauze din instanțe federale58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (revizuiri în sănătate mintală)GPT-4oTestat în iunie 2025176 de citări, 6 revizuiri19.9% fabricate integral, 56% fabricate sau eronate
Rao, Wong și Callison-Burch, preprint arXiv (multi-domeniu, agenți de deep research)GPT-4.1, GPT-4o-search-preview, Claude 3.5 și 3.7 Sonnet, Gemini 2.52026Peste 220,000 de URL-uri de citare3% până la 13% în funcție de model

Studiul juridic adaugă un detaliu pe care procentul brut nu îl surprinde: aceeași cercetare a constatat că modelele au dificultăți în a-și prezice propriile halucinații și tind să accepte premisa incorectă a utilizatorului despre o cauză, în loc să o corecteze. O citare fabricată este un mod de eșec. Un model care, în plus, nu își poate semnala propria incertitudine reprezintă o problemă mai dificilă, iar aceasta apare cel mai clar exact în domeniul în care o citare greșită are cel mai mare cost.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

S-a îmbunătățit ChatGPT de la 2023?

Într-o anumită măsură, și inegal. Cea mai clară comparație înainte și după este chiar în studiul Walters și Wilder: GPT-3.5 la GPT-4, în aceeași zi, fabricația a scăzut de la 55 percent la 18 percent. Dacă avansăm la GPT-4o la mijlocul lui 2025, rata măsurată de echipa lui Linardon a fost de 19.9 percent, pe o sarcină mai dificilă și mai restrânsă, șase recenzii de literatură într-un singur domeniu de cercetare, nu rezumate scurte răspândite pe 42 de subiecte fără legătură între ele. Dacă avansăm din nou la modelele cu funcțiile de căutare sau deep-research activate, testate la începutul lui 2026, intervalul coboară la o singură cifră pentru majoritatea, de la 3 la 9 percent, deși un mod deep-research a ajuns totuși la 13.3 percent.

Nimic din toate acestea nu urmează o linie dreaptă descendentă. Valoarea lui Linardon se situează între cifra GPT-4 din 2023 și cifra GPT-3.5 din 2023, pe un model lansat la mai bine de un an după ambele, pentru că a fost testat pe o sarcină mai dificilă: generarea reală de recenzii de literatură într-un domeniu în care o mare parte din materialul sursă este, la rândul său, greu de găsit. O rată de fabricație descrie un model pe o sarcină la o anumită dată. Schimbați oricare dintre cele trei și cifra se modifică, uneori mult.

Familia de modele nu este singura variabilă care mai modifică astăzi cifra. Un studiu din 2025 care a evaluat opt chatboți gratuiti, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat și Perplexity, pe 400 de referințe din cinci domenii academice, a constatat că doar 26.5 percent din toate referințele generate au fost complet corecte. Grok și DeepSeek nu au produs nicio referință fabricată în acel test. Claude, Copilot și Perplexity s-au numărat printre cele mai slabe performanțe. Două produse construite pe tehnologie de bază comparabilă, testate în aceeași lună, pe aceleași prompturi, au ajuns la capete opuse ale intervalului, ceea ce este aceeași lecție ca în tabelul despre model și dată de mai sus, aplicată la produs, nu la versiune.

De ce citările fabricate par reale

O citare fabricată nu este un substituent evident. Walters și Wilder au constatat că intrările lor inventate purtau nume reale de autori, persoane care publică în domeniul real, atașate unor titluri de reviste care există cu adevărat, formatate suficient de bine pentru a trece un control vizual rapid. Echipa lui Linardon a găsit ceva mai clar: dintre cele 35 de citări fabricate produse de GPT-4o, 33 aveau atașat un DOI, iar 64 la sută dintre acele DOI-uri duceau la o lucrare reală, publicată, pe un subiect complet fără legătură, nu la un link mort și nici la o pagină de eroare, cercetarea reală a altcuiva înlocuind o sursă care nu există.

Cum să verificați dacă o citare ChatGPT este reală

Căutați titlul exact în Google Scholar sau pe site-ul propriu al revistei, în loc să aveți încredere doar în DOI, deoarece un DOI funcțional poate indica în întregime lucrarea greșită. Confirmați că lista de autori, anul și revista corespund cu ceea ce apare efectiv, nu doar că apare ceva. Faceți acest lucru pentru fiecare referință oferită de un chatbot, nu doar pentru cele care par nefamiliare, deoarece intrările fabricate din aceste studii au fost construite în mod special pentru a părea obișnuite.

Tratați un subiect nefamiliar sau restrâns ca având un risc mai mare decât unul principal. Echipa lui Linardon a constatat o fabricare de aproape 6 la sută pentru o afecțiune bine studiată, tulburarea depresivă majoră, și de aproape 30 la sută pentru două afecțiuni mai puțin studiate din același set de recenzii. Modelul se menține și în afara sănătății mintale: un model are mai mult text real din care să extragă tipare într-un domeniu aglomerat și mai mult spațiu pentru a inventa plauzibil într-unul subțire.

Un verificator de citări AI care rulează fiecare intrare împotriva unei baze de date academice reale automatizează această căutare, în loc să o lase unei verificări manuale pentru fiecare referință în parte, care este partea pe care cei mai mulți o sar sub presiunea termenului limită, exact condiția în care o citare fabricată are cele mai mari șanse să ajungă într-un draft final.

Găsirea lor într-o bibliografie finalizată este o procedură de sine stătătoare și are propria pagină. Pentru citările care sunt reale, citarea ChatGPT în APA este prezentată pas cu pas.

Nimic din toate acestea nu schimbă modul în care formatați o citare după ce ați confirmat că este reală. Aceasta este o întrebare separată: How to cite ChatGPT acoperă APA, MLA, Chicago și IEEE pentru schimbul propriu-zis, iar un generator de citări gestionează referința obișnuită în același mod, indiferent de stilul în care scrieți. Ceea ce nu poate corecta niciun format de citare este o referință la ceva care nu a fost niciodată publicat. Acea verificare are loc înainte de formatare, pentru fiecare referință, indiferent de modelul care v-a scris schița sau de versiunea pe care o pretinde eticheta sa.

Frequently Asked Questions

ChatGPT inventează referințe? Da, în cazul fiecărui model testat până acum, în fiecare studiu publicat din 2023 până în 2026. Rata variază enorm în funcție de versiunea modelului, de domeniu și de dată, de la aproximativ 3% la cele mai recente modele cu fundamentare până la peste jumătate la GPT-3.5 în 2023, astfel încât un singur număr nu este niciodată răspunsul complet.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

ChatGPT inventează referințe? Studiile comparate | TextPulse.ai