Academic Writing

ChatGPT inventa riferimenti? Cosa hanno trovato gli studi sulla fabbricazione

Sei studi, quattro ambiti, tre anni. Il tasso con cui ChatGPT inventa un riferimento varia da valori a una cifra a ben oltre la metà, e il numero non significa nulla senza la versione del modello e la data a cui è associato.

6 min
Does ChatGPT make up references: a table of studies by model version and year

Nell giugno 2025, i ricercatori della Deakin University hanno chiesto a GPT-4o di scrivere sei revisioni della letteratura su temi di salute mentale. Delle 176 citazioni prodotte, 35 non esistevano affatto. Altre 64 rimandavano a articoli reali con dettagli errati. Si tratta quindi di una citazione su cinque inventata del tutto, da un modello rilasciato più di un anno dopo che il problema delle citazioni di ChatGPT era stato misurato per la prima volta in forma scritta.

ChatGPT inventa riferimenti? Sì, e lo fa ancora nel 2026, sui modelli attuali, non solo sulla versione che fece notizia nel 2023. La questione aperta non è mai stata se ciò accada. È con quale frequenza, e quel numero varia in base al modello, alla versione, al campo e alla data in cui il test è stato eseguito.

ChatGPT inventa riferimenti?

Sì. Un modello linguistico prevede la parola successiva plausibile in base a tutto ciò che precede. Non consulta alcuna fonte, a meno che nel prodotto non si aggiunga una fase di recupero o di ricerca. Se viene lasciato a prevedere l'aspetto di una citazione, ne produrrà una che sembra corretta, nome dell'autore, anno, titolo della rivista, numero del volume, DOI, senza verificare che uno qualsiasi di questi elementi corrisponda a una pubblicazione reale. Parte di ciò sarà accurata per caso o per memorizzazione meccanica. Parte sarà inventata da zero e apparirà esattamente uguale.

Perché un tasso di fabbricazione richiede una versione del modello e una data

Perché il tasso non è un solo numero. Nello studio singolo più citato su questo tema, ChatGPT-3.5 ha fabbricato il 55 percento delle citazioni in un insieme di brevi revisioni della letteratura, e ChatGPT-4, testato dagli stessi ricercatori sugli stessi 42 argomenti, ha fabbricato il 18 percento. Stesso studio, stessi prompt, stesso giorno di test. L'unica cosa cambiata era il modello, e il tasso è sceso di due terzi.

La data conta tanto quanto il nome del modello. GPT-4 in quello studio significava qualunque cosa OpenAI stesse fornendo a metà del 2023. Uno studio del 2026 su dieci modelli attuali e agenti di ricerca, che ha controllato in totale più di 220,000 collegamenti di citazione, ha rilevato tassi di fabbricazione dal 3 percento al 13 percento, con il valore esatto che dipendeva dal modello specifico e dal fatto che il prodotto usasse il search grounding o una modalità di ricerca approfondita. Nessuna delle due cifre è sbagliata. Descrivono cose diverse misurate a quasi tre anni di distanza.

Anche il settore conta, indipendentemente dal modello. Abbiamo anche uno studio di economia eseguito con la stessa combinazione di GPT-3.5 e GPT-4 che ha rilevato oltre il 30 percento di citazioni di GPT-3.5 inventate e un tasso ancora superiore al 20 percento per GPT-4, vicino a quanto trovato dallo studio multidisciplinare, mentre lo studio di revisione sistematica in ambito medico, che ha testato in modo specifico quella che era etichettata come la build di marzo 2023 di GPT-4, ha misurato il 28.6 percento su un compito completamente diverso: recuperare riferimenti per revisioni sistematiche già esistenti invece di scrivere da zero nuovi riassunti della letteratura.

Cosa hanno trovato gli studi pubblicati

Sei studi, condotti tra il 2023 e il 2026, in medicina, diritto, economia e scrittura accademica generale, convergono sulla stessa conclusione espressa in sei modi diversi: controlla ogni riferimento che uno strumento AI ti fornisce, indipendentemente dal modello che lo ha prodotto o dal momento in cui è stato prodotto.

Study and fieldModel and versionDate testedSampleFabrication rate
Walters and Wilder, Scientific Reports (multidisciplinary)ChatGPT-3.5 and ChatGPT-42023636 citazioni, 42 argomenti55% (3.5) versus 18% (4)
Buchanan, Hill and Shapoval, The American Economist (economics)GPT-3.5 and GPT-42023Prompt dai temi di Journal of Economic LiteratureOltre 30% (3.5), oltre 20% (4)
Chelli et al, JMIR (medical systematic reviews)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Interrogato a luglio 2023471 riferimenti, 11 revisioni39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law)ChatGPT-4 and Llama 22024Domande casuali su casi di tribunali federali58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (mental health reviews)GPT-4oTestato a giugno 2025176 citazioni, 6 revisioni19.9% completamente fabbricato, 56% fabbricato o difettoso
Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026Oltre 220,000 URL di citazioniDal 3% al 13% a seconda del modello

Lo studio giuridico aggiunge un dettaglio che la percentuale grezza non coglie: la stessa ricerca ha rilevato che i modelli fanno fatica a prevedere le proprie allucinazioni e tendono ad accettare la premessa errata di un utente su un caso invece di correggerla. Una citazione fabbricata è una modalità di errore. Un modello che inoltre non riesce a segnalare la propria incertezza è un problema più difficile, e si manifesta soprattutto proprio nel campo in cui una citazione sbagliata ha il costo più alto.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

ChatGPT è migliorato dal 2023?

In una certa misura, e in modo diseguale. Il confronto più chiaro tra prima e dopo è nello stesso studio di Walters e Wilder: da GPT-3.5 a GPT-4, nello stesso giorno, la fabbricazione è scesa dal 55 percento al 18 percento. Passando a GPT-4o a metà del 2025, il tasso misurato dal team di Linardon era del 19.9 percento, su un compito più difficile e più ristretto, sei rassegne della letteratura in un singolo campo di ricerca invece di brevi riassunti distribuiti su 42 argomenti non correlati. Passando ancora ai modelli con le funzioni di ricerca o deep-research attivate, testati all'inizio del 2026, l'intervallo scende a una sola cifra per la maggior parte di essi, dal 3 al 9 percento, anche se una modalità deep-research ha comunque raggiunto il 13.3 percento.

Nulla di tutto ciò segue una linea retta discendente. Il dato di Linardon si colloca tra la cifra del 2023 di GPT-4 e quella del 2023 di GPT-3.5, su un modello rilasciato più di un anno dopo entrambi, perché è stato testato su un compito più difficile, la generazione reale di rassegne della letteratura in un campo in cui gran parte del materiale di partenza è esso stesso difficile da reperire. Un tasso di fabbricazione descrive un modello, su un compito, in una data. Cambiate uno qualsiasi dei tre elementi e il numero si sposta, talvolta di molto.

La famiglia del modello non è l'unica variabile che ancora oggi modifica il numero. Uno studio del 2025 che ha valutato otto chatbot gratuiti, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat e Perplexity, su 400 riferimenti in cinque ambiti accademici ha rilevato che solo il 26.5 percento di tutti i riferimenti generati era completamente corretto. Grok e DeepSeek non hanno prodotto alcun riferimento fabbricato in quel test. Claude, Copilot e Perplexity sono stati tra i peggiori. Due prodotti costruiti su una tecnologia di base comparabile, testati nello stesso mese, sugli stessi prompt, si sono collocati agli estremi opposti dell'intervallo, e questa è la stessa lezione della tabella su modello e data qui sopra, applicata al prodotto anziché alla versione.

Perché le citazioni fabbricate sembrano reali

Una citazione fabbricata non è un segnaposto ovvio. Walters e Wilder hanno rilevato che le loro voci inventate riportavano nomi di autori reali, persone che pubblicano nel campo effettivo, associati a titoli di riviste che esistono davvero, formattati abbastanza bene da superare un rapido controllo visivo. Il team di Linardon ha trovato qualcosa di più netto: delle 35 citazioni fabbricate prodotte da GPT-4o, 33 avevano un DOI allegato, e il 64 percento di quei DOI conduceva a un articolo reale e pubblicato su un argomento completamente non correlato, non a un link morto e non a una pagina di errore, il lavoro reale di qualcun altro al posto di una fonte che non esiste.

Come verificare se una citazione di ChatGPT è reale

Cerca il titolo esatto in Google Scholar o nel sito della rivista, invece di fidarti solo del DOI, poiché un DOI funzionante può rimandare del tutto all'articolo sbagliato. Verifica che l'elenco degli autori, l'anno e la rivista corrispondano a ciò che compare davvero, non solo che compaia qualcosa. Fai questo per ogni riferimento fornito da un chatbot, non solo per quelli che sembrano insoliti, poiché le voci fabbricate in questi studi erano costruite appositamente per sembrare ordinarie.

Considera un argomento poco familiare o di nicchia come più rischioso di uno mainstream. Il team di Linardon ha rilevato una fabbricazione vicina al 6 percento per una condizione ben studiata, il disturbo depressivo maggiore, e vicina al 30 percento per altre due meno studiate nello stesso insieme di revisioni. Il modello vale anche al di fuori della salute mentale: in un campo affollato un modello ha più testo reale da cui ricavare schemi, e più spazio per inventare in modo plausibile in uno più scarno.

Un controllore di citazioni AI che confronta ogni voce con un vero database accademico automatizza questa ricerca invece di lasciarla a una verifica manuale per ogni singolo riferimento, che è la parte che la maggior parte delle persone salta sotto la pressione della scadenza, la condizione esatta in cui una citazione fabbricata ha più probabilità di arrivare fino a una bozza finale.

Trovarle in una bibliografia finita è una procedura a sé e ha una pagina propria. Per le citazioni che sono reali, citare ChatGPT in APA è spiegato passo per passo.

Niente di tutto questo cambia il modo in cui si formatta una citazione una volta che si è confermato che è reale. Questa è una questione separata: How to cite ChatGPT copre APA, MLA, Chicago e IEEE per lo scambio in sé, e un generatore di citazioni gestisce il riferimento ordinario allo stesso modo, indipendentemente dallo stile in cui si sta scrivendo. Ciò che nessun formato di citazione può correggere è un riferimento a qualcosa che non è mai stato pubblicato. Questo controllo avviene prima della formattazione, su ogni riferimento, indipendentemente dal modello che ha scritto la bozza o dalla versione che la sua etichetta dichiara.

Frequently Asked Questions

ChatGPT inventa riferimenti? Sì, in ogni modello testato finora, in ogni studio pubblicato dal 2023 al 2026. Il tasso varia enormemente in base alla versione del modello, al campo e alla data, da circa il 3 percento sui modelli grounded più recenti a ben oltre la metà su GPT-3.5 nel 2023, quindi un singolo numero non è mai la risposta completa.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

ChatGPT inventa riferimenti? Gli studi confrontati | TextPulse.ai