Academic Writing

O ChatGPT inventa referências? O que os estudos de fabricação encontraram

Seis estudos, quatro áreas, três anos. A taxa com que o ChatGPT inventa uma referência varia de dígitos simples a bem mais da metade, e o número não significa nada sem a versão do modelo e a data associada a ele.

6 min
Does ChatGPT make up references: a table of studies by model version and year

Em junho de 2025, pesquisadores da Deakin University pediram ao GPT-4o que escrevesse seis revisões de literatura sobre temas de saúde mental. Das 176 citações que ele produziu, 35 não existiam de forma alguma. Outras 64 apontavam para artigos reais, mas com detalhes incorretos. Isso significa uma referência em cada cinco inventada por completo, a partir de um modelo lançado mais de um ano depois de o problema de citações do ChatGPT ter sido medido pela primeira vez em publicação impressa.

O ChatGPT inventa referências? Sim, e ainda o faz em 2026, em modelos atuais, não apenas na versão que ganhou destaque em 2023. A questão aberta nunca foi se isso acontece. É com que frequência, e esse número varia conforme o modelo, a versão, o campo e a data em que o teste foi realizado.

O ChatGPT Inventa Referências?

Sim. Um modelo de linguagem prevê a próxima palavra plausível com base em tudo o que veio antes. Ele não consulta nada, a menos que você adicione uma etapa de recuperação ou busca ao seu produto. Se for deixado para prever como é uma citação, ele criará uma que pareça correta: nome do autor, ano, título do periódico, número do volume, DOI, sem verificar se qualquer um desses elementos corresponde a uma publicação real. Parte disso estará correta por acaso ou por memorização mecânica. Parte será inventada do zero e parecerá exatamente igual.

Por que uma Taxa de Fabricação Precisa de uma Versão do Modelo e de uma Data

Porque a taxa não é um único número. No estudo mais citado sobre isso, o ChatGPT-3.5 fabricou 55 por cento das citações em um conjunto de revisões curtas de literatura, e o ChatGPT-4, testado pelos mesmos pesquisadores nos mesmos 42 temas, fabricou 18 por cento. Mesmo estudo, mesmos prompts, mesmo dia de teste. A única coisa que mudou foi o modelo, e a taxa caiu em dois terços.

A data importa tanto quanto o nome do modelo. GPT-4, naquele estudo, significava o que quer que a OpenAI estivesse oferecendo em meados de 2023. Um estudo de 2026 sobre dez modelos atuais e agentes de pesquisa, verificando mais de 220,000 links de citação no total, encontrou taxas de fabricação de 3 percent a 13 percent, com a cifra exata dependendo do modelo específico e de o produto usar busca com fundamentação ou um modo de pesquisa aprofundada. Nenhuma das cifras está errada. Elas descrevem coisas diferentes medidas com quase três anos de intervalo.

O campo também importa, independentemente do modelo. Também tivemos uma pesquisa em economia executada com o mesmo pareamento de GPT-3.5 e GPT-4 encontrar mais de 30 percent das citações do GPT-3.5 inventadas e uma taxa ainda acima de 20 percent para o GPT-4, próxima do que o estudo multidisciplinar encontrou, enquanto o estudo de revisão sistemática em medicina, testando especificamente o que foi rotulado como a versão de março de 2023 do GPT-4, mediu 28.6 percent em uma tarefa completamente diferente: recuperar referências para revisões sistemáticas já existentes, em vez de escrever novos resumos de literatura do zero.

O que os estudos publicados encontraram

Seis estudos, realizados entre 2023 e 2026, em medicina, direito, economia e redação acadêmica geral, convergem para a mesma conclusão, formulada de seis maneiras diferentes: verifique toda referência que uma ferramenta de IA lhe der, independentemente de qual modelo a produziu ou de quando.

Estudo e áreaModelo e versãoData testadaAmostraTaxa de fabricação
Walters and Wilder, Scientific Reports (multidisciplinar)ChatGPT-3.5 and ChatGPT-42023636 citações, 42 tópicos55% (3.5) versus 18% (4)
Buchanan, Hill and Shapoval, The American Economist (economia)GPT-3.5 and GPT-42023Prompts de tópicos do Journal of Economic LiteratureMais de 30% (3.5), mais de 20% (4)
Chelli et al, JMIR (revisões sistemáticas médicas)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Consultado em julho de 2023471 referências, 11 revisões39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (direito)ChatGPT-4 and Llama 22024Perguntas aleatórias de casos de tribunais federais58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (revisões em saúde mental)GPT-4oTestado em junho de 2025176 citações, 6 revisões19.9% totalmente fabricado, 56% fabricado ou falho
Rao, Wong and Callison-Burch, preprint do arXiv (multidomínio, agentes de pesquisa profunda)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026Mais de 220,000 URLs de citações3% a 13% dependendo do modelo

O estudo jurídico acrescenta um detalhe que a porcentagem bruta não captura: a mesma pesquisa constatou que os modelos têm dificuldade para prever suas próprias alucinações e tendem a aceitar a premissa incorreta de um usuário sobre um caso em vez de corrigi-la. Uma citação fabricada é um modo de falha. Um modelo que também não consegue sinalizar sua própria incerteza é um problema mais difícil, e isso aparece sobretudo exatamente na área em que uma citação errada tem o maior custo.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

O ChatGPT Melhorou Desde 2023?

De certa forma, e de modo desigual. O exemplo mais claro de antes e depois está no próprio estudo de Walters e Wilder: GPT-3.5 para GPT-4, no mesmo dia, a fabricação caiu de 55 percent para 18 percent. Avançando para GPT-4o em meados de 2025, a taxa medida pela equipe de Linardon foi de 19.9 percent, em uma tarefa mais difícil e mais restrita, seis revisões de literatura em um único campo de pesquisa, em vez de resumos curtos distribuídos por 42 tópicos não relacionados. Avançando novamente para os modelos com recursos de busca ou deep-research ativados, testados no início de 2026, a faixa cai para um dígito na maioria deles, de 3 a 9 percent, embora um modo deep-research ainda tenha પહોંચado 13.3 percent.

Nada disso é uma linha reta descendente. O número de Linardon fica entre a cifra de GPT-4 de 2023 e a cifra de GPT-3.5 de 2023, em um modelo lançado mais de um ano depois de ambos, porque foi testado em uma tarefa mais difícil: geração real de revisão de literatura em um campo em que grande parte do material de स्रोत é, por si só, difícil de encontrar. Uma taxa de fabricação descreve um modelo em uma tarefa em uma data. Altere qualquer um dos três e o número se move, às vezes bastante.

A família do modelo não é a única variável que ainda altera o número hoje. Um estudo de 2025 que avaliou oito chatbots gratuitos, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat e Perplexity, em 400 referências em cinco áreas acadêmicas, constatou que apenas 26.5 percent de todas as referências geradas estavam totalmente corretas. Grok e DeepSeek produziram zero referências fabricadas nesse teste. Claude, Copilot e Perplexity estiveram entre os piores desempenhos. Dois produtos construídos sobre tecnologia subjacente comparável, testados no mesmo mês, com os mesmos prompts, ficaram em extremos opostos da faixa, o que é a mesma lição da tabela de modelo e data acima, aplicada ao produto e não à versão.

Por que as citações fabricadas parecem reais

Uma citação fabricada não é um espaço reservado óbvio. Walters e Wilder constataram que suas entradas inventadas traziam nomes reais de autores, pessoas que publicam no campo real, vinculados a títulos de periódicos que de fato existem, formatados de modo suficientemente bom para passar por uma verificação visual rápida. A equipe de Linardon encontrou algo mais preciso: das 35 citações fabricadas que GPT-4o produziu, 33 vinham com um DOI anexado, e 64 percent dessas DOIs levavam a um artigo real e publicado sobre um tema completamente não relacionado, não um link quebrado e não uma página de erro, a pesquisa real de outra pessoa ocupando o lugar de uma fonte que não existe.

Como Verificar se uma Citação de ChatGPT é Real

Pesquise o título exato no Google Scholar ou no próprio site do periódico, em vez de confiar apenas no DOI, já que um DOI funcional pode apontar para o artigo errado por completo. Confirme se a lista de autores, o ano e o periódico correspondem ao que realmente aparece, e não apenas se algo aparece. Faça isso para toda referência que um chatbot fornecer, não apenas para as que parecem desconhecidas, pois as entradas fabricadas nesses estudos foram construídas especificamente para parecerem comuns.

Trate um tema desconhecido ou restrito como de maior risco do que um tema de grande circulação. A equipe de Linardon encontrou fabricação em cerca de 6 percent para uma condição bem estudada, transtorno depressivo maior, e em cerca de 30 percent para duas outras menos estudadas no mesmo conjunto de revisões. O padrão também se mantém fora da saúde mental: um modelo tem mais texto real do qual extrair padrões em um campo amplo, e mais espaço para inventar de modo plausível em um campo estreito.

Um verificador de citações de IA que compara cada entrada com um banco de dados acadêmico real automatiza essa busca em vez de deixá-la para uma consulta manual de cada referência, que é a parte que a maioria das pessoas pula sob pressão de prazo, a condição exata sob a qual uma citação fabricada tem maior probabilidade de sobreviver até um rascunho final.

Encontrá-las em uma bibliografia finalizada é um procedimento próprio e tem sua própria página. Para as citações que são reais, citar ChatGPT em APA é apresentado passo a passo.

Nada disso altera como você formata uma citação depois de confirmar que ela é real. Essa é uma questão अलगada: Como citar ChatGPT cobre APA, MLA, Chicago e IEEE para a própria troca, e um gerador de citações lida com a referência comum da mesma forma, independentemente de qual estilo você esteja usando. O que nenhum formato de citação pode corrigir é uma referência a algo que nunca foi publicado. Essa verificação acontece antes da formatação, em cada referência, independentemente de qual modelo escreveu seu rascunho ou de qual versão seu rótulo afirma.

Frequently Asked Questions

O ChatGPT inventa referências? Sim, em todos os modelos testados até agora, em todos os estudos publicados de 2023 a 2026. A taxa varia enormemente conforme a versão do modelo, a área e a data, de cerca de 3 percent nos modelos fundamentados mais recentes a bem mais da metade no GPT-3.5 em 2023, de modo que um único número nunca é a resposta completa.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.