Academic Writing

¿ChatGPT inventa referencias? Lo que hallaron los estudios sobre fabricación

Seis estudios, cuatro campos, tres años. La tasa a la que ChatGPT inventa una referencia va de cifras de un solo dígito a bastante más de la mitad, y el número no significa nada sin la versión del modelo y la fecha asociada.

6 min
Does ChatGPT make up references: a table of studies by model version and year

En junio de 2025, investigadores de Deakin University pidieron a GPT-4o que escribiera seis revisiones de la literatura sobre temas de salud mental. De las 176 citas que produjo, 35 no existían en absoluto. Otras 64 apuntaban a artículos reales con los datos incorrectos adjuntos. Eso es una referencia de cada cinco inventada por completo, a partir de un modelo publicado más de un año después de que el problema de citas de ChatGPT se midiera por primera vez en la literatura impresa.

¿ChatGPT inventa referencias? Sí, y sigue haciéndolo en 2026, en modelos actuales, no solo en la versión que acaparó titulares en 2023. La pregunta abierta nunca fue si esto ocurre. Es con qué frecuencia, y esa cifra cambia según el modelo, la versión, el campo y la fecha en que se realizó la prueba.

¿ChatGPT inventa referencias?

Sí. Un modelo de lenguaje predice la siguiente palabra plausible a partir de todo lo anterior. No consulta nada a menos que añada un paso de recuperación o búsqueda en su producto. Si se le deja predecir cómo es una cita, creará una que parezca correcta, nombre del autor, año, título de la revista, número de volumen, DOI, sin verificar que ninguno de esos elementos coincida con una publicación real. Parte de ello será exacto por accidente o por memorización mecánica. Parte de ello será inventado desde cero y parecerá exactamente igual.

Por qué una tasa de invención necesita una versión del modelo y una fecha

Porque la tasa no es un solo número. En el estudio más citado sobre esto, ChatGPT-3.5 inventó el 55 por ciento de las citas en un conjunto de breves revisiones de la literatura, y ChatGPT-4, probado por los mismos investigadores sobre los mismos 42 temas, inventó el 18 por ciento. Mismo estudio, mismos prompts, mismo día de prueba. Lo único que cambió fue el modelo, y la tasa descendió en dos tercios.

La fecha importa tanto como el nombre del modelo. GPT-4 en ese estudio significaba lo que fuera que OpenAI estuviera ofreciendo a mediados de 2023. Un estudio de 2026 sobre diez modelos y agentes de investigación actuales, que comprobó más de 220,000 enlaces de citas en total, encontró tasas de fabricación del 3 por ciento al 13 percent, con la cifra exacta dependiendo del modelo específico y de si el producto utilizaba búsqueda con grounding o un modo de investigación profunda. Ninguna de las dos cifras es incorrecta. Describen cosas distintas medidas con casi tres años de diferencia.

El campo también importa, independientemente del modelo. También hemos tenido investigación en economía ejecutada con el mismo emparejamiento de GPT-3.5 y GPT-4 que encontró más del 30 percent de citas de GPT-3.5 inventadas y una tasa todavía superior al 20 percent para GPT-4, cercana a lo que encontró el estudio multidisciplinario, mientras que el estudio de revisión sistemática médica, que probó específicamente lo que se etiquetó como la versión de marzo de 2023 de GPT-4, midió 28.6 percent en una tarea completamente distinta: extraer referencias para revisiones sistemáticas existentes en lugar de escribir nuevos resúmenes de literatura desde cero.

Lo que encontraron los estudios publicados

Seis estudios, realizados entre 2023 y 2026, en medicina, derecho, economía y escritura académica general, convergen en el mismo hallazgo expresado de seis maneras distintas: compruebe cada referencia que le dé una herramienta de IA, independientemente del modelo que la haya producido o del momento en que lo haya hecho.

Study and fieldModel and versionDate testedSampleFabrication rate
Walters and Wilder, Scientific Reports (multidisciplinario)ChatGPT-3.5 and ChatGPT-42023636 citas, 42 temas55% (3.5) versus 18% (4)
Buchanan, Hill and Shapoval, The American Economist (economía)GPT-3.5 and GPT-42023Prompts from Journal of Economic Literature topicsMás del 30% (3.5), más del 20% (4)
Chelli et al, JMIR (medical systematic reviews)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Queried July 2023471 referencias, 11 revisiones39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law)ChatGPT-4 and Llama 22024Random federal court case questions58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (mental health reviews)GPT-4oTested June 2025176 citas, 6 revisiones19.9% fully fabricated, 56% fabricated or flawed
Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026Over 220,000 citation URLs3% to 13% depending on model

El estudio jurídico añade un detalle que el porcentaje bruto no capta: la misma investigación encontró que los modelos tienen dificultades para predecir sus propias alucinaciones y tienden a aceptar la premisa incorrecta de un usuario sobre un caso en lugar de corregirla. Una cita fabricada es un modo de fallo. Un modelo que además no puede señalar su propia incertidumbre es un problema más difícil, y aparece sobre todo precisamente en el campo en el que una cita incorrecta tiene el mayor coste.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

¿Ha mejorado ChatGPT desde 2023?

En cierta medida, y de forma desigual. La comparación más clara de antes y después está en el propio estudio de Walters y Wilder: GPT-3.5 frente a GPT-4, el mismo día, la fabricación se redujo del 55 percent al 18 percent. Si avanzamos hasta GPT-4o a mediados de 2025, la tasa medida por el equipo de Linardon fue del 19.9 percent, en una tarea más difícil y más restringida, seis revisiones de literatura en un único campo de investigación en lugar de resúmenes breves repartidos entre 42 temas no relacionados. Si avanzamos de nuevo hasta los modelos con funciones de búsqueda o de deep-research activadas, probados a comienzos de 2026, el rango desciende a cifras de un solo dígito para la mayoría de ellos, del 3 al 9 percent, aunque un modo de deep-research aún alcanzó el 13.3 percent.

Nada de eso sigue una línea recta descendente. La cifra de Linardon se sitúa entre la cifra de GPT-4 de 2023 y la cifra de GPT-3.5 de 2023, en un modelo lanzado más de un año después de ambos, porque se probó en una tarea más difícil: la generación real de revisiones de literatura en un campo en el que gran parte del material fuente es en sí mismo difícil de encontrar. Una tasa de fabricación describe un modelo en una tarea en una fecha. Si se modifica cualquiera de los tres elementos, la cifra cambia, a veces mucho.

La familia del modelo no es la única variable que todavía mueve la cifra hoy. Un estudio de 2025 que evaluó ocho chatbots gratuitos, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat y Perplexity, sobre 400 referencias en cinco campos académicos encontró que solo el 26.5 percent de todas las referencias generadas eran completamente correctas. Grok y DeepSeek no produjeron ninguna referencia fabricada en esa prueba. Claude, Copilot y Perplexity estuvieron entre los peores resultados. Dos productos construidos sobre una tecnología subyacente comparable, probados el mismo mes, con los mismos prompts, quedaron en extremos opuestos del rango, lo cual es la misma lección que la tabla de modelo y fecha anterior, aplicada al producto y no a la versión.

Por qué las citas fabricadas parecen reales

Una cita fabricada no es un marcador de posición obvio. Walters y Wilder encontraron que sus entradas inventadas llevaban nombres reales de autores, personas que publican en el campo real, vinculados a títulos de revistas que realmente existen, formateados lo bastante bien como para pasar una comprobación visual rápida. El equipo de Linardon encontró algo más preciso: de las 35 citas fabricadas que produjo GPT-4o, 33 venían con un DOI adjunto, y el 64 percent de esos DOI conducían a un artículo real y publicado sobre un tema completamente no relacionado, no a un enlace roto ni a una página de error, la investigación real de otra persona ocupando el lugar de una fuente que no existe.

Cómo comprobar si una cita de ChatGPT es real

Busque el título exacto en Google Scholar o en el propio sitio de la revista en lugar de confiar solo en el DOI, ya que un DOI que funcione puede apuntar por completo al artículo equivocado. Confirme que la lista de autores, el año y la revista coinciden con lo que realmente aparece, no solo que aparezca algo. Haga esto con cada referencia que le dé un chatbot, no solo con las que parezcan desconocidas, ya que las entradas fabricadas en estos estudios se construyeron precisamente para parecer ordinarias.

Trate un tema desconocido o muy específico como de mayor riesgo que uno general. El equipo de Linardon encontró una fabricación cercana al 6 percent para una afección bien estudiada, el trastorno depresivo mayor, y cercana al 30 percent para otras dos menos estudiadas en el mismo conjunto de revisiones. El patrón también se mantiene fuera de la salud mental: un modelo tiene más texto real del que extraer patrones en un campo saturado, y más margen para inventar de forma plausible en uno escaso.

Un comprobador de citas de IA que ejecuta cada entrada contra una base de datos académica real automatiza esa búsqueda en lugar de dejarla a una consulta manual para cada referencia, que es la parte que la mayoría de las personas omite bajo la presión de la fecha límite, la condición exacta bajo la cual una cita fabricada tiene más probabilidades de sobrevivir hasta un borrador final.

Encontrarlas en una bibliografía terminada es un procedimiento propio y tiene su propia página. Para las citas que sí son reales, citar ChatGPT en APA se expone paso a paso.

Nada de esto cambia cómo formatea una cita una vez que ha confirmado que es real. Esa es una cuestión distinta: How to cite ChatGPT cubre APA, MLA, Chicago y IEEE para el intercambio en sí, y un generador de citas gestiona la referencia ordinaria del mismo modo, independientemente del estilo en que esté escribiendo. Lo que ningún formato de cita puede corregir es una referencia a algo que nunca se publicó. Esa comprobación ocurre antes del formateo, en cada referencia, sin importar qué modelo escribió su borrador o qué versión afirma su etiqueta.

Frequently Asked Questions

¿ChatGPT inventa referencias? Sí, en todos los modelos probados hasta ahora, en todos los estudios publicados de 2023 a 2026. La tasa varía enormemente según la versión del modelo, el campo y la fecha, desde aproximadamente el 3 por ciento en los modelos fundamentados más recientes hasta bastante más de la mitad en GPT-3.5 en 2023, de modo que una sola cifra nunca es la respuesta completa.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

¿ChatGPT inventa referencias? Los estudios compararon | TextPulse.ai