Citas alucinadas: audite su artículo antes de enviarlo
Una referencia fabricada no es una referencia mal escrita. Llega con autores plausibles, un título adecuado, una revista real y un DOI que parece válido, por lo que volver a leerla no la detectará. Auditorías a escala de la literatura publicadas en 2026 hallaron que la proporción de artículos con al menos una referencia fabricada aumentó aproximadamente diez veces en tres años. Esta es la auditoría que debe aplicar primero a su propia lista.
En junio de 2023, un juez federal de Nueva York sancionó a dos abogados por presentar un escrito basado en al menos seis casos judiciales que no existían. Steven Schwartz había pedido a ChatGPT precedentes de apoyo, recibió nombres de casos y razonamientos citados que sonaban plausibles, y presentó el escrito sin abrir por sí mismo ni un solo caso. El juez P. Kevin Castel le impuso una multa de cinco mil dólares y ordenó una carta a cada juez real cuyo nombre había sido atribuido a una opinión fabricada.
Una lista de referencias puede acabar en el mismo lugar. La solución es una auditoría de citas alucinadas realizada sobre la propia lista de referencias antes de que un editor, un supervisor o un revisor la haga por usted. Esto no es solo un problema causado por redactar con un chatbot. Una cita recordada que nunca llegó a existir del todo, el título de un coautor copiado con un pequeño error, o un preprint cuya cita final cambió tras la aceptación pueden dejar en una lista de referencias el mismo tipo de vacío que deja una fabricada. La auditoría que se presenta a continuación detecta todos ellos, con independencia de cómo haya llegado cada entrada hasta allí.
¿Qué tan común es realmente una cita alucinada?
El rango depende en gran medida del modelo que produjo el borrador. Walters y Wilder, publicado en Scientific Reports en 2023, probaron listas de referencias generadas por GPT-3.5 y GPT-4 frente a consignas reales de escritura académica: 636 citas extraídas de 84 listas de referencias generadas por IA, 42 para cada modelo. El 55 por ciento de las citas de GPT-3.5 eran totalmente fabricadas, frente al 18 por ciento de GPT-4. Incluso las reales no eran necesariamente limpias: el 43 por ciento de las citas genuinas de GPT-3.5 y el 24 por ciento de las de GPT-4 seguían presentando algún error sustantivo en el autor, el título, el año o la publicación.
La investigación jurídica sobre citas generadas por IA muestra una tasa de fallo aún más alta, pero ese trabajo mide un fallo distinto, la invención de resoluciones judiciales, en lugar de referencias bibliográficas fabricadas, por lo que esa cifra no debe trasladarse a un contexto académico. Lo que ambos campos comparten es la causa subyacente, un modelo que produce una cita de apariencia plausible optimiza para lo que suele parecer una cita, no para comprobar si realmente existe. El propio texto de TextPulse sobre si ChatGPT inventa referencias se centra específicamente en ese chatbot, este análisis funciona con independencia de qué herramienta, o de qué memoria de qué coautor, haya producido la entrada que tiene delante.
Lo que encontraron las auditorías a escala de la literatura de 2026
Esas tasas a nivel de modelo describen lo que sale de un chatbot. Una cuestión distinta, y la que importa a cualquiera que presente un manuscrito a una revista, es con qué frecuencia una referencia fabricada supera todas las comprobaciones entre un borrador y un artículo publicado. Dos auditorías publicadas con un día de diferencia en mayo de 2026 respondieron a esa pregunta a escala de la literatura, y la respuesta es que el fallo ya no es raro.
Una auditoría publicada en The Lancet examinó referencias en aproximadamente 2.5 millones de artículos biomédicos en PubMed Central Open Access, cubriendo de enero de 2023 a febrero de 2026. Varios miles de referencias apuntaban a trabajos que no existen, repartidos entre más de 2,800 artículos publicados. La tendencia importa más que el total.
| Periodo | Artículos con al menos una referencia fabricada | Por 10,000 artículos |
|---|---|---|
| 2023 | 1 de cada 2,828 | 3.5 |
| 2025 | 1 de cada 458 | 21.8 |
| 2026, primeras siete semanas | 1 de cada 277 | 36.1 |
Eso supone aproximadamente un aumento de diez veces en tres años, y la cifra de 2026 se extrae de siete semanas en lugar de un año completo, por lo que es una lectura temprana y no una tasa anual consolidada. Lo que establece es que las referencias fabricadas están llegando a la imprenta en revistas revisadas por pares, después de haber pasado por autores, coautores, editores y revisores en el camino.
El estudio complementario, Zhao and colleagues on non-existent citations, amplió la búsqueda a 111 million referencias en arXiv, bioRxiv, SSRN y PubMed Central y fijó un mínimo conservador de 146,932 citas alucinadas solo en 2025. Su hallazgo más útil se refiere a la distribución más que al volumen: las referencias fabricadas se concentran en campos con una adopción rápida de IA, y entre equipos pequeños y de autores en etapas tempranas de su carrera. Si usted es un autor en solitario o un grupo pequeño sin una oficina de investigación que revise su bibliografía, pertenece al grupo en el que esto sale mal con mayor frecuencia, lo que constituye un argumento para realizar usted mismo la auditoría en lugar de asumir que alguien más adelante en el proceso lo hará.
Qué Modelos Fabrican Más, y Qué Reduce Realmente Eso
La respuesta honesta es que no existe ningún punto de referencia público riguroso que clasifique entre sí a los principales modelos actuales en lo que respecta específicamente a la fabricación de citas. Circulan pequeñas comparaciones informales, por lo general unas pocas docenas de referencias pasadas manualmente por dos o tres chatbots, y las muestras son demasiado escasas para sustentar una clasificación entre ellos. Tratar una de esas comparaciones como una tabla de posiciones es la forma en que una afirmación segura y errónea entra en un artículo.
Lo que sí se sostiene es la comparación generacional en los datos de Walters y Wilder anteriores, donde el modelo más nuevo fabricó aproximadamente un tercio tan a menudo como el más antiguo.
| Modelo probado | Citas totalmente fabricadas | Citas genuinas que aún contenían un error sustantivo |
|---|---|---|
| GPT-3.5 | 55% | 43% |
| GPT-4 | 18% | 24% |
Tres patrones se repiten en la literatura y valen más que cualquier clasificación aislada. Los modelos más grandes fabrican menos que los más pequeños. Los modelos que realmente pueden buscar y recuperar fuentes fabrican sustancialmente menos que los modelos que responden solo a partir de sus parámetros, lo cual es el efecto individual más grande que nadie ha medido. Y las fuentes oscuras son mucho más arriesgadas que las conocidas, porque un artículo muy citado aparece con suficiente frecuencia en los datos de entrenamiento como para reproducirse correctamente, mientras que uno de nicho tiene más probabilidades de reconstruirse a partir de fragmentos.
La lectura práctica es que ningún modelo es lo bastante seguro como para omitir la comprobación, y las entradas con más probabilidades de ser incorrectas son precisamente aquellas que usted menos puede verificar de memoria: la cita especializada, el artículo de congreso oscuro, la fuente que añadió al final.
Qué Detecta una Comprobación Automatizada, y Dónde Se Detiene
Pasar primero la lista por un comprobador es más rápido que resolver cuarenta DOI a mano, y el comprobador gratuito de citas de IA de este sitio hace exactamente eso frente a Crossref, OpenAlex y Semantic Scholar. Conviene saber qué hace mal esa clase de herramienta antes de confiar en una.
Una evaluación de 2026 de cinco detectores de citas alucinadas, Badalova and Mayr, encontró que ofrecen advertencias tempranas útiles, pero siguen limitados por cuatro cosas: extraer referencias con limpieza de un documento, metadatos incompletos en la propia entrada, cobertura irregular de las bases de datos y registros que discrepan entre sí. Solo la primera de esas desaparece cuando pega una lista en lugar de subir un PDF.
La consecuencia para su propia auditoría es una regla sobre la interpretación. Un verificador es más sólido en el hallazgo que más importa, un DOI que resuelve a un artículo distinto del que afirma la entrada, lo cual es casi concluyente. Es más débil en libros, capítulos, tesis, actas, trabajos muy recientes y publicaciones en otros idiomas, todos los cuales están escasamente indexados en todas partes y con frecuencia vuelven como no encontrados aun siendo perfectamente auténticos. No encontrado es una indicación para comprobar a mano, nunca un veredicto. Los pasos manuales que siguen son los que se aplican a todo aquello que la pasada automatizada no pudo resolver.
Humanice su propio artículo
Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.
Resuelva Cada DOI Antes de Enviar
Un DOI, un Digital Object Identifier, se supone que debe resolver a un único registro a través del resolvedor doi.org. Añada el DOI de su lista de referencias al resolvedor y uno que funcione aterriza en la página del editor para ese artículo exacto. Un DOI que resuelve a un artículo no relacionado, a una revista completamente distinta, o a nada en absoluto, es una de las comprobaciones de alucinación más rápidas disponibles, porque un modelo que inventa una cita suele inventar una cadena de DOI de aspecto plausible para acompañarla, en lugar de reutilizar una real.
Un DOI que resuelve correctamente no es una prueba automática de que la cita sea auténtica. Algunas referencias fabricadas toman prestado el DOI real de un artículo no relacionado, que resuelve sin error y apunta a un artículo real que no tiene nada que ver con la afirmación que supuestamente respalda. Lea la página a la que llega el DOI, no solo el hecho de que se cargó.
Compare Cada Título con una Base de Datos Real
Busque el título exacto, entre comillas, en una base de datos que cubra su campo, no en la web abierta. Use algo como Crossref, PubMed para trabajos biomédicos, o el índice propio de su disciplina. Si usa Crossref, puede utilizar su búsqueda gratuita de invitado para localizar una referencia por título y primer autor, o por autor y número de página si no está seguro del título. Esto devolverá el DOI y los metadatos completos de lo que tengan registrado. Si no hay coincidencia, o si lo que aparece es un artículo real con un conjunto de autores totalmente distinto, podría estar viendo el segundo tipo de alucinación, un DOI roto.
Una búsqueda por título detecta un fallo específico que una comprobación de DOI no detecta, una cita con un DOI real y funcional adjunto al título equivocado, porque el número y el texto se ensamblaron por separado y nunca se comprobaron realmente entre sí. Si el título de la base de datos no coincide de forma estrecha con el título de su lista de referencias, trate eso como una fabricación hasta que pueda explicar la discrepancia, no como una errata que corregir en silencio.
Compruebe en cruz la lista de autores y el año de publicación
Una cita alucinada a menudo acierta con el autor y falla con el artículo, porque un nombre real y destacado en el campo es exactamente lo que producirá un modelo que busca una cita plausible. Busque la lista de publicaciones del propio autor, en la base de datos que ya tiene abierta, para el año que indica su lista de referencias. Si ese autor publicó tres artículos ese año y ninguno coincide con su título, es muy probable que la cita sea inventada, construida a partir de un nombre real y un año real que en realidad nunca fueron juntos.
El patrón inverso también aparece, un artículo real, con el título correcto, asociado al año equivocado, por lo general el año de una prepublicación en lugar del año de la publicación final, o una versión de congreso citada con el año posterior de publicación de la revista. Ninguno de los dos es una fabricación en el sentido estricto de la auditoría, pero ambos envían al lector a un gestor de referencias o a un coautor que luego no puede encontrar lo que usted citó, lo bastante cerca del mismo problema como para corregirlo durante la misma revisión.
Detecte un nombre de revista plausible pero inventado
Un nombre de revista inventado está construido para sonar exactamente como uno real: un campo plausible, un adjetivo plausible, un nombre lo bastante cercano a una revista real como para que nadie se detenga a comprobarlo. "The Journal of Applied Cognitive Studies" es inventado; "The Journal of Applied Psychology" y "Journal of Cognitive Science" existen, y un nombre que une partes de las dos suena familiar precisamente por esa razón.
Busque el nombre de la revista por sí solo, entre comillas, y busque la propia página de la revista del editor y un ISSN vigente, no solo un resultado en algún otro sitio que cite la misma referencia. Una revista real tiene una página principal que enumera un editor, un volumen y un número vigentes, y un ISSN legítimo registrado a su nombre. Un nombre sin página del editor, sin ISSN y sin ningún otro artículo que cite trabajos de ella es la señal más clara en toda la auditoría de que la referencia no existe.
Convierta su auditoría de citas alucinadas en una lista de verificación repetible
Realice estas comprobaciones en orden, sobre cada referencia, antes de considerar definitiva la lista. El orden importa menos que cubrir las cuatro, una cita puede superar una comprobación y aun así fallar en otra.
| Comprobación | Qué detecta |
|---|---|
| Resolución de DOI | Un DOI que no lleva a ninguna parte, o a un artículo no relacionado |
| Coincidencia entre título y base de datos | Un DOI real asociado al título equivocado, o un título que no devuelve ningún resultado en absoluto |
| Verificación cruzada de autor más año | El nombre de un autor real asociado a un artículo que no escribió ese año |
| Verificación del nombre de la revista | Una revista con nombre plausible, pero sin ISSN, sin página del editor y sin existencia real |
El verificador de citas con IA de TextPulse ejecuta automáticamente una versión de este paso en una lista completa de referencias, más rápido que realizar a mano cada una de las cuatro comprobaciones en una bibliografía larga, aunque sigue mereciendo la pena leer uno mismo lo que señala, en lugar de aceptar o rechazar una señal sin comprobarla. Para el paso del DOI en concreto, una búsqueda de DOI a cita dedicada evita tener que ir al resolvedor para cada entrada, una por una.
Una bibliografía limpia es una de varias comprobaciones antes de que un manuscrito se envíe. La reducción de una puntuación de IA para la entrega a una revista se trata por separado, y también la carta de respuesta a los revisores que la sigue.
Nada de esto sustituye volver a leer su propio trabajo una vez más antes de enviarlo. Si una sección sigue leyendo de forma genérica después de que los hechos estén comprobados, un humanizador de IA puede suavizar la prosa sin tocar una sola cita; la guía de TextPulse para humanizar texto de IA en la escritura académica cubre ese paso sección por sección. Una lista de referencias que se resuelve sin problemas y un manuscrito que suena como su propia voz son dos comprobaciones distintas, y merece la pena realizarlas una tras otra en lugar de confiar en que una cubra la otra.
Preguntas frecuentes
Una auditoría de citas alucinadas es una comprobación repetible aplicada a una lista completa de referencias antes del envío: resolver cada DOI, cotejar cada título con una base de datos real, verificar de nuevo la lista de autores y el año, y confirmar que el nombre de la revista existe realmente. Detecta referencias fabricadas independientemente de si las introdujo un chatbot, un error de un gestor de citas o un detalle recordado de forma incorrecta.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.