ChatGPT invente-t-il des références ? Ce qu'ont montré les études sur la fabrication
Six études, quatre disciplines, trois ans. Le taux auquel ChatGPT invente une référence va des chiffres à un seul chiffre à bien plus de la moitié, et ce nombre ne signifie rien sans la version du modèle et la date qui lui sont associées.
En juin 2025, des chercheurs de Deakin University ont demandé à GPT-4o de rédiger six revues de littérature sur des sujets de santé mentale. Parmi les 176 citations qu'il a produites, 35 n'existaient pas du tout. 64 autres renvoyaient à de vrais articles, mais avec des détails erronés. Cela fait une référence sur cinq inventée de toutes pièces, à partir d'un modèle publié plus d'un an après que le problème de citation de ChatGPT a été mesuré pour la première fois dans la littérature.
ChatGPT invente-t-il des références ? Oui, et il le fait encore en 2026, sur les modèles actuels, et pas seulement sur la version qui a fait les gros titres en 2023. La question ouverte n'a jamais été de savoir si cela se produit. Il s'agit de savoir à quelle fréquence, et ce chiffre varie selon le modèle, la version, le domaine et la date à laquelle le test a été effectué.
ChatGPT Invente-t-il des Références ?
Oui. Un modèle de langage prédit le mot plausible suivant à partir de tout ce qui précède. Il ne consulte rien, sauf si vous ajoutez une étape de récupération ou de recherche dans votre produit. S'il est laissé libre de prédire à quoi ressemble une citation, il en produira une qui paraît correcte, nom de l'auteur, année, titre de la revue, numéro de volume, DOI, sans vérifier qu'aucun de ces éléments correspond à une publication réelle. Une partie sera exacte par hasard ou par mémorisation mécanique. Une autre partie sera inventée de toutes pièces et aura exactement la même apparence.
Pourquoi un Taux de Fabrication Exige une Version du Modèle et une Date
Parce que le taux n'est pas un seul nombre. Dans l'étude la plus citée sur ce sujet, ChatGPT-3.5 a fabriqué 55 percent des citations dans un ensemble de courtes revues de littérature, et ChatGPT-4, testé par les mêmes chercheurs sur les mêmes 42 sujets, en a fabriqué 18 percent. Même étude, mêmes invites, même jour de test. La seule chose qui a changé était le modèle, et le taux a diminué des deux tiers.
La date compte autant que le nom du modèle. GPT-4 dans cette étude désignait ce que OpenAI fournissait au milieu de 2023. Une étude de 2026 portant sur dix modèles actuels et agents de recherche, qui a vérifié au total plus de 220,000 liens de citation, a trouvé des taux de fabrication allant de 3 percent à 13 percent, le chiffre exact dépendant du modèle précis et du fait que le produit utilisait un ancrage par recherche ou un mode de recherche approfondie. Aucun des deux chiffres n’est faux. Ils décrivent des choses différentes mesurées à presque trois ans d’intervalle.
Le domaine compte aussi, indépendamment du modèle. Nous avons également eu des recherches en économie exécutées avec le même duo GPT-3.5 et GPT-4, qui ont trouvé plus de 30 percent de citations de GPT-3.5 inventées et un taux encore supérieur à 20 percent pour GPT-4, proche de ce que l’étude multidisciplinaire a trouvé, tandis que l’étude de revue systématique médicale, testant précisément ce qui était étiqueté comme la version de mars 2023 de GPT-4, a mesuré 28.6 percent sur une tâche complètement différente, à savoir extraire des références pour des revues systématiques existantes plutôt que rédiger de nouveaux résumés de littérature à partir de zéro.
Ce que les études publiées ont trouvé
Six études, menées entre 2023 et 2026, en médecine, en droit, en économie et dans la rédaction académique générale, convergent vers la même conclusion formulée de six façons différentes, vérifiez chaque référence qu’un outil d’IA vous donne, quel que soit le modèle qui l’a produite ou le moment où elle a été produite.
| Study and field | Model and version | Date tested | Sample | Fabrication rate |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisciplinary) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (economics) | GPT-3.5 and GPT-4 | 2023 | Prompts from Journal of Economic Literature topics | Over 30% (3.5), over 20% (4) |
| Chelli et al, JMIR (medical systematic reviews) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 references, 11 reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law) | ChatGPT-4 and Llama 2 | 2024 | Random federal court case questions | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (mental health reviews) | GPT-4o | Tested June 2025 | 176 citations, 6 reviews | 19.9% fully fabricated, 56% fabricated or flawed |
| Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Over 220,000 citation URLs | 3% to 13% depending on model |
L’étude juridique ajoute un détail que le pourcentage brut ne saisit pas, la même recherche a montré que les modèles peinent à prédire leurs propres hallucinations et ont tendance à accepter la prémisse incorrecte d’un utilisateur à propos d’une affaire plutôt que de la corriger. Une citation fabriquée est un mode de défaillance. Un modèle qui ne peut pas non plus signaler sa propre incertitude pose un problème plus difficile, et cela apparaît surtout précisément dans le domaine où une citation erronée a le coût le plus élevé.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
ChatGPT s’est-il amélioré depuis 2023 ?
Dans une certaine mesure, et de façon inégale. Le contraste le plus net entre avant et après se trouve dans l’étude même de Walters et Wilder, GPT-3.5 vers GPT-4, le même jour, la fabrication passant de 55 percent à 18 percent. En avançant jusqu’à GPT-4o au milieu de 2025, le taux mesuré par l’équipe de Linardon était de 19.9 percent, sur une tâche plus difficile et plus étroite, six revues de littérature dans un seul domaine de recherche plutôt que de courts résumés répartis sur 42 sujets sans lien entre eux. En avançant encore vers les modèles dont les fonctions de recherche ou de deep-research étaient activées, testés au début de 2026, la fourchette descend à un seul chiffre pour la plupart d’entre eux, de 3 à 9 percent, bien qu’un mode deep-research ait encore atteint 13.3 percent.
Rien de tout cela ne suit une ligne descendante continue. Le chiffre de Linardon se situe entre la valeur de GPT-4 de 2023 et celle de GPT-3.5 de 2023, sur un modèle publié plus d’un an après les deux, parce qu’il a été testé sur une tâche plus difficile, la génération réelle de revues de littérature dans un domaine où une grande partie du matériau source est elle-même difficile à trouver. Un taux de fabrication décrit un modèle, sur une tâche, à une date donnée. Si l’on modifie l’un des trois, le chiffre change, parfois de beaucoup.
La famille de modèles n’est pas la seule variable qui fait encore varier le chiffre aujourd’hui. Une étude de 2025 évaluant huit chatbots gratuits, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat et Perplexity, sur 400 références dans cinq domaines universitaires a montré que seulement 26.5 percent de toutes les références générées étaient entièrement correctes. Grok et DeepSeek n’ont produit aucune référence fabriquée dans ce test. Claude, Copilot et Perplexity figuraient parmi les moins performants. Deux produits fondés sur une technologie sous-jacente comparable, testés le même mois, sur les mêmes requêtes, se sont retrouvés aux extrémités opposées de la fourchette, ce qui est la même leçon que le tableau des modèles et des dates ci-dessus, appliquée au produit plutôt qu’à la version.
Pourquoi les citations fabriquées paraissent réelles
Une citation fabriquée n’est pas un simple espace réservé évident. Walters et Wilder ont constaté que leurs entrées inventées comportaient de vrais noms d’auteurs, des auteurs qui publient dans le domaine réel, associés à des titres de revues qui existent réellement, présentés de manière suffisamment correcte pour passer un contrôle visuel rapide. L’équipe de Linardon a trouvé quelque chose de plus net, sur les 35 citations fabriquées produites par GPT-4o, 33 étaient accompagnées d’un DOI, et 64 percent de ces DOI menaient à un article réel et publié sur un sujet complètement sans rapport, non pas à un lien mort ni à une page d’erreur, mais à la recherche réelle de quelqu’un d’autre se substituant à une source qui n’existe pas.
Comment vérifier si une citation ChatGPT est réelle
Recherchez le titre exact dans Google Scholar ou sur le site même de la revue plutôt que de faire confiance au DOI seul, car un DOI fonctionnel peut renvoyer entièrement au mauvais article. Vérifiez que la liste des auteurs, l’année et la revue correspondent à ce qui apparaît réellement, et pas seulement à ce que quelque chose apparaisse. Faites-le pour chaque référence fournie par un chatbot, et pas seulement pour celles qui semblent peu familières, car les entrées fabriquées dans ces études ont été conçues précisément pour paraître ordinaires.
Considérez un sujet peu familier ou étroit comme plus risqué qu’un sujet courant. L’équipe de Linardon a trouvé une fabrication proche de 6 percent pour une affection bien étudiée, le trouble dépressif majeur, et proche de 30 percent pour deux autres moins étudiées dans le même ensemble de revues. Le schéma vaut aussi en dehors de la santé mentale, un modèle dispose de davantage de texte réel pour en tirer des schémas dans un domaine très fourni, et de davantage d’espace pour inventer de manière plausible dans un domaine plus mince.
Un vérificateur de citations IA qui compare chaque entrée à une véritable base de données savante automatise cette recherche au lieu de la laisser à une vérification manuelle pour chaque référence, ce que la plupart des gens sautent sous la pression des délais, exactement dans les conditions où une citation fabriquée a le plus de chances de survivre jusqu’à une version finale.
Les repérer dans une bibliographie achevée relève d’une procédure propre et dispose de sa propre page. Pour les citations qui sont réelles, citer ChatGPT en APA est présenté étape par étape.
Rien de tout cela ne change la manière dont vous formatez une citation une fois que vous avez confirmé qu’elle est réelle. C’est une question distincte : How to cite ChatGPT couvre APA, MLA, Chicago et IEEE pour l’échange lui-même, et un générateur de citations traite la référence ordinaire de la même manière, quel que soit le style dans lequel vous rédigez. Aucun format de citation ne peut corriger une référence à quelque chose qui n’a jamais été publié. Cette vérification a lieu avant le formatage, pour chaque référence, quel que soit le modèle qui a rédigé votre brouillon ou la version que son étiquette prétend indiquer.
Frequently Asked Questions
ChatGPT invente-t-il des références ? Oui, sur chaque modèle testé jusqu'à présent, dans chaque étude publiée de 2023 à 2026. Le taux varie énormément selon la version du modèle, la discipline et la date, d'environ 3 pour cent sur les modèles récents fondés sur des sources à bien plus de la moitié sur GPT-3.5 en 2023, de sorte qu'un seul chiffre ne donne jamais la réponse complète.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.