Erfindet ChatGPT Referenzen? Was die Fabrication-Studien ergaben
Sechs Studien, vier Fachgebiete, drei Jahre. Die Rate, mit der ChatGPT eine Referenz erfindet, reicht von einstelligen Werten bis weit über die Hälfte, und die Zahl bedeutet nichts ohne die Modellversion und das Datum, das ihr zugeordnet ist.
Im Juni 2025 baten Forschende der Deakin University GPT-4o, sechs Literaturübersichten zu Themen der psychischen Gesundheit zu verfassen. Von den 176 Zitaten, die es erzeugte, existierten 35 überhaupt nicht. Weitere 64 verwiesen auf reale Arbeiten, denen die falschen Angaben zugeordnet waren. Das ist eine von fünf Referenzen, die vollständig erfunden wurden, und zwar von einem Modell, das mehr als ein Jahr nach der ersten gedruckt gemessenen Zitationsproblematik von ChatGPT veröffentlicht wurde.
Erfindet ChatGPT Referenzen? Ja, und das tut es auch 2026 noch, bei aktuellen Modellen, nicht nur bei der Version, die 2023 Schlagzeilen machte. Die offene Frage war nie, ob dies geschieht. Es geht darum, wie oft, und diese Zahl verändert sich mit dem Modell, der Version, dem Fachgebiet und dem Datum, an dem der Test durchgeführt wurde.
Erfindet ChatGPT Referenzen?
Ja. Ein Sprachmodell sagt das nächste plausible Wort voraus, gegeben alles, was davor steht. Es sucht nichts nach, sofern Sie in Ihrem Produkt nicht einen Abruf- oder Suchschritt hinzufügen. Wenn es allein vorhersagen soll, wie ein Zitat aussieht, erzeugt es eines, das korrekt aussieht, Autorenname, Jahr, Zeitschriftentitel, Bandnummer, DOI, ohne zu überprüfen, ob irgendeines davon mit einer realen Veröffentlichung übereinstimmt. Einiges davon wird zufällig oder durch bloßes Auswendiglernen korrekt sein. Einiges davon wird von Grund auf erfunden sein und genau gleich aussehen.
Warum eine Fälschungsrate ein Modell und ein Datum benötigt
Weil die Rate keine einzelne Zahl ist. In der am häufigsten zitierten Studie zu diesem Thema fälschte ChatGPT-3.5 55 Prozent der Zitate in einer Reihe kurzer Literaturübersichten, und ChatGPT-4, von denselben Forschenden an denselben 42 Themen getestet, fälschte 18 Prozent. Dieselbe Studie, dieselben Prompts, derselbe Testtag. Das Einzige, was sich änderte, war das Modell, und die Rate sank um zwei Drittel.
Das Datum ist ebenso wichtig wie der Modellname. GPT-4 bedeutete in jener Studie das, was OpenAI Mitte 2023 gerade bereitstellte. Eine Studie aus dem Jahr 2026 zu zehn aktuellen Modellen und Forschungsagenten, die insgesamt mehr als 220,000 Zitationslinks prüfte, fand Fälschungsraten von 3 Prozent bis 13 Prozent, wobei der genaue Wert vom jeweiligen Modell und davon abhing, ob das Produkt Suchanbindung oder einen Deep-Research-Modus verwendete. Keine der beiden Angaben ist falsch. Sie beschreiben unterschiedliche Dinge, die fast drei Jahre auseinander gemessen wurden.
Auch das Fachgebiet ist wichtig, unabhängig vom Modell. Wir haben außerdem gesehen, dass eine wirtschaftswissenschaftliche Studie, die mit derselben Kombination aus GPT-3.5 und GPT-4 durchgeführt wurde, mehr als 30 Prozent erfundene GPT-3.5-Zitationen und eine Rate von immer noch über 20 Prozent für GPT-4 fand, also nahe an dem, was die multidisziplinäre Studie ergab, während die medizinische systematische Übersichtsarbeit, die speziell die als März-2023-Build von GPT-4 bezeichnete Version testete, 28.6 Prozent bei einer völlig anderen Aufgabe maß, nämlich beim Herausziehen von Referenzen für bestehende systematische Übersichtsarbeiten statt beim Verfassen neuer Literaturzusammenfassungen von Grund auf.
Was die veröffentlichten Studien fanden
Sechs Studien, durchgeführt zwischen 2023 und 2026, in Medizin, Recht, Wirtschaft und allgemeinem akademischem Schreiben, kommen zu derselben Feststellung, die auf sechs verschiedene Arten formuliert wird: Prüfen Sie jede Referenz, die Ihnen ein KI-Tool gibt, unabhängig davon, welches Modell sie erzeugt hat oder wann.
| Studie und Fachgebiet | Modell und Version | Testdatum | Stichprobe | Fabrikationsrate |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisziplinär) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 Zitate, 42 Themen | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (Ökonomie) | GPT-3.5 and GPT-4 | 2023 | Prompts aus Themen des Journal of Economic Literature | Über 30% (3.5), über 20% (4) |
| Chelli et al, JMIR (medizinische systematische Übersichtsarbeiten) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Abgefragt im Juli 2023 | 471 Referenzen, 11 Reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (Recht) | ChatGPT-4 and Llama 2 | 2024 | Zufällige Fragen zu Bundesgerichtsverfahren | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (Übersichtsarbeiten zur psychischen Gesundheit) | GPT-4o | Getestet im Juni 2025 | 176 Zitate, 6 Reviews | 19.9% vollständig fabriziert, 56% fabriziert oder fehlerhaft |
| Rao, Wong and Callison-Burch, arXiv preprint (mehrere Domänen, Deep-Research-Agenten) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Über 220,000 Zitat-URLs | 3% bis 13% je nach Modell |
Die rechtliche Studie fügt ein Detail hinzu, das die reine Prozentzahl nicht erfasst: Dieselbe Forschung ergab, dass Modelle Schwierigkeiten haben, ihre eigenen Halluzinationen vorherzusagen, und dazu neigen, die falsche Prämisse eines Nutzers zu einem Fall zu akzeptieren, statt sie zu korrigieren. Eine fabrizierte Zitation ist ein Fehlermodus. Ein Modell, das zudem seine eigene Unsicherheit nicht kennzeichnen kann, ist ein schwierigeres Problem, und es zeigt sich am stärksten genau in dem Fachgebiet, in dem eine falsche Zitation die höchsten Kosten verursacht.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Ist ChatGPT seit 2023 besser geworden?
Etwas, und ungleichmäßig. Der klarste einzelne Vorher-Nachher-Vergleich findet sich in der Studie von Walters und Wilder selbst: GPT-3.5 zu GPT-4, am selben Tag, die Erfindungsrate sank von 55 Prozent auf 18 Prozent. Geht man weiter zu GPT-4o Mitte 2025, lag die von Linardons Team gemessene Rate bei 19.9 Prozent, bei einer schwierigeren und engeren Aufgabe, sechs Literaturübersichten in einem einzigen Forschungsfeld statt kurzer Zusammenfassungen über 42 nicht zusammenhängende Themen. Geht man erneut weiter zu den Modellen mit aktivierten Such- oder Deep-Research-Funktionen, die Anfang 2026 getestet wurden, sinkt die Spanne bei den meisten von ihnen auf einstellige Werte, 3 bis 9 Prozent, obwohl ein Deep-Research-Modus immer noch 13.3 Prozent erreichte.
Nichts davon ist ein geradliniger Abwärtstrend. Die Linardon-Zahl liegt zwischen dem GPT-4-Wert von 2023 und dem GPT-3.5-Wert von 2023, bei einem Modell, das mehr als ein Jahr nach beiden veröffentlicht wurde, weil es an einer schwierigeren Aufgabe getestet wurde: der tatsächlichen Erstellung einer Literaturübersicht in einem Fachgebiet, in dem ein großer Teil des Quellenmaterials selbst schwer zu finden ist. Eine Erfindungsrate beschreibt ein Modell bei einer Aufgabe an einem Datum. Ändert man eine der drei Größen, verschiebt sich die Zahl, manchmal erheblich.
Die Modellfamilie ist nicht die einzige Variable, die die Zahl auch heute noch verändert. Eine Studie aus dem Jahr 2025, die acht kostenlose Chatbots, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat und Perplexity, anhand von 400 Referenzen aus fünf akademischen Fachgebieten bewertete, ergab, dass nur 26.5 Prozent aller erzeugten Referenzen vollständig korrekt waren. Grok und DeepSeek erzeugten in diesem Test keine erfundenen Referenzen. Claude, Copilot und Perplexity gehörten zu den schwächsten Modellen. Zwei Produkte, die auf vergleichbarer zugrunde liegender Technologie basieren, im selben Monat und mit denselben Prompts getestet, landeten an entgegengesetzten Enden der Spanne, was dieselbe Lehre ist wie die obige Tabelle zu Modell und Datum, nur auf das Produkt statt auf die Version angewandt.
Warum erfundene Zitate echt aussehen
Eine erfundene Zitierung ist kein offensichtlicher Platzhalter. Walters und Wilder fanden, dass ihre erfundenen Einträge echte Autorennamen trugen, also Namen von Personen, die im tatsächlichen Fachgebiet veröffentlichen, verbunden mit Zeitschriftentiteln, die tatsächlich existieren, und so formatiert waren, dass sie eine schnelle visuelle Prüfung bestanden. Das Team von Linardon fand etwas Schärferes: Von den 35 erfundenen Zitierungen, die GPT-4o erzeugte, enthielten 33 einen DOI, und 64 Prozent dieser DOIs führten zu einer echten, veröffentlichten Arbeit zu einem völlig anderen Thema, also nicht zu einem toten Link und nicht zu einer Fehlerseite, sondern zu der tatsächlichen Forschung einer anderen Person, die an die Stelle einer Quelle trat, die nicht existiert.
Wie man prüft, ob eine ChatGPT-Zitierung echt ist
Suchen Sie den genauen Titel in Google Scholar oder auf der eigenen Website der Zeitschrift, statt sich allein auf den DOI zu verlassen, da ein funktionierender DOI auf die völlig falsche Arbeit verweisen kann. Bestätigen Sie, dass die Autorenliste, das Jahr und die Zeitschrift mit dem übereinstimmen, was tatsächlich erscheint, nicht nur, dass überhaupt etwas erscheint. Tun Sie dies für jede Referenz, die ein Chatbot liefert, nicht nur für die, die unbekannt wirken, da die erfundenen Einträge in diesen Studien gerade so gestaltet wurden, dass sie gewöhnlich wirken.
Behandeln Sie ein unbekanntes oder enges Thema als risikoreicher als ein Mainstream-Thema. Das Team von Linardon fand eine Fälschungsrate von fast 6 Prozent bei einer gut untersuchten Erkrankung, major depressive disorder, und von fast 30 Prozent bei zwei weniger untersuchten im selben Satz von Übersichten. Das Muster gilt auch außerhalb der psychischen Gesundheit: Ein Modell hat in einem dicht besetzten Fachgebiet mehr echten Text, aus dem es Muster ableiten kann, und in einem dünnen mehr Spielraum, plausibel zu erfinden.
Ein KI-Zitierungsprüfer, der jeden Eintrag mit einer echten wissenschaftlichen Datenbank abgleicht automatisiert diese Suche, statt sie einer manuellen Prüfung für jede einzelne Referenz zu überlassen, und genau diesen Teil überspringen die meisten Menschen unter Zeitdruck, also unter genau den Bedingungen, unter denen eine erfundene Zitierung am ehesten bis in einen endgültigen Entwurf überlebt.
Sie in einem fertigen Literaturverzeichnis zu finden ist ein eigenes Verfahren und hat eine eigene Seite. Für die Zitierungen, die echt sind, wird das Zitieren von ChatGPT in APA Schritt für Schritt dargestellt.
All dies ändert nichts daran, wie Sie ein Zitat formatieren, sobald Sie bestätigt haben, dass es echt ist. Das ist eine separate Frage: How to cite ChatGPT behandelt APA, MLA, Chicago und IEEE für den Austausch selbst, und ein Zitationsgenerator behandelt die gewöhnliche Referenz auf dieselbe Weise, unabhängig davon, in welchem Stil Sie schreiben. Was kein Zitierformat beheben kann, ist eine Referenz auf etwas, das nie veröffentlicht wurde. Diese Prüfung erfolgt vor der Formatierung, bei jeder Referenz, unabhängig davon, welches Modell Ihren Entwurf geschrieben hat oder welche Version sein Label behauptet.
Frequently Asked Questions
Erfindet ChatGPT Referenzen? Ja, bei jedem bisher getesteten Modell, in jeder veröffentlichten Studie von 2023 bis 2026. Die Rate variiert enorm nach Modellversion, Fachgebiet und Datum, von ungefähr 3 Prozent bei den jüngsten grounded Modellen bis weit über die Hälfte bei GPT-3.5 im Jahr 2023, daher ist eine einzelne Zahl nie die vollständige Antwort.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.