Academic Writing

Vymýšlí ChatGPT odkazy? Co zjistily studie o fabrikaci

Šest studií, čtyři obory, tři roky. Míra, s jakou ChatGPT vymýšlí odkaz, se pohybuje od jednotek procent až po více než polovinu, a toto číslo nic neznamená bez verze modelu a data, které je k němu připojeno.

6 min
Does ChatGPT make up references: a table of studies by model version and year

V červnu 2025 požádali výzkumníci na Deakin University GPT-4o, aby napsal šest literárních přehledů na témata duševního zdraví. Z 176 citací, které vytvořil, 35 neexistovalo vůbec. Dalších 64 odkazovalo na skutečné práce, ale s nesprávnými údaji. To je jedna citace z pěti zcela vymyšlená, a to u modelu vydaného více než rok poté, co byl problém s citacemi v ChatGPT poprvé změřen v tištěné podobě.

Vymýšlí ChatGPT odkazy? Ano, a dělá to i v roce 2026, na aktuálních modelech, nejen na verzi, která se dostala do titulků v roce 2023. Otevřená otázka nikdy nezní, zda se to děje. Jde o to, jak často, a toto číslo se mění podle modelu, verze, oboru a data, kdy byl test proveden.

Vymýšlí ChatGPT odkazy?

Ano. Jazykový model předpovídá další pravděpodobné slovo na základě všeho, co mu předchází. Nic nevyhledává, pokud do svého produktu nepřidáte krok načítání nebo vyhledávání. Pokud je ponechán, aby předpověděl, jak citace vypadá, vytvoří takovou, která vypadá správně, jméno autora, rok, název časopisu, číslo svazku, DOI, aniž by ověřil, zda kterákoli z těchto věcí odpovídá skutečné publikaci. Některé z toho budou správné náhodou nebo díky mechanickému zapamatování. Některé budou vymyšlené od začátku a budou vypadat úplně stejně.

Proč míra vymýšlení potřebuje verzi modelu a datum

Protože tato míra není jedno číslo. V jediné nejčastěji citované studii na toto téma ChatGPT-3.5 vymyslel 55 procent citací v souboru krátkých literárních přehledů a ChatGPT-4, testovaný stejnými výzkumníky na stejných 42 tématech, vymyslel 18 procent. Stejná studie, stejné prompty, stejný den testování. Jediné, co se změnilo, byl model, a míra klesla o dvě třetiny.

Na datu záleží stejně jako na názvu modelu. GPT-4 v této studii znamenal to, co OpenAI v polovině roku 2023 právě poskytovala. Studie z roku 2026, která zkoumala deset současných modelů a výzkumných agentů a celkem prověřila více než 220,000 citačních odkazů, zjistila míru fabrikace od 3 procent do 13 procent, přičemž přesná hodnota závisela na konkrétním modelu a na tom, zda produkt používal vyhledávací ukotvení nebo režim hlubokého výzkumu. Ani jedna hodnota není chybná. Popisují odlišné věci měřené s odstupem téměř tří let.

Na oboru také záleží, nezávisle na modelu. Také jsme měli výzkum z ekonomie, který byl veden stejnou dvojicí GPT-3.5 a GPT-4, a zjistil více než 30 procent vymyšlených citací u GPT-3.5 a míru stále nad 20 procent u GPT-4, což je blízko tomu, co zjistila multidisciplinární studie, zatímco studie systematického přehledu v medicíně, která testovala konkrétně to, co bylo označeno jako sestavení GPT-4 z března 2023, naměřila 28.6 procenta na zcela odlišném úkolu, totiž získávání referencí pro existující systematické přehledy, nikoli psaní nových literárních shrnutí od nuly.

Co zjistily publikované studie

Šest studií, provedených mezi lety 2023 a 2026 v medicíně, právu, ekonomii a obecně akademickém psaní, dospívá ke stejnému zjištění vyjádřenému šesti různými způsoby, zkontrolujte každou referenci, kterou vám nástroj AI poskytne, bez ohledu na to, který model ji vytvořil nebo kdy.

Studie a oborModel a verzeDatum testováníVzorekMíra fabrikace
Walters and Wilder, Scientific Reports (multidisciplinární)ChatGPT-3.5 and ChatGPT-42023636 citací, 42 témat55% (3.5) versus 18% (4)
Buchanan, Hill and Shapoval, The American Economist (ekonomie)GPT-3.5 and GPT-42023Výzvy z témat Journal of Economic LiteratureVíce než 30% (3.5), více než 20% (4)
Chelli et al, JMIR (lékařské systematické přehledy)GPT-3.5, GPT-4 (sestavení gpt-4-32k-0314), Bard (PaLM 2.0)Queried July 2023471 referencí, 11 přehledů39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (právo)ChatGPT-4 and Llama 22024Náhodné otázky k případům federálních soudů58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (přehledy v oblasti duševního zdraví)GPT-4oTested June 2025176 citací, 6 přehledů19.9% zcela fabrikovaných, 56% fabrikovaných nebo chybných
Rao, Wong and Callison-Burch, arXiv preprint (vícedoménové, deep research agents)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026Více než 220,000 citačních URL3% to 13% depending on model

Právní studie přidává detail, který samotné hrubé procento nezachycuje: tatáž výzkumná práce zjistila, že modely mají potíže předpovídat vlastní halucinace a mají tendenci přijmout uživatelovu nesprávnou premisu o případu, místo aby ji opravily. Fabrikovaná citace je jeden způsob selhání. Model, který navíc nedokáže upozornit na vlastní nejistotu, představuje obtížnější problém a nejvíce se projevuje právě v oboru, kde má chybná citace nejvyšší náklady.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Zlepšil se ChatGPT od roku 2023?

Do jisté míry, a nerovnoměrně. Nejzřetelnější jednotlivé srovnání před a po je přímo ve studii Walters a Wilder: GPT-3.5 oproti GPT-4, ve stejný den, podíl výmyslů klesl z 55 procent na 18 procent. Posuňme se k GPT-4o v polovině roku 2025 a míra měřená týmem Linardon byla 19.9 procenta, při náročnějším a užším úkolu, šest literárních rešerší v jediném výzkumném oboru namísto krátkých shrnutí rozprostřených přes 42 nesouvisejících témat. Posuňme se znovu k modelům se zapnutými funkcemi search nebo deep-research, testovaným na začátku roku 2026, a rozsah u většiny z nich klesá na jednociferné hodnoty, 3 až 9 procent, ačkoli jeden režim deep-research stále dosáhl 13.3 procenta.

Nic z toho není přímá klesající linie. Hodnota Linardon se nachází mezi údajem pro GPT-4 z roku 2023 a údajem pro GPT-3.5 z roku 2023, u modelu vydaného více než rok po obou, protože byl testován na náročnějším úkolu, skutečné generaci literární rešerše v oboru, kde je velká část zdrojového materiálu sama obtížně dohledatelná. Míra výmyslů popisuje model na určitém úkolu v určitém datu. Změňte kteroukoli z těchto tří proměnných a číslo se posune, někdy výrazně.

Rodina modelu není jedinou proměnnou, která dnes stále mění číslo. Studie z roku 2025 hodnotící osm bezplatných chatbotů, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat a Perplexity, na 400 odkazech napříč pěti akademickými obory zjistila, že pouze 26.5 procenta všech vygenerovaných odkazů bylo zcela správných. Grok a DeepSeek v tomto testu nevytvořily žádné vymyšlené odkazy. Claude, Copilot a Perplexity patřily k nejhorším. Dva produkty postavené na srovnatelné základní technologii, testované ve stejném měsíci, na stejných zadáních, skončily na opačných koncích rozsahu, což je tatáž lekce jako v tabulce modelu a data výše, jen aplikovaná na produkt místo na verzi.

Proč vymyšlené citace vypadají skutečně

Vymyšlená citace není zjevný zástupný symbol. Walters a Wilder zjistili, že jejich vymyšlené záznamy nesly skutečná jména autorů, tedy autorů, kteří publikují v daném oboru, a byly přiřazeny k názvům časopisů, které skutečně existují, a byly formátovány dostatečně dobře, aby prošly rychlou vizuální kontrolou. Tým Linardona zjistil něco ještě přesnějšího: z 35 vymyšlených citací, které GPT-4o vytvořil, 33 mělo připojené DOI, a 64 procent těchto DOI vedlo ke skutečnému, publikovanému článku na zcela nesouvisející téma, nikoli k nefunkčnímu odkazu ani chybové stránce, skutečný výzkum někoho jiného zde zastupoval zdroj, který neexistuje.

Jak ověřit, zda je citace ChatGPT skutečná

Vyhledejte přesný název v Google Scholar nebo na vlastních stránkách časopisu, místo abyste důvěřovali pouze DOI, protože funkční DOI může ukazovat zcela na nesprávný článek. Ověřte, že seznam autorů, rok a časopis odpovídají tomu, co se skutečně zobrazí, nejen to, že se něco zobrazí. Udělejte to u každé reference, kterou chatbot uvede, nejen u těch, které vypadají neznámě, protože vymyšlené záznamy v těchto studiích byly vytvořeny právě tak, aby působily obyčejně.

Neznámé nebo úzce vymezené téma považujte za rizikovější než téma hlavního proudu. Tým Linardona zjistil míru vymýšlení kolem 6 procent u dobře prozkoumaného stavu, velké depresivní poruchy, a kolem 30 procent u dvou méně prozkoumaných ve stejné sadě přehledů. Tento vzorec platí i mimo oblast duševního zdraví: model má v přeplněném oboru více skutečného textu, z něhož může odvozovat vzorce, a v řídce pokrytém oboru více prostoru pro věrohodné vymýšlení.

Kontrola citací pomocí AI, která porovnává každý záznam se skutečnou vědeckou databází tuto kontrolu automatizuje místo toho, aby ji ponechávala na ručním vyhledávání u každé jednotlivé reference, což je část, kterou většina lidí pod tlakem termínu přeskočí, tedy přesně za podmínek, za nichž má vymyšlená citace největší šanci přežít až do konečné verze textu.

Najít je v hotové bibliografii je samostatný postup a má vlastní stránku. U citací, které jsou skutečné, je citování ChatGPT v APA popsáno krok za krokem.

Nic z toho nemění způsob, jakým formátujete citaci poté, co jste potvrdili, že je skutečná. To je samostatná otázka: How to cite ChatGPT pokrývá APA, MLA, Chicago a IEEE pro samotnou výměnu, a generátor citací zpracuje běžný odkaz stejným způsobem bez ohledu na to, v jakém stylu píšete. Žádný citační formát nemůže napravit odkaz na něco, co nikdy nebylo publikováno. Tato kontrola probíhá před formátováním, u každého odkazu, bez ohledu na to, který model napsal váš návrh nebo jakou verzi tvrdí jeho označení.

Frequently Asked Questions

Vymýšlí ChatGPT odkazy? Ano, u každého dosud testovaného modelu, v každé publikované studii z let 2023 až 2026. Míra se výrazně liší podle verze modelu, oboru a data, od přibližně 3 procent u nejnovějších uzemněných modelů až po více než polovinu u GPT-3.5 v roce 2023, takže jedno číslo nikdy nepředstavuje úplnou odpověď.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

Vymýšlí ChatGPT odkazy? Studie to porovnaly | TextPulse.ai