Vymýšlí ChatGPT odkazy? Co zjistily studie o fabrikaci
Šest studií, čtyři obory, tři roky. Míra, s jakou ChatGPT vymýšlí odkaz, se pohybuje od jednotek procent až po více než polovinu, a toto číslo nic neznamená bez verze modelu a data, které je k němu připojeno.
V červnu 2025 požádali výzkumníci na Deakin University GPT-4o, aby napsal šest literárních přehledů na témata duševního zdraví. Z 176 citací, které vytvořil, 35 neexistovalo vůbec. Dalších 64 odkazovalo na skutečné práce, ale s nesprávnými údaji. To je jedna citace z pěti zcela vymyšlená, a to u modelu vydaného více než rok poté, co byl problém s citacemi v ChatGPT poprvé změřen v tištěné podobě.
Vymýšlí ChatGPT odkazy? Ano, a dělá to i v roce 2026, na aktuálních modelech, nejen na verzi, která se dostala do titulků v roce 2023. Otevřená otázka nikdy nezní, zda se to děje. Jde o to, jak často, a toto číslo se mění podle modelu, verze, oboru a data, kdy byl test proveden.
Vymýšlí ChatGPT odkazy?
Ano. Jazykový model předpovídá další pravděpodobné slovo na základě všeho, co mu předchází. Nic nevyhledává, pokud do svého produktu nepřidáte krok načítání nebo vyhledávání. Pokud je ponechán, aby předpověděl, jak citace vypadá, vytvoří takovou, která vypadá správně, jméno autora, rok, název časopisu, číslo svazku, DOI, aniž by ověřil, zda kterákoli z těchto věcí odpovídá skutečné publikaci. Některé z toho budou správné náhodou nebo díky mechanickému zapamatování. Některé budou vymyšlené od začátku a budou vypadat úplně stejně.
Proč míra vymýšlení potřebuje verzi modelu a datum
Protože tato míra není jedno číslo. V jediné nejčastěji citované studii na toto téma ChatGPT-3.5 vymyslel 55 procent citací v souboru krátkých literárních přehledů a ChatGPT-4, testovaný stejnými výzkumníky na stejných 42 tématech, vymyslel 18 procent. Stejná studie, stejné prompty, stejný den testování. Jediné, co se změnilo, byl model, a míra klesla o dvě třetiny.
Na datu záleží stejně jako na názvu modelu. GPT-4 v této studii znamenal to, co OpenAI v polovině roku 2023 právě poskytovala. Studie z roku 2026, která zkoumala deset současných modelů a výzkumných agentů a celkem prověřila více než 220,000 citačních odkazů, zjistila míru fabrikace od 3 procent do 13 procent, přičemž přesná hodnota závisela na konkrétním modelu a na tom, zda produkt používal vyhledávací ukotvení nebo režim hlubokého výzkumu. Ani jedna hodnota není chybná. Popisují odlišné věci měřené s odstupem téměř tří let.
Na oboru také záleží, nezávisle na modelu. Také jsme měli výzkum z ekonomie, který byl veden stejnou dvojicí GPT-3.5 a GPT-4, a zjistil více než 30 procent vymyšlených citací u GPT-3.5 a míru stále nad 20 procent u GPT-4, což je blízko tomu, co zjistila multidisciplinární studie, zatímco studie systematického přehledu v medicíně, která testovala konkrétně to, co bylo označeno jako sestavení GPT-4 z března 2023, naměřila 28.6 procenta na zcela odlišném úkolu, totiž získávání referencí pro existující systematické přehledy, nikoli psaní nových literárních shrnutí od nuly.
Co zjistily publikované studie
Šest studií, provedených mezi lety 2023 a 2026 v medicíně, právu, ekonomii a obecně akademickém psaní, dospívá ke stejnému zjištění vyjádřenému šesti různými způsoby, zkontrolujte každou referenci, kterou vám nástroj AI poskytne, bez ohledu na to, který model ji vytvořil nebo kdy.
| Studie a obor | Model a verze | Datum testování | Vzorek | Míra fabrikace |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisciplinární) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citací, 42 témat | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (ekonomie) | GPT-3.5 and GPT-4 | 2023 | Výzvy z témat Journal of Economic Literature | Více než 30% (3.5), více než 20% (4) |
| Chelli et al, JMIR (lékařské systematické přehledy) | GPT-3.5, GPT-4 (sestavení gpt-4-32k-0314), Bard (PaLM 2.0) | Queried July 2023 | 471 referencí, 11 přehledů | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (právo) | ChatGPT-4 and Llama 2 | 2024 | Náhodné otázky k případům federálních soudů | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (přehledy v oblasti duševního zdraví) | GPT-4o | Tested June 2025 | 176 citací, 6 přehledů | 19.9% zcela fabrikovaných, 56% fabrikovaných nebo chybných |
| Rao, Wong and Callison-Burch, arXiv preprint (vícedoménové, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Více než 220,000 citačních URL | 3% to 13% depending on model |
Právní studie přidává detail, který samotné hrubé procento nezachycuje: tatáž výzkumná práce zjistila, že modely mají potíže předpovídat vlastní halucinace a mají tendenci přijmout uživatelovu nesprávnou premisu o případu, místo aby ji opravily. Fabrikovaná citace je jeden způsob selhání. Model, který navíc nedokáže upozornit na vlastní nejistotu, představuje obtížnější problém a nejvíce se projevuje právě v oboru, kde má chybná citace nejvyšší náklady.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Zlepšil se ChatGPT od roku 2023?
Do jisté míry, a nerovnoměrně. Nejzřetelnější jednotlivé srovnání před a po je přímo ve studii Walters a Wilder: GPT-3.5 oproti GPT-4, ve stejný den, podíl výmyslů klesl z 55 procent na 18 procent. Posuňme se k GPT-4o v polovině roku 2025 a míra měřená týmem Linardon byla 19.9 procenta, při náročnějším a užším úkolu, šest literárních rešerší v jediném výzkumném oboru namísto krátkých shrnutí rozprostřených přes 42 nesouvisejících témat. Posuňme se znovu k modelům se zapnutými funkcemi search nebo deep-research, testovaným na začátku roku 2026, a rozsah u většiny z nich klesá na jednociferné hodnoty, 3 až 9 procent, ačkoli jeden režim deep-research stále dosáhl 13.3 procenta.
Nic z toho není přímá klesající linie. Hodnota Linardon se nachází mezi údajem pro GPT-4 z roku 2023 a údajem pro GPT-3.5 z roku 2023, u modelu vydaného více než rok po obou, protože byl testován na náročnějším úkolu, skutečné generaci literární rešerše v oboru, kde je velká část zdrojového materiálu sama obtížně dohledatelná. Míra výmyslů popisuje model na určitém úkolu v určitém datu. Změňte kteroukoli z těchto tří proměnných a číslo se posune, někdy výrazně.
Rodina modelu není jedinou proměnnou, která dnes stále mění číslo. Studie z roku 2025 hodnotící osm bezplatných chatbotů, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat a Perplexity, na 400 odkazech napříč pěti akademickými obory zjistila, že pouze 26.5 procenta všech vygenerovaných odkazů bylo zcela správných. Grok a DeepSeek v tomto testu nevytvořily žádné vymyšlené odkazy. Claude, Copilot a Perplexity patřily k nejhorším. Dva produkty postavené na srovnatelné základní technologii, testované ve stejném měsíci, na stejných zadáních, skončily na opačných koncích rozsahu, což je tatáž lekce jako v tabulce modelu a data výše, jen aplikovaná na produkt místo na verzi.
Proč vymyšlené citace vypadají skutečně
Vymyšlená citace není zjevný zástupný symbol. Walters a Wilder zjistili, že jejich vymyšlené záznamy nesly skutečná jména autorů, tedy autorů, kteří publikují v daném oboru, a byly přiřazeny k názvům časopisů, které skutečně existují, a byly formátovány dostatečně dobře, aby prošly rychlou vizuální kontrolou. Tým Linardona zjistil něco ještě přesnějšího: z 35 vymyšlených citací, které GPT-4o vytvořil, 33 mělo připojené DOI, a 64 procent těchto DOI vedlo ke skutečnému, publikovanému článku na zcela nesouvisející téma, nikoli k nefunkčnímu odkazu ani chybové stránce, skutečný výzkum někoho jiného zde zastupoval zdroj, který neexistuje.
Jak ověřit, zda je citace ChatGPT skutečná
Vyhledejte přesný název v Google Scholar nebo na vlastních stránkách časopisu, místo abyste důvěřovali pouze DOI, protože funkční DOI může ukazovat zcela na nesprávný článek. Ověřte, že seznam autorů, rok a časopis odpovídají tomu, co se skutečně zobrazí, nejen to, že se něco zobrazí. Udělejte to u každé reference, kterou chatbot uvede, nejen u těch, které vypadají neznámě, protože vymyšlené záznamy v těchto studiích byly vytvořeny právě tak, aby působily obyčejně.
Neznámé nebo úzce vymezené téma považujte za rizikovější než téma hlavního proudu. Tým Linardona zjistil míru vymýšlení kolem 6 procent u dobře prozkoumaného stavu, velké depresivní poruchy, a kolem 30 procent u dvou méně prozkoumaných ve stejné sadě přehledů. Tento vzorec platí i mimo oblast duševního zdraví: model má v přeplněném oboru více skutečného textu, z něhož může odvozovat vzorce, a v řídce pokrytém oboru více prostoru pro věrohodné vymýšlení.
Kontrola citací pomocí AI, která porovnává každý záznam se skutečnou vědeckou databází tuto kontrolu automatizuje místo toho, aby ji ponechávala na ručním vyhledávání u každé jednotlivé reference, což je část, kterou většina lidí pod tlakem termínu přeskočí, tedy přesně za podmínek, za nichž má vymyšlená citace největší šanci přežít až do konečné verze textu.
Najít je v hotové bibliografii je samostatný postup a má vlastní stránku. U citací, které jsou skutečné, je citování ChatGPT v APA popsáno krok za krokem.
Nic z toho nemění způsob, jakým formátujete citaci poté, co jste potvrdili, že je skutečná. To je samostatná otázka: How to cite ChatGPT pokrývá APA, MLA, Chicago a IEEE pro samotnou výměnu, a generátor citací zpracuje běžný odkaz stejným způsobem bez ohledu na to, v jakém stylu píšete. Žádný citační formát nemůže napravit odkaz na něco, co nikdy nebylo publikováno. Tato kontrola probíhá před formátováním, u každého odkazu, bez ohledu na to, který model napsal váš návrh nebo jakou verzi tvrdí jeho označení.
Frequently Asked Questions
Vymýšlí ChatGPT odkazy? Ano, u každého dosud testovaného modelu, v každé publikované studii z let 2023 až 2026. Míra se výrazně liší podle verze modelu, oboru a data, od přibližně 3 procent u nejnovějších uzemněných modelů až po více než polovinu u GPT-3.5 v roce 2023, takže jedno číslo nikdy nepředstavuje úplnou odpověď.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.