Academic Writing

Halucinované citace: zkontrolujte svůj článek před odevzdáním

Vymyšlený odkaz není jen zkomolený. Přichází s pravděpodobnými autory, odpovídajícím názvem, skutečným časopisem a DOI, které vypadá platně, a právě proto jej opětovné čtení neodhalí. Audity literatury v rozsahu celé databáze, publikované v roce 2026, zjistily, že podíl článků obsahujících alespoň jeden vymyšlený odkaz vzrostl za tři roky zhruba desetinásobně. Zde je audit, který je třeba nejprve provést na vlastním seznamu.

11 min
Checklist for a hallucinated citation audit: DOI resolution, title matching, author-year cross-check, and journal name verification

V červnu 2023 federální soudce v New Yorku sankcionoval dva advokáty za podání podání, které bylo založeno na nejméně šesti soudních případech, jež neexistovaly. Steven Schwartz požádal ChatGPT o podpůrný precedens, obdržel názvy případů a citované odůvodnění, které všechno znělo věrohodně, a podání podal, aniž by sám otevřel jediný případ. Soudce P. Kevin Castel mu uložil pokutu pět tisíc dolarů a nařídil dopis každému skutečnému soudci, jehož jméno bylo připojeno k vymyšlenému stanovisku.

Seznam literatury může skončit na stejném místě. Řešením je audit halucinovaných citací provedený na vlastním seznamu literatury dříve, než jej za vás provede redaktor, vedoucí nebo recenzent. Nejde jen o problém způsobený psaním s chatbotem. Citace vybavená z paměti, která nikdy docela neexistovala, mírně chybně opsaný název spoluautora nebo preprint, jehož konečná citace se po přijetí změnila, mohou v seznamu literatury zanechat stejný druh mezery jako vymyšlená citace. Níže uvedený audit zachytí všechny, bez ohledu na to, jak se tam kterýkoli jednotlivý záznam dostal.

Jak častá je vlastně halucinovaná citace?

Rozsah silně závisí na tom, který model vytvořil návrh. Walters a Wilder, publikující v Scientific Reports v roce 2023, testovali seznamy literatury generované GPT-3.5 a GPT-4 proti skutečným akademickým zadáním: 636 citací převzatých z 84 seznamů literatury vytvořených AI, 42 pro každý model. Padesát pět procent citací GPT-3.5 bylo zcela vymyšlených, oproti 18 procentům u GPT-4. Ani skutečné citace nebyly nutně bezchybné: 43 procent skutečných citací GPT-3.5 a 24 procent citací GPT-4 stále neslo podstatnou chybu někde v autorovi, názvu, roce nebo zdroji.

Právní výzkum citací vytvořených AI ukazuje ještě vyšší míru selhání, ale tato práce měří jiné selhání, halucinovaná soudní rozhodnutí, nikoli vymyšlené bibliografické odkazy, takže tento údaj není vhodné přenášet do akademického kontextu. To, co mají oba obory společné, je základní příčina, model, který vytváří citaci znějící věrohodně, optimalizuje to, jak citace obvykle vypadá, nikoli to, zda skutečně existuje. Vlastní text TextPulse o tom, zda ChatGPT vymýšlí odkazy se zaměřuje právě na tohoto chatbota, tato kontrola však funguje bez ohledu na to, který nástroj, nebo která paměť spoluautora, vytvořil záznam před vámi.

Co zjistily audity literatury v roce 2026

Tato míra na úrovni modelu popisuje, co vypadne z chatbota. Samostatná otázka, a ta, na níž záleží každému, kdo odevzdává text do časopisu, je, jak často vymyšlený odkaz přežije každou kontrolu mezi návrhem a publikovaným článkem. Dva audity zveřejněné v rozmezí jednoho dne v květnu 2026 na ni odpověděly v měřítku celé literatury a odpověď zní, že toto selhání už není vzácné.

Audit zveřejněný v The Lancet prověřil odkazy napříč přibližně 2.5 milionu biomedicínských článků v PubMed Central Open Access, a to za období od ledna 2023 do února 2026. Několik tisíc odkazů směřovalo k pracím, které neexistují, a to v více než 2,800 publikovaných článcích. Důležitější než celkový počet je trend.

ObdobíČlánky s alespoň jedním vymyšleným odkazemNa 10,000 článků
20231 z 2,8283.5
20251 z 45821.8
2026, prvních sedm týdnů1 z 27736.1

To je zhruba desetinásobný nárůst během tří let a údaj za rok 2026 je odvozen ze sedmi týdnů, nikoli z celého roku, takže jde o raný údaj, nikoli o ustálenou roční míru. Ukazuje to, že smyšlené odkazy pronikají do tisku v recenzovaných časopisech a cestou prošly přes autory, spoluautory, editory i recenzenty.

Související studie, Zhao a kolegové o neexistujících citacích, rozšířila záběr na 111 milionů odkazů napříč arXiv, bioRxiv, SSRN a PubMed Central a stanovila konzervativní dolní hranici 146,932 halucinovaných citací jen za rok 2025. Její užitečnější zjištění se týká spíše rozložení než objemu, smyšlené odkazy se shlukují v oborech s rychlým zaváděním AI a mezi malými autorskými týmy a týmy na začátku kariéry. Pokud jste samostatný autor nebo malá skupina bez výzkumného oddělení, které by kontrolovalo vaši bibliografii, patříte do skupiny, u níž se to nejčastěji pokazí, což je argument pro to, abyste audit provedli sami, místo abyste předpokládali, že to udělá někdo po vás.

Které modely smyšlejí nejvíce a co to skutečně snižuje

Upřímná odpověď je, že neexistuje žádný rigorózní veřejný benchmark, který by dnešní hlavní modely mezi sebou řadil podle smyšlení citací konkrétně. Kolují malé neformální srovnávací testy, obvykle několik desítek odkazů ručně prohnaných dvěma nebo třemi chatboty, a vzorky jsou příliš malé na to, aby z nich šlo sestavit pořadí. Brát jeden z nich jako žebříček je způsob, jak se do článku dostane sebejisté a chybné tvrzení.

Co se však potvrzuje, je generační srovnání v datech Walters a Wilder výše, kde novější model smyšlel zhruba třikrát méně často než starší model.

Testovaný modelCitace zcela smyšlenéSkutečné citace, které přesto nesly podstatnou chybu
GPT-3.555%43%
GPT-418%24%

Tři vzorce se v literatuře opakují a mají větší váhu než jakékoli jednotlivé pořadí. Větší modely si vymýšlejí méně než menší. Modely, které skutečně umějí vyhledávat a získávat zdroje, si vymýšlejí podstatně méně než modely odpovídající pouze z vlastních parametrů, což je jediný největší efekt, který kdy někdo změřil. A neznámé zdroje jsou mnohem rizikovější než známé, protože silně citovaný článek se v trénovacích datech objevuje dost často na to, aby byl reprodukován správně, zatímco specializovaný zdroj je pravděpodobnější rekonstruovat z fragmentů.

Praktický závěr je, že žádný model není dost bezpečný na to, aby bylo možné kontrolu vynechat, a položky, u nichž je největší pravděpodobnost chyby, jsou přesně ty, které je z paměti nejméně možné ověřit, odborná citace, neznámý konferenční příspěvek, zdroj, který jste přidali jako poslední.

Co automatická kontrola zachytí a kde končí

Projít seznam nejprve kontrolorem je rychlejší než ručně ověřovat čtyřicet DOI, a tento bezplatný AI kontrolor citací na tomto webu přesně to dělá vůči Crossref, OpenAlex a Semantic Scholar. Je užitečné vědět, v čem tento typ nástroje selhává, dříve než se na něj spolehnete.

Vyhodnocení pěti detektorů halucinovaných citací z roku 2026, Badalova and Mayr, zjistilo, že poskytují užitečná včasná varování, ale zůstávají omezeny čtyřmi věcmi, čistým extrahováním referencí z dokumentu, neúplnými metadaty v samotné položce, neúplným pokrytím databází a registry, které se navzájem neshodují. Pouze první z nich odpadá, když vložíte seznam místo nahrání PDF.

Důsledkem pro vaši vlastní kontrolu je pravidlo pro interpretaci. Kontrolní nástroj je nejsilnější při zjištění, na kterém záleží nejvíce, tedy DOI, které se rozlišuje na jiný článek, než jaký záznam tvrdí, což je téměř rozhodující. Je nejslabší u knih, kapitol, disertací, sborníků, velmi nedávných prací a neanglických zdrojů, které jsou všude indexovány jen řídce a běžně se vracejí jako nenalezené, přestože jsou zcela pravé. Nenalezené je podnět ke kontrole ručně, nikdy verdikt. Níže uvedené ruční kroky jsou to, co použijete na cokoli, co automatizovaný průchod nedokázal vyřešit.

Zlidštit vlastní práci

Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.

Začít zdarma

Vyřešte každé DOI před odesláním

DOI, tedy Digital Object Identifier, má být rozlišeno na přesně jeden záznam prostřednictvím resolveru doi.org. Přidejte DOI ze svého seznamu literatury do resolveru a funkční DOI se otevře na stránce vydavatele pro přesně ten článek. DOI, které se rozlišuje na nesouvisející článek, zcela jiný časopis, nebo vůbec na nic, je jednou z nejrychlejších dostupných kontrol halucinace, protože model, který si vymýšlí citaci, obvykle vymyslí k ní i DOI řetězec, který vypadá věrohodně, místo aby použil skutečný.

DOI, které se rozlišuje správně, není automatickým důkazem, že citace je pravá. Některé zfalšované odkazy přebírají skutečné DOI nesouvisejícího článku, které se rozlišuje bez chyby a vede na skutečný článek, jenž nemá s tvrzením, které má údajně podporovat, nic společného. Čtěte stránku, na kterou DOI vede, ne jen to, že se načetla.

Porovnejte každý název s reálnou databází

Vyhledejte přesný název, v uvozovkách, v databázi, která pokrývá váš obor, ne na otevřeném webu. Použijte například Crossref, PubMed pro biomedicínskou práci nebo vlastní index vašeho oboru. Pokud používáte Crossref, můžete využít jejich bezplatné hostující vyhledávání k dohledání odkazu podle názvu a prvního autora, nebo podle autora a čísla stránky, pokud si nejste jisti názvem. To vrátí DOI a úplná metadata pro cokoli, co mají v záznamech. Pokud nenajdete shodu, nebo pokud se vrátí skutečný článek s úplně jiným seznamem autorů, můžete být svědky druhého typu halucinace, poškozeného DOI.

Vyhledání podle názvu zachytí konkrétní selhání, které kontrola DOI nezachytí, citaci s funkčním, skutečným DOI připojeným ke špatnému názvu, protože číslo a text byly sestaveny odděleně a nikdy nebyly skutečně porovnány mezi sebou. Pokud se název v databázi neshoduje s názvem ve vašem seznamu literatury dostatečně přesně, považujte to za výmysl, dokud nebudete schopni vysvětlit nesoulad, ne za překlep, který lze tiše opravit.

Porovnejte seznam autorů a rok publikace

Halucinovaná citace často uvede správně autora a špatně článek, protože právě skutečné, známé jméno v oboru je to, co model usilující o pravděpodobnou citaci obvykle vytvoří. Vyhledejte vlastní publikační seznam autora v databázi, kterou už máte otevřenou, pro rok, který uvádí váš seznam literatury. Pokud ten autor publikoval v daném roce tři články a žádný z nich neodpovídá vašemu názvu, je citace velmi pravděpodobně vymyšlená, sestavená ze skutečného jména a skutečného roku, které spolu ve skutečnosti nikdy nepatřily.

Objevuje se i opačný vzorec, skutečný článek, správně pojmenovaný, ale přiřazený ke špatnému roku, obvykle k roku preprintu místo roku konečné publikace, nebo konferenční verze citovaná s pozdějším rokem publikace časopisu. Ani jedno není výmysl v přísném smyslu auditu, ale obojí pošle čtenáře do citačního manažeru nebo za spoluautorem, který pak nemůže najít to, co jste citovali, a je to natolik blízké stejnému problému, že je vhodné to opravit při téže kontrole.

Odhalte pravděpodobný, ale vymyšlený název časopisu

Vymyšlený název časopisu je sestaven tak, aby zněl přesně jako skutečný: věrohodný obor, věrohodné přídavné jméno, název dostatečně blízký skutečnému časopisu, takže se nikdo nezastaví, aby to ověřil. „The Journal of Applied Cognitive Studies“ je vymyšlený; „The Journal of Applied Psychology“ i „Journal of Cognitive Science“ skutečně existují a název, který spojuje části obou dohromady, působí povědomě právě z tohoto důvodu.

Vyhledejte název časopisu samostatně, v uvozovkách, a hledejte vlastní stránku časopisu vydavatele a aktuální ISSN, ne jen záznam na nějakém jiném webu, který cituje stejný odkaz. Skutečný časopis má domovskou stránku uvádějící editora, aktuální ročník a číslo a legitimní ISSN, které je k němu registrováno. Název bez stránky vydavatele, bez ISSN a bez jakéhokoli jiného článku, který by z něj citoval práci, je v celé kontrole nejjasnějším znakem, že daný odkaz neexistuje.

Převeďte audit vymyšlených citací na opakovatelný kontrolní seznam

Proveďte tyto kontroly v tomto pořadí u každého odkazu, než bude seznam považován za konečný. Na pořadí záleží méně než na tom, aby byly pokryty všechny čtyři, citace může projít jednou kontrolou a přesto v jiné selhat.

KontrolaCo odhalí
Řešení DOIDOI, který nikam nevede, nebo vede k nesouvisejícímu článku
Shoda názvu s databázíSkutečné DOI přiřazené k nesprávnému názvu, nebo název, který nevrátí vůbec žádný výsledek
Křížová kontrola autora a rokuJméno skutečného autora přiřazené k článku, který v daném roce nenapsal
Ověření názvu časopisuVěrohodně znějící časopis bez ISSN, bez stránky vydavatele a bez skutečné existence

TextPulse's kontrola citací pomocí AI provádí automaticky verzi tohoto kroku napříč celým seznamem literatury, rychleji než ruční procházení všech čtyř kontrol u dlouhé bibliografie, i když stále stojí za to přečíst si, co označí, sami, místo abyste označení přijímali nebo odmítali na základě důvěry. Pro krok DOI konkrétně vyhrazené vyhledání citace z DOI ušetří cestu k resolveru pro každý záznam zvlášť.

Čistá bibliografie je jednou z několika kontrol před odesláním rukopisu. Snížení AI skóre pro odevzdání do časopisu je pojednáno samostatně a stejně tak dopis s odpovědí recenzentům, který na něj navazuje.

Nic z toho nenahrazuje to, abyste si svůj vlastní článek před odesláním ještě jednou přečetli. Pokud po ověření faktů některá část stále zní příliš obecně, AI humanizer může uhladit styl, aniž by se dotkl jediné citace, TextPulse's průvodce humanizací textu AI v akademickém psaní tento krok pokrývá po jednotlivých částech. Seznam literatury, který se bez problémů rozřeší, a rukopis, který zní jako váš vlastní hlas, jsou dvě oddělené kontroly, které stojí za to provést hned po sobě, místo abyste důvěřovali tomu, že jedna pokryje druhou.

XLinkedInFacebook

Často kladené otázky

Audit halucinovaných citací je opakovatelná kontrola provedená nad úplným seznamem literatury před odevzdáním, která zahrnuje ověření každého DOI, porovnání každého názvu se skutečnou databází, křížovou kontrolu seznamu autorů a roku a potvrzení, že název časopisu skutečně existuje. Zachytí vymyšlené odkazy bez ohledu na to, zda je tam vložil chatbot, chyba správce citací, nebo špatně zapamatovaný údaj.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

Zůstaňte v obraze o humanizaci AI

Získejte tipy na akademické psaní, detekci AI a humanizaci doručené do vaší schránky.

Žádný spam. Kdykoli se můžete odhlásit.