AI Detection

Jsou detektory AI přesné? Falešně pozitivní výsledky a zkreslení

Dodavatelé zveřejňují míry falešně pozitivních výsledků pod 1 procento. Nezávislí výzkumníci, kteří testovali stejné detektory na psaní v angličtině od nerodilých mluvčích, zjistili míry nad 60 procent. Zde je to, co ukazují důkazy.

Aktualizováno dne 13 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin tvrdí, že jejich míra falešně pozitivních výsledků je nižší než 1%. Skupina nezávislých výzkumníků otestovala více detektorů na širším souboru vzorků psaní od nerodilých mluvčích angličtiny. Zjistili, že průměrná míra falešně pozitivních výsledků byla u téhož typu psaní vyšší než 60%. Obě čísla jsou skutečná, obě byla zveřejněna a obě se vztahují k detektorům, které prodávají stejnému trhu. Jsou detektory AI přesné? Záleží na tom, jakou populaci jste testovali, jaký detektor jste použili a jak jej váš dodavatel od začátku definoval.

Tento příspěvek nebude znovu vysvětlovat, jak detektor tento výsledek vypočítává. Mechanismus, perplexity, pravděpodobnost tokenů, způsob, jakým je klasifikátor trénován, je podrobně popsán jinde, a pokud jste to ještě nečetli, stojí za to si to nejprve přečíst. Zde je podstatné, co se děje, jakmile výsledek existuje, jak často je chybný, čí psaní je jím nejčastěji označováno chybně a co falešné obvinění ve skutečnosti stojí někoho, kdo neudělal nic špatného.

Jsou detektory AI přesné?

Nejsou konzistentně přesné a rozdíl mezi marketingovými tvrzeními a nezávislým testováním je dobře doložen. Skupina výzkumníků vedená Deborou Weber-Wulff zveřejnila své závěry o 14 nástrojích pro detekci, z nichž 12 bylo zdarma a dva komerční, které byly v roce 2023 testovány na směsi lidského textu a textu z ChatGPT. Zjistili, že žádný z těchto nástrojů není přesný ani spolehlivý, s vestavěnou tendencí označovat strojový text jako lidský spíše než naopak. Dva z komerčních nástrojů zahrnutých do tohoto testu byly Turnitin a PlagiarismCheck. Všechny nástroje v tomto testu si vedly hůře, když byl text parafrázován.

Ale po dvou letech věci nestagnují. Pracovní studie z Booth School na University of Chicago, od Briana Jabariane a Alexe Imase, podrobila tři nováčky, Pangram, GPTZero a Originality.ai, a jednoho open source konkurenta zkoušce s téměř 2,000 texty napsanými lidmi z blogů, zpráv, recenzí a beletrie. Za kontrolovaných testovacích podmínek nejlepší nástroj v souboru neklesl pod 99.8 procentní přesnost a udržel svou míru falešně pozitivních výsledků na nízké úrovni. Open source model si vedl stejně dobře jako náhodný tipař. Věci se skutečně zlepšily. Jaksi. Trochu.

Háček je však ve slově kontrolovaných. Benchmarkové pasáže jsou čisté, úplné a vytvořené za známých podmínek. Odevzdaná esej není spolehlivě ani jednou z těchto věcí. Výsledky v reálném světě nemusí být totožné s výsledky v laboratoři, jak veřejně uvedl vlastní chief product officer společnosti Turnitin, i když jde o vzácné a užitečné přiznání ze strany dodavatele. Následující část klade čísla dodavatele vedle nezávislých čísel, aby byl rozdíl viditelný, nikoli pouze tvrzený.

Tvrzení dodavatele versus nezávislé testování

Tabulka níže staví to, co o sobě tvrdí čtyři detektory, proti tomu, co naměřili nezávislí výzkumníci, když nástroje testovali přímo. Čtěte společně dva prostřední sloupce, nikoli pouze sloupec dodavatele.

DetektorÚdajná přesnost podle dodavateleNezávisle zjištěnoCo dodavatel uvádí o falešně pozitivních výsledcích
TurnitinPrahová hodnota jistoty 98% před označením, méně než 1% falešně pozitivních výsledků na úrovni dokumentuPřibližně 80% přesnost, nejlepší z 12 nástrojů v porovnání z roku 2023, na dřívější verzi nástrojeMéně než 1% na úrovni dokumentu nad prahem 20% textu napsaného AI, přibližně 4% na úrovni věty
GPTZero95.7% detekce textu AI při 1% míře falešně pozitivních výsledků na nezávislém benchmarku RAID96% přesnost u krátkých pasáží, míra falešně pozitivních výsledků pod 1% ve studii Booth School of Business University of Chicago z roku 2025Uvádí 1% míru falešně pozitivních výsledků na benchmarku RAID
Originality.ai99% přesnost, 0.5% míra falešně pozitivních výsledků, model Lite, 1.5%, model TurboMíra falešně pozitivních výsledků pod 1%, ale ve stejné studii Booth School of Business přehlédla 10% až 40% textu napsaného AIZveřejňuje samostatné údaje o falešně pozitivních výsledcích podle úrovně modelu
PangramMíry chyb, které podle něj jsou více než 38krát nižší než u konkurenčních nástrojů, uvádí, že nemá zkreslení vůči autorům, pro něž angličtina není rodným jazykemPřesnost nikdy nižší než 99.8%, míra falešně pozitivních výsledků téměř nulová, ve studii BoothUvádí téměř nulové míry falešně pozitivních výsledků napříč 10 textovými doménami a 8 jazykovými modely

Vynikají dvě věci. Zaprvé, všechny údaje dodavatelů pocházejí z laboratoře, kterou kontroluje dodavatel, a údaje Booth pocházejí od výzkumníků, kteří nemají co prodávat. Zadruhé, Turnitin se v tomto prostředním sloupci vůbec neobjevuje, protože studie z roku 2025 jej netestovala. V tabulce je jeho nezávislý údaj založen na dřívějším srovnání z roku 2023, ale byl proveden na starší verzi nástroje, proto na to při pohledu na tabulku jako na srovnání typu jako za stejných podmínek pamatujte.

Jak přesná je detekce AI v Turnitin?

Turnitin nezveřejňuje jedno číslo přesnosti. Místo toho zveřejňuje práh a kompromis. Společnost uvedla, že dokument označí pouze tehdy, když je na 98 procent přesvědčena, že označená část byla napsána AI, a že právě tento práh udržuje míru falešně pozitivních výsledků na úrovni celého dokumentu pod 1 procentem. Turnitin odhadl, že zachytí přibližně 85 procent textů napsaných s pomocí AI, a zbytek záměrně propustí, než aby riskoval nesprávné obvinění.

Skutečné procento falešně pozitivních výsledků, které Turnitin uvádí na úrovni vět, tedy tam, kde rozhraní zvýrazňuje konkrétní řádky místo celého dokumentu, je ve skutečnosti blíže 4 procentům. To je číslo, které stojí za to znát, pokud profesor pořídí snímek obrazovky jediného označeného odstavce místo skóre za celý dokument, protože zvýrazněná věta nese výrazně vyšší pravděpodobnost omylu než skóre dokumentu vedle ní.

Za zmínku stojí také to, že Turnitin tuto mezeru výslovně uznal. Zjistili, že jejich první výsledky z reálného provozu, zejména u kratších dokumentů, měly vyšší míru falešně pozitivních výsledků, než se očekávalo na základě laboratorních testů. Proto upravili minimální délku dokumentu, který se má hodnotit, z 150 na 300 slov. To je případ, kdy dodavatel upravuje vlastní produkt, protože zveřejněné číslo neobstálo mimo laboratoř, což vypovídá stejně mnoho jako jakákoli nezávislá studie.

Co falešně pozitivní výsledek studentovi skutečně způsobí

To se stalo studentovi executive MBA na Yale's School of Management. Student byl obviněn z porušení pravidel, v tom nejdoslovnějším smyslu. Použitým detektorem byl GPTZero. Závěrečná zkouška studenta v kurzu financí byla označena pedagogickým asistentem, který si myslel, že text je dlouhý a rozvláčný, s téměř dokonalou interpunkcí a gramatikou. A právě tento profesor jej nechal projít přes GPTZero, který odpovědi ohodnotil jako pravděpodobně vygenerované AI.

Neprospěl v kurzu a byl na rok suspendován. Jeho žaloba, podaná u federálního soudu v únoru 2025, tvrdí, že vlastní politika Yale omezuje používání nástrojů, jako je GPTZero, právě z tohoto důvodu, tedy kvůli jeho zdokumentované míře falešně pozitivních výsledků vůči nerodilým mluvčím angličtiny, a že jej použil v rozporu s touto politikou. Jeho podání také uvádí, že GPTZero vrátilo 100 procentní skóre AI-generated u akademického textu bývalého univerzitního prezidenta Yale i děkana obchodní školy.

Soudce v květnu 2025 odmítl vydat předběžné opatření. Případ dosud nebyl rozhodnut, když toto píši. Žalobce, francouzský státní příslušník, tvrdí, že stejná známá zaujatost vůči nerodilým mluvčím angličtiny způsobila, že jeho text dopadl tak, jak dopadl. Na to se podíváme v následující části. Co není předmětem sporu, je cena, rok ztracený v rámci studijního programu, neprospění, právní náklady a několik měsíců strávených sporem o skóre místo získávání titulu. 1 procentní míra falešně pozitivních výsledků zní nepatrně, dokud velká populace neudělá z tohoto problému problém konkrétní osoby.

Zlidštit vlastní práci

Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.

Začít zdarma

Které rysy psaného projevu způsobují, že lidský text působí strojově

Čtyři druhy běžného psaní nesou největší riziko a žádný z nich neznamená, že by člověk dělal něco špatně. Krátké dokumenty, silně formulaické psaní, citovaný nebo šablonovitý materiál a psaní, které bylo důkladně korektorsky upraveno, mají tendenci být hodnoceny jako předvídatelnější než volně komponovaná próza, což je jediná vlastnost, kterou ve skutečnosti měří každý detektor. free burstiness checker měří tutéž variaci přímo, což je rychlejší způsob, jak tento vzorec rozpoznat, než číst jeho popis.

Některé žánry jsou záměrně formulové. Sekce metod, laboratorní zpráva, standardní motivační dopis a literární přehled všechny odměňují konvenční obrat spíše než vynalézavý, protože právě konvence činí dokument pro jeho čtenáře použitelným. Výzkumníci to přímo otestovali na skutečném psaní, vzali 14,400 abstraktů z časopisů publikovaných mezi lety 1980 a 2023, tedy roky předtím, než existoval jakýkoli velký jazykový model, a prošli je veřejně dostupným detektorem. Až 8 procent bylo označeno jako generované AI bez ohledu na rok publikace a abstrakty časopisu New England Journal of Medicine byly označeny v 10.24 procenta, což byla nejvyšší míra falešně pozitivních výsledků ze všech pěti testovaných časopisů.

Test nemohl detekovat nic o ChatGPT, protože ChatGPT po většinu let, z nichž vzorkoval, neexistoval. Detekoval žánr. Formálněji řečeno, jak by to vyjádřila statistická analýza problému detekce z roku 2026, neexistuje způsob, jak vytvořit detektor, který by rozlišil mezi větou, která je předvídatelná proto, že byla napsána softwarem, a větou, která je předvídatelná proto, že je to druh věci, kterou v daném žánru píšete. Zvenčí vypadají úplně stejně.

Silná redakční úprava působí podobným směrem. První verze nese specifické nepravidelnosti autora, zvláštní slovosled, větu, která se táhne příliš dlouho, protože se táhla i myšlenka. Důkladná korektura, zejména ta provedená pomocí jiného nástroje, má tendenci právě tyto nepravidelnosti vyhladit. Dosud největší nezávislé srovnání detekčních nástrojů testovalo 14 z nich a zjistilo, že přesnost u každého nástroje dále klesla, jakmile byl vzorový text parafrázován nebo strojově přeložen.

Vlastnost psaníProč snižuje zdánlivou nepředvídatelnost dokumentuCo ukazují důkazy
Krátké odevzdané textyMéně textu ponechává méně prostoru pro přirozenou variaci, která odlišuje lidský rytmus od strojového rytmuSkóre u krátkých dokumentů kolísá více podle několika neobvyklých vět
Formulové nebo oborově specifické psaníKonvence žánru zvýhodňuje očekávané spojení slov před vynalézavým14,400 abstraktů z časopisů před ChatGPT (1980 až 2023) stále vyvolalo až 8% falešně pozitivních výsledků, abstrakty jednoho časopisu dosáhly 10.24%
Silně upravené nebo parafrázované návrhyFáze leštění vyhlazuje individuální nepravidelnosti, které detektor čte jako lidskéNezávislé srovnání 14 nástrojů zjistilo, že přesnost dále klesla po parafrázování nebo strojovém překladu
Citovaný nebo šablonový materiálCitovaný úryvek nese statistický podpis svého zdroje, nikoli autora, který jej citujeDetektory, které nevylučují citace, hodnotí okolní dokument podle vypůjčeného textu

Proč AI detektory chybně klasifikují nerodilé mluvčí angličtiny?

Špatně, a to výrazným rozdílem. To je závěr studie, která to jako první vyčíslila. Výzkumníci ze Stanfordu otestovali sedm široce používaných detektorů GPT na 91 esejích TOEFL od nerodilých mluvčích angličtiny a na 88 esejích žáků 8. ročníku v USA. Detektory téměř pokaždé správně přečetly eseje žáků 8. ročníku. Pokud šlo o eseje TOEFL, které napsali dospělí dostatečně plynně na to, aby mohli skládat zkoušku z angličtiny na úrovni postgraduálního studia, detektory v průměru vykázaly míru falešně pozitivních výsledků 61.3 percent. Osmdesát devět z 91 esejí bylo alespoň jedním ze sedmi detektorů označeno jako vygenerované GPT, 18 z těchto esejí bylo označeno všemi sedmi detektory.

Mechanismus je stejný jako ten, který řídí zbytek detekce: předvídatelná slovní zásoba a jednodušší stavba vět se jeví jako nízká perplexita, a nízká perplexita se jeví jako strojově vytvořená, bez ohledu na to, kdo drží pero. Autoři pracující v druhém jazyce se opírají o dobře zavedené formulace, protože právě tak vypadá plynulost v dalším jazyce, a přesně tento profil je detektor navržen tak, aby označil.

Autoři v této situaci nejsou dobře obslouženi radou, aby prostě psali přirozeněji, protože právě přirozené bylo to, co bylo označeno. Stránka TextPulse pro ESL akademické autory podrobněji rozebírá vzorce formulací, které za tímto rizikem stojí, včetně toho, co je mění, aniž by se změnil význam věty.

Toto nebyl ojedinělý případ. V prosinci 2025 byl zveřejněn nový benchmark, výslovně navržený k hodnocení zaujatosti v těchto detektorech. Zahrnoval více než 200,000 vzorků napříč více demografickými skupinami a jazyky. Přestože uplynuly dva roky od první studie Stanfordu a zahrnoval mnoho různých verzí modelů týchž detektorů, tento benchmark odhalil, že zaujatost vůči English language learners je stále přítomná.

U všech dodavatelů to neplatí. Vlastní technická dokumentace Pangram uvádí, že její klasifikátor není zaujatý vůči nerodilým mluvčím angličtiny. Výzkumníci z Chicago Booth toto tvrzení nezávisle netestovali, ale ukazuje to, že novější generace detektorů je budována s tímto problémem na paměti, nikoli tak, že by jej ignorovala.

Pokud chcete vidět, kde se nachází váš vlastní text dříve, než jej kdokoli jiný ohodnotí, bezplatná kontrola perplexity vám poskytne stejné základní číslo, které by detektor vypočítal, aniž byste cokoli nejprve odesílali instituci.

Kdo další je označován a proč

Největší zdokumentované riziko nesou lidé, pro něž angličtina není rodným jazykem, ale stejná statistická logika zachytí i jiné texty. Tým Weber-Wulff zjistil, že všech 14 nástrojů, které testovali, bylo méně přesných, když je použili na parafrázované texty, to popisuje významnou část akademického psaní, které prošlo korekturou, redakcí nebo zásahy vedoucího ještě předtím, než na něj někdo spustí detektor.

Nic z toho neznamená, že je toto číslo bezvýznamné, pouze že potřebuje potvrzení, než bude znamenat cokoli o konkrétní osobě. Pokud máte text, který působí jednotně, se podobnou délkou vět, podobným rytmem v celém průběhu, bude hodnocen jako více strojový bez ohledu na to, kdo jej napsal nebo proč. To lze ověřit přímo pomocí free burstiness checker místo toho, aby se to odhadovalo.

Druhá, méně diskutovaná skupina čelí souvisejícímu problému. Výzkumníci porovnali přibližně 60,000 příspěvků na Redditu, rozdělených mezi podmnožinu označenou jako pravděpodobně napsanou autistickými autory a obecný vzorek, a oba soubory prošli detektorem založeným na GPT-2. Obě skupiny zůstaly celkově pod 2 percent označení, ale podmnožina pravděpodobně autistických autorů byla označena výrazně častěji než obecný vzorek. Psaní, které se přiklání k doslovnému, opakujícímu se, těsně vzorovanému vyjadřování, což je zdokumentovaný rys některých autistických komunikačních stylů, vytváří přesně ten text s nízkou variabilitou, který je detektor navržen k zachycení.

Proč jisté skóre není jisté obvinění

Míra falešně pozitivních výsledků zní, jako by se vztahovala k pravděpodobnosti, že jeden student označený jako problémový je nevinný. Ale ne. Popisuje, jak test funguje pro všechny, kdo jej podstupují. A to jsou odlišné otázky s odlišnými odpověďmi, stejně jako u každého screeningového testu v medicíně nebo bezpečnosti.

Březnová statistická analýza z roku 2026 od výzkumníka z Griffith University zpřesňuje základní matematiku. Pokud se detekce AI chápe jako test aplikovaný na populaci studentských autorů, nikoli na jeden izolovaný dokument, objeví se kompromis, kdykoli nějaká část této populace píše způsobem, který se přirozeně překrývá s typickým výstupem AI, je blízký žánrové konvenci, je blízký rozsahu studenta píšícího v druhém jazyce, každý detektor se skutečnou schopností zachytit práci napsanou AI musí u části tohoto překrývajícího se podílu selhat. Nejde o tvrzení, že konkrétní detektor je špatně zkonstruovaný. Je to vlastnost testování rozmanité populace pomocí jediného dokumentu a bez dalších důkazů.

Vlastní ilustrační příklad článku ukazuje, jak velký tento problém je. Předpokládejme, že 10 percent studentské populace píše dostatečně blízko typickému výstupu AI a že detektor je nastaven tak, aby zachytil 80 percent skutečně AI napsané práce. Matematika pak vyžaduje průměrnou míru falešně pozitivních výsledků alespoň 7.5 percent napříč touto populací. To není chyba v konstrukci detektoru, je to přímý důsledek toho, jak moc se psaní této skupiny statisticky překrývá s tím, co je detekováno.

Převedeno na univerzitu s 10,000 studenty, už tato dolní hranice znamená přibližně 750 falešných označení napříč populací, což je matematický důsledek testování rozmanité populace proti jedinému dokumentu bez dalších důkazů, které by bylo možné zvážit. Autor článku výslovně uvádí, že tato konkrétní čísla jsou pouze ilustrativní, nikoli naměřená na skutečné instituci. Příklad ukazuje podobu problému, nikoli konkrétní předpověď pro kterýkoli jeden kampus.

Jak vypadá obhajitelná politika detekce AI

Yale už měla politiku, která údajně omezuje nástroje jako GPTZero, a to z důvodů, které tento článek popsal, tedy kvůli doložené míře falešně pozitivních výsledků a doložené zaujatosti vůči autorům, pro něž angličtina není rodným jazykem. Takže nejde ani tak o příběh jednoho smolařského studenta, jako spíše o to, že se nepostupovalo podle existujícího pravidla. Když politika skutečně prosazuje rozdíl mezi skóre a verdiktem, pak se skóre stává jedním z podkladů, nikoli verdiktem.

  • Chápejte skóre jako jeden vstup, nikdy ne jako jediný základ pro zjištění pochybení
  • Před použitím proti studentům jim sdělte zveřejněnou míru falešně pozitivních výsledků nástroje
  • U krátkých odevzdaných prací a u psaní v angličtině od nerodilých mluvčích, což jsou v obou případech zdokumentované slabiny, postupujte s mimořádnou opatrností
  • Zajistěte možnost odvolání, která nevyžaduje vyvrácení statistiky

Nic z toho není exotické. Je to blíže tomu, jak by měl být kdekoli jinde zacházeno s jakýmkoli jediným důkazem z forenzního šetření, užitečně, ověřitelně a nikdy ne jako s něčím, co samo o sobě stačí.

Pro jednotlivého autora platí tentýž princip ještě předtím, než nějaké skóre existuje, nikoli až poté. Jedno číslo, z jakéhokoli nástroje, je odhad, nikoli verdikt, a zacházet s ním jako s jistotou v obou směrech, tedy jako s bezpečným nebo přistiženým, klade na číslo větší nároky, než může unést.

Vlastní AI humanizer tool od TextPulse na základě téže logiky uvádí Human Score, tedy odhad vypočtený z vašeho vlastního textu, nikoli verdikt detektoru o něm, užitečný spíše jako signál toho, jak návrh v dané chvíli zní, než jako příslib toho, co řekne kterýkoli konkrétní detektor.

Otázka přesnosti se rozpadá na užší otázky, z nichž každá má vlastní stránku. Konkrétní důkazy o Turnitin's false positive rate a o ZeroGPT's accuracy jsou zpracovány samostatně. Pokud už bylo skóre použito proti vám, existují praktické texty o what to do when you are accused of using AI, o důkazech, které můžete shromáždit, abyste prove you did not use AI, a o writing an appeal letter, který odpovídá na skóre podle jeho vlastních pravidel.

Číslo v jakékoli zprávě se bude dál měnit, jak dodavatelé budou znovu trénovat své modely a výzkumníci je budou dál testovat na obtížnějších případech. Co by se však měnit nemělo, je návyk, který je pod tím, čtěte skóre jako jedno z několika měření, ptejte se, na jaké populaci bylo ověřeno, a ptejte se, co dodavatel neříká o případech, v nichž se stále mýlí.

XLinkedInFacebook

Často kladené otázky

Ano. Weber-Wulff a kolegové v porovnání z roku 2023 zjistili, že nástroje pro detekci AI jsou ,ani přesné, ani spolehlivé, a autoři, pro něž angličtina není rodným jazykem, čelí nejvyššímu doloženému riziku, přičemž jedna studie zjistila průměrnou míru falešně pozitivních výsledků nad 60 procent u esejí TOEFL. Jediné skóre samo o sobě nic nedokazuje, a proto by nikdy nemělo být jediným důkazem pro obvinění.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Zůstaňte v obraze o humanizaci AI

Získejte tipy na akademické psaní, detekci AI a humanizaci doručené do vaší schránky.

Žádný spam. Kdykoli se můžete odhlásit.