Jsou AI detektory přesné? Falešně pozitivní výsledky a zkreslení
Dodavatelé uvádějí míru falešně pozitivních výsledků pod 1 procento. Nezávislí výzkumníci, kteří testovali stejné detektory na psaní nerodilých mluvčích angličtiny, zjistili míru nad 60 procent. Zde je to, co ukazují důkazy.
Turnitin tvrdí, že jejich míra falešně pozitivních výsledků je nižší než 1%. Skupina nezávislých výzkumníků testovala více detektorů na širším souboru vzorků psaní od nerodilých mluvčích angličtiny. Zjistili, že průměrná míra falešně pozitivních výsledků byla u stejného typu psaní vyšší než 60%. Obě čísla jsou skutečná, obě byla zveřejněna a obě se vztahují k detektorům, které prodávají na stejném trhu. Jsou AI detektory přesné? Záleží na tom, jakou populaci jste testovali, jaký detektor jste použili a jak jej váš dodavatel od začátku definoval.
Tento příspěvek nebude znovu vysvětlovat, jak detektor vypočítává toto skóre. Mechanismus, perplexity, pravděpodobnost tokenů, způsob, jakým je klasifikátor trénován, je podrobně popsán jinde, a pokud jste to ještě nečetli, stojí za to si to nejprve přečíst. Zde je důležité, co se děje, jakmile skóre existuje, jak často je chybné, u čího psaní je chybné nejčastěji a co falešné obvinění ve skutečnosti stojí někoho, kdo neudělal nic špatného.
Jsou AI detektory přesné?
Ne konzistentně a rozdíl mezi marketingovými tvrzeními a nezávislým testováním je dobře zdokumentován. Skupina výzkumníků vedená Deborou Weber-Wulff zveřejnila své závěry o 14 nástrojích pro detekci, včetně 12 bezplatných a dvou komerčních, které byly testovány na směsi lidského textu a textu z ChatGPT v roce 2023. Zjistili, že žádný z těchto nástrojů není přesný ani spolehlivý a že mají vestavěnou tendenci označovat strojový text jako lidský spíše než naopak. Dva z komerčních nástrojů zahrnutých do tohoto testu byly Turnitin a PlagiarismCheck. Všechny nástroje v tomto testu si vedly hůře, když byl text parafrázován.
Ale po dvou letech věci nestagnují. Pracovní studie z Booth School University of Chicago, od Briana Jabariane a Alexe Imase, podrobila třem nováčkům, Pangram, GPTZero a Originality.ai, a jednomu open source konkurentovi zkoušce na téměř 2.000 lidsky napsaných textech z blogů, zpráv, recenzí a fikce. Za kontrolovaných testovacích podmínek nejlepší nástroj v souboru nikdy neklesl pod 99.8 procentní přesnost a udržel svou míru falešně pozitivních výsledků na nízké úrovni. Open source model si vedl stejně dobře jako náhodný tipař. Věci se skutečně zlepšily. Tak trochu. Trochu.
Háček je však ve slově kontrolovaných. Benchmarkové pasáže jsou čisté, úplné a vytvořené za známých podmínek. Odevzdaná esej není spolehlivě ani jednou z těchto věcí. Výsledky v reálném světě nemusí být totožné s laboratorními výsledky, jak veřejně uvedl vlastní chief product officer společnosti Turnitin, i když jde o vzácné a užitečné přiznání ze strany dodavatele. Následující část klade čísla dodavatele vedle nezávislých čísel, aby byl rozdíl viditelný, nikoli pouze tvrzený.
Tvrzení dodavatelů versus nezávislé testování
Tabulka níže staví vedle sebe to, co o sobě tvrdí čtyři detektory, a to, co naměřili nezávislí výzkumníci, když nástroje testovali přímo. Čtěte společně dva prostřední sloupce, ne pouze sloupec dodavatele.
| Detektor | Údaj o přesnosti uváděný dodavatelem | Nezávisle zjištěno | Co dodavatel říká o falešně pozitivních výsledcích |
|---|---|---|---|
| Turnitin | Prahová hodnota jistoty 98% před označením, méně než 1% falešně pozitivních výsledků na úrovni dokumentu | Přibližně 80% přesnost, nejlepší z 12 nástrojů ve srovnání z roku 2023, na starší verzi nástroje | Méně než 1% na úrovni dokumentu nad prahem 20% textu napsaného AI, přibližně 4% na úrovni věty |
| GPTZero | 95.7% detekce textu AI při 1% míře falešně pozitivních výsledků v nezávislém benchmarku RAID | 96% přesnost na krátkých pasážích, míra falešně pozitivních výsledků pod 1% ve studii University of Chicago Booth z roku 2025 | Uvádí 1% míru falešně pozitivních výsledků v benchmarku RAID |
| Originality.ai | 99% přesnost, 0.5% míra falešně pozitivních výsledků, model Lite, 1.5%, model Turbo | Míra falešně pozitivních výsledků pod 1%, ale ve stejné studii Booth přehlédl 10% až 40% textu napsaného AI | Zveřejňuje samostatné údaje o falešně pozitivních výsledcích podle úrovně modelu |
| Pangram | Míry chyb, které jsou podle něj více než 38krát nižší než u konkurenčních nástrojů, uvádí, že nemá žádné zkreslení vůči autorům, pro něž angličtina není rodným jazykem | Přesnost nikdy neklesla pod 99.8%, míra falešně pozitivních výsledků blízko nule, ve studii Booth | Uvádí míry falešně pozitivních výsledků blízké nule napříč 10 textovými doménami a 8 jazykovými modely |
Vynikají dvě věci. Zaprvé, všechny údaje dodavatelů pocházejí z laboratoře, kterou kontroluje dodavatel, a údaje Booth pocházejí od výzkumníků, kteří nemají co prodávat. Zadruhé, Turnitin se v tomto prostředním sloupci vůbec neobjevuje, protože studie z roku 2025 jej netestovala. V tabulce je jeho nezávislý údaj založen na dřívějším srovnání z roku 2023, ale byl získán na starší verzi nástroje, proto na to při pohledu na tabulku jako na srovnání typu jako s jako pamatujte.
Jak přesná je detekce AI v Turnitin?
Turnitin nezveřejňuje jedno číslo přesnosti. Místo toho zveřejňuje práh a kompromis. Společnost uvedla, že dokument označí pouze tehdy, když je na 98 procent přesvědčena, že označená část byla napsána AI, a že právě tento práh udržuje míru falešně pozitivních výsledků na úrovni celého dokumentu pod 1 procento. Turnitin odhadl, že zachytí přibližně 85 procent textů s pomocí AI, a zbytek záměrně propouští dál, aby neriskoval chybné obvinění.
Skutečné procento falešně pozitivních výsledků, které Turnitin uvádí na úrovni vět, tedy tam, kde rozhraní zvýrazňuje konkrétní řádky místo celého dokumentu, je ve skutečnosti blíže 4 procentům. To je číslo, které stojí za to znát, pokud profesor udělá snímek obrazovky jediného označeného odstavce místo skóre za celý dokument, protože zvýrazněná věta nese podstatně vyšší pravděpodobnost chyby než skóre dokumentu vedle ní.
Za zmínku také stojí, že Turnitin tuto mezeru výslovně uznal. Zjistili, že jejich první výsledky z reálného provozu, zejména u kratších dokumentů, měly vyšší míru falešně pozitivních výsledků, než se očekávalo na základě laboratorních testů. Proto upravili minimální délku dokumentu, který se má hodnotit, z 150 na 300 slov. To je případ, kdy dodavatel upravuje vlastní produkt, protože zveřejněné číslo neobstálo mimo laboratoř, což vypovídá stejně mnoho jako jakákoli nezávislá studie.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Co falešně pozitivní výsledek studentovi skutečně stojí
To se stalo studentovi executive MBA na Yale's School of Management. Student byl obviněn z porušení pravidel, v tom nejdoslovnějším možném smyslu. Použitým detektorem byl GPTZero. Závěrečná zkouška studenta v kurzu financí byla označena asistentem výuky, který si myslel, že text je dlouhý a rozvláčný, s téměř dokonalou interpunkcí a gramatikou. A tento konkrétní profesor jej prohnal přes GPTZero, který odpovědi ohodnotil jako pravděpodobně generované AI.
Neuspěl v kurzu a byl na rok suspendován. Jeho žaloba, podaná u federálního soudu v únoru 2025, tvrdí, že vlastní politika Yale omezuje používání nástrojů, jako je GPTZero, právě z tohoto důvodu, tedy kvůli jeho zdokumentované míře falešně pozitivních výsledků vůči nerodilým mluvčím angličtiny, a že jej použil v rozporu s touto politikou. Jeho podání také uvádí, že GPTZero přiřadil 100 procentní skóre AI-generated akademickému textu bývalého univerzitního prezidenta Yale a děkana obchodní školy.
Soudce v květnu 2025 odmítl vydat předběžné soudní opatření. Případ dosud nebyl rozhodnut, jak píši. Žalobce, francouzský státní příslušník, tvrdí, že stejná známá zaujatost vůči nerodilým mluvčím angličtiny způsobila, že jeho text dopadl tak, jak dopadl. Na to se podíváme v následující části. O čem se nediskutuje, je cena, rok ztracený v rámci studijního programu, neprospívající známka, právní výdaje a několik měsíců boje o skóre místo získávání titulu. Míra falešně pozitivních výsledků 1 procento zní málo, dokud velká populace neudělá z tohoto problému něco konkrétního pro jednotlivce.
Proč AI detektory chybně klasifikují nerodilé mluvčí angličtiny?
Špatně, a to velmi výrazně. To je závěr studie, která to jako první vyčíslila. Výzkumníci ze Stanfordu otestovali sedm široce používaných detektorů GPT na 91 esejích TOEFL od nerodilých mluvčích angličtiny a na 88 esejích žáků osmé třídy v USA. Detektory téměř pokaždé správně přečetly eseje žáků osmé třídy. Pokud šlo o eseje TOEFL, které napsali dospělí dostatečně plynně na to, aby mohli skládat zkoušku z angličtiny na úrovni postgraduálního studia, detektory vykázaly v průměru míru falešně pozitivních výsledků 61.3 procenta. Osmdesát devět z 91 esejí bylo alespoň jedním ze sedmi detektorů označeno jako texty vygenerované GPT, 18 z těchto esejí bylo označeno všemi sedmi detektory.
Mechanismus je stejný jako ten, který řídí zbytek detekce: předvídatelná slovní zásoba a jednodušší stavba vět se jeví jako nízká perplexita a nízká perplexita se jeví jako strojově vytvořená, bez ohledu na to, kdo drží pero. Autoři pracující v druhém jazyce se opírají o dobře zavedené formulace, protože právě tak vypadá plynulost v dalším jazyce, a přesně tento profil má detektor zachytit.
Autorům v této situaci příliš nepomáhá rada, aby prostě psali přirozeněji, protože právě přirozenost byla to, co bylo označeno. Stránka TextPulse pro akademické autory ESL podrobněji rozebírá formulacové vzorce, které za tímto rizikem stojí, včetně toho, co je mění, aniž by se změnil význam věty.
Toto nebyl ojedinělý případ. V prosinci 2025 byl zveřejněn nový benchmark, výslovně navržený k vyhodnocení zkreslení v těchto detektorech. Zahrnoval více než 200,000 vzorků napříč více demografickými skupinami a jazyky. Přestože uplynuly dva roky od první studie Stanfordu a benchmark zahrnoval mnoho různých verzí modelů týchž detektorů, ukázal, že zkreslení vůči lidem učícím se angličtinu je stále přítomné.
To neplatí pro všechny dodavatele. Vlastní technická dokumentace Pangram uvádí, že její klasifikátor není zaujatý proti nerodilým mluvčím angličtiny. Výzkumníci z Chicago Booth toto tvrzení samostatně netestovali, ale ukazuje to, že novější generace detektorů se staví s ohledem na tento problém, nikoli tak, že by jej ignorovala.
Pokud chcete vidět, kde se vaše vlastní psaní nachází ještě předtím, než je kdokoli jiný ohodnotí, bezplatný kontrolor perplexity vám dá stejné základní číslo, které by detektor vypočítal, aniž byste cokoli nejprve odesílali instituci.
Kdo další je označován a proč
Uživatelé, pro které angličtina není rodným jazykem, nesou největší doložené riziko, ale stejná statistická logika zachytí i jiné texty. Tým Weber-Wulff zjistil, že všech 14 nástrojů, které testovali, bylo méně přesných, když je použili na parafrázované texty, to popisuje významnou část akademického psaní, které prošlo korekturou, redakcí nebo červenou tužkou vedoucího, než na něj kdokoli spustí detektor.
Nic z toho neznamená, že je toto číslo bezvýznamné, pouze to, že potřebuje potvrzení, než bude znamenat cokoli o konkrétní osobě. Pokud máte text, který působí jednotně, se podobnou délkou vět, podobným rytmem v celém průběhu, bude hodnocen jako více strojový bez ohledu na to, kdo jej napsal nebo proč. To lze ověřit přímo pomocí free burstiness checker místo toho, aby se to odhadovalo.
Jak vypadá obhajitelná politika detekce AI
Yale už měla politiku, která údajně omezuje nástroje jako GPTZero, a to z téměř stejných důvodů, jaké tento článek uvedl, doložená míra falešně pozitivních výsledků a doložená zaujatost vůči autorům, pro které angličtina není rodným jazykem. Není to tedy ani tak příběh jednoho smolaře, jako spíše případ toho, že se stávající pravidlo nedodržovalo. Když politika skutečně vymezuje rozdíl mezi skóre a verdiktem, pak se skóre stává jedním z podkladů, nikoli verdiktem.
- Chápejte skóre jako jeden z podkladů, nikdy ne jako jediný základ pro zjištění pochybení
- Před použitím proti studentům jim sdělte zveřejněnou míru falešně pozitivních výsledků daného nástroje
- U krátkých odevzdání a u textů autorů, pro které angličtina není rodným jazykem, uplatňujte zvýšenou opatrnost, v obou případech jde o doložená slabá místa
- Zaručte možnost odvolání, která nevyžaduje vyvrácení statistiky
Nic z toho není neobvyklé. Je to blíže tomu, jak by měl být kdekoli jinde zacházeno s jakýmkoli jednotlivým důkazem z forenzní analýzy, užitečný, ověřitelný a nikdy sám o sobě dostačující.
Pro jednotlivého autora platí tatáž zásada ještě předtím, než skóre vůbec existuje, nikoli až poté. Jedno číslo, z jakéhokoli nástroje, je odhad, nikoli verdikt, a zacházet s ním jako s jistotou v obou směrech, bezpečný nebo přistižený, klade na číslo větší nároky, než může unést.
Vlastní nástroj AI humanizer od TextPulse uvádí Human Score na základě stejné logiky: jde o odhad vypočtený z vašeho vlastního textu, nikoli o verdikt detektoru nad ním, užitečný jako signál toho, jak návrh v současnosti zní, spíše než jako příslib toho, co řekne kterýkoli konkrétní detektor.
Otázka přesnosti se rozpadá na užší otázky, z nichž každá má vlastní stránku. Míra, s jakou detektory označují lidské psaní je pokryta samostatně, stejně jako konkrétní důkazy o míře falešně pozitivních výsledků Turnitin a o přesnosti ZeroGPT. Pokud už proti vám bylo skóre použito, existují praktické texty o tom, co dělat, když jste obviněni z používání AI, o důkazech, které můžete shromáždit, abyste prokázali, že jste AI nepoužili, a o psaní odvolacího dopisu, který na skóre odpovídá podle jeho vlastních pravidel.
Číslo v jakékoli zprávě se bude nadále měnit, jak dodavatelé znovu trénují své modely a výzkumníci je dál testují na obtížnějších případech. To, co by se však měnit nemělo, je návyk, který je pod tím, čtěte skóre jako jedno měření mezi několika, ptejte se, na jaké populaci bylo ověřeno, a ptejte se, co dodavatel neříká o případech, v nichž se stále mýlí.
Frequently Asked Questions
Ano. Weber-Wulff a kolegové v porovnání z roku 2023 zjistili, že nástroje pro detekci AI jsou „ani přesné, ani spolehlivé“, a autoři, pro něž angličtina není mateřským jazykem, čelí nejvyššímu doloženému riziku, přičemž jedna studie zjistila průměrnou míru falešně pozitivních výsledků nad 60 procent u esejí TOEFL. Jediné skóre samo o sobě není důkazem ničeho, a proto by nikdy nemělo být jediným podkladem pro obvinění.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.