AI Detection

Jak fungují detektory AI? Perplexita, burstiness a pravděpodobnost tokenů

Detektory AI nerozpoznávají strojový text tak, jak jej rozpoznává čtenář. Měří, jak předvídatelný je váš text, a pak to převedou na skóre. Jakmile si to člověk uvědomí, dává větší smysl jak technologie, tak její selhání.

7 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

Vaše univerzita začala procházet odevzdané práce přes detektor AI a vrátila se zpráva s číslem, které jste nečekali. Než se ho pokusíte zpochybnit, je užitečné vědět, co toto číslo znamená. Jak fungují detektory AI? Nečtou strojově psaný text tak, jak ho čte člověk. Měří, jak předvídatelný je váš text pro jazykový model, a tuto předvídatelnost pak převádějí na skóre. V tomto procesu se nic nedívá na to, co máte na mysli, na váš argument ani na to, zda jste ten text skutečně napsali.

Strávil jsem roky vytvářením nástrojů, které text statisticky rozkládají, a jediná nejužitečnější věc, kterou je třeba u detekce pochopit, je tato: jde o měření typičnosti, nikoli původu. Jakmile si to člověk uvědomí, dávají jak technologie, tak její selhání mnohem větší smysl.

Co detektor ve skutečnosti měří

Detektor neví, kdo cokoli napsal. Má k dispozici jazykový model a hodnoticí funkci. Model čte váš text zleva doprava a v každém bodě vytváří pravděpodobnostní rozdělení nad tím, které slovo by mělo následovat. Když mu dáte slova "the results of the", zařadí nejvýše "study", o něco níže "experiment" a "marmalade" někde blízko nuly.

Detektor se tedy na váš dokument ptá jediné otázky: jak často tento text zvolil slovo, které model očekával? Psaní, které opakovaně končí u slov s vysokou pravděpodobností, působí strojově, protože přesně to dělá generátor textu. Model opakovaně vzorkuje z horní části vlastního rozdělení, a to po tisíce tokenů.

Proto je celá tato kategorie na vratší půdě, než naznačuje marketing. Detektor nenachází vodoznak ani otisk prstu. Všímá si, že vaše próza je statisticky nepřekvapivá, a nepřekvapivá próza má mnoho příčin kromě chatbota.

Perplexita: jak moc je model překvapen

Hlavní metrika se nazývá perplexity, což je jednodušší, než to zní. Vezměte pravděpodobnost, kterou model přiřadil každému slovu, které se skutečně objevilo, zprůměrujte logaritmy těchto pravděpodobností a výsledek umocněte. Výsledkem je jediné číslo popisující, jak moc byl model vaším dokumentem překvapen. Můžete zkontrolovat perplexity vlastního návrhu místo toho, abyste ji odhadovali.

Nízká perplexity znamená, že se text ubíral směrem, který model očekával. Vysoká perplexity znamená, že opakovaně volil obraty, které model neočekával. Lidské psaní má tendenci být výše, protože lidé sahají po neobvyklém konkrétním podstatném jménu, po nezvyklé konstrukci, po větě, která začíná nečekaným způsobem. Generovaný text má tendenci být níže, protože dekódovací proces je navržen tak, aby se přesně těmto krokům vyhýbal.

Porovnejte dva způsoby, jak začít část o metodách. "The results of the study were statistically significant" je posloupnost, kterou by téměř každý model předpověděl s vysokou jistotou, protože nenese žádnou neočekávanou informaci. "Two of the three cohorts drifted before week six, which we had not planned for" je mnohem méně předvídatelné, protože nese konkrétní, neobratnou informaci, kterou by nebylo možné odhadnout ze zbytku článku. Druhá věta stojí detektoru skutečné překvapení, a právě toto překvapení se zaznamenává jako lidské.

Burstiness, variabilita, nikoli průměr

Perplexity sama o sobě nestačí, protože dokument může v průměru vycházet na zcela rozumné číslo, a přitom být podezřele jednotný vnitřně. Důležitá je variace napříč textem, a právě tu měří burstiness, tedy to, jak moc se délka vět a perplexity na úrovni vět při psaní proměňují. burstiness checker vám tento rozptyl ukáže přímo.

Zrychlujeme, když si jsme jisti, a zpomalujeme, když se vyhýbáme jednoznačnosti, a tento rytmus se přenáší i do prózy. Lidé píší v dávkách. Odstavec může začít krátkou oznamovací větou o osmi slovech, přejít do čtyřiatřicetislovné věty, která nese tři vedlejší věty a vsuvku, a pak se vrátit k něčemu svižnému.

Výstup modelu to nedělá spolehlivě. Věty se shlukují kolem průměrné délky. Odstavce přicházejí v úhledných blocích. Každá část začíná zopakováním svého vlastního nadpisu. Čte se to plynule a dosahuje to špatného skóre, protože nízká variabilita napříč větami je jedním z nejsilnějších signálů, které má detektor k dispozici. Neprozrazuje to žádná jednotlivá věta. Prozrazuje to jednotnost.

SignálCo měříProč strojový text dosahuje nízkého skóre
PerplexityJak moc je model překvapen vašimi volbami slov, zprůměrováno přes celý dokumentDekódování záměrně vzorkuje z tokenů s vysokou pravděpodobností
BurstinessJak moc se délka vět a předvídatelnost v textu lišíVýstup se shlukuje kolem průměru místo toho, aby kolísal
Token probabilityPravděpodobnost na úrovni jednotlivých slov, z níž se vypočítávají další dva ukazateleDlouhé úseky jednotlivě nevýrazných voleb

Token probability a odkud skóre pochází

Obě tato čísla jsou postavena na třetím, na log-likelihood na úrovni tokenu, tedy na surovině, z níž se počítá vše ostatní. Některé nástroje vám jej zobrazují přímo a zvýrazňují úseky, kde byl váš text nejpředvídatelnější. Tato zvýraznění nejsou obviněním z konkrétních vět, ať už rozhraní naznačuje cokoli. Jsou to části, které nejvíce přispěly k číslu na úrovni dokumentu.

Výzkumné přístupy se posunuly za jednoduché prahové hodnoty. DetectGPT a jeho následovníci se dívají na zakřivení, mírně narušují váš text a zjišťují, zda pravděpodobnost klesá způsobem, který má tendenci vykazovat generovaný text. Jiné přístupy porovnávají tutéž pasáž pod dvěma různými modely a jako signál používají nesoulad.

Jeden důsledek je důležitý pro každého, kdo je hodnocen. Protože se metriky počítají vůči určitému referenčnímu modelu, je skóre vždy relativní k tomuto modelu. Dva detektory mohou číst tentýž odstavec a zcela se neshodnout, a ani jeden z nich nefunguje chybně. Odpovídají na tutéž otázku s různými referenčními body.

Druhý důsledek se uvádí méně často. Model může najít úryvek předvídatelný pouze tehdy, pokud se tento úryvek podobá tomu, na čem byl trénován, takže kvalita detekce se zhoršuje s tím, jak se zvětšuje rozdíl mezi referenčním modelem a čímkoli, co text vytvořilo. Novější generátory, neobvyklé disciplíny a jazyky jiné než angličtina tento rozdíl všechny zvětšují. Je to součást toho, proč přesnost měřená v kontrolovaném benchmarku jen zřídka obstojí při kontaktu se skutečným balíkem odevzdaných prací.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Co komerční detektory přidávají navíc

Nástroje, které instituce skutečně kupují, nepracují s učebnicovou perplexity. Turnitin, GPTZero, Originality a ostatní trénují řízené klasifikátory na rozsáhlých označených souborech lidského a strojového textu, přičemž vedle stylistických znaků používají i statistické rysy. To, co se klasifikátor naučí, je cokoli, co v jeho trénovacích datech odlišuje tyto dvě skupiny, což je užší a více historická věc než "AI writing" obecně.

Závislost na tréninku je tichý problém. Klasifikátor trénovaný převážně na jedné generaci výstupů modelu musí zobecnit na novější modely, na neznámé disciplíny a na autory, jejichž angličtina se nepodobá jeho trénovacímu rozdělení. Dodavatelé zveřejňují údaje o přesnosti ze svých vlastních hodnocení a nezávislé benchmarky se u stejných nástrojů pravidelně pohybují výrazně pod těmito čísly.

Jak číst skóre, aniž bychom je přeceňovali

Zpráva detektoru obvykle přichází jako procento a toto procento je běžně chybně vykládáno. Není to podíl vašeho dokumentu napsaný strojem. V závislosti na nástroji jde o míru jistoty klasifikátoru nebo o podíl vět, které překročily nějaký interní práh, a dodavatelé jsou často nejasní v tom, které z toho platí. Dvě zprávy, které obě ukazují šedesát procent, mohou znamenat velmi odlišné věci.

Je také užitečné vědět, co posouvá skóre z důvodů, které nemají nic společného s tím, kdo text napsal. Krátké dokumenty jsou šumovější, protože je v nich méně textu, na němž by se průměry mohly ustálit, a esej o pěti stech slovech se může výrazně změnit vlivem dvou nebo tří neobvyklých vět. Započítává se i citovaný materiál, pokud jej nástroj neodstraní, takže literární přehled plný blokových citací přebírá předvídatelnost toho, co cituje. Stejně se chová i technický úsek zatížený standardní terminologií.

Pokud se ocitnete na straně příjemce označení, užitečnou reakcí je důkaz, nikoli argument o metrice. Historie verzí, koncepty, poznámky a záznamy vyhledávání vypovídají o procesu a právě proces může komise pro posouzení pochybení skutečně hodnotit. Neexistuje žádný práh, na který by bylo možné ukázat a který by odděloval pečlivého autora od modelu.

Proč detektory označují text, který žádný model nevytvořil

Falešně pozitivní výsledky nejsou vzácnou poruchou. Přímo vyplývají z měření typičnosti. Jakýkoli text, který je skutečně předvídatelný, bude hodnocen jako předvídatelný, bez ohledu na to, kdo jej vytvořil.

Nejvíce jsou zasaženi autoři, pro něž není angličtina rodným jazykem. Výzkumníci ze Stanfordu zjistili, že detektory nesprávně klasifikovaly velkou část esejí od nerodilých mluvčích jako strojově generované, zatímco eseje rodilých mluvčích klasifikovaly správně. Důvod je mechanický, nikoli zlomyslný, autoři pracující v druhém jazyce mají tendenci spoléhat na zažité konstrukce a běžnější slovní zásobu. To je přesně profil nízké perplexity, a proto jsou ESL writers get flagged for writing carefully.

Stejný problém způsobují akademické konvence. Oddíl metod má být formulační. Právní psaní, technická dokumentace a klinické zprávy všechny zvýhodňují standardní formulaci před vynalézavou. Intenzivní editace to dále zesiluje, protože uhlazení konceptu obvykle znamená odstranění nepravidelností, které nesly váš statistický podpis.

Instituce si toho všimly. Vanderbilt deaktivoval funkci detekce AI v Turnitin místo toho, aby jednal na základě skóre, která nemohl ověřit, a jiné univerzity omezily, jak mohou být tato čísla používána v řízeních o akademickém pochybení. Berte skóre detektoru jako jeden slabý důkaz, ne jako verdikt.

Co to znamená pro vaše vlastní psaní

Praktická doporučení, která vyplývají z mechanismu, nejsou nijak exotická a nic z nich nespočívá v obcházení systému. Záměrně střídejte délku vět, protože právě uniformita se zaznamenává. Zachovejte konkrétní detail, skutečné číslo, skutečné omezení, věc, která se pokazila v šestém týdnu. Obecná kompetence je to, co se hodnotí jako strojově vytvořené, a konkrétnost je zároveň lepší psaní i silnější signál.

Zachovejte si také vlastní idiom. Pokud máte svůj způsob vyjadřování, ponechte jej. Instinkt uhladit návrh tak dlouho, až zní jako každý jiný text v oboru, je tentýž instinkt, který snižuje vaši perplexity.

Jedna věc, které je třeba se vyhnout, některé nástroje záměrně zavádějí gramatické chyby, aby zvýšily perplexity. Na metrice to funguje a pro cokoli hodnoceného nebo podléhajícího recenznímu řízení je to velmi špatný nápad, protože vyměňujete podezření za jistotu. Cílem je psaní, které působí jako vaše, ne psaní, které bylo úmyslně poškozeno. To je celý rozdíl mezi přepisem pro lidského čtenáře a poškozením textu s cílem oklamat hodnoticí nástroj.

Pokud chcete tato čísla vidět u vlastního návrhu, místo abyste brali černou skříňku za bernou minci, základní měření nejsou tajná. Bezplatné nástroje pro analýzu textu vám ukážou, kde se vaše próza nachází, a sami se můžete rozhodnout, zda jsou ploché pasáže stylistickým problémem, který stojí za opravu.

Frequently Asked Questions

Ano, a předvídatelně. Detektory měří, jak statisticky předvídatelný je text, ne kdo jej napsal, takže jakékoli skutečně formulové psaní získává skóre jako strojově vytvořené. Nezávislé benchmarky konzistentně uvádějí přesnost nižší, než tvrdí poskytovatelé, a několik univerzit omezilo, jak lze tato skóre používat.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Jak fungují detektory AI? | TextPulse.ai