AI Detection

Co je perplexity v detekci AI?

Perplexity je číslo, které jazykový model vytváří, aby popsal, jak moc byl překvapen vašimi volbami slov. Tento příspěvek sleduje tuto metriku k jejímu vzniku v roce 1977, prochází vzorec a vysvětluje, proč stejný úryvek může získat odlišné skóre podle toho, který model jej čte.

Aktualizováno dne 6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

Vyhledávání pojmů perplexity a detekce AI dohromady vede u několika nejvýše umístěných výsledků k nesouvisejícímu produktu, k vyhledávači poháněnému AI, který se také jmenuje Perplexity. Metrika, kterou detektor skutečně uvádí, nemá s touto společností společného nic kromě tohoto slova. Pochází z výzkumu rozpoznávání řeči staršího o desítky let než GPTZero nebo tento vyhledávač a měří něco užšího než obojí, totiž jak moc je jazykový model překvapen slovy, která už jsou na stránce.

Co je tedy perplexity v detekci AI? Perplexity je skóre, které popisuje, jak dobře jazykový model předpověděl přesná slova v úryvku, a vzniká zprůměrováním vlastních pravděpodobností modelu a převodem výsledku na jediné číslo. Nízké skóre znamená, že model hádal správně. Vysoké skóre znamená, že byl stále překvapován.

Tato myšlenka je starší než jakýkoli detektor AI na trhu a sama o sobě neříká nic o tom, kdo dokument napsal. Jakmile je aritmetika za tímto číslem viditelná, skóre v reportu přestává vypadat jako verdikt a začíná vypadat jako to, čím skutečně je, tedy jako popis volby slov.

Free perplexity checker scoring word-level predictability: a repetitive paragraph scores 62 of 100 estimated word variation with a 51% type-token ratio
Nízká lexikální rozmanitost v perplexity checkeru, 44 jedinečných slov ze 87, takže stejná slova nesou příliš velkou část textu. Tato předvídatelnost je přesně to, co detektory založené na perplexity čtou.

Co je perplexity v detekci AI?

Perplexita je měřítko převzaté z modelování jazyka. Hodnotí, jak dobře model předpověděl konkrétní slova, která se v pasáži objevují, a tuto hodnotu uvádí jako jediné číslo. Detektory používají stejné měřítko na odevzdaný dokument: nízké číslo, tedy že odhady modelu se těsně shodovaly se skutečnými slovy, se čte jako známka strojového autorství, a vysoké číslo se čte jako známka lidského autorství. Samotný výpočet nečte argument dokumentu, jeho citace ani jeho tematiku. Čte pouze to, jak očekávané bylo každé slovo, jedno po druhém.

Detektory toto měřítko nevynalezly. Půjčily si nástroj, který systémy rozpoznávání řeči a strojového překladu používaly už po desetiletí k posuzování toho, jak dobře model předpověděl běžný jazyk, a znovu jej využily jako zástupný ukazatel autorství, k čemuž nebyl původně nikdy určen.

Nic z toho nemá nic společného s nesouvisejícím vyhledávačem zmíněným výše. Perplexita, kterou detektor uvádí, nikdy není společnost a nikdy se nepíše s velkým písmenem: je to prostá statistická vlastnost posloupnosti slov, nově vypočtená z jakéhokoli textu, který dostane.

Jak se perplexita ve skutečnosti počítá

Výpočet sahá dál do minulosti než jakýkoli produkt AI. Frederick Jelinek, Robert Mercer, Lalit Bahl a James Baker zavedli perplexitu v roce 1977, aby měřili, jak obtížný byl úkol rozpoznávání řeči pro statistický model, tedy desetiletí předtím, než někdo tento termín použil pro esej nebo laboratorní zprávu. Definice se od té doby nezměnila.

V každé pozici v dokumentu model vypíše pravděpodobnost pro slovo, které skutečně následuje, něco jako 0.72 pro běžný přechod nebo 0.03 pro neobvyklý. Perplexita zprůměruje logaritmy těchto pravděpodobností přes celou pasáž a poté tento průměr obrátí pomocí exponentu.

Exponent v there dělá víc, než se na první pohled zdá. Průměrování logaritmických pravděpodobností je přesně to, co děláme, když počítáme cross-entropy, což je informačně teoretický způsob, jak vyjádřit, kolik bitů potřebujete k zakódování sekvence vzhledem k predikcím, které provedl model. Perplexity však převádí počet bitů zpět na něco, čemu můžeme lépe rozumět, na efektivní počet možností, nikoli na abstraktní počet bitů.

To, co z této aritmetiky vyplývá, má čistý, téměř fyzikální význam. Model, který je pokaždé zcela jistý, dává perplexity 1, tedy spodní hranici škály. Model, který považuje každou pozici za rovnoměrný výběr mezi osmdesáti stejně pravděpodobnými slovy, dává perplexity 80.

Většina skutečných dokumentů se nachází někde mezi těmito dvěma extrémy a přesná poloha závisí na autorovi, tématu a na tom, který model text čte.

Zlidštit vlastní práci

Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.

Začít zdarma

Proč lidské psaní má tendenci dosahovat odlišných výsledků

Očekávání modelu jsou budována výhradně z toho, co předcházelo, jedno slovo po druhém. Po spojení 'the treatment group showed a statistically' je drtivá většina gramaticky správných pokračování 'significant', a model trénovaný na velkém objemu vědeckého psaní přiřadí tomuto slovu bez váhání vysokou pravděpodobnost. Lidský autor, který se dostane ke stejné frázi, může také zvolit 'significant', protože samotná fráze je pro tento žánr typická. Rozdíl se objevuje jinde, v podstatném jménu zvoleném o dvě věty později, ve vsuvce přidané v závorkách, v čísle uvedeném s neobvyklým počtem desetinných míst místo zaokrouhlené hodnoty.

Na tom není nic klamavého. Když se člověk píšící o skutečných datech snaží sáhnout po přesném čísle, přesném upřesnění, o něco užším slovu, sahá po věcech, které jsou pravdivé pro danou práci, nikoli pro daný žánr. A každá z těchto voleb stojí model o něco více překvapení. Překvapení je to, co má toto skóre sčítat.

Inference dělá více práce, než kolik může měření unést. Perplexity měří předvídatelnost přímo. Autorství odvozuje pouze tím, že předpokládá, že předvídatelné psaní je mezi lidmi vzácné a u modelů běžné, což je předpoklad, který je obvykle rozumný a občas chybný konkrétním, identifikovatelným způsobem, protože předvídatelnost je vlastnost, kterou text může mít z důvodů, jež nemají nic společného s tím, kdo jej napsal.

Proč může tentýž úryvek získat odlišné skóre

Skóre je také méně přenosné, než se zdá, protože se nikdy neměří ve vakuu. Perplexity se vždy počítá vůči tréninku jednoho konkrétního referenčního modelu a tato závislost vytváří problémy, které žádná jediná definice sama o sobě nemůže ukázat.

FaktorCo se měníProč se to děje
Který model provádí čteníTentýž odstavec může získat nízké skóre u jednoho modelu a vysoké u jinéhoPerplexity se vždy měří pouze vůči trénovacím datům jednoho modelu a různé modely byly trénovány na různých textech
Zda je úryvek široce reprodukovaný textSlavný historický dokument nebo definice z učebnice může získat nízké perplexity i tehdy, když do detektoru každé slovo napsal člověkPangram Labs uvádí jako příklad Deklaraci nezávislosti, je citována v trénovacích datech tak často, že model nepovažuje žádnou z jejích vět za překvapivou
Zda detektor vůbec může vidět pravděpodobnosti tokenůUzavřené komerční modely jako ChatGPT, Gemini a Claude nezpřístupňují pravděpodobnosti pro jednotlivá slova, které perplexity potřebujeDetektory odhadují skóre pomocí náhradního otevřeného modelu místo toho, aby počítaly perplexity vůči modelu, který text skutečně vytvořil

Nic z toho nečiní toto číslo bezvýznamným, pouze rizikovějším pro důvěru jako samostatný verdikt. Vlastní dokumentace GPTZero kdysi zveřejnila hrubé pravidlo, že perplexity nad 85 se jeví spíše jako lidská, ale práh jednoho dodavatele na jednom modelu nelze přenést na jiný nástroj měřený proti jinému modelu. Detektor, který uvádí jediné skóre, stlačuje všechny výše uvedené faktory do jedné hodnoty, aniž by řekl, který z nich se na tom podílel.

Co vám vlastně říká skóre perplexity

Komerční detektory spojují perplexity s rytmem na úrovni vět, trénováním klasifikátoru a několika dalšími signály ještě předtím, než na zprávě vytisknou jediné číslo. Úplnější obraz toho, jak AI detektory ve skutečnosti fungují, je popsán samostatně a vysvětluje, odkud zbytek tohoto čísla pochází.

Rytmus mezi větami je příbuzný, ale samostatný signál, který je samostatně popsán v burstiness checkeru, a sleduje, jak velká je v pasáži variabilita, nikoli jednotlivé slovo.

Žádné z těchto čísel nemůže prokázat, kdo dokument napsal, včetně odhadovaného Human Score, který TextPulse vypočítává z předloženého návrhu a který popisuje text, nikoli o něm vydává verdikt. Zjednodušená verze téže myšlenky, rozmanitost slovní zásoby spíše než plná pravděpodobnost modelu, pohání bezplatný perplexity checker na tomto webu, který stojí za to vyzkoušet na odstavci, jehož původ je už známý, dříve než budete důvěřovat tomu, co zpráva říká o textu někoho jiného.

Perplexity checker je vedle ostatních bezplatných nástrojů TextPulse, takže úplná kontrola návrhu, slovní zásoby, rytmu a všeho ostatního nevyžaduje mít současně otevřených tucet samostatných panelů.

Perplexita je jednou ze dvou statistik, o které se tyto systémy opírají. Druhou je burstiness, variace v délce a struktuře vět v rámci pasáže, a pod oběma stojí aritmetika pravděpodobnosti tokenů, která vůbec vytváří výsledné skóre.

Číslo ve zprávě je koncem dlouhého řetězce aritmetických operací, nikoli začátkem sporu o to, kdo něco napsal. Zajímavější otázka, jakmile aritmetika přestane být záhadná, zní, co konkrétně učinilo dokument překvapivým nebo předvídatelným, a to je otázka týkající se samotného psaní.

XLinkedInFacebook

Často kladené otázky

Ne. Perplexity v detekci AI je desetiletí staré statistické měření z jazykového modelování, které popisuje, jak předvídatelný je úsek textu pro model. Perplexity AI je nesouvisející společnost, která vytváří produkt pro vyhledávání poháněný AI. Tyto dvě věci sdílejí jen název a nic víc, a jejich záměna vám nepomůže porozumět zprávě detektoru.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Zůstaňte v obraze o humanizaci AI

Získejte tipy na akademické psaní, detekci AI a humanizaci doručené do vaší schránky.

Žádný spam. Kdykoli se můžete odhlásit.