AI Detection

Pravděpodobnost tokenů a logaritmická věrohodnost v detekci AI

Perplexita přitahuje pozornost, ale aritmetika pod ní je pravděpodobnost tokenů: co vlastně obsahuje rozdělení modelu nad dalším slovem, proč detekční matematika pracuje v logaritmickém prostoru místo s hrubou pravděpodobností a jak se řada skóre pro jednotlivé tokeny stane jedním číslem.

6 min
Diagram illustrating token probability ai detection: a language model's next-token distribution turning into a log-likelihood score

Pokud se zeptáte detektoru, jak dospěl k danému skóre, většina jeho uživatelských rozhraní vám dá stejnou odpověď: odstavec, v němž jsou některá slova ztmavena více než jiná. Toto stínování není odhad. Pochází z čísla přiřazeného každému tokenu v pasáži, vypočteného dříve, než se detektor vůbec dotkne perplexity, burstiness nebo konečného procenta.

Je to pravděpodobnost tokenu a každá detekce pravděpodobnosti tokenu je na tom založena od samého základu. Jakékoli číslo metrik, které detektor uvede, včetně dvou, o nichž pojednáváme jinde na tomto webu, je jen aritmetika provedená nad řadou těchto čísel. Vrstva pod vrstvou, u níž většina vysvětlení končí, je místo, kde je třeba přemýšlet o tom, co token vlastně je, co znamená rozdělení modelu nad ním a proč se aritmetika provádí v logaritmickém prostoru, nikoli s hrubou pravděpodobností. Většina vysvětlení končí právě zde.

Nic z toho nemusí zůstat neprůhledné. Token, pravděpodobnostní rozdělení a logaritmus jsou běžné nástroje, nikoli proprietární tajemství, a tytéž tři myšlenky vysvětlují jak AI detektory ve skutečnosti fungují, od surového textu až po jediné číslo v reportu.

Detekce AI na základě pravděpodobnosti tokenu: Od rozdělení ke skóre

Detekce AI na základě pravděpodobnosti tokenu funguje ve třech fázích. Jazykový model přiřadí pravděpodobnost každému možnému následujícímu tokenu vzhledem k tomu, co mu předcházelo. Tyto pravděpodobnosti jednotlivých tokenů se převedou na logaritmy a sečtou přes pasáž, čímž se obejde numerický problém, na který naráží prosté násobení téměř okamžitě. Výsledný součet, zprůměrovaný a přepočtený, je to, co se nakonec objeví jako hodnota perplexity nebo co vstupuje do rozhodnutí klasifikátoru. Každá fáze je konkrétní, ověřitelný kus aritmetiky, nikoli černá skříňka.

Co token vlastně je

Token není slovo. Moderní jazykové modely rozdělují text na podslovní části pomocí algoritmu, jako je byte-pair encoding, takže běžné slovo jako 'the' je obvykle jeden token, méně běžné slovo jako 'perplexity' se rozdělí na dvě nebo tři části a neznámé jméno se může rozpadnout až na jednotlivé znaky. Úryvek běžné angličtiny se spolehlivě tokenizuje do většího počtu částí, než kolik má slov, a to je dobré vědět dříve, než začnete důvěřovat jakémukoli počtu slov, který vám nástroj vrátí.

Model nikdy nevidí slova tak, jak je vidí čtenář. Vidí posloupnost celých čísel, z nichž každé je indexem do pevné slovní zásoby, s níž byl model trénován. Vše, co token probability ai detection od tohoto bodu dál dělá, pracuje s touto posloupností celých čísel, ne s původním řetězcem písmen, což je jedním z důvodů, proč se může vnitřní fungování detektoru zdát odpojené od toho, jak člověk skutečně čte větu.

Rozdělení modelu nad dalším tokenem

V každé pozici v posloupnosti autoregresivní jazykový model nevytváří jednu predikci. Vytváří celé pravděpodobnostní rozdělení přes celou svou slovní zásobu, tedy desítky tisíc čísel, která sečtena dávají jednu, a řadí každý možný další token od nejpravděpodobnějšího po nejméně pravděpodobný podle všeho, co mu předcházelo. Když modelu zadáte frázi 'the results of the', rozloží většinu této pravděpodobnostní hmoty mezi několik pravděpodobných podstatných jmen, 'study,' 'experiment,' 'analysis,' zatímco něčemu jako 'marmalade' přiřadí zanedbatelný podíl.

Token, který se ve skutečném dokumentu objeví jako další, se v tomto pořadí umístí někde mezi nimi a pravděpodobnost, která mu byla přiřazena, je surový materiál, z něhož se odvozuje všechno ostatní. Model, který vytváří vlastní text, se může na toto rozdělení přímo spoléhat a opakovaně vybírat z jeho horní části. Detektor, který čte hotový text někoho jiného, se může až zpětně ptát, jakou pravděpodobnost by model přiřadil volbě, která byla skutečně učiněna.

Pravděpodobnost celé sekvence je součinem pravděpodobnosti každého tokenu za předpokladu všeho, co mu předcházelo, pokud tuto otázku pro každý token řetězíme napříč celým dokumentem pomocí standardního pravidla pro společnou pravděpodobnost, konečným výsledkem je jediné číslo popisující, jak očekávaný byl celý úryvek. Právě v tomto součinu se aritmetika začíná rozpadat, a proto existuje následující část.

Zlidštit vlastní práci

Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.

Začít zdarma

Proč log-likelihood nahrazuje surovou pravděpodobnost

Násobení pravděpodobností je matematicky správné a po několika desítkách tokenů prakticky nepoužitelné. Každá jednotlivá pravděpodobnost je zlomek menší než jedna, takže průběžný součin se s každým dalším tokenem zmenšuje, a to rychle. Po několika stech tokenech může surový součin klesnout tak hluboko pod nejmenší číslo, které může počítač reprezentovat, že se zaokrouhlí přesně na nulu, což je selhání označované jako underflow.

Jakmile se to stane, číslo nenese vůbec žádnou informaci. Dokument, který byl jen nepravděpodobný, a dokument, který byl krajně, chaoticky nepravděpodobný, se oba zhroutí na totožnou nulu, aniž by je bylo možné poté odlišit. Logaritmy to napravují, protože logaritmus součinu se rovná součtu logaritmů, což je identita ze základní algebry. Sčítání řetězce běžných záporných čísel nepodléhá underflow jako násobení řetězce malých zlomků a navíc je výpočetně levnější.

Délka úryvku (ilustrativně)Surová pravděpodobnost, průběžný součinSoučet log-pravděpodobností
12 tokenů při ilustrativní hodnotě 0.1 každý1 x 10 to the power of -12, stále reprezentovatelnépřibližně -27.6
350 tokenů při ilustrativní hodnotě 0.1 každý1 x 10 to the power of -350, underflows to exactly 0přibližně -805.9

Toto je zjednodušená ilustrace. Skutečné pravděpodobnosti pro jednotlivé tokeny se nesmírně liší, místo aby se držely na ploché hodnotě 0.1, ale směr problému je přesně správný. Jakmile se surový součin podteče na nulu, srovnání, které detektor skutečně potřebuje, tedy zda byl tento dokument více nebo méně očekávaný než onen, se stává nemožným. Součet logaritmů pravděpodobností tímto způsobem nikdy neselže. Zůstává přesným, běžným a srovnatelným číslem bez ohledu na to, jak dlouhý je úsek, což je skutečný důvod, proč se detekovatelnost měří v logaritmickém prostoru, nikoli v prostoru surových pravděpodobností.

Od skóre pro jednotlivé tokeny ke skóre detekce

Sečtení logaritmů pravděpodobností napříč úsekem vytváří celkovou logaritmickou věrohodnost dokumentu podle referenčního modelu. Vydělení počtem tokenů odstraní vliv délky a ponechá průměrnou logaritmickou věrohodnost na token, číslo, které je konečně srovnatelné mezi esejí o pěti stech slovech a kapitolou disertace o pěti tisících slovech. Když tento průměr negujete a exponenciujete, výsledkem je skóre perplexity, metrika, kterou tento soubor podrobně pokrývá v samostatném pohledu na co perplexity ve skutečnosti měří.

Stejné hodnoty pro jednotlivé věty, sledované kvůli variaci napříč dokumentem místo toho, aby byly zploštěny do jednoho průměru, jsou z čeho je burstiness tvořena, související, ale odlišný signál od perplexity. Obě vycházejí z totožných čísel pro jednotlivé tokeny popsaných výše. Jen nad nimi provádějí jinou aritmetiku.

Jednoduchý průměr není jediný způsob, jak tento surový materiál použít, a výzkum jej už dávno překročil. DetectGPT, publikovaný na ICML 2023 Mitchellovou, Lee, Khazatským, Manningem a Finnovou, vychází z jiné vlastnosti téže pravděpodobnostní funkce: text vzorkovaný z jazykového modelu má tendenci ležet v oblasti, kde drobné přeformulování způsobí pokles logaritmické pravděpodobnosti, nikoli její růst, což článek nazývá negativní zakřivení.

Místo trénování klasifikátoru nebo použití vodoznaku tato metoda narušuje úryvek, vytváří drobné variace v tom, jak je přeformulován, a poté každou variaci znovu ohodnocuje stejným modelem. Článek to porovnává s nejlepším zero-shot baseline a zjišťuje, že u textu vygenerovaného modelem s 20 miliardami parametrů tato metoda dosahuje AUROC 0.95, zatímco nejlepší zero-shot baseline dosahuje AUROC 0.81.

Totožné rozdělení, použité k vodoznaku místo detekce

Dosud bylo pravděpodobnostní rozdělení chápáno jako něco, co se čte až dodatečně. Lze na něj však sáhnout už v okamžiku generování, čímž se problém zcela obrací. Metoda z roku 2023 od Kirchenbauer, Geiping, Wen, Katz, Miers a Goldstein před každým vytvořeným slovem vybírá náhodně zvolený užší seznam povolených tokenů na základě hashe toho, co mu předcházelo, a jemně směruje vzorkování k tomuto užšímu seznamu. Toto zkreslení je pro čtenáře neviditelné a později je možné je obnovit statistickým testem na krátkém úseku textu, aniž je třeba přístup k původnímu modelu.

SynthID od Google DeepMind uvádí verzi této myšlenky do praxe, upravuje skóre pravděpodobnosti dalšího tokenu v době generování a je dnes dostupný v aplikaci Gemini a ve webovém rozhraní. OpenAI vybudovala srovnatelný systém a dosud jej neuvedla do provozu. Zprávy přisuzují toto rozhodnutí částečně průzkumu, v němž téměř 30 percent uživatelů ChatGPT uvedlo, že by je vodoznak vedl k menšímu používání produktu, spolu s obavami o to, jak dobře by vodoznak přežil parafrázování.

Zpráva detektoru ukáže stínované slovo nebo jediné procento a tam skončí, aniž by kdy ukázala rozdělení, z něhož to vše pochází. bezplatná kontrola perplexity od TextPulse spouští zjednodušenou verzi stejného hodnocení po jednotlivých tokenech na vašem vlastním návrhu, což je přímější způsob, jak zjistit, kde se úryvek nachází, než číst verdikt zprostředkovaně.

Dvě sousední stránky to zachycují. Zda se detektory stále opírají o burstiness se od roku 2023 změnilo a jak GPTZero převádí tyto stejné pravděpodobnosti na skóre je popsáno na samostatné stránce.

Je to součástí ostatních bezplatných nástrojů TextPulse, takže stejný návrh lze zkontrolovat z hlediska rytmu a struktury i předvídatelnosti na úrovni slov, aniž by bylo nutné kvůli tomu otevírat tucet samostatných panelů.

XLinkedInFacebook

Často kladené otázky

Detekce AI na základě pravděpodobnosti tokenů je vrstva pod každou jinou detekční metrikou. Jazykový model přiřazuje pravděpodobnost každému tokenu v sekvenci, po jednom slovním dílu, na základě všeho, co mu předcházelo. Perplexita, skóre klasifikátoru i procento v reportu jsou až následná aritmetika provedená nad touto sekvencí čísel, nikoli samostatné, nezávislé měření.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.