AI Detection

Token valószínűség és log-likelihood az AI detektálásban

A perplexity kapja a figyelmet, de az alatta álló aritmetika a token valószínűség: mit tartalmaz valójában a modell következő szóra vonatkozó eloszlása, miért logaritmikus térben fut a detektálási matematika a nyers valószínűség helyett, és hogyan lesz a tokenenkénti pontszámok sorozatából egyetlen szám.

Frissítve ekkor 6 min
Diagram illustrating token probability ai detection: a language model's next-token distribution turning into a log-likelihood score

Ha megkérdez egy detektort, hogyan jutott ahhoz a pontszámhoz, a felhasználói felületek többsége ugyanazt a választ adja: egy bekezdést, amelyben néhány szó sötétebb árnyalatú, mint a többi. Az árnyalás nem találgatás. Egy olyan számból származik, amely a szövegrész minden tokenjéhez hozzá van rendelve, és amelyet még azelőtt számítanak ki, hogy a detektor egyáltalán hozzáérne a perplexity, a burstiness vagy a végső százalék értékéhez.

Ez egy tokenvalószínűség, és minden tokenvalószínűségre épülő ai detection erre támaszkodik, a legelső alapoktól kezdve. Bármennyi mérőszámot is közöl egy detektor, beleértve azt a kettőt is, amelyet ezen az oldalon máshol tárgyalunk, mindössze ezeknek a számoknak egy sorozatán végzett aritmetika. Az a réteg, amely alatt az a réteg van, ahol a legtöbb magyarázat megáll, az a pont, ahol azt kell átgondolni, mi is valójában egy token, mit jelent a modell eloszlása fölötte, és miért logaritmikus térben fut az aritmetika a nyers valószínűség helyett. A legtöbb magyarázat itt megáll.

Ennek semminek sem kell homályosnak maradnia. Egy token, egy valószínűségi eloszlás és egy logaritmus hétköznapi eszközök, nem tulajdonosi titkok, és ugyanaz a három gondolat magyarázza hogyan működnek valójában az AI detektorok, a nyers szövegtől egészen a jelentésben szereplő egyetlen számig.

Tokenvalószínűség alapú ai detection: az eloszlástól a pontszámig

A tokenvalószínűség alapú ai detection három szakaszban működik. Egy nyelvi modell valószínűséget rendel minden lehetséges következő tokenhez az előzmények alapján. Ezeket tokenenkénti valószínűségeket logaritmusokká alakítják, majd összeadják a szövegrészben, ami megkerüli azt a numerikus problémát, amelybe a nyers szorzás szinte azonnal beleütközik. Az így kapott összeg, átlagolva és újraskálázva, az, ami végül perplexity értékként jelenik meg, vagy egy osztályozó döntését táplálja. Minden szakasz egy konkrét, ellenőrizhető aritmetikai művelet, nem fekete doboz.

Mi is valójában egy token

Egy token nem egy szó. A modern nyelvi modellek a szöveget byte-pair encodinghoz hasonló algoritmussal szubszó-egységekre bontják, ezért egy gyakori szó, mint a 'the', általában egy token, egy ritkább szó, mint a 'perplexity', két vagy három részre bomlik, és egy ismeretlen név akár egyes karakterekre is szétaprózódhat. Egy közönséges angol szövegrész megbízhatóan több tokenre tagolódik, mint ahány szóból áll, és ezt érdemes tudni, mielőtt bármilyen szószámnak hinnénk, amelyet egy eszköz visszajelez.

A modell soha nem úgy látja a szavakat, ahogyan egy olvasó. Egy egész számokból álló sorozatot lát, ahol minden szám egy index egy rögzített szókészletben, amelyen a modellt tanították. Minden, amit a token probability ai detection ettől a ponttól kezdve végez, ezen az egész számsorozaton működik, nem az eredeti betűsorozaton, és ez részben magyarázza, miért tűnhet egy detektor belső működése elszakadtnak attól, ahogyan egy ember valójában egy mondatot olvas.

A modell eloszlása a következő token felett

Egy sorozat minden pozíciójában egy autoregresszív nyelvi modell nem egyetlen előrejelzést ad ki. A teljes szókészletére kiterjedő teljes valószínűségi eloszlást adja ki, több tízezer számot, amelyek összege egy, és amelyek a korábban elhangzottak alapján a legvalószínűbbtől a legkevésbé valószínűig rangsorolják az összes lehetséges következő tokent. Ha a modellnek azt a kifejezést adjuk, hogy 'the results of the', akkor a valószínűségi tömeg nagy részét néhány hihető főnév között osztja szét, például 'study,' 'experiment,' 'analysis,' miközben egy olyan szónak, mint a 'marmalade,' elenyészően kis részt rendel.

A token, amely egy valódi dokumentumban ténylegesen ezután megjelenik, valahol ebben a rangsorban helyezkedik el, és a hozzá rendelt valószínűség az az alapanyag, amelyből minden más felépül. Egy modell, amely a saját szövegét állítja elő, közvetlenül támaszkodhat erre az eloszlásra, és ismételten a lista elejéről választhat. Egy detektor, amely valaki más kész szövegét olvassa, utólag csak azt kérdezheti meg, hogy a modell mekkora valószínűséget rendelt volna ahhoz a választáshoz, amely ténylegesen megszületett.

Egy teljes szekvencia valószínűsége az egyes tokenek valószínűségének szorzata, feltéve mindazt, ami előttük áll; ha ezt a tokenenkénti kérdést egy egész dokumentumon végigvezetjük a közös valószínűségre vonatkozó standard szabály segítségével, a végeredmény egyetlen szám lesz, amely azt írja le, mennyire volt várható az egész szövegrész. Ez a szorzat az a pont, ahol az aritmetika elkezd szétesni, és ezért létezik a következő szakasz.

Emberibbé tenni saját dolgozatát

Alakítsa át az AI által támogatott szövegét úgy, hogy emberinek hangozzon, anélkül hogy fontos szavakat vagy hivatkozásokat érintene.

Kezdje el ingyen

Miért váltja fel a log-likelihood a nyers valószínűséget

A valószínűségek összeszorzása matematikailag helyes, de néhány tucat token után gyakorlatilag használhatatlan. Minden egyes valószínűség egy egynél kisebb tört, ezért a folyamatban lévő szorzat minden alkalommal zsugorodik, amikor egy újabb tokent megszorozunk vele, és gyorsan zsugorodik. Néhány száz token után a nyers szorzat annyira a számítógép által ábrázolható legkisebb szám alá eshet, hogy pontosan nullára kerekedik le, ezt a hibamódot underflow-nak nevezik.

Amint ez megtörténik, a szám teljesen elveszíti az információtartalmát. Egy dokumentum, amely csupán valószínűtlen volt, és egy dokumentum, amely vadul, kaotikusan valószínűtlen volt, ugyanarra a nullára omlik össze, utólag semmilyen módon nem lehet megkülönböztetni őket. A logaritmusok ezt azért oldják meg, mert egy szorzat logaritmusa megegyezik a logaritmusok összegével, ami az elemi algebrából ismert azonosság. A szokásos negatív számok sorozatának összeadása nem szenved underflow-tól úgy, ahogyan a kis törtek sorozatának szorzása igen, ráadásul számítás szempontjából is olcsóbb.

Szövegrész hossza, szemléltetőNyers valószínűség, folyamatban lévő szorzatA log-valószínűségek összege
12 token, szemléltető 0.1 mindegyik1 x 10 a -12. hatványon, még ábrázolhatónagyjából -27.6
350 token, szemléltető 0.1 mindegyik1 x 10 a -350. hatványon, pontosan 0-ra underflow-ziknagyjából -805.9

Ez egy leegyszerűsített szemléltetés. A valós per-token valószínűségek rendkívüli mértékben eltérnek egymástól, nem pedig egy lapos 0.1 körül állnak, de a probléma iránya pontosan helyes. Amint egy nyers szorzat aláfolyik a nullának, az az összehasonlítás, amelyre egy detektornak ténylegesen szüksége van, vagyis hogy ez a dokumentum inkább várt volt-e, mint az a másik, lehetetlenné válik. A log-valószínűségek összege soha nem hibásodik meg ilyen módon. Pontos, hétköznapi, összehasonlítható szám marad, bármilyen hosszú is a szövegrész, és ez az a valódi ok, amiért a detektálhatóságot log-térben mérik, nem pedig nyers valószínűségi térben.

A per-token pontszámoktól a detektálási pontszámig

A log-valószínűségek összegzése egy szövegrészben a dokumentum teljes log-valószínűségét adja az referencia modell alatt. A tokenek számával való osztás eltávolítja a hossz hatását, és megadja az átlagos log-valószínűséget tokenenként, egy olyan számot, amely végre összehasonlítható egy ötszáz szavas esszé és egy ötezer szavas disszertációfejezet között. Ha ezt az átlagot negáljuk és exponenciáljuk, akkor a perplexity pontszámot kapjuk, egy metrikát, amelyet ez a csoport teljes egészében tárgyal egy külön áttekintésben arról, hogy mit mér valójában a perplexity.

Ugyanezek a mondatonkénti értékek, ha a dokumentumon belüli változékonyságot követjük nyomon velük, ahelyett hogy egyetlen átlagba lapítanánk őket, azok, amelyekből a burstiness felépül, egy perplexity-hez kapcsolódó, de attól különálló jel. Mindkettő ugyanazokból a fent leírt per-token számokból indul ki. Egyszerűen más aritmetikát alkalmaznak rájuk.

Az egyszerű átlag nem az egyetlen módja ennek a nyers anyagnak a felhasználására, és a kutatás már jóval túllépett rajta. A DetectGPT, amelyet Mitchell, Lee, Khazatsky, Manning és Finn publikált az ICML 2023 konferencián, ugyanannak a valószínűségfüggvénynek egy másik tulajdonságából indul ki: a nyelvi modellből mintavételezett szöveg hajlamos olyan régióban elhelyezkedni, ahol az apró átfogalmazások a log-valószínűség csökkenését, nem pedig növekedését okozzák, ezt a mintázatot a tanulmány negatív görbületnek nevezi.

Nem osztályozó tanításával vagy vízjel használatával, ez a módszer megzavar egy szövegrészt, apró eltéréseket hozva létre abban, hogyan fogalmazzák át, majd minden változatot ugyanazzal a modellel újrapontoz. A tanulmány ezt a legjobb zero-shot baseline-hoz hasonlítja, és azt találja, hogy egy 20 milliárd paraméteres modell által generált szövegen ez a módszer 0.95 AUROC értéket ér el, míg a legjobb zero-shot baseline 0.81 AUROC értéket ér el.

Ugyanaz az eloszlás, vízjelezésre használva, nem észlelésre

Eddig minden az eloszlást olyasvalaminek kezelte, amit utólag olvasunk le. A generálás pillanatában is hozzá lehet nyúlni, ami teljesen megfordítja a problémát. Egy 2023-as módszer, amelyet Kirchenbauer, Geiping, Wen, Katz, Miers és Goldstein dolgozott ki, minden szó előállítása előtt egy véletlenszerűen kiválasztott, engedélyezett tokenekből álló rövid listát választ ki, az azt megelőző szöveg hash-e alapján, majd finoman e rövid lista felé tereli a mintavételezést. Az elfogultság az olvasó számára láthatatlan, és később egy rövid szövegrész statisztikai tesztjével visszanyerhető, az eredeti modellhez való hozzáférés nélkül.

A Google DeepMind SynthID rendszere ennek az ötletnek egy változatát éles környezetben használja: a generálás során módosítja a következő token valószínűségi pontszámait, és ma már él a Gemini alkalmazásban és webes felületén. OpenAI egy hasonló rendszert épített, de nem adta ki. A beszámolók szerint a döntés részben egy felmérésnek tulajdonítható, amelyben a ChatGPT felhasználóinak közel 30 percente azt mondta, hogy a vízjelezés miatt kevésbé használná a terméket, valamint annak az aggodalomnak, hogy egy watermark mennyire maradna meg parafrazálás után.

Egy detektor jelentése egy árnyalt szóval vagy egyetlen százalékkal zárul, és itt megáll, anélkül hogy valaha is megmutatná azt az eloszlást, amelyből mindez származik. A TextPulse ingyenes perplexity ellenőrzője ugyanennek a tokenenkénti pontozásnak egy leegyszerűsített változatát futtatja a saját vázlatán, ami közvetlenebb módja annak, hogy lássa, hol helyezkedik el egy szövegrész, mint egy ítéletet közvetve olvasni.

Két szomszédos oldal is ezt veszi figyelembe. Az, hogy az detektorok még mindig a burstiness-re támaszkodnak-e 2023 óta megváltozott, és az, hogy GPTZero miként alakítja ezeket ugyanazokat a valószínűségeket pontszámmá külön oldalon van leírva.

Ez a TextPulse többi ingyenes eszköze mellett található, így ugyanazt a vázlatot a ritmus és a szerkezet, valamint a szószintű kiszámíthatóság szempontjából is ellenőrizni lehet, anélkül hogy ehhez egy tucat külön lapot kellene megnyitni.

XLinkedInFacebook

Gyakran ismételt kérdések

A token valószínűség ai detection minden más detektálási mérőszám alaprétege. Egy nyelvi modell egy szekvencia minden tokenjéhez rendel egy valószínűséget, egyszerre egy szóelemet, mindaz alapján, ami előtte állt. A perplexity, a klasszifikátor pontszámai és a jelentésen szereplő százalék mind e számok sorozatán végzett utólagos aritmetika, nem pedig különálló, független mérés.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Maradjon naprakész az AI humanizálásról

Kapjon tippeket az akadémiai íráshoz, az AI-észleléshez és a humanizáláshoz közvetlenül az e-mail fiókjába.

Nincs spam. Bármikor leiratkozhat.