AI Detection

Ce este perplexity în detectarea AI?

Perplexity este numărul pe care un model de limbaj îl produce pentru a descrie cât de surprins a fost de alegerile tale de cuvinte. Acest articol urmărește metrica până la originea ei din 1977, parcurge formula și explică de ce același pasaj poate obține scoruri diferite în funcție de modelul care îl citește.

6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

Căutați împreună perplexity și detectarea AI, iar mai multe dintre rezultatele de top se dovedesc a fi despre un produs fără legătură: un motor de căutare bazat pe AI care, întâmplător, poartă și numele Perplexity. Metrica pe care o raportează efectiv un detector nu are nimic în comun cu acea companie, în afară de cuvânt. Ea provine din cercetarea în recunoașterea vorbirii de acum zeci de ani, mai veche decât GPTZero sau motorul de căutare, și măsoară ceva mai restrâns decât oricare dintre ele: cât de surprins este un model de limbaj de cuvintele deja aflate pe pagină.

Așadar, ce este perplexity în detectarea AI? Perplexity este un scor care descrie cât de bine a prezis un model de limbaj cuvintele exacte dintr-un pasaj, obținut prin mediarea propriilor probabilități ale modelului și convertirea rezultatului într-un singur număr. Un scor mic înseamnă că modelul a continuat să ghicească corect. Un scor mare înseamnă că a continuat să fie surprins.

Ideea este mai veche decât orice detector AI de pe piață și, de una singură, nu spune nimic despre cine a scris un document. Odată ce aritmetica din spatele numărului devine vizibilă, un scor dintr-un raport încetează să mai pară un verdict și începe să arate a ceea ce este de fapt: o descriere a alegerii cuvintelor.

Ce este perplexity în detectarea AI?

Perplexity este o măsură împrumutată din modelarea limbajului. Ea evaluează cât de bine a prezis un model cuvintele specifice care apar într-un pasaj și raportează acest scor ca un singur număr. Detectorii aplică aceeași măsură unui document trimis: un număr mic, care înseamnă că presupunerile modelului s-au potrivit îndeaproape cu cuvintele reale, este citit ca un indiciu al autoratului mașinii, iar un număr mare este citit ca un indiciu al autoratului uman. Nimic din calcul nu citește argumentul documentului, citările sale sau subiectul său. Citește doar cât de așteptat a fost fiecare cuvânt, unul câte unul.

Detectorii nu au inventat această măsură. Ei au împrumutat un instrument pe care sistemele de recunoaștere a vorbirii și de traducere automată îl foloseau deja de decenii pentru a evalua cât de bine a prezis un model limbajul obișnuit și l-au reutilizat ca proxy pentru autorat, o sarcină pentru care nu a fost construit inițial.

Nimic din toate acestea nu are legătură cu motorul de căutare fără legătură menționat mai devreme. Perplexitatea raportată de un detector nu este niciodată o companie și nu se scrie niciodată cu majusculă: este o proprietate statistică simplă a unei secvențe de cuvinte, calculată din nou, de la zero, pentru orice text i se oferă.

Cum se calculează de fapt perplexitatea

Calculul își are originea cu mult înaintea oricărui produs AI. Frederick Jelinek, Robert Mercer, Lalit Bahl și James Baker au introdus perplexitatea în 1977 pentru a măsura cât de dificilă era o sarcină de recunoaștere a vorbirii pentru un model statistic, cu decenii înainte ca cineva să aplice termenul la un eseu sau la un raport de laborator. Definiția nu s-a schimbat de atunci.

La fiecare poziție dintr-un document, modelul produce o probabilitate pentru cuvântul care urmează efectiv, ceva de genul 0.72 pentru o tranziție obișnuită sau 0.03 pentru una neobișnuită. Perplexitatea face media logaritmilor acestor probabilități pe întregul pasaj, apoi inversează media cu ajutorul unui exponent.

Exponentul din there's face mai mult decât pare. Media probabilităților logaritmice este exact ceea ce facem când calculăm entropia încrucișată, care este modul teoretic informațional de a spune câți biți sunt necesari pentru a codifica o secvență, având în vedere predicțiile făcute de un model. Dar perplexitatea transformă numărul de biți înapoi în ceva ce putem înțelege mai bine, un număr efectiv de opțiuni, nu un număr abstract de biți.

Ce rămâne după această aritmetică are o interpretare clară, aproape fizică. Un model care este complet sigur de fiecare dată produce o perplexitate de 1, limita inferioară a scalei. Un model care tratează fiecare poziție ca pe o alegere la întâmplare între optzeci de cuvinte la fel de probabile produce o perplexitate de 80.

Majoritatea documentelor reale se situează undeva între aceste două extreme, iar locul exact depinde de autor, de subiect și de modelul care face lectura.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

De ce scrierea umană tinde să obțină scoruri diferite

Modelul își construiește așteptările exclusiv din ceea ce a precedat, un cuvânt pe rând. După expresia „the treatment group showed a statistically”, marea majoritate a continuărilor bine formate sunt „significant”, iar un model antrenat pe un volum mare de scriere științifică atribuie acelui cuvânt o probabilitate ridicată, fără ezitare. Un autor uman care ajunge la aceeași expresie ar putea alege tot „significant”, pentru că expresia în sine este un element fix al genului. Diferența apare în altă parte, în substantivul ales două propoziții mai târziu, în paranteza adăugată ca observație, în numărul raportat cu o zecimală neobișnuită, în locul uneia rotunde.

Nimic din toate acestea nu este un artificiu. Când o persoană care scrie despre date reale încearcă să ajungă la numărul exact, la calificativul precis, la cuvântul puțin mai restrâns, ea caută lucruri care sunt adevărate despre lucrare, nu despre gen. Iar fiecare dintre aceste alegeri îi costă modelului puțin mai multă surpriză. Surpriza este ceea ce scorul este construit să însumeze.

Inferența face mai mult decât poate susține măsurarea. Perplexity măsoară direct predictibilitatea. Ea deduce autoratul doar presupunând că scrierea predictibilă este rară la oameni și frecventă la modele, o presupunere care este de obicei rezonabilă și, ocazional, greșită într-un mod specific, identificabil, deoarece predictibilitatea este o proprietate pe care textul o poate avea din motive care nu au nicio legătură cu cine l-a tastat.

De ce același pasaj poate obține scoruri diferite

Scorul este, de asemenea, mai puțin portabil decât pare, deoarece nu este niciodată măsurat în vid. Perplexity este calculată întotdeauna în raport cu antrenarea unui anumit model de referință, iar această dependență creează probleme pe care nicio definiție singulară nu le poate arăta de una singură.

FactorCe se schimbăDe ce se întâmplă
Ce model face lecturaAcelași paragraf poate obține un scor mic la un model și un scor mare la altulPerplexity este măsurată întotdeauna doar în raport cu datele de antrenare ale unui singur model, iar modele diferite au fost antrenate pe texte diferite
Dacă pasajul este text reprodus pe scară largăUn document istoric celebru sau o definiție dintr-un manual poate obține un scor de perplexity scăzut chiar și atunci când o persoană a tastat fiecare cuvânt în detectorPangram Labs indică Declarația de Independență ca exemplu, aceasta este citată atât de des în datele de antrenare încât un model găsește fiecare propoziție a ei lipsită de surpriză
Dacă detectorul poate vedea deloc probabilitățile tokenurilorModelele comerciale închise, precum ChatGPT, Gemini și Claude, nu expun probabilitățile pe cuvânt de care are nevoie perplexityDetectoarele aproximează scorul cu un model deschis de substituție, în loc să calculeze perplexity în raport cu modelul care a produs efectiv textul

Niciuna dintre aceste situații nu face numărul lipsit de sens, ci doar mai riscant de considerat de unul singur drept verdict. Documentația proprie a GPTZero a publicat cândva o regulă empirică aproximativă, un scor de perplexity peste 85 fiind interpretat ca mai probabil uman, dar pragul unui singur furnizor pe un model nu se transferă la un instrument diferit măsurat în raport cu altul. Un detector care raportează un singur scor comprimă toți factorii de mai sus într-o singură cifră, fără să spună care dintre ei a avut rolul decisiv.

Ce îți spune de fapt un scor de perplexity

Detectoarele comerciale combină perplexity cu tipare la nivel de propoziție, antrenarea clasificatorului și mai multe alte semnale înainte de a afișa vreodată o singură cifră într-un raport. Imaginea mai completă a modului în care funcționează de fapt detectoarele AI este tratată separat, iar aceasta explică de unde provine restul acelui număr.

Ritmul de la o propoziție la alta este un semnal înrudit, dar separat, tratat în propriile sale termeni de burstiness checker, și urmărește câtă variație există într-un pasaj, nu un singur cuvânt.

Niciuna dintre aceste cifre nu poate dovedi cine a scris un document, inclusiv Human Score estimat pe care TextPulse îl calculează dintr-un draft trimis, care descrie textul, nu emite un verdict asupra lui. O versiune simplificată a aceleiași idei, varietatea vocabularului, nu probabilitatea completă a modelului, stă la baza free perplexity checker de pe acest site, care merită încercat pe un paragraf a cărui origine este deja cunoscută, înainte de a avea încredere în ceea ce spune un raport despre textul altcuiva.

Perplexity checker se află alături de celelalte free tools ale TextPulse, astfel încât o analiză completă a unui draft, a vocabularului, a ritmului și a tuturor celorlalte elemente nu necesită deschiderea simultană a unei duzini de file separate.

Perplexity este una dintre cele două statistici pe care se sprijină aceste sisteme. Cealaltă este burstiness, variația lungimii și structurii propozițiilor dintr-un pasaj, iar dedesubtul ambelor se află aritmetica probabilității tokenilor care produce scorul de la bun început.

O cifră dintr-un raport este capătul unui lanț lung de aritmetică, nu începutul unui argument despre cine a scris ceva. Întrebarea mai interesantă, odată ce aritmetica nu mai este misterioasă, este ce anume a făcut un document surprinzător sau previzibil de la bun început, iar aceasta este o întrebare despre scrierea însăși.

Frequently Asked Questions

Nu. Perplexity în detectarea AI este o măsurătoare statistică veche de decenii din modelarea limbajului, care descrie cât de previzibil este un pasaj de text pentru un model. Perplexity AI este o companie fără legătură, care produce un produs de căutare bazat pe AI. Cele două au un nume comun și nimic altceva, iar confundarea lor nu vă va ajuta să înțelegeți raportul unui detector.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.