AI Detection

Ce este perplexity în detectarea AI?

Perplexity este numărul pe care un model de limbaj îl produce pentru a descrie cât de surprins a fost de alegerile dvs. de cuvinte. Acest articol urmărește metrica până la originea ei din 1977, parcurge formula și explică de ce același pasaj poate obține scoruri diferite în funcție de modelul care îl citește.

Actualizat la 6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

Căutați împreună perplexity și detectarea AI, iar mai multe dintre primele rezultate se dovedesc a fi despre un produs fără legătură: un motor de căutare bazat pe AI care, întâmplător, se numește și Perplexity. Metrica pe care o raportează efectiv un detector nu are nimic în comun cu acea companie, în afară de cuvânt. Ea provine din cercetarea în recunoașterea vorbirii, cu decenii mai veche decât GPTZero sau motorul de căutare, și măsoară ceva mai restrâns decât oricare dintre ele: cât de surprins este un model lingvistic de cuvintele deja aflate pe pagină.

Așadar, ce este perplexity în detectarea AI? Perplexity este un scor care descrie cât de bine a prezis un model lingvistic cuvintele exacte dintr-un pasaj, obținut prin medierea propriilor probabilități ale modelului și convertirea rezultatului într-un singur număr. Un scor mic înseamnă că modelul a continuat să ghicească corect. Un scor mare înseamnă că a continuat să fie surprins.

Ideea este mai veche decât orice detector AI de pe piață și, de una singură, nu spune nimic despre cine a scris un document. Odată ce aritmetica din spatele numărului devine vizibilă, un scor dintr-un raport încetează să mai pară un verdict și începe să arate ca ceea ce este de fapt, o descriere a alegerii cuvintelor.

Free perplexity checker scoring word-level predictability: a repetitive paragraph scores 62 of 100 estimated word variation with a 51% type-token ratio
Varietate lexicală redusă pe perplexity checker, 44 de cuvinte unice din 87, astfel încât aceleași cuvinte poartă prea mult din text. Această predictibilitate este exact ceea ce citesc detectorii bazați pe perplexity.

Ce este perplexity în detectarea AI?

Perplexity este o măsură împrumutată din modelarea limbajului. Ea evaluează cât de bine a prezis un model cuvintele specifice care apar într-un pasaj și raportează acest scor ca un singur număr. Detectoarele aplică aceeași măsură unui document trimis: un număr mic, care înseamnă că presupunerile modelului s-au potrivit îndeaproape cu cuvintele reale, este citit ca un semn al autoratului mașinii, iar un număr mare este citit ca un semn al autoratului uman. Nimic din calcul nu citește argumentul documentului, citările sale sau subiectul său. Citește doar cât de așteptat a fost fiecare cuvânt, unul câte unul.

Detectoarele nu au inventat această măsură. Ele au împrumutat un instrument pe care sistemele de recunoaștere a vorbirii și de traducere automată îl foloseau deja de decenii pentru a judeca cât de bine a prezis un model limbajul obișnuit și l-au reutilizat ca indicator indirect al autoratului, o sarcină pentru care nu a fost construit inițial.

Nimic din toate acestea nu are legătură cu motorul de căutare fără legătură menționat mai devreme. Perplexity pe care o raportează un detector nu este niciodată o companie și nu este niciodată scrisă cu majusculă: este o proprietate statistică simplă a unei secvențe de cuvinte, calculată din nou pentru orice text i se oferă.

Cum este calculată de fapt perplexity

Calculul își are originea mai departe decât orice produs AI. Frederick Jelinek, Robert Mercer, Lalit Bahl și James Baker au introdus perplexity în 1977 pentru a măsura cât de dificilă era o sarcină de recunoaștere a vorbirii pentru un model statistic, cu decenii înainte ca cineva să aplice termenul unui eseu sau unui raport de laborator. Definiția nu s-a schimbat de atunci.

La fiecare poziție dintr-un document, modelul produce o probabilitate pentru cuvântul care urmează efectiv, ceva de genul 0.72 pentru o tranziție obișnuită sau 0.03 pentru una neobișnuită. Perplexity face media logaritmilor acestor probabilități pe întregul pasaj, apoi inversează media cu un exponent.

Exponentul din there’s face mai mult decât pare. Media probabilităților logaritmice este exact ceea ce facem când calculăm cross-entropy, care este modul teoretic informațional de a spune câți biți sunt necesari pentru a codifica o secvență, având în vedere predicțiile făcute de un model. Dar perplexity traduce numărul de biți înapoi într-un lucru pe care îl putem înțelege mai bine, un număr efectiv de opțiuni, nu un număr abstract de biți.

Ce supraviețuiește acestei aritmetici are o interpretare clară, aproape fizică. Un model care este complet sigur de fiecare dată produce o perplexity de 1, limita inferioară a scalei. Un model care tratează fiecare poziție ca pe o alegere egală între optzeci de cuvinte la fel de probabile produce o perplexity de 80.

Majoritatea documentelor reale se situează undeva între aceste două extreme, iar locul exact depinde de autor, de subiect și de modelul care face lectura.

Umanizează-ți propria lucrare

Transformă textul tău asistat de AI și fă-l să sune uman, fără a atinge cuvintele importante sau citările.

Începe gratuit

De ce scrierea umană tinde să obțină scoruri diferite

Așteptările unui model sunt construite în întregime din ceea ce a precedat, câte un cuvânt pe rând. După expresia 'the treatment group showed a statistically', marea majoritate a continuărilor bine formate sunt 'significant', iar un model antrenat pe un volum mare de scriere științifică atribuie acelui cuvânt o probabilitate mare, fără ezitare. Un autor uman care ajunge la aceeași expresie ar putea alege tot 'significant', deoarece expresia în sine este un element fix al genului. Diferența apare în altă parte, în substantivul ales două propoziții mai târziu, în observația adăugată între paranteze, în numărul raportat cu o zecimală neobișnuită, în locul uneia rotunde.

Nimic din toate acestea nu este un truc. Când o persoană care scrie despre date reale încearcă să ajungă la numărul exact, la calificativul precis, la cuvântul puțin mai restrâns, ea caută lucruri care sunt adevărate despre lucrare, nu despre gen. Și fiecare dintre aceste alegeri îi costă modelului puțin mai multă surpriză. Surpriza este ceea ce scorul este conceput să adune.

Inferența face mai multă muncă decât poate susține măsurarea. Perplexitatea măsoară direct predictibilitatea. Ea deduce autoratul doar presupunând că scrierea predictibilă este rară la oameni și comună la modele, o presupunere care este de obicei rezonabilă și, ocazional, greșită într-un mod specific, identificabil, deoarece predictibilitatea este o proprietate pe care textul o poate avea din motive care nu au nicio legătură cu cine l-a tastat.

De ce același pasaj poate obține scoruri diferite

Scorul este, de asemenea, mai puțin portabil decât pare, deoarece nu este niciodată măsurat în vid. Perplexitatea este calculată întotdeauna în raport cu antrenarea unui anumit model de referință, iar această dependență creează probleme pe care nicio definiție singulară nu le poate arăta de una singură.

FactorCe se schimbăDe ce se întâmplă
Ce model face lecturaAcelași paragraf poate obține un scor mic la un model și mare la altulPerplexitatea este măsurată întotdeauna doar în raport cu datele de antrenare ale unui model, iar modele diferite au fost antrenate pe texte diferite
Dacă pasajul este text larg reprodusUn document istoric celebru sau o definiție dintr-un manual poate obține un scor de perplexitate scăzut chiar și atunci când o persoană a tastat fiecare cuvânt al lui în detectorPangram Labs indică Declarația de Independență ca exemplu: este citată atât de des în datele de antrenare, încât un model găsește fiecare propoziție a ei lipsită de surpriză
Dacă detectorul poate vedea deloc probabilitățile tokenilorModelele comerciale închise, precum ChatGPT, Gemini și Claude, nu expun probabilitățile pe cuvânt de care perplexitatea are nevoieDetectorii aproximează scorul cu un model deschis de substituție, în loc să calculeze perplexitatea în raport cu modelul care a produs efectiv textul

Nimic din toate acestea nu face numărul lipsit de sens, ci doar mai riscant de considerat drept un verdict în sine. Documentația proprie GPTZero a publicat odată o regulă empirică aproximativă, un perplexity peste 85 fiind interpretat ca mai probabil uman, dar pragul unui singur furnizor pe un model nu se transferă la un instrument diferit, evaluat față de altul. Un detector care raportează un singur scor comprimă toți factorii de mai sus într-o singură cifră, fără să spună care dintre ei a făcut munca.

Ce vă spune de fapt un scor de perplexity

Detectorii comerciali combină perplexity cu tipare la nivel de propoziție, antrenarea clasificatorului și alte câteva semnale înainte de a afișa vreodată un singur număr într-un raport. Imaginea mai completă a modului în care funcționează de fapt detectorii AI este tratată separat și explică de unde provine restul acelui număr.

Ritmul de la o propoziție la alta este un semnal înrudit, dar separat, tratat în mod propriu de verificatorul de burstiness, și acesta analizează câtă variație există într-un pasaj, nu un singur cuvânt.

Niciunul dintre aceste numere nu poate dovedi cine a scris un document, inclusiv Human Score estimat pe care TextPulse îl calculează dintr-un draft trimis, care descrie textul, nu emite un verdict asupra lui. O versiune simplificată a aceleiași idei, varietatea vocabularului, nu probabilitatea completă a modelului, stă la baza verificatorului gratuit de perplexity de pe acest site, care merită încercat pe un paragraf a cărui origine este deja cunoscută înainte de a avea încredere în ceea ce spune un raport despre textul altcuiva.

Verificatorul de perplexity se află alături de restul instrumentelor gratuite TextPulse, astfel încât o analiză completă a unui draft, vocabular, ritm și tot restul, nu necesită deschiderea simultană a unei duzini de file separate.

Perplexity este una dintre cele două statistici pe care se bazează aceste sisteme. Cealaltă este burstiness, variația în lungimea și structura propozițiilor de-a lungul unui pasaj, iar dedesubtul ambelor se află aritmetica probabilității tokenurilor care produce scorul de la bun început.

Un număr dintr-un raport este capătul unui lung lanț de aritmetică, nu începutul unei dezbateri despre cine a scris ceva. Întrebarea mai interesantă, odată ce aritmetica încetează să mai fie misterioasă, este ce anume a făcut un document surprinzător sau previzibil de la bun început, iar aceasta este o întrebare despre scrierea însăși.

XLinkedInFacebook

Întrebări frecvente

Nu. Perplexity în detectarea AI este o măsurătoare statistică veche de decenii din modelarea limbajului, care descrie cât de previzibil este un pasaj de text pentru un model. Perplexity AI este o companie fără legătură, care produce un produs de căutare bazat pe AI. Cele două împart un nume și nimic altceva, iar confuzia dintre ele nu vă va ajuta să înțelegeți raportul unui detector.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Rămâi la curent cu umanizarea AI

Primește în inbox sfaturi despre scriere academică, detectarea AI și umanizare.

Fără spam. Te poți dezabona oricând.