AI Detection

Che cos'è la perplexity nel rilevamento AI?

La perplexity è il numero che un language model produce per descrivere quanto sia rimasto sorpreso dalle tue scelte di parole. Questo articolo ripercorre la metrica fino alla sua origine nel 1977, esamina la formula e spiega perché lo stesso passaggio può ottenere punteggi diversi a seconda del modello che lo legge.

6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

Cercare insieme perplexity e rilevamento AI, e diversi dei primi risultati si rivelano riguardare un prodotto non correlato: un motore di ricerca basato su AI che, per coincidenza, si chiama anche Perplexity. La metrica che un rilevatore riporta realmente non ha nulla in comune con quell'azienda, salvo la parola. Proviene dalla ricerca sul riconoscimento vocale di decenni precedente a GPTZero o al motore di ricerca, e misura qualcosa di più ristretto rispetto a entrambi: quanto un modello linguistico sia sorpreso dalle parole già presenti nella pagina.

Allora, che cos'è la perplexity nel rilevamento AI? La perplexity è un punteggio che descrive quanto bene un modello linguistico ha previsto le parole esatte in un passaggio, ottenuto mediando le probabilità del modello stesso e convertendo il risultato in un unico numero. Un punteggio basso significa che il modello ha continuato a indovinare correttamente. Un punteggio alto significa che è stato continuamente sorpreso.

L'idea è più antica di qualsiasi rilevatore AI sul mercato, e da sola non dice nulla su chi abbia scritto un documento. Una volta che l'aritmetica dietro il numero diventa visibile, un punteggio in un rapporto smette di sembrare un verdetto e comincia a sembrare ciò che è realmente: una descrizione della scelta delle parole.

Che cos'è la perplexity nel rilevamento AI?

La perplexity è una misura presa in prestito dalla modellazione del linguaggio. Valuta quanto bene un modello ha previsto le parole specifiche che compaiono in un passaggio e riporta quel punteggio come un unico numero. I rilevatori applicano la stessa misura a un documento inviato: un numero basso, che significa che le ipotesi del modello corrispondevano da vicino alle parole reali, viene letto come un segno di paternità della macchina, e un numero alto viene letto come un segno di paternità umana. Nulla nel calcolo legge l'argomentazione del documento, le sue citazioni o il suo contenuto. Legge solo quanto fosse attesa ciascuna parola, una alla volta.

I rilevatori non hanno inventato questa misura. Hanno preso in prestito uno strumento che i sistemi di riconoscimento vocale e di traduzione automatica avevano già usato per decenni per valutare quanto bene un modello prevedesse il linguaggio ordinario, e lo hanno riadattato come proxy per la paternità, un compito per cui non era stato originariamente costruito.

Nulla di tutto questo ha a che fare con il motore di ricerca non correlato menzionato in precedenza. La perplexity che un rilevatore riporta non è mai un'azienda e non è mai maiuscola: è una semplice proprietà statistica di una sequenza di parole, calcolata ex novo a partire da qualunque testo le venga fornito.

Come viene effettivamente calcolata la perplexity

Il calcolo risale a un periodo anteriore a qualsiasi prodotto AI. Frederick Jelinek, Robert Mercer, Lalit Bahl e James Baker introdussero la perplexity nel 1977 per misurare quanto fosse difficile un compito di riconoscimento vocale per un modello statistico, decenni prima che qualcuno applicasse il termine a un saggio o a una relazione di laboratorio. La definizione non è cambiata da allora.

In ogni posizione di un documento, il modello produce una probabilità per la parola che effettivamente viene dopo, qualcosa come 0.72 per una transizione comune o 0.03 per una insolita. La perplexity fa la media dei logaritmi di quelle probabilità sull'intero passaggio, poi inverte la media con un esponente.

L'esponente in there's fa più di quanto sembri. Fare la media delle probabilità logaritmiche è esattamente ciò che facciamo quando calcoliamo la cross-entropy, che è il modo, in termini teorico-informativi, di dire quanti bit servono per codificare una sequenza date le previsioni formulate da un modello. Ma la perplexity traduce il conteggio dei bit in qualcosa che possiamo comprendere meglio: un numero effettivo di scelte, anziché un conteggio astratto di bit.

Ciò che sopravvive a quell'aritmetica ha una lettura chiara, quasi fisica. Un modello completamente certo ogni volta produce una perplexity di 1, il limite inferiore della scala. Un modello che tratta ogni posizione come un pareggio alla pari tra ottanta parole equiprobabili produce una perplexity di 80.

La maggior parte dei documenti reali si colloca da qualche parte tra questi due estremi, e il punto esatto dipende dallo scrittore, dall'argomento e da quale modello sta leggendo.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Perché la scrittura umana tende a ottenere punteggi diversi

Le aspettative di un modello si costruiscono interamente a partire da ciò che viene prima, una parola alla volta. Dopo la frase 'the treatment group showed a statistically', la grande maggioranza delle continuazioni ben formate è 'significant', e un modello addestrato su un grande volume di scrittura scientifica assegna a quella parola una probabilità elevata senza esitazione. Un autore umano che arrivi alla stessa frase potrebbe scegliere anch'egli 'significant', perché la frase stessa è un elemento fisso del genere. La distanza emerge altrove: nel sostantivo scelto due frasi dopo, nella parentesi aggiunta come inciso, nel numero riportato con una cifra decimale insolita invece che con una cifra tonda.

Non c'è alcun trucco in tutto questo. Quando una persona che scrive di dati reali cerca il numero esatto, il qualificatore preciso, la parola leggermente più ristretta, sta cercando elementi che sono veri del lavoro invece che veri del genere. E ciascuna di queste scelte costa al modello un po' più di sorpresa. La sorpresa è ciò che il punteggio è costruito per sommare.

L'inferenza sta facendo più lavoro di quanto la misurazione possa sostenere. La perplexity misura direttamente la prevedibilità. Deduce la paternità solo assumendo che la scrittura prevedibile sia rara tra gli esseri umani e comune tra i modelli, un'assunzione che di solito è ragionevole e talvolta sbagliata in un modo specifico e identificabile, poiché la prevedibilità è una proprietà che un testo può avere per ragioni che non hanno nulla a che fare con chi lo ha digitato.

Perché lo stesso passaggio può ottenere punteggi diversi

Il punteggio è anche meno portabile di quanto sembri, perché non viene mai misurato in un vuoto. La perplexity è sempre calcolata rispetto all'addestramento di uno specifico modello di riferimento, e questa dipendenza crea problemi che nessuna definizione singola può mostrare da sola.

FattoreCosa cambiaPerché accade
Quale modello sta facendo la letturaLo stesso paragrafo può ottenere un punteggio basso su un modello e alto su un altroLa perplexity viene sempre misurata solo rispetto ai dati di addestramento di un modello, e modelli diversi sono stati addestrati su testi diversi
Se il passaggio è un testo ampiamente riprodottoUn famoso documento storico o una definizione da manuale possono ottenere una bassa perplexity anche quando una persona ha digitato ogni parola nel detectorPangram Labs indica la Dichiarazione di Indipendenza come esempio: viene citata così spesso nei dati di addestramento che un modello trova non sorprendente ogni sua frase
Se il detector può vedere le probabilità dei token in assolutoModelli commerciali chiusi come ChatGPT, Gemini e Claude non espongono le probabilità per parola di cui la perplexity ha bisognoI detector approssimano il punteggio con un modello aperto sostitutivo invece di calcolare la perplexity rispetto al modello che ha effettivamente prodotto il testo

Niente di tutto questo rende il numero privo di significato, ma solo più rischioso da considerare attendibile come verdetto autonomo. La documentazione di GPTZero pubblicò una volta una regola empirica approssimativa, una perplexity superiore a 85 letta come più probabilmente umana, ma la soglia di un singolo fornitore su un modello non si trasferisce a uno strumento diverso misurato rispetto a un altro. Un detector che riporta un singolo punteggio sta comprimendo tutti i fattori sopra in un'unica cifra senza dire quali di essi abbiano avuto un ruolo.

Cosa indica realmente un punteggio di perplexity

I detector commerciali combinano la perplexity con modelli a livello di frase, l'addestramento del classificatore e diversi altri segnali prima ancora di stampare un singolo numero in un report. Il quadro più completo di come funzionano realmente i detector AI è trattato separatamente, e spiega da dove proviene il resto di quel numero.

Il ritmo da una frase all'altra è un segnale correlato ma distinto, trattato autonomamente dal controllore di burstiness, e considera quanta variazione esiste in un passaggio piuttosto che una singola parola.

Nessuno di questi numeri può provare chi abbia scritto un documento, incluso l'Human Score stimato che TextPulse calcola da una bozza inviata, che descrive il testo invece di emettere un verdetto su di esso. Una versione semplificata della stessa idea, la varietà del vocabolario invece della probabilità completa del modello, alimenta il controllore gratuito di perplexity su questo sito, che vale la pena provare su un paragrafo la cui origine è già nota prima di fidarsi di ciò che un rapporto dice sul testo di qualcun altro.

Il controllore di perplexity si affianca agli altri strumenti gratuiti di TextPulse, così un'analisi completa di una bozza, del vocabolario, del ritmo e di tutto il resto, non richiede di avere aperte contemporaneamente una dozzina di schede separate.

La perplexity è una delle due statistiche su cui si basano questi sistemi. L'altra è la burstiness, la variazione nella lunghezza e nella struttura delle frasi in un passaggio, e sotto entrambe si trova l'aritmetica della probabilità dei token che produce il punteggio in primo luogo.

Un numero in un rapporto è il punto finale di una lunga catena di aritmetica, non l'inizio di un argomento su chi abbia scritto qualcosa. La domanda più interessante, una volta che l'aritmetica smette di essere misteriosa, è che cosa abbia reso precisamente un documento sorprendente o prevedibile in primo luogo, e questa è una domanda che riguarda la scrittura stessa.

Frequently Asked Questions

No. La perplexity nel rilevamento AI è una misura statistica risalente a decenni fa, derivata dal language modelling, che descrive quanto prevedibile sia un passaggio di testo per un modello. Perplexity AI è un'azienda non correlata che realizza un prodotto di ricerca basato su AI. I due condividono un nome e nient'altro, e confonderli non aiuterà a capire il rapporto di un detector.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Che cos'è la perplexity nel rilevamento AI? | TextPulse.ai