AI Detection

Perché i rilevatori di AI sono di parte contro gli scrittori non madrelingua di inglese

Uno studio Stanford del 2023 ha rilevato che i rilevatori di AI interpretano in modo errato la scrittura fluente in inglese di parlanti non madrelingua come generata da una macchina a un tasso molto più alto rispetto alla scrittura di madrelingua. Ecco il meccanismo alla base di questo divario, e che cosa è accaduto quando gli stessi saggi sono stati riscritti con un lessico più ricco.

Aggiornato il 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

I rilevatori di AI con pregiudizi contro i non madrelingua non sono una lamentela soggettiva. Uno studio di Stanford del 2023, sottoposto a revisione paritaria, lo ha misurato direttamente. I ricercatori hanno sottoposto sette rilevatori GPT ampiamente usati a 91 saggi TOEFL reali scritti da parlanti non nativi di inglese e a 88 saggi scritti da studenti americani di ottava classe, quindi hanno confrontato i punteggi ottenuti da ciascun gruppo.

I rilevatori hanno letto correttamente quasi sempre i saggi di ottava classe. Nei saggi TOEFL, scritti da adulti che avevano già superato un esame di competenza in inglese di livello universitario, gli stessi sette strumenti hanno restituito un tasso medio di falsi positivi del 61.22 percento. Ottantanove dei novantuno saggi, quasi il 98 percento, sono stati segnalati come generati da AI da almeno uno dei sette strumenti.

La panoramica di TextPulse delle prove più ampie sull'accuratezza dei rilevatori di AI copre questo risultato principale e le cause legali in cui esso è poi confluito. Ciò che viene omesso quasi ovunque lo studio sia citato è il meccanismo: perché la prosa di chi parla inglese a livello universitario viene letta, in primo luogo, come prodotta da una macchina, e che cosa cambia quando smette di essere letta in questo modo.

I rilevatori di AI con pregiudizi contro i non madrelingua: il meccanismo

Un rilevatore non legge mai il significato. Legge quanto è prevedibile ciascuna parola, date le parole che la precedono, e assegna un punteggio basso a un passaggio quando il modello avrebbe potuto indovinarne la maggior parte in anticipo. La diversità lessicale, cioè quanto ampio è il vocabolario a cui uno scrittore attinge invece di ripetere un insieme più ristretto di parole sicure, e la prevedibilità sintattica, cioè quanto da vicino la struttura della frase segue il modello più comune per la lingua invece di variarlo, sono due proprietà della produzione linguistica che abbassano quel punteggio.

La distinzione conta perché i due aspetti si manifestano in modo diverso sulla pagina. La diversità lessicale riguarda le parole stesse: uno scrittore che ricorre a "obtain", "acquire" e "secure" in tre frasi diverse appare più vario di uno che scrive "get" tre volte, anche quando le frasi sono altrimenti identiche. La prevedibilità sintattica riguarda la struttura: soggetto, verbo, oggetto, ripetuti ancora e ancora, invece di una frase che si apre con una proposizione subordinata o termina con una parola inattesa. Uno scrittore di seconda lingua che lavora in condizioni d'esame ha ogni motivo per adottare la versione più sicura di entrambe.

La scrittura in seconda lingua mostra in modo affidabile meno di entrambe, e non come una carenza. Uno scrittore che opera in una lingua aggiuntiva si appoggia al lessico e ai modelli di frase più probabilmente corretti, perché sbagliare costa di più quando la lingua non è ancora del tutto automatica. L'articolo di Stanford che ha documentato il bias del detector cita un insieme di ricerche di linguistica applicata proprio su questo schema, stabilito ben prima che esistessero i detector di AI: ricchezza lessicale ridotta, diversità lessicale ridotta e struttura sintattica più semplice sono caratteristiche documentate e misurabili della scrittura in seconda lingua, non il segno di altro.

Quel divario tra scrittura nativa e non nativa emerge come una differenza di perplexity, la stessa misurazione che un detector esegue per decidere se un passaggio sia stato generato da una macchina. Una perplexity più bassa appare più simile a quella di una macchina, indipendentemente da chi l'abbia prodotta, e la scrittura non nativa si colloca più in basso su quella scala per ragioni che non hanno nulla a che vedere con un chatbot. Se quel divario sia davvero ciò che guida i detector, piuttosto che una coincidenza, è una questione verificabile. Il team di Stanford l'ha testata direttamente.

Cosa è successo quando gli stessi saggi sono stati riscritti con un vocabolario più ricco

I ricercatori presero gli stessi 91 saggi TOEFL che avevano attivato un tasso medio di falsi positivi del 61.22 percent e chiesero a ChatGPT di revisionarli usando una sola istruzione: "Enhance the word choices to sound more like that of a native speaker." Nulla del contenuto, dell'argomentazione o della grammatica doveva essere modificato. Dopo quella singola modifica, il tasso medio di falsi positivi sui medesimi sette detector scese all'11.77 percent, un calo di quasi cinquanta punti percentuali, e il numero di saggi segnalati all'unanimità da ogni detector scese da diciotto a uno.

I ricercatori poi invertirono l'esperimento. Presero gli 88 saggi di ottavo grado di parlanti nativi, che i detector avevano inizialmente classificato correttamente quasi sempre, e chiesero a ChatGPT di semplificarne le scelte lessicali come se fossero stati scritti da un parlante non nativo. Il tasso medio di falsi positivi su quei medesimi saggi scritti da nativi salì dal 5.19 percent al 56.65 percent. I saggi non cambiarono autore. Cambiò solo il vocabolario, e i detector seguirono il vocabolario.

La perplexity si mosse in parallelo con il tasso di misclassificazione in entrambe le direzioni: aumentò nettamente quando i saggi TOEFL furono arricchiti, e diminuì nettamente quando i saggi di ottavo grado furono semplificati. Gli autori traggono da ciò una conclusione netta: a cui i detector stavano realmente rispondendo non era mai l'autorialità. Era la scelta delle parole, una proprietà che il vocabolario di qualsiasi scrittore può veicolare indipendentemente da dove abbia imparato l'inglese.

Quanto è coerente il bias tra detector diversi

I sette detector non concordavano su molto, tranne che sulla direzione dell'errore. Ognuno di essi segnalava i saggi TOEFL molto più spesso dei saggi di ottavo grado, ma con margini molto diversi.

RilevatoreTasso di falsi positivi, saggi TOEFLTasso di falsi positivi, saggi di madrelingua
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
Rilevatore di OpenAI58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Questi sono dati del 2023, misurati sugli strumenti così come esistevano allora. Da allora diversi sono cambiati completamente: OpenAI ha chiuso il proprio rilevatore nel luglio 2023, quattro mesi dopo questo test, dopo aver constatato che identificava correttamente solo il 26 percento del testo effettivamente scritto da AI, pur etichettando erroneamente il 9 percento della scrittura umana. Ciò che non è cambiato è la direzione del divario. Un benchmark di bias più ampio, costruito appositamente per testare i rilevatori attraverso categorie demografiche e linguistiche, pubblicato nel dicembre 2025 e applicato a quattro strumenti open-source più recenti, ha comunque riportato un richiamo costantemente inferiore per i gruppi di scrittori sottorappresentati.

Umanizza il tuo articolo

Trasforma il tuo testo assistito dall'AI e fallo suonare umano, senza toccare parole importanti o citazioni.

Inizia gratis

Questo bias si manifesta ancora nei rilevatori più recenti?

Lo studio di Stanford ha ormai diverse generazioni di AI alle spalle, e gli stessi autori ne hanno indicato il limite: un piccolo campione pilota, e rilevatori costruiti soprattutto su GPT-2, un modello molto più piccolo e più vecchio di quello che alimenta oggi il rilevamento. Questo solleva una domanda legittima. Una tecnologia migliore ha colmato il divario?

Il test dedicato più recente dice di no, non ancora. In uno studio del febbraio 2026 condotto presso la Sultan Qaboos University, i ricercatori hanno testato due rilevatori commerciali attuali, Turnitin e Originality, su 192 testi che mescolavano scrittura autentica di studenti EFL precedente a ChatGPT, scrittura umana professionale, testo generato da AI e testo ibrido umano-AI. I risultati hanno mostrato un'accuratezza complessiva del 69 percento e del 61 percento per i due strumenti, con un'accuratezza nella categoria ibrida, il tipo di scrittura che produce effettivamente una revisione di editing, scesa vicino allo zero. Lo stesso studio ha inoltre rivelato un secondo bias che correva accanto a quello linguistico: l'accuratezza sulla scrittura scientifica era inferiore di 28 to 38 punti percentuali rispetto a quella sulla scrittura umanistica.

Nessuno dei due risultati riguarda un singolo prodotto difettoso. Due architetture di rilevamento diverse, testate a tre anni di distanza su corpora differenti da team di ricerca diversi, continuano a giungere allo stesso risultato: la scrittura modellata dalla convenzione di genere o da una seconda lingua si colloca più vicino a ciò che questi strumenti chiamano prodotto di macchina rispetto alla scrittura che non lo è. Gli strumenti gratuiti di TextPulse consentono a uno scrittore di controllare lo stesso profilo statistico prima che uno di questi testi raggiunga il rilevatore di un'istituzione.

Prove indipendenti che il divario è reale, non un artefatto del test

Il primo problema con i risultati del TOEFL è che si potrebbe sostenere che si applichino solo a un piccolo studio pilota del 2023. A questo ha risposto lo stesso team di ricerca in un altro studio che utilizza dati che non hanno nulla a che fare con i rilevatori. Hanno esaminato 1,574 articoli accettati a ICLR 2023, una importante conferenza di machine learning, limitando il campione agli abstract presentati e valutati prima che ChatGPT esistesse.

Gli autori con base in paesi in cui l'inglese non è la lingua principale hanno scritto abstract con una perplexity significativamente più bassa rispetto agli autori con base in paesi anglofoni nativi, e la differenza è rimasta anche dopo aver controllato quanto ogni articolo fosse stato valutato dai revisori. Questo campione non avrebbe potuto essere influenzato da qualcuno che cercava di sembrare più o meno come un chatbot. ChatGPT era a tre mesi dal rilascio quando si è chiusa la finestra di invio. Il divario di perplexity tra la scrittura accademica di parlanti nativi e non nativi non è qualcosa che i detector hanno inventato. È qualcosa che hanno ereditato.

Un'analisi statistica del 2026 del rilevamento dell'AI come problema di test offre una versione formale della stessa conclusione. Ogni volta che un gruppo di autori produce un linguaggio che si sovrappone, nel complesso, all'output tipico dell'AI, qualsiasi detector con una reale capacità di individuare testi scritti dall'AI deve presentare per quel gruppo specifico un tasso più elevato di falsi positivi, una proprietà matematica del test di una popolazione diversificata piuttosto che un difetto di un singolo strumento. Gli autori non nativi di inglese sono il caso documentato più chiaro di esattamente questa sovrapposizione.

Cosa significa questo per gli autori in una seconda lingua

Niente di tutto questo è un argomento per scrivere meno come se stessi. È un motivo per sapere che cosa viene effettivamente misurato prima che arrivi un punteggio. Un detector che legge la tua prosa come prevedibile sta rilevando una reale proprietà statistica della scrittura in seconda lingua, non una prova che tu abbia usato uno strumento che non hai usato.

I ricercatori di Stanford che hanno condotto lo studio originale osservano una conseguenza scomoda del loro stesso risultato: lo stesso adattamento del vocabolario che riduce il rischio di falsi positivi è anche il tipo di revisione che un autore potrebbe desiderare per ragioni del tutto separate, una formulazione più chiara, una parola più precisa, indipendentemente da qualsiasi detector. La pagina di TextPulse per gli autori accademici ESL illustra come appare questo tipo di revisione su frasi reali, separatamente da qualsiasi cosa abbia a che fare con un punteggio di rilevamento.

I rilevatori più recenti stanno iniziando a tenere conto esplicitamente di questo schema. Pangram, uno dei più recenti operatori commerciali, afferma nella propria documentazione tecnica che il suo classificatore non è distorto contro gli scrittori di inglese non madrelingua, anche se tale affermazione proviene dal fornitore e non da test indipendenti. Un controllore gratuito di perplexity mostra la stessa misurazione di base che uno qualsiasi di questi strumenti calcola a partire da un testo, senza inviare prima la bozza altrove.

Due compagni pratici si collocano nello stesso gruppo: quando usare a, an e the, che è la singola fonte più comune dello schema, e come sembrare naturali nella scrittura accademica in inglese più in generale.

La ricerca continua ad accumularsi nella stessa direzione a distanza di due anni, tra team diversi, rilevatori diversi e diversi disegni sperimentali. Ciò che non ha tenuto il passo è una risposta istituzionale ampiamente adottata: verificare un rilevatore su una gamma di scrittori prima di fidarsi di esso per uno qualsiasi di loro, invece che dopo che uno studente specifico è già stato accusato. Finché questo non diventerà una prassi, l'onere di dimostrare che un falso positivo è errato ricadrà proprio sugli scrittori che questa ricerca indica come i più probabilmente destinatari di uno.

Domande frequenti

Il fatto che i rilevatori di AI siano di parte contro i non madrelingua è un risultato sottoposto a revisione paritaria, non una speculazione. Uno studio Stanford del 2023 ha rilevato che sette GPT detectors ampiamente usati hanno classificato erroneamente in media il 61.22 percento dei veri saggi TOEFL come generati da AI, mentre hanno letto correttamente quasi sempre i saggi di madrelingua.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Rimani aggiornato sulla humanization con AI

Ricevi nella tua casella di posta consigli su scrittura accademica, rilevamento AI e humanization.

Niente spam. Annulla l'iscrizione in qualsiasi momento.