Turnitin può rilevare testo AI umanizzato?
Turnitin afferma che il suo indicatore di scrittura AI copre già il testo passato attraverso un humanizer. Ciò che tale affermazione significa e non significa, perché un documento umanizzato a volte ottiene ancora un punteggio alto e a volte no, e quanto vale il numero per uno studente in ogni caso.
Turnitin risponde a questa domanda nel proprio sito di supporto, e la risposta è più specifica di entrambe le posizioni del consueto dibattito. Il suo indicatore di scrittura AI, Turnitin says, include già il rilevamento di contenuti generati da AI che possono essere stati umanizzati o fatti passare attraverso un bypasser per evitare il rilevamento. Si tratta di un fornitore che descrive il proprio prodotto. È anche il punto giusto da cui iniziare, perché indica che cosa il modello dichiara di coprire.
Quindi, Turnitin può rilevare testo umanizzato? La domanda ha una forma più ristretta e più utile. Il modello di Turnitin non cerca l'impronta di un humanizer e non conserva alcun elenco di strumenti. Assegna un punteggio alla prosa frase per frase in base a quanto da vicino la scrittura corrisponde ai modelli statistici del testo generato da macchina, poi calcola la media di tali punteggi sull'intero documento. Se un passaggio umanizzato continui a ottenere un punteggio elevato dipende da quanto la riscrittura ha modificato quel modello, e da quanto del documento è stato riscritto in generale.
Turnitin può rilevare testo umanizzato? Che cosa dichiara Turnitin
La loro posizione pubblicata è un semplice sì. Rispondendo alla domanda se possa rilevare contenuti passati attraverso un humanizer, la loro guida afferma: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." La stessa pagina fornisce la stessa risposta per gli strumenti di parafrasi AI.
Questa affermazione non compare come un secondo numero da qualche parte nel report. Turnitin la incorpora nella singola percentuale di scrittura AI, e la definizione pubblicata di tale percentuale lo dice direttamente: copre il testo che il modello determina essere stato probabilmente generato da AI, oppure probabilmente generato e poi modificato da un parafrasatore AI o da un bypasser. Esiste un solo punteggio, e già tiene conto della riscrittura per quanto il modello sia in grado di farlo.
Leggere con attenzione, questa è un’affermazione sulla copertura, non un’affermazione sull’accuratezza. Turnitin sta dicendo che il testo umanizzato rientrava nell’ambito quando il modello è stato costruito. Si ferma ben prima di dire che ogni documento umanizzato ottiene un punteggio alto, e le sue stesse cifre pubblicate, più avanti, descrivono un modello che tratta le singole frasi come incerte.
Che cosa sta realmente valutando l’AI Writing Indicator
Non è una percentuale. È una frazione di testo, quindi non è un livello di confidenza. È una misura di quanto testo all’interno del documento il nostro modello ritiene probabilmente generato da AI. Lo chiamiamo testo qualificato, il che significa frasi in prosa in un formato di scrittura esteso. Non include elenchi puntati, codice, tabelle o brevi frammenti. Ed è per questo che potresti vedere numeri diversi per lo stesso elaborato in base a quanta parte di esso è prosa continua.
Il meccanismo sottostante è abbastanza semplice da immaginare. Turnitin suddivide un documento in segmenti sovrapposti di alcune centinaia di parole, circa cinque o dieci frasi ciascuno, sovrapposti in modo che ogni frase riceva un punteggio nel contesto. A ciascuna frase viene assegnato un valore compreso tra 0 e 1. I punteggi dei segmenti vengono poi mediati sull’intero documento per produrre l’unico numero che un docente vede. Un resoconto passo per passo di come Turnitin rileva AI esamina ciascuna fase in modo più dettagliato.
Quella fase di media conta più del resto della pipeline per il testo umanizzato, ed è la parte che quasi nessuno considera. La cifra che un docente legge è una media aritmetica dei giudizi a livello di segmento. Un documento può essere riscritto per metà e collocarsi a metà strada per ragioni che hanno poco a che fare con la qualità della riscrittura.
Perché l’output umanizzato a volte ottiene comunque un punteggio alto
La ragione più comune è la copertura. Un umanizzatore applicato a un'introduzione e a una conclusione lascia intatta la rassegna della letteratura e la discussione, e tali segmenti portano i loro punteggi originali direttamente nella media. In un capitolo lungo, riscrivere le pagine iniziali modifica una manciata di segmenti e lascia il resto esattamente com'era, il che produce uno spostamento minore di quanto l'autore si aspetti da un lavoro che sembrava sostanziale.
La seconda ragione è la profondità della riscrittura. Un passaggio che sostituisce il lessico mantenendo inalterate la lunghezza delle frasi, l'ordine delle proposizioni e le scelte di transizione lascia in gran parte intatto il modello su cui il classificatore è stato addestrato. Il modello valuta la forma della prosa, quindi cambiare quali parole riempiono quella forma incide meno di quanto la maggior parte delle persone supponga. Un free perplexity checker mostrerà quanto un brano continui a risultare prevedibile dopo una riscrittura, il che è un segnale più informativo di un confronto parola per parola tra prima e dopo.
La terza ragione è che una riscrittura può introdurre una propria regolarità. Un software che applica la stessa trasformazione a ogni paragrafo produrrà un nuovo modello che è altrettanto regolare di quello precedente. Se ogni frase presenta lo stesso tipo di taglio interno, oppure se a ogni frase viene aggiunto nello stesso punto lo stesso tipo di proposizione attenuativa, tali frasi saranno considerate da un classificatore in modo altrettanto uniforme di quanto lo sarebbero state se, in origine, fossero state tutte della stessa lunghezza.
| Situazione | Cosa fa il punteggio AI | Perché |
|---|---|---|
| Solo una parte del documento è stata riscritta | Scende meno del previsto | I segmenti non toccati mantengono i loro punteggi originali nella media |
| Il vocabolario è cambiato, la struttura delle frasi è rimasta invariata | Si muove molto poco | Il classificatore assegna un punteggio ai modelli a livello di frase che la sostituzione ha lasciato al loro posto |
| Le frasi sono state realmente ristrutturate in tutto il testo | Si muove di più | Il ritmo uniforme che il modello è stato addestrato a riconoscere viene spezzato |
| Sono state inviate meno di 300 parole di prosa | Non viene generato alcun punteggio | Turnitin richiede 300 parole di prosa idonea prima di riportare una percentuale |
| Il risultato scende sotto il 20 percento | Un asterisco invece di una cifra | Turnitin segnala come meno affidabili i risultati in questo intervallo |
Perché la stessa riscrittura produce talvolta un punteggio basso
Un documento reso più umano può restituire un punteggio basso per ragioni che non hanno nulla a che fare con la riscrittura. Turnitin richiede almeno 300 parole di prosa idonea prima di generare in assoluto una percentuale AI, una soglia che ha innalzato da 150 parole iniziali sulla base della motivazione dichiarata che l'accuratezza migliora con un po' più di testo. Un breve testo riflessivo non produce alcun numero, e un punteggio assente non è la stessa cosa di un punteggio pulito.
Turnitin contrassegna con un asterisco un intervallo inferiore al 20 percento invece di fornire una percentuale esatta, perché in questo intervallo si registra una maggiore incidenza di falsi positivi. Al momento del lancio, la comunicazione nel settore dell'istruzione faceva anche riferimento a questo comportamento, affermando che i risultati riportati come inferiori al 20 percento di testo scritto da AI avevano una maggiore incidenza di falsi positivi e che quindi Turnitin aveva aggiunto avvertenze. Un documento collocato in quella fascia è stato contrassegnato come un intervallo che Turnitin rifiuta di riportare con precisione, il che è cosa diversa dall'essere stato escluso.
C'è anche un filtro istituzionale al di sopra di tutto questo. Turnitin elabora un invio per il rilevamento della scrittura AI solo se l'istituzione ha attivato la funzione, e gli amministratori possono disabilitarla a livello di account. La Vanderbilt University ha fatto esattamente questo nell'agosto 2023, citando il tasso di falsi positivi dell'1 percento allora pubblicato da Turnitin su circa 75,000 invii annuali, il pregiudizio contro gli autori non madrelingua inglese, e la mancanza di trasparenza sul funzionamento del modello. Uno studente in un'istituzione con la funzione disattivata non ha alcun punteggio AI su nessun invio, umanizzato o altrimenti.
E quando la riscrittura era davvero strutturale, il punteggio può diminuire perché il modello misurato è cambiato. Turnitin riporta una stima calcolata a partire dai modelli di scrittura, quindi un testo i cui modelli differiscono ottiene un punteggio diverso. Il meccanismo funziona in entrambe le direzioni, ed è questa la parte scomoda: a volte la scrittura umana originale ottiene un punteggio alto per esattamente la stessa ragione.
Umanizza il tuo articolo
Trasforma il tuo testo assistito dall'AI e fallo suonare umano, senza toccare parole importanti o citazioni.
Che cosa sostiene ciascun fornitore di humanizer, e che cosa è documentato
Una regola governa la tabella. La colonna centrale è il linguaggio promozionale del fornitore stesso, tratto dal suo sito ogni volta che quel sito ne offrirebbe uno. La colonna di destra registra ciò che effettivamente sostiene ciascuna affermazione, che nella maggior parte dei casi non è affatto un dataset, una data o un metodo. Non esiste alcun test pubblico diretto tra questi marchi.
| Brand | What the vendor claims | What is documented |
|---|---|---|
| Undetectable.ai | Elenca il superamento dei rilevatori AI come funzionalità del prodotto senza alcuna cifra associata, e offre di rimborsare il costo della umanizzazione se l'output viene segnalato come non umano | Il rimborso è una condizione commerciale, nessun dataset, data o risultato per singolo rilevatore sostiene l'affermazione |
| QuillBot | Non formula alcuna affermazione di rilevamento o di aggiramento per la funzione humanizer nelle proprie pagine. Il suo rilevatore AI separato è descritto solo come strumento che rileva contenuti generati da AI | QuillBot vende l'humanizer all'interno di una suite generale di scrittura e non formula per esso alcuna affermazione specifica su Turnitin |
| WriteHuman | Classificato al primo posto in una Humanizer Leaderboard, e descritto come l'humanizer AI premium per la scrittura seria | La leaderboard non cita alcuna metodologia o campione, e WriteHuman non associa alcuna cifra numerica di accuratezza alla classifica |
| Walter Writes AI | Commercializza una umanizzazione ampia in oltre 80 lingue senza alcuna affermazione specifica su Turnitin | Nessun dato di test in un senso o nell'altro |
| HIX Bypass | Commercializza pagine di aggiramento per singolo rilevatore senza alcuna cifra specifica su Turnitin | HIX Bypass e BypassGPT sono prodotti separati su domini separati, quindi occorre verificare quale dei due descriva un'affermazione |
| StealthGPT | Una media del 98% di contenuti umanizzati su Turnitin e del 95% su GPTZero, ciascuna da una esecuzione dichiarata di 30 campioni con zero rilevamenti, più una garanzia di rimborso se un abbonato viene rilevato | Autodichiarato. Nessun dataset, selezione del campione, data o metodo è pubblicato accanto alle cifre, e 30 documenti sono una serie piccola per un'affermazione relativa a un modello che valuta milioni di invii |
| Phrasly | Si presenta come un rimuovitore del rilevamento AI, non pubblica alcun dato di test | Nessuna affermazione pubblica in un senso o nell'altro. Le cifre che circolano nelle recensioni sono di seconda mano e qui sono escluse per principio |
| Grammarly | Non commercializza affatto la propria riscrittura come aggiramento del rilevamento. La sua pagina del rilevatore AI afferma un'accuratezza di rilevamento del 99% e una classifica al primo posto nel benchmark indipendente di RAID | La stessa pagina di Grammarly afferma che nessun rilevatore AI è accurato al 100%. La funzione Authorship etichetta il testo come digitato da un essere umano, creato con AI o modificato con Grammarly |
| TextPulse | Un tasso di superamento del 92.33% su Turnitin AI, dell'89.12% su Originality.ai e dell'87.91% su GPTZero, misurato su un corpus accademico di 2,000 documenti | Misurato e pubblicato da TextPulse, quindi autodichiarato come ogni cifra sopra di esso. La dimensione del corpus e i rilevatori sono indicati, nessun esito del rilevatore è promesso per un singolo documento |
Tre cose emergono da quella tabella. La maggior parte di questi strumenti non pubblica alcuna dichiarazione di rilevamento da verificare. Alcuni associano una dimensione del campione a un numero, il che è più di quanto riesca a fare il resto della categoria. E nessuno di essi pubblica un dataset che chiunque al di fuori dell'azienda possa eseguire autonomamente. Tuttavia, va riconosciuto a ciascun marchio ciò che gli spetta. Undetectable.ai affianca un rimborso alla propria affermazione, il che costituisce un impegno concreto piuttosto che un aggettivo. WriteHuman pubblica limiti esatti di richieste e di parole per ciascun livello, così che un acquirente sappia che cosa sta ottenendo. Grammarly qualifica la propria cifra di accuratezza nella stessa pagina in cui la formula, il che è più di quanto facciano la maggior parte dei fornitori di detector. E il fatto che QuillBot scelga di non formulare affatto una dichiarazione di bypass è la posizione più difendibile nell'elenco.
Perché nessuno al di fuori del fornitore può verificare questi numeri
Un fornitore di humanizer che dichiara un tasso di superamento di Turnitin sta descrivendo esecuzioni effettuate tramite un account che controlla, su documenti da lui selezionati, in una data che di solito non indica, rispetto a un classificatore che Turnitin revisiona man mano che vengono rilasciati nuovi modelli linguistici. Questo vale per la cifra di trenta campioni di StealthGPT ed è altrettanto vero per la cifra di 2,000 documenti che questo sito pubblica. La dimensione del corpus modifica la quantità di rumore presente in un numero. Non trasforma un'autodichiarazione in una verifica.
L'altra metà del problema è che l'elenco stesso di Turnitin dei modelli che dichiara di rilevare viene modificato quando arrivano nuove versioni. Quel tasso di superamento misurato rispetto al classificatore del trimestre scorso descrive il classificatore del trimestre scorso e nient'altro. Il motivo per cui ciò significa che nessuno può indicare un miglior AI humanizer per bypassare Turnitin è esposto separatamente. Ogni cifra presente in ogni homepage di humanizer, compresa quella di questo sito, è un'istantanea che porta con sé una data che il fornitore potrebbe non aver mai pubblicato.
Come leggere una dichiarazione di bypass prima di pagarla
Quattro domande separano una dichiarazione che vale la pena considerare da una che vale la pena ignorare, e si applicano a ogni riga della tabella sopra, compresa l'ultima.
- Quanti documenti sono stati testati, e chi li ha scelti? Una percentuale senza una dimensione del campione alle spalle è uno slogan che indossa un numero.
- In quale data, e contro quale versione del detector? I modelli di rilevazione vengono revisionati man mano che vengono rilasciati nuovi modelli linguistici, e un tasso di passaggio senza data invecchia rapidamente.
- La garanzia è un rimborso o un risultato? Una promessa di rimborso trasferisce un piccolo rischio finanziario e non fa assolutamente nulla rispetto a un comitato di integrità accademica.
- Cosa dice il fornitore che accade a una citazione, a un termine tecnico o a una citazione in blocco? La maggior parte delle pagine di humanizer non dice nulla, il che è di per sé una risposta.
Quell'ultima domanda decide più di quanto faccia l'aritmetica del detector per chiunque presenti un lavoro accademico. Una riscrittura che ottiene un buon punteggio e generalizza silenziosamente una frase di metodologia ti è costata proprio ciò su cui venivi valutato. L'humanizer accademico di TextPulse documenta la conservazione delle citazioni in APA, MLA, IEEE, Chicago, Harvard e Vancouver, i freeze terms per bloccare il vocabolario esatto prima dell'esecuzione di un passaggio, e l'addestramento su testo accademico sottoposto a peer review con output mantenuto tra il livello 13 e 18 del Flesch-Kincaid. Si tratta di affermazioni su ciò che accade al testo, che è un tipo di affermazione diverso da una percentuale relativa a un detector, e un lettore può verificarle nell'output entro un minuto.
Cosa significa il punteggio per uno studente in ogni caso
Turnitin è chiaro nell'affermare che l'indicatore di scrittura AI non è una constatazione di cattiva condotta. La pagina del prodotto di Turnitin afferma esplicitamente che Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." Inoltre chiarisce che Turnitin fornisce informazioni per consentire agli insegnanti di prendere una decisione informata in base alle politiche della loro istituzione. Questo è ribadito dall'avvertenza che il modello "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."
Gli studenti non vedono il punteggio per impostazione predefinita. Turnitin afferma chiaramente che l'indicatore e il rapporto di rilevamento della scrittura AI non sono visibili agli studenti, e l'unico modo per vederli è che un docente scarichi il rapporto in formato PDF e lo consegni. Uno studente che controlla la propria bozza sta controllando uno strumento diverso, addestrato su dati diversi, e i due numeri non hanno alcun obbligo di coincidere.
Resta quindi la parte che nessun punteggio risolve. Se l'assistenza AI fosse consentita in assoluto è una questione per il corso e per l'istituzione, e una politica di uso dell'AI la risponde in un modo che una percentuale non fa mai. Un punteggio alto su un uso consentito e dichiarato è una conversazione con prove a sostegno. Un punteggio basso su un uso non dichiarato che la politica vieta è comunque un uso non dichiarato.
Per uno scrittore che modifica la propria bozza, la lettura pratica di tutto questo è che il punteggio segue la scrittura. Il modello di Turnitin misura il pattern a livello di frase lungo l'intero documento, quindi le riscritture parziali producono spostamenti parziali e i passaggi di vocabolario producono spostamenti molto limitati, se non nulli. La guida completa su come umanizzare il testo AI esamina le modifiche strutturali che cambiano il pattern, nell'ordine che lo sposta di più.
Il humanizer AI di TextPulse applica queste modifiche strutturali all'intero documento in una sola volta e riporta un Human Score stimato calcolato dal testo stesso, mai una previsione di ciò che dirà un rilevatore nominato. Nessuno strumento può promettere un esito su Turnitin, perché nessuno strumento può vedere all'interno del modello di Turnitin. Qualsiasi prodotto che affermi il contrario sta descrivendo un risultato che non ha modo di osservare.
La distinzione tra un humanizer e un parafrasatore è importante qui, così come il motivo per cui il testo parafrasato viene comunque segnalato.
Il numero è la parte meno interessante di tutto questo. Ciò che decide l'esito sono i venti minuti dopo che un correttore lo guarda: se il testo può mostrare il proprio processo, una storia delle bozze, una serie di appunti, fonti di cui chi scrive può parlare senza aprirle. Questa prova è disponibile per chiunque abbia svolto il lavoro, e sopravvive a un punteggio che una riscrittura non è riuscita a modificare.
Domande frequenti
Le stesse indicazioni di Turnitin affermano che il suo indicatore AI include il rilevamento di contenuti che possono essere stati umanizzati o passati attraverso un bypasser. Ciò che il prodotto restituisce concretamente è una percentuale di testo idoneo, non un verdetto sulla paternità. Quindi la risposta pratica alla domanda se Turnitin può rilevare testo umanizzato è che il punteggio riflette quanto del modello di scrittura della macchina è sopravvissuto alla riscrittura.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.