AI Detection

Che cos'è un buon punteggio Turnitin?

Turnitin non pubblica alcuna percentuale di similarità accettabile, e le istituzioni stabiliscono invece le proprie indicazioni. Questo post spiega che cosa determina davvero un punteggio alto o basso, perché il materiale citato e gli elenchi di riferimenti lo gonfiano senza che vi sia nulla di errato, e come leggere la ripartizione delle corrispondenze dietro il numero invece del numero stesso.

Aggiornato il 6 min
What is a good Turnitin score? A similarity report broken into matched sources rather than one number.

Uno studente si sente dire da un supervisore che qualsiasi valore sotto il quindici percento va bene. Un altro studente, sempre nello stesso dipartimento, vede il proprio elaborato segnalato lungo il corridoio al dodici percento, perché tre di quei punti rientrano in un unico paragrafo continuo, senza virgolette vicine. Entrambi leggono correttamente il punteggio di similarità di Turnitin. Lo strumento non è mai stato concepito, in primo luogo, per assegnare un unico numero di superamento o bocciatura.

Allora, qual è un buon punteggio di Turnitin? Non esiste un numero del genere. Turnitin non pubblica una percentuale accettabile, non valuta un invio e afferma chiaramente che il dato non è, da solo, una misura di plagio. Ogni istituzione stabilisce le proprie indicazioni, e spesso lo fa anche ogni supervisore al suo interno, ed è per questo che lo stesso rapporto può apparire insignificante in un ufficio e preoccupante in quello accanto. Il numero che vale la pena imparare è quello che permette di leggere ciò che vi sta dietro.

Turnitin similarity report showing 12% overall similarity with match groups for uncited matches and missing quotations, and top sources split across internet, publications and student papers
Un rapporto di similarità al 12% suddiviso in gruppi di corrispondenza: ciò che conta non è il numero principale, ma quanta parte di esso è testo corrispondente non citato rispetto a materiale citato e referenziato.

Che cos'è un buon punteggio di Turnitin?

Turnitin non ha mai pubblicato un numero che possa essere considerato buono, sicuro o accettabile, e per una ragione precisa: il punteggio di similarità misura quanto testo in un elaborato corrisponde a testo già presente nei database di Turnitin, non se tale sovrapposizione sia stata usata in modo improprio. Un punteggio alto può derivare interamente da materiale citato e referenziato correttamente. Un punteggio basso può trovarsi sopra un elaborato che parafrasa una fonte abbastanza da vicino da creare problemi a un esaminatore, senza attivare affatto il motore di corrispondenza. Leggere il numero come un voto significa usare lo strumento al contrario.

Una cifra come il dieci o il venti percento circola ampiamente come regola empirica informale, ripetuta in forum e guide di studio fino a sembrare ufficiale. Non è ufficiale. Turnitin non stabilisce alcuna cifra del genere, e una regola empirica che ignora la lunghezza del documento, la densità delle citazioni e le convenzioni del settore crolla nel momento in cui incontra un testo reale. Una rassegna della letteratura costruita da trenta fonti correttamente citate può superare il venti percento solo per le citazioni. Un singolo paragrafo parafrasato molto da vicino, senza virgolette, può restare sotto il cinque percento e tuttavia costituire il problema più serio.

Cosa misura realmente il Similarity Score

Turnitin descrive il proprio strumento in termini quasi identici. Una guida della Boise State University, basata sul linguaggio stesso di Turnitin, spiega che il similarity score è una percentuale del contenuto di un elaborato che corrisponde a materiale già presente nei database di Turnitin, e che la percentuale in sé non è una valutazione del fatto che il testo contenga materiale plagiato. La distinzione è sostanziale: la corrispondenza è meccanica, una sequenza di parole che si allinea con una sequenza di parole altrove, mentre stabilire se tale sovrapposizione sia stata correttamente attribuita richiede una persona, non un algoritmo.

I database alla base della corrispondenza sono ampi per scelta: elaborati studenteschi attuali e archiviati, il web aperto e un vasto corpus di pubblicazioni accademiche. Nessuno di questi contenuti viene letto per il significato. Il sistema individua sequenze sovrapposte di parole e segnala quanta parte di un elaborato esse coprano, ed è per questo che una frase citata e una copiata senza dichiararlo possono produrre una corrispondenza identica. Solo la vista dettagliata del report mostra quale dei due casi si tratti.

Perché un punteggio alto può essere del tutto legittimo

Due caratteristiche ordinarie della scrittura accademica spiegano la maggior parte del fenomeno. I passaggi tra virgolette corrispondono per definizione, poiché le parole sono copiate intenzionalmente e indicate sulla pagina come appartenenti a un altro autore. Anche gli elenchi bibliografici corrispondono con la stessa affidabilità, perché nomi degli autori, titoli delle riviste e formati di citazione si ripetono in migliaia di altri elaborati che citano le stesse fonti. Entrambi sono esattamente l'aspetto che una scrittura accademica corretta dovrebbe avere.

Affiancati, un punteggio gonfiato e un problema reale appaiono diversi a colpo d'occhio.

Cosa è stato trovatoPerché è successoVale un esame più attento?
Un passaggio citato con virgolette e una citazioneLe parole sono state copiate intenzionalmente e attribuite nella paginaNo, questo è l'aspetto di una citazione corretta
Un elenco di riferimenti o una bibliografiaI nomi degli autori, i titoli delle riviste e i formati di citazione si ripetono in molti altri articoliNo, a meno che l'impostazione di esclusione non sia stata applicata
Metodi standard o formulazioni proceduraliIl vocabolario condiviso di un settore descrive lo stesso processo nello stesso modo in tutti gli articoliRaramente, a meno che l'intera sezione non sia stata ripresa invece di essere scritta ex novo
Un paragrafo lungo e continuo senza virgolette, che corrisponde a una singola fonteLa formulazione segue abbastanza da vicino la frase di un altro autore da essere rilevata dal motore di corrispondenzaSì, questo è il modello per cui vale la pena aprire la fonte e controllare

Umanizza il tuo articolo

Trasforma il tuo testo assistito dall'AI e fallo suonare umano, senza toccare parole importanti o citazioni.

Inizia gratis

Perché un punteggio basso può comunque nascondere un problema

Un numero basso risponde a una domanda più ristretta di quanto sembri, cioè se poco testo coincide parola per parola con i database di Turnitin, e nient'altro. Una parafrasi che modifica abbastanza la formulazione mantenendo intatti la struttura e l'argomentazione di un altro autore può ottenere un punteggio vicino a zero e restare comunque un serio problema di integrità, poiché il motore lavora su sequenze di parole, non su idee prese in prestito. I contenuti tradotti, o il materiale proveniente da database indicizzati da Turnitin, si comportano allo stesso modo: nulla da confrontare, nulla da segnalare.

Le fonti fabbricate creano lo stesso punto cieco da una direzione diversa. Un riferimento che non esiste non può corrispondere a nulla, perché non c’è nulla, da nessuna parte, a cui possa corrispondere, e un punteggio di similarità non ha modo di segnalare una citazione che non è mai stata reale fin dall’inizio. Il controllore gratuito di citazioni AI di TextPulse esiste proprio per colmare questa lacuna: confronta ogni voce di un elenco di riferimenti con i registri effettivi in cui tali fonti dovrebbero comparire, prima che un lettore debba individuare la lacuna con difficoltà.

Vale la pena fare un’ulteriore distinzione prima di passare oltre il numero in sé. Un elaborato con un basso punteggio di similarità può comunque riportare il distinto indicatore di scrittura AI di Turnitin, una misura diversa costruita per intercettare un tipo diverso di problema, trattata nella guida di questo sito su se Turnitin possa davvero rilevare ChatGPT. Le due percentuali non sono calcolate nello stesso modo, e questo articolo riguarda soltanto il punteggio di similarità.

Come leggere il rapporto invece del numero

Non reagire al totale prima di aprire la ripartizione delle corrispondenze. Turnitin ordinerà le fonti umane, che compongono un punteggio, in base al loro contributo ad esso. Un totale del ventidue percento composto da undici fonti che contribuiscono per due percento ciascuna non si legge come un totale composto da una sola fonte. Il primo schema tende a riflettere una sovrapposizione di molte espressioni comuni. Il secondo merita un esame diretto di ciò che quella fonte dice effettivamente.

Turnitin suddivide inoltre la stessa percentuale in una fascia di colore, riprodotta nella guida ufficiale del Loughborough College per gli studenti: blu per nessun testo corrispondente, verde da una parola al ventiquattro percento, giallo dal venticinque al quarantanove, arancione dal cinquanta al settantaquattro, rosso dal settantacinque in su. La guida ufficiale del college è esplicita su ciò che i colori non sono: i controlli di similarità non significano che un elaborato contenga materiale plagiato. Il colore ordina un rapporto per attirare l’attenzione, non per emettere un verdetto.

Che le impostazioni proprie di un'istituzione escludano o meno le citazioni e la bibliografia dal conteggio è comunque opportuno verificarlo, poiché lo stesso invio può produrre due numeri diversi a seconda di come è impostato quel selettore. Nulla di tutto ciò è complicato una volta che è visibile. È invisibile solo se nessuno apre il rapporto oltre la sua prima pagina.

Cosa fare se il tuo punteggio ti sorprende

Riapri singolarmente ogni fonte segnalata, invece di reagire al totale complessivo. Verifica se la versione che viene valutata ha citazioni e bibliografia escluse, poiché il numero che uno studente vede durante la stesura non è sempre configurato nello stesso modo del numero che un docente vede al momento dell'invio. Quando emerge una corrispondenza autentica non attribuita, correggi direttamente la citazione invece di riformulare le frasi per eludere il motore di corrispondenza, che tratta il sintomo e lascia intatto il problema.

Se il numero continua a sembrare incoerente rispetto a ciò che un supervisore si aspetta, chiedi direttamente quale sia la convenzione propria di quel dipartimento. Le sezioni sopra mostrano già che non esiste una soglia unica da raggiungere, quindi la risposta sta con chi ha autorità locale sull'elaborato, non con una percentuale che chiunque avrebbe potuto consultare in anticipo. La raccolta di strumenti gratuiti di TextPulse copre i controlli di citazione e di stesura che vale la pena eseguire prima che un rapporto arrivi nella casella di posta di qualcun altro.

I punteggi di strumenti diversi non sono intercambiabili, e come funziona GPTZero è illustrato in una pagina propria, insieme a la statistica di perplexity che si trova alla base di entrambi.

Il punteggio si comporta nel modo in cui si comporta a causa di come avviene la corrispondenza al di sotto di esso, e il numero più recente ora affiancato ad esso nello stesso rapporto funziona con un meccanismo diverso, quello che la guida di questo sito su come funzionano davvero i rilevatori di AI illustra per intero. Leggere uno dei due numeri come un verdetto salta l'unica parte del rapporto che vale la pena leggere.

Domande frequenti

Che cos'è un buon punteggio Turnitin? Non esiste un numero del genere. Turnitin non pubblica una percentuale accettabile, e il punteggio di similarità misura quanto testo corrisponde ai suoi database, non quanto sia stato plagiato. Una rassegna della letteratura correttamente citata può superare il venti percento solo per via delle citazioni, mentre una singola parafrasi non attribuita può restare sotto il cinque. Leggi le fonti corrispondenti, non il dato principale.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Rimani aggiornato sulla humanization con AI

Ricevi nella tua casella di posta consigli su scrittura accademica, rilevamento AI e humanization.

Niente spam. Annulla l'iscrizione in qualsiasi momento.