AI Detection

Rata de fals pozitiv Turnitin: ce arată cifrele

Turnitin publică două cifre privind falsul pozitiv, nu una, și niciuna nu descrie lucrarea aflată în fața unui anumit profesor. Iată împărțirea la nivel de document versus la nivel de propoziție, asteriscul sub pragul de 20%, și aritmetica ce transformă o fracțiune de procent într-un număr real de studenți.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

Rata falselor pozitive la Turnitin nu este un singur număr. Compania publică două: o valoare sub 1 procent la nivel de document și una mai apropiată de 4 procente la nivel de propoziție. Ambele sunt reale, ambele sunt publicate, iar niciuna, luată singură, nu spune prea multe despre lucrarea specifică aflată în fața unui profesor specific.

Diferența dintre aceste două valori și ceea ce se întâmplă odată ce oricare dintre ele este aplicată unei clase reale, nu unui singur document, este ceea ce analizează acest text: ce afirmă chiar Turnitin, ce acoperă de fapt cele două numere și aritmetica ce transformă o fracțiune de procent într-un număr real de studenți.

Care este rata falselor pozitive la Turnitin, potrivit Turnitin?

La nivel de document, în cuvintele companiei: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Această condiție contează la fel de mult ca numărul. Valoarea sub 1 procent nu este o afirmație despre fiecare lucrare evaluată de Turnitin. Ea descrie doar subsetul de lucrări care au depășit deja un prag de 20 percent de text scris de AI în propria estimare a modelului.

La nivel de propoziție, unde o interfață evidențiază linii individuale, nu un document întreg, valoarea oferită de Turnitin este de aproximativ patru ori mai mare. "Our sentence-level false positive rate is around 4%," afirmă compania. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin adaugă că aceste propoziții marcate greșit nu apar aleatoriu: în 54 percent din cazuri, o propoziție semnalată în mod fals se află imediat lângă text autentic generat de AI, ceea ce compania prezintă ca parte a motivului pentru care scorul la nivel de document tinde să fie mai solid decât orice linie evidențiată individual.

Nivelul de document și nivelul de propoziție nu sunt aceeași afirmație

Această împărțire în două niveluri reprezintă un mesaj revizuit, nu poziția inițială a Turnitin. La lansarea din aprilie 2023, compania a publicat o singură valoare sub 1%, fără nicio distincție între document și propoziție. După ce instituțiile au început să citeze acel număr și după ce presa din educație a raportat rate mai mari decât se aștepta de fals pozitive în condiții reale, directorul de produs al Turnitin a publicat defalcarea folosită mai sus, împreună cu două modificări de produs făcute ca răspuns: creșterea lungimii minime a documentului care poate fi punctat de la 150 la 300 de cuvinte și schimbarea modului în care sunt punctate propozițiile de la începutul și de la sfârșitul unui document.

Pragul de 300 de cuvinte există dintr-un motiv înrudit. Turnitin l-a ridicat de la un minim inițial de 150 de cuvinte după ce a constatat, în propriile cuvinte ale companiei, că acuratețea crește odată cu mai mult text. O trimitere scurtă, o reflecție de o pagină, un draft parțial, o postare de discuție, oferă modelului mai puțin semnal cu care să lucreze decât cele față de care au fost măsurate cifrele privind fals pozitive de mai sus, ceea ce face ca orice material sub acest prag să nu primească deloc un scor AI, în locul unuia nesigur.

NivelRata declarată de TurnitinCe acoperă de fapt
La nivel de documentSub 1%Doar documentele deja marcate cu 20% sau mai mult text scris de AI, procentul total pentru întreaga trimitere
La nivel de propozițieAproximativ 4%Orice propoziție individuală evidențiată în raportul de scriere AI, indiferent de scorul total al documentului
Sub pragul de 20% al documentuluiNu este afișat niciun numărTurnitin afișează un asterisc în locul unui procent, marcând rezultatul ca fiind mai puțin fiabil în acel interval

Umanizează-ți propria lucrare

Transformă textul tău asistat de AI și fă-l să sune uman, fără a atinge cuvintele importante sau citările.

Începe gratuit

Aritmetica: ce înseamnă o fracțiune de procent pentru o cohortă reală

Calculul a fost făcut public atunci când Vanderbilt University a calculat ratele de eroare asociate cu detectarea AI de către Turnitin în august 2023. Cel mai bun exemplu despre cum se face acest calcul este chiar modul în care Vanderbilt a obținut propriile cifre. Într-o postare pe blog despre decizia lor de a opri detectorul AI al Turnitin, au notat: "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."

Această cifră este propria extrapolare a Vanderbilt din numărul publicat de furnizor, aplicat la volumul propriu al Vanderbilt, nu un rezultat măsurat separat. Structura aritmeticii se generalizează dincolo de numărul de persoane al unei singure universități. O rată sub 1 la sută aplicată la câteva sute de lucrări produce câțiva studenți marcați eronat, ușor de trecut cu vederea. Aceeași rată aplicată la zeci de mii de lucrări, scara pe care o universitate reală o trimite în fiecare an, produce sute, nu doar câțiva, deoarece un procent mic și o populație mare sunt înmulțite împreună, nu considerate izolat.

Nimic din toate acestea nu dovedește că rata din lumea reală coincide exact cu cifra din laborator. Chiar directorul de produs al Turnitin a recunoscut public că rezultatele din lumea reală diferă de testarea de laborator, ceea ce face parte din motivul pentru care compania și-a revizuit mesajele de la bun început. Aritmetica de mai sus tratează numărul declarat de Turnitin ca pe o intrare care merită luată în serios, nu ca pe un plafon al ceea ce se întâmplă efectiv odată ce un instrument punctează lucrări care nu seamănă deloc cu un reper selectat.

Ce nu acoperă rata

Un rezultat sub pragul de 20 la sută nu primește un mic procent atașat. Primește un asterisc în locul unui număr, o alegere făcută de Turnitin deoarece acel interval este cel în care instrumentul este cel mai puțin fiabil în ambele direcții, lucru coroborat de relatări independente din presa educațională, alături de formularea companiei privind încrederea scăzută la acel interval. O editare ușoară, un paragraf revizuit cu ajutor și restul scris fără asistență, poate produce deloc un scor vizibil, nu unul mic, iar acest lucru merită știut înainte ca un număr lipsă să fie citit fie ca o acuzație, fie ca o dovadă de sănătate deplină. Ghidul TextPulse despre ce este considerat un scor bun Turnitin tratează același prag din perspectiva cititorului raportului.

Deci cum ar trebui citit un fals pozitiv publicat?

Ca o cifră a unui furnizor despre o condiție mai îngustă decât pare la prima vedere că o descrie, nu ca o afirmație despre lucrarea aflată în fața unui anumit profesor. Turnitin își formulează propriul rezultat în același mod, compania afirmă clar că tehnologia sa de detectare a scrierii generate de AI nu oferă „o constatare de abatere”, ci doar „date pentru ca educatorii să ia o decizie informată”. Dovezile mai ample privind dacă detectoarele AI sunt deloc precise susțin aceeași interpretare, o rată publicată descrie un reper, nu documentul care este evaluat în prezent.

Autorii care vor să știe unde se situează propriul lor draft pe același tip de măsurare statistică, în loc să ghicească, îl pot verifica direct cu un perplexity checker gratuit înainte ca vreun fragment să ajungă la detectorul unei instituții. Aceasta este o utilizare diferită a tehnologiei față de încercarea de a contesta un scor după fapt, și este singurul context în care un autor, nu un administrator, vede mai întâi numărul.

Precizia ZeroGPT este analizată separat pentru oricine a cărui instituție folosește acel instrument. Grupul asupra căruia aceste erori au cel mai mare impact, autorii de engleză care nu sunt vorbitori nativi, are propria sa pagină.

Populația cea mai expusă la această aritmetică nu este distribuită uniform nici ea. Autorii de limba engleză non-nativi poartă cel mai mare risc documentat de a ajunge de partea greșită a oricăruia dintre aceste procente, ceea ce este exact publicul în jurul căruia este construită pagina TextPulse pentru scriitori academici ESL. Turnitin va continua să revizuiască aceste cifre pe măsură ce își reantrenează modelul. Ceea ce nu se va schimba este aritmetica însăși, o rată atât de mică are încă nevoie de o populație atât de mare în care să dispară, iar majoritatea trimiterilor reale nu au această șansă.

XLinkedInFacebook

Întrebări frecvente

Rata de fals pozitiv Turnitin, conform propriilor cifre publicate ale companiei, nu este un singur număr. La nivel de document, Turnitin afirmă o rată sub 1%, dar numai pentru documentele deja semnalate cu 20% sau mai mult ca fiind scrise de AI. La nivel de propoziție, unde sunt evidențiate linii individuale, cifra proprie a companiei este de aproximativ 4%.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Rămâi la curent cu umanizarea AI

Primește în inbox sfaturi despre scriere academică, detectarea AI și umanizare.

Fără spam. Te poți dezabona oricând.