Poate Turnitin să detecteze textul AI umanizat?
Turnitin spune că indicatorul său de scriere AI acoperă deja textul trecut printr-un humanizer. Ce înseamnă și ce nu înseamnă această afirmație, de ce un document umanizat uneori tot obține un scor mare și alteori nu, și ce valoare are numărul pentru un student, în orice caz.
Turnitin răspunde la această întrebare pe propriul său site de suport, iar răspunsul este mai specific decât oricare dintre cele două poziții ale argumentului obișnuit. Indicatorul său de scriere AI, Turnitin says, include deja detectarea conținutului generat de AI care ar fi putut fi umanizat sau trecut printr-un bypasser pentru a evita detectarea. Aceasta este descrierea propriului produs de către un furnizor. Este și locul potrivit de unde să începi, pentru că îți spune ce pretinde modelul că acoperă.
Așadar, poate Turnitin detecta textul umanizat? Întrebarea are o formă mai restrânsă și mai utilă. Modelul Turnitin nu caută amprenta unui humanizer și nu păstrează nicio listă de instrumente. El acordă un scor prozei, propoziție cu propoziție, în funcție de cât de strâns se potrivește scrierea cu tiparele statistice ale textului generat de mașină, apoi face media acestor scoruri pe întregul document. Dacă un pasaj umanizat obține în continuare un scor ridicat depinde de cât de mult a schimbat rescrierea acel tipar și de cât de mult din document a fost rescris în total.
Poate Turnitin detecta textul umanizat? Ce susține Turnitin
Poziția lor publicată este un da simplu. Răspunzând la întrebarea dacă poate detecta conținut care a fost trecut printr-un humanizer, ghidul lor afirmă: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." Aceeași pagină oferă același răspuns pentru instrumentele de parafrazare AI.
Această afirmație nu apare ca un al doilea număr undeva în raport. Turnitin o încorporează în singurul procentaj de scriere AI, iar definiția publicată a acestui procentaj spune acest lucru în mod direct: el acoperă textul pe care modelul îl consideră probabil generat de AI, sau probabil generat și apoi modificat de un parafrazator AI sau de un bypasser. Există un singur scor, iar acesta ia deja în calcul rescrierea, în măsura în care modelul este capabil să o facă.
Citiți cu atenție, aceasta este o afirmație despre acoperire, nu o afirmație despre acuratețe. Turnitin spune că textul umanizat a fost în sfera de aplicare atunci când modelul a fost construit. Se oprește mult înainte de a spune că fiecare document umanizat obține un scor mare, iar propriile sale cifre publicate, mai jos, descriu un model care tratează propozițiile individuale ca fiind incerte.
Ce Scorizează de Fapt Indicatorul de Scriere AI
Nu este un procent. Este o fracțiune de text, deci nu este un nivel de încredere. Este o măsură a cantității de text din documentul dumneavoastră pe care modelul nostru o consideră probabil generată de AI. O numim text calificat, ceea ce înseamnă propoziții în proză într-un format de scriere de tip lung. Nu include liste cu puncte, cod, tabele sau fragmente scurte. Și de aceea ați putea vedea numere diferite pentru aceeași lucrare, în funcție de cât de mult din ea este proză continuă.
Mecanismul de dedesubt este suficient de simplu pentru a fi imaginat. Turnitin împarte un document în segmente suprapuse de aproximativ câteva sute de cuvinte, cam cinci până la zece propoziții fiecare, suprapuse astfel încât fiecare propoziție să primească un scor în context. Fiecărei propoziții i se atribuie o valoare între 0 și 1. Scorurile segmentelor sunt apoi mediate pe întreg documentul pentru a produce singurul număr pe care îl vede un cadru didactic. O prezentare pas cu pas a modului în care Turnitin detectează AI parcurge fiecare etapă în mai mult detaliu.
Pasul de mediere contează mai mult pentru textul umanizat decât orice altceva din fluxul de procesare, și este partea pe care aproape nimeni nu o ia în calcul. Cifra pe care o citește un cadru didactic este o medie aritmetică a judecăților la nivel de segment. Un document poate fi rescris pe jumătate și poate ajunge undeva la mijloc din motive care au puțin de-a face cu cât de bună a fost rescrierea.
De ce rezultatul umanizat uneori tot obține un scor mare
Cel mai frecvent motiv este acoperirea. Un humanizer aplicat unei introduceri și unei concluzii lasă neatinse recenzia literaturii și discuția, iar acele segmente își păstrează scorurile originale și intră direct în medie. Într-un capitol lung, rescrierea paginilor de început schimbă câteva segmente și le lasă pe celelalte exact așa cum erau, ceea ce produce o variație mai mică decât se așteaptă autorul de la o lucrare care a părut substanțială.
Al doilea motiv este profunzimea rescrierii. O trecere care înlocuiește vocabularul, păstrând în același timp lungimile propozițiilor, ordinea propozițiilor subordonate și alegerile de tranziție, lasă modelul pe care a fost antrenat clasificatorul în mare parte intact. Modelul evaluează forma prozei, astfel încât schimbarea cuvintelor care umplu acea formă contează mai puțin decât presupun cei mai mulți oameni. Un free perplexity checker va arăta cât de previzibilă încă pare o secvență după o rescriere, ceea ce este un semnal mai informativ decât o comparație la nivel de cuvânt între înainte și după.
Al treilea motiv este că o rescriere își poate instala propria regularitate. Un program care aplică aceeași transformare fiecărui paragraf va produce un model nou care este la fel de regulat ca cel vechi. Dacă fiecare propoziție are același tip de tăietură internă prin ea, sau dacă fiecărei propoziții i se adaugă în același loc același fel de propoziție de atenuare, acele propoziții vor fi percepute de un clasificator la fel de uniform cum ar fi fost dacă, de la început, toate ar fi avut aceeași lungime.
| Situație | Ce face scorul AI | De ce |
|---|---|---|
| Doar o parte din document a fost rescrisă | Scade mai puțin decât era de așteptat | Segmentele neatinse își păstrează scorurile originale în medie |
| Vocabularul a fost schimbat, structura propozițiilor a fost păstrată | Se modifică foarte puțin | Clasificatorul punctează tiparele la nivel de propoziție pe care schimbul le-a lăsat în loc |
| Propozițiile au fost restructurate în mod real pe tot parcursul | Se modifică mai mult | Ritmul uniform pe care modelul a fost antrenat să îl recunoască este rupt |
| Au fost trimise mai puțin de 300 de cuvinte de proză | Nu se generează deloc niciun scor | Turnitin necesită 300 de cuvinte de proză eligibilă înainte de a raporta un procent |
| Rezultatul ajunge sub 20 percent | Un asterisc în locul unei valori | Turnitin marchează rezultatele din acest interval ca fiind mai puțin fiabile |
De ce aceeași rescriere produce uneori un scor scăzut
Un document umanizat poate reveni cu un scor scăzut din motive care nu au legătură cu rescrierea. Turnitin are nevoie de cel puțin 300 de cuvinte de proză eligibilă înainte de a genera deloc un procent AI, un prag pe care l-a ridicat de la 150 de cuvinte inițiale pe motivul declarat că acuratețea se îmbunătățește cu puțin mai mult text. O piesă reflexivă scurtă nu produce nicio valoare numerică, iar un scor absent nu este același lucru cu unul curat.
Turnitin marchează un interval sub 20 percent cu un asterisc, în loc să ofere un procent exact, deoarece în acest interval există o incidență mai mare a falselor pozitive. La momentul lansării, relatările din educație au făcut referire și la acest comportament, spunând că rezultatele raportate ca fiind mai puțin de 20 percent scrise de AI aveau o incidență mai mare a falselor pozitive și, prin urmare, Turnitin a adăugat avertismente. Un document aflat în acea bandă a fost marcat ca un interval pe care Turnitin refuză să îl raporteze cu precizie, ceea ce este altceva decât a fi declarat conform.
Există, de asemenea, o poartă instituțională deasupra tuturor acestora. Turnitin procesează o trimitere pentru detectarea scrierii generate de AI numai dacă instituția a activat funcția, iar administratorii o pot dezactiva la nivelul întregului cont. Vanderbilt University a făcut exact acest lucru în august 2023, invocând rata de fals pozitiv de 1 percent publicată atunci de Turnitin, raportată la aproximativ 75,000 de trimiteri anuale, părtinirea împotriva scriitorilor care nu sunt vorbitori nativi de engleză și lipsa de transparență privind modul în care funcționează modelul. Un student de la o instituție cu funcția dezactivată nu are niciun scor AI pentru nicio trimitere, fie ea umanizată sau nu.
Și acolo unde rescrierea a fost cu adevărat structurală, scorul poate scădea deoarece tiparul măsurat s-a schimbat. Turnitin raportează o estimare calculată din tiparele de scriere, astfel încât textul ale cărui tipare diferă obține un scor diferit. Mecanismul funcționează în ambele direcții, iar aceasta este partea inconfortabilă, scrierea umană originală uneori obține un scor ridicat exact din același motiv.
Umanizează-ți propria lucrare
Transformă textul tău asistat de AI și fă-l să sune uman, fără a atinge cuvintele importante sau citările.
Ce susține fiecare furnizor de humanizer și ce este documentat
O singură regulă guvernează tabelul. Coloana din mijloc este limbajul de marketing al furnizorului, preluat de pe propriul său site ori de câte ori acel site ar putea servi unul. Coloana din dreapta consemnează ce se află de fapt în spatele fiecărei afirmații, ceea ce, în majoritatea cazurilor, nu este deloc un set de date, o dată sau o metodă. Nu există niciun test public comparativ direct pentru aceste branduri.
| Brand | Ce susține furnizorul | Ce este documentat |
|---|---|---|
| Undetectable.ai | Enumeră trecerea prin detectoarele AI ca funcție a produsului, fără nicio cifră atașată, și oferă să ramburseze costul humanizării dacă rezultatul este semnalat ca nefiind uman | Rambursarea este o clauză comercială, nu există niciun set de date, nicio dată și niciun rezultat pe detector care să susțină afirmația |
| QuillBot | Nu face nicio afirmație privind detectarea sau ocolirea pentru funcția de humanizer pe propriile pagini. Detectorul său AI separat este descris doar ca detectând conținut generat de AI | QuillBot vinde humanizerul în cadrul unei suite generale de scriere și nu face nicio afirmație specifică Turnitin pentru acesta |
| WriteHuman | Clasat pe locul întâi într-un Humanizer Leaderboard și descris ca humanizerul AI premium pentru scriere serioasă | Leaderboard-ul nu citează nicio metodologie sau eșantion, iar WriteHuman nu atașează nicio cifră numerică de acuratețe clasamentului |
| Walter Writes AI | Promovează humanizarea largă în peste 80 de limbi, fără o afirmație specifică Turnitin | Nu există date de test în niciun sens |
| HIX Bypass | Promovează pagini de ocolire detector cu detector, fără o cifră specifică Turnitin | HIX Bypass și BypassGPT sunt produse separate pe domenii separate, deci confirmați care dintre ele descrie o afirmație |
| StealthGPT | O medie de 98% uman pe Turnitin și 95% pe GPTZero, fiecare dintr-o rulare declarată de 30 de mostre cu zero detecții, plus o garanție de returnare a banilor dacă un abonat este detectat | Autodeclarat. Nu este publicat niciun set de date, nicio selecție a eșantionului, nicio dată și nicio metodă alături de cifre, iar 30 de documente reprezintă o rulare mică pentru o afirmație despre un model care evaluează milioane de trimiteri |
| Phrasly | Se poziționează ca un eliminator al detecției AI, nu publică date de test | Nicio afirmație publică în niciun sens. Cifrele care circulă în recenzii sunt din surse secundare și sunt excluse aici, din principiu |
| Grammarly | Nu își promovează deloc rescrierea ca ocolire a detecției. Pagina sa de detector AI susține o acuratețe a detecției de 99% și un clasament pe locul întâi în benchmark-ul independent al RAID | Aceeași pagină Grammarly afirmă că niciun detector AI nu este 100% precis. Funcția sa Authorship etichetează textul ca fiind tastat de un om, creat cu AI sau editat cu Grammarly |
| TextPulse | O rată de trecere de 92.33% pe Turnitin AI, 89.12% pe Originality.ai și 87.91% pe GPTZero, măsurată pe un corpus academic de 2,000 de documente | Măsurat și publicat de TextPulse, deci autodeclarat, la fel ca fiecare cifră de mai sus. Dimensiunea corpusului și detectoarele sunt numite, nu este promis niciun rezultat al detectorului pentru vreun document individual |
Trei lucruri rezultă din acel tabel. Majoritatea acestor instrumente nu publică nicio afirmație despre detector pe care să o verifice deloc. Câteva atașează unui număr o dimensiune a eșantionului, ceea ce este mai mult decât reușește restul categoriei. Și niciunul nu publică un set de date pe care cineva din afara companiei să îl poată rula singur. Totuși, merită acordat credit acolo unde fiecare marcă îl câștigă. Undetectable.ai pune o rambursare în spatele afirmației sale, ceea ce este un angajament concret, nu un adjectiv. WriteHuman publică limite exacte de cereri și de cuvinte, pe niveluri, astfel încât un cumpărător știe ce primește. Grammarly își califică propria cifră de acuratețe pe aceeași pagină în care o formulează, ceea ce este mai mult decât fac majoritatea furnizorilor de detectoare. Iar faptul că QuillBot refuză să facă deloc o afirmație de bypass este cea mai defensabilă poziție din listă.
De ce nimeni din afara furnizorului nu poate verifica aceste numere
Un furnizor de humanizer care afirmă o rată de trecere în Turnitin descrie rulări făcute printr-un cont pe care îl controlează, pe documente pe care le-a selectat, la o dată pe care de obicei nu o precizează, în raport cu un clasificator pe care Turnitin îl revizuiește pe măsură ce apar noi modele lingvistice. Acest lucru este valabil pentru cifra de treizeci de eșantioane a lui StealthGPT și la fel de valabil pentru cifra de 2,000 de documente pe care o publică acest site. Dimensiunea corpusului schimbă cât de mult zgomot se află într-un număr. Nu transformă o autoevaluare într-un audit.
Cealaltă jumătate a problemei este că propria listă a Turnitin cu modelele pe care pretinde că le detectează este editată pe măsură ce apar noi versiuni. Acea rată de trecere măsurată în raport cu clasificatorul din trimestrul trecut descrie clasificatorul din trimestrul trecut și nimic altceva. De ce acest lucru înseamnă că nimeni nu poate numi un cel mai bun AI humanizer pentru a ocoli Turnitin este expus separat. Fiecare cifră de pe fiecare pagină principală a unui humanizer, inclusiv a acestui site, este o imagine de moment care poartă o dată pe care furnizorul poate să nu o fi publicat niciodată.
Cum să citiți o afirmație de bypass înainte să plătiți pentru una
Patru întrebări separă o afirmație care merită cântărită de una care merită ignorată, iar ele se aplică fiecărui rând din tabelul de mai sus, inclusiv ultimului.
- Câte documente au fost testate și cine le-a ales? Un procent fără o dimensiune a eșantionului în spate este un slogan care poartă un număr.
- La ce dată și împotriva cărei versiuni a detectorului? Modelele de detecție sunt revizuite pe măsură ce apar noi modele lingvistice, iar o rată de trecere nedatată îmbătrânește repede.
- Garanția este o rambursare sau un rezultat? O promisiune de returnare a banilor transferă un risc financiar mic și nu face absolut nimic în privința unui comitet de integritate academică.
- Ce spune furnizorul că se întâmplă cu o citare, un termen tehnic sau un citat bloc? Majoritatea paginilor de humanizer nu spun nimic, ceea ce este în sine un răspuns.
Această ultimă întrebare decide mai mult decât o face aritmetica detectorului pentru oricine depune lucrări academice. O rescriere care obține un scor bun și generalizează în tăcere o propoziție din metodologie te-a costat tocmai lucrul pentru care erai evaluat. Humanizerul academic al TextPulse documentează păstrarea citărilor în APA, MLA, IEEE, Chicago, Harvard și Vancouver, freeze terms pentru blocarea vocabularului exact înainte de o rulare de trecere și instruirea pe text academic evaluat de colegi, cu ieșirea menținută la Flesch-Kincaid grade 13 to 18. Acestea sunt afirmații despre ceea ce se întâmplă cu textul, ceea ce este un tip diferit de afirmație față de un procent despre un detector, iar un cititor le poate verifica în rezultat în decurs de un minut.
Ce înseamnă scorul pentru un student, în orice caz
Turnitin este clar când afirmă că indicatorul de scriere AI nu este o constatare de abatere. Pagina de produs a Turnitin afirmă explicit că Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." De asemenea, precizează clar că Turnitin furnizează informații pentru a le permite profesorilor să ia o decizie informată, pe baza politicilor instituției lor. Acest lucru este reiterat prin avertismentul că modelul "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."
Studenții nu văd scorul în mod implicit. Turnitin afirmă clar că indicatorul și raportul de detectare a scrierii AI nu sunt vizibile pentru studenți, iar singura modalitate de a le vedea este ca un profesor să descarce raportul în format PDF și să îl predea. Un student care își verifică propriul draft verifică un instrument diferit, antrenat pe date diferite, iar cele două numere nu au nicio obligație să coincidă.
Asta lasă partea pe care niciun scor nu o rezolvă. Dacă asistența AI a fost permisă deloc este o întrebare pentru curs și pentru instituție, iar o politică de utilizare a AI răspunde la ea într-un mod în care un procent nu o face niciodată. Un scor mare pentru o utilizare permisă, declarată, este o discuție cu dovezi în spate. Un scor mic pentru o utilizare nedeclarată, interzisă de politică, rămâne tot utilizare nedeclarată.
Pentru un autor care își editează propriul draft, lectura practică a tuturor acestor lucruri este că scorul urmează scrierea. Modelul Turnitin măsoară tiparele la nivel de propoziție în întregul document, astfel încât rescrierile parțiale produc o mișcare parțială, iar trecerile de vocabular produc foarte puțină mișcare, dacă produc vreuna. Prezentarea completă a modului de a umaniza textul AI parcurge modificările structurale care schimbă tiparul, în ordinea care îl deplasează cel mai mult.
AI humanizer de la TextPulse aplică aceste modificări structurale asupra întregului document deodată și raportează un Human Score estimat calculat din textul însuși, niciodată o predicție despre ce va spune vreun detector numit. Niciun instrument nu poate promite un rezultat în Turnitin, deoarece niciun instrument nu poate vedea în interiorul modelului Turnitin. Orice produs care pretinde altfel descrie un rezultat pe care nu are cum să îl observe.
Distincția dintre un humanizer și un parafrazator contează aici, la fel ca motivul pentru care textul parafrazat este totuși semnalat.
Numărul este partea cea mai puțin interesantă a acestui lucru. Ceea ce decide rezultatul sunt cele douăzeci de minute după ce un evaluator se uită la el: dacă lucrarea își poate arăta procesul de lucru, o istorie a schițelor, un set de note, surse despre care autorul poate vorbi fără să le deschidă. Această dovadă este disponibilă oricui a făcut munca și supraviețuiește unei note pe care o rescriere nu a reușit să o schimbe.
Întrebări frecvente
Propriile îndrumări ale Turnitin spun că indicatorul său AI include detectarea conținutului care ar fi putut fi umanizat sau trecut printr-un bypasser. Ceea ce produce efectiv produsul este un procent din textul care se califică, nu un verdict asupra autoriei. Așadar, răspunsul practic la întrebarea dacă Turnitin poate detecta textul umanizat este că scorul reflectă cât din modelul de scriere al mașinii a supraviețuit rescrierii.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.