AI Detection

Turnitin hamis pozitív aránya: mit mutatnak a számok

A Turnitin két hamis pozitív értéket közöl, nem egyet, és egyik sem írja le azt a dolgozatot, amely egy adott professzor előtt fekszik. Itt látható a dokumentumszint és a mondatszint közötti különbség, a 20% alatti csillagozás, valamint az a számtan, amely egy százalék töredékét valódi hallgatói létszámmá alakítja.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

A Turnitin hamis pozitív aránya nem egyetlen szám. A vállalat kettőt közöl: egy 1 százalék alatti értéket dokumentumszinten, és egy körülbelül 4 százalékos értéket mondatszinten. Mindkettő valós, mindkettő közzétett adat, és egyik sem mond önmagában sokat arról a konkrét dolgozatról, amely éppen egy konkrét oktató előtt fekszik.

A két érték közötti különbség, valamint az, hogy mi történik, ha bármelyiket egy tényleges osztályra alkalmazzák egyetlen dokumentum helyett, az, amit ez az írás végigvesz: mit állít maga a Turnitin, mire terjed ki valójában a két szám, és milyen számtan alakít át egy százalék töredékét valós hallgatói létszámmá.

Mi a Turnitin hamis pozitív aránya, a Turnitin szerint?

Dokumentumszinten, a vállalat saját szavaival: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Ez a feltétel legalább annyira fontos, mint maga a szám. Az 1 százalék alatti érték nem minden Turnitin által pontozott dolgozatra vonatkozó állítás. Csak azoknak a dolgozatoknak az alcsoportját írja le, amelyek a modell saját becslése szerint már átlépték a 20 százalékos AI-written küszöböt.

Mondategység szintjén, ahol a felület egyes sorokat emel ki egy teljes dokumentum helyett, a Turnitin saját értéke nagyjából négyszer magasabb. "Our sentence-level false positive rate is around 4%," states the company. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." A Turnitin hozzáteszi, hogy ezek a tévesen jelölt mondatok nem véletlenszerűen szóródnak szét: az esetek 54 százalékában a hamisan megjelölt mondat közvetlenül valódi AI writing mellett áll, és a vállalat ezt részben annak okaként hozza fel, hogy a teljes dokumentumra vonatkozó pontszám általában megbízhatóbban állja meg a helyét, mint bármely egyetlen kiemelt sor.

A dokumentumszint és a mondatszint nem ugyanaz az állítás

Ez a két szintre bontott megfogalmazás módosított kommunikáció, nem Turnitin eredeti álláspontja. A bevezetéskor, 2023 áprilisában a vállalat egyetlen, 1% alatti értéket tett közzé, minden dokumentum és mondat közötti megkülönböztetés nélkül. Miután az intézmények elkezdték ezt a számot idézni, és miután az oktatási sajtó a vártnál magasabb, valós környezetben jelentkező téves pozitív arányokról számolt be, Turnitin vezető termékigazgatója közzétette a fent használt bontást, valamint két, erre válaszul végrehajtott termékváltoztatást, a minimálisan pontozható dokumentumhossz 150 szóról 300 szóra emelését, és annak módosítását, hogy a dokumentum eleji és végi mondatok miként kapnak pontszámot.

A 300 szavas alsó határ egy kapcsolódó okból létezik. Turnitin ezt az eredeti 150 szavas minimumról emelte meg, miután a vállalat saját szavaival megállapította, hogy a pontosság több szöveggel növekszik. Egy rövid beadott munka, egy egyoldalas reflexió, egy részleges vázlat, egy hozzászólás, kevesebb jelet ad a modellnek, mint amilyen ellen a fenti téves pozitív arányokat mérték, és ez része annak, hogy a küszöb alatti bármely szöveg egyáltalán nem kap AI-pontszámot, nem pedig megbízhatatlant.

SzintTurnitin által közölt arányMit fed le valójában
Dokumentumszint1% alattCsak azokat a dokumentumokat, amelyeket már 20% vagy annál magasabb AI-írásként jelöltek meg, a teljes beadott munka összesített százalékát
MondatszintKörülbelül 4%Bármely egyes mondatot, amelyet az AI writing report kiemel, függetlenül a dokumentum összesített pontszámától
A 20%-os dokumentumküszöb alattNem jelenik meg számTurnitin százalék helyett csillagot jelenít meg, jelezve, hogy az eredmény ebben a tartományban kevésbé megbízható

Emberibbé tenni saját dolgozatát

Alakítsa át az AI által támogatott szövegét úgy, hogy emberinek hangozzon, anélkül hogy fontos szavakat vagy hivatkozásokat érintene.

Kezdje el ingyen

A számtan: mit jelent egy százalék töredéke egy valós kohorsz esetében

A matematika nyilvánosan került elvégzésre, amikor a Vanderbilt University 2023 augusztusában kiszámította a Turnitin AI észleléséhez kapcsolódó hibaarányokat. Ennek a számításnak a legjobb példája a Vanderbilt saját, a számokkal végzett levezetése. Egy blogbejegyzésben, amelyben a Turnitin AI detektorának kikapcsolása melletti döntésüket ismertették, ezt írták: "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."

Ez az érték a Vanderbilt saját extrapolációja a szolgáltató közzétett számából, a Vanderbilt saját terhelésére alkalmazva, nem pedig külön mért eredmény. Az aritmetika szerkezete túlmutat egyetlen egyetem létszámán. Egy 1 százalék alatti arány néhány száz dolgozatra alkalmazva csak néhány tévesen megjelölt hallgatót eredményez, amit könnyű figyelmen kívül hagyni. Ugyanez az arány több tízezer dolgozatra alkalmazva, ami egy valódi egyetem éves benyújtási mennyisége, már nem néhány, hanem több száz esetet eredményez, mert egy kis százalékot és egy nagy populációt szoroznak össze, nem pedig elszigetelten vizsgálnak.

Mindebből nem következik, hogy a valós környezetben mért arány pontosan megegyezik a laboratóriumi értékkel. Turnitin saját vezető termékfelelőse nyilvánosan elismerte, hogy a valós eredmények eltérnek a laboratóriumi teszteléstől, és ez részben az oka annak, hogy a vállalat eredetileg módosította az üzenetét. A fenti aritmetika Turnitin saját közölt számát olyan bemeneti adatként kezeli, amelyet komolyan kell venni, nem pedig olyan felső határként, amely azt írja le, mi történik ténylegesen, amikor egy eszköz olyan beküldéseket pontoz, amelyek semmiben sem hasonlítanak egy gondosan összeállított viszonyítási alaphoz.

Mit nem fed le az arány

A 20 százalékos küszöb alatti eredményhez nem társul kis százalékérték. Ehelyett csillag kerül a szám helyére, ezt a Turnitin azért választotta, mert ebben a tartományban az eszköz mindkét irányban a legkevésbé megbízható, amit független oktatási sajtóbeszámolók is alátámasztanak, a vállalat saját, ebben a tartományban alkalmazott alacsony bizalmi keretezésével együtt. Egy enyhe szerkesztés, egy bekezdés segítséggel átdolgozva, a többi pedig önállóan megírva, egyáltalán nem látható pontszámot eredményezhet, nem pedig egy kicsit alacsonyat, és ezt érdemes tudni, mielőtt egy hiányzó számot valaki vagy vádként, vagy tiszta egészségi bizonyítványként olvasna. TextPulse útmutatója arról, mi számít jó Turnitin pontszámnak ugyanezt a küszöböt a jelentés olvasója felől tárgyalja.

Hogyan kell tehát értelmezni egy közzétett hamis pozitív arányt?

Úgy, mint egy szolgáltató olyan adatát, amely egy szűkebb feltételre vonatkozik, mint amilyennek elsőre látszik, nem pedig úgy, mint egy állítást az adott professzor előtt fekvő dolgozatról. A Turnitin a saját kimenetét is így keretezi: a vállalat világosan kijelenti, hogy az AI írásfelismerő technológiája nem ad "a determination of misconduct" eredményt, csupán "data for educators to make an informed decision." A arról szóló szélesebb bizonyíték, hogy az AI detektorok egyáltalán pontosak-e ugyanezt az értelmezést támasztja alá: egy közzétett arány egy viszonyítási alapot ír le, nem pedig azt a dokumentumot, amelyet éppen osztályoznak.

Azok az írók, akik tudni szeretnék, hogy saját vázlatuk ugyanezen statisztikai mérés szerint hol áll, a találgatás helyett közvetlenül ellenőrizhetik azt egy ingyenes perplexity checkerrel, mielőtt bármelyik intézményi detektorhoz eljutna. Ez a technológia másfajta használata, mint utólag vitatkozni egy pontszámmal, és ez az az egyetlen hely, ahol az író, nem pedig az adminisztrátor, először látja a számot.

A ZeroGPT pontosságát külön vizsgáljuk mindazok számára, akiknek az intézménye ezt használja. Az a csoport, amelyre ezek a hibák a legsúlyosabban hatnak, a nem anyanyelvi angol írók, külön oldalon szerepel.

A leginkább kitett népesség sem oszlik el egyenletesen ehhez az aritmetikához képest. A nem anyanyelvi angol írók viselik annak a legnagyobb, dokumentált kockázatát, hogy e százalékok bármelyikének rossz oldalára kerülnek, és pontosan erre a közönségre épül a TextPulse ESL akadémiai íróknak szóló oldala. Turnitin tovább fogja módosítani ezeket az adatokat, miközben újratanítja a modelljét. Ami nem fog változni, az maga az aritmetika: egy ilyen kicsi arányhoz még mindig ekkora népességre van szükség ahhoz, hogy eltűnjön benne, és a legtöbb valódi beadott munka nem ilyen szerencsés.

XLinkedInFacebook

Gyakran ismételt kérdések

A Turnitin hamis pozitív aránya, a cég saját közzétett adatai szerint, nem egyetlen szám. Dokumentumszinten a Turnitin 1% alatti arányt állít, de csak azokra a dokumentumokra, amelyeket már 20% vagy annál nagyobb AI-írásúnak jelölt. Mondatszinten, ahol az egyes sorok kiemelésre kerülnek, a cég saját értéke körülbelül 4%.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Maradjon naprakész az AI humanizálásról

Kapjon tippeket az akadémiai íráshoz, az AI-észleléshez és a humanizáláshoz közvetlenül az e-mail fiókjába.

Nincs spam. Bármikor leiratkozhat.