AI Detection

Mennyire pontosak az AI-detektorok? Hamis pozitív eredmények és torzítás

A szolgáltatók 1 százalék alatti hamis pozitív arányokat tesznek közzé. Független kutatók, akik ugyanazokat a detektorokat nem anyanyelvi angol írásokon tesztelték, 60 százalék feletti arányokat találtak. Íme, mit mutatnak a bizonyítékok.

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin azt állítja, hogy a hamis pozitív arányuk kevesebb mint 1%. Független kutatók egy csoportja több detektort tesztelt a nem anyanyelvi angolul írók szövegmintáinak szélesebb körén. Azt találták, hogy az átlagos hamis pozitív arány ugyanazon írástípus esetében meghaladta a 60%-ot. Mindkét szám valós, mindkettőt publikálták, és mindkettő olyan detektorokra vonatkozik, amelyeket ugyanannak a piacnak értékesítenek. Pontosak az AI detektorok? Ez attól függ, milyen populáción tesztelték őket, melyik detektort használták, és hogyan határozta meg ezt eleve a szolgáltató.

Ez a bejegyzés nem fogja újra elmagyarázni, hogyan számítja ki egy detektor ezt a pontszámot. A mechanizmus, a perplexity, a token valószínűség, az, hogy a klasszifikátort hogyan tanítják, másutt részletesen ismertetve van, és érdemes először elolvasni, ha még nem tette meg. Itt az számít, mi történik, miután a pontszám már létezik: milyen gyakran téves, kinek az írásáról téved a leggyakrabban, és mibe kerül valójában egy hamis vád annak, aki semmi rosszat nem tett.

Pontosak az AI detektorok?

Nem következetesen, és a marketingállítások és a független tesztelés közötti rés jól dokumentált. Debora Weber-Wulff vezette kutatói csoport 2023-ban közzétette 14 detektáló eszközön, köztük 12 ingyenes és két kereskedelmi eszközön végzett vizsgálatának eredményeit, amelyeket emberi és ChatGPT szövegek keverékével teszteltek. Azt találták, hogy egyik eszköz sem pontos vagy megbízható, és beépített elfogultságuk van arra, hogy a gépi szöveget emberinek címkézzék, nem pedig fordítva. A tesztben szereplő két kereskedelmi eszköz Turnitin és PlagiarismCheck volt. A tesztben szereplő összes eszköz rosszabbul teljesített, amikor a szöveget parafrazálták.

De két év elteltével a helyzet nem stagnál. A University of Chicago Booth School egyik working paperje, Brian Jabarian és Alex Imas szerzőktől, három új belépőt, Pangramot, GPTZero-t és Originality.ai-t, valamint egy nyílt forráskódú versenytársat vetett alá próbának csaknem 2,000, blogokból, hírekből, értékelésekből és fikcióból származó, ember által írt szöveggel. Ellenőrzött tesztkörülmények között a mezőny legjobb eszköze soha nem esett 99.8 percent accuracy alá, és a false positive rate-je alacsony szinten maradt. A nyílt forráskódú modell ugyanolyan jól teljesített, mint egy véletlen tippelő. A helyzet valóban javult. Valamelyest. Kissé.

De a bökkenő a controlled szó. A benchmark szövegek tiszták, teljesek, és ismert körülmények között készülnek. Egy benyújtott esszé ezek közül egyik sem megbízhatóan. A valós környezetbeli eredmények nem feltétlenül azonosak a laboreredményekkel, ahogyan azt a Turnitin saját chief product officer-e nyilvánosan is elmondta, bár ez ritka és hasznos elismerés egy szállítótól. A következő szakasz a szállítói számokat az független számok mellé helyezi, hogy a különbség látható legyen, ne csupán állított.

Szállítói állítások az független teszteléssel szemben

Az alábbi táblázat egymás mellé rendezi, hogy négy detektor mit állít magáról, és hogy mit mértek a független kutatók, amikor közvetlenül tesztelték az eszközöket. A két középső oszlopot együtt olvassa, ne csak a szállítói oszlopot.

DetektorA gyártó által állított pontosságFüggetlenül megfigyeltMit mond a gyártó a hamis pozitív eredményekről
Turnitin98% bizalmi küszöb a megjelölés előtt, dokumentumszinten 1% alatti hamis pozitív eredményekKörülbelül 80% pontosság, a 12 eszköz közül a legjobb egy 2023-as összehasonlításban, a eszköz egy korábbi verziójánDokumentumszinten 1% alatt, 20% AI-written küszöb felett, mondatszinten körülbelül 4%
GPTZero95.7% AI-szöveg felismerés 1% hamis pozitív arány mellett az független RAID benchmarkon96% pontosság rövid szakaszokon, 1% alatti hamis pozitív arány egy 2025-ös University of Chicago Booth tanulmányban1% hamis pozitív arányt közöl a RAID benchmarkon
Originality.ai99% pontosság, 0.5% hamis pozitív arány, Lite modell, 1.5%, Turbo modell1% alatti hamis pozitív arány, de az AI-written szöveg 10% és 40% közötti részét nem észlelte ugyanabban a Booth tanulmánybanKülön hamis pozitív adatokat tesz közzé modell szintenként
PangramAz általa közölt hibaarányok több mint 38-szor alacsonyabbak a versengő eszközöknél, azt állítja, hogy nincs elfogultság a nem anyanyelvi angol írókkal szembenA pontosság soha nem volt 99.8% alatt, a hamis pozitív arány közel nulla volt a Booth tanulmánybanAzt állítja, hogy a hamis pozitív arány közel nulla 10 szövegtartományban és 8 nyelvi modellben

Két dolog tűnik ki. Először is, minden gyártói adat egy olyan laborból származik, amelyet a gyártó irányít, a Booth adatai pedig olyan kutatóktól, akiknek nincs eladnivalójuk. Másodszor, Turnitin egyáltalán nem szerepel abban a középső oszlopban, mivel a 2025-ös tanulmány nem tesztelte. A táblázatban szereplő független adat egy korábbi, 2023-as összehasonlításon alapul, de az eszköz egy régebbi verzióján készült, ezért ezt tartsa szem előtt, amikor a táblázatot közvetlen összehasonlításként nézi.

Mennyire pontos a Turnitin AI-felismerése?

Turnitin nem tesz közzé egyetlen pontossági értéket. Ehelyett egy küszöbértéket és egy kompromisszumot tesz közzé. A vállalat közölte, hogy csak akkor jelöl meg egy dokumentumot, ha 98 százalékos bizonyossággal úgy ítéli meg, hogy a megjelölt rész AI által írt, és hogy ez a küszöbérték tartja a dokumentumszintű hamis pozitív arányt 1 százalék alatt. Turnitin becslése szerint az AI által segített írások körülbelül 85 százalékát észleli, a többit szándékosan átengedi, a téves vád kockázatának elkerülése érdekében.

A Turnitin által mondatszinten visszaadott hamis pozitív eredmények tényleges aránya, ahol a felület konkrét sorokat emel ki egy teljes dokumentum helyett, valójában közelebb van a 4 százalékhoz. Ezt az értéket érdemes ismerni, ha egy professzor egyetlen megjelölt bekezdésről készít képernyőképet a teljes dokumentum pontszáma helyett, mert egy kiemelt mondat érdemben nagyobb eséllyel hibás, mint a mellette szereplő dokumentumpontszám.

Érdemes azt is megjegyezni, hogy Turnitin ezt a különbséget közvetlenül elismerte. Megállapították, hogy az első, valós környezetben kapott eredményeik, különösen a rövidebb dokumentumok esetében, a laboratóriumi tesztek alapján vártnál magasabb hamis pozitív arányt mutattak. Ezért a pontozáshoz szükséges minimális dokumentumhosszt 150 szóról 300 szóra módosították. Ez azt jelenti, hogy egy szolgáltató a saját termékét igazítja, mert a közzétett szám a laboron kívül nem állta meg a helyét, és ez legalább annyit elárul, mint bármely független tanulmány.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Mit jelent valójában egy hamis pozitív eredmény egy hallgató számára

Ez történt egy Yale School of Management executive MBA hallgatójával. A hallgatót a lehető legszorosabb értelemben véve szabálysértéssel vádolták. Az érintett detektor GPTZero volt. A hallgató pénzügyi tárgyból írt záróvizsgáját egy oktatási asszisztens jelölte meg, aki úgy vélte, hogy az írás hosszú és kidolgozott, közel tökéletes központozással és nyelvtannal. És ezt a konkrét professzor GPTZero-n futtatta át, amely a válaszokat valószínűleg AI által generáltnak értékelte.

Nem teljesítette a kurzust, és egy évre felfüggesztették. A 2025 februárjában a szövetségi bíróságon benyújtott keresete azt állítja, hogy a Yale saját szabályzata éppen ezért korlátozza az olyan eszközök használatát, mint a GPTZero, nevezetesen a nem anyanyelvi angol beszélőkkel szembeni dokumentált téves pozitív arány miatt, és hogy ő e szabályzattal ellentétesen használta azt. A beadvány azt is idézi, hogy a GPTZero 100 százalékos AI-generated pontszámot adott a Yale saját korábbi egyetemi elnökének és az üzleti iskola dékánjának tudományos írására.

A bíró 2025 májusában elutasította egy korai ideiglenes intézkedés kiadását. Az ügyet még nem zárták le, amikor ezt írom. A felperes, egy francia állampolgár, azt állítja, hogy ugyanez a nem anyanyelvi angol beszélőkkel szembeni ismert torzítás okozta, hogy az írása úgy teljesített, ahogyan teljesített. Ezt vizsgáljuk a következő szakaszban. Ami nem vita tárgya, az az ár, egy év elvesztése a képzési programból, egy elégtelen osztályzat, jogi költségek, és több hónapnyi küzdelem egy pontszám miatt ahelyett, hogy diplomát szerzett volna. Az 1 százalékos téves pozitív arány csekélynek hangzik, amíg egy nagy populáció valakivé nem teszi.

Miért osztályozzák tévesen az AI detektorok a nem anyanyelvi angol beszélőket?

Rossz hatásfokkal, és nagy mértékben. Ez volt annak a tanulmánynak a következtetése, amely először számszerűsítette ezt. A Stanford kutatói hét széles körben használt GPT detektort futtattak 91 TOEFL esszén, amelyeket nem anyanyelvi angol beszélők írtak, valamint 88, amerikai nyolcadikosok által írt esszén. A detektorok a nyolcadikos esszéket szinte minden alkalommal helyesen olvasták. Amikor a TOEFL esszékről volt szó, amelyeket olyan felnőttek írtak, akik elég folyékonyan beszéltek ahhoz, hogy egy mesterképzési szintű angol tesztet tegyenek, a detektorok átlagos téves pozitív aránya 61.3 százalék volt. A 91 esszé közül 89-et legalább az egyik a hét detektor közül GPT által generáltnak jelölt meg, ezek közül 18 esszét mind a hét detektor megjelölt.

Ugyanaz a mechanizmus működik itt is, mint a felismerés többi részében: az előre jelezhető szókincs és az egyszerűbb mondatszerkezet alacsony perplexityként olvasható, az alacsony perplexity pedig gépi eredetűként, függetlenül attól, hogy ki tartja a tollat. Azok az írók, akik második nyelven dolgoznak, jól bevált fordulatokra támaszkodnak, mert az idegen nyelvi folyékonyság valójában így néz ki, és pontosan ez az a profil, amelyet egy detektor azért építettek, hogy jelezzen.

Az ilyen helyzetben lévő íróknak nem sokat segít az a tanács, hogy egyszerűen írjanak természetesebben, mivel éppen a természetesnek ítélt szöveg vált jelöltté. TextPulse oldala az ESL tudományos írók számára részletesebben tárgyalja azokat a megfogalmazási mintázatokat, amelyek e kockázat mögött állnak, beleértve azt is, mi változtat rajtuk anélkül, hogy a mondat jelentése megváltozna.

Ez nem elszigetelt eset volt. 2025 decemberében egy új benchmarkot tettek közzé, amelyet kifejezetten e detektorok torzításának értékelésére terveztek. Több mint 200,000 mintát tartalmazott több demográfiai csoport és nyelv között. Annak ellenére, hogy két év telt el Stanford első tanulmánya óta, és hogy ugyanazon detektorok számos különböző modellváltozatát is bevonták, ez a benchmark feltárta, hogy az angol nyelvet tanulók felé mutató torzítás továbbra is jelen van.

Ez nem minden szolgáltatóra igaz. Pangram saját műszaki dokumentációja szerint az osztályozója nem elfogult a nem anyanyelvi angol beszélőkkel szemben. A Chicago Booth kutatói ezt az állítást nem vizsgálták meg függetlenül, de ez azt mutatja, hogy a detektorok újabb generációját már úgy építik, hogy számolnak ezzel a problémával, nem pedig figyelmen kívül hagyják azt.

Ha szeretné látni, hogy saját szövege hol áll, mielőtt bárki más pontozná, egy ingyenes perplexity ellenőrző ugyanazt az alapértéket adja meg, amelyet egy detektor kiszámítana, anélkül, hogy bármit előbb egy intézményhez kellene benyújtania.

Kit jelölnek még meg, és miért

A nem anyanyelvi angolul beszélők viselik a legnagyobb dokumentált kockázatot, de ugyanez a statisztikai logika más szövegeket is kiszűr. Weber-Wulff csapata megállapította, hogy mind a 14 eszköz, amelyet teszteltek, kevésbé volt pontos, amikor parafrazált szövegeken futtatták őket, ez egy jelentős részét írja le annak az akadémiai írásnak, amelyen már átesett egy lektor, egy szerkesztő vagy egy témavezető piros tollán, mielőtt bárki detektort futtatna rajta.

Mindebből nem az következik, hogy a szám értelmetlen, csupán az, hogy megerősítésre van szüksége, mielőtt bármit is jelentene egy konkrét személyre nézve. Ha van egy szöveg, amely egyenletesnek hat, hasonló mondathosszakkal, végig hasonló ritmussal, akkor gépiesebbnek fog pontozódni, függetlenül attól, hogy ki írta vagy miért. Ez közvetlenül ellenőrizhető egy ingyenes burstiness checker segítségével, ahelyett hogy találgatnánk.

Hogyan néz ki egy védhető AI észlelési szabályzat

Yale-nek már volt egy olyan szabályzata, amely állítólag korlátozza az olyan eszközöket, mint a GPTZero, nagyjából azokból az okokból, amelyeket ez a cikk is kifejtett, egy dokumentált hamis pozitív arány és egy dokumentált elfogultság a nem anyanyelvi angol írókkal szemben. Így ez nem is annyira egy szerencsétlen hallgató története, hanem inkább egy meglévő szabály be nem tartásáé. Amikor egy szabályzat ténylegesen érvényesíti a különbséget egy pontszám és egy ítélet között, akkor a pontszám egy bemeneti adat lesz, nem pedig ítélet.

  • A pontszámot egyetlen bemeneti adatként kezelje, soha ne legyen ez az egyetlen alapja egy szabálysértési megállapításnak
  • A hallgatók számára a használat előtt hozza nyilvánosságra az eszköz közzétett hamis pozitív arányát
  • Alkalmazzon fokozott óvatosságot a rövid beadandók és a nem anyanyelvi angol nyelvű írás esetében, mindkettő dokumentált gyenge pont
  • Biztosítson olyan fellebbezési lehetőséget, amely nem követeli meg egy statisztika megcáfolását

Ebben semmi sem szokatlan. Ez közelebb áll ahhoz, ahogyan bárhol máshol egyetlen törvényszéki bizonyítékot kezelni kellene, hasznos, ellenőrizhető, és önmagában soha nem elegendő.

Egy egyéni szerző esetében ugyanez az elv a pontszám megszületése előtt érvényes, nem utána. Egyetlen szám, bármely eszköztől származzon is, becslés, nem pedig ítélet, és ha valaki bizonyosságként kezeli bármelyik irányban, biztonságosként vagy leleplezettként, akkor a számnál többet vár el, mint amennyit az alátámaszthat.

TextPulse saját AI humanizer toolja ugyanezen logika alapján Human Score-t jelez: ez az Ön saját szövegéből számított becslés, nem pedig egy detektor ítélete róla, és hasznos jelzés arra vonatkozóan, hogy egy vázlat jelenleg hogyan olvasható, nem pedig ígéret arra, hogy bármely konkrét detektor mit fog mondani.

A pontosság kérdése szűkebb kérdésekre bomlik, amelyek mindegyikének külön oldala van. A detektorok által emberi írásként megjelölt szövegek aránya külön tárgyalás tárgya, ahogyan a Turnitin hamis pozitív aránya és a ZeroGPT pontossága is. Ha egy pontszámot már Ön ellen használtak fel, vannak gyakorlati anyagok arról, hogy mit tegyen, ha azzal vádolják, hogy AI-t használt, arról a bizonyítékról, amelyet összegyűjthet annak bizonyítására, hogy nem használt AI-t, valamint arról, hogyan írjon fellebbezési levelet, amely a pontszámra annak saját feltételei szerint válaszol.

Bármely jelentésben szereplő szám folyamatosan változni fog, ahogy a szolgáltatók újratanítják modelljeiket, és a kutatók tovább tesztelik őket nehezebb esetekkel szemben. De aminek nem szabad változnia, az az alatta húzódó szokás: a pontszámot több mérés egyikeként olvassa, kérdezze meg, milyen populáción validálták, és kérdezze meg, mit nem mond a szolgáltató azokról az esetekről, amelyeket még mindig rosszul kezel.

Frequently Asked Questions

Igen. Weber-Wulff és munkatársai egy 2023-as összehasonlításban úgy találták, hogy az AI-észlelő eszközök „sem pontosak, sem megbízhatóak”, és a nem anyanyelvi angol írók viselik a legnagyobb dokumentált kockázatot, egy tanulmány pedig TOEFL-esszéken átlagosan 60 százalék feletti hamis pozitív arányt talált. Egyetlen pontszám önmagában nem bizonyít semmit, ezért soha nem szabadna ez legyen az egyetlen bizonyíték egy vád mögött.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Mennyire pontosak az AI-detektorok? Hamis pozitív eredmények | TextPulse.ai