Mennyire pontosak az AI detektorok? Hamis pozitív eredmények és torzítás
A szolgáltatók 1 százalék alatti hamis pozitív arányokat tesznek közzé. Független kutatók ugyanazokat a detektorokat nem anyanyelvi angol szövegeken tesztelve 60 százalék feletti arányokat találtak. Íme, mit mutatnak a bizonyítékok.
Turnitin azt állítja, hogy a hamis pozitív arányuk kevesebb mint 1%. Egy független kutatócsoport több detektort tesztelt a nem anyanyelvi angol beszélők írásmintáinak szélesebb körén. Azt találták, hogy az átlagos hamis pozitív arány ugyanazon írástípus esetében 60% fölött volt. Mindkét szám valós, mindkettőt publikálták, és mindkettő olyan detektorokra vonatkozik, amelyeket ugyanannak a piacnak értékesítenek. Pontosak az AI detektorok? Ez attól függ, milyen populáción tesztelték őket, melyik detektort használták, és hogy a szolgáltató eleve hogyan határozta meg ezt a fogalmat.
Ez a bejegyzés nem fogja újra elmagyarázni, hogyan számítja ki egy detektor ezt a pontszámot. A mechanizmus, a perplexity, a token valószínűség, az, hogy a klasszifikátort hogyan tanítják, másutt részletesen tárgyalva van, és érdemes először elolvasni, ha még nem tette. Ami itt számít, az az, mi történik, miután a pontszám már létezik, milyen gyakran téved, kinek az írásáról téved a leggyakrabban, és mennyibe kerül valójában egy hamis vád annak, aki semmi rosszat nem tett.
Pontosak az AI detektorok?
Nem következetesen, és a marketingállítások és a független tesztelés közötti szakadék jól dokumentált. Debora Weber-Wulff vezette kutatók egy csoportja 2023-ban közzétette 14 detektáló eszközön végzett vizsgálatának eredményeit, ezek közül 12 ingyenes és kettő kereskedelmi volt, és emberi, valamint ChatGPT szövegek keverékével tesztelték őket. Azt találták, hogy ezek közül egyik eszköz sem pontos vagy megbízható, és beépített torzítással rendelkeznek, amely a gépi szöveget inkább emberinek címkézi, mint fordítva. A tesztben szereplő két kereskedelmi eszköz a Turnitin és a PlagiarismCheck volt. A tesztben szereplő összes eszköz rosszabbul teljesített, amikor a szöveget parafrazálták.
De két év elteltével a helyzet nem stagnál. A University of Chicago Booth Schooljának Brian Jabarian és Alex Imas által jegyzett working paperje közel 2.000 ember által írt szöveggel, blogokból, hírekből, értékelésekből és fikcióból, három új belépőt, Pangram, GPTZero és Originality.ai, valamint egy nyílt forráskódú versenytársat vetett alá próbának. Ellenőrzött tesztkörülmények között a mezőny legjobb eszköze soha nem esett 99.8 százalékos pontosság alá, és alacsony szinten tartotta a téves pozitív arányát. A nyílt forráskódú modell ugyanolyan jól teljesített, mint egy véletlen tippelő. A dolgok valóban jobbak lettek. Valamelyest. Kissé.
De a bökkenő a kontrollált szó. A benchmark szövegrészletek tiszták, teljesek és ismert körülmények között készülnek. Egy benyújtott esszé ezek közül egyik sem megbízhatóan. A valós környezetbeli eredmények nem feltétlenül azonosak a laboreredményekkel, ahogyan azt Turnitin saját vezető termékigazgatója nyilvánosan is elmondta, bár ez ritka és hasznos elismerés egy szállítótól. A következő szakasz a szállítói számokat az függetlenek mellé helyezi, hogy a rés látható legyen, ne pusztán állított.
Szállítói állítások az független teszteléssel szemben
Az alábbi táblázat egymás mellé rendezi, hogy négy detektor mit állít magáról, és hogy mit mértek a független kutatók, amikor közvetlenül tesztelték az eszközöket. A két középső oszlopot együtt olvassa, ne csak a szállítói oszlopot.
| Detektor | A gyártó által állított pontosság | Függetlenül megfigyelt | Mit mond a gyártó a hamis pozitív eredményekről |
|---|---|---|---|
| Turnitin | 98% bizalmi küszöb a megjelölés előtt, dokumentumszinten 1% alatti hamis pozitív eredmények | Körülbelül 80% pontosság, a 12 eszköz közül a legjobb egy 2023-as összehasonlításban, a eszköz egy korábbi verzióján | Dokumentumszinten 1% alatt egy 20% AI által írt küszöb felett, mondatszinten körülbelül 4% |
| GPTZero | 95.7% AI-szöveg felismerés 1% hamis pozitív arány mellett az független RAID benchmarkon | 96% pontosság rövid szakaszokon, 1% alatti hamis pozitív arány egy 2025-ös University of Chicago Booth tanulmányban | 1% hamis pozitív arányt közöl a RAID benchmarkon |
| Originality.ai | 99% pontosság, 0.5% hamis pozitív arány, Lite modell, 1.5%, Turbo modell | 1% alatti hamis pozitív arány, de ugyanebben a Booth tanulmányban az AI által írt szöveg 10% és 40% közötti részét nem észlelte | Külön hamis pozitív adatokat tesz közzé modellrétegenként |
| Pangram | Az általa közölt hibaarányok több mint 38-szor alacsonyabbak a versengő eszközökénél, azt állítja, hogy nincs elfogultság a nem anyanyelvi angol írókkal szemben | A pontosság soha nem volt 99.8% alatt, a hamis pozitív arány közel nulla volt a Booth tanulmányban | Azt állítja, hogy 10 szövegtartományban és 8 nyelvi modellen keresztül közel nulla hamis pozitív arányt mutat |
Két dolog tűnik ki. Először is, minden gyártói adat egy olyan laborból származik, amelyet a gyártó irányít, míg a Booth adatai olyan kutatóktól származnak, akiknek nincs eladnivalójuk. Másodszor, Turnitin egyáltalán nem szerepel abban a középső oszlopban, mivel a 2025-ös tanulmány nem tesztelte. A táblázatban szereplő független adat egy korábbi, 2023-as összehasonlításon alapul, de az eszköz egy régebbi verzióján készült, ezért ezt tartsa szem előtt, amikor a táblázatot közvetlen összehasonlításként nézi.
Mennyire pontos a Turnitin AI-felismerése?
Turnitin nem tesz közzé egyetlen pontossági értéket. Ehelyett egy küszöbértéket és egy kompromisszumot tesz közzé. A vállalat közölte, hogy csak akkor jelöl meg egy dokumentumot, amikor 98 százalékos biztonsággal úgy ítéli meg, hogy a megjelölt rész AI által írt, és hogy éppen ez a küszöbérték tartja a dokumentumszintű hamis pozitív arányt 1 százalék alatt. Turnitin becslése szerint az AI-segítséggel készült szövegek mintegy 85 százalékát felismeri, a többit pedig szándékosan átengedi, ahelyett hogy téves vádat kockáztatna.
A Turnitin által mondatszinten visszaadott hamis pozitív eredmények tényleges aránya, vagyis amikor a felület konkrét sorokat emel ki egy teljes dokumentum helyett, valójában inkább 4 százalékhoz közelít. Ezt az értéket érdemes ismerni, ha egy professzor egyetlen megjelölt bekezdésről készít képernyőképet a teljes dokumentum pontszáma helyett, mert egy kiemelt mondatnak érdemben nagyobb az esélye arra, hogy téves legyen, mint a mellette szereplő dokumentumpontszámnak.
Érdemes azt is megjegyezni, hogy Turnitin ezt a különbséget közvetlenül elismerte. Megállapították, hogy az első valós körülmények között kapott eredményeik, különösen a rövidebb dokumentumok esetében, magasabb hamis pozitív arányt mutattak, mint amire a laboratóriumi tesztek alapján számítottak. Ezért a pontozáshoz szükséges minimális dokumentumhosszt 150 szóról 300 szóra emelték. Ez egy olyan szállító, amely a saját termékét módosítja, mert a közzétett szám a laboron kívül nem állta meg a helyét, és ez legalább annyit elárul, mint bármely független tanulmány.
Mit jelent valójában egy hamis pozitív eredmény egy hallgató számára
Ez történt egy Yale School of Management executive MBA-hallgatóval. A hallgatót a szó legszorosabb értelmében szabálysértéssel vádolták. Az érintett detektor GPTZero volt. A hallgató pénzügyi tárgyból írt záróvizsgáját egy oktatási asszisztens jelölte meg, aki úgy gondolta, hogy az írás hosszú és kidolgozott, szinte tökéletes központozással és nyelvtannal. És ez a konkrét professzor éppen GPTZero-n futtatta át, amely a válaszokat valószínűleg AI által generáltnak értékelte.
Nem teljesítette a kurzust, és egy évre felfüggesztették. A 2025 februárjában a szövetségi bíróságon benyújtott keresete azt állítja, hogy a Yale saját szabályzata éppen ezért korlátozza az olyan eszközök használatát, mint a GPTZero, nevezetesen a nem anyanyelvi angol beszélőkkel szembeni dokumentált hamis pozitív arány miatt, és hogy ő e szabályzattal ellentétesen használta azt. A beadvány azt is idézi, hogy a GPTZero 100 százalékos AI-generated eredményt adott a Yale saját korábbi egyetemi elnökének és az üzleti iskola dékánjának tudományos írására.
A bíró 2025 májusában megtagadta egy korai ideiglenes intézkedés elrendelését. Az ügyet még nem zárták le, amint ezt írom. A felperes, egy francia állampolgár, azt állítja, hogy ugyanaz az ismert elfogultság a nem anyanyelvi angol beszélőkkel szemben okozta, hogy az írása úgy teljesített, ahogyan. Ezt vizsgáljuk a következő szakaszban. Ami nem vita tárgya, az az ár, egy év elvesztése a képzési programból, egy elégtelen osztályzat, jogi költségek, és több hónapnyi küzdelem egy pontszám miatt ahelyett, hogy diplomát szerezne. Az 1 százalékos hamis pozitív arány csekélynek hangzik, amíg egy nagy populáció valakivé nem teszi.
Emberibbé tenni saját dolgozatát
Alakítsa át az AI által támogatott szövegét úgy, hogy emberinek hangozzon, anélkül hogy fontos szavakat vagy hivatkozásokat érintene.
Mely írási jellemzők miatt tűnik az emberi szöveg gépi készítésűnek
Négyféle hétköznapi írás hordozza a legnagyobb kockázatot, és egyik sem jár azzal, hogy valaki bármi rosszat tenne. A rövid dokumentumok, az erősen formulaikus írás, az idézett vagy sablonos anyag, valamint az alaposan lektorált szöveg mind hajlamosabbak kiszámíthatóbbnak látszani, mint a szabadon megfogalmazott próza, márpedig ez az az egyetlen tulajdonság, amelyet minden detektor valójában mér. Egy ingyenes burstiness checker közvetlenül méri ugyanezt a változatosságot, ami gyorsabb módja a minta felismerésének, mint annak leírását olvasni.
Egyes műfajok eleve formulikusak. Egy módszertani rész, egy laborjelentés, egy szabványos kísérőlevél és egy irodalmi áttekintés mind a hagyományos fordulatot jutalmazza az ötletes helyett, mert éppen a konvenció teszi a dokumentumot használhatóvá az olvasója számára. A kutatók ezt közvetlenül valós szövegeken tesztelték: 14,400 folyóirat-absztraktot futtattak át, amelyeket 1980 és 2023 között publikáltak, jóval azelőtt, hogy bármilyen nagy nyelvi modell létezett volna, egy nyilvánosan elérhető detektoron. Legfeljebb 8 percentot AI-generatedként jelöltek meg, függetlenül a publikáció évétől, és a New England Journal of Medicine absztraktjait 10.24 percentnál jelölték meg, ami az öt tesztelt folyóirat közül a legmagasabb hamis pozitív arány volt.
A teszt nem észlelhetett semmit ChatGPT-ről, mivel ChatGPT a mintavétel éveinek többségében nem létezett. A műfajt észlelte. Formálisabban fogalmazva, ahogyan a 2026 statisztikai elemzése a detektálási problémáról megállapítaná, nincs olyan mód, amellyel olyan detektort lehetne építeni, amely különbséget tesz egy olyan mondat között, amely azért kiszámítható, mert szoftver írta, és egy olyan mondat között, amely azért kiszámítható, mert az adott műfajban éppen ilyen mondatot ír az ember. Kívülről pontosan ugyanúgy néznek ki.
A jelentős szerkesztés hasonló irányba hat. Az első vázlat egy író sajátos szabálytalanságait hordozza: a szokatlan szórendet, a túlságosan hosszú mondatot, mert a gondolat is az volt. Az alapos lektorálás, különösen ha egy másik eszközön is lefuttatják, hajlamos éppen ezeket a szabálytalanságokat elsimítani. A detektálóeszközök eddigi legnagyobb független összehasonlítása 14 eszközt tesztelt, és azt találta, hogy a pontosság minden eszköznél tovább romlott, miután a mintaszöveget parafrazálták vagy gépi fordítással fordították.
| Írási jellemző | Miért csökkenti egy dokumentum látszólagos kiszámíthatatlanságát | Mit mutatnak a bizonyítékok |
|---|---|---|
| Rövid benyújtások | A kevesebb szöveg kevesebb teret hagy annak a természetes változatosságnak, amely elválasztja az emberi ritmust a gépi ritmustól | A rövid dokumentumokra adott pontszámok jobban ingadoznak néhány szokatlan mondat hatására |
| Formulaisztikus vagy szakterület-specifikus írás | A műfaji konvenció az elvárható kifejezést jutalmazza a találékony helyett | 14,400, a ChatGPT előtti folyóirat-absztrakt, 1980 to 2023 között, továbbra is legfeljebb 8% hamis pozitív eredményt váltott ki, egy folyóirat absztraktjai elérték a 10.24%-ot |
| Erősen szerkesztett vagy parafrazált vázlatok | Egy csiszolási kör elsimítja azokat az egyéni szabálytalanságokat, amelyeket egy detektor emberinek olvas | Egy független, 14 eszközt összehasonlító vizsgálat megállapította, hogy a pontosság tovább csökkent parafrazálás vagy gépi fordítás után |
| Idézett vagy sablonos anyag | Az idézett részlet a forrásának statisztikai lenyomatát hordozza, nem az idéző szerzőét | Azok a detektorok, amelyek nem zárják ki az idézeteket, a környező dokumentumot az átvett szöveg alapján pontozzák |
Miért osztályozzák tévesen az AI detektorok a nem anyanyelvi angolul beszélőket?
Rossz eredménnyel, és nagy különbséggel. Ez volt annak a tanulmánynak a következtetése, amely először számszerűsítette ezt. Stanford kutatók hét széles körben használt GPT detektort futtattak 91 TOEFL esszén, amelyeket nem anyanyelvi angolul beszélők írtak, valamint 88, amerikai nyolcadikosok által írt esszén. A detektorok szinte minden alkalommal helyesen olvasták a nyolcadikos esszéket. Amikor a TOEFL esszékről volt szó, amelyeket olyan felnőttek írtak, akik elég folyékonyan beszéltek ahhoz, hogy egy mesterképzési szintű angol tesztet tegyenek le, a detektorok átlagos hamis pozitív aránya 61.3 percent volt. A 91 esszéből 89-et legalább egy a hét detektor közül GPT által generáltnak jelölt, és ezek közül 18 esszét mind a hét detektor jelölt.
Az eljárás ugyanaz, mint ami az észlelés többi részét is irányítja: az előre jelezhető szókincs és az egyszerűbb mondatszerkezet alacsony perplexityként olvasható, az alacsony perplexity pedig gépi eredetűként, függetlenül attól, hogy ki tartja a tollat. A második nyelven dolgozó szerzők jól bevált fordulatokra támaszkodnak, mert az idegen nyelvi folyékonyság valójában így néz ki, és pontosan ez az a profil, amelyet egy detektor azért építettek, hogy jelezzen.
Az ilyen helyzetben lévő szerzőknek nem sokat segít az a tanács, hogy egyszerűen írjanak természetesebben, mivel éppen a természetesnek ítélt szöveg került jelzésre. TextPulse oldala az ESL akadémiai szerzők számára részletesebben tárgyalja azokat a fordulati mintázatokat, amelyek e kockázat mögött állnak, beleértve azt is, hogy mi változtat rajtuk anélkül, hogy a mondat jelentése megváltozna.
Ez nem elszigetelt eset volt. 2025 decemberében egy új benchmarkot tettek közzé, amelyet kifejezetten e detektorok torzításának értékelésére terveztek. Több mint 200,000 mintát tartalmazott több demográfiai csoport és nyelv között. Annak ellenére, hogy két év telt el Stanford első tanulmánya óta, és hogy ugyanazon detektorok számos különböző modellváltozatát is bevonták, ez a benchmark feltárta, hogy az English language learnerekkel szembeni torzítás továbbra is fennáll.
Ez nem igaz minden szolgáltatóra. Pangram saját műszaki dokumentációja szerint az osztályozója nem elfogult a nem anyanyelvi angol beszélőkkel szemben. A Chicago Booth kutatói ezt az állítást nem tesztelték függetlenül, de ez azt mutatja, hogy az érzékelők újabb generációját már a probléma figyelembevételével építik, nem pedig figyelmen kívül hagyják azt.
Ha szeretné látni, hogy az Ön saját szövege hol áll, mielőtt bárki más pontozná, egy ingyenes perplexity-ellenőrző ugyanazt az alapul szolgáló számot adja meg, amelyet egy detektor kiszámítana, anélkül hogy bármit is először egy intézményhez benyújtana.
Ki más kerül jelzésre, és miért
Azok a személyek, akiknek az angol nem anyanyelvük, viselik a legnagyobb dokumentált kockázatot, de ugyanez a statisztikai logika más szövegeket is érint. Weber-Wulff csapata megállapította, hogy mind a 14 eszköz, amelyet teszteltek, kevésbé volt pontos, amikor parafrazált szövegeken futtatták őket, ez egy jelentős részét írja le az akadémiai írásnak, amelyen már átesett egy lektor, egy szerkesztő vagy egy témavezető piros tollas javítása, mielőtt bárki detektort futtatna rajta.
Mindebből nem következik, hogy a szám értelmetlen, csupán az, hogy megerősítésre van szüksége, mielőtt bármit is jelentene egy konkrét személyre nézve. Ha olyan szövege van, amely egységesnek hat, hasonló mondathosszakkal, végig hasonló ritmussal, akkor gépiesebbnek fog pontozódni, függetlenül attól, hogy ki írta vagy miért. Ez közvetlenül ellenőrizhető egy ingyenes burstiness checker segítségével, ahelyett hogy találgatnánk.
Egy második, kevésbé tárgyalt csoport hasonló problémával szembesül. Kutatók körülbelül 60,000 Reddit bejegyzést hasonlítottak össze, egy olyan részhalmazra bontva, amelyet valószínűleg autista szerzők által írtként azonosítottak, és egy általános mintára, majd mindkettőt lefuttatták egy GPT-2-alapú detektoron. Mindkét csoport összességében 2 percent alatt maradt a megjelölések arányában, de a valószínűleg autista részhalmazt szignifikánsan magasabb arányban jelölte meg a rendszer, mint az általános mintát. Az a szöveg, amely a szó szerinti, ismétlődő, szorosan mintázott megfogalmazás felé hajlik, ami egyes autista kommunikációs stílusok dokumentált jellemzője, pontosan azt az alacsony variációjú szöveget hozza létre, amelynek felismerésére egy detektort terveztek.
Miért nem jelent a magabiztos pontszám magabiztos vádat
A hamis pozitív arány úgy hangzik, mintha annak esélyére utalna, hogy egy megjelölt hallgató ártatlan. De nem. Azt írja le, hogyan működik egy teszt mindenkinél, aki kitölti. És ezek különböző kérdések, különböző válaszokkal, ugyanúgy, mint bármely szűrővizsgálat esetében az orvostudományban vagy a biztonságban.
Egy Griffith University kutató 2026 márciusában készült statisztikai elemzése explicitté teszi a mögöttes matematikát. Ha az AI-detekciót nem egyetlen elszigetelt dokumentumra, hanem a hallgatói írók egy populációjára alkalmazott tesztként kezeljük, akkor egy kompromisszum jelenik meg: valahányszor e populáció egy része olyan módon ír, amely természetes módon átfed a tipikus AI-kimenettel, közel áll a műfaji konvencióhoz, vagy közel áll egy második nyelvet tanuló író nyelvi tartományához, minden olyan detektornak, amelynek valódi ereje van az AI által írt munka felismerésére, tévesen kell jeleznie e fedésben lévő rész valamelyik elemét. Ez nem azt állítja, hogy egy konkrét detektor rosszul van megépítve. Ez annak a tulajdonsága, hogy egy sokféle populációt egyetlen dokumentummal és más bizonyíték nélkül tesztelünk.
A tanulmány saját szemléltető példája megmutatja az érintett nagyságrendet. Tegyük fel, hogy a hallgatói populáció 10 százaléka elég közel ír a tipikus AI-kimenethez, és egy detektort úgy hangolnak be, hogy az a ténylegesen AI által írt munka 80 százalékát elkapja. A matematika ekkor legalább 7.5 százalékos átlagos hamis pozitív arányt követel meg e populáció egészére vetítve. Ez nem a detektor mérnöki kialakításának hibája, hanem annak közvetlen következménye, hogy az adott csoport írása statisztikailag mennyire fed át azzal, amit észlelni próbálnak.
Ezt 10,000 hallgatós egyetemre skálázva ez az alsó határ önmagában nagyjából 750 téves jelzést jelentene a populációban, ami annak a matematikai következménye, hogy egy sokféle populációt egyetlen dokumentummal tesztelnek, más mérlegelendő bizonyíték nélkül. A tanulmány szerzője világosan kimondja, hogy ezek a konkrét számok szemléltető jellegűek, nem pedig egy valós intézményben mért adatok. A példa a probléma alakját mutatja meg, nem pedig egyetlen campusra vonatkozó konkrét előrejelzést.
Milyen egy védhető AI-detekciós szabályzat
Yale-nek már volt egy olyan szabályzata, amely állítólag korlátozza az olyan eszközöket, mint a GPTZero, nagyjából azokból az okokból, amelyeket ez a cikk kifejtett: dokumentált hamis pozitív arány és dokumentált elfogultság a nem anyanyelvi angol írókkal szemben. Így ez nem annyira egy szerencsétlen hallgató története, hanem inkább egy meglévő szabály be nem tartásáé. Amikor egy szabályzat ténylegesen érvényesíti a különbséget egy pontszám és egy ítélet között, akkor a pontszám már csak egy bemeneti adat lesz, nem pedig ítélet.
- Tekintse a pontszámot egy bemeneti adatnak, soha ne az egyetlen alapnak egy szabálytalansági megállapításhoz
- A használat előtt közölje a hallgatókkal az eszköz közzétett hamis pozitív arányát, mielőtt ellenük alkalmazná
- Fordítson különös figyelmet a rövid beadásokra és a nem anyanyelvi angol nyelvű írásokra, amelyek mindkettő dokumentált gyenge pont
- Biztosítson olyan fellebbezési lehetőséget, amely nem követeli meg egy statisztika megcáfolását
Ebben semmi egzotikus nincs. Ez közelebb áll ahhoz, ahogyan bárhol máshol bármelyetlen törvényszéki bizonyítékot kezelni kellene: hasznos, ellenőrizhető, és önmagában soha nem elegendő.
Egy egyéni szerző esetében ugyanez az elv akkor is érvényes, mielőtt egy pontszám egyáltalán létezne, nem pedig utána. Bármely eszközből származó egyetlen szám becslés, nem pedig ítélet, és ha ezt bármelyik irányban, biztonságosnak vagy leleplezettnek tekintjük bizonyosságként, akkor a számnál többet várunk el, mint amire az képes.
A TextPulse saját AI humanizer tool eszköze ugyanezen logika alapján közöl Human Score értéket: a saját szövegéből számított becslést, nem pedig egy detektor ítéletét róla, amely hasznos jelzés arra vonatkozóan, hogy egy vázlat jelenleg hogyan olvasható, nem pedig ígéret arra, hogy bármely konkrét detektor mit fog mondani.
A pontosság kérdése szűkebb kérdésekre bomlik, amelyek mindegyikének külön oldala van. A Turnitin hamis pozitív arányára és a ZeroGPT pontosságára vonatkozó konkrét bizonyítékokat külön tárgyaljuk. Ha egy pontszámot már felhasználtak Ön ellen, vannak gyakorlati anyagok arról, mit tegyen, ha azzal vádolják, hogy AI-t használt, arról a bizonyítékról, amelyet összegyűjthet annak bizonyítására, hogy nem használt AI-t, valamint a fellebbezési levél megírásáról, amely a pontszámra annak saját feltételei szerint válaszol.
Bármely jelentésben szereplő szám tovább fog változni, ahogy a szolgáltatók újratanítják modelljeiket, és a kutatók tovább tesztelik őket nehezebb esetekkel szemben. De annak, ami alatta van, nem szabad változnia, ez a szokás: a pontszámot több mérés egyikeként olvassa, kérdezze meg, milyen populáción validálták, és kérdezze meg, mit nem mond a szolgáltató azokról az esetekről, amelyeket még mindig rosszul kezel.
Gyakran ismételt kérdések
Igen. Weber-Wulff és munkatársai egy 2023-as összehasonlításban úgy találták, hogy az AI-észlelő eszközök „sem pontosak, sem megbízhatóak”, és a nem anyanyelvi angolul írók viselik a legnagyobb dokumentált kockázatot, egy tanulmány pedig átlagosan 60 százalék feletti hamis pozitív arányt talált TOEFL esszéken. Egyetlen pontszám önmagában nem bizonyít semmit, ezért soha nem szabadna ez legyen az egyetlen bizonyíték egy vád mögött.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.