Winston AI áttekintés: a 99.98% pontossági állítás és a bizonyítékok
Winston AI 99.98% pontosságot hirdet, ami a detektoriparágban a legmagasabb önállóan állított érték, egy belső teszthalmazon mérve, amelyet a vállalat soha nem tett közzé. A szaklektorált RAID benchmark az összesített pontosságot 71%-ra tette, 5% rögzített hamis pozitív arány mellett, ami továbbra is a négy vizsgált kereskedelmi detektor közül a második helyet jelentette. Itt van, mit mér valójában minden szám, és kinek felel meg ténylegesen ez az eszköz.
Winston AI 99.98%-os pontosságot hirdet, ez a legmagasabb, saját maga által állított érték az összes elterjedt AI-detektor közül. A szám a vállalat honlapján a "The Most Trusted AI Detector" szavak mellett szerepel, és a vállalat saját belső teszteléséből származik, nem külső laborból. Nem közölnek mellette módszertant, tesztkészlet-méretet, emberi és AI által generált minták arányát vagy működési küszöbértéket. A kijelentés és a dokumentáció közötti ez a rés az első dolog, amelyet egy körültekintő olvasónak tudnia kell erről az eszközről.
A második dolog az, hogy Winston-t valójában külső felek is tesztelték, és ez már több, mint amit egyes detektorokról el lehet mondani. A RAID benchmark, egy szakértői bírálaton átesett tanulmány, amelyet az ACL 2024 keretében mutattak be, körülbelül 6.2 millió gép által generált szövegen vizsgálta Winston-t, és 71.0%-os összpontosságot mért, miközben a hamis pozitív arányt 5%-on rögzítette. Ez nagyon messze van a 99.98%-tól. Az is kiderült, hogy a négy tesztelt kereskedelmi detektor közül Winston a második helyre került, GPTZero és ZeroGPT előtt. Mindkét tény számít, és egyik sem érvényteleníti a másikat.
Az alábbiakban azt tekintjük át, hogy mi Winston és kinek készült, mit állít a gyártó, statisztikailag mit jelenthet és mit nem jelenthet egy 99.98%-os saját benchmark, valamint hogy mit mutatnak valójában a független számok.
Mi a Winston AI, és kik használják?
A Winston AI egy fizetős, előfizetéses detektor, amelyet kifejezetten oktatóknak és tartalomszolgáltatóknak szánnak. Funkciólistája egy tanári munkafolyamatra emlékeztet: a vállalat webhelye OCR-t ír le, amely a szkennelt dokumentumokból, fényképekből és kézírásból nyeri ki a szöveget, a támogatott platformok között felsorolt Google Classroom-integrációt, az AI-észlelés mellett egy plágiumellenőrzőt, valamint dokumentumszervezést a beküldések kötegeinek kezelésére. A gyártó szerint képes felismerni a ChatGPT, Gemini, Claude, LLaMA és "much more" kimenetét.
A felület legjellegzetesebb része a mondatonkénti kimenet. Ahelyett, hogy csupán egyetlen százalékértéket adna vissza, a Winston azt nevezi AI prediction mapnek: egy színkódolt, mondatról mondatra haladó értékelést arról, hogy a dokumentum mely részei tűnnek gép által generáltnak. Oktatók számára ez a térkép hasznosabb, mint egy puszta pontszám, mert megmutatja, hol összpontosul az eszköz gyanúja. Ugyanakkor könnyű túlértelmezni, erre lentebb még visszatérünk.

Mit állít a vállalat?
A Winston AI kezdőlapján szereplő fő állítás a következő: "99.98% Accurate." E cikk írásakor az ezt az értéket közlő oldal nem teszi közzé, hogyan állították össze a tesztkorpuszát, hány mintát tartalmazott, milyen arányban szerepelt benne emberi és AI szöveg, illetve milyen döntési küszöbre állították a detektort az érték mérésének idején. Ez ebben az iparágban nem szokatlan, ugyanaz a szakadék a gyártói pontossági állítások és a független bizonyítékok között szinte minden piacon lévő detektorra jellemző. A Winston állítása egyszerűen a legnagyobb szám, amelyet valaha ráírtak.
Mit jelenthet valójában egy 99.98% önértékelés?
Vegyük komolyan egy pillanatra az aritmetikát. A 99.98% pontossági arány azt jelenti, hogy 10,000 mintából 2 hiba jut. Egy ilyen érték egyáltalán megméréséhez a vállalatnak legalább több tízezer dokumentumból álló, címkézett tesztkészletre van szüksége, amelyben minden szöveg valódi eredete bizonyossággal ismert. Ekkor a szám csak arra a korpuszra vonatkozó teljesítményt írja le: azokra az AI modellekre, azokra a promptokra, azokra a műfajokra, arra a szöveghosszra, egyetlen kiválasztott küszöbértéken.
Ehhez egyik sem igényel rosszhiszeműséget. Egy olyan detektor, amelyet népszerű chat modellek által generált esszéken tanítottak, majd népszerű chat modellek által generált esszéket tartalmazó korpuszon teszteltek, valóban közel a felső határhoz fog teljesíteni. A probléma az átvihetőség. Abban a pillanatban, amikor a beérkező szöveg egy másik modellből, egy másik mintavételi stratégiából vagy egy olyan szerzőtől származik, akinek természetes stílusa szokatlanul egységes, az a korpusz, amelyen az összehasonlító mérés történt, már nem írja le a vizsgált szöveget. Egy belső összehasonlító mérés olyan kontrollált kísérlet, amelyet az a fél végez, amelynek a legerősebb érdeke fűződik az eredményéhez, a saját maga által választott feltételek mellett. Ez bizonyíték, de a leggyengébb fajtából való, és a hiányzó módszertan miatt a vállalaton kívül senki sem tudja még ellenőrizni sem.
Mit mutat a független tesztelés?
A Winston-t is tartalmazó legszigorúbb nyilvános teszt az RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, Dugan és munkatársainak szakmai lektoráláson átesett tanulmánya, amelyet az ACL 2024 konferencián mutattak be. A RAID 12 detektort értékelt, köztük négy kereskedelmi terméket, mintegy 6.2 millió generált szöveggel szemben, amelyek 11 nyelvi modellt, 8 írási domaint, 4 dekódolási stratégiát és 11 ellenséges támadást öleltek fel, és minden detektort ugyanarra az 5% hamis pozitív arányra kalibráltak, hogy az eredmények összehasonlíthatók legyenek.
| Detector | Overall accuracy in RAID (FPR fixed at 5%) |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
Kétféle olvasata is őszinte egyszerre ennek a táblázatnak. Winston 71.0%-os értéke messze van a 99.98%-tól, ugyanakkor Winston mégis felülmúlta három kereskedelmi riválisa közül kettőt a rendelkezésre álló legnehezebb nyilvános benchmarkon. Az átlagok egy árulkodó szóródást is elfednek. A RAID modellenkénti eredményeiben Winston 99.6%-ot ért el a ChatGPT kimeneten és 98.8%-ot a GPT-4 kimeneten, ami közel van a saját hirdetett értékéhez, de GPT-2 szövegen 47.6%-ra, a base MPT-30B modell szövegén pedig 24.8%-ra esett vissza. A parafrazált gépi szövegen a pontossága 52.6%-ra csökkent.
Ez a szóródás a 99.98%-os állítás lényege kicsiben. Azon a szövegen, amely ahhoz hasonlít, amire a detektort feltehetően hangolták, vagyis a friss chat modellek által írt egyszerű prózán, Winston közel teljesíti a marketingjét. Ezen az eloszláson kívül a teljesítmény meredeken romlik. Egy belső benchmark, amely az eloszláson belüli szövegből épül fel, valóban produkálhat közel tökéletes számot, miközben szinte semmit nem mond arról a kusza keverékről, amelyet egy valós bejövő postaláda modellekből, szerkesztésekből és parafrázisokból tartalmaz. Azokat a statisztikai jeleket, amelyekre a detektorok támaszkodnak, részletesebben tárgyaljuk a hogyan működnek az AI detektorok című magyarázó anyagunkban.
Emberibbé tenni saját dolgozatát
Alakítsa át az AI által támogatott szövegét úgy, hogy emberinek hangozzon, anélkül hogy fontos szavakat vagy hivatkozásokat érintene.
Hamis pozitív eredmények: ki sérül?
A RAID kialakítása egy olyan kompromisszumot tesz láthatóvá, amelyet a gyártói marketing ritkán mutat meg, minden pontossági értéket a tanulmányban úgy mértek, hogy a hamis pozitív arányt 5%-on rögzítették. Ennél a kalibrációnál minden 20 valóban emberi dokumentumból 1 megjelölésre kerül. Egy detektor ezt az arányt a küszöb emelésével csökkentheti, de csak úgy, hogy kevesebb AI szöveget fog el, a két szám együtt mozog, és aki az egyiket a másik nélkül idézi, az a teljes eredménynek csak a felét idézi.
E hibák terhe nem oszlik el egyenletesen. Az a szöveg, amely sablonos, konvencionális és alacsony varianciájú, minden statisztikai detektor számára gépszerűen hat, és ez a leírás illik a módszertani részekre, az irodalmi áttekintésekre, valamint azoknak az íróknak az óvatos prózájára, akik második nyelven dolgoznak. Az AI detektorok által a nem anyanyelvi angol beszélők magasabb arányú jelölésének mintázata az iparág egészében dokumentált, és Winston módszerében semmi sem mentesíti ez alól. A mondatonkénti előrejelzési térkép ugyanilyen óvatosságot érdemel, egy pirossal kiemelt mondat statisztikai megfigyelés a szóhasználati mintázatokról, nem pedig szerzőségre vonatkozó bizonyíték. Azoknak a hallgatóknak, akiket téves jelölés ér, a dokumentációból kell kiindulniuk, nem a beismerésből, a hogyan bizonyítsd be, hogy nem használtál AI-t című útmutatónk azt ismerteti, mi győz meg ténylegesen.
Árazás és hozzáférés
Winston fizetős termék, korlátozott próbaidőszakkal. Winston 14 napos ingyenes próbát kínál 2,000 kredittel, egy Essential csomagot havi $18-ért, vagy éves számlázás esetén havi $10-ért, 100,000 havi kredittel, egy Advanced csomagot havi $29-ért, vagy éves $16-ért, amely csapattaghelyeket és nagyobb vizsgálatokat ad hozzá, valamint egy ennél magasabb Elite szintet. Egyetlen hallgatói csoport beadott munkáinak szűrésére ez Winston-t az impulzusvásárlás kategóriájába helyezi, olcsóbbá teszi az intézményi szerződéseknél, és képességeiben meghaladja a legtöbb ingyenes eszközt.
Hová illeszkedik Winston a detektorok környezetében
Független bizonyítékok alapján Winston középkategóriás kereskedelmi detektor, amely jobban teljesít a piac ingyenes szintjénél, és gyengébben, mint amit a saját reklámja sugall. Olyan oktatónak felel meg, aki mondatonkénti láthatóságot, Classroom-integrációt és plágiumellenőrzést szeretne egyetlen olcsó eszközben, és minden eredményt beszélgetésre való felhívásként kezel, nem pedig ítéletként. Nem felel meg annak, akinek a pontszámnak bizonyítékként kell működnie, mert egyetlen detektor pontszáma sem működik bizonyítékként.
A teljes összehasonlítás
Winston egy detektor a zsúfolt mezőnyben, és a 71% és 99.98% közötti különbség az iparág egészére jellemző mintázat egyik példája. Arról, hogy miként teljesít Turnitin, GPTZero, Originality, ZeroGPT és a többiek mellett, ugyanazon bizonyítékokra épülő szempontok szerint, lásd az AI detektorok összehasonlítása című teljes útmutatónkat.
Mit mutatott a saját kutatásunk
A TextPulse Research detektor-egyezési tanulmányában kilenc kereskedelmi AI-detektor értékelte ugyanazt a 90 akadémiai szöveget. Az egyik egy 455 szavas hibrid szöveg volt: ember írta bevezetés és zárás, közötte 168 szavas, AI által írt középrész. A Winston AI erre a szövegre 7% AI értéket adott, miközben a többi eszköz ítélete ugyanezekre a szavakra 0% és 95.7% AI között szórt. A teljes tanulmány, a korpusz és az eszközönkénti pontszámmátrix szabadon elérhető itt: TextPulse Research.

Gyakran ismételt kérdések
A 99.98% érték a Winston AI saját állítása, amelyet egy belső teszthalmazon mértek, amelyet a vállalat nem tett közzé. Az ACL 2024-en bemutatott szaklektorált RAID benchmarkban Winston 71.0% összesített pontosságot ért el 5%-ra rögzített hamis pozitív arány mellett, bár kifejezetten a ChatGPT kimenetén 99.6%-ot ért el. Az állítás egy kiválasztott korpuszt ír le, nem a valós teljesítményt.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.