Recenze Winston AI: tvrzení o 99,98% přesnosti versus důkazy
Winston AI uvádí 99,98% přesnost, nejvyšší vlastní tvrzenou hodnotu v odvětví detektorů, změřenou na interní testovací sadě, kterou společnost nikdy nezveřejnila. Recenzovaný RAID benchmark stanovil jeho celkovou přesnost na 71% při pevné 5% míře falešně pozitivních výsledků, stále druhou mezi čtyřmi testovanými komerčními detektory. Zde je, co každé číslo ve skutečnosti měří a komu je tento nástroj skutečně určen.
Winston AI inzeruje 99.98% přesnost, nejvyšší jím uváděnou hodnotu ze všech běžných detektorů AI. Toto číslo je na domovské stránce společnosti vedle slov "The Most Trusted AI Detector" a pochází z interního testování společnosti, nikoli z externí laboratoře. Spolu s ním nejsou zveřejněny žádná metodika, velikost testovací sady, poměr vzorků člověka k AI ani provozní práh. Tento rozdíl mezi tvrzením a jeho dokumentací je první věc, kterou by si měl pozorný čtenář o tomto nástroji uvědomit.
Druhá věc je, že Winston byl skutečně testován externími subjekty, což se o některých detektorech říci nedá. Benchmark RAID, recenzovaná studie prezentovaná na ACL 2024, porovnal Winston s přibližně 6.2 miliony strojově generovaných textů a naměřil 71.0% celkovou přesnost při pevně stanovené míře falešně pozitivních výsledků 5%. To je velmi daleko od 99.98%. Zároveň umístil Winston na druhé místo ze čtyř testovaných komerčních detektorů, před GPTZero a ZeroGPT. Obě skutečnosti jsou důležité a ani jedna neruší tu druhou.
Následující text popisuje, co Winston je a pro koho je určen, co tvrdí dodavatel, co může a nemůže statisticky znamenat vlastní benchmark s 99.98%, a co ve skutečnosti ukazují nezávislá čísla.
Co je Winston AI a kdo jej používá?
Winston AI je placený detektor založený na předplatném, zaměřený přímo na pedagogy a vydavatele obsahu. Jeho seznam funkcí připomíná pracovní postup učitele, web společnosti popisuje OCR, které extrahuje text ze skenovaných dokumentů, fotografií a rukopisu, integraci Google Classroom uvedenou mezi podporovanými platformami, kontrolu plagiátorství vedle detekce AI a organizaci dokumentů pro správu dávek odevzdaných prací. Dodavatel uvádí, že detekuje výstupy z ChatGPT, Gemini, Claude, LLaMA "and much more."
Nejvýraznější částí rozhraní je výstup po jednotlivých větách. Místo toho, aby vracel pouze jediné procento, Winston vytváří to, co nazývá mapou predikce AI, tedy barevně kódované, větu po větě provedené hodnocení toho, které části dokumentu působí jako strojově generované. Pro pedagoga je tato mapa užitečnější než prosté skóre, protože ukazuje, kde je soustředěno podezření nástroje. Je však také snadné ji přeceňovat, k čemuž se vrátíme níže.

Co společnost tvrdí?
Hlavní tvrzení na domovské stránce Winston AI zní "99.98% Accurate." K okamžiku psaní tohoto textu stránka, která toto číslo uvádí, nezveřejňuje, jak byl testovací korpus sestaven, kolik vzorků obsahoval, jaký poměr lidského a AI textu používal ani na jaké rozhodovací prahové hodnotě byl detektor nastaven v okamžiku měření tohoto čísla. To není v tomto odvětví neobvyklé, stejná mezera mezi tvrzeními dodavatelů o přesnosti a nezávislými důkazy se objevuje téměř u každého detektoru na trhu. Verze tohoto tvrzení od Winston je jednoduše nejvyšší číslo, které na něj kdokoli uvedl.
Co může 99.98% vlastní benchmark ve skutečnosti znamenat?
Na chvíli berme aritmetiku vážně. Míra přesnosti 99.98% znamená 2 chyby na každých 10,000 vzorků. Aby bylo možné toto číslo vůbec změřit, potřebuje společnost označenou testovací sadu alespoň v řádu desítek tisíc dokumentů, u nichž je s jistotou znám skutečný původ každého textu. Poté toto číslo popisuje pouze výkon na tomto korpusu, tedy na těchto modelech AI, těchto zadáních, těchto žánrech, této délce textu, při jednom zvoleném prahu.
Nic z toho nevyžaduje zlý úmysl. Detektor natrénovaný na esejích generovaných populárními chatovacími modely a poté testovaný na korpusu esejí generovaných populárními chatovacími modely bude skutečně dosahovat výsledků blízko stropu. Problémem je přenositelnost. Ve chvíli, kdy vstupní text pochází z jiného modelu, jiné strategie vzorkování nebo od autora, jehož přirozený styl je neobvykle uniformní, korpus, na němž byl benchmark měřen, již nepopisuje posuzovaný text. Interní benchmark je kontrolovaný experiment prováděný stranou s nejsilnějším zájmem na jeho výsledku, za podmínek, které si sama zvolí. Je to důkaz, ale ten nejslabší, a chybějící metodika znamená, že si to nikdo mimo společnost nemůže ani ověřit.
Co ukazuje nezávislé testování?
Nejpřísnější veřejný test, který zahrnuje Winston, je RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, recenzovaná studie Dugan a kolegů prezentovaná na ACL 2024. RAID hodnotil 12 detektorů, včetně čtyř komerčních produktů, na přibližně 6.2 milionu generací zahrnujících 11 jazykových modelů, 8 psacích domén, 4 dekódovací strategie a 11 adversariálních útoků, přičemž každý detektor byl kalibrován na stejnou 5% míru falešně pozitivních výsledků, aby byly skóre srovnatelná.
| Detektor | Celková přesnost v RAID (FPR pevně nastavena na 5%) |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
Dvě čtení této tabulky jsou zároveň poctivá. Winstonových 71.0% je daleko od 99.98%, a přesto Winston porazil dva ze svých tří komerčních rivalů na nejtěžším veřejném benchmarku, který je k dispozici. Průměry také skrývají výmluvný rozptyl. V výsledcích RAID podle jednotlivých modelů dosáhl Winston 99.6% na výstupech ChatGPT a 98.8% na výstupech GPT-4, tedy blízko své vlastní uváděné hodnoty, ale klesl na 47.6% na textu GPT-2 a na 24.8% na textu ze základního modelu MPT-30B. Na parafrázovaném strojovém textu jeho přesnost klesla na 52.6%.
Tento rozptyl je v miniatuře celým příběhem tvrzení o 99.98%. Na textu připomínajícím to, pro co byl detektor pravděpodobně laděn, tedy na nedávných chat modelech píšících prostou prózu, Winston podává výkon blízký svému marketingu. Mimo toto rozdělení výkon prudce klesá. Interní benchmark vytvořený z textu v rámci rozdělení může skutečně vyprodukovat číslo blízké dokonalosti, a přitom vám říci téměř nic o neuspořádané směsi modelů, úprav a parafrází, kterou obsahuje skutečná schránka. Statistické signály, na něž se detektory spoléhají, jsou podrobněji rozebrány v našem vysvětlení o jak fungují detektory AI.
Zlidštit vlastní práci
Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.
Falešně pozitivní výsledky: kdo je poškozen?
Návrh RAID zviditelňuje jeden kompromis, který marketing dodavatelů jen zřídka ukazuje: každé skóre přesnosti ve studii bylo měřeno po nastavení míry falešně pozitivních výsledků na 5%. Při této kalibraci je označen 1 z 20 skutečně lidských dokumentů. Detektor může tuto míru snížit zvýšením svého prahu, ale jen za cenu nižšího záchytu textu AI, obě čísla se pohybují společně a dodavatel, který uvádí jedno bez druhého, uvádí jen polovinu výsledku.
Zátěž těchto chyb není rozložena rovnoměrně. Text, který je formulaický, konvenční a s nízkou variabilitou, působí na každý statistický detektor strojově, a tento popis odpovídá metodickým částem, přehledům literatury i pečlivé próze autorů pracujících v druhém jazyce. Vzorec AI detektory označují nerodilé mluvčí angličtiny ve zvýšené míře je doložen napříč odvětvím a nic na metodě Winston z něj nevyjímá. Mapování predikce po jednotlivých větách si zaslouží stejnou opatrnost, červeně zvýrazněná věta je statistické pozorování vzorců slov, nikoli důkaz o autorství. Studenti, kteří čelí neoprávněnému označení, by měli vycházet z dokumentace, nikoli z přiznání, náš průvodce jak prokázat, že jste nepoužili AI popisuje, co skutečně přesvědčuje.
Ceny a přístup
Winston je placený produkt s omezenou zkušební verzí. Winston uvádí 14denní bezplatnou zkušební verzi s 2,000 kredity, tarif Essential za $18 měsíčně, nebo $10 měsíčně při roční fakturaci, s 100,000 měsíčními kredity, tarif Advanced za $29 měsíčně, nebo $16 ročně, který přidává týmová místa a větší skeny, a nad tím ještě úroveň Elite. Pro jednotlivého vyučujícího, který prověřuje odevzdání v rozsahu jedné třídy, to staví Winston do kategorie impulzivního nákupu, levnějšího než institucionální smlouvy, schopnějšího než většina bezplatných nástrojů.
Kde Winston zapadá do prostředí detektorů
Podle nezávislých důkazů je Winston komerční detektor střední cenové hladiny, který si vede lépe než bezplatná úroveň trhu a hůře než jeho vlastní reklama. Hodí se pro vyučujícího, který chce viditelnost po jednotlivých větách, integraci s Classroom a kontrolu plagiátorství v jednom levném nástroji, a který považuje každý výsledek za podnět k rozhovoru, nikoli za verdikt. Nehodí se pro nikoho, kdo potřebuje, aby skóre fungovalo jako důkaz, protože žádné skóre detektoru to nedokáže.
Úplné srovnání
Winston je jeden detektor v přeplněném poli a jeho rozdíl 71 % oproti 99.98 % je jedním příkladem celoodvětvového vzorce. Jak si vede ve srovnání s Turnitin, GPTZero, Originality, ZeroGPT a ostatními na stejných, na důkazech založených kritériích, viz náš úplný průvodce AI detektory ve srovnání.
Co zjistil náš vlastní výzkum
Ve studii shody detektorů od TextPulse Research hodnotilo devět komerčních AI detektorů stejných 90 akademických textů. Jedním z nich byl hybridní text o 455 slovech: lidsky psaný začátek a závěr kolem AI generované střední části o 168 slovech. Winston AI ohodnotil tento text na 7% AI, zatímco verdikty ostatních nástrojů nad stejnými slovy sahaly od 0% do 95.7% AI. Celá studie, korpus i matice skóre všech nástrojů jsou volně dostupné na TextPulse Research.

Často kladené otázky
Hodnota 99,98% je vlastní tvrzení Winston AI, změřené na interní testovací sadě, kterou společnost nezveřejnila. V recenzovaném RAID benchmarku představeném na ACL 2024 dosáhl Winston celkové přesnosti 71.0% při pevně nastavené míře falešně pozitivních výsledků 5%, ačkoli na výstupech ChatGPT dosáhl konkrétně 99.6%. Toto tvrzení popisuje zvolený korpus, nikoli výkon v reálném světě.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.