AI Detection

Recenzie Winston AI: afirmația de acuratețe de 99.98% versus dovezile

Winston AI afirmă o acuratețe de 99.98%, cea mai mare valoare auto-atribuită din industria detectoarelor, măsurată pe un set intern de testare pe care compania nu l-a publicat niciodată. Benchmarkul RAID evaluat de colegi a stabilit acuratețea sa generală la 71% la o rată fixă a falselor pozitive de 5%, încă pe locul al doilea dintre cele patru detectoare comerciale testate. Iată ce măsoară de fapt fiecare număr și cui i se potrivește cu adevărat acest instrument.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI afișează o acuratețe de 99.98%, cea mai mare valoare auto-atribuită dintre toate detectoarele AI consacrate. Cifra apare pe pagina principală a companiei, lângă cuvintele „The Most Trusted AI Detector”, și provine din testarea internă a companiei, nu dintr-un laborator extern. Nu este publicată alături de ea nicio metodologie, nicio dimensiune a setului de testare, nici raportul dintre eșantioanele umane și cele generate de AI, nici pragul de funcționare. Această diferență dintre afirmație și documentația ei este primul lucru pe care un cititor atent trebuie să îl știe despre acest instrument.

Al doilea lucru este că Winston a fost, de fapt, testat de terți, ceea ce este mai mult decât pot spune unele detectoare. Benchmark-ul RAID, un studiu evaluat de colegi și prezentat la ACL 2024, a testat Winston pe aproximativ 6.2 milioane de texte generate de mașină și a măsurat o acuratețe generală de 71.0% cu rata de fals pozitiv fixată la 5%. Aceasta este foarte departe de 99.98%. De asemenea, a plasat Winston pe locul al doilea dintre cele patru detectoare comerciale testate, înaintea GPTZero și ZeroGPT. Ambele fapte contează, și niciuna nu o anulează pe cealaltă.

În continuare sunt prezentate ce este Winston și pentru cine este conceput, ce susține furnizorul, ce poate și ce nu poate însemna statistic un auto-benchmark de 99.98%, și ce arată de fapt cifrele independente.

Ce este Winston AI și cine îl folosește?

Winston AI este un detector plătit, bazat pe abonament, destinat în mod direct educatorilor și editorilor de conținut. Lista sa de funcții seamănă cu fluxul de lucru al unui profesor: site-ul companiei descrie OCR care extrage text din documente scanate, fotografii și scris de mână, o integrare Google Classroom menționată printre platformele sale acceptate, un verificator de plagiat alături de detectarea AI și organizarea documentelor pentru gestionarea loturilor de lucrări trimise. Furnizorul afirmă că detectează output din ChatGPT, Gemini, Claude, LLaMA „și multe altele”.

Cea mai distinctivă parte a interfeței este rezultatul pe propoziție. În loc să returneze doar un singur procent, Winston produce ceea ce numește o hartă de predicție AI, o evaluare codificată prin culori, propoziție cu propoziție, a părților dintr-un document care par generate de mașină. Pentru un educator, această hartă este mai utilă decât un scor brut, deoarece arată unde se concentrează suspiciunea instrumentului. De asemenea, poate fi ușor suprainterpretată, un punct abordat mai jos.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
Insigna în cauză: 99.98% accurate, pe pagina principală, fără niciun studiu numit în spatele ei.

Ce susține compania?

Afirmația principală de pe pagina principală a Winston AI este „99.98% Accurate.” În momentul redactării, pagina care afișează această cifră nu publică modul în care a fost construit corpusul de test, câte eșantioane a conținut, ce combinație de text uman și text AI a folosit sau la ce prag de decizie a fost setat detectorul atunci când a fost măsurată cifra. Acest lucru nu este neobișnuit pentru această industrie, aceeași diferență dintre afirmațiile de acuratețe ale furnizorilor și dovezile independente apare la aproape fiecare detector de pe piață. Versiunea Winston a afirmației este pur și simplu cel mai mare număr care i-a fost atribuit.

Ce poate însemna de fapt un auto-benchmark de 99.98%?

Luați în serios aritmetica pentru un moment. O rată de acuratețe de 99.98% înseamnă 2 erori la fiecare 10,000 de eșantioane. Pentru a măsura deloc această cifră, o companie are nevoie de un set de test etichetat de cel puțin zeci de mii de documente, în care originea reală a fiecărui text este cunoscută cu certitudine. Apoi, numărul descrie doar performanța pe acel corpus, acele modele AI, acele prompturi, acele genuri, acea lungime a textului, la un prag ales.

Nimic din toate acestea nu presupune reavoință. Un detector antrenat pe eseuri generate de modele de chat populare, apoi testat pe un corpus de eseuri generate de modele de chat populare, va obține într-adevăr scoruri aproape de plafon. Problema este transferabilitatea. În momentul în care textul de intrare provine de la un model diferit, de la o strategie de eșantionare diferită sau de la un autor al cărui stil natural este neobișnuit de uniform, corpusul pe care a fost măsurat benchmark-ul nu mai descrie textul evaluat. Un benchmark intern este un experiment controlat realizat de partea care are cel mai puternic interes în rezultat, în condiții alese de ea însăși. Este o dovadă, dar de cel mai slab tip, iar metodologia lipsă înseamnă că nimeni din afara companiei nu o poate nici măcar verifica.

Ce arată testarea independentă?

Cel mai riguros test public care include Winston este RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, un studiu evaluat de colegi, realizat de Dugan și colaboratorii săi și prezentat la ACL 2024. RAID a evaluat 12 detectoare, inclusiv patru produse comerciale, pe aproximativ 6.2 milioane de generări care acoperă 11 modele lingvistice, 8 domenii de scriere, 4 strategii de decodare și 11 atacuri adversariale, fiecare detector fiind calibrat la aceeași rată de fals pozitiv de 5% astfel încât scorurile să fie comparabile.

DetectorAcuratețe generală în RAID (FPR fixată la 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

Două lecturi ale acelui tabel sunt, în același timp, oneste. 71.0% al lui Winston este departe de 99.98%, iar Winston a depășit totuși doi dintre cei trei rivali comerciali ai săi pe cel mai dificil reper public disponibil. Mediile ascund, de asemenea, o variație revelatoare. În rezultatele RAID pe model, Winston a obținut 99.6% pe ieșirea ChatGPT și 98.8% pe ieșirea GPT-4, aproape de propria cifră declarată, dar a coborât la 47.6% pe text GPT-2 și la 24.8% pe textul provenit din modelul de bază MPT-30B. Pe textul de mașină parafrazat, acuratețea sa a scăzut la 52.6%.

Această variație este întreaga poveste a afirmației de 99.98%, în miniatură. Pe text care seamănă cu ceea ce detectorul a fost, probabil, calibrat să recunoască, modele de chat recente care scriu proză obișnuită, Winston performează aproape conform marketingului său. În afara acelei distribuții, performanța se prăbușește. Un reper intern construit din text aflat în distribuție poate produce cu adevărat un număr aproape perfect, spunându-vă în același timp aproape nimic despre amestecul dezordonat de modele, editări și parafrazări pe care îl conține o inbox reală. Semnalele statistice pe care se bazează detectoarele sunt prezentate mai detaliat în explicația noastră despre cum funcționează detectoarele AI.

Umanizează-ți propria lucrare

Transformă textul tău asistat de AI și fă-l să sune uman, fără a atinge cuvintele importante sau citările.

Începe gratuit

False pozitive, cine este afectat?

Proiectarea RAID face vizibil un compromis pe care marketingul furnizorilor îl arată rareori: fiecare scor de acuratețe din studiu a fost măsurat după fixarea ratei de fals pozitiv la 5%. La această calibrare, 1 din 20 de documente cu adevărat umane este marcat. Un detector poate reduce această rată prin creșterea pragului său, dar numai cu prețul detectării unei cantități mai mici de text AI, cele două numere se mișcă împreună, iar un furnizor care îl citează pe unul fără celălalt citează jumătate dintr-un rezultat.

Povara acestor erori nu este distribuită uniform. Scrierea care este formulată, convențională și cu variație redusă pare mecanică pentru orice detector statistic, iar această descriere se potrivește secțiunilor de metodologie, recenziilor de literatură și prozei atente a autorilor care lucrează într-o a doua limbă. Modelul de AI detectors care semnalează vorbitorii non-nativi de engleză la rate mai ridicate este documentat în întreaga industrie, iar nimic din metoda lui Winston nu îl exceptă. Harta de predicție la nivel de propoziție merită aceeași prudență, o propoziție evidențiată cu roșu este o observație statistică despre tiparele de cuvinte, nu o dovadă privind autoratul. Studenții care se confruntă cu o semnalare eronată ar trebui să pornească de la documentație, nu de la confesiune, ghidul nostru despre cum să dovedești că nu ai folosit AI acoperă ceea ce convinge cu adevărat.

Prețuri și acces

Winston este un produs plătit, cu o perioadă de probă limitată. Winston afișează o perioadă de probă gratuită de 14-day cu 2,000 credite, un plan Essential la $18 pe lună, sau $10 pe lună facturat anual, cu 100,000 credite lunare, un plan Advanced la $29 pe lună, sau $16 anual, care adaugă locuri pentru echipă și scanări mai ample, și un nivel Elite deasupra acestuia. Pentru un educator individual care verifică un număr de lucrări echivalent cu o clasă, asta plasează Winston în zona unei achiziții impulsive, mai ieftin decât contractele instituționale, mai capabil decât majoritatea instrumentelor gratuite.

Unde se încadrează Winston în peisajul detectorilor

Pe baza dovezilor independente, Winston este un detector comercial cu preț mediu, care performează mai bine decât nivelul gratuit al pieței și mai slab decât propria sa publicitate. Se potrivește unui educator care dorește vizibilitate la nivel de propoziție, integrare Classroom și verificare a plagiatului într-un singur instrument ieftin și care tratează fiecare rezultat ca pe un pretext pentru o conversație, nu ca pe un verdict. Nu se potrivește nimănui care are nevoie ca scorul să funcționeze ca dovadă, deoarece scorul niciunui detector nu face asta.

Comparația completă

Winston este un detector într-un domeniu aglomerat, iar diferența sa de 71% față de 99.98% este un exemplu al unui tipar la nivelul întregii industrii. Pentru modul în care se compară cu Turnitin, GPTZero, Originality, ZeroGPT și ceilalți, pe aceleași criterii bazate pe dovezi, vedeți ghidul nostru complet despre AI detectors compared.

Ce a arătat propria noastră cercetare

În studiul de acord între detectoare realizat de TextPulse Research, nouă detectoare comerciale de AI au evaluat aceleași 90 de texte academice. Unul era un text hibrid de 455 de cuvinte: un început și un final scrise de om în jurul unei părți centrale de 168 de cuvinte generate de AI. Winston AI a notat acest text cu 7% AI, în timp ce verdictele celorlalte instrumente pentru aceleași cuvinte au variat de la 0% la 95.7% AI. Lucrarea completă, corpusul și matricea scorurilor pe instrument sunt disponibile liber la TextPulse Research.

Winston AI pe textul hibrid din corpusul studiului.
Winston AI pe textul hibrid din corpusul studiului.
XLinkedInFacebook

Întrebări frecvente

Cifra de 99.98% este propria afirmație a Winston AI, măsurată pe un set intern de testare pe care compania nu l-a publicat. În benchmarkul RAID evaluat de colegi, prezentat la ACL 2024, Winston a obținut 71.0% acuratețe generală, cu rata falselor pozitive fixată la 5%, deși a atins 99.6% în mod specific pe ieșirea ChatGPT. Afirmația descrie un corpus ales, nu performanța din lumea reală.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Rămâi la curent cu umanizarea AI

Primește în inbox sfaturi despre scriere academică, detectarea AI și umanizare.

Fără spam. Te poți dezabona oricând.