AI Detection

Recenzja Winston AI: roszczenie 99.98% dokładności a dowody

Winston AI reklamuje 99.98% dokładności, najwyższą samodzielnie deklarowaną wartość w branży detektorów, zmierzoną na wewnętrznym zbiorze testowym, którego firma nigdy nie opublikowała. Recenzowany przez ekspertów benchmark RAID określił jego ogólną dokładność na 71% przy stałym 5% wskaźniku fałszywie dodatnich wyników, nadal drugim spośród czterech testowanych komercyjnych detektorów. Oto, co każda z tych liczb naprawdę mierzy i komu to narzędzie rzeczywiście odpowiada.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI reklamuje dokładność na poziomie 99.98%, najwyższą samodzielnie deklarowaną wartość spośród wszystkich głównych detektorów AI. Liczba ta widnieje na stronie głównej firmy obok słów "The Most Trusted AI Detector" i pochodzi z wewnętrznych testów firmy, a nie z zewnętrznego laboratorium. Nie opublikowano przy niej metodologii, wielkości zbioru testowego, proporcji próbek ludzkich do próbek generowanych przez AI ani progu działania. Ta luka między deklaracją a jej dokumentacją jest pierwszą rzeczą, którą uważny czytelnik powinien wiedzieć o tym narzędziu.

Drugą rzeczą jest to, że Winston został rzeczywiście przetestowany przez podmioty zewnętrzne, co nie jest czymś, co mogą powiedzieć wszystkie detektory. Benchmark RAID, recenzowane badanie przedstawione na ACL 2024, sprawdził Winston na około 6.2 miliona tekstów wygenerowanych maszynowo i zmierzył 71.0% dokładności ogólnej przy ustalonym współczynniku wyników fałszywie dodatnich na poziomie 5%. To bardzo daleko od 99.98%. Badanie umieściło też Winston na drugim miejscu spośród czterech testowanych komercyjnych detektorów, przed GPTZero i ZeroGPT. Oba fakty mają znaczenie i żaden nie unieważnia drugiego.

To, co następuje, wyjaśnia, czym jest Winston i dla kogo został stworzony, co twierdzi dostawca, co statystycznie może i czego nie może oznaczać własny benchmark na poziomie 99.98%, oraz co rzeczywiście pokazują niezależne liczby.

Czym jest Winston AI i kto z niego korzysta?

Winston AI jest płatnym detektorem opartym na subskrypcji, skierowanym bezpośrednio do nauczycieli i wydawców treści. Lista jego funkcji przypomina tok pracy nauczyciela: strona firmy opisuje OCR, które wyodrębnia tekst ze skanowanych dokumentów, zdjęć i pisma odręcznego, integrację z Google Classroom wymienioną wśród obsługiwanych platform, sprawdzanie plagiatu obok wykrywania AI oraz organizację dokumentów do zarządzania partiami zgłoszeń. Dostawca podaje, że wykrywa treści z ChatGPT, Gemini, Claude, LLaMA "and much more."

Najbardziej charakterystyczną częścią interfejsu jest wynik wyświetlany zdanie po zdaniu. Zamiast zwracać tylko jeden procent, Winston generuje to, co nazywa mapą predykcji AI: oznaczoną kolorami ocenę zdanie po zdaniu, wskazującą, które części dokumentu brzmią jak wygenerowane przez maszynę. Dla osoby uczącej jest to bardziej użyteczne niż sam wynik liczbowy, ponieważ pokazuje, gdzie skupia się podejrzenie narzędzia. Łatwo jednak nadinterpretować taki wynik, co omówiono poniżej.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
Sporny znak: 99.98% accurate, na stronie głównej, bez wskazanego badania, na którym się opiera.

Co twierdzi firma?

Główne twierdzenie na stronie głównej Winston AI brzmi "99.98% Accurate." W chwili pisania tego tekstu strona zawierająca tę wartość nie podaje, jak zbudowano korpus testowy, ile próbek zawierał, jaki był udział tekstów ludzkich i AI, ani przy jakim progu decyzyjnym ustawiono detektor, gdy mierzono tę wartość. Nie jest to nic niezwykłego w tej branży, ta sama luka między deklaracjami dokładności dostawców a niezależnymi dowodami występuje niemal w każdym detektorze na rynku. Wersja tego twierdzenia przedstawiona przez Winston jest po prostu największą liczbą, jaką ktokolwiek przy nim umieścił.

Co właściwie może oznaczać 99.98% własnego benchmarku?

Przez chwilę potraktujmy arytmetykę poważnie. Wskaźnik dokładności 99.98% oznacza 2 błędy na każde 10,000 próbek. Aby w ogóle zmierzyć taką wartość, firma potrzebuje oznaczonego zbioru testowego obejmującego co najmniej dziesiątki tysięcy dokumentów, w którym znane z całkowitą pewnością jest prawdziwe pochodzenie każdego tekstu. Wtedy liczba ta opisuje wyłącznie skuteczność na tym korpusie, na tych modelach AI, na tych promptach, w tych gatunkach tekstu, przy tej długości tekstu, przy jednym wybranym progu.

Nic z tego nie wymaga złej wiary. Detektor wytrenowany na esejach generowanych przez popularne modele czatu, a następnie testowany na korpusie esejów generowanych przez popularne modele czatu, rzeczywiście uzyska wynik bliski maksimum. Problemem jest przenoszalność. W chwili, gdy przychodzący tekst pochodzi z innego modelu, innej strategii próbkowania albo od autora, którego naturalny styl jest wyjątkowo jednolity, korpus, na którym zmierzono benchmark, nie opisuje już ocenianego tekstu. Wewnętrzny benchmark jest kontrolowanym eksperymentem prowadzonym przez stronę mającą najsilniejszy interes w jego wyniku, w warunkach przez nią samą wybranych. Jest to dowód, ale najsłabszego rodzaju, a brak metodologii oznacza, że nikt spoza firmy nie może go nawet sprawdzić.

Co pokazują niezależne testy?

Najbardziej rygorystycznym publicznym testem, który obejmuje Winston, jest RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, recenzowane badanie autorstwa Dugana i współpracowników, przedstawione na ACL 2024. RAID ocenił 12 detektorów, w tym cztery produkty komercyjne, na około 6,2 miliona generacji obejmujących 11 modeli językowych, 8 domen pisarskich, 4 strategie dekodowania i 11 ataków adversarialnych, przy czym każdy detektor został skalibrowany do tego samego 5% wskaźnika fałszywie pozytywnych wyników, aby wyniki były porównywalne.

DetektorOgólna dokładność w RAID (FPR ustalony na 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

Dwie interpretacje tej tabeli są jednocześnie uczciwe. 71.0% Winstona jest daleko od 99.98%, a Winston i tak pokonał dwóch z trzech swoich komercyjnych rywali na najtrudniejszym dostępnym publicznym benchmarku. Średnie ukrywają też wymowny rozrzut. W wynikach RAID dla poszczególnych modeli Winston uzyskał 99.6% na wyjściu ChatGPT i 98.8% na wyjściu GPT-4, blisko własnej deklarowanej wartości, lecz spadł do 47.6% na tekście GPT-2 i 24.8% na tekście z modelu bazowego MPT-30B. Na sparafrazowanym tekście maszynowym jego dokładność spadła do 52.6%.

Ten rozrzut jest w miniaturze całą historią roszczenia 99.98%. Na tekście przypominającym to, do czego detektor był zapewne dostrajany, nowsze modele czatu piszące zwykłą prozę, Winston działa blisko tego, co obiecuje marketing. Poza tym rozkładem skuteczność spada gwałtownie. Wewnętrzny benchmark zbudowany z tekstu z tego samego rozkładu może rzeczywiście dać wynik bliski ideału, a jednocześnie powiedzieć niemal nic o chaotycznej mieszaninie modeli, poprawek i parafraz, jaką zawiera rzeczywista skrzynka odbiorcza. O sygnałach statystycznych, na których opierają się detektory, piszemy szerzej w naszym objaśnieniu jak działają detektory AI.

Humanizuj własną pracę

Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.

Zacznij za darmo

Fałszywe alarmy: kto ponosi szkodę?

Projekt RAID ujawnia jedno ustępstwo, którego marketing dostawców rzadko pokazuje: każdy wynik dokładności w badaniu mierzono po ustaleniu wskaźnika fałszywie dodatnich wyników na poziomie 5%. Przy takiej kalibracji 1 na 20 rzeczywiście ludzkich dokumentów zostaje oznaczony. Detektor może obniżyć ten wskaźnik przez podniesienie progu, ale tylko kosztem wykrywania mniejszej ilości tekstu AI, te dwie wartości zmieniają się razem, a dostawca cytujący jedną bez drugiej cytuje tylko połowę wyniku.

Ciężar tych błędów nie rozkłada się równomiernie. Tekst, który jest schematyczny, konwencjonalny i ma niską zmienność, brzmi dla każdego detektora statystycznego jak wygenerowany maszynowo, a ten opis pasuje do sekcji metod, przeglądów literatury oraz starannej prozy autorów piszących w drugim języku. Wzorzec detektorów AI oznaczających osoby niebędące rodzimymi użytkownikami języka angielskiego z podwyższoną częstością jest udokumentowany w całej branży, i nic w metodzie Winston nie zwalnia jej z tego problemu. Mapa przewidywań dla poszczególnych zdań wymaga tej samej ostrożności, zdanie zaznaczone na czerwono jest obserwacją statystyczną dotyczącą wzorców słów, a nie dowodem autorstwa. Studenci, wobec których niesłusznie wystawiono oznaczenie, powinni zacząć od dokumentacji, a nie od przyznania się, nasz przewodnik o tym, jak udowodnić, że nie używało się AI, omawia to, co rzeczywiście przekonuje.

Cennik i dostęp

Winston jest produktem płatnym z ograniczonym okresem próbnym. Winston podaje 14-dniowy bezpłatny okres próbny z 2,000 kredytów, plan Essential za $18 miesięcznie, lub $10 miesięcznie przy rozliczeniu rocznym, z 100,000 kredytów miesięcznie, plan Advanced za $29 miesięcznie, lub $16 rocznie, który dodaje miejsca dla zespołu i większe skany, oraz wyższy poziom Elite. Dla pojedynczego nauczyciela sprawdzającego liczbę zgłoszeń odpowiadającą całej klasie, sytuacja ta lokuje Winston w obszarze zakupów impulsywnych, tańszym niż umowy instytucjonalne, bardziej zaawansowanym niż większość bezpłatnych narzędzi.

Miejsce Winston w krajobrazie detektorów

Na podstawie niezależnych danych Winston jest komercyjnym detektorem ze średniej półki cenowej, który działa lepiej niż bezpłatna wersja rynku i gorzej niż własna reklama. Nadaje się dla nauczyciela, który chce widoczności na poziomie pojedynczych zdań, integracji z Classroom oraz sprawdzania plagiatu w jednym niedrogim narzędziu, i który traktuje każdy wynik jako impuls do rozmowy, a nie jako rozstrzygnięcie. Nie nadaje się dla nikogo, kto potrzebuje, aby wynik funkcjonował jako dowód, ponieważ żaden wynik detektora nie pełni takiej roli.

Pełne porównanie

Winston jest jednym z detektorów na zatłoczonym rynku, a różnica między 71% a 99.98% jest jednym z przykładów wzorca występującego w całej branży. Aby zobaczyć, jak wypada na tle Turnitin, GPTZero, Originality, ZeroGPT i pozostałych w tych samych, opartych na dowodach kategoriach, zobacz nasz pełny przewodnik po porównaniu detektorów AI.

Co wykazały nasze własne badania

W badaniu zgodności detektorów TextPulse Research dziewięć komercyjnych detektorów AI oceniło te same 90 tekstów akademickich. Jednym z nich był hybrydowy tekst o długości 455 słów: napisany przez człowieka wstęp i zakończenie wokół środkowej części 168 słów wygenerowanej przez AI. Winston AI ocenił ten tekst na 7% AI, podczas gdy werdykty pozostałych narzędzi dla tych samych słów wahały się od 0% do 95.7% AI. Pełny artykuł, korpus i macierz wyników wszystkich narzędzi są otwarcie dostępne na TextPulse Research.

Winston AI wobec hybrydowego tekstu z korpusu badania.
Winston AI wobec hybrydowego tekstu z korpusu badania.

Najczęściej zadawane pytania

Wartość 99.98% to własne roszczenie Winston AI, zmierzone na wewnętrznym zbiorze testowym, którego firma nie opublikowała. W recenzowanym przez ekspertów benchmarku RAID przedstawionym na ACL 2024 Winston uzyskał 71.0% ogólnej dokładności przy wskaźniku fałszywie dodatnich wyników ustalonym na 5%, choć osiągnął 99.6% konkretnie dla wyników ChatGPT. To roszczenie opisuje wybrany korpus, a nie rzeczywistą skuteczność w praktyce.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Bądź na bieżąco z humanizacją AI

Otrzymuj wskazówki dotyczące pisania akademickiego, wykrywania AI i humanizacji prosto na swoją skrzynkę.

Bez spamu. Możesz zrezygnować w dowolnym momencie.