AI Detection

Czy detektory AI nadal opierają się na perplexity i burstiness?

GPTZero spopularyzowało perplexity i burstiness, a następnie po cichu wycofało oba pojęcia jesienią 2023 na rzecz klasyfikatora opartego na deep learning. Ten tekst śledzi, co się zmieniło, co GPTZero i Turnitin faktycznie dokumentują dziś oraz dlaczego te dwie statystyki nadal wyjaśniają, dlaczego tekst generowany maszynowo jest wykrywalny, mimo że żaden z tych dostawców nie oblicza ich już bezpośrednio.

5 min
Is burstiness still used by AI detectors? GPTZero's 2023 shift from a statistical formula to a trained classifier.

Wyszukaj, jak GPTZero wykrywa dziś teksty generowane przez AI, a większość wyników nadal koncentruje się na dwóch statystykach, perplexity i burstiness, czyli parze, która uczyniła to narzędzie sławnym w ciągu kilku tygodni od jego uruchomienia w styczniu 2023 roku. Własna dokumentacja pomocy GPTZero mówi dziś coś innego: jesienią tego samego roku przestało ono używać obu tych miar.

Czy zatem burstiness jest nadal używane przez detektory AI? Nie przez narzędzie, które uczyniło ten termin powszechnie znanym w środowisku akademickim. Centrum pomocy GPTZero stwierdza wprost, że nie używa już perplexity ani burstiness, lecz przeszło na architekturę opartą na deep learning. Turnitin, narzędzie, z którym większość studentów faktycznie się spotyka, nigdy nie opublikowało żadnego z tych terminów jako części swojej metody. Te pojęcia nie zniknęły z dyskusji. Zniknęły z produktów, które rzeczywiście dokonują wykrywania.

Czy burstiness jest nadal używane przez detektory AI?

Nie, nie przez GPTZero i nie pod tą nazwą. Własna dokumentacja pomocy GPTZero mówi to wprost: "As of autumn 2023, GPTZero no longer uses perplexity and burstiness for its AI detection because we migrated to a deep-learning based architecture." Własne przewodniki Turnitin opisują jeszcze inną metodę, opartą na punktowaniu fragmentów zgłoszenia przez wytrenowany klasyfikator, a żaden z tych terminów nie pojawia się również w tej dokumentacji. Dwie statystyki, które zdefiniowały pierwszą falę wykrywania AI, nie są tym, na czym obecnie działają wiodące narzędzia. To stwierdzenie jest węższe niż twierdzenie, że zostały odrzucone: własne objaśnienie GPTZero nadal zalicza je do siedmiu wskaźników zasilających jego model. Przestały być metodą, nie przestając być miarą, a różnica między tymi dwoma twierdzeniami stanowi w dużej mierze istotę tego pytania.

Co zmieniło się jesienią 2023 roku

Oba terminy nigdy nie były niejasne. Własny wczesny objaśniacz GPTZero definiował perplexity jako "miarę tego, jak prawdopodobne byłoby, że model AI wybrałby dokładnie ten sam zestaw słów, jaki znajduje się w dokumencie", a burstiness jako "miarę tego, jak bardzo wzorce pisania i perplexities tekstu różnią się w całym dokumencie", czyli statystykę na poziomie dokumentu, a nie prosty zliczanie długości zdań. Obie definicje są nadal opublikowane na stronie GPTZero. Zmieniło się to, który z nich detektor faktycznie uruchamia.

"Migrated to a deep-learning based architecture" to konkretne twierdzenie, a nie fraza marketingowa, i opisuje rzeczywistą zmianę rodzaju. Wynik perplexity jest obliczany bezpośrednio z formuły: tekst przepuszcza się przez referencyjny model językowy, uśrednia się logarytmy prawdopodobieństw, a następnie potęguje się wynik. Zamiast tego trenuje się klasyfikator deep-learning, pokazuje mu się duże zbiory przykładów tekstów ludzkich i napisanych przez AI, aż sam nauczy się, jaka kombinacja cech odróżnia te dwie grupy w danych treningowych. W drugim podejściu nikt nie zapisuje reguły ręcznie. Model ją znajduje.

Oba wycofane terminy mają pełne omówienie w innym miejscu na tej stronie: what perplexity actually measures oraz what burstiness actually measures szczegółowo opisują własne mechanizmy, w tym stojące za nimi formuły. Ten tekst pozostaje ściśle ograniczony do pytania, czy którykolwiek z nich jest nadal tym, co detektor uruchamia dzisiaj.

Co GPTZero i Turnitin Faktycznie Dokumentują Dzisiaj

Aktualna strona technologii GPTZero, która opisuje to, co jest dostarczane w produkcie, stwierdza, że ich detektor jest "end-to-end deep learning approach", z "sentence-by-sentence classification model", który generuje wynik prawdopodobieństwa wraz z oceną pewności. Perplexity i burstiness nie pojawiają się nigdzie na tej stronie, ani jako komponent, ani jako funkcja dziedziczona, ani w przypisie.

Dokumentacja Turnitin od samego początku nie była zbudowana wokół żadnego z tych terminów. Jej przewodniki opisują zgłoszenie podzielone na fragmenty liczące po kilkaset słów, każdy fragment oceniany przez wytrenowany model, a następnie wyniki fragmentów uśredniane do jednego procentu wyświetlanego w raporcie. Jest to klasyfikator nadzorowany działający na segmentach tekstu, należący do tej samej rodziny metod, do której przeszło GPTZero, a nie obliczanie perplexity i nie obliczanie burstiness pod inną nazwą.

Najłatwiej zobaczyć tę zmianę obok siebie.

Co opisywały wczesne objaśnienia (2023)Co opisuje obecna dokumentacja
GPTZeroPerplexity i burstiness, oceniane względem modelu referencyjnegoKlasyfikator deep learning działający zdanie po zdaniu, zwracający prawdopodobieństwo i wynik pewności
TurnitinNigdy nie opublikowano, terminy te nie pojawiają się w żadnych materiałach TurnitinFragmenty liczące po kilkaset słów, oceniane przez wytrenowany klasyfikator, uśredniane do jednego procentu

Humanizuj własną pracę

Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.

Zacznij za darmo

Dlaczego te pojęcia nadal wyjaśniają wykrywalność

Nic z tego nie czyni perplexity i burstiness pojęciami błędnymi, jedynie przestarzałymi jako opis obecnego mechanizmu. Oba pojęcia zawsze opisywały coś rzeczywistego: tekst generowany przez próbkowanie w kierunku najwyżej prawdopodobnych kontynuacji samego modelu bywa bardziej przewidywalny, słowo po słowie, niż tekst pisany od podstaw przez człowieka, a także zwykle mniej się zmienia z jednego zdania na następne. Ta podstawowa regularność nie zmieniła się tylko dlatego, że dostawca zmienił architekturę swojego detektora. Zmieniło się to, w jaki sposób detektor próbuje ją wykryć.

Wytrenowany klasyfikator nie jest wprost proszony o szukanie perplexity ani burstiness. Zamiast tego jest trenowany na tym samym podstawowym rozróżnieniu między tekstem ludzkim a maszynowym, które te dwie statystyki miały uchwycić. I wydaje się bardzo mało prawdopodobne, aby klasyfikator trenowany do odróżniania tych dwóch zbiorów nie opierał się również właśnie na tej regularności, jednej z najbardziej niezawodnych różnic między nimi. Jest to wniosek dotyczący tego, dlaczego klasyfikator prawdopodobnie działa, a nie twierdzenie o jego opublikowanej liście cech, i tych dwóch rzeczy nie należy ze sobą mieszać.

Niezależne badania potwierdzają ideę, że leżąca u podstaw statystyka nadal ma znaczenie, nawet poza produktem pojedynczego dostawcy. DetectGPT, akademicka metoda zero-shot opublikowana w 2023, analizuje bliską krewną perplexity, to, jak stromo funkcja log-prawdopodobieństwa modelu zakrzywia się wokół fragmentu tekstu, i osiąga 0.95 AUROC na jednym benchmarku wobec 0.81 dla najlepszego wcześniejszego baseline zero-shot, bez trenowania klasyfikatora na oznaczonych przykładach. Główna idea, że tekst generowany przez maszynę znajduje się w statystycznie odrębnym regionie własnej przestrzeni prawdopodobieństwa modelu, nadal pozostaje aktywnym obszarem badań. Po prostu nie jest to to, co GPTZero dostarcza użytkownikom.

Dlaczego tak wiele osób w internecie nadal się w tym myli

Większość opublikowanych wyjaśnień tego, jak działa wykrywanie AI, powstała w czasie lub krótko po uruchomieniu GPTZero w styczniu 2023, kiedy perplexity i burstiness były jedyną publiczną ramą interpretacyjną, jaką sama firma oferowała. Te pierwotne strony wyjaśniające nadal są dziś dostępne. Jesienne zawiadomienie o wycofaniu z 2023 znajduje się na osobnej stronie pomocy, a nie zostało włączone do nich, więc autor, który przeczytał pierwszą stronę i przestał dalej szukać, nie miałby powodu wiedzieć, że metoda zmieniła się mniej niż rok później.

Recenzja detektora strony trzeciej krążąca w 2026 twierdzi, że GPTZero nadal stosuje perplexity i burstiness jako jedną warstwę spośród kilku w większym systemie. To twierdzenie pozostaje w bezpośredniej sprzeczności z aktualną stroną technologiczną GPTZero oraz z jego własną dokumentacją pomocy, a nic na stronie GPTZero nie potwierdza tej tezy. Firma opisująca własny dostarczony produkt nadal ma większą wiarygodność niż niepotwierdzone twierdzenie strony trzeciej o tym samym produkcie, choć dokumentacja dostawcy również może zawierać błędy. Ten tekst opiera się na własnych stronach GPTZero, a nie na recenzji powtarzającej starszą wersję tej historii.

Co to oznacza dla sposobu, w jaki piszesz

Praktyczna wskazówka oparta na burstiness nie stała się bezużyteczna tylko dlatego, że to słowo zniknęło z własnych materiałów GPTZero. Świadome zróżnicowanie długości zdań nadal, w sensie mechanicznym, jest argumentem za unikaniem tej samej statystycznej jednorodności, którą klasyfikator bardzo prawdopodobnie został wytrenowany rozpoznawać, niezależnie od tego, jak wewnętrznie nazywa ten sygnał. Podstawowa rada przetrwała zmianę architektury dostawcy, mimo że słownictwo, które ją opisywało, nie przetrwało.

Nic z tego nie wymaga przyjmowania niczyjego słowa na wiarę, w tym tego wpisu. Darmowy sprawdzacz perplexity TextPulse oraz szersza kolekcja darmowych narzędzi pozwalają sprawdzić, gdzie znajduje się Twój własny szkic, zanim zrobi to detektor, jakiejkolwiek generacji.

Jeśli odpowiedź odsyła Cię z powrotem do własnego tekstu, praktyczne dalsze kroki to świadome zwiększanie burstiness oraz zróżnicowanie długości zdań w obrębie akapitu akademickiego, co jest tym samym zadaniem opisanym bez użycia metryki.

Mechanizm, który uruchamia detektor, będzie się nadal zmieniał, GPTZero już raz go zmienił. Stałe pozostaje rzeczywiste pytanie, omówione w całości w przewodniku na tej stronie o tym, jak naprawdę działają detektory AI: czy przewidywalne pisanie jest tym samym co pisanie wygenerowane przez maszynę, niezależnie od tego, która formuła akurat jest modna w danym roku.

Najczęściej zadawane pytania

Czy burstiness nadal jest używane przez detektory AI? Nie przez GPTZero i nie pod tą nazwą. Własna dokumentacja pomocy GPTZero stwierdza, że przestało ono używać perplexity i burstiness do wykrywania od jesieni 2023, po przejściu na architekturę opartą na deep learning. Turnitin nigdy nie opublikował żadnego z tych terminów jako części swojej metody, a obie firmy opisują obecnie zamiast tego wytrenowane klasyfikatory.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.