AI Detection

Prawdopodobieństwo tokenów i logarytmiczna wiarygodność w wykrywaniu AI

Perpleksja przyciąga uwagę, lecz arytmetyka leżąca u jej podstaw to prawdopodobieństwo tokenów: co rzeczywiście zawiera rozkład modelu dla następnego słowa, dlaczego matematyka wykrywania działa w przestrzeni logarytmicznej zamiast na surowym prawdopodobieństwie i jak ciąg wyników per token staje się jedną liczbą.

Zaktualizowano dnia 6 min
Diagram illustrating token probability ai detection: a language model's next-token distribution turning into a log-likelihood score

Jeśli zapytasz detektor, jak doszedł do takiego wyniku, większość jego interfejsów użytkownika da ci tę samą odpowiedź: akapit, w którym niektóre słowa są zacienione ciemniej niż inne. To cieniowanie nie jest przypuszczeniem. Pochodzi z liczby przypisanej do każdego tokenu w fragmencie, obliczonej zanim detektor w ogóle dotknie perplexity, burstiness albo końcowego procentu.

Jest to prawdopodobieństwo tokenu, a każde wykrywanie ai oparte jest na tym prawdopodobieństwie tokenu, od podstaw. Każda liczba metryk, którą detektor może raportować, w tym dwie, które omawiamy gdzie indziej na tej stronie, to po prostu arytmetyka zastosowana do szeregu tych liczb. Warstwa pod warstwą, na której zatrzymuje się większość wyjaśnień, to miejsce, w którym trzeba zastanowić się, czym token właściwie jest, co oznacza rozkład modelu nad nim i dlaczego arytmetyka działa w przestrzeni logarytmicznej, a nie na surowym prawdopodobieństwie. Większość wyjaśnień zatrzymuje się właśnie tam.

Nic z tego nie musi pozostawać nieprzejrzyste. Token, rozkład prawdopodobieństwa i logarytm to zwykłe narzędzia, a nie zastrzeżone sekrety, i te same trzy idee wyjaśniają jak naprawdę działają detektory AI, od surowego tekstu do jednej liczby w raporcie.

Wykrywanie AI na podstawie prawdopodobieństwa tokenu: od rozkładu do wyniku

Wykrywanie ai na podstawie prawdopodobieństwa tokenu działa w trzech etapach. Model językowy przypisuje prawdopodobieństwo każdemu możliwemu następnemu tokenowi, biorąc pod uwagę to, co było wcześniej. Te prawdopodobieństwa dla poszczególnych tokenów są przekształcane w logarytmy i sumowane w całym fragmencie, co omija problem numeryczny, na który niemal natychmiast natrafia zwykłe mnożenie. Otrzymana suma, uśredniona i przeskalowana, to to, co ostatecznie pojawia się jako wartość perplexity albo zasila decyzję klasyfikatora. Każdy etap jest konkretnym, możliwym do sprawdzenia elementem arytmetyki, a nie czarną skrzynką.

Czym właściwie jest token

Token nie jest słowem. Współczesne modele językowe dzielą tekst na podjednostki słów za pomocą algorytmu takiego jak byte-pair encoding, więc częste słowo, takie jak 'the', zwykle stanowi jeden token, rzadsze słowo, takie jak 'perplexity', dzieli się na dwie lub trzy części, a nieznana nazwa może rozpaść się na pojedyncze znaki. Fragment zwykłego angielskiego niezawodnie tokenizuje się na więcej części, niż ma słów, co warto wiedzieć, zanim zaufa się jakiejkolwiek liczbie słów zwracanej przez narzędzie.

Model nigdy nie widzi słów tak, jak widzi je czytelnik. Widzi ciąg liczb całkowitych, z których każda jest indeksem w ustalonym słowniku, na którym model był trenowany. Wszystko, co robi token probability ai detection od tego momentu, działa na tym ciągu liczb całkowitych, a nie na oryginalnym ciągu liter, co częściowo wyjaśnia, dlaczego wewnętrzne działanie detektora może wydawać się oderwane od tego, jak człowiek rzeczywiście czyta zdanie.

Rozkład Modelu Nad Następnym Tokenem

Na każdej pozycji w sekwencji autoregresyjny model językowy nie zwraca jednej predykcji. Zwraca pełny rozkład prawdopodobieństwa dla całego swojego słownika, dziesiątki tysięcy liczb, które sumują się do jedności, porządkując każdy możliwy następny token od najbardziej do najmniej prawdopodobnego, biorąc pod uwagę wszystko, co było wcześniej. Jeśli podać modelowi frazę 'the results of the', rozdziela on większość tej masy prawdopodobieństwa między kilka prawdopodobnych rzeczowników, 'study,' 'experiment,' 'analysis,' przypisując znikomo mały udział czemuś takiemu jak 'marmalade.'

Token, który rzeczywiście pojawia się jako następny w rzeczywistym dokumencie, trafia gdzieś w tym rankingu, a przypisane mu prawdopodobieństwo jest surowym materiałem, z którego zbudowane jest wszystko inne. Model tworzący własny tekst może bezpośrednio opierać się na tym rozkładzie, wielokrotnie wybierając spośród pozycji bliskich szczytu. Detektor czytający cudzy gotowy tekst może jedynie zapytać po fakcie, jak duże prawdopodobieństwo model przypisałby wyborowi, który rzeczywiście został dokonany.

Prawdopodobieństwo całego ciągu jest iloczynem prawdopodobieństwa każdego tokena, przy założeniu wszystkiego, co poprzedzało go wcześniej, jeśli połączymy to pytanie dotyczące każdego tokena w całym dokumencie, stosując standardową regułę prawdopodobieństwa łącznego, końcowym wynikiem jest pojedyncza liczba opisująca, jak bardzo oczekiwany był cały fragment. To właśnie ten iloczyn sprawia, że arytmetyka zaczyna się załamywać, i dlatego istnieje następna sekcja.

Humanizuj własną pracę

Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.

Zacznij za darmo

Dlaczego logarytmiczne prawdopodobieństwo zastępuje surowe prawdopodobieństwo

Mnożenie prawdopodobieństw jest matematycznie poprawne i praktycznie bezużyteczne po kilku dziesiątkach tokenów. Każde pojedyncze prawdopodobieństwo jest ułamkiem mniejszym od jedności, więc bieżący iloczyn zmniejsza się za każdym razem, gdy mnoży się kolejny token, i zmniejsza się szybko. Po kilkuset tokenach surowy iloczyn może spaść tak daleko poniżej najmniejszej liczby, jaką komputer może reprezentować, że zostaje zaokrąglony do dokładnie zera, co jest trybem awarii nazywanym underflow.

Gdy tak się stanie, liczba nie niesie już żadnej informacji. Dokument, który był jedynie mało prawdopodobny, oraz dokument, który był skrajnie, chaotycznie mało prawdopodobny, oba zapadają się do identycznego zera, bez możliwości odróżnienia ich później. Logarytmy rozwiązują ten problem, ponieważ logarytm iloczynu jest równy sumie logarytmów, co stanowi tożsamość z podstawowej algebry. Sumowanie ciągu zwykłych liczb ujemnych nie powoduje underflow tak jak mnożenie ciągu małych ułamków, a ponadto jest tańsze obliczeniowo.

Długość fragmentu (ilustracyjna)Surowe prawdopodobieństwo, bieżący iloczynSuma logarytmicznych prawdopodobieństw
12 tokenów przy ilustracyjnej wartości 0.1 każdy1 x 10 do potęgi -12, nadal reprezentowalneokoło -27.6
350 tokenów przy ilustracyjnej wartości 0.1 każdy1 x 10 do potęgi -350, underflow do dokładnie 0około -805.9

To jest uproszczona ilustracja. Rzeczywiste prawdopodobieństwa dla poszczególnych tokenów różnią się ogromnie, zamiast utrzymywać się na stałym poziomie 0.1, ale kierunek problemu jest dokładnie właściwy. Gdy surowy iloczyn ulega niedomiarowi i spada do zera, porównanie, którego detektor rzeczywiście potrzebuje, czyli czy ten dokument był bardziej czy mniej oczekiwany niż tamten, staje się niemożliwe. Suma logarytmów prawdopodobieństwa nigdy nie zawodzi w ten sposób. Pozostaje precyzyjną, zwykłą, porównywalną liczbą bez względu na to, jak długi jest fragment, a to jest rzeczywisty powód, dla którego wykrywalność mierzy się w przestrzeni logarytmicznej, a nie w przestrzeni surowego prawdopodobieństwa.

Od wyników dla poszczególnych tokenów do wyniku detekcji

Sumowanie logarytmów prawdopodobieństwa w całym fragmencie daje całkowite logarytmiczne prawdopodobieństwo dokumentu według modelu odniesienia. Podzielenie przez liczbę tokenów usuwa wpływ długości i pozostawia średnie logarytmiczne prawdopodobieństwo na token, liczbę, którą można wreszcie porównać między esejem liczącym pięćset słów a rozdziałem pracy dyplomowej liczącym pięć tysięcy słów. Jeśli tę średnią zanegować i podnieść do potęgi, otrzymuje się wynik perplexity, metrykę, którą ten zbiór omawia w całości w osobnym omówieniu tego, co perplexity rzeczywiście mierzy.

Te same wartości dla poszczególnych zdań, śledzone pod kątem zmienności w obrębie dokumentu zamiast sprowadzone do jednej średniej, są tym, z czego zbudowana jest burstiness, sygnałem powiązanym z perplexity, ale odrębnym. Oba zaczynają od identycznych liczb dla poszczególnych tokenów opisanych powyżej. Po prostu wykonują na nich inną arytmetykę.

Prosta średnia nie jest jedynym sposobem wykorzystania tego surowego materiału, a badania dawno już wykroczyły poza nią. DetectGPT, opublikowany na ICML 2023 przez Mitchell, Lee, Khazatsky, Manning i Finn, opiera się na innej własności tej samej funkcji prawdopodobieństwa: tekst próbkowany z modelu językowego ma tendencję do znajdowania się w regionie, w którym niewielkie przeformułowania powodują spadek, a nie wzrost, logarytmicznego prawdopodobieństwa, co artykuł nazywa ujemną krzywizną.

Zamiast trenować klasyfikator lub używać znaku wodnego, ta metoda zaburza fragment, tworząc drobne warianty tego, jak został on przeformułowany, a następnie ponownie ocenia każdy wariant tym samym modelem. Artykuł porównuje to z najlepszą bazą odniesienia zero-shot i stwierdza, że w przypadku tekstu wygenerowanego przez model o 20 miliardach parametrów ta metoda osiąga 0.95 AUROC, podczas gdy najlepsza baza odniesienia zero-shot osiąga 0.81 AUROC.

To samo rozkładanie, użyte do znakowania wodnego zamiast wykrywania

Dotąd wszystko traktowało rozkład prawdopodobieństwa jako coś odczytywanego po fakcie. Można go jednak także modyfikować w momencie generowania, co całkowicie odwraca problem. Metoda z 2023 roku autorstwa Kirchenbauer, Geiping, Wen, Katz, Miers i Goldstein wybiera losową krótką listę dozwolonych tokenów przed wygenerowaniem każdego słowa, na podstawie skrótu tego, co było wcześniej, i łagodnie kieruje próbkowanie ku tej krótkiej liście. To odchylenie jest niewidoczne dla czytelnika i można je później odzyskać za pomocą testu statystycznego na krótkim fragmencie tekstu, bez potrzeby dostępu do oryginalnego modelu.

SynthID firmy Google DeepMind wdraża wersję tej idei w praktyce: dostosowuje wyniki prawdopodobieństwa następnego tokenu w czasie generowania i jest dziś dostępny w aplikacji Gemini oraz w wersji webowej. OpenAI zbudowało porównywalny system i go nie opublikowało. Doniesienia przypisują tę decyzję częściowo ankiecie, w której blisko 30 percent użytkowników ChatGPT stwierdziło, że znakowanie wodne sprawiłoby, iż rzadziej korzystaliby z produktu, a także obawom o to, jak dobrze znak wodny przetrwa parafrazowanie.

Raport detektora pokazuje zacienione słowo albo pojedynczy procent i na tym się kończy, nigdy nie pokazując rozkładu, z którego to wszystko pochodzi. Darmowy checker perplexity TextPulse uruchamia uproszczoną wersję tego samego punktowego oceniania względem własnego szkicu, co jest bardziej bezpośrednim sposobem zobaczenia, gdzie dany fragment się znajduje, niż czytanie werdyktu z drugiej ręki.

Dwie sąsiednie strony obejmują to. To, czy detektory nadal opierają się na burstiness zmieniło się od 2023 roku, a jak GPTZero przekształca te same prawdopodobieństwa w wynik jest opisane na osobnej stronie.

Znajduje się to obok pozostałych bezpłatnych narzędzi TextPulse, więc ten sam szkic można sprawdzić pod kątem rytmu i struktury, a także przewidywalności na poziomie słów, bez otwierania tuzina osobnych kart, aby to zrobić.

Najczęściej zadawane pytania

Wykrywanie AI na podstawie prawdopodobieństwa tokenów stanowi warstwę leżącą pod każdą inną metryką wykrywania. Model językowy przypisuje prawdopodobieństwo każdemu tokenowi w sekwencji, po jednym fragmencie słowa naraz, na podstawie wszystkiego, co pojawiło się wcześniej. Perpleksja, wyniki klasyfikatora i procent w raporcie to wszystko arytmetyka wykonana później na tej sekwencji liczb, a nie odrębny, niezależny pomiar.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Bądź na bieżąco z humanizacją AI

Otrzymuj wskazówki dotyczące pisania akademickiego, wykrywania AI i humanizacji prosto na swoją skrzynkę.

Bez spamu. Możesz zrezygnować w dowolnym momencie.