AI Detection

Вероятность токена и логарифмическая правдоподобность в обнаружении ИИ

Perplexity привлекает внимание, но лежащая в ее основе арифметика, это вероятность токена: что именно содержит распределение модели по следующему слову, почему математика обнаружения работает в логарифмическом пространстве, а не с сырой вероятностью, и как последовательность посимвольных оценок превращается в одно число.

Обновлено 6 min
Diagram illustrating token probability ai detection: a language model's next-token distribution turning into a log-likelihood score

Если вы спросите детектор, как он получил этот балл, большинство его пользовательских интерфейсов дадут вам один и тот же ответ: абзац, в котором одни слова затемнены сильнее, чем другие. Это затемнение не является догадкой. Оно происходит из числа, связанного с каждым токеном в отрывке, вычисленного ещё до того, как детектор вообще обращается к perplexity, burstiness или итоговому проценту.

Это вероятность токена, и вся token probability ai detection основана именно на ней, с самого начала. Любое число метрик, которое детектор может вывести, включая две, которые мы рассматриваем в другом месте на этом сайте, это лишь арифметика, применённая к ряду этих чисел. Слой под слоем, на котором останавливаются большинство объяснений, это место, где нужно подумать о том, что такое токен на самом деле, что означает распределение модели по нему и почему арифметика ведётся в логарифмическом пространстве, а не в пространстве исходных вероятностей. На этом большинство объяснений и заканчивается.

Во всём этом нет необходимости сохранять непрозрачность. Токен, распределение вероятностей и логарифм, это обычные инструменты, а не закрытые секреты, и те же три идеи объясняют как AI detectors на самом деле работают, от исходного текста до одного числа в отчёте.

Token Probability AI Detection: От распределения к баллу

Token probability ai detection работает в три этапа. Языковая модель присваивает вероятность каждому возможному следующему токену, исходя из того, что было до него. Эти вероятности по токенам преобразуются в логарифмы и суммируются по всему отрывку, что позволяет обойти численную проблему, с которой прямое перемножение сталкивается почти сразу. Полученная сумма, усреднённая и пересчитанная, в итоге проявляется как показатель perplexity или используется при принятии решения классификатором. Каждый этап, это конкретный, проверяемый фрагмент арифметики, а не чёрный ящик.

Что такое токен на самом деле

Токен не является словом. Современные языковые модели разбивают текст на подсловные единицы с помощью алгоритма, такого как byte-pair encoding, поэтому обычное слово, например 'the', обычно представляет собой один токен, менее распространённое слово, например 'perplexity', распадается на две или три части, а незнакомое имя может фрагментироваться до отдельных символов. Отрывок обычного английского языка надёжно токенизируется в большее число единиц, чем в нём слов, и это стоит знать, прежде чем доверять любому подсчёту слов, который сообщает вам инструмент.

Модель никогда не видит слова так, как их видит читатель. Она видит последовательность целых чисел, каждое из которых является индексом в фиксированном словаре, на котором модель была обучена. Всё, что делает token probability ai detection с этого момента, работает с этой последовательностью целых чисел, а не с исходной строкой букв, и именно поэтому внутреннее устройство детектора может казаться оторванным от того, как человек на самом деле читает предложение.

Распределение модели по следующему токену

В каждой позиции последовательности авторегрессионная языковая модель не выдаёт одно предсказание. Она выдаёт полное распределение вероятностей по всему своему словарю, десятки тысяч чисел, сумма которых равна единице, ранжируя каждый возможный следующий токен от наиболее до наименее вероятного с учётом всего, что было до этого. Если подать модели фразу 'the results of the', она распределит большую часть этой вероятностной массы между несколькими правдоподобными существительными, 'study,' 'experiment,' 'analysis,' одновременно присваивая ничтожно малую долю чему-то вроде 'marmalade.'

Токен, который в реальном документе действительно появляется следующим, оказывается где-то в этом ранжировании, и назначенная ему вероятность является исходным материалом, из которого строится всё остальное. Модель, создающая собственный текст, может опираться на это распределение напрямую, многократно выбирая из верхней части списка. Детектор, читающий чужой готовый текст, может лишь задним числом спросить, какую вероятность модель присвоила бы тому выбору, который был фактически сделан.

Вероятность всей последовательности представляет собой произведение вероятностей каждого токена при условии всего, что было до него, если мы последовательно применим этот вопрос к каждому токену ко всему документу, используя стандартное правило для совместной вероятности, то итогом будет одно число, описывающее, насколько ожидаемым был весь фрагмент. Именно на этом произведении арифметика начинает давать сбой, и поэтому существует следующий раздел.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Почему логарифмическая вероятность заменяет исходную вероятность

Перемножать вероятности между собой математически корректно, но практически бесполезно уже после нескольких десятков токенов. Каждая отдельная вероятность представляет собой дробь меньше единицы, поэтому текущее произведение уменьшается каждый раз, когда в него входит очередной токен, и уменьшается быстро. Уже через несколько сотен токенов исходное произведение может опуститься настолько ниже наименьшего числа, которое может представить компьютер, что оно округлится до точно нуля, это режим отказа, называемый underflow.

Как только это происходит, число вообще не несет информации. Документ, который был лишь маловероятным, и документ, который был крайне, хаотически маловероятным, оба сводятся к одному и тому же нулю, и после этого их невозможно различить. Логарифмы исправляют это, потому что логарифм произведения равен сумме логарифмов, это тождество из базовой алгебры. Суммирование последовательности обычных отрицательных чисел не приводит к underflow так, как это происходит при перемножении последовательности малых дробей, и к тому же это вычислительно дешевле.

Длина фрагмента, для иллюстрацииИсходная вероятность, текущее произведениеСумма логарифмов вероятностей
12 токенов при иллюстративном значении 0.1 каждый1 x 10 to the power of -12, все еще представимопримерно -27.6
350 токенов при иллюстративном значении 0.1 каждый1 x 10 to the power of -350, underflows to exactly 0примерно -805.9

Это упрощённая иллюстрация. Реальные вероятности для каждого токена сильно различаются, а не остаются на уровне 0.1, но направление проблемы совершенно верно. Как только необработанное произведение уходит в underflow и становится нулём, сравнение, которое на самом деле нужно детектору, был ли этот документ более или менее ожидаемым, чем тот, становится невозможным. Сумма логарифмов вероятностей никогда не отказывает таким образом. Она остаётся точным, обычным, сопоставимым числом независимо от того, насколько длинен фрагмент, и именно поэтому обнаруживаемость измеряют в логарифмическом пространстве, а не в пространстве необработанных вероятностей.

От оценок для каждого токена к оценке обнаружения

Суммирование логарифмов вероятностей по всему фрагменту даёт общую логарифмическую правдоподобность документа в рамках эталонной модели. Деление на число токенов устраняет влияние длины и оставляет среднюю логарифмическую правдоподобность на токен, число, которое наконец можно сравнивать между эссе на пятьсот слов и главой диссертации на пять тысяч слов. Если взять отрицание этого среднего и затем возвести его в экспоненту, получится показатель perplexity, метрика, которую этот кластер полностью рассматривает в отдельном материале о том, что на самом деле измеряет perplexity.

Те же самые показатели для каждого предложения, отслеживаемые на предмет вариации по всему документу, а не сведённые к одному среднему, это то, из чего строится burstiness, связанный, но отдельный сигнал по отношению к perplexity. Оба начинаются с тех же самых чисел для каждого токена, описанных выше. Они просто выполняют над ними разную арифметику.

Простое среднее не является единственным способом использовать этот исходный материал, и исследования давно вышли за его пределы. DetectGPT, опубликованная на ICML 2023 Mitchell, Lee, Khazatsky, Manning и Finn, опирается на иное свойство той же функции вероятности: текст, сгенерированный языковой моделью, как правило, находится в области, где небольшие переформулировки вызывают падение логарифмической вероятности, а не её рост, и в статье этот паттерн называется отрицательной кривизной.

Вместо обучения классификатора или использования водяного знака этот метод искажает фрагмент, создавая небольшие вариации в том, как он переформулируется, а затем повторно оценивает каждую вариацию той же моделью. В статье это сопоставляется с лучшей zero-shot базовой линией и показывается, что на тексте, сгенерированном моделью с 20 миллиардами параметров, этот метод достигает 0.95 AUROC, тогда как лучшая zero-shot базовая линия достигает 0.81 AUROC.

То же распределение, используемое для водяного знака вместо обнаружения

До сих пор все рассматривало распределение вероятностей как нечто, что считывается постфактум. Его также можно задействовать в момент генерации, и это полностью меняет постановку задачи. Метод 2023 года от Kirchenbauer, Geiping, Wen, Katz, Miers и Goldstein перед каждым сгенерированным словом выбирает случайным образом упорядоченный короткий список допустимых токенов, основываясь на хеше того, что было до этого, и мягко направляет выборку к этому короткому списку. Это смещение незаметно для читателя и впоследствии может быть восстановлено с помощью статистического теста на коротком отрезке текста, без необходимости доступа к исходной модели.

SynthID от Google DeepMind внедряет версию этой идеи в производство: он корректирует оценки вероятности следующего токена в момент генерации и уже доступен сегодня в приложении Gemini и в веб-версии. OpenAI создала сопоставимую систему и не выпустила ее. В отчетах это решение частично объясняется опросом, в котором почти 30 percent пользователей ChatGPT сказали, что водяной знак заставил бы их реже пользоваться продуктом, а также опасениями относительно того, насколько хорошо водяной знак выдержит перефразирование.

Отчет детектора показывает затемненное слово или один процент и на этом останавливается, так и не показывая распределение, из которого все это произошло. Бесплатный perplexity checker от TextPulse запускает упрощенную версию того же покомпонентного оценивания по токенам на вашем собственном черновике, что является более прямым способом увидеть, где находится фрагмент, чем читать вывод через посредника.

Две соседние страницы подхватывают это. Сохраняют ли детекторы по-прежнему зависимость от burstiness изменилось с 2023 года, а как GPTZero превращает эти же вероятности в оценку описано на отдельной странице.

Это находится рядом с остальными бесплатными инструментами TextPulse, так что один и тот же черновик можно проверить на ритм и структуру, а также на предсказуемость на уровне слов, не открывая для этого дюжину отдельных вкладок.

XLinkedInFacebook

Часто задаваемые вопросы

Обнаружение ИИ по вероятности токена, это слой, лежащий в основе каждого другого метрика обнаружения. Языковая модель назначает вероятность каждому токену в последовательности, по одному фрагменту слова за раз, на основе всего, что было до него. Perplexity, оценки классификатора и процент в отчете, это вся арифметика, выполненная над этой последовательностью чисел после этого, а не отдельное, независимое измерение.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.