AI Detection

Как работают AI detectors? Perplexity, burstiness и вероятность токенов

AI detectors не распознают машинный текст так, как это делает читатель. Они измеряют, насколько предсказуем ваш текст, а затем превращают это в оценку. Когда это становится понятным, и технология, и ее сбои выглядят более осмысленно.

7 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

Ваш университет начал пропускать работы через детектор AI, и был получен отчёт с числом, которого вы не ожидали. Прежде чем пытаться оспорить его, полезно понять, что означает это число. Как работают детекторы AI? Они не читают машинный текст так, как это делает человек. Они измеряют, насколько предсказуем ваш текст для языковой модели, а затем превращают эту предсказуемость в оценку. В этом процессе ничего не рассматривает, что вы имеете в виду, каков ваш аргумент или действительно ли вы написали этот текст.

Я много лет создавал инструменты, которые статистически разбирают текст, и самое полезное, что нужно понять о детекции, это следующее: это измерение типичности, а не происхождения. Как только это становится ясно, и технология, и её сбои начинают гораздо лучше объясняться.

Что на самом деле измеряет детектор

Детектор не знает, кто что написал. У него есть языковая модель и функция оценки. Модель читает ваш текст слева направо, и в каждой точке она выдаёт распределение вероятностей того, какое слово должно идти следующим. Дайте ей слова "the results of the" и она поставит "study" на первое место, "experiment" немного ниже, а "marmalade" где-то около нуля.

Поэтому детектор задаёт вашему документу один вопрос: как часто этот текст выбирал слово, которое ожидала модель? Письмо, которое снова и снова останавливается на словах с высокой вероятностью, выглядит созданным машиной, потому что именно так и работает генератор текста. Модель многократно выбирает образцы из верхней части собственного распределения, снова и снова, для тысяч токенов.

Именно поэтому вся эта категория стоит на более шаткой основе, чем предполагает маркетинг. Детектор не находит водяной знак или отпечаток. Он замечает, что ваша проза статистически не вызывает удивления, а проза, не вызывающая удивления, имеет много причин, помимо чатбота.

Perplexity: насколько модель удивлена

Основной показатель называется perplexity, и он проще, чем звучит. Возьмите вероятность, которую модель присвоила каждому слову, которое действительно появилось, усредните логарифмы этих вероятностей и возведите результат в степень. В итоге получается одно число, описывающее, насколько модель была удивлена вашим документом. Вы можете проверить perplexity собственного черновика вместо того, чтобы гадать о нём.

Низкая perplexity означает, что текст шёл туда, куда модель ожидала. Высокая perplexity означает, что он постоянно делал повороты, которых модель не ожидала. Для человеческого письма обычно характерны более высокие значения, потому что люди тянутся к редкому конкретному существительному, необычной конструкции, предложению, которое начинается с неожиданного места. Сгенерированный текст обычно имеет более низкие значения, потому что процесс декодирования устроен так, чтобы избегать именно таких ходов.

Сравните два способа начать раздел методов. "The results of the study were statistically significant" это последовательность, которую почти любая модель предсказала бы с высокой уверенностью, потому что она не несёт неожиданной информации. "Two of the three cohorts drifted before week six, which we had not planned for" гораздо менее предсказуемо, потому что оно несёт конкретную, неудобную информацию, которую нельзя было бы угадать по остальной части статьи. Второй вариант создаёт для детектора реальное удивление, и именно это удивление распознаётся как человеческое.

Burstiness: дисперсия, а не среднее

Одной perplexity недостаточно, потому что у документа может получиться вполне разумное среднее значение, при этом внутри он будет подозрительно однородным. Важна вариативность по всему тексту, и именно её измеряет burstiness: насколько сильно меняются длина предложения и perplexity на уровне предложения по мере развёртывания текста. burstiness checker покажет вам этот разброс напрямую.

Мы ускоряемся, когда уверены, и замедляемся, когда оговариваемся, и этот ритм сохраняется в прозе. Люди пишут рывками. Абзац может начинаться с короткого повествовательного предложения из восьми слов, затем переходить к предложению из тридцати четырёх слов, которое содержит три придаточных и вставную конструкцию, а потом снова опускаться до чего-то более краткого.

Выход модели не делает этого надёжно. Предложения группируются около средней длины. Абзацы приходят аккуратными пакетами. Каждый раздел начинается с повторения собственного заголовка. Текст читается гладко и получает низкий балл, потому что низкая вариативность между предложениями, это один из самых сильных сигналов, которыми располагает детектор. Выдаёт его не какое-то одно предложение. Выдаёт его однородность.

СигналЧто он измеряетПочему машинный текст получает низкий балл
PerplexityНасколько модель удивлена вашим выбором слов, в среднем по документуДекодирование по замыслу выбирает образцы из токенов с высокой вероятностью
BurstinessНасколько сильно длина предложений и предсказуемость варьируются по текстуВыход группируется около среднего вместо того, чтобы колебаться
Token probabilityВероятность для каждого слова, на основе которой вычисляются два других показателяДлинные последовательности по отдельности ничем не примечательных выборов

Вероятность токена и откуда берётся оценка

Оба этих числа строятся на основе третьего, логарифмической правдоподобности для каждого токена, то есть исходного материала, из которого вычисляется всё остальное. Некоторые инструменты показывают его напрямую, выделяя фрагменты, где ваш текст был наиболее предсказуемым. Эти выделения не являются обвинениями в адрес конкретных предложений, как бы ни подразумевал интерфейс. Это части, которые сильнее всего повлияли на число на уровне документа.

Исследовательские подходы ушли дальше простых порогов. DetectGPT и его последователи рассматривают кривизну, они слегка возмущают ваш текст и проверяют, падает ли правдоподобие по тому же образцу, который обычно показывает сгенерированный текст. Другие сравнивают один и тот же фрагмент под двумя разными моделями и используют расхождение как сигнал.

Одно следствие важно для любого, кого оценивают. Поскольку метрики вычисляются относительно конкретной опорной модели, оценка всегда является относительной по отношению к этой модели. Два детектора могут прочитать один и тот же абзац и полностью не согласиться, и ни один из них не работает неправильно. Они отвечают на один и тот же вопрос, но с разными точками отсчёта.

Второе следствие упоминается реже. Модель может найти отрывок предсказуемым только в том случае, если этот отрывок похож на то, на чём она обучалась, поэтому качество обнаружения снижается по мере того, как увеличивается разрыв между эталонной моделью и тем, что именно породило текст. Более новые генераторы, необычные дисциплины и языки, отличные от английского, все расширяют этот разрыв. Именно поэтому точность, измеренная в контролируемом бенчмарке, редко сохраняется при столкновении с реальной массой поданных работ.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Что добавляют коммерческие детекторы поверх этого

Инструменты, которые учреждения действительно покупают, не используют учебниковую perplexity. Turnitin, GPTZero, Originality.ai и другие обучают классификаторы с учителем на больших размеченных наборах человеческого и машинного текста, используя статистические признаки наряду со стилистическими. То, чему учится классификатор, это то, что разделяет эти две массы в его обучающих данных, а это более узкая и более исторически обусловленная вещь, чем "AI writing" в целом.

Зависимость от обучения, это тихая проблема. Классификатор, обученный главным образом на одном поколении выходных данных модели, должен обобщать на более новые модели, на незнакомые дисциплины и на авторов, чей английский не похож на распределение его обучения. Поставщики публикуют показатели точности из собственных оценок, и независимые бенчмарки регулярно оказываются заметно ниже этих чисел на тех же инструментах.

Как читать оценку, не переосмысливая её

Отчёт детектора обычно приходит в виде процента, и этот процент регулярно понимают неверно. Это не доля вашего документа, написанная машиной. В зависимости от инструмента, это либо уверенность классификатора, либо доля предложений, которые пересекли некоторый внутренний порог, и поставщики часто расплывчаты в том, какой именно. Два отчёта, оба показывающие шестьдесят процентов, могут означать весьма разные вещи.

Также полезно понимать, что именно сдвигает оценку по причинам, не имеющим отношения к тому, кто написал текст. Короткие документы более шумные, потому что в них меньше текста, на котором могут стабилизироваться средние значения, и эссе в пятьсот слов может сильно колебаться из-за двух или трёх необычных предложений. Цитируемый материал тоже учитывается, если только инструмент не исключает его, поэтому обзор литературы, насыщенный блочными цитатами, наследует предсказуемость всего, что он цитирует. Технический фрагмент, насыщенный стандартной терминологией, ведёт себя так же.

Если на ваш текст поставили отметку, полезнее предоставить доказательства, а не спорить о метрике. История версий, черновики, заметки и поисковые записи всё это свидетельствует о процессе, а именно процесс комиссия по академической недобросовестности действительно может оценить. Не существует порога, на который кто-либо мог бы указать и который отделял бы внимательного автора от модели.

Почему детекторы помечают текст, который не создавал ни один model

Ложные срабатывания это не редкая неисправность. Они напрямую вытекают из измерения типичности. Любой текст, который действительно предсказуем, будет получать оценку как предсказуемый, независимо от того, кто его создал.

Больше всего страдают авторы, для которых английский не является родным. Исследователи Stanford установили, что детекторы ошибочно классифицировали значительную долю эссе, написанных носителями других языков, как сгенерированные машиной, тогда как эссе носителей языка классифицировались правильно. Причина здесь механическая, а не злонамеренная: авторы, работающие на втором языке, как правило, опираются на заезженные конструкции и более распространённую лексику. Именно так выглядит низкая perplexity, поэтому ESL writers get flagged for writing carefully.

Академические нормы вызывают ту же проблему. Раздел методов и должен быть шаблонным. Юридическое письмо, техническая документация и клинические отчёты все они поощряют стандартную формулировку, а не изобретательную. Сильное редактирование ещё больше усугубляет это, поскольку полировка черновика обычно означает удаление неровностей, которые и составляли ваш статистический отпечаток.

Учреждения это заметили. Vanderbilt отключил функцию обнаружения ИИ в Turnitin, вместо того чтобы действовать на основании оценок, которые он не мог проверить, а другие университеты ограничили то, как эти числа могут использоваться в разбирательствах по поводу нарушений. Относитесь к оценке детектора как к одному слабому доказательству, а не как к вердикту.

Что это означает для вашего собственного письма

Практический совет, который следует из механики, не является экзотическим, и ни один из его пунктов не связан с попытками обойти систему. Намеренно варьируйте длину предложений, потому что именно однообразие фиксируется. Сохраняйте конкретную деталь: фактическую цифру, фактическое ограничение, то, что пошло не так на шестой неделе. Общая компетентность как раз и получает оценку как машинно созданная, а конкретность является и лучшим письмом, и более сильным сигналом.

Сохраняйте и собственный идиом. Если у вас есть свой способ выражаться, оставьте его. Стремление отшлифовать черновик до состояния, когда он звучит как любая другая работа в этой области, это именно тот импульс, который снижает вашу perplexity.

Чего следует избегать: некоторые инструменты намеренно вводят грамматические ошибки, чтобы повысить perplexity. Это работает для метрики и является крайне плохой идеей для всего, что оценивается или проходит рецензирование, поскольку вы обмениваете подозрение на уверенность. Цель состоит в том, чтобы текст читался как ваш, а не в том, чтобы намеренно повредить его. В этом и состоит вся разница между переписыванием для человеческого читателя и искажением текста, чтобы обмануть оценщик.

Если вы хотите увидеть эти числа для собственного черновика, а не принимать на веру слова чёрного ящика, лежащие в основе измерения не являются секретом. Бесплатные инструменты анализа текста покажут вам, где находится ваша проза, и вы сможете сами решить, являются ли ровные фрагменты стилистической проблемой, которую стоит исправить.

Frequently Asked Questions

Да, и вполне предсказуемо. Детекторы измеряют статистическую предсказуемость текста, а не то, кто его написал, поэтому любое действительно шаблонное письмо получает оценку как машинно созданное. Независимые бенчмарки последовательно сообщают о точности ниже заявлений поставщиков, и несколько университетов ограничили то, как можно использовать эти оценки.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.