Как работают AI detectors? Perplexity, burstiness и вероятность токенов
AI detectors не распознают машинный текст так, как это делает читатель. Они измеряют, насколько предсказуем ваш текст, а затем превращают это в оценку. Когда это становится понятным, и технология, и её сбои начинают выглядеть более осмысленно.
Ваш университет начал пропускать работы через AI detector, и был получен отчёт с числом, которого вы не ожидали. Прежде чем пытаться оспорить его, полезно понять, что означает это число. Как работают AI detectors? Они не читают машинный текст так, как это делает человек. Они измеряют, насколько предсказуем ваш текст для языковой модели, а затем превращают эту предсказуемость в оценку. В этом процессе ничто не рассматривает, что вы имеете в виду, каков ваш аргумент или действительно ли вы сами написали этот текст.
Я много лет создаю инструменты, которые статистически разбирают текст, и самое полезное, что нужно понять о detection, это следующее: это измерение типичности, а не происхождения. Как только это становится ясно, и технология, и её сбои начинают выглядеть гораздо понятнее.
Что detector на самом деле измеряет
Detector не знает, кто что написал. У него есть языковая модель и функция оценки. Модель читает ваш текст слева направо, и в каждой точке она выдаёт распределение вероятностей того, какое слово должно идти следующим. Если дать ей слова "the results of the", она поставит "study" на первое место, "experiment" немного ниже, а "marmalade" где-то около нуля.
Поэтому detector задаёт вашему документу один вопрос: как часто этот текст выбирал слово, которое ожидала модель? Письмо, которое снова и снова попадает в высоковероятные слова, выглядит созданным машиной, потому что именно так и работает генератор текста. Модель многократно отбирает образцы из верхней части собственного распределения, снова и снова, для тысяч токенов.
Именно поэтому вся эта категория находится на более шаткой основе, чем это следует из маркетинга. Detector не находит водяной знак или отпечаток. Он замечает, что ваша проза статистически не вызывает удивления, а проза, не вызывающая удивления, имеет множество причин, помимо chatbot.
Perplexity: насколько модель удивлена
Основной показатель называется perplexity, и он проще, чем звучит. Возьмите вероятность, которую модель присвоила каждому слову, которое действительно появилось, усредните логарифмы этих вероятностей и возведите результат в степень. В итоге получается одно число, описывающее, насколько модель была удивлена вашим документом. Вы можете проверить perplexity собственного черновика, а не гадать о ней.
Низкая perplexity означает, что текст двигался туда, куда модель ожидала. Высокая perplexity означает, что он продолжал делать повороты, которых модель не ожидала. Для человеческого письма обычно характерны более высокие значения, потому что люди тянутся к редкому конкретному существительному, необычной конструкции, предложению, которое начинается с неожиданного места. Сгенерированный текст обычно имеет более низкие значения, потому что процесс декодирования устроен так, чтобы избегать именно таких ходов.
Сравните два способа начать раздел методов. "The results of the study were statistically significant" это последовательность, которую почти любая модель предсказала бы с высокой уверенностью, потому что она не несет неожиданной информации. "Two of the three cohorts drifted before week six, which we had not planned for" гораздо менее предсказуема, потому что она несет конкретную, неудобную информацию, которую нельзя было бы угадать по остальной части статьи. Во втором случае детектору приходится иметь дело с реальным удивлением, и именно это удивление регистрируется как человеческое.
Burstiness: дисперсия, а не среднее
Одной perplexity недостаточно, потому что у документа может получиться вполне разумное среднее значение, при этом под поверхностью он будет подозрительно однородным. Важна вариация по всему тексту, и именно ее измеряет burstiness: насколько сильно длина предложений и perplexity на уровне предложений колеблются по мере продвижения текста. проверка burstiness покажет этот разброс напрямую.
Мы ускоряемся, когда уверены, и замедляемся, когда выражаем оговорки, и этот ритм сохраняется в прозе. Люди пишут рывками. Абзац может начинаться с короткого повествовательного предложения из восьми слов, затем переходить к предложению из тридцати четырех слов, которое содержит три придаточных и вставную конструкцию, а потом снова возвращаться к чему-то более краткому.
Выход модели не делает этого надёжно. Предложения группируются около средней длины. Абзацы приходят аккуратными блоками. Каждый раздел начинается с повторения собственного заголовка. Текст читается гладко и получает низкую оценку, потому что низкая вариативность между предложениями, это один из самых сильных сигналов, которыми располагает детектор. Выдаёт его не какое-то одно предложение. Выдаёт его однородность.
| Сигнал | Что он измеряет | Почему машинный текст получает низкий балл |
|---|---|---|
| Perplexity | Насколько модель удивлена вашим выбором слов, в среднем по документу | При декодировании по замыслу выбираются токены с высокой вероятностью |
| Burstiness | Насколько сильно длина предложений и предсказуемость варьируются по тексту | Выход группируется около среднего вместо того, чтобы колебаться |
| Token probability | Вероятность по каждому слову, на основе которой вычисляются два других показателя | Длинные последовательности по отдельности ничем не примечательных выборов |
Вероятность токена и откуда берётся оценка
Оба этих числа строятся на основе третьего, логарифмической правдоподобности по каждому токену, то есть исходного материала, из которого вычисляется всё остальное. Некоторые инструменты показывают его напрямую, выделяя фрагменты, где ваш текст был наиболее предсказуемым. Эти выделения не являются обвинениями в адрес конкретных предложений, как бы ни намекал интерфейс. Это части, которые сильнее всего повлияли на число на уровне документа.
Исследовательские подходы ушли дальше простых порогов. DetectGPT и его последователи смотрят на кривизну: они слегка возмущают ваш текст и проверяют, падает ли правдоподобие по тому шаблону, который обычно демонстрирует сгенерированный текст. Другие сравнивают один и тот же фрагмент под двумя разными моделями и используют расхождение как сигнал.
Одно следствие имеет значение для любого, кого оценивают. Поскольку метрики вычисляются относительно конкретной эталонной модели, оценка всегда является относительной по отношению к этой модели. Два детектора могут прочитать один и тот же абзац и полностью не согласиться друг с другом, и ни один из них не неисправен. Они отвечают на один и тот же вопрос, но с разными точками отсчета.
Второе следствие упоминается реже. Модель может считать фрагмент предсказуемым только в том случае, если этот фрагмент похож на то, на чем она обучалась, поэтому качество обнаружения снижается по мере увеличения разрыва между эталонной моделью и тем, что породило текст. Более новые генераторы, необычные дисциплины и языки, отличные от английского, все расширяют этот разрыв. Отчасти поэтому точность, измеренная в контролируемом бенчмарке, редко сохраняется при столкновении с реальной кучей работ.
Очеловечить свою работу
Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.
Почему AI-текст вообще обнаруживается
Как языковая модель выбирает следующее слово
Если предоставить ее самой себе, языковая модель просто выдала бы свой полный ранжированный список возможных следующих слов и позволила бы чему-то другому сделать выбор. На практике стратегия декодирования автоматически принимает это решение, слово за словом, и то, какая стратегия используется, меняет вид выходного текста, даже если сама базовая модель никогда не меняется.
Жадное декодирование всегда выбирает единственное наиболее вероятное слово. В статье, где nucleus sampling был предложен как решение, Ari Holtzman и соавторы отметили, что следование этой стратегии приводит к тексту, который, по их собственным словам, 'скучный и странно повторяющийся.' Beam search, который отслеживает сразу несколько вероятных продолжений, прежде чем остановиться на одном, сталкивается с похожей версией той же проблемы.
Стратегии sampling вновь вводят некоторую случайность, но в контролируемой форме. Temperature регулирует, насколько резко модель отдает предпочтение своим наиболее вероятным вариантам до того, как выбирается слово. Nucleus sampling, иногда называемый top-p, обрезает распределение до наименьшего набора слов, чья совокупная вероятность превышает порог, и выбирает только из этого набора, который в оригинальной статье описан как выборка из динамического ядра распределения, а не из его ненадежного хвоста.
Даже наименее детерминированные из этих настроек по-прежнему опираются на короткий список, сформированный вокруг того, что модель уже считает вероятным. Человеческий текст никогда не создавался путём ранжирования словаря и выбора из его верхней части, поэтому он постоянно выходит за пределы этого короткого списка. Смысл иногда живёт в слове, которого никогда не было в списке.
Лексическая плоскость: меньше слов, более безопасные слова
Лексическая плоскость, это словесный уровень того же самого привычного механизма. В каждой точке предложения десятки слов могли бы правдоподобно продолжить его, но несколько слов заметно опережают остальные в ранжировании модели, и декодирование снова и снова выбирает именно эту небольшую группу. Умножьте этот выбор на каждое предложение в документе, и диапазон реально использованных слов ощутимо сужается по сравнению с человеческим текстом сопоставимой длины.
Эффект накапливается, а не остаётся постоянным. Модель, которая тянется к слову с наивысшим рангом в первом предложении, с большей вероятностью создаст контекст, в котором слово с наивысшим рангом во втором предложении тоже окажется обычным, потому что обычные слова, как правило, следуют за обычными словами. Человек-писатель постоянно прерывает этот дрейф, выбирая конкретный технический термин, чуть более необычный глагол, слово, которое называет саму вещь, а не её безопасное приближение. Это различие проявляется как измеримо меньший рабочий словарь в сгенерированной версии, даже когда обе версии описывают одни и те же базовые факты.
Это свойство всего фрагмента, а не какого-то одного выбора слова. Одно безопасное слово ничего не доказывает. Страница таких слов, где предложение за предложением выбирается один и тот же ранг общеупотребительной лексики, это именно то, что сигнал на уровне слов у детектора и предназначен замечать.
Синтаксическая однородность: одни и те же формы, повторяемые
Синтаксическая однородность, это версия на уровне предложения. Речь идёт не о том, насколько длинным получается предложение. Речь идёт о том, сколько различных грамматических форм использует фрагмент: как начинаются предложения, как придаточные присоединяются друг к другу, как часто слово-связка выполняет работу по соединению одной идеи с другой. Модель, которая продолжает предсказывать статистически вероятную следующую структуру, закрепляется в небольшом наборе форм и повторяет его.
Абзац может варьировать длину предложений и при этом оставаться синтаксически плоским, если каждое предложение следует одной и той же схеме подлежащее, сказуемое, дополнение, начинается с одного и того же типа перехода или завершается одинаковым образом. Предсказуемость заключена в шаблоне, а не в количестве слов, и это различие подробнее рассматривается в руководстве по тому, что на самом деле измеряет burstiness.
| Что сужает | Что обычно делает текст, оптимизированный для декодирования | Что обычно делает человеческое письмо |
|---|---|---|
| Выбор слов | Останавливается на наиболее вероятном общеупотребительном слове на каждом шаге | Тянется к конкретному или менее распространенному слову, которое называет реальную вещь |
| Начало предложения | Повторяет небольшой набор безопасных переходных начал | Варьирует то, как начинается предложение, включая начала, которые модель сочла бы менее вероятными |
| Структура придаточных | Повторяет одну или две предпочтительные грамматические формы на протяжении отрывка | Смешивает простые и сложные структуры в зависимости от того, что требуется предложению |
Выбор, который обычно делает только человек
Обратная сторона узкого диапазона состоит в том, что выходит за его пределы. Человек, описывающий реальные события, тянется к точной цифре вместо округленной, признает ту часть, которая не сработала, прерывает предложение, чтобы исправить его в ходе мысли, или выбирает слово, которое является правильным, а не типичным. С точки зрения языковой модели каждый из этих выборов является низковероятным токеном, именно тем типом, которого декодирование и призвано избегать.
Все это не означает, что конкретное или необычное письмо защищено от любого флага, или что беглое, корректное письмо по умолчанию вызывает подозрение. Раздел методов, юридическая оговорка или сильно отредактированный финальный черновик могут попасть в узкий диапазон по причинам, не имеющим ничего общего с моделью, именно поэтому единый балл является описанием шаблона, а не вердиктом о том, кто это напечатал.
Видеть, где собственный черновик находится на этой шкале, полезнее, чем гадать. Бесплатный проверщик perplexity и проверщик burstiness от TextPulse измеряют предсказуемость на уровне слов и ритм от предложения к предложению отдельно, так что однообразный словарь и повторяющаяся структура предложений проявляются как два разных сигнала, а не как одно смешанное число.
Из этого следуют две более узкие страницы. Как Turnitin обнаруживает AI отдельно, и разница между его показателем сходства и его AI-показателем отдельно, поскольку их регулярно путают друг с другом.
Обе они входят в более широкую коллекцию бесплатных инструментов, для тех, кто хочет увидеть закономерность сам, а не слепо доверять одному числу.
Какая доля веба сейчас создается AI?
По нескольким показателям текст, созданный машиной, теперь превосходит по объему текст, написанный человеком, в интернете. Команда Amazon Web Services проанализировала 6.4 миллиарда предложений из веба и установила, что 57.1% существовали как машинные переводы на трех или более языках, причем значительная их часть была низкого качества. Анализ SEO-компании Graphite за 2025 год показал, что чуть более половины вновь опубликованных веб-статей были сгенерированы AI. Wikipedia не является исключением: исследование Princeton страниц, созданных в августе 2024 года, показало, что около одной из двадцати новых англоязычных статей были в существенной степени сгенерированы AI.
Эта доля растет, потому что стоимость вывода модели на порядки ниже, чем человеческого письма, и каждый коммерческий стимул ведет в том же направлении. Целые платформы теперь работают вообще без человеческих авторов: Chirper это социальная сеть, полностью заполненная AI-аккаунтами, где люди могут только наблюдать, а SocialAI продает ленту, в которой каждый ответ вам дает бот. Форумы, разделы отзывов и ветки комментариев демонстрируют ту же закономерность в меньшем масштабе.
Для обнаружения это меняет базовую частоту. Классификатор, читающий произвольный веб-текст в 2023 году, мог бы предположить, что большая его часть написана человеком, классификатор в 2026 году уже не может этого предполагать. Это также влияет на сами модели, поскольку каждое новое поколение обучается на вебе, который уже был записан в него его предшественниками, и именно поэтому лексические привычки, на которые ориентируются детекторы, распространяются, а не исчезают.
Для вашего собственного письма следствие прямое: проза, написанная человеком, становится меньшинственной категорией, и преподаватели, редакторы и читатели это знают. Повышенное подозрение теперь является нормой, и именно поэтому полезно понимать, что детектор может и чего не может измерить.
Что коммерческие детекторы добавляют сверх этого
Инструменты, которые учреждения действительно покупают, не используют учебниковую перплексию. Turnitin, GPTZero, Originality и остальные обучают классификаторы с учителем на больших размеченных наборах человеческого и машинного текста, используя статистические признаки наряду со стилистическими. То, чему учится классификатор, это то, что разделяет эти две кучи в его обучающих данных, а это более узкая и более исторически обусловленная вещь, чем "AI writing" в целом.
Зависимость от обучения, это тихая проблема. Классификатор, обученный главным образом на выходных данных одного поколения модели, должен обобщать на более новые модели, на незнакомые дисциплины и на авторов, чей английский не похож на его обучающее распределение. Поставщики публикуют показатели точности на основе собственных оценок, и независимые бенчмарки регулярно оказываются значительно ниже этих чисел на тех же инструментах.
Как читать оценку, не переинтерпретируя ее
Отчет детектора обычно приходит в виде процента, и этот процент регулярно неверно понимают. Это не доля вашего документа, написанная машиной. В зависимости от инструмента это либо уверенность классификатора, либо доля предложений, которые пересекли некоторый внутренний порог, и поставщики часто неясно говорят, что именно имеется в виду. Два отчета, оба показывающие шестьдесят процентов, могут означать совершенно разные вещи.
Также полезно понимать, что меняет оценку по причинам, не связанным с тем, кто написал текст. Короткие документы более шумные, потому что текста меньше и средним значениям труднее стабилизироваться, а эссе в пятьсот слов может сильно колебаться из-за двух или трёх необычных предложений. Цитируемый материал тоже учитывается, если только инструмент не исключает его, поэтому обзор литературы, насыщенный блочными цитатами, наследует предсказуемость того, что он цитирует. Технический фрагмент, перегруженный стандартной терминологией, ведёт себя так же.
Если на ваш текст поставили отметку, полезнее представить доказательства, а не спорить о метрике. История версий, черновики, заметки и записи поиска все свидетельствуют о процессе, а именно процесс комиссия по нарушениям действительно может оценить. Не существует порога, на который кто-либо мог бы указать и который отделял бы внимательного автора от модели.
Почему детекторы помечают текст, который не создавал ни один model
Ложные срабатывания не являются редкой неисправностью. Они прямо вытекают из измерения типичности. Любой текст, который действительно предсказуем, будет получать оценку как предсказуемый, независимо от того, кто его создал.
Авторы, для которых английский не является родным, страдают сильнее всего. Исследователи Stanford установили, что детекторы ошибочно классифицировали значительную долю эссе, написанных носителями неродного английского, как сгенерированные машиной, тогда как эссе носителей языка классифицировались правильно. Причина механическая, а не злонамеренная: авторы, работающие на втором языке, как правило, опираются на заезженные конструкции и более распространённую лексику. Это в точности профиль низкой perplexity, поэтому авторов ESL помечают за аккуратное письмо.
Академические конвенции вызывают ту же проблему. Раздел методов по определению должен быть шаблонным. Юридическое письмо, техническая документация и клиническая отчётность все вознаграждают стандартную формулировку, а не изобретательную. Сильное редактирование ещё больше усугубляет это, поскольку полировка черновика обычно означает устранение нерегулярностей, которые и составляли ваш статистический отпечаток.
Учреждения это заметили. Vanderbilt отключил функцию обнаружения ИИ в Turnitin, вместо того чтобы опираться на оценки, которые он не мог проверить, а другие университеты ограничили то, как эти числа могут использоваться в разбирательствах о нарушениях. Относитесь к оценке детектора как к одному слабому доказательству, а не как к вердикту.
Что это означает для вашего собственного письма
Практический совет, который следует из механики, не является чем-то экзотическим, и ни в одном из его пунктов нет попытки обойти систему. Осознанно варьируйте длину предложений, потому что именно однообразие фиксируется. Сохраняйте конкретную деталь, фактическую цифру, реальное ограничение, то, что пошло не так на шестой неделе. Общая компетентность выглядит как созданная машиной, а конкретность, это и лучшее письмо, и более сильный сигнал.
Сохраняйте и свой собственный идиом. Если у вас есть свой способ выражаться, оставьте его. Стремление шлифовать черновик до тех пор, пока он не начнёт звучать как любая другая работа в этой области, это именно тот импульс, который снижает вашу perplexity.
Чего следует избегать, некоторые инструменты намеренно вводят грамматические ошибки, чтобы повысить perplexity. На метрике это работает, но для всего, что оценивается или проходит рецензирование, это очень плохая идея, поскольку вы обмениваете подозрение на уверенность. Цель состоит в том, чтобы текст читался как ваш, а не в том, чтобы намеренно повредить его. В этом и состоит вся разница между переписыванием для человеческого читателя и искажением текста, чтобы обмануть оценщик.
Если вы хотите увидеть эти числа для собственного черновика, а не принимать на веру чёрный ящик, лежащие в основе измерения не являются секретом. Бесплатные инструменты анализа текста покажут вам, где находится ваша проза, и вы сможете сами решить, являются ли ровные фрагменты стилистической проблемой, которую стоит исправить.
Часто задаваемые вопросы
Да, и вполне предсказуемо. Detectors измеряют, насколько текст статистически предсказуем, а не кто его написал, поэтому любое действительно шаблонное письмо получает оценку как созданное машиной. Независимые тесты последовательно показывают точность ниже заявлений разработчиков, а несколько университетов ограничили то, как можно использовать эти оценки.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.