AI Detection

Ложные срабатывания AI Detector: почему человеческий текст помечается

Поставщики публикуют показатели ложных срабатываний около одного процента. Независимые тесты тех же инструментов на другом материале регулярно показывают иное. Вот что на самом деле вызывает ложную пометку и что означает, а что не означает число, когда оно уже получено.

7 min
AI detector false positive: table comparing writing traits, from short documents to heavy editing, that trigger false flags in human text

В 1982 году New England Journal of Medicine опубликовал статью о цитомегаловирусе у пациентов после трансплантации костного мозга. Она прошла рецензирование и пролежала в архиве четыре десятилетия. В 2023 году исследователи пропустили её через детектор AI writing, который OpenAI выпустила в открытый доступ, и инструмент оценил её как на 99.96 percent вероятно сгенерированную AI, за тридцать семь лет до того, как появилась модель, которой, как предполагалось, она была написана. Это ложноположительный результат AI detector в его чистейшей форме: документ, помеченный как написанный машиной, который не может быть написан машиной в принципе.

Этот пример экстремален только по времени. Основной шаблон, когда детектор считывает формализованную, предсказуемую прозу как созданную машиной, независимо от того, кто и когда её написал, постоянно проявляется в обычных работах: эссе, сопроводительных письмах, лабораторных отчётах, личных заявлениях. В этом материале рассматривается, что вызывает ложноположительный результат, какие виды письма наиболее уязвимы и почему один помеченный балл не является тем доказательством, каким он кажется.

Что такое ложноположительный результат AI detector?

Ложноположительный результат AI detector, это текст, написанный человеком, который инструмент обнаружения оценивает как сгенерированный AI. При этом не измеряется ничего, связанного с процессом работы автора, его честностью или уровнем мастерства. Инструмент сравнивает статистическую форму предложения, то, насколько предсказуемы выбор слов и структура, с формой, которую он научился связывать с машинным выводом.

Поставщики сообщают о частоте ложноположительных результатов как об одном небольшом проценте, обычно менее одного или двух процентов. Эта цифра описывает контролируемый тест на наборе данных, созданном самим поставщиком, а не гарантию для какого-либо отдельного документа. Более широкий вопрос о том, насколько вообще точны AI detectors, уже проверялся независимо, и результаты оказываются совсем в другом диапазоне, иногда значительно выше любых показателей поставщика. Этот материал более узок по теме: какие виды письма повышают этот риск и что может, а что не может сообщить кому-либо помеченный балл.

Какие особенности письма заставляют человеческий текст выглядеть созданным машиной

Четыре вида обычного письма несут наибольший риск, и ни один из них не связан с тем, что человек делает что-то неправильное. Короткие документы, сильно формализованное письмо, цитируемый или шаблонный материал, а также текст, который был тщательно вычитан, как правило, получают более высокую оценку предсказуемости, чем свободно составленная проза, а именно это свойство и измеряет каждый детектор. бесплатный checker burstiness напрямую измеряет ту же вариативность, и это более быстрый способ увидеть закономерность, чем читать ее описание.

Некоторые жанры по замыслу формализованы. Раздел методов, лабораторный отчет, стандартное сопроводительное письмо и обзор литературы все поощряют привычную формулировку, а не изобретательную, потому что именно конвенция делает документ пригодным для его читателя. Исследователи проверили это напрямую на реальных текстах: они прогнали через общедоступный детектор 14,400 аннотаций журналов, опубликованных между 1980 и 2023 годами, за годы до появления какой-либо большой языковой модели. До 8 процентов были помечены как сгенерированные AI независимо от года публикации, а аннотации New England Journal of Medicine были помечены в 10.24 процента случаев, что стало самым высоким уровнем ложноположительных срабатываний среди пяти протестированных журналов.

Тест не мог обнаруживать ничего, связанного с ChatGPT, поскольку ChatGPT не существовал в течение большей части тех лет, которые он охватывал. Он обнаруживал жанр. Если выразиться более формально, как это сделало бы статистическое исследование 2026 года о проблеме обнаружения, невозможно создать детектор, который будет различать предложение, предсказуемое потому, что оно было написано программой, и предложение, предсказуемое потому, что это именно тот тип текста, который вы пишете в данном жанре. Снаружи они выглядят совершенно одинаково.

Сильное редактирование действует в сходном направлении. Первый черновик несет на себе специфические неровности автора: необычный порядок слов, предложение, которое становится слишком длинным, потому что мысль была такой же. Тщательная вычитка, особенно выполненная с помощью другого инструмента, как правило, сглаживает именно эти неровности. Крупнейшее на сегодняшний день независимое сравнение инструментов обнаружения протестировало 14 из них и показало, что точность еще больше снижалась у каждого инструмента после того, как исходный текст был перефразирован или машинно переведен.

Характеристика письмаПочему она снижает кажущуюся непредсказуемость документаЧто показывают данные
Короткие текстыМеньший объем текста оставляет меньше места для естественной вариативности, которая отличает человеческий ритм от машинногоОценки коротких документов сильнее колеблются под влиянием нескольких необычных предложений
Формульное или специфичное для дисциплины письмоЖанровая конвенция вознаграждает ожидаемую фразу, а не изобретательную14,400 аннотаций журналов до ChatGPT (1980 to 2023) все еще вызывали до 8% ложных срабатываний; аннотации одного журнала достигали 10.24%
Сильно отредактированные или перефразированные черновикиПроверка на полировку сглаживает индивидуальные неровности, которые детектор считывает как человеческиеНезависимое сравнение 14 инструментов показало, что точность еще больше снижалась после перефразирования или машинного перевода
Цитируемый или шаблонный материалЦитируемый фрагмент несет статистический отпечаток своего источника, а не автора, который его цитируетДетекторы, которые не исключают цитаты, оценивают окружающий документ по заимствованному тексту

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Почему опубликованные показатели и показатели в реальных условиях не совпадают

Каждый крупный детектор публикует уровень ложноположительных срабатываний около одного процента или ниже. Независимые тесты тех же инструментов, проведенные на разных документах в разных условиях, регулярно сообщают о значительно более высоких значениях, иногда в десять раз и более. Оба показателя могут быть точными и при этом почти не описывать одно и то же, потому что они измеряют не одно и то же.

Turnitin является полезным примером именно потому, что публикует больше подробностей, чем большинство конкурентов: уровень ложноположительных срабатываний ниже 1 percent на уровне документа, при условии, что более 20 percent работы помечено как написанное AI, а также заявление компании о том, что результаты в реальных условиях отличаются от её собственных лабораторных испытаний. The Washington Post в 2023 году пропустила 16 реальных документов через тот же инструмент и обнаружила, что более половины были как минимум частично неверно идентифицированы, включая одно полностью написанное человеком эссе, отмеченное как частично сгенерированное AI. Ни одна из этих цифр не выдумана. Они получены из разных выборок, при разных порогах и при разных определениях того, что считается пометкой.

Та же самая разница проявляется по всей отрасли, а не только у одной компании. То сравнение 14 tools показало, что ни один из них в целом не достигал 80 percent точности, и что шесть из четырнадцати дали ложноположительный результат на неизменённом человеческом тексте ещё до того, как в рассмотрение вошло какое-либо перефразирование. Опубликованное число описывает эталонный показатель. Оно не описывает документ, который в данный момент лежит перед профессором.

Почему уверенный результат не является уверенным обвинением

Уровень ложноположительных срабатываний звучит так, будто он относится к вероятности того, что один студент, отмеченный как проблемный, на самом деле невиновен. Но нет. Он описывает, как тест работает для всех, кто его проходит. А это разные вопросы с разными ответами, как и в любом скрининговом тесте в медицине или безопасности.

Статистический анализ March 2026 года, выполненный исследователем Griffith University, делает лежащую в основе математику явной. Если рассматривать обнаружение AI как тест, применяемый к популяции студенческих авторов, а не к одному изолированному документу, возникает компромисс: всякий раз, когда некоторая доля этой популяции пишет так, что это естественным образом перекрывается с типичным выводом AI, близко к жанровой норме, близко к диапазону изучающего второй язык, любой детектор, обладающий реальной способностью выявлять работы, написанные AI, должен ошибаться на части этой перекрывающейся доли. Это не утверждение о том, что конкретный детектор плохо сконструирован. Это свойство тестирования разнообразной популяции по одному документу и без каких-либо иных доказательств.

Собственный иллюстративный пример в статье показывает масштаб рассматриваемого явления. Предположим, что 10 percent студенческой популяции пишет достаточно близко к типичному выводу AI, а детектор настроен на выявление 80 percent действительно написанных AI работ. Тогда математика требует среднего уровня ложноположительных срабатываний не менее 7.5 percent в этой популяции. Это не недостаток инженерной реализации детектора, а прямое следствие того, насколько сильно письмо этой группы статистически перекрывается с тем, что подлежит обнаружению.

Если масштабировать это на университет с 10,000 студентами, один только этот нижний предел означает примерно 750 ложных пометок по всей популяции, математическое следствие проверки разнообразной группы по одному документу без какой-либо иной доказательной базы, которую можно было бы учесть. Автор статьи прямо указывает, что эти конкретные цифры носят иллюстративный характер, а не являются результатом измерений в реальном учебном заведении. Пример показывает форму проблемы, а не конкретный прогноз для какого-либо одного кампуса.

Все это не означает, что помеченный результат лишен смысла. Это означает, что показатель является лишь слабым сигналом на уровне популяции, которому предлагают ответить на вопрос об одном конкретном человеке, а такой несоответствие никакая степень доработки со стороны поставщика не может полностью устранить сама по себе. Ответственный подход рассматривает это число как повод собрать более убедительные доказательства: черновики, историю версий, обычный след документов, который остается, когда человек действительно что-то пишет. Бесплатные инструменты TextPulse позволяют автору проверить, где находится черновик по этим же показателям, прежде чем это сделает кто-либо еще, и это иное использование технологии, чем попытка обойти какой-либо конкретный детектор.

Какие авторы сталкиваются с наибольшим риском

Исследование показывает две группы, которые выделяются сильнее остальных: люди, пишущие на втором языке, и люди, которые по причинам, не связанным с тем, как они написали свое эссе, от природы пишут очень структурированно или повторяющимся образом. Оба этих типа авторов попадают под тот же статистический признак, который детектор и создан выявлять.

Носители английского языка как неродного несут наибольший документально подтверждённый риск. Независимое тестирование неоднократно показывало, что детекторы ошибочно принимают свободное академическое письмо на втором языке за сгенерированное машиной с гораздо более высокой частотой, чем письмо носителей языка. Страница TextPulse для академических авторов ESL подробнее разбирает механизм, лежащий в основе этого риска, включая то, какие модели формулировок за ним стоят.

Вторая, менее обсуждаемая группа сталкивается со связанной проблемой. Исследователи сравнили примерно 60,000 публикаций Reddit, разделённых на подмножество, которое было определено как вероятно написанное авторами с аутизмом, и общую выборку, и пропустили обе через детектор на основе GPT-2. Обе группы в целом оставались ниже порога 2 percent, но подмножество, вероятно написанное авторами с аутизмом, было отмечено с существенно более высокой частотой, чем общая выборка. Письмо, тяготеющее к буквальным, повторяющимся, жёстко структурированным формулировкам, что является документально зафиксированной особенностью некоторых аутичных стилей коммуникации, создаёт именно тот текст с низкой вариативностью, который детектор и предназначен выявлять.

Два поставщика публикуют достаточно данных, чтобы проверить это утверждение. собственная частота ложноположительных срабатываний Turnitin изложена отдельно, а точность ZeroGPT рассматривается на отдельной странице. На кого именно эти ошибки ложатся тяжелее всего, это уже отдельный вопрос, и почему авторов, пишущих на английском не как на родном языке, отмечают чаще имеет свой собственный ответ.

Вряд ли всё это скоро станет проще. Детекторы будут продолжать совершенствоваться в выявлении действительно машинно написанного текста, а разнообразие популяции будет и дальше порождать некоторую долю ложных обвинений, которую одними лишь улучшениями инженерии полностью устранить невозможно. Более полезный сдвиг уже происходит в некоторых учреждениях, это рассмотрение оценки как начала разговора, а не его конца, и вопрос о том, на какой популяции была фактически протестирована опубликованная частота, прежде чем доверять тому, что она применима к документу перед ними.

Frequently Asked Questions

Ложное срабатывание AI detector, это текст, написанный человеком, который инструмент обнаружения ошибочно оценивает как сгенерированный AI. Это происходит потому, что детекторы измеряют, насколько предсказуем отрывок, а не то, кто его написал. Краткий, шаблонный, сильно отредактированный текст или текст, написанный на втором языке, часто выглядит предсказуемым по причинам, не связанным с авторством, и этого достаточно, чтобы вызвать пометку.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.