Точны ли AI Detectors? Ложные срабатывания и предвзятость
Поставщики публикуют показатели ложных срабатываний ниже 1 процента. Независимые исследователи, тестировавшие те же детекторы на текстах на английском языке, написанных носителями других языков, обнаружили показатели выше 60 процентов. Вот что показывают данные.
Turnitin утверждает, что их уровень ложноположительных срабатываний составляет менее 1%. Группа независимых исследователей протестировала несколько детекторов на более широком наборе образцов письма от носителей английского языка, для которых он не является родным. Они обнаружили, что средний уровень ложноположительных срабатываний превышал 60% для того же типа письма. Оба числа реальны, оба были опубликованы, и оба относятся к детекторам, которые продаются на одном и том же рынке. Насколько точны детекторы ИИ? Это зависит от того, какую совокупность вы тестировали, какой детектор использовали и как ваш поставщик изначально определил это понятие.
В этом посте не будет повторно объясняться, как детектор вычисляет этот показатель. Механизм, perplexity, вероятность токена, способ обучения классификатора, подробно рассмотрены в другом месте, и если вы еще не читали, стоит сначала ознакомиться с этим материалом. Здесь важно то, что происходит после появления показателя, как часто он ошибается, относительно чьего письма он ошибается чаще всего и что на самом деле стоит ложное обвинение человеку, который не сделал ничего неправильного.
Насколько точны детекторы ИИ?
Не последовательно, и разрыв между маркетинговыми заявлениями и независимым тестированием хорошо документирован. Группа исследователей под руководством Debora Weber-Wulff опубликовала свои результаты по 14 инструментам обнаружения, включая 12 бесплатных и два коммерческих, которые были протестированы на смеси человеческого текста и текста ChatGPT в 2023 году. Они обнаружили, что ни один из этих инструментов не является точным или надежным, при этом в них встроено смещение в сторону того, чтобы помечать машинный текст как человеческий, а не наоборот. Два коммерческих инструмента, включенных в этот тест, были Turnitin и PlagiarismCheck. Все инструменты в этом тесте показали худшие результаты, когда текст был перефразирован.
Но спустя два года ситуация не застыла. Рабочий документ Школы бизнеса Booth при University of Chicago, подготовленный Brian Jabarian и Alex Imas, подверг трёх новичков, Pangram, GPTZero и Originality.ai, а также одного конкурента с открытым исходным кодом, испытанию на почти 2,000 текстах, написанных людьми, из блогов, новостей, обзоров и художественной прозы. В контролируемых условиях испытаний лучший инструмент в этой группе ни разу не опускался ниже 99.8 percent точности и сохранял низкий уровень ложноположительных срабатываний. Модель с открытым исходным кодом показала себя не хуже случайного угадывателя. Дела действительно стали лучше. В некотором смысле. Немного.
Но загвоздка в слове контролируемые. Тексты для бенчмарка чистые, полные и созданы в известных условиях. Сданное эссе не обладает ни одним из этих свойств с надёжностью. Как публично говорил главный директор по продукту Turnitin, результаты в реальном мире могут не совпадать с результатами в лаборатории, хотя это редкое и полезное признание со стороны поставщика. В следующем разделе числа поставщика сопоставляются с независимыми числами, чтобы разрыв был виден, а не просто утверждался.
Заявления поставщиков в сравнении с независимым тестированием
Таблица ниже сопоставляет то, что четыре детектора заявляют о себе, с тем, что измерили независимые исследователи, когда напрямую тестировали эти инструменты. Читайте вместе два средних столбца, а не только столбец поставщика.
| Детектор | Заявленная поставщиком точность | Независимо наблюдаемая | Что поставщик говорит о ложноположительных срабатываниях |
|---|---|---|---|
| Turnitin | Порог уверенности 98% перед пометкой, менее 1% ложноположительных срабатываний на уровне документа | Около 80% точности, лучший показатель среди 12 инструментов в сравнении 2023 года, на более ранней версии инструмента | Менее 1% на уровне документа при пороге 20% текста, написанного AI, около 4% на уровне предложения |
| GPTZero | 95.7% обнаружения текста AI при 1% уровне ложноположительных срабатываний на независимом бенчмарке RAID | 96% точности на коротких отрывках, уровень ложноположительных срабатываний ниже 1% в исследовании Booth School of Business University of Chicago 2025 года | Сообщает о 1% уровне ложноположительных срабатываний на бенчмарке RAID |
| Originality.ai | 99% точности, 0.5% уровень ложноположительных срабатываний, модель Lite, 1.5%, модель Turbo | Уровень ложноположительных срабатываний ниже 1%, но пропускал от 10% до 40% текста, написанного AI, в том же исследовании Booth | Публикует отдельные показатели ложноположительных срабатываний по уровню модели |
| Pangram | Уровни ошибок, которые, как он утверждает, более чем в 38 раз ниже, чем у конкурирующих инструментов, заявляет об отсутствии предвзятости против авторов, для которых английский не является родным | Точность никогда не ниже 99.8%, уровень ложноположительных срабатываний близок к нулю, в исследовании Booth | Заявляет о почти нулевых уровнях ложноположительных срабатываний в 10 текстовых доменах и 8 языковых моделях |
Здесь выделяются две вещи. Во-первых, все показатели поставщиков получены в лаборатории, контролируемой поставщиком, а показатели Booth получены от исследователей, которым нечего продавать. Во-вторых, Turnitin вообще не фигурирует в этом среднем столбце, поскольку исследование 2025 года его не тестировало. В таблице его независимый показатель основан на более раннем сравнении 2023 года, но был получен на более старой версии инструмента, поэтому помните об этом, рассматривая таблицу как сопоставление на основе одинаковых условий.
Насколько точна AI-детекция Turnitin?
Turnitin не публикует одну цифру точности. Вместо этого она публикует порог и компромисс. Компания заявила, что помечает документ только тогда, когда уверена на 98 процентов, что отмеченная часть написана AI, и что именно этот порог позволяет удерживать долю ложноположительных результатов на уровне документа ниже 1 процента. Turnitin оценила, что она выявляет примерно 85 процентов текста, написанного с помощью AI, а остальное пропускает намеренно, а не рискует ошибочным обвинением.
Фактический процент ложноположительных результатов, который Turnitin показывает на уровне предложения, где интерфейс выделяет отдельные строки, а не весь документ, на самом деле ближе к 4 процентам. Это число важно знать, если преподаватель делает снимок экрана с одним выделенным абзацем, а не с оценкой всего документа, потому что выделенное предложение несет заметно более высокий риск ошибки, чем оценка документа рядом с ним.
Также стоит отметить, что Turnitin прямо признала этот разрыв. Они обнаружили, что их первые результаты в реальных условиях, особенно для более коротких документов, имели более высокие показатели ложноположительных результатов, чем ожидалось на основе лабораторных тестов. Поэтому они изменили минимальную длину документа, с которой он оценивается, с 150 до 300 слов. Это означает, что поставщик корректирует собственный продукт, потому что опубликованная цифра не подтвердилась вне лаборатории, и это говорит не меньше, чем любое независимое исследование.
Что на самом деле стоит студенту ложноположительный результат
Это произошло со студентом executive MBA в Yale's School of Management. Студенту было предъявлено обвинение в нарушении, в самом буквальном смысле этого слова. Использованным детектором был GPTZero. Итоговый экзамен студента по курсу финансов был отмечен ассистентом преподавателя, который счел, что текст был длинным и усложненным, с почти идеальной пунктуацией и грамматикой. И этот конкретный профессор прогнал его через GPTZero, который оценил ответы как вероятно сгенерированные AI.
Он не сдал курс и был отстранен на год. В его иске, поданном в федеральный суд в феврале 2025 года, утверждается, что собственная политика Yale ограничивает использование таких инструментов, как GPTZero, именно по этой причине, а именно из-за задокументированного уровня ложноположительных результатов в отношении носителей неродного английского языка, и что он использовал его в нарушение этой политики. В подаче также указывается, что GPTZero выдал оценку 100 percent AI-generated для академического текста, написанного бывшим президентом университета Yale и деканом бизнес-школы.
Судья отказался вынести предварительный запрет в мае 2025 года. Дело по-прежнему не разрешено, на момент написания. Истец, гражданин Франции, утверждает, что именно та же известная предвзятость в отношении носителей неродного английского языка привела к такому результату его текста. Именно это мы рассматриваем в следующем разделе. То, что не подлежит спору, это цена, год, потерянный из программы обучения, неудовлетворительная оценка, судебные расходы и несколько месяцев борьбы за оценку вместо получения степени. Ложноположительный показатель в 1 percent кажется небольшим, пока большая совокупность не делает его проблемой для конкретного человека.
Очеловечить свою работу
Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.
Какие особенности письма заставляют человеческий текст выглядеть созданным машиной
Четыре вида обычного письма несут наибольший риск, и ни один из них не связан с тем, что человек делает что-то неправильное. Короткие документы, сильно формализованное письмо, цитируемый или шаблонный материал, а также текст, который был тщательно вычитан, как правило, получают более высокий показатель предсказуемости, чем свободно составленная проза, а именно это свойство и измеряет каждый детектор. free burstiness checker напрямую измеряет ту же вариативность, и это более быстрый способ увидеть закономерность, чем читать ее описание.
Некоторые жанры по замыслу являются формульными. Раздел с методами, лабораторный отчёт, стандартное сопроводительное письмо и обзор литературы, все они вознаграждают привычную формулировку, а не изобретательную, потому что именно конвенция делает документ пригодным для использования читателем. Исследователи проверили это напрямую на реальном письме: они прогнали 14,400 аннотаций журналов, опубликованных между 1980 и 2023 годами, то есть за годы до появления какой-либо большой языковой модели, через общедоступный детектор. До 8 percent были помечены как сгенерированные AI независимо от года публикации, а аннотации New England Journal of Medicine были помечены в 10.24 percent, что стало самым высоким уровнем ложноположительных срабатываний среди пяти протестированных журналов.
Тест не мог обнаруживать ничего, связанного с ChatGPT, поскольку ChatGPT не существовал в течение большей части лет, которые он охватывал. Он обнаруживал жанр. Если выразиться более формально, как это сделало бы статистическое исследование проблемы обнаружения в 2026 году, не существует способа создать детектор, который будет различать предложение, предсказуемое потому, что оно было написано программным обеспечением, и предложение, предсказуемое потому, что это именно тот тип текста, который пишут в данном жанре. Снаружи они выглядят совершенно одинаково.
Сильное редактирование движется в том же направлении. Черновик несёт на себе специфические неровности автора, необычный порядок слов, предложение, которое становится слишком длинным, потому что мысль тоже стала длинной. Тщательная вычитка, особенно если она выполнена с помощью другого инструмента, как правило, сглаживает именно эти неровности. Крупнейшее на сегодняшний день независимое сравнение инструментов обнаружения протестировало 14 из них и показало, что точность для каждого инструмента дополнительно снижалась после того, как исходный текст был перефразирован или машинно переведён.
| Письменная особенность | Почему она снижает кажущуюся непредсказуемость документа | Что показывает доказательная база |
|---|---|---|
| Короткие тексты | Меньший объём текста оставляет меньше пространства для естественной вариативности, которая отличает человеческий ритм от машинного | Оценки коротких документов сильнее колеблются под влиянием нескольких необычных предложений |
| Формульное или специфичное для дисциплины письмо | Жанровая конвенция вознаграждает ожидаемую фразу, а не изобретательную | 14,400 аннотаций журналов до ChatGPT (1980 to 2023) по-прежнему вызывали до 8% ложных срабатываний, у аннотаций одного журнала показатель достигал 10.24% |
| Сильно отредактированные или перефразированные черновики | Этап шлифовки сглаживает индивидуальные неровности, которые детектор считывает как человеческие | Независимое сравнение 14 инструментов показало, что точность ещё больше снижалась после перефразирования или машинного перевода |
| Цитируемый или шаблонный материал | Цитируемый фрагмент несёт статистический отпечаток своего источника, а не автора, который его цитирует | Детекторы, которые не исключают цитаты, оценивают окружающий документ на основе заимствованного текста |
Почему AI detectors ошибочно классифицируют носителей английского языка, для которых он не является родным?
Плохо, и с большим отрывом. Таков вывод исследования, которое первым количественно оценило это явление. Исследователи Stanford сопоставили семь широко используемых детекторов GPT с 91 эссе TOEFL, написанным носителями английского языка, для которых он не является родным, и 88 эссе учащихся восьмого класса в США. Детекторы почти всегда правильно распознавали эссе восьмого класса. Когда речь шла об эссе TOEFL, написанных взрослыми, достаточно свободно владевшими языком, чтобы сдавать экзамен по английскому языку уровня магистратуры, средний уровень ложноположительных срабатываний у детекторов составил 61.3 percent. Восемьдесят девять из 91 эссе были хотя бы одним из семи детекторов отмечены как сгенерированные GPT, 18 из этих эссе были отмечены всеми семью детекторами.
Механизм тот же, что и в остальной системе обнаружения: предсказуемый словарь и более простое построение предложений воспринимаются как низкая perplexity, а низкая perplexity воспринимается как созданная машиной, независимо от того, кто держит перо. Авторы, работающие на втором языке, опираются на хорошо закрепившиеся формулировки, потому что именно так и выглядит владение дополнительным языком на уровне беглости, и именно такой профиль детектор и был создан для выявления.
Авторам в таком положении не помогает совет просто писать более естественно, поскольку именно естественность и была отмечена. Страница TextPulse для академических авторов, для которых английский является вторым языком подробнее рассматривает речевые модели, лежащие в основе этого риска, включая то, что их изменяет, не меняя смысла предложения.
Это был не единичный случай. В декабре 2025 года был опубликован новый бенчмарк, прямо предназначенный для оценки предвзятости в этих детекторах. Он включал более 200,000 образцов по нескольким демографическим группам и языкам. Несмотря на то, что он появился через два года после первого исследования Stanford и включал множество различных версий моделей тех же детекторов, этот бенчмарк показал, что предвзятость по отношению к English language learners по-прежнему сохраняется.
Это относится не ко всем поставщикам. В собственной технической документации Pangram говорится, что его классификатор не предвзят по отношению к носителям английского языка, для которых он не является родным. Исследователи Chicago Booth не проверяли это утверждение независимо, но оно показывает, что детекторы нового поколения создаются с учетом этой проблемы, а не игнорируют ее.
Если вы хотите увидеть, где находится ваш собственный текст, прежде чем его оценит кто-либо еще, бесплатная проверка perplexity дает вам то же базовое число, которое вычислил бы детектор, без предварительной отправки чего-либо в учреждение.
Кого еще отмечают, и почему
Носители английского языка, для которых он не является родным, несут наибольший задокументированный риск, но та же статистическая логика выявляет и другие тексты. Команда Weber-Wulff установила, что все 14 инструментов, которые они тестировали, работали менее точно, когда применялись к перефразированным текстам, это описывает значительную долю академического письма, которое уже прошло через корректора, редактора или красную ручку научного руководителя до того, как кто-либо запускает на нём детектор.
Ничто из этого не означает, что число лишено смысла, только то, что ему требуется подтверждение, прежде чем оно начнёт что-либо означать в отношении конкретного человека. Если у вас есть текст, который читается как однородный, с похожей длиной предложений и похожим ритмом на всём протяжении, он получит более высокий показатель машиноподобности независимо от того, кто его написал и почему. Это можно проверить напрямую с помощью free burstiness checker, а не гадать.
Вторая, менее обсуждаемая группа сталкивается со связанной проблемой. Исследователи сравнили примерно 60,000 публикаций Reddit, разделённых на подмножество, которое было определено как, вероятно, написанное авторами с аутизмом, и общую выборку, и пропустили обе через детектор на основе GPT-2. Обе группы в целом оставались ниже порога в 2 percent, но подмножество, вероятно написанное авторами с аутизмом, помечалось со значительно более высокой частотой, чем общая выборка. Письмо, которое тяготеет к буквальным, повторяющимся, жёстко структурированным формулировкам, задокументированной особенности некоторых аутичных стилей коммуникации, создаёт именно тот текст с низкой вариативностью, который детектор и предназначен выявлять.
Почему уверенный результат не является уверенным обвинением
False positive rate звучит так, будто речь идёт о вероятности того, что один студент, помеченный как проблемный, на самом деле невиновен. Но нет. Этот показатель описывает, как тест работает для всех, кто его проходит. И это разные вопросы с разными ответами, как и в случае любого скринингового теста в медицине или безопасности.
Статистический анализ марта 2026 года, выполненный исследователем из Griffith University, делает лежащую в основе математику явной. Если рассматривать обнаружение AI как тест, применяемый к популяции студенческих авторов, а не к одному изолированному документу, возникает компромисс: всякий раз, когда некоторая доля этой популяции пишет так, что это естественным образом перекрывается с типичным выводом AI, близко к жанровой норме, близко к диапазону носителя второго языка, любой детектор с реальной способностью выявлять написанные AI работы должен ошибаться на части этой перекрывающейся доли. Это не утверждение о том, что какой-то конкретный детектор плохо сконструирован. Это свойство тестирования разнообразной популяции по одному документу и без каких-либо иных доказательств.
Сам иллюстративный пример в статье показывает масштаб проблемы. Предположим, что 10 процентов студенческой популяции пишет достаточно близко к типичному выводу AI, а детектор настроен на выявление 80 процентов действительно написанных AI работ. Тогда математика требует среднего уровня ложноположительных срабатываний не менее 7.5 процента по этой популяции. Это не недостаток инженерной реализации детектора, а прямое следствие того, насколько сильно письмо этой группы статистически перекрывается с тем, что подлежит обнаружению.
В пересчете на университет с 10,000 студентами только этот нижний предел означает примерно 750 ложных срабатываний по всей популяции, математическое следствие тестирования разнообразной популяции по одному документу без каких-либо иных доказательств, которые можно было бы учесть. Автор статьи прямо указывает, что эти конкретные цифры носят иллюстративный характер и не измерены в реальном учреждении. Пример показывает форму проблемы, а не конкретный прогноз для какого-либо одного кампуса.
Как выглядит обоснованная политика обнаружения AI
Yale уже имел политику, которая, как сообщается, ограничивает инструменты вроде GPTZero, по тем же причинам, которые изложены в этой статье: задокументированный уровень ложноположительных срабатываний и задокументированная предвзятость против носителей английского языка, для которых он не является родным. Поэтому это не столько история об одном неудачливом студенте, сколько о том, что существующее правило не было соблюдено. Когда политика действительно проводит различие между оценкой и вердиктом, оценка становится одним из входных данных, а не вердиктом.
- Рассматривайте оценку как один из входных параметров, никогда не как единственное основание для вывода о нарушении
- Раскрывайте студентам опубликованную инструментом частоту ложноположительных результатов до того, как использовать его против них
- Применяйте повышенную осторожность к коротким работам и к текстам на английском языке, для авторов которого он не является родным, к обоим хорошо задокументированным слабым сторонам
- Гарантируйте возможность обжалования, которая не требует опровержения статистического показателя
Во всем этом нет ничего экзотического. Это ближе к тому, как следует относиться к любому отдельному фрагменту судебного доказательства в любой другой ситуации: он полезен, поддается проверке и никогда не является достаточным сам по себе.
Для отдельного автора тот же принцип действует до появления оценки, а не после. Одно число, из любого инструмента, является оценкой, а не вердиктом, и воспринимать его как несомненную истину в любом направлении, безопасно или уличен, значит требовать от числа большего, чем оно может обосновать.
Собственный инструмент AI humanizer TextPulse сообщает Human Score на той же логике: это оценка, вычисленная на основе вашего собственного текста, а не вердикт детектора о нем, полезная как сигнал о том, как черновик сейчас читается, а не как обещание того, что скажет какой-либо конкретный детектор.
Вопрос точности распадается на более узкие вопросы, у каждого из которых есть своя страница. Конкретные данные о частоте ложноположительных результатов Turnitin и о точности ZeroGPT рассматриваются отдельно. Если оценка уже была использована против вас, есть практические материалы о том, что делать, когда вас обвиняют в использовании AI, о доказательствах, которые можно собрать, чтобы доказать, что вы не использовали AI, и о написании апелляционного письма, которое отвечает на оценку на ее собственных условиях.
Число в любом отчете будет продолжать меняться по мере того, как поставщики переобучают свои модели, а исследователи продолжают проверять их на более сложных случаях. Но не должно меняться то, что лежит в основе этого, привычка: читать оценку как одно измерение среди нескольких, спрашивать, на какой выборке она была валидирована, и спрашивать, о чем поставщик не говорит в отношении случаев, в которых он по-прежнему ошибается.
Часто задаваемые вопросы
Да. Weber-Wulff и коллеги в сравнении 2023 года установили, что инструменты AI-detection «ни точны, ни надежны», а авторы, для которых английский не является родным, сталкиваются с наибольшим документированным риском, при этом одно исследование выявило средний показатель ложных срабатываний выше 60 процентов на эссе TOEFL. Один балл сам по себе не является доказательством чего-либо, поэтому он никогда не должен быть единственным основанием для обвинения.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.