AI Detection

Насколько точны AI detectors? Ложные срабатывания и предвзятость

Поставщики публикуют показатели ложных срабатываний ниже 1 процента. Независимые исследователи, тестировавшие те же детекторы на текстах на английском языке, написанных носителями других языков, обнаружили показатели выше 60 процентов. Вот что показывает доказательная база.

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin утверждает, что их уровень ложноположительных срабатываний составляет менее 1%. Группа независимых исследователей протестировала несколько детекторов на более широком наборе образцов письма от носителей, для которых английский не является родным языком. Они обнаружили, что средний уровень ложноположительных срабатываний превышал 60% для того же типа письма. Оба числа реальны, оба были опубликованы, и оба относятся к детекторам, которые продаются на одном и том же рынке. Насколько точны детекторы ИИ? Это зависит от того, какую популяцию вы тестировали, какой детектор вы использовали и как ваш поставщик изначально определил это понятие.

В этом посте не будет повторно объясняться, как детектор вычисляет этот показатель. Механизм, perplexity, вероятность токена, то, как обучается классификатор, подробно рассмотрены в другом месте, и если вы еще не читали это, стоит сделать это сначала. Здесь важно то, что происходит после появления показателя, как часто он ошибается, относительно чьего письма он ошибается чаще всего и во что на самом деле обходится ложное обвинение человеку, который не сделал ничего неправильного.

Насколько точны детекторы ИИ?

Не последовательно, и разрыв между маркетинговыми утверждениями и независимым тестированием хорошо документирован. Группа исследователей под руководством Debora Weber-Wulff опубликовала свои результаты по 14 инструментам обнаружения, включая 12 бесплатных и два коммерческих, которые были протестированы на смеси текста, написанного человеком, и текста ChatGPT в 2023 году. Они обнаружили, что ни один из этих инструментов не является точным или надежным, при этом в них встроено смещение, заставляющее помечать машинный текст как человеческий, а не наоборот. Два коммерческих инструмента, включенные в этот тест, были Turnitin и PlagiarismCheck. Все инструменты в этом тесте показали худшие результаты, когда текст был перефразирован.

Но спустя два года ситуация не застыла. Рабочий документ Школы бизнеса Booth при University of Chicago, подготовленный Brian Jabarian и Alex Imas, подверг испытанию трёх новичков, Pangram, GPTZero и Originality.ai, а также одного конкурента с открытым исходным кодом, используя почти 2,000 написанных человеком текстов из блогов, новостей, рецензий и художественной прозы. В контролируемых условиях тестирования лучший инструмент в этой группе ни разу не опускался ниже 99.8 percent точности и сохранял низкий уровень ложноположительных срабатываний. Модель с открытым исходным кодом показала себя не лучше случайного угадывателя. Дела действительно стали лучше. В некотором смысле. Немного.

Но загвоздка в слове контролируемые. Тексты для бенчмарка чистые, полные и созданы в известных условиях. Сданное эссе не обладает ни одним из этих свойств с надёжностью. Результаты в реальном мире могут не совпадать с результатами в лаборатории, как публично говорил собственный главный директор по продукту Turnitin, хотя это редкое и полезное признание со стороны поставщика. В следующем разделе числа поставщика сопоставляются с независимыми, чтобы разрыв был виден, а не просто утверждался.

Заявления поставщиков против независимого тестирования

Приведённая ниже таблица сопоставляет то, что заявляют о себе четыре детектора, с тем, что измерили независимые исследователи, когда напрямую тестировали эти инструменты. Читайте вместе два средних столбца, а не только столбец поставщика.

DetectorЗаявленная поставщиком точностьНезависимо наблюдаемаяЧто поставщик говорит о ложноположительных срабатываниях
TurnitinПорог уверенности 98% перед пометкой, менее 1% ложноположительных срабатываний на уровне документаОколо 80% точности, лучший результат среди 12 инструментов в сравнении 2023 года, на более ранней версии инструментаМенее 1% на уровне документа при пороге 20% текста, написанного AI, около 4% на уровне предложения
GPTZero95.7% обнаружения текста AI при уровне ложноположительных срабатываний 1% в независимом бенчмарке RAID96% точности на коротких фрагментах, уровень ложноположительных срабатываний ниже 1% в исследовании Booth School of Business University of Chicago 2025 годаСообщает об уровне ложноположительных срабатываний 1% в бенчмарке RAID
Originality.ai99% точности, уровень ложноположительных срабатываний 0.5% (модель Lite), 1.5% (модель Turbo)Уровень ложноположительных срабатываний ниже 1%, но при этом было пропущено от 10% до 40% текста, написанного AI, в том же исследовании BoothПубликует отдельные показатели ложноположительных срабатываний по уровням моделей
PangramУровни ошибок, которые, как он утверждает, более чем в 38 раз ниже, чем у конкурирующих инструментов, заявляет об отсутствии предвзятости против авторов, для которых английский не является роднымТочность не ниже 99.8%, уровень ложноположительных срабатываний близок к нулю, в исследовании BoothЗаявляет о почти нулевых уровнях ложноположительных срабатываний в 10 текстовых доменах и 8 языковых моделях

Здесь выделяются две вещи. Во-первых, все показатели поставщиков получены в лаборатории, контролируемой поставщиком, а показатели Booth получены от исследователей, которым нечего продавать. Во-вторых, Turnitin вообще не фигурирует в этом среднем столбце, поскольку исследование 2025 года его не тестировало. В таблице его независимый показатель основан на более раннем сравнении 2023 года, но был получен на более старой версии инструмента, поэтому помните об этом, рассматривая таблицу как сопоставление по принципу один к одному.

Насколько точна AI-детекция Turnitin?

Turnitin не публикует одну цифру точности. Вместо этого он публикует порог и компромисс. Компания заявляла, что помечает документ только тогда, когда на 98 percent уверена, что отмеченная часть написана AI, и что именно этот порог позволяет удерживать уровень ложноположительных срабатываний на уровне документа ниже 1 percent. Turnitin оценивал, что он выявляет примерно 85 percent текста, написанного с помощью AI, а остальное пропускает намеренно, а не рискует ошибочным обвинением.

Фактический процент ложноположительных срабатываний, который Turnitin показывает на уровне предложения, где интерфейс выделяет отдельные строки, а не весь документ, на самом деле ближе к 4 percent. Это та цифра, которую стоит знать, если профессор делает скриншот одного выделенного абзаца, а не оценки всего документа, потому что выделенное предложение несет существенно более высокий риск ошибки, чем показатель документа рядом с ним.

Также стоит отметить, что Turnitin прямо признал этот разрыв. Они установили, что их первые результаты в реальных условиях, особенно для более коротких документов, имели более высокие показатели ложноположительных срабатываний, чем ожидалось на основе лабораторных тестов. Поэтому они изменили минимальную длину документа для оценки с 150 до 300 слов. Это означает, что поставщик сам корректирует свой продукт, потому что опубликованная цифра не выдержала проверки вне лаборатории, и это говорит не меньше, чем любое независимое исследование.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Что на самом деле стоит студенту ложноположительное срабатывание

Это произошло со студентом executive MBA в Yale's School of Management. Студенту было предъявлено обвинение в нарушении, в самом буквальном смысле этого слова. Используемым детектором был GPTZero. Итоговый экзамен студента по курсу финансов был помечен преподавательским ассистентом, который счел, что текст был длинным и усложненным, с почти безупречной пунктуацией и грамматикой. И этот конкретный профессор прогнал его через GPTZero, который оценил ответы как вероятно сгенерированные AI.

Он провалил курс и был отстранен на год. В его иске, поданном в федеральный суд в феврале 2025 года, утверждается, что собственная политика Yale ограничивает использование таких инструментов, как GPTZero, именно по этой причине, а именно из-за задокументированного уровня ложноположительных срабатываний в отношении носителей английского языка, для которых он не является родным, и что он использовал его в нарушение этой политики. В подаче также указывается, что GPTZero выдал 100 percent оценку AI-generated для академического текста, написанного бывшим президентом Yale и деканом бизнес-школы.

Судья отказался вынести предварительный запрет в мае 2025 года. Дело пока не разрешено, на момент написания. Истец, гражданин Франции, утверждает, что именно та же известная предвзятость против носителей английского языка, для которых он не является родным, привела к такому результату его текста. Именно это мы рассматриваем в следующем разделе. Спорным не является цена, год, потерянный из программы обучения, неудовлетворительная оценка, судебные расходы и несколько месяцев борьбы из-за оценки вместо получения степени. Уровень ложноположительных срабатываний в 1 percent кажется небольшим, пока большая совокупность не делает его проблемой для конкретного человека.

Почему AI detectors ошибочно классифицируют носителей английского языка, для которых он не является родным?

Плохо, и с большим отрывом. Таков вывод исследования, которое первым количественно оценило этот эффект. Исследователи Stanford проверили семь широко используемых GPT detectors на 91 эссе TOEFL, написанном носителями английского языка, для которых он не является родным, и на 88 эссе восьмиклассников из США. Детекторы почти всегда правильно распознавали эссе восьмого класса. Когда речь шла об эссе TOEFL, написанных взрослыми, владевшими английским достаточно хорошо, чтобы сдавать экзамен по английскому языку уровня магистратуры, средний уровень ложноположительных срабатываний у детекторов составил 61.3 percent. Восемьдесят девять из 91 эссе были отмечены как сгенерированные GPT по крайней мере одним из семи детекторов, 18 из этих эссе были отмечены всеми семью детекторами.

Механизм тот же, что и в остальной системе обнаружения: предсказуемая лексика и более простое построение предложений воспринимаются как низкая perplexity, а низкая perplexity воспринимается как машинно созданная, независимо от того, кто держит перо. Авторы, пишущие на втором языке, опираются на хорошо закрепившиеся формулировки, потому что именно так на самом деле выглядит владение дополнительным языком, и именно такой профиль детектор и был создан, чтобы отмечать.

Авторам в таком положении мало помогает совет просто писать более естественно, поскольку именно естественность и была отмечена. Страница TextPulse для академических авторов ESL подробнее рассматривает языковые модели, лежащие в основе этого риска, включая то, что меняет их без изменения смысла предложения.

Это не был единичный случай. В декабре 2025 года был опубликован новый бенчмарк, явно предназначенный для оценки предвзятости в этих детекторах. Он включал более 200,000 образцов по нескольким демографическим группам и языкам. Несмотря на то, что с первого исследования Stanford прошло два года и несмотря на включение многих разных версий моделей тех же детекторов, этот бенчмарк показал, что предвзятость по отношению к изучающим английский язык по-прежнему сохраняется.

Это относится не ко всем поставщикам. В собственной технической документации Pangram говорится, что его классификатор не предвзят по отношению к носителям, для которых английский не является родным. Исследователи Chicago Booth не проверяли это утверждение независимо, но оно действительно показывает, что детекторы нового поколения создаются с учетом этой проблемы, а не игнорируют ее.

Если вы хотите увидеть, где находится ваш собственный текст, прежде чем кто-либо другой его оценит, бесплатная проверка perplexity дает вам то же базовое число, которое вычислил бы детектор, без предварительной отправки чего-либо в учреждение.

Кого еще отмечают, и почему

Носители английского языка как неродного несут наибольший задокументированный риск, но та же статистическая логика затрагивает и другие тексты. Команда Weber-Wulff установила, что все 14 инструментов, которые они тестировали, работали менее точно, когда их применяли к перефразированным текстам, это описывает значительную долю академического письма, которое уже прошло через корректора, редактора или красную ручку научного руководителя до того, как кто-либо запускает на нём детектор.

Ничто из этого не означает, что число лишено смысла, лишь то, что ему требуется подтверждение, прежде чем оно начнёт что-либо значить в отношении конкретного человека. Если у вас есть текст, который выглядит однородным, с похожей длиной предложений и одинаковым ритмом на всём протяжении, он получит более высокий показатель машиноподобности, независимо от того, кто его написал и почему. Это можно проверить напрямую с помощью free burstiness checker, а не гадать.

Как выглядит обоснованная политика обнаружения AI

В Yale уже существовала политика, которая, как сообщается, ограничивает использование таких инструментов, как GPTZero, по тем же причинам, которые изложены в этой статье, а именно из-за задокументированной доли ложноположительных результатов и задокументированной предвзятости против авторов, для которых английский язык не является родным. Поэтому это не столько история об одном неудачливом студенте, сколько о том, что существующее правило не было соблюдено. Когда политика действительно проводит различие между показателем и вердиктом, тогда показатель становится одним из входных данных, а не вердиктом.

  • Рассматривайте показатель как один из входных данных, но никогда не как единственное основание для вывода о нарушении
  • Сообщайте студентам опубликованную инструментом долю ложноположительных результатов до того, как использовать его против них
  • Применяйте особую осторожность к коротким работам и к письму на английском языке у авторов, для которых он не является родным, это оба задокументированные слабые места
  • Гарантируйте возможность обжалования, которая не требует опровержения статистики

Ничто из этого не является чем-то необычным. Это ближе к тому, как следует обращаться с любым отдельным доказательством в других областях: оно полезно, поддаётся проверке и никогда не бывает достаточным само по себе.

Для отдельного автора тот же принцип действует ещё до появления показателя, а не после. Одно число, из любого инструмента, является оценкой, а не вердиктом, и если относиться к нему как к несомненности в любую сторону, как к оправданию или как к уличающему доказательству, от этого числа требуют большего, чем оно может обосновать.

Собственный инструмент AI humanizer TextPulse сообщает Human Score на той же логике: это оценка, вычисленная на основе вашего собственного текста, а не вердикт детектора о нём, полезная как сигнал о том, как черновик читается в данный момент, а не как обещание того, что скажет какой-либо конкретный детектор.

Вопрос об точности распадается на более узкие вопросы, у каждого из которых есть своя страница. Частота, с которой детекторы помечают человеческий текст, рассматривается отдельно, как и конкретные данные о ложноположительной частоте Turnitin и о точности ZeroGPT. Если оценка уже была использована против вас, есть практические материалы о том, что делать, когда вас обвиняют в использовании AI, о доказательствах, которые вы можете собрать, чтобы доказать, что вы не использовали AI, и о написании апелляционного письма, которое отвечает на оценку на её собственных условиях.

Число в любом отчёте будет продолжать меняться по мере того, как поставщики переобучают свои модели, а исследователи продолжают проверять их на более сложных случаях. Но не должно меняться то, что лежит в основе этого, привычка читать оценку как один из нескольких показателей, спрашивать, на какой выборке она была валидирована, и спрашивать, о чём поставщик не говорит в отношении случаев, в которых он по-прежнему ошибается.

Frequently Asked Questions

Да. Weber-Wulff и коллеги в сравнении 2023 года установили, что инструменты AI-detection «ни точны, ни надежны», а авторы, для которых английский не является родным, сталкиваются с наибольшим задокументированным риском, при этом одно исследование выявило средний показатель ложных срабатываний выше 60 процентов на эссе TOEFL. Один единственный балл сам по себе ничего не доказывает, поэтому он никогда не должен быть единственным основанием для обвинения.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Насколько точны AI detectors? Ложные срабатывания | TextPulse.ai