AI Detection

Лучшие AI-детекторы для академического письма в 2026 году: сравнение 10 инструментов

Два из этих десяти детекторов публикуют один и тот же заголовочный показатель точности 99.98%. Один называет исследователей, стоящих за ним, и отдельно указывает долю ложноположительных срабатываний по жанрам. Другой не называет ни одного теста. Десять инструментов сопоставлены по четырем осям, кто их покупает, что они заявляют, какие доказательства стоят за заявлением и что на самом деле показывает отчет, а также по модели отслеживания процесса, которая может полностью заменить оценивание.

15 min
AI detectors compared by who each one is sold to and whether a named study sits behind its accuracy figure

Два из десяти инструментов здесь публикуют одно и то же число в заголовке: 99.98% accuracy. Один из них называет исследователей и университеты, стоящие за этой цифрой, и отдельно указывает свою долю ложноположительных результатов по жанрам контента. Другой не называет ни одного теста. Этот контраст, пожалуй, самое полезное, что есть в любом наборе AI detectors, если сравнивать их рядом, и он останется полезным и после того, как все цены на всех этих страницах изменятся.

Это руководство сравнивает лучшие AI detectors для академического письма в 2026: Turnitin, GPTZero, Copyleaks, Originality.ai, Pangram, Winston AI, ZeroGPT, Scribbr, Sapling и Compilatio, десять инструментов, с которыми с наибольшей вероятностью столкнется студент, исследователь, преподаватель или редактор. Они продаются разным покупателям, имеют разные модели ценообразования и сообщают обратно разные сведения. Сравнение их только по точности упускает почти все, что определяет, через какой из них будет пропущен ваш текст и что произойдет после этого.

Четыре вещи, которые действительно различаются

Маркетинговые страницы детекторов сходятся в одном числе и расходятся во всем остальном. Эти продукты разделяют четыре вопроса, и только один из них, это процент на главной странице.

  • Кому он продается. Инструмент, лицензированный для учреждений и показываемый только преподавателям, занимает иное положение, чем тот, на который может зарегистрироваться любой человек в браузере, и это различие определяет, кто вообще увидит результат о вас.
  • Какую величину он публикует. Каждый поставщик здесь публикует какое-либо утверждение, от простого процента до доли ложноположительных результатов, указанной с точностью до четырех знаков.
  • Стоит ли за этой цифрой названный тест. Это ось, которая наиболее резко разделяет эти десять инструментов, и та, которую не использует ни одна сравнительная таблица поставщиков.
  • Что именно возвращает отчет. Процент на уровне документа, выделения на уровне предложений, представление для интерпретации и отчет, которым можно поделиться, это четыре разных объекта, и обвинение, основанное на одном из них, это иной разговор, чем обвинение, основанное на другом.

Третий вопрос стоит того, чтобы над ним задуматься. Процент с указанным учреждением, указанным набором данных и заявленным методом можно оспаривать, воспроизводить или опровергать. Процент без какого-либо основания можно только принять на веру или проигнорировать, а вера не является основанием для разбирательства по делу о нарушении академической добросовестности. Perplexity, статистическое свойство, на которое сильнее всего опиралось более раннее поколение детекторов, достаточно измерима, чтобы free perplexity checker показал вам, как она выглядит на вашем собственном тексте, хотя ни один из приведённых ниже поставщиков не сообщает свой вердикт в виде оценки perplexity.

Сравнительная таблица: кому каждый из них продаётся и что он утверждает

DetectorКому продаётсяКак получить доступОсновное утверждениеНазванный тест, лежащий в основе утверждения
TurnitinПреподавателям и администраторам в лицензированных учрежденияхТолько лицензия учрежденияДоля ложноположительных результатов по документам ниже 1% при пороге 20%Собственный набор валидации Turnitin, внешнее исследование не названо
GPTZeroПреподавателям, студентам, авторам, рекрутерам, издателямПрямая регистрация, бесплатный тариф99% точности, 96.5% на смешанных документахСсылается на RAID, сторонний бенчмарк, и партнёрство с Penn State
CopyleaksОбразованию и корпоративным клиентам, внутри Canvas, Blackboard и MoodleПрямая регистрация и лицензия LMSБолее 99% точности при 0.03% уровне ложноположительных результатовСуществуют независимые данные, исследование VUB 2026 года ниже
Originality.aiАвторам, редакторам, маркетологам, агентствам, корпоративным клиентамПрямая регистрация, кредитная модель99% точности на новейших моделях AIСобственное исследование точности плюс рецензируемая сторонняя работа
PangramУниверситетам, школам и предприятиямПрямая регистрация, институциональные и API планы99.98% точности, уровень ложноположительных результатов 1 из 10,000Исследование, которое оно приписывает исследователям Chicago Booth и University of Maryland
Winston AIЧастным лицам, командам, клиентам сертификации веб-сайтовПрямая регистрация, кредитная модель99.98% точности, заявлено как единственный детектор, достигший этогоНе названо
ZeroGPTЧастным лицам, предварительная проверка без регистрацииБесплатно, 15,000 символов, без аккаунтаВыше 98% по внутренним оценкамНе названо, цифра принадлежит самому поставщику
ScribbrСтудентам, бесплатная проверка плюс премиум тарифБесплатно в браузере78% тестовых текстов были определены правильноСобственное сравнение Scribbr, проведённое самим Scribbr
SaplingРазработчикам и командам поддержки, API-firstПрямая регистрация, публичный API, расширение браузераВероятности AI по каждому предложениюНе названо, независимые обзоры резко расходятся друг с другом
CompilatioЕвропейским учреждениям и студентам, особенно в франкоязычных системахЛицензия учреждения или прямая покупка студентом от 4.99 euros94 to 99% надёжности, менее 1% ложноположительных результатовЗанял 2-е место из 14 инструментов, Weber-Wulff et al. 2023

Одна строка ведет себя не так, как остальные. Turnitin не может быть приобретен тем, кого оценивают, не может быть запущен им до отправки и возвращает свои результаты кому-то другому. Compilatio лицензируется учреждениями таким же образом, но также продает студентам те же проверки напрямую, так что это единственный институциональный детектор, который можно сначала запустить на собственном черновике. Каждый другой детектор здесь, это продукт, который студент, автор или редактор может открыть в браузере и проверить на собственном тексте уже сегодня.

Заявления о точности и те, за которыми стоит названное исследование

Winston AI и Pangram публикуют одну и ту же цифру. Winston утверждает, что это "The only AI detector with a 99.98% accuracy rate". На главной странице Pangram указано: "Detect AI-generated content with 99.98% accuracy. Trusted by universities, schools, and enterprises worldwide." Числа идентичны. Доказательства, стоящие за ними, и близко не соответствуют этому.

Pangram называет свой источник. На его собственных страницах эта статистика приписывается сравнительному исследованию исследователей из Booth School of Business Университета Chicago и Университета Maryland, а также публикуется разбивка ложноположительных результатов по жанрам контента. На страницах Winston не названо ни одно исследование: ни набор данных, ни размер выборки, ни метод для цифры 99.98%. Маркеры доверия там, это значки SOC 2 и GDPR и логотипы прессы, которые говорят о состоянии безопасности и освещении в СМИ, а не о качестве обнаружения. Полный разбор каждого утверждения приведен в отдельных обзорах: Pangram reviewed и Winston AI reviewed.

Наиболее конкретные числа из десяти опубликованы Turnitin и представляют собой показатели ошибок, а не показатели точности: уровень ложноположительных результатов для документа ниже 1% при пороге 20%, вероятность ошибки на уровне предложения примерно 4%, а также заявленная вероятность пропуска 15% текста, созданного AI, в документе, опубликованный показатель пропуска, который почти никто не цитирует в ответ. How Turnitin's detector works и what its false positive rate means in practice рассматриваются отдельно.

GPTZero публикует точность 99% и ссылается на RAID, сторонний бенчмарк, а также на исследовательское партнёрство с Penn State, что ставит его на шаг выше голой цифры и на шаг ниже цитаты. Originality.ai публикует 99% для новейших моделей AI, ссылаясь на собственное исследование и рецензируемую стороннюю работу, а также публикует предложение, которое должно определять весь этот раздел: "Any AI detector accuracy claim that is not transparently supported by methodology, benchmark data, and independent or reproducible analysis should be viewed skeptically." Если последовательно применять этот стандарт, он требует задать один и тот же вопрос к каждой цифре на этой странице, включая обе претензии на 99.98%. Показатель ZeroGPT, выше 98% по внутренним оценкам, тоже не имеет названного теста, стоящего за ним; обзор точности ZeroGPT прослеживает, откуда берётся это число. Показатель Scribbr в 78% по крайней мере честно говорит о своём масштабе, хотя тест является собственным тестом Scribbr.

Тот же стандарт должен применяться и к нашим собственным числам. TextPulse публикует измеренные показатели прохождения 92.33% на Turnitin AI, 89.12% на Originality.ai и 87.91% на GPTZero для своего академического AI humanizer. Это показатели поставщика, полученные в тестировании поставщика, точно так же, как у Winston и Pangram, и ни один инструмент ни на одной стороне этого рынка не может обещать, что именно детектор сообщит о конкретном документе.

10 лучших AI detectors для академического письма

Каждая запись охватывает четыре одинаковых аспекта: как работает движок, что утверждает поставщик, что показывает независимое свидетельство и кто фактически использует инструмент. Подробный обзор, на который ведёт ссылка из каждого раздела, рассматривает вопрос глубже.

1. Turnitin: институциональный стандарт по умолчанию

Главная страница Turnitin, позиционирующая обнаружение AI writing внутри своего рабочего процесса аутентичного обучения и сходства
Turnitin продаёт решение учреждениям, а не авторам: обнаружение AI поставляется в составе рабочего процесса similarity, который преподаватели уже используют.

Индикатор AI-письма Turnitin представляет собой классификатор на основе глубокого обучения, обученный на академической прозе. Он разбивает работу на перекрывающиеся фрагменты по несколько сотен слов, оценивает каждый фрагмент по статистическим признакам текста, сгенерированного моделью, и агрегирует результаты в процент по документу, который видят преподаватели. В качестве квалифицируемого текста учитывается только проза в развернутой форме, списки с маркерами, цитаты и ссылки исключаются.

Turnitin публикует показатели ошибок, а не показатель точности: доля ложноположительных результатов для документа ниже 1% для работ выше его порога 20%, вероятность ошибки примерно 4% для любого отдельного выделенного предложения и заявленная вероятность пропуска 15% AI-текста в документе. Исследование VUB 2026 года было более жестким, чем собственные цифры поставщика: Turnitin показал 0% AI по всем 40 полностью сгенерированным AI диссертациям в тестовом наборе. Он остается вариантом по умолчанию, потому что поставляется внутри рабочего процесса проверки на плагиат, на который, по собственному подсчету Turnitin, уже лицензированы более 16,000 учреждений, и оценку видят только преподаватели и администраторы. Это также самый ограниченный инструмент на этой странице: несколько крупных университетов отключили его из-за опасений по поводу ложноположительных результатов, которые отслеживаются в universities that stopped using Turnitin. How Turnitin detects AI и similarity versus AI score описывают механизм.

2. GPTZero: крупнейший бренд со стороны студентов

GPTZero homepage: AI detector made to preserve what's human, claiming 99% accuracy with 17 million users and 1 million educators
Масштаб GPTZero со стороны студентов: бесплатный уровень, миллионы пользователей и заявленная точность 99%, указывающая на сторонние бенчмарки.

GPTZero был запущен в январе 2023 года как проверка на perplexity и burstiness и с тех пор перестроил свой движок в многослойный классификатор. Сканирование возвращает вердикт по документу, распределение вероятности между AI, human и mixed, выделение по предложениям фрагментов, которые определяют результат, а также список AI vocabulary. На главной странице заявлены 99% точности, 17 million пользователей и 1 million educators, бесплатный тариф принимает около 10,000 символов за одно сканирование, а компания публикует ESL calibration, предназначенную для снижения числа ложных срабатываний на англоязычных текстах, написанных не носителями языка.

По совокупности доказательств он находится в середине. Он ссылается на сторонний бенчмарк RAID и исследовательское партнёрство с Penn State, что является шагом выше простого заявления, но в исследовании VUB его медианный результат на полностью сгенерированных AI диссертациях оставался ниже 20%, при этом наблюдались значительные колебания между отдельными работами. Это инструмент, который студенты чаще всего используют, чтобы предварительно проверить собственные черновики перед сдачей. Как работает GPTZero поэтапно разбирает отчёт, а GPTZero versus Turnitin объясняет, почему эти два инструмента расходятся на одном и том же тексте.

3. Copyleaks: детектор внутри вашей LMS

Copyleaks homepage: content integrity and AI detection platform for enterprises and universities
Copyleaks позиционирует себя выше уровня аудитории: это корпоративная платформа integrity, которая достигает студентов через интеграции с LMS.

Copyleaks продаёт AI detection и plagiarism checking как единый корпоративный продукт, встроенный в Canvas, Blackboard и Moodle, с самым широким языковым покрытием из десяти: поставщик указывает более 30 языков с моделями обнаружения для каждого языка. Сканирование возвращает процент по документу с выделенными фрагментами. Поставщик заявляет более 99% точности при уровне false positive rate 0.03%, а бесплатный сканер принимает около 25,000 символов.

Независимый результат является слабой частью аргумента. В исследовании VUB Copyleaks не классифицировал ни одну из 40 полностью сгенерированных ИИ диссертаций как полностью написанную ИИ, отметил лишь 10 из 40 даже частично и сохранял медианную долю ИИ, указанную в отчёте, ниже 20% на работах, которые были на 100% сгенерированы машиной. При этом он без ошибок пропустил все 40 работ, написанных человеком, и каждая из них была написана носителем, для которого английский не является родным, что является подлинным свидетельством в его пользу в отношении ложноположительных срабатываний. Обзор Copyleaks даёт полную картину.

4. Originality.ai: создан для издателей, а не для аудиторий

Страница бесплатного детектора ИИ Originality.ai с регулируемым ползунком допустимой доли ИИ и тремя бесплатными проверками в день
Калибровка Originality.ai по замыслу регулируется: ползунок допустимой доли ИИ, ориентированный на редакторов, проверяющих тексты, а не на комиссии по нарушениям.

Originality.ai обслуживает издателей, SEO-агентства и контент-команды, проверяющие тексты фрилансеров, и каждое проектное решение вытекает из этой аудитории: ценообразование на основе кредитов, по одному кредиту за 100 слов, API, расширение для Chrome, дополнения для проверки на плагиат и фактчекинга, а также регулируемый ползунок допустимой доли ИИ, который позволяет редактору задать, какой объём текста с помощью ИИ является приемлемым. Он переобучает свои модели обнаружения для каждого нового поколения языковых моделей и заявляет о 99% точности на самых новых из них, ссылаясь на собственное исследование и рецензируемые работы третьих сторон.

Он показывает достойные результаты в независимом тестировании, входя в число самых сильных коммерческих инструментов в бенчмарке RAID, а его калибровка намеренно агрессивна: он скорее даст ложное срабатывание, чем пропустит нарушение. Для издателя это правильный компромисс, а для комиссии по нарушениям, неправильный, и это самое важное, что нужно понимать, когда его предварительный результат не совпадает с тем, что позже показывает университетский инструмент. Originality.ai versus Turnitin показывает этот разрыв.

5. Pangram: тот, которому независимые исследования продолжают отдавать предпочтение

Главная страница Pangram: AI detector, который действительно работает, с заявлением о точности 99.98%, приписываемым исследователям University of Maryland и University of Chicago
Pangram выделяется тем, чего не хватает большинству поставщиков: независимой проверкой, приписываемой названным университетским исследователям.

Pangram является самым новым инструментом здесь и тем, который исследователи продолжают валидировать. Его классификатор был обучен специально так, чтобы удерживать ложноположительные результаты почти на нуле, а его отчет включает представление интерпретируемости, показывающее, какие фразы повлияли на вердикт. Функции охватывают более 20 языков, загрузку файлов с OCR, расширение браузера и интеграцию с Google Docs, бесплатный тариф сканирует до 2,000 слов в день. Поставщик утверждает точность 99.98% и уровень ложноположительных результатов 1 из 10,000, опубликованные с разбивкой по жанрам.

Необычно, но независимые данные указывают в том же направлении, что и маркетинг. Исследование VUB 2026 года показало, что это единственный из четырех протестированных инструментов, чья медианная оценка на полностью сгенерированных ChatGPT диссертациях была близка к истинному значению, и он же оказался наиболее близко согласованным на гибридных и гуманизированных работах. Рабочая статья NBER от исследователей Chicago Booth и Maryland показала, что это единственный detector, удерживающий ложноположительные результаты на уровне 0.5% или ниже и при этом сохраняющий высокие показатели на переписанном тексте. Оба исследования недавние и ограничены по охвату, но ни у одного другого инструмента на этой странице нет столь убедительной текущей доказательной базы. Обзор Pangram подробно рассматривает оба исследования.

6. Winston AI: самое громкое утверждение, меньше всего доказательств

Главная страница Winston AI: самый надежный AI detector, с значком точности 99.98% и 10 million users
Значок 99.98% у Winston размещен на главной странице, за ним не стоит названное внешнее исследование.

Winston AI это детектор на основе кредитов, предназначенный для преподавателей и контент-команд. Его набор функций практичен: тепловая карта по предложениям, OCR, который распознает сфотографированные и рукописные страницы, дополнение для проверки на плагиат и интеграция с Google Classroom. На главной странице заявлены 99.98% точности и более 10 million пользователей, при этом показатель точности основан на внутреннем тестировании, а методология, набор данных и размер выборки нигде на сайте не опубликованы.

Лучшей независимой точкой отсчета является бенчмарк RAID (ACL 2024), где Winston в целом обнаруживал 71% AI-текста при фиксированном уровне ложноположительных срабатываний 5%: отличный результат на выводе в стиле ChatGPT, 99.6%, значительно слабее на более старых и open-source моделях, и лишь 52.6% на перефразированном тексте. Компетентный инструмент с завышенным заголовочным заявлением. Обзор Winston AI подробно рассматривает это утверждение.

7. ZeroGPT: бесплатная предварительная проверка

Детектор на главной странице ZeroGPT с бесплатным вводом до 15,000 символов и без необходимости регистрации
Позиционирование ZeroGPT основано на отсутствии трения и на объеме: 15,000 символов, без учетной записи, и самый слабый набор доказательств из десяти.

ZeroGPT это бесплатная предварительная проверка с наибольшим трафиком: вставьте до 15,000 символов без учетной записи и получите мгновенный процент, а также выделенные предложения на основе того, что сервис называет технологией DeepAnalyse. Поставщик заявляет о точности выше 98% на внутренних оценках и не называет ни одного внешнего теста. Независимые сравнения последовательно помещают его в нижнюю часть коммерческого поля, а его оценка одного и того же текста может заметно меняться от запуска к запуску. Как грубый первый взгляд он безвреден, как окончательный вывод, это наименее обоснованный инструмент на этой странице. Обзор точности ZeroGPT прослеживает его утверждения до источников.

8. Scribbr: доверенный бренд с лицензированным движком

Бесплатный AI detector Scribbr, оценивающий академический абзац как на 100% сгенерированный AI, при этом в панели результата видна версия движка QuillBot
Проверка Scribbr в работе, тег версии QuillBot в панели результата, это корпоративная деталь, которую маркетинг не выдвигает на первый план.

AI checker Scribbr, это движок обнаружения QuillBot под брендом Scribbr: панель результата показывает версию движка, а страница о компании помещает обе компании в семейство Learneo. Бесплатный уровень сканирует около 1,200 слов в браузере без регистрации и сообщает трёхчастное распределение между AI-generated, AI-refined и human-written. В собственном сравнении Scribbr за July 2026 бесплатный checker выявил 78% тестовых текстов, а премиум-версия 84%, при этом в этой выборке не было ни одного false positive.

Это лучшие опубликованные показатели в бесплатном уровне, и они получены в тесте, который Scribbr сам разработал, провёл и оценил, причём его собственная корпоративная сестринская компания разделила первое место. Студенты доверяют checker, потому что руководства Scribbr по цитированию и диссертациям заслужили это доверие, detector наследует его. Обзор Scribbr рассматривает, что именно измеряют бесплатная и премиум-версии.

9. Sapling: инструмент для разработчиков

Результат AI detector Sapling, выделяющий предложения, сгенерированные AI, красным цветом, с ложной вероятностью 73.6%
Построчный вид Sapling, красное выделение и вероятность для документа, созданные для первичной сортировки внутри отраслевых рабочих процессов.

Detector Sapling создан NLP-компанией, основным бизнесом которой является помощь в написании для команд поддержки клиентов, и это заметно: самый доступный API в группе, оценки вероятности по предложениям с представлением perplexity и расширение для браузера, которое сканирует текст внутри Google Docs, Gmail, Zendesk и Salesforce. Бесплатные проверки ограничены 2,000 символов, платные планы повышают лимит до 100,000.

Его независимая репутация самая нестабильная из десяти: 68% при нулевом числе ложных срабатываний в сравнении Scribbr, почти полные промахи в бенчмарке arXiv 2023 года и как минимум один практический обзор, в котором он помечал все как поддельное. Оценки по одному обзору плохо обобщаются для любого детектора, и Sapling, это наиболее наглядный пример. Обзор Sapling рассматривает, почему.

10. Compilatio: институциональный аналог Европы

Compilatio homepage: detect AI content with Compilatio, plagiarism checker and AI detector for European institutions
Предложение Compilatio повторяет Turnitin и ориентировано на преподавателей и учреждения во французских и более широких европейских системах.

Compilatio это пакет для проверки на плагиат и AI, который европейские учреждения лицензируют там, где в обзорах, ориентированных на США, предполагается Turnitin: наиболее силен во франкоязычных системах, при этом обнаружение AI встроено в тот же рабочий процесс для преподавателя, что и проверка на сходство, а студенческая версия продает те же проверки по кредитам. Компания заявляет о надежности 94 to 99% и менее 1% ложных срабатываний, и это единственный инструмент здесь, кроме Turnitin, который оказался почти вверху рецензируемого теста, заняв второе место из четырнадцати у Weber-Wulff и коллег. Если вы учитесь в ЕС, детектор, который читает вашу диссертацию, вполне может быть именно этим. Обзор Compilatio рассматривает, что этот рейтинг устанавливает, а что нет.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

iThenticate: детектор на столе издателя

Еще один продукт Turnitin заслуживает здесь отдельного раздела, потому что большинство исследователей сталкиваются с ним, так и не видя его. iThenticate это инструмент проверки Turnitin для издателей, журналов и исследовательских учреждений, созданный для проверки рукописей перед публикацией, а не для выставления оценок учебным работам. Его позиционирование, это публикация с уверенностью: проверяйте документ с высокими ставками на возможные нарушения до его отправки. Тысячи научных журналов пропускают через него поступающие материалы через сервис Crossref Similarity Check, так что если вы отправляли статью в рецензируемый журнал, ваша рукопись, вероятно, прошла через iThenticate, независимо от того, сообщил ли вам об этом кто-либо.

iThenticate homepage for publishers and researchers: publish with confidence by screening high-stakes documents for potential misconduct before publication, with log in and buy credits buttons
iThenticate продает предварительную проверку перед публикацией с кредитами, покупаемыми для каждого документа, это единственный инструмент семейства Turnitin, который автор может запустить без учреждения.

Две вещи отличают его от строки Turnitin выше. Он ориентирован прежде всего на документ, а не на курс, здесь нет классов, нет заданий, один отчет на одну рукопись. И, в отличие от Turnitin, его может купить сам проверяемый. Кредиты продаются напрямую на сайте, по цене за документ, что делает его единственным инструментом в семействе Turnitin, который автор может запустить на своей рукописи до того, как это сделает журнал. Отчет прежде всего является отчетом о сходстве, с сопоставлением с опубликованной литературой и вебом, и Turnitin относит iThenticate к продуктам, которые включают его обнаружение AI writing для соответствующих клиентов.

Для академического автора практическое применение узко и реально: предварительная проверка окончательной рукописи на оригинальность перед подачей, выполняемая той же компанией, чьи инструменты, вероятно, использует журнал. Отчёт не исправляет ничего. Он выявляет совпадения и вероятный AI-текст, а переработка отмеченной прозы по-прежнему остаётся вашей задачей, именно для этого и предназначена половина контрольного списка подачи, для которой создан academic AI humanizer.

Что независимые исследования говорят об этой категории

Показатели поставщиков группируются около 99%. Опубликованные исследования, нет. Weber-Wulff и коллеги протестировали 14 систем в International Journal for Educational Integrity в 2023 году, среди них Turnitin, а Liang и коллеги в том же году в Patterns установили, что 89 из 91 эссе TOEFL, написанных неносителями английского языка, то есть 97.8%, были помечены как AI как минимум одним из семи детекторов, при этом 18 были помечены всеми семью.

Наиболее прямым академическим тестом указанных выше инструментов является исследование VUB 2026 года, опубликованное в открытом доступе в International Journal for Educational Integrity: реальные магистерские диссертации, четыре коммерческих детектора и медианы ниже 20% для полностью сгенерированных AI работ у трёх из четырёх. Jabarian и Imas в рабочем документе NBER w34223 создали корпус из 1,992 человеческих текстов до 2020 года и 1,992 AI текстов из четырёх передовых моделей и провели стресс-тестирование Pangram, GPTZero, Originality.ai и базовой модели с открытым исходным кодом: коммерческие детекторы превзошли базовую модель, и только один инструмент удержал уровень ложноположительных срабатываний на уровне 0.5% или ниже, сохраняя при этом высокие показатели на переписанном тексте. Базовая модель с открытым исходным кодом помечала от 30% до 69% человеческого текста, поэтому бесплатные детекторы GitHub отсутствуют в таблице выше.

OpenAI отозвала свой собственный AI Text Classifier 20 июля 2023 года, заявив, что он "больше не доступен из-за низкой точности". Giray, Roe и Espiritu, публикуя в English Teaching: Practice & Critique в марте 2026 года, прямо сформулировали проблему справедливости: "Эти инструменты непропорционально часто помечают как подозрительные подлинные тексты студентов, для которых английский язык не является родным, создавая сдерживающий эффект, который парадоксальным образом побуждает использовать AI, чтобы избежать ложных обвинений." Паттерн, лежащий в основе этого вывода, документирован в как детекторы относятся к англоязычному письму носителей других языков.

Учреждения отреагировали на проблему ложноположительных результатов. Vanderbilt отключил AI detector Turnitin в августе 2023 года, исходя из того, что при 75,000 работах, которые он представил в 2022 году, уровень ложноположительных результатов в 1% означает примерно 750 работ, ошибочно помеченных как нарушающие правила. В документации Michigan State указано, что инструменты обнаружения AI не должны быть единственным основанием для неблагоприятных мер против студента, а University of Texas at Austin вообще не поддерживает программное обеспечение для обнаружения AI. Насколько точны AI detectors на самом деле как категория, это отдельный вопрос от того, какую именно систему лицензирует ваше учреждение.

Модель, обходящая оценивание, отслеживание процесса

Другой ответ на проблему ложноположительных результатов вызывает институциональный интерес: перестать оценивать готовый текст и вместо этого фиксировать, как именно был написан документ. Функция Authorship в Grammarly и платформа для оценивания Cadmus работают именно так, фиксируя процесс письма, набор текста, вставки и историю правок по мере их выполнения. Запись процесса не может дать ложноположительный результат для эссе, которое действительно было набрано вручную, а именно этот режим отказа и заставил университеты отключать детекторы. Компромиссы здесь иные, вопросы надзора заменяют вопросы статистики, но если ваше учреждение внедряет одну из этих систем, спор о детекторах выше для вас в значительной степени теряет значение: доказательством служит журнал процесса, а не вероятностная оценка.

Как читать оценку детектора, которую вам предоставили

Число почти всегда появляется без контекста. Четыре вопроса возвращают достаточно контекста, чтобы разговор был осмысленным.

  • Какой именно инструмент и какая именно цифра. Процент на уровне документа и выделение на уровне предложения несут разные опубликованные показатели ошибки у одного и того же поставщика, а у Turnitin это 1% и около 4% соответственно.
  • Что поставщик опубликовал о своих ошибках. Инструмент, который указывает частоту пропусков и частоту ложноположительных результатов, уже сообщил вам, где проходят его пределы. Инструмент, который публикует только процент точности, этого не сделал.
  • Является ли оценка доказательством или лишь поводом для проверки. Формулировка Michigan State о том, что эти инструменты не должны быть единственным основанием для неблагоприятных мер, является распространенной институциональной позицией и заслуживает цитирования в апелляции. Руководство по апелляционному письму показывает, как это сделать.
  • Что на самом деле говорит политика вашего учреждения. Лицензирован ли детектор, можно ли использовать его результат в процессе рассмотрения нарушения и что может запросить студент, все это где-то зафиксировано, и в разных университетах эти правила сильно различаются.

Что Turnitin делает с humanized text рассматривается отдельно, вместе с более широким обзором альтернатив humanizer.

Поставщики детекторов и дальше будут публиковать округленные числа, и большинство из них по-прежнему будет отказываться говорить, откуда эти числа взялись. Какие из этих десяти критериев применимы к вашей работе, решает тот, кто ее читает, поэтому полезная подготовка состоит в том, чтобы знать, что именно этот инструмент публикует о собственных показателях ошибки, прежде чем кто-либо процитирует вам процент. Текущие цены TextPulse размещены на отдельной странице, где они обновляются, а не в сводном обзоре.

Что показало наше собственное исследование

В исследовании согласованности детекторов TextPulse Research девять коммерческих ИИ-детекторов оценили одни и те же 90 академических текстов. Один из них был гибридным текстом из 455 слов: написанные человеком начало и концовка вокруг сгенерированной ИИ средней части из 168 слов. Copyleaks оценил этот текст в 0% ИИ, тогда как вердикты остальных инструментов по тем же словам разошлись от 0% до 95.7% ИИ. Полная статья, корпус и матрица оценок по каждому инструменту открыто доступны на TextPulse Research.

Copyleaks на гибридном тексте из корпуса исследования.
Copyleaks на гибридном тексте из корпуса исследования.
Sapling на гибридном тексте из корпуса исследования.
Sapling на гибридном тексте из корпуса исследования.
XLinkedInFacebook

Часто задаваемые вопросы

Ни одно заявление производителя не решает этот вопрос, но самые недавние независимые данные в пользу Pangram: исследование 2026 года в Vrije Universiteit Brussel, опубликованное в International Journal for Educational Integrity, показало, что это единственный инструмент, чья медианная оценка на полностью сгенерированных AI академических текстах приблизилась к истинному значению, тогда как GPTZero, Copyleaks и Turnitin дали медианы ниже 20%, а рабочая статья NBER показала, что это единственный детектор, удерживавший ложноположительные срабатывания на уровне 0.5% или ниже. Оба исследования недавние и ограничены по охвату, и вывод любого детектора сам по себе не является доказательством.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.