AI Detection

Обзор Winston AI: заявленная точность 99,98% против доказательств

Winston AI заявляет о точности 99,98%, это самый высокий самозаявленный показатель в индустрии детекторов, измеренный на внутреннем тестовом наборе, который компания никогда не публиковала. Рецензируемый бенчмарк RAID показал общую точность 71% при фиксированном уровне ложноположительных срабатываний 5%, что все же стало вторым результатом среди четырех протестированных коммерческих детекторов. Вот что на самом деле измеряет каждое число и кому этот инструмент действительно подходит.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI рекламирует точность 99.98%, это самый высокий показатель, заявленный самим производителем среди всех основных детекторов AI. Эта цифра размещена на главной странице компании рядом со словами "The Most Trusted AI Detector", и она получена в результате внутренних испытаний компании, а не внешней лаборатории. Вместе с ней не опубликованы ни методология, ни размер тестового набора, ни соотношение образцов человека и AI, ни порог срабатывания. Этот разрыв между заявлением и его документированием, это первое, что внимательный читатель должен знать об этом инструменте.

Второе состоит в том, что Winston действительно подвергался внешнему тестированию, и это уже больше, чем могут сказать некоторые детекторы. В бенчмарке RAID, рецензируемом исследовании, представленном на ACL 2024, Winston был проверен примерно на 6.2 million текстах, сгенерированных машиной, и показал общую точность 71.0% при фиксированной доле ложноположительных срабатываний 5%. Это очень далеко от 99.98%. Кроме того, он занял второе место среди четырех протестированных коммерческих детекторов, опередив GPTZero и ZeroGPT. Оба факта важны, и ни один не отменяет другой.

Далее рассматривается, что такое Winston и для кого он создан, что заявляет поставщик, что статистически может и не может означать собственный бенчмарк 99.98%, а также что на самом деле показывают независимые данные.

Что такое Winston AI и кто им пользуется?

Winston AI это платный детектор на основе подписки, ориентированный прежде всего на преподавателей и издателей контента. Его перечень функций напоминает рабочий процесс преподавателя: на сайте компании описан OCR, который извлекает текст из отсканированных документов, фотографий и рукописного текста, интеграция с Google Classroom, указанная среди поддерживаемых платформ, проверка на плагиат наряду с AI-детекцией, а также организация документов для управления пакетами отправленных материалов. Поставщик заявляет, что он обнаруживает вывод ChatGPT, Gemini, Claude, LLaMA "and much more".

Наиболее отличительная часть интерфейса, это вывод по каждому предложению. Вместо того чтобы возвращать только один процент, Winston формирует то, что он называет картой предсказания AI: цветовую, построчную оценку того, какие части документа выглядят как сгенерированные машиной. Для преподавателя такая карта полезнее, чем голый показатель, потому что она показывает, где сосредоточено подозрение инструмента. Кроме того, ее легко переинтерпретировать, и этот вопрос рассматривается ниже.

Главная страница Winston AI: самый надежный детектор AI, с бейджем точности 99.98% и 10 million users
Речь идет о бейдже: точность 99.98%, на главной странице, без указанного исследования, на котором он основан.

Что утверждает компания?

Главное утверждение на главной странице Winston AI звучит так: "99.98% Accurate." На момент написания этого текста страница, где приводится эта цифра, не публикует, как был сформирован тестовый корпус, сколько образцов он содержал, какое соотношение человеческого и AI текста использовалось, а также какой порог принятия решения был установлен у детектора, когда измерялась эта цифра. Для этой отрасли это не необычно, тот же разрыв между заявлениями поставщиков о точности и независимыми данными характерен почти для каждого детектора на рынке. Версия этого утверждения у Winston, это просто самое большое число, которое кто-либо к нему приписал.

Что на самом деле может означать собственный бенчмарк 99.98%?

На минуту серьезно отнеситесь к арифметике. Показатель точности 99.98% означает 2 ошибки на каждые 10,000 образцов. Чтобы вообще измерить такую величину, компании нужен размеченный тестовый набор как минимум из десятков тысяч документов, где истинное происхождение каждого текста известно с полной определенностью. Затем это число описывает только результат на этом корпусе, на этих AI моделях, на этих промптах, на этих жанрах, на этой длине текста, при одном выбранном пороге.

Ничто из этого не требует недобросовестности. Детектор, обученный на эссе, сгенерированных популярными чат-моделями, а затем протестированный на корпусе эссе, сгенерированных популярными чат-моделями, действительно будет показывать результат, близкий к верхней границе шкалы. Проблема заключается в переносимости. В тот момент, когда входной текст поступает от другой модели, другой стратегии сэмплирования или автора, чей естественный стиль необычно однороден, корпус, на котором измерялся бенчмарк, больше не описывает оцениваемый текст. Внутренний бенчмарк, это контролируемый эксперимент, проводимый стороной, у которой самый сильный интерес в его исходе, в условиях, выбранных ею самой. Это доказательство, но самого слабого рода, и отсутствие методологии означает, что никто вне компании не может даже проверить его.

Что показывает независимое тестирование?

Самым строгим публичным тестом, включающим Winston, является RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, рецензируемое исследование Dugan и коллег, представленное на ACL 2024. RAID оценивал 12 детекторов, включая четыре коммерческих продукта, примерно на 6,2 миллиона сгенерированных текстов, охватывающих 11 языковых моделей, 8 письменных жанров, 4 стратегии декодирования и 11 атак противодействия, при этом каждый детектор был откалиброван на один и тот же уровень ложноположительных срабатываний 5%, чтобы показатели были сопоставимы.

DetectorОбщая точность в RAID (FPR фиксирован на уровне 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

Два прочтения этой таблицы одновременно честны. Показатель Winston 71.0% и близко не равен 99.98%, и при этом Winston все же обошел двух из трех своих коммерческих конкурентов на самом сложном доступном публичном бенчмарке. Средние значения также скрывают показательное распределение. В результатах RAID по отдельным моделям Winston получил 99.6% на выводе ChatGPT и 98.8% на выводе GPT-4, что близко к его собственному заявленному показателю, но снизился до 47.6% на тексте GPT-2 и до 24.8% на тексте базовой модели MPT-30B. На перефразированном машинном тексте его точность упала до 52.6%.

Это распределение и есть вся история заявления о 99.98% в миниатюре. На тексте, похожем на тот, для которого, по-видимому, настраивали детектор, то есть на недавних чат-моделях, пишущих обычную прозу, Winston работает близко к своим маркетинговым обещаниям. Вне этого распределения качество резко падает. Внутренний бенчмарк, построенный на тексте из того же распределения, действительно может дать почти идеальное число, при этом почти ничего не сообщая о беспорядочной смеси моделей, правок и перефразирований, которая содержится в реальном почтовом ящике. Статистические сигналы, на которые опираются детекторы, подробнее разобраны в нашем объяснении о том, как работают AI detectors.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Ложноположительные срабатывания: кто страдает?

Конструкция RAID делает видимым один компромисс, который в маркетинге поставщиков редко обсуждается: каждый показатель точности в исследовании измерялся после фиксации уровня ложноположительных срабатываний на 5%. При такой калибровке 1 из 20 действительно человеческих документов помечается как подозрительный. Детектор может снизить этот показатель, повысив порог, но только ценой меньшего числа обнаруженных AI-текстов, эти два числа изменяются вместе, и поставщик, который приводит одно без другого, приводит лишь половину результата.

Бремя этих ошибок распределено неравномерно. Текст, который формален, шаблонен и обладает низкой вариативностью, для любого статистического детектора выглядит машинным, и это описание подходит для разделов с методами, обзоров литературы и аккуратной прозы авторов, пишущих на втором языке. Паттерн того, что AI detectors чаще помечают носителей неродного английского языка как подозрительных, документирован в отрасли, и метод Winston не делает здесь исключения. Карта предсказаний по отдельным предложениям заслуживает той же осторожности, предложение, выделенное красным, представляет собой статистическое наблюдение за словесными паттернами, а не доказательство авторства. Студентам, столкнувшимся с ошибочной пометкой, следует начинать с документации, а не с признания, наш гид о том, как доказать, что вы не использовали AI, объясняет, что действительно убеждает.

Цены и доступ

Winston является платным продуктом с ограниченным пробным периодом. Winston указывает 14-дневный бесплатный пробный период с 2,000 кредитов, план Essential за $18 в месяц, или $10 в месяц при ежегодной оплате, с 100,000 ежемесячных кредитов, план Advanced за $29 в месяц, или $16 в год, который добавляет командные места и более крупные сканы, и уровень Elite выше этого. Для отдельного преподавателя, проверяющего объем работ, сопоставимый с целым классом, это помещает Winston в категорию импульсной покупки, дешевле институциональных контрактов, но более функциональный, чем большинство бесплатных инструментов.

Место Winston в ландшафте детекторов

Судя по независимым данным, Winston представляет собой коммерческий детектор средней ценовой категории, который работает лучше, чем бесплатный уровень рынка, и хуже, чем его собственная реклама. Он подходит преподавателю, которому нужна видимость по отдельным предложениям, интеграция с Classroom и проверка на плагиат в одном недорогом инструменте, и который рассматривает каждый результат как повод для разговора, а не как окончательный вердикт. Он не подходит никому, кому нужен балл как доказательство, потому что ни один балл детектора не может служить доказательством.

Полное сравнение

Winston является одним из детекторов на переполненном рынке, и разрыв между 71% и 99.98% является одним из проявлений общерыночной закономерности. О том, как он соотносится с Turnitin, GPTZero, Originality, ZeroGPT и остальными на тех же, основанных на доказательствах, условиях, см. наше полное руководство по сравнению AI detectors.

Что показало наше собственное исследование

В исследовании согласованности детекторов TextPulse Research девять коммерческих ИИ-детекторов оценили одни и те же 90 академических текстов. Один из них был гибридным текстом из 455 слов: написанные человеком начало и концовка вокруг сгенерированной ИИ средней части из 168 слов. Winston AI оценил этот текст в 7% ИИ, тогда как вердикты остальных инструментов по тем же словам разошлись от 0% до 95.7% ИИ. Полная статья, корпус и матрица оценок по каждому инструменту открыто доступны на TextPulse Research.

Winston AI на гибридном тексте из корпуса исследования.
Winston AI на гибридном тексте из корпуса исследования.
XLinkedInFacebook

Часто задаваемые вопросы

Показатель 99,98% это собственное утверждение Winston AI, измеренное на внутреннем тестовом наборе, который компания не публиковала. В рецензируемом бенчмарке RAID, представленном на ACL 2024, Winston получил 71,0% общей точности при фиксированном уровне ложноположительных срабатываний 5%, хотя на выходных данных ChatGPT он достиг 99,6%. Это утверждение описывает выбранный корпус, а не реальную производительность.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.