Огляд Winston AI: твердження про точність 99.98% проти доказів
Winston AI заявляє про точність 99.98%, найвище самостійно заявлене значення в індустрії детекторів, виміряне на внутрішньому тестовому наборі, який компанія ніколи не оприлюднювала. Рецензований бенчмарк RAID визначив його загальну точність на рівні 71% за фіксованої частоти хибнопозитивних спрацьовувань 5%, що все ще є другим показником серед чотирьох протестованих комерційних детекторів. Ось що насправді вимірює кожне число і кому цей інструмент справді підходить.
Winston AI рекламує 99.98% точності, найвищий самостійно заявлений показник серед усіх поширених AI-детекторів. Це число розміщене на головній сторінці компанії поруч зі словами "The Most Trusted AI Detector", і воно походить із власного внутрішнього тестування компанії, а не з незалежної лабораторії. Поряд із ним не опубліковано методологію, розмір тестового набору, співвідношення зразків людини до зразків AI або робочий поріг. Ця різниця між твердженням і його документацією є першим, що уважний читач має знати про цей інструмент.
Друге полягає в тому, що Winston насправді був протестований сторонніми дослідниками, і це більше, ніж можуть сказати деякі детектори. Бенчмарк RAID, рецензоване дослідження, представлене на ACL 2024, перевірив Winston на приблизно 6.2 мільйона машинно згенерованих текстів і зафіксував 71.0% загальної точності за умови, що рівень хибнопозитивних спрацьовувань був встановлений на 5%. Це дуже далеко від 99.98%. Також він поставив Winston на друге місце серед чотирьох протестованих комерційних детекторів, попереду GPTZero і ZeroGPT. Обидва факти мають значення, і жоден не скасовує інший.
Далі йтиметься про те, що таке Winston і для кого він створений, що стверджує постачальник, що може і чого не може означати статистично внутрішній бенчмарк із 99.98%, а також що насправді показують незалежні цифри.
Що таке Winston AI і хто ним користується?
Winston AI є платним детектором на основі підписки, орієнтованим насамперед на викладачів і видавців контенту. Перелік його функцій читається як робочий процес викладача: сайт компанії описує OCR, яке витягує текст зі сканованих документів, фотографій і рукописного тексту, інтеграцію з Google Classroom, зазначену серед підтримуваних платформ, перевірку на плагіат поряд із AI-детекцією, а також організацію документів для керування великими пакетами подань. Постачальник стверджує, що він виявляє вивід ChatGPT, Gemini, Claude, LLaMA "and much more."
Найвиразнішою частиною інтерфейсу є вивід по реченнях. Замість того, щоб повертати лише один відсоток, Winston створює те, що називає картою прогнозування AI: кольорово кодовану оцінку по реченнях, яка показує, які частини документа виглядають як згенеровані машиною. Для викладача така карта корисніша, ніж голий бал, тому що вона показує, де зосереджена підозра інструмента. Її також легко переінтерпретувати, про що йдеться нижче.

Що стверджує компанія?
Головне твердження на головній сторінці Winston AI звучить як "99.98% Accurate." На момент написання цього тексту сторінка, що містить цю цифру, не публікує, як було сформовано тестовий корпус, скільки зразків він містив, яку суміш людського тексту та тексту AI було використано, або на якому порозі ухвалення рішень було налаштовано детектор, коли цю цифру вимірювали. Це не є незвичним для цієї галузі, та сама різниця між заявами постачальників про точність і незалежними доказами простежується майже в кожному детекторі на ринку. Версія цього твердження у Winston просто містить найбільше число, яке хтось коли-небудь до нього додав.
Що насправді може означати самобенчмарк 99.98%?
На мить серйозно поставтеся до арифметики. Рівень точності 99.98% означає 2 помилки на кожні 10,000 зразків. Щоб узагалі виміряти таку цифру, компанії потрібен розмічений тестовий набір щонайменше з десятків тисяч документів, де справжнє походження кожного тексту відоме напевно. Тоді це число описує лише продуктивність на цьому корпусі: ті AI моделі, ті підказки, ті жанри, ту довжину тексту, за одного обраного порога.
Усе це не потребує недобросовісності. Детектор, навчений на есе, згенерованих популярними чат-моделями, а потім протестований на корпусі есе, згенерованих популярними чат-моделями, справді покаже результат, близький до стелі. Проблема полягає в переносимості. У момент, коли вхідний текст походить від іншої моделі, іншої стратегії семплювання або автора, чий природний стиль є незвично однорідним, корпус, на якому було виміряно бенчмарк, уже не описує текст, що оцінюється. Внутрішній бенчмарк є контрольованим експериментом, проведеним стороною, яка має найсильніший інтерес у його результаті, на умовах, обраних нею самою. Це доказ, але найслабшого типу, і відсутність методології означає, що ніхто поза компанією не може навіть перевірити його.
Що показує незалежне тестування?
Найсуворіше публічне тестування, яке включає Winston, це RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, рецензоване дослідження Дугана та колег, представлене на ACL 2024. RAID оцінив 12 детекторів, включно з чотирма комерційними продуктами, приблизно на 6.2 мільйона згенерованих текстів, що охоплюють 11 мовних моделей, 8 жанрів письма, 4 стратегії декодування та 11 атак супротивника, причому кожен детектор було відкалібровано до однакового рівня хибнопозитивних спрацьовувань 5%, щоб показники були порівнюваними.
| Detector | Overall accuracy in RAID (FPR fixed at 5%) |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
Два прочитання цієї таблиці однаково чесні. 71.0% у Winston аж ніяк не дорівнює 99.98%, і водночас Winston усе ж перевершив двох із трьох своїх комерційних конкурентів на найскладнішому доступному публічному бенчмарку. Середні значення також приховують показовий розкид. У результатах RAID за окремими моделями Winston набрав 99.6% на виводі ChatGPT і 98.8% на виводі GPT-4, близько до власної заявленої цифри, але впав до 47.6% на тексті GPT-2 і до 24.8% на тексті з базової моделі MPT-30B. На перефразованому машинному тексті його точність знизилася до 52.6%.
Цей розкид і є всією історією заяви про 99.98% у мініатюрі. На тексті, що нагадує те, для чого, ймовірно, налаштовували детектор, тобто на нещодавніх чат-моделях, які пишуть звичайну прозу, Winston працює близько до своїх маркетингових обіцянок. Поза цим розподілом результативність різко падає. Внутрішній бенчмарк, побудований на тексті з того самого розподілу, справді може дати майже ідеальне число, але при цьому майже нічого не сказати про строкату суміш моделей, редагувань і перефразувань, яку містить реальна поштова скринька. Статистичні сигнали, на які спираються детектори, докладніше розглянуто в нашому поясненні про як працюють детектори AI.
Гуманізуйте свою власну статтю
Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.
Хибнопозитивні спрацьовування: хто зазнає шкоди?
Конструкція RAID робить видимою одну компромісну умову, яку маркетинг постачальників рідко показує: кожен показник точності в дослідженні вимірювали після фіксації рівня хибнопозитивних спрацьовувань на 5%. За такого калібрування 1 із 20 справді людських документів позначається як підозрілий. Детектор може знизити цей показник, підвищивши свій поріг, але лише ціною гіршого виявлення тексту AI, ці два числа змінюються разом, і постачальник, який наводить одне без іншого, наводить лише половину результату.
Тягар цих помилок розподіляється нерівномірно. Письмо, яке є шаблонним, звичним і з низькою варіативністю, для кожного статистичного детектора виглядає машиноподібним, і цей опис відповідає розділам методів, оглядам літератури та обережній прозі авторів, які працюють другою мовою. Патерн позначення AI detectors носіїв, для яких англійська не є рідною, за підвищеними показниками задокументований у всій галузі, і метод Winston не має жодного винятку з цього. Карта прогнозів для кожного речення заслуговує на таку саму обережність, речення, виділене червоним, є статистичним спостереженням щодо словесних патернів, а не доказом авторства. Студентам, які зіткнулися з хибним позначенням, слід починати з документації, а не з визнання, наш посібник як довести, що ви не використовували AI описує те, що справді переконує.
Ціни та доступ
Winston є платним продуктом з обмеженим пробним періодом. Winston пропонує 14-денний безкоштовний пробний період із 2,000 кредитів, план Essential за $18 на місяць, або $10 на місяць при щорічній оплаті, із 100,000 щомісячних кредитів, план Advanced за $29 на місяць, або $16 на рік, який додає командні місця та більші перевірки, і рівень Elite вище за нього. Для окремого викладача, який перевіряє обсяг подань, достатній для цілого класу, це розміщує Winston у категорії імпульсної покупки, дешевшої за інституційні контракти, але більш спроможної, ніж більшість безкоштовних інструментів.
Місце Winston у ландшафті детекторів
З огляду на незалежні докази, Winston є комерційним детектором середнього цінового сегмента, який працює краще, ніж безкоштовний рівень ринку, і гірше, ніж його власна реклама. Він підходить викладачеві, який хоче бачити результати для кожного речення, інтеграцію з Classroom і перевірку на плагіат в одному недорогому інструменті, і який сприймає кожен результат як привід для розмови, а не як вирок. Він не підходить нікому, кому потрібен бал як доказ, тому що жоден бал детектора не може виконувати таку функцію.
Повне порівняння
Winston є одним із детекторів у перенасиченому полі, і його розрив між 71% та 99.98% є одним із проявів загальногалузевої закономірності. Щоб побачити, як він співвідноситься з Turnitin, GPTZero, Originality, ZeroGPT та іншими на тих самих, заснованих на доказах, умовах, дивіться наш повний посібник із порівняння AI detectors.
Що показало наше власне дослідження
У дослідженні узгодженості детекторів TextPulse Research дев'ять комерційних ШІ-детекторів оцінили ті самі 90 академічних текстів. Один із них був гібридним текстом на 455 слів: написані людиною вступ і завершення навколо згенерованої ШІ середньої частини на 168 слів. Winston AI оцінив цей текст у 7% ШІ, тоді як вердикти інших інструментів щодо тих самих слів розійшлися від 0% до 95.7% ШІ. Повна стаття, корпус і матриця оцінок кожного інструмента відкрито доступні на TextPulse Research.

Часті запитання
Показник 99.98% є власним твердженням Winston AI, виміряним на внутрішньому тестовому наборі, який компанія не оприлюднила. У рецензованому бенчмарку RAID, представленому на ACL 2024, Winston отримав 71.0% загальної точності за фіксованої частоти хибнопозитивних спрацьовувань 5%, хоча для вихідних даних ChatGPT окремо він досяг 99.6%. Це твердження описує обраний корпус, а не реальну продуктивність.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.