AI Detection

Чи точні AI-детектори? Хибні спрацьовування та упередженість

Постачальники публікують показники хибних спрацьовувань нижче 1 відсотка. Незалежні дослідники, які тестували ті самі детектори на письмі неносіїв англійської мови, виявили показники понад 60 відсотків. Ось що показують докази.

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin стверджує, що їхній рівень хибнопозитивних результатів становить менше 1%. Група незалежних дослідників протестувала кілька детекторів на ширшому наборі зразків письма від носіїв, для яких англійська не є рідною. Вони виявили, що середній рівень хибнопозитивних результатів перевищував 60% для того самого типу письма. Обидва числа є реальними, обидва були опубліковані, і обидва стосуються детекторів, які продаються на тому самому ринку. Чи є AI детектори точними? Це залежить від того, яку популяцію ви тестували, який детектор ви використовували, і як ваш постачальник визначив це спочатку.

Цей допис не буде повторно пояснювати, як детектор обчислює цей бал. Механізм, perplexity, ймовірність токенів, спосіб навчання класифікатора, детально розглянуто в іншому місці, і якщо ви ще не читали це, варто прочитати спочатку. Тут важливо те, що відбувається після появи бала, як часто він є хибним, щодо чиєго письма він найчастіше є хибним, і що насправді коштує хибне звинувачення людині, яка не зробила нічого неправильного.

Чи є AI детектори точними?

Не послідовно, і розрив між маркетинговими твердженнями та незалежним тестуванням добре задокументований. Група дослідників під керівництвом Debora Weber-Wulff опублікувала свої висновки щодо 14 інструментів виявлення, зокрема 12 безкоштовних і двох комерційних, які було протестовано на суміші людського тексту та тексту ChatGPT у 2023 році. Вони виявили, що жоден із цих інструментів не є точним або надійним, і що в них вбудована упередженість, яка змушує позначати машинний текст як людський, а не навпаки. Два комерційні інструменти, включені до цього тесту, були Turnitin і PlagiarismCheck. Усі інструменти в цьому тесті працювали гірше, коли текст було перефразовано.

Але через два роки ситуація не застигла. Робочий документ із Booth School Університету Chicago, автори Brian Jabarian та Alex Imas, випробував трьох новачків, Pangram, GPTZero та Originality.ai, а також одного конкурента з відкритим кодом на майже 2,000 текстах, написаних людьми, з блогів, новин, рецензій і художньої прози. За контрольованих умов тестування найкращий інструмент у цій групі ніколи не опускався нижче 99.8 percent точності та зберігав низький рівень хибнопозитивних спрацьовувань. Модель з відкритим кодом показала себе не краще за випадкове вгадування. Справді, ситуація стала кращою. Так би мовити. Трохи.

Але тут є застереження, і це слово контрольованих. Тексти для бенчмарку є чистими, повними та створеними за відомих умов. Подане есе не є жодною з цих речей надійно. Як публічно зазначав головний директор з продукту Turnitin, результати в реальному світі можуть не збігатися з лабораторними результатами, хоча це рідкісне й корисне визнання з боку постачальника. У наступному розділі числові дані постачальників зіставлено з незалежними даними, щоб розрив було видно, а не просто стверджено.

Заяви постачальників проти незалежного тестування

У таблиці нижче зіставлено те, що чотири детектори заявляють про себе, з тим, що виміряли незалежні дослідники, коли безпосередньо тестували ці інструменти. Читайте два середні стовпці разом, а не лише стовпець постачальника.

ДетекторЗаявлена постачальником точністьНезалежно спостережуванаЩо постачальник каже про хибнопозитивні результати
TurnitinПоріг упевненості 98% перед позначенням, менше ніж 1% хибнопозитивних результатів на рівні документаБлизько 80% точності, найкращий показник серед 12 інструментів у порівнянні 2023 року, на раннішій версії інструментаМенше ніж 1% на рівні документа понад порогом 20% AI-written; близько 4% на рівні речення
GPTZero95.7% виявлення AI-text за 1% рівня хибнопозитивних результатів у незалежному бенчмарку RAID96% точності на коротких уривках, рівень хибнопозитивних результатів менше ніж 1% у дослідженні University of Chicago Booth 2025 рокуПовідомляє про 1% рівень хибнопозитивних результатів у бенчмарку RAID
Originality.ai99% точності, 0.5% рівня хибнопозитивних результатів, модель Lite, 1.5%, модель TurboРівень хибнопозитивних результатів менше ніж 1%, але пропустив від 10% до 40% AI-written тексту в тому самому дослідженні BoothПублікує окремі показники хибнопозитивних результатів за рівнями моделі
PangramРівні помилок, які, за його словами, більш ніж у 38 разів нижчі, ніж у конкуруючих інструментів, стверджує, що немає упередженості проти авторів, для яких англійська не є рідноюТочність ніколи не нижча за 99.8%, рівень хибнопозитивних результатів близький до нуля, у дослідженні BoothСтверджує про майже нульові рівні хибнопозитивних результатів у 10 текстових доменах і 8 мовних моделях

Дві речі впадають в око. По-перше, усі показники постачальників походять із лабораторії, яку контролює постачальник, а показники Booth походять від дослідників, яким нічого продавати. По-друге, Turnitin взагалі не представлений у тій середній колонці, оскільки дослідження 2025 року його не тестувало. У таблиці його незалежний показник ґрунтується на раннішому порівнянні 2023 року, але був отриманий на старішій версії інструмента, тож пам'ятайте про це, коли дивитеся на таблицю як на порівняння на однаковій основі.

Наскільки точним є виявлення AI у Turnitin?

Turnitin не публікує одну цифру точності. Натомість воно публікує поріг і компроміс. Компанія заявила, що позначає документ лише тоді, коли має 98 percent упевненості, що позначена частина написана AI, і що саме цей поріг забезпечує рівень хибнопозитивних результатів на рівні документа нижче 1 percent. Turnitin оцінила, що виявляє приблизно 85 percent текстів, написаних за допомогою AI, а решту пропускає навмисно, щоб не ризикувати хибним звинуваченням.

Фактичний відсоток хибнопозитивних результатів, який Turnitin видає на рівні речення, де інтерфейс підсвічує окремі рядки, а не весь документ, насправді ближчий до 4 percent. Це число варто знати, якщо професор робить знімок екрана одного позначеного абзацу, а не оцінки всього документа, тому що підсвічене речення має істотно вищу ймовірність бути помилковим, ніж оцінка документа поруч із ним.

Також варто зазначити, що Turnitin прямо визнав цю різницю. Вони встановили, що їхні перші результати в реальних умовах, особливо для коротших документів, мали вищі показники хибнопозитивних результатів, ніж очікувалося на основі лабораторних тестів. Тому вони змінили мінімальну довжину документа для оцінювання з 150 до 300 слів. Це означає, що постачальник коригує власний продукт, тому що опублікована цифра не підтвердилася поза лабораторією, а це говорить не менше, ніж будь-яке незалежне дослідження.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Що насправді коштує студенту хибнопозитивний результат

Це сталося з студентом executive MBA у Yale's School of Management. Студента звинуватили в порушенні, у найбуквальнішому сенсі цього слова. Використаним детектором був GPTZero. Підсумковий іспит студента з курсу фінансів позначив асистент викладача, який вважав, що текст був довгим і розгорнутим, із майже бездоганною пунктуацією та граматикою. І цей конкретний професор пропустив його через GPTZero, який оцінив відповіді як імовірно згенеровані AI.

Він не склав курс і був відсторонений на рік. Його позов, поданий до федерального суду в лютому 2025 року, стверджує, що власна політика Yale обмежує використання таких інструментів, як GPTZero, саме з цієї причини, а саме через задокументований рівень хибнопозитивних результатів щодо носіїв англійської мови, для яких вона не є рідною, і що він використав його всупереч цій політиці. У поданні також зазначається, що GPTZero присвоїв 100 percent оцінку AI-generated академічному письму колишнього президента університету Yale та декана бізнес-школи.

Суддя відмовився видати попередню судову заборону в травні 2025 року. Справу досі не вирішено, коли я це пишу. Позивач, громадянин Франції, стверджує, що саме та сама відома упередженість щодо носіїв англійської мови, для яких вона не є рідною, спричинила такий результат його письма. Саме це ми розглядаємо в наступному розділі. Те, що не підлягає обговоренню, це ціна, рік, втрачений у програмі здобуття ступеня, незадовільна оцінка, судові витрати та кілька місяців боротьби за бал замість здобуття ступеня. 1 percent хибнопозитивних результатів здається незначним, доки велика сукупність не робить його проблемою для конкретної людини.

Чому AI detectors неправильно класифікують носіїв англійської мови, для яких вона не є рідною?

Погано, і з великим відривом. Саме такого висновку дійшло дослідження, яке вперше кількісно це оцінило. Дослідники Stanford перевірили сім широко використовуваних GPT detectors на 91 есе TOEFL, написаному носіями англійської мови, для яких вона не є рідною, та 88 есе учнів восьмого класу в US. Детектори майже завжди правильно читали есе восьмого класу. Коли йшлося про есе TOEFL, написані дорослими, які володіли мовою достатньо добре, щоб складати іспит з англійської мови рівня магістратури, середній рівень хибнопозитивних результатів у детекторів становив 61.3 percent. Вісімдесят дев'ять із 91 есе були позначені як такі, що були згенеровані GPT, принаймні одним із семи детекторів, 18 із цих есе були позначені всіма сімома детекторами.

Механізм той самий, що керує рештою виявлення: передбачувана лексика і простіша побудова речень читаються як низька perplexity, а низька perplexity читається як машинно створена, незалежно від того, хто тримає перо. Автори, які працюють другою мовою, спираються на усталені формулювання, тому що саме так насправді виглядає вільне володіння додатковою мовою, і саме такий профіль детектор був створений позначати.

Автори в такому становищі не отримують належної користі від поради просто писати природніше, оскільки саме природність і була позначена. Сторінка TextPulse для академічних авторів ESL докладніше розглядає моделі формулювань, що стоять за цим ризиком, зокрема те, що змінює їх без зміни змісту речення.

Це не був поодинокий випадок. У грудні 2025 року було оприлюднено новий benchmark, спеціально розроблений для оцінювання упередженості в цих детекторах. Він охоплював понад 200,000 зразків у межах кількох демографічних груп і мов. Попри те, що минуло два роки від першого дослідження Stanford і що він включав багато різних версій моделей тих самих детекторів, цей benchmark виявив, що упередженість щодо тих, хто вивчає англійську мову, досі присутня.

Це не стосується всіх постачальників. Власна технічна документація Pangram стверджує, що її класифікатор не є упередженим проти носіїв англійської мови, для яких вона не є рідною. Дослідники Chicago Booth не перевіряли це твердження незалежно, але воно показує, що детектори нового покоління створюються з урахуванням цієї проблеми, а не з її ігноруванням.

Якщо ви хочете побачити, де саме перебуває ваш власний текст, перш ніж хтось інший оцінить його, безкоштовний перевірник perplexity дає вам те саме базове число, яке обчислив би детектор, без попереднього надсилання чогось до установи.

Хто ще отримує позначення, і чому

Носії англійської мови, для яких вона не є рідною, несуть найбільший задокументований ризик, але та сама статистична логіка виявляє й інші тексти. Команда Weber-Wulff встановила, що всі 14 інструментів, які вони тестували, були менш точними, коли застосовували їх до перефразованих текстів, це описує значну частку академічного письма, яке вже пройшло через коректора, редактора або червону ручку наукового керівника, перш ніж хтось запускає на ньому детектор.

Усе це не означає, що число є беззмістовним, лише те, що його потрібно підтвердити, перш ніж воно означатиме щось про конкретну особу. Якщо у вас є текст, який читається як однорідний, із подібною довжиною речень, подібним ритмом упродовж усього тексту, він отримає вищу оцінку як більш машиноподібний, незалежно від того, хто його написав і чому. Це можна перевірити безпосередньо за допомогою free burstiness checker, а не здогадуватися.

Як виглядає обґрунтована політика щодо виявлення AI

Yale вже мала політику, яка, як повідомляється, обмежує використання інструментів на кшталт GPTZero, майже з тих самих причин, які викладено в цій статті, задокументований рівень хибнопозитивних результатів і задокументована упередженість проти тих, хто пише англійською не як рідною мовою. Тож це не стільки історія про одного невдачливого студента, скільки про те, що чинне правило не було дотримане. Коли політика справді проводить межу між оцінкою і вердиктом, тоді оцінка стає одним із вхідних даних, а не вердиктом.

  • Ставтеся до оцінки як до одного з вхідних даних, ніколи не як до єдиної підстави для встановлення порушення
  • Розкривайте студентам опублікований рівень хибнопозитивних результатів інструмента до того, як використовувати його проти них
  • Застосовуйте додаткову обережність до коротких подань і до письма англійською не як рідною мовою, обидва ці випадки є задокументованими слабкими місцями
  • Гарантуйте шлях до оскарження, який не вимагає спростування статистики

У цьому немає нічого екзотичного. Це ближче до того, як слід ставитися до будь-якого окремого доказу у криміналістиці в інших контекстах, корисного, такого, що можна перевірити, і ніколи не достатнього сам по собі.

Для окремого автора той самий принцип застосовується ще до того, як з'являється оцінка, а не після. Одне число, з будь-якого інструмента, є оцінкою, а не вердиктом, і ставитися до нього як до певності в будь-який бік, безпечно або викрито, означає вимагати від цього числа більшого, ніж воно може підтвердити.

Власний AI humanizer tool від TextPulse повідомляє Human Score на тій самій логіці: це оцінка, обчислена на основі вашого власного тексту, а не вердикт детектора щодо нього, корисна як сигнал того, як чернетка наразі читається, а не як обіцянка того, що скаже будь-який конкретний детектор.

Питання точності розпадається на вужчі питання, кожне з яких має власну сторінку. Частота, з якою детектори позначають людське письмо розглядається окремо, так само як і конкретні дані щодо рівня хибнопозитивних результатів Turnitin та точності ZeroGPT. Якщо оцінка вже була використана проти вас, є практичні матеріали про що робити, коли вас звинувачують у використанні AI, про докази, які ви можете зібрати, щоб довести, що ви не використовували AI, і про написання апеляційного листа, який відповідає на оцінку на її власних умовах.

Число в будь-якому звіті й надалі змінюватиметься, оскільки постачальники перенавчають свої моделі, а дослідники продовжують тестувати їх на складніших випадках. Але те, що не повинно змінюватися, це звичка, що лежить під цим: читати оцінку як один із кількох вимірів, запитувати, на якій популяції її було валідовано, і запитувати, про що постачальник не говорить щодо випадків, у яких він і досі помиляється.

Frequently Asked Questions

Так. Weber-Wulff та колеги у порівнянні 2023 року дійшли висновку, що інструменти виявлення AI є «ані точними, ані надійними», а письменники, для яких англійська не є рідною, стикаються з найвищим задокументованим ризиком, причому одне дослідження виявило середній показник хибних спрацьовувань понад 60 відсотків на есе TOEFL. Один бал сам по собі не є доказом чогось, саме тому він ніколи не має бути єдиною підставою для звинувачення.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Чи точні AI-детектори? Хибні спрацьовування | TextPulse.ai