AI Detection

Чи точні детектори AI? Хибні спрацьовування і упередженість

Постачальники публікують показники хибних спрацьовувань нижче 1 відсотка. Незалежні дослідники, які тестували ті самі детектори на текстах неносіїв англійської, виявили показники понад 60 відсотків. Ось що показують докази.

Оновлено 13 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin стверджує, що їхній рівень хибнопозитивних результатів становить менше 1%. Група незалежних дослідників протестувала кілька детекторів на ширшому наборі зразків письма від неносіїв англійської мови. Вони виявили, що середній рівень хибнопозитивних результатів перевищував 60% для того самого типу письма. Обидва числа є реальними, обидва були опубліковані, і обидва стосуються детекторів, які продаються на тому самому ринку. Чи є детектори AI точними? Це залежить від того, яку популяцію ви тестували, який детектор ви використовували, і як ваш постачальник визначив це спочатку.

У цій публікації не буде повторно пояснюватися, як детектор обчислює цей показник. Механізм, perplexity, ймовірність токенів, спосіб навчання класифікатора, детально розглянуто в іншому місці, і варто спочатку прочитати це, якщо ви ще не читали. Тут важливо те, що відбувається після появи показника: як часто він помиляється, щодо чиїх текстів він помиляється найчастіше, і скільки насправді коштує хибне звинувачення людині, яка не зробила нічого неправильного.

Чи є детектори AI точними?

Не послідовно, і розрив між маркетинговими твердженнями та незалежним тестуванням добре задокументований. Група дослідників під керівництвом Debora Weber-Wulff опублікувала свої висновки щодо 14 інструментів виявлення, зокрема 12 безкоштовних і двох комерційних, які у 2023 році тестували на суміші людського тексту та тексту ChatGPT. Вони виявили, що жоден із цих інструментів не є точним або надійним, і що в них вбудована упередженість, яка змушує позначати машинний текст як людський, а не навпаки. Двома комерційними інструментами, включеними до цього тесту, були Turnitin і PlagiarismCheck. Усі інструменти в цьому тесті працювали гірше, коли текст було перефразовано.

Але через два роки ситуація не застигла. Робочий документ Школи бізнесу Booth Чиказького університету, підготовлений Brian Jabarian та Alex Imas, випробував трьох новачків, Pangram, GPTZero і Originality.ai, а також одного конкурента з відкритим кодом, на майже 2,000 текстах, написаних людьми, з блогів, новин, рецензій і художньої літератури. За контрольованих умов тестування найкращий інструмент у цій групі ніколи не опускався нижче 99.8 percent точності і зберігав низький рівень хибнопозитивних спрацьовувань. Модель з відкритим кодом показала себе не краще за випадкове вгадування. Справді, ситуація стала кращою. Певною мірою. Трохи.

Але тут є застереження, і це слово контрольованих. Бенчмарк уривки є чистими, повними і створеними за відомих умов. Подане есе не є надійно жодною з цих речей. Результати в реальному світі можуть не збігатися з лабораторними результатами, як публічно зазначав головний директор з продукту Turnitin, хоча це рідкісне і корисне визнання з боку постачальника. Наступний розділ ставить цифри постачальника поруч із незалежними цифрами, щоб розрив був видимим, а не просто стверджувався.

Заяви постачальників проти незалежного тестування

Таблиця нижче зіставляє те, що чотири детектори заявляють про себе, з тим, що виміряли незалежні дослідники, коли безпосередньо тестували інструменти. Читайте разом два середні стовпці, а не лише стовпець постачальника.

ДетекторЗаявлена постачальником точністьНезалежно спостережуванаЩо постачальник каже про хибнопозитивні результати
TurnitinПоріг упевненості 98% перед позначенням, менше ніж 1% хибнопозитивних результатів на рівні документаБлизько 80% точності, найкращий показник серед 12 інструментів у порівнянні 2023 року, на ранній версії інструментаМенше ніж 1% на рівні документа понад порогом 20% тексту, написаного AI, близько 4% на рівні речення
GPTZero95.7% виявлення тексту AI за рівня 1% хибнопозитивних результатів у незалежному бенчмарку RAID96% точності на коротких уривках, рівень хибнопозитивних результатів менше ніж 1% у дослідженні Booth 2025 року в University of ChicagoПовідомляє про 1% рівень хибнопозитивних результатів у бенчмарку RAID
Originality.ai99% точності, 0.5% рівень хибнопозитивних результатів, модель Lite, 1.5%, модель TurboРівень хибнопозитивних результатів менше ніж 1%, але пропустив від 10% до 40% тексту, написаного AI, у тому самому дослідженні BoothПублікує окремі показники хибнопозитивних результатів за рівнями моделі
PangramРівні помилок, які, за його словами, більш ніж у 38 разів нижчі, ніж у конкуруючих інструментів, стверджує, що немає упередженості проти авторів, для яких англійська не є рідноюТочність ніколи не нижча за 99.8%, рівень хибнопозитивних результатів близький до нуля, у дослідженні BoothСтверджує про майже нульові рівні хибнопозитивних результатів у 10 текстових доменах і 8 мовних моделях

Тут вирізняються дві речі. По-перше, усі показники постачальників походять із лабораторії, яку контролює постачальник, а показники Booth походять від дослідників, яким нічого продавати. По-друге, Turnitin взагалі не представлено в цій середній колонці, оскільки дослідження 2025 року не тестувало його. У таблиці його незалежний показник ґрунтується на ранньому порівнянні 2023 року, але був отриманий на старішій версії інструмента, тож пам'ятайте про це, коли розглядаєте таблицю як порівняння на однаковій основі.

Наскільки точним є виявлення AI у Turnitin?

Turnitin не публікує одну цифру точності. Натомість воно публікує поріг і компроміс. Компанія заявила, що позначає документ лише тоді, коли має 98 відсотків упевненості, що позначена частина написана AI, і що саме цей поріг дає змогу утримувати рівень хибнопозитивних результатів на рівні документа нижче 1 відсотка. Turnitin оцінила, що виявляє приблизно 85 відсотків текстів, створених за допомогою AI, а решту пропускає навмисно, а не ризикуючи хибним звинуваченням.

Фактичний відсоток хибнопозитивних результатів, який Turnitin видає на рівні речення, де інтерфейс підсвічує окремі рядки, а не весь документ, насправді ближчий до 4 відсотків. Саме цю цифру варто знати, якщо викладач робить скриншот одного позначеного абзацу, а не оцінки всього документа, тому що підсвічене речення має істотно вищу ймовірність бути помилковим, ніж показник документа поруч із ним.

Також варто зазначити, що Turnitin прямо визнала цю різницю. Вона встановила, що її перші результати в реальних умовах, особливо для коротших документів, мали вищі показники хибнопозитивних результатів, ніж очікувалося на основі лабораторних тестів. Тому вона змінила мінімальну довжину документа для оцінювання з 150 до 300 слів. Це означає, що постачальник коригує власний продукт, тому що опублікована цифра не підтвердилася поза лабораторією, а це говорить не менше, ніж будь-яке незалежне дослідження.

Що насправді коштує студенту хибнопозитивний результат

Це сталося зі студентом executive MBA у School of Management Єльського університету. Студента звинуватили в порушенні, у найбільш буквальному сенсі цього слова. Використаним детектором був GPTZero. Підсумковий іспит студента з курсу фінансів був позначений асистентом викладача, який вважав, що текст був довгим і складним, із майже бездоганними пунктуацією та граматикою. І цей конкретний професор пропустив його через GPTZero, який оцінив відповіді як імовірно згенеровані AI.

Він не склав курс і був відсторонений на рік. Його позов, поданий до федерального суду в лютому 2025 року, стверджує, що власна політика Yale обмежує використання таких інструментів, як GPTZero, саме з цієї причини, його задокументованого рівня хибнопозитивних результатів щодо носіїв англійської мови, для яких вона не є рідною, і що він використав його всупереч цій політиці. У поданні також зазначається, що GPTZero присвоїв 100 percent оцінку AI-generated академічному письму колишнього президента університету Yale та декана бізнес-школи.

У травні 2025 року суддя відмовився видати ранню судову заборону. Справу досі не вирішено, на момент написання. Позивач, громадянин Франції, стверджує, що та сама відома упередженість щодо носіїв англійської мови, для яких вона не є рідною, спричинила саме такий результат його письма. Саме це ми розглядаємо в наступному розділі. Те, що не підлягає обговоренню, це ціна, рік, втрачений у програмі навчання, незадовільна оцінка, судові витрати та кілька місяців боротьби за бал замість здобуття ступеня. 1 percent хибнопозитивних результатів здається незначним, доки велика сукупність не робить його проблемою для конкретної людини.

Гуманізуйте свою власну статтю

Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.

Почати безкоштовно

Які риси письма роблять людський текст схожим на машинно створений

Чотири види звичайного письма несуть найбільший ризик, і жоден з них не означає, що людина робить щось неправильне. Короткі документи, дуже формульоване письмо, цитований або шаблонний матеріал, а також текст, який ретельно вичитували, як правило, отримують вищі показники передбачуваності, ніж вільно створена проза, а саме цю властивість фактично вимірює кожен детектор. free burstiness checker безпосередньо вимірює ту саму варіативність, і це швидший спосіб побачити закономірність, ніж читати її опис.

Деякі жанри за задумом є формульними. Розділ методів, лабораторний звіт, стандартний супровідний лист і огляд літератури, усі вони винагороджують звичний вислів більше, ніж винахідливий, тому що саме конвенція робить документ придатним для його читача. Дослідники безпосередньо перевірили це на реальному письмі: вони прогнали 14,400 анотацій журналів, опублікованих між 1980 і 2023 роками, за роки до появи будь-якої великої мовної моделі, через загальнодоступний детектор. До 8 percent було позначено як згенеровані AI, незалежно від року публікації, а анотації New England Journal of Medicine були позначені на рівні 10.24 percent, що є найвищим показником хибнопозитивних результатів серед п'яти протестованих журналів.

Тест не міг виявляти нічого, пов'язаного з ChatGPT, оскільки ChatGPT не існував протягом більшості років, які він охоплював. Він виявляв жанр. Якщо висловитися формальніше, як це зробив би статистичний аналіз проблеми виявлення 2026 року, немає способу побудувати детектор, який би розрізняв речення, передбачуване тому, що його написало програмне забезпечення, і речення, передбачуване тому, що це саме той тип речі, яку ви пишете в межах його жанру. Ззовні вони виглядають абсолютно однаково.

Інтенсивне редагування штовхає в подібному напрямку. Чернетка містить специфічні нерегулярності автора, незвичний порядок слів, речення, яке розтягується, тому що так само розтягнулася думка. Ретельне вичитування, особливо якщо його виконують за допомогою іншого інструмента, має тенденцію саме ці нерегулярності згладжувати. Найбільше на сьогодні незалежне порівняння інструментів виявлення протестувало 14 таких інструментів і встановило, що точність для кожного інструмента ще більше знижувалася після того, як зразок тексту було перефразовано або машинно перекладено.

Ознака письмаЧому вона знижує видиму непередбачуваність документаЩо показують докази
Короткі поданняМенший обсяг тексту залишає менше простору для природної варіативності, яка відрізняє людський ритм від машинного ритмуОцінки коротких документів сильніше коливаються під впливом кількох незвичних речень
Формульне або специфічне для дисципліни письмоЖанрова конвенція винагороджує очікуваний вислів більше, ніж винахідливий14,400 анотацій журналів до появи ChatGPT (1980 to 2023) все ще спричиняли до 8% хибнопозитивних результатів, в одному журналі анотації досягали 10.24%
Сильно відредаговані або перефразовані чернеткиЕтап полірування згладжує індивідуальні нерівності, які детектор читає як людськіНезалежне порівняння 14 інструментів показало, що точність ще більше знижувалася після перефразування або машинного перекладу
Цитований або шаблонний матеріалЦитований уривок несе статистичний підпис свого джерела, а не автора, який його цитуєДетектори, які не виключають цитати, оцінюють навколишній документ на основі запозиченого тексту

Чому AI detectors неправильно класифікують носіїв англійської мови, для яких вона не є рідною?

Погано, і з великим відривом. Саме такого висновку дійшло дослідження, яке вперше надало цьому числове значення. Дослідники Stanford запустили сім широко використовуваних GPT detectors проти 91 есе TOEFL, написаного носіями англійської мови, для яких вона не є рідною, і 88 есе учнів восьмого класу в US. Детектори майже завжди правильно читали есе восьмого класу. Коли йшлося про есе TOEFL, написані дорослими, які володіли мовою достатньо добре, щоб складати іспит з англійської мови рівня магістратури, детектори в середньому показали рівень хибнопозитивних результатів 61.3 percent. Вісімдесят дев'ять із 91 есе були позначені як такі, що були згенеровані GPT, принаймні одним із семи детекторів, 18 із цих есе були позначені всіма сімома детекторами.

Механізм є тим самим, що керує рештою виявлення: передбачувана лексика і простіша побудова речень читаються як низька perplexity, а низька perplexity читається як машинно створена, незалежно від того, хто тримає перо. Автори, які працюють другою мовою, спираються на усталені формулювання, тому що саме так насправді виглядає вільне володіння додатковою мовою, і саме такий профіль детектор був створений позначати.

Авторам у такому становищі не допомагає порада просто писати природніше, оскільки саме природність і була позначена. Сторінка TextPulse для академічних авторів ESL докладніше розглядає мовні шаблони, що стоять за цим ризиком, зокрема те, що змінює їх без зміни змісту речення.

Це не був ізольований випадок. У грудні 2025 року було оприлюднено новий бенчмарк, прямо призначений для оцінювання упередженості в цих детекторах. Він охоплював понад 200,000 зразків у кількох демографічних групах і мовах. Попри те, що минуло два роки від першого дослідження Stanford і що він включав багато різних версій моделей тих самих детекторів, цей бенчмарк показав, що упередженість щодо English language learners досі присутня.

Це не стосується всіх постачальників. Власна технічна документація Pangram стверджує, що її класифікатор не є упередженим проти носіїв англійської мови, для яких вона не є рідною. Дослідники Chicago Booth не перевіряли це твердження незалежно, але воно показує, що детектори нового покоління створюються з урахуванням цієї проблеми, а не ігнорують її.

Якщо ви хочете побачити, де перебуває ваше власне письмо, перш ніж його оцінить хтось інший, безкоштовний перевірник perplexity дає вам те саме базове число, яке обчислив би детектор, без попереднього надсилання чогось до закладу.

Хто ще отримує позначку, і чому

Носії англійської мови, для яких вона не є рідною, несуть найбільший задокументований ризик, але та сама статистична логіка виявляє й інші тексти. Команда Weber-Wulff встановила, що всі 14 інструментів, які вони тестували, були менш точними, коли застосовували їх до перефразованих текстів, це описує значну частку академічного письма, яке вже пройшло через коректора, редактора або червону ручку керівника, перш ніж хтось запускає на ньому детектор.

Усе це не означає, що число є беззмістовним, лише те, що його потрібно підтвердити, перш ніж воно означатиме щось про конкретну особу. Якщо у вас є текст, який читається як однорідний, із подібною довжиною речень, подібним ритмом упродовж усього тексту, він отримає вищу оцінку як більш машиноподібний, незалежно від того, хто його написав і чому. Це можна перевірити безпосередньо за допомогою безкоштовного перевірника burstiness, а не здогадуватися.

Друга, менш обговорювана група стикається з пов'язаною проблемою. Дослідники порівняли приблизно 60,000 дописів Reddit, розділених між підмножиною, яку визначили як імовірно написану авторами з аутизмом, і загальною вибіркою, та пропустили обидві через детектор на основі GPT-2. Обидві групи загалом залишилися нижче 2 percent позначених, але підмножина, імовірно написана авторами з аутизмом, була позначена зі значно вищою частотою, ніж загальна вибірка. Письмо, яке тяжіє до буквальних, повторюваних, чітко впорядкованих формулювань, задокументованої риси деяких стилів комунікації людей з аутизмом, створює саме той текст із низькою варіативністю, який детектор і створено виявляти.

Чому впевнений бал не є впевненим звинуваченням

False positive rate звучить так, ніби йдеться про ймовірність того, що один студент, якого позначили як проблему, є невинним. Але ні. Воно описує, як тест працює для всіх, хто його проходить. І це різні питання з різними відповідями, так само як і в будь-якому скринінговому тесті в медицині або безпеці.

Статистичний аналіз березня 2026 року, виконаний дослідником з Griffith University, робить базову математику явною. Якщо розглядати виявлення AI як тест, застосований до популяції студентських авторів, а не до одного ізольованого документа, виникає компроміс: щоразу, коли певна частка цієї популяції пише так, що її текст природно перетинається з типовим виходом AI, близько до жанрової норми, близько до діапазону тих, хто вивчає другу мову, будь-який детектор із реальною здатністю виявляти роботи, написані AI, повинен помилятися щодо частини цієї перетинної групи. Це не твердження про те, що якийсь конкретний детектор погано сконструйований. Це властивість тестування різнорідної популяції за одним документом і без будь-яких інших доказів.

Власний ілюстративний приклад у статті показує масштаб цього явища. Припустімо, що 10 percent студентської популяції пише достатньо близько до типового виходу AI, а детектор налаштовано так, щоб виявляти 80 percent справжніх робіт, написаних AI. Тоді математика вимагає середнього рівня хибнопозитивних спрацьовувань щонайменше 7.5 percent у цій популяції. Це не вада інженерної реалізації детектора, а прямий наслідок того, наскільки сильно письмо цієї групи статистично перетинається з тим, що виявляють.

Якщо масштабувати це на університет із 10,000 студентів, лише ця нижня межа означає приблизно 750 хибних позначень у межах усієї популяції, тобто математичний наслідок тестування різнорідної популяції за одним документом без будь-яких інших доказів, які можна було б зважити. Автор статті прямо зазначає, що ці конкретні цифри є ілюстративними, а не виміряними в реальному закладі. Приклад демонструє форму проблеми, а не конкретний прогноз для якогось одного кампусу.

Як виглядає обґрунтована політика виявлення AI

Yale вже мав політику, яка, за повідомленнями, обмежує інструменти на кшталт GPTZero, і це близько до тих причин, які викладено в цій статті: задокументований рівень хибнопозитивних спрацьовувань і задокументована упередженість проти тих, для кого англійська не є рідною мовою. Отже, це не стільки історія про одного невдалого студента, скільки про те, що наявне правило не було дотримане. Коли політика справді забезпечує різницю між оцінкою і вердиктом, тоді оцінка стає одним із вхідних даних, а не вердиктом.

  • Ставтеся до бала як до одного з вхідних даних, ніколи не як до єдиної підстави для висновку про порушення
  • Розкривайте студентам оприлюднену інструментом частоту хибнопозитивних результатів до того, як використовувати його проти них
  • Застосовуйте додаткову обережність до коротких робіт і текстів, написаних не носіями англійської мови, обидва ці випадки є задокументованими слабкими місцями
  • Гарантуйте шлях до оскарження, який не вимагає спростування статистики

У цьому немає нічого екзотичного. Це ближче до того, як слід ставитися до будь-якого окремого фрагмента судово-експертного доказу деінде: корисного, такого, що можна перевірити, і ніколи не достатнього сам по собі.

Для окремого автора той самий принцип застосовується до того, як з'являється бал, а не після цього. Одне число, з будь-якого інструменту, є оцінкою, а не вердиктом, і ставитися до нього як до певності в будь-якому напрямі, безпечно чи викрито, означає вимагати від числа більшого, ніж воно може підтвердити.

Власний інструмент AI humanizer TextPulse повідомляє Human Score на тій самій логіці: оцінку, обчислену на основі вашого власного тексту, а не вердикт детектора щодо нього, корисну як сигнал про те, як чернетка наразі читається, а не як обіцянку щодо того, що скаже будь-який конкретний детектор.

Питання точності розпадається на вужчі, кожне зі своєю окремою сторінкою. Конкретні докази щодо частоти хибнопозитивних результатів Turnitin і щодо точності ZeroGPT розглядаються окремо. Якщо бал уже було використано проти вас, є практичні матеріали про те, що робити, коли вас звинувачують у використанні AI, про докази, які ви можете зібрати, щоб довести, що ви не використовували AI, і про написання апеляційного листа, який відповідає на бал на його власних умовах.

Число в будь-якому звіті й надалі змінюватиметься, оскільки постачальники перенавчають свої моделі, а дослідники продовжують перевіряти їх на складніших випадках. Але те, що не повинно змінюватися, це звичка, яка стоїть за цим: читати бал як один із кількох вимірів, з'ясовувати, на якій вибірці його було валідовано, і з'ясовувати, про що постачальник не говорить щодо випадків, у яких він досі помиляється.

XLinkedInFacebook

Часті запитання

Так. Weber-Wulff та колеги у порівнянні 2023 року дійшли висновку, що інструменти виявлення AI є «ні точними, ні надійними», а для авторів, які не є носіями англійської, ризик є найвищим, причому одне дослідження виявило середній рівень хибних спрацьовувань понад 60 відсотків на есе TOEFL. Один бал сам по собі не є доказом чогось, тому він ніколи не має бути єдиною підставою для звинувачення.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсі AI-гуманізації

Отримуйте поради щодо академічного письма, виявлення AI та гуманізації прямо на вашу пошту.

Жодного спаму. Відписатися можна будь-коли.