AI Detection

Чи досі AI-детектори покладаються на перплексію та burstiness?

GPTZero зробив перплексію та burstiness відомими, а потім непомітно відмовився від обох восени 2023 року на користь класифікатора глибокого навчання. Цей допис простежує, що змінилося, що саме сьогодні документують GPTZero і Turnitin, і чому ці дві статистики досі пояснюють, чому машинний текст можна виявити, хоча жоден із цих постачальників уже не обчислює їх безпосередньо.

Оновлено 5 min
Is burstiness still used by AI detectors? GPTZero's 2023 shift from a statistical formula to a trained classifier.

Пошук того, як GPTZero сьогодні виявляє текст, згенерований ШІ, і досі здебільшого зводиться до двох статистик, perplexity і burstiness, пари, яка зробила цей інструмент відомим за кілька тижнів після його запуску в січні 2023 року. Власна довідкова документація GPTZero тепер каже інше: восени того самого року він перестав використовувати обидві.

Отже, чи досі burstiness використовується детекторами ШІ? Не тим інструментом, який зробив цей термін загальновідомим в академічних колах. Центр підтримки GPTZero прямо зазначає, що він більше не використовує perplexity або burstiness, а натомість перейшов на архітектуру глибокого навчання. Turnitin, інструмент, з яким насправді стикається більшість студентів, від самого початку ніколи не публікував жоден із цих термінів як частину свого методу. Ці поняття не зникли з обговорення. Вони зникли з продуктів, які фактично виконують виявлення.

Чи досі burstiness використовується детекторами ШІ?

Ні, не GPTZero, і не за назвою. Власна довідкова документація GPTZero прямо це стверджує: "As of autumn 2023, GPTZero no longer uses perplexity and burstiness for its AI detection because we migrated to a deep-learning based architecture." Власні посібники Turnitin описують знову інший метод, побудований навколо оцінювання фрагментів подання за допомогою навченого класифікатора, і жоден із цих термінів також ніде не з'являється в цій документації. Дві статистики, які визначили першу хвилю виявлення ШІ, не є тим, що нині використовують провідні інструменти. Це вужче, ніж сказати, що їх відкинули: власне пояснення GPTZero все ще зараховує їх до семи індикаторів, які живлять його модель. Вони перестали бути методом, не переставши бути вимірюванням, і різниця між цими двома твердженнями значною мірою і становить суть цього питання.

Що змінилося восени 2023 року

Обидва терміни ніколи не були неясними. Власне раннє пояснення GPTZero визначало perplexity як "міру того, наскільки ймовірно модель AI обрала б точно той самий набір слів, що й у документі", а burstiness як "міру того, наскільки змінюються патерни письма і текстові perplexities в усьому документі", тобто статистику на рівні документа, а не простий підрахунок довжини речень. Обидва визначення досі опубліковані на сайті GPTZero. Змінилося те, який із них фактично запускає детектор.

"Migrated to a deep-learning based architecture" є конкретним твердженням, а не маркетинговою фразою, і воно описує реальну зміну типу. Оцінка perplexity обчислюється безпосередньо за формулою: текст пропускають через еталонну мовну модель, усереднюють логарифмічні ймовірності, підносять результат до експоненти. Натомість deep-learning classifier навчають, показуючи йому великі масиви прикладів, написаних людьми та AI, доки він сам не навчиться будь-якій комбінації ознак, що розрізняє ці дві групи в навчальних даних. У другому підході ніхто не виписує правило вручну. Модель знаходить його.

Обидва вилучені терміни мають повне пояснення в іншому місці на цьому сайті: що саме вимірює perplexity і що саме вимірює burstiness окремо докладно розглядають власну механіку, включно з формулами, на яких вони ґрунтуються. Цей матеріал зосереджується лише на тому, чи є будь-який із них тим, що детектор запускає сьогодні.

Що GPTZero і Turnitin фактично документують сьогодні

поточна сторінка технології GPTZero, яка описує те, що постачається в продукті, стверджує, що компанія використовує "an end-to-end deep learning approach, trained on text datasets from the web, education, and AI-generated from a range of LLMs", у межах якого "a sentence-by-sentence classification model determines the probability and confidence that a text was created by AI". Perplexity і burstiness не згадуються на цій сторінці ні як компонент, ні як застаріла функція, ні в примітці.

Документація Turnitin від самого початку не будувалася навколо жодного з цих термінів. У її посібниках описано подання, розділене на фрагменти по кілька сотень слів, кожен фрагмент оцінюється навченою моделлю, а оцінки фрагментів усереднюються в єдиний відсоток, який відображає звіт. Це класифікатор із навчанням під наглядом, що працює з сегментами тексту, той самий клас методу, до якого перейшов GPTZero, а не обчислення perplexity і не обчислення burstiness під іншою назвою.

Зсув найлегше побачити поруч.

Що описували ранні пояснення (2023)Що описує поточна документація
GPTZeroPerplexity і burstiness, оцінені щодо еталонної моделіКласифікатор на основі глибокого навчання, що працює речення за реченням і виводить імовірність та показник упевненості
TurnitinНіколи не публікувалося, ці терміни не з'являються в матеріалах Turnitin у жодному місціФрагменти по кілька сотень слів, які оцінює навчений класифікатор, після чого результати усереднюються в один відсоток

Гуманізуйте свою власну статтю

Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.

Почати безкоштовно

Чому ці поняття все ще пояснюють виявлюваність

Усе це не робить perplexity і burstiness хибними, лише застарілими як опис поточного механізму. Обидва поняття завжди описували реальне явище: текст, згенерований шляхом вибірки в бік найімовірніших продовжень самої моделі, зазвичай є більш передбачуваним, слово за словом, ніж текст, який людина пише з нуля, і зазвичай менше варіюється від одного речення до наступного. Базова закономірність не змінилася лише тому, що постачальник змінив архітектуру свого детектора. Змінилося те, як детектор шукає цю закономірність.

Навчений класифікатор не просять прямо шукати perplexity або burstiness. Натомість його навчають на тій самій базовій відмінності між людським і машинним текстом, яку ці два статистичні показники були покликані виявляти. І видається вкрай малоймовірним, що класифікатор, навчений розрізняти ці дві групи, не спирався б також саме на цю регулярність, одну з найнадійніших відмінностей між ними. Це висновок про те, чому класифікатор, імовірно, працює, а не твердження про його опублікований перелік ознак, і ці два питання слід розрізняти.

Незалежні дослідження підтверджують думку, що базовий статистичний показник і далі має значення, навіть поза межами продукту будь-якого окремого постачальника. DetectGPT, академічний zero-shot метод, опублікований у 2023 році, розглядає близького родича perplexity, тобто те, наскільки різко функція log-probability моделі викривляється навколо уривка, і досягає 0.95 AUROC на одному benchmark проти 0.81 для найкращої попередньої zero-shot baseline, взагалі не навчаючи класифікатор на позначених прикладах. Основна ідея, що текст, згенерований машиною, перебуває в статистично відмінній області власного простору ймовірностей моделі, і далі є активним напрямом досліджень. Просто саме цього GPTZero не постачає користувачам.

Чому так багато в Інтернеті досі неправильно це розуміє

Більшість опублікованих пояснень того, як працює виявлення AI, були написані під час запуску GPTZero у січні 2023 року або невдовзі після нього, коли perplexity і burstiness були єдиною публічною рамкою, яку сама компанія пропонувала. Ті початкові сторінки з поясненнями й досі доступні. Повідомлення про припинення використання восени 2023 року розміщене на окремій сторінці підтримки, а не включене до них, тож автор, який прочитав першу сторінку і припинив дослідження, не мав би підстав знати, що метод змінився менш ніж за рік.

Огляд стороннього детектора, що поширюється у 2026 році, стверджує, що GPTZero досі використовує perplexity і burstiness як один шар серед кількох у межах ширшої системи. Це твердження прямо суперечить власній поточній сторінці технології GPTZero та його власній документації підтримки, і ніщо на власному сайті GPTZero не підтверджує його. Компанія, яка описує власний випущений продукт, усе ще має більшу вагу, ніж непідтверджене твердження стороннього джерела про той самий продукт, хоча документація постачальника теж може бути хибною. Цей матеріал спирається на власні сторінки GPTZero, а не на огляд, що повторює старішу версію історії.

Що це означає для того, як ви пишете

Практична порада, побудована навколо burstiness, не стала марною лише тому, що це слово зникло з власних матеріалів GPTZero. Свідоме варіювання довжини речень, як і раніше, механічно є аргументом проти тієї самої статистичної однорідності, яку класифікатор, дуже ймовірно, навчено помічати, як би він не називав цей сигнал усередині. Базова порада пережила зміну архітектури постачальника, хоча словник, яким її описують, і ні.

Усе це не вимагає вірити комусь на слово, зокрема й цьому допису. Безплатний перевірник perplexity від TextPulse і ширша колекція безплатних інструментів дають змогу подивитися, де перебуває ваш власний чернетковий текст, ще до того, як це зробить детектор, будь-якого покоління.

Якщо відповідь повертає вас до власного тексту, практичні подальші кроки, це свідоме збільшення burstiness і варіювання довжини речень у межах академічного абзацу, що є тією самою задачею, описаною без метрики.

Механізм, який запускає детектор, і надалі змінюватиметься, GPTZero вже змінював його один раз. Незмінним лишається фактичне питання, повністю розглянуте в поясненні цього сайту про те, як насправді працюють детектори AI: чи є передбачуване письмо тим самим, що й письмо, створене машиною, незалежно від того, яка формула виявляється модною в певному році.

XLinkedInFacebook

Часті запитання

Чи досі burstiness використовують AI-детектори? Не GPTZero, і не під цією назвою. Власна документація служби підтримки GPTZero прямо стверджує, що вона припинила використовувати перплексію разом із burstiness для виявлення з осені 2023 року, після переходу на архітектуру на основі глибокого навчання. Turnitin ніколи не публікував жоден із цих термінів як частину свого методу, і обидві компанії тепер описують натреновані класифікатори.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсі AI-гуманізації

Отримуйте поради щодо академічного письма, виявлення AI та гуманізації прямо на вашу пошту.

Жодного спаму. Відписатися можна будь-коли.