AI Detection

Як працюють AI detectors? Perplexity, burstiness і ймовірність токенів

AI detectors не розпізнають машинне письмо так, як це робить читач. Вони вимірюють, наскільки передбачуваним є ваш текст, а потім перетворюють це на оцінку. Коли це стає зрозумілим, і технологія, і її обмеження виглядають значно ясніше.

7 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

Ваш університет почав пропускати подання через AI detector, і було отримано звіт із числом, якого ви не очікували. Перш ніж намагатися оскаржити його, корисно зрозуміти, що означає це число. Як працюють AI detectors? Вони не читають машинний текст так, як це робить людина. Вони вимірюють, наскільки передбачуваним є ваш текст для мовної моделі, а потім перетворюють цю передбачуваність на оцінку. У цьому процесі нічого не враховує, що ви маєте на увазі, який у вас аргумент, або чи справді ви написали цей текст.

Я роками створював інструменти, які статистично розбирають текст, і найкорисніше, що слід зрозуміти про виявлення, це таке: це вимір типовості, а не походження. Коли це усвідомлюєш, і технологія, і її збої стають значно зрозумілішими.

Що насправді вимірює детектор

Детектор не знає, хто що написав. У нього є мовна модель і функція оцінювання. Модель читає ваш текст зліва направо, і в кожній точці вона створює розподіл імовірностей того, яке слово має йти далі. Якщо дати їй слова "the results of the", вона поставить "study" найвище, "experiment" трохи нижче, а "marmalade" десь близько до нуля.

Отже, детектор ставить до вашого документа одне запитання: як часто цей текст обирав слово, якого очікувала модель? Письмо, яке постійно потрапляє в слова з високою ймовірністю, виглядає створеним машиною, тому що саме так працює генератор тексту. Модель знову і знову відбирає з верхньої частини власного розподілу протягом тисяч токенів.

Саме тому вся ця категорія стоїть на менш надійній основі, ніж це подає маркетинг. Детектор не знаходить водяний знак або відбиток пальця. Він лише помічає, що ваша проза статистично не є несподіваною, а для такої прози існує багато причин, окрім chatbot.

Perplexity: наскільки модель здивована

Основний показник називається perplexity, і він простіший, ніж звучить. Візьміть імовірність, яку модель призначила кожному слову, що фактично з’явилося, усередніть логарифми цих імовірностей і піднесіть результат до експоненти. Те, що вийде, це одне число, яке описує, наскільки модель здивував ваш документ. Ви можете перевірити perplexity власного чернеткового тексту, а не здогадуватися про нього.

Низький perplexity означає, що текст рухався туди, куди модель очікувала. Високий perplexity означає, що він постійно робив повороти, яких модель не очікувала. Людське письмо зазвичай розташовується вище, бо люди тягнуться до дивного конкретного іменника, незвичної конструкції, речення, що починається з неочікуваного місця. Згенерований текст зазвичай розташовується нижче, бо процес декодування побудований так, щоб уникати саме таких ходів.

Порівняйте два способи почати розділ методів. "The results of the study were statistically significant" це послідовність, яку майже будь-яка модель передбачила б із високою впевненістю, бо вона не несе неочікуваної інформації. "Two of the three cohorts drifted before week six, which we had not planned for" значно менш передбачуване, бо воно несе конкретну, незграбну інформацію, яку не можна було б вгадати з решти статті. Друге речення коштує детектору справжнього здивування, і саме це здивування реєструється як людське.

Burstiness: дисперсія, а не середнє

Perplexity саме по собі недостатнє, бо документ може в середньому давати цілком прийнятне число, залишаючись підозріло однорідним усередині. Важлива варіація у вашому тексті, і саме її вимірює burstiness: наскільки змінюються довжина речень і perplexity на рівні речення, коли письмо рухається далі. burstiness checker покаже вам цей розкид безпосередньо.

Ми пришвидшуємося, коли впевнені, і сповільнюємося, коли обережничаємо, і цей ритм переходить у прозу. Люди пишуть ривками. Абзац може починатися коротким розповідним реченням із восьми слів, переходити в речення на тридцять чотири слова, яке містить три підрядні частини і вставну конструкцію, а потім знову спадати до чогось короткого.

Вихід моделі не робить цього надійно. Речення збираються біля середньої довжини. Абзаци постають у впорядкованих групах. Кожен розділ починається з повторення власного заголовка. Це читається плавно і отримує низькі оцінки, тому що низька варіативність між реченнями є одним із найсильніших сигналів, які має детектор. Видає його не якесь одне речення. Видає його однорідність.

СигналЩо він вимірюєЧому машинний текст отримує низький бал
PerplexityНаскільки модель здивована вашим вибором слів, у середньому по всьому документуПід час декодування за задумом відбираються токени з високою ймовірністю
BurstinessНаскільки змінюються довжина речень і передбачуваність у межах текстуВихід збирається біля середнього значення, а не коливається
Token probabilityЙмовірність для кожного слова, з якої обчислюються два інші показникиТривалі послідовності окремо нічим не примітних виборів

Ймовірність токена і звідки береться бал

Обидва ці числа будуються на основі третього, а саме логарифмічної правдоподібності для кожного токена, тобто сирого матеріалу, з якого обчислюється все інше. Деякі інструменти показують її безпосередньо, виділяючи фрагменти, де ваш текст був найбільш передбачуваним. Ці виділення не є звинуваченнями щодо окремих речень, як би це не натякав інтерфейс. Це ті частини, які найбільше сприяли формуванню числа на рівні документа.

Дослідницькі підходи вийшли за межі простих порогів. DetectGPT та його наступники аналізують кривизну: вони трохи збурюють ваш текст і перевіряють, чи падає правдоподібність за тим самим зразком, який зазвичай демонструє згенерований текст. Інші порівнюють той самий уривок у двох різних моделях і використовують розбіжність як сигнал.

Один наслідок має значення для кожного, кого оцінюють. Оскільки метрики обчислюються щодо певної референтної моделі, бал завжди є відносним до цієї моделі. Два детектори можуть прочитати той самий абзац і повністю не погодитися між собою, і жоден з них не працює неправильно. Вони відповідають на те саме запитання, але з різними точками відліку.

Другий наслідок згадують рідше. Модель може визнати уривок передбачуваним лише тоді, коли цей уривок подібний до того, на чому її навчали, тож якість виявлення погіршується, коли розрив між еталонною моделлю і тим, що саме згенерувало текст, збільшується. Новіші генератори, незвичні дисципліни та мови, відмінні від англійської, усі розширюють цей розрив. Саме тому точність, виміряна в контрольованому бенчмарку, рідко витримує зіткнення з реальною купою подань.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Що комерційні детектори додають зверху

Інструменти, які установи насправді купують, не запускають підручникову perplexity. Turnitin, GPTZero, Originality та інші навчають класифікатори з наглядом на великих розмічених наборах людського і машинного тексту, використовуючи статистичні ознаки поряд зі стилістичними. Те, чого навчається класифікатор, це все, що розрізняє ці два масиви в його навчальних даних, а це вже вужча і більш історично зумовлена річ, ніж "AI writing" загалом.

Залежність від навчання є тихою проблемою. Класифікатор, навчений переважно на одному поколінні вихідних даних моделі, має узагальнювати на новіші моделі, на незнайомі дисципліни та на авторів, чия англійська не нагадує його навчальний розподіл. Постачальники публікують показники точності зі своїх власних оцінювань, і незалежні бенчмарки регулярно дають значно нижчі значення для тих самих інструментів.

Як читати оцінку, не перечитуючи її надмірно

Звіт детектора зазвичай надходить у вигляді відсотка, і цей відсоток регулярно тлумачать неправильно. Це не частка вашого документа, написана машиною. Залежно від інструмента, це або впевненість класифікатора, або частка речень, що перевищили певний внутрішній поріг, і постачальники часто нечітко пояснюють, який саме. Два звіти, які обидва показують шістдесят відсотків, можуть означати зовсім різні речі.

Також варто знати, що саме змінює оцінку з причин, які не мають нічого спільного з тим, хто це написав. Короткі документи є більш шумними, тому що для стабілізації середніх значень у них менше тексту, і есе на п'ятсот слів може сильно змінюватися під впливом двох чи трьох незвичних речень. Цитований матеріал також враховується, якщо тільки інструмент не вилучає його, тож огляд літератури, насичений блоковими цитатами, успадковує передбачуваність усього, що він цитує. Технічний уривок, перевантажений стандартною термінологією, поводиться так само.

Якщо ви отримали позначку, корисною відповіддю є докази, а не суперечка щодо метрики. Історія версій, чернетки, нотатки та записи пошуку все свідчать про процес, а саме процес є тим, що комісія з академічної недоброчесності може реально оцінити. Не існує жодного порога, на який хтось міг би вказати, щоб відокремити уважного автора від моделі.

Чому детектори позначають тексти, які не створила жодна модель

Хибнопозитивні результати не є рідкісною несправністю. Вони безпосередньо випливають із вимірювання типовості. Будь-який текст, який є справді передбачуваним, отримає оцінку як передбачуваний, незалежно від того, хто його створив.

Найбільше це впливає на авторів, для яких англійська не є рідною. Дослідники Stanford виявили, що детектори помилково класифікували значну частку есе, написаних неносіями мови, як згенеровані машиною, тоді як есе носіїв мови класифікували правильно. Причина є механічною, а не зловмисною: автори, які працюють другою мовою, зазвичай покладаються на усталені конструкції та більш поширену лексику. Саме це і є профілем низької perplexity, тому ESL writers get flagged for writing carefully.

Академічні конвенції спричиняють ту саму проблему. Розділ методів має бути формульним. Юридичне письмо, технічна документація та клінічна звітність усі винагороджують стандартне формулювання, а не винахідливе. Інтенсивне редагування ще більше посилює це, оскільки шліфування чернетки зазвичай означає усунення нерегулярностей, які несли ваш статистичний підпис.

Установи це помітили. Vanderbilt вимкнув функцію виявлення ШІ в Turnitin, а не поклався на оцінки, які не міг перевірити, а інші університети обмежили те, як ці числа можна використовувати в провадженнях щодо академічної недоброчесності. Ставтеся до оцінки детектора як до одного слабкого доказу, а не як до вердикту.

Що це означає для вашого власного письма

Практична порада, що випливає з механіки, не є екзотичною, і жодна з неї не передбачає жодних маніпуляцій. Навмисно варіюйте довжину речень, тому що саме однорідність привертає увагу. Зберігайте конкретну деталь, фактичну цифру, реальне обмеження, те, що пішло не так на шостому тижні. Загальна компетентність саме й дає оцінку як машинно створеному тексту, а конкретність є і кращим письмом, і сильнішим сигналом.

Зберігайте також власний ідіолект. Якщо у вас є свій спосіб висловлюватися, залишайте його. Прагнення шліфувати чернетку, доки вона не звучить як будь-яка інша робота в цій галузі, є саме тим прагненням, яке знижує вашу perplexity.

Ще одна річ, якої слід уникати: деякі інструменти навмисно вводять граматичні помилки, щоб підвищити perplexity. На метриці це працює, але для будь-чого, що оцінюють або рецензують, це дуже погана ідея, оскільки ви обмінюєте підозру на певність. Мета полягає в тому, щоб текст читався як ваш, а не в тому, щоб навмисно пошкодити його. У цьому й полягає вся різниця між переписуванням для людського читача і псуванням тексту, щоб обдурити оцінювач.

Якщо ви хочете побачити ці числа для власної чернетки, а не просто покладатися на слова чорної скриньки, базові вимірювання не є таємницею. Безкоштовні інструменти аналізу тексту покажуть вам, де саме перебуває ваша проза, і ви самі зможете вирішити, чи є рівні фрагменти стилістичною проблемою, яку варто виправити.

Frequently Asked Questions

Так, і цілком передбачувано. Детектори вимірюють, наскільки статистично передбачуваним є текст, а не те, хто його написав, тому будь-яке справді формульне письмо отримує оцінку як машинно створене. Незалежні бенчмарки послідовно повідомляють про точність нижчу за заяви постачальників, а кілька університетів обмежили те, як можна використовувати ці оцінки.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.