Як працює GPTZero
GPTZero зробив perplexity і burstiness відомими, а потім непомітно відмовився від обох. Ось що його класифікатор вимірює тепер, що насправді показує звіт і де інструмент сам вказує на свої межі.
Введіть "how gptzero works" у рядок пошуку, і більшість результатів, які ви отримаєте, досі описують perplexity та burstiness, дві статистики, які його власний засновник зробив відомими в перші тижні після виходу ChatGPT. Це опис був точним у січні 2023 року. Від осені того ж року він уже не був точним, коли, за документацією GPTZero, компанія замінила цей метод чимось зовсім іншим. Розрив між тим, що інструмент робив під час запуску, і тим, що він робить тепер, достатньо великий, щоб більшість пояснень, які досі поширюються, описували продукт, якого вже не існує.
Сьогодні GPTZero застосовує класифікатор на рівні речення до великого змішаного корпусу текстів, створених людиною та AI, а не обчислення perplexity. Сучасний GPTZero все ще надає одне підсумкове число, але арифметика інша. Підсвічування на рівні речень під цим підсумковим числом також має інше значення, ніж у 2023 році. Обидві версії цієї історії варто знати, ту, що зробила ці терміни відомими, і ту, що фактично працює сьогодні.
Історія: як perplexity та burstiness зробили GPTZero відомим
2 січня 2023 року тодішній студент Принстона Edward Tian оприлюднив публічну демонстрацію GPTZero, лише через кілька тижнів після виходу ChatGPT. Його початкова пояснювальна сторінка описує, як він використав дві статистики, запозичені з мовного моделювання, щоб виявляти, коли мовна модель щось написала. Perplexity, це показник того, наскільки еталонна модель була здивована вибором слів у тексті. Burstiness, це назва GPTZero для того, наскільки сильно це здивування змінювалося в межах документа. Саме ці пояснювальні сторінки є причиною того, що обидва слова взагалі увійшли до повсякденної розмови про AI writing. Більшість людей, які сьогодні можуть визначити perplexity або burstiness, дізналися ці терміни від GPTZero, а не з підручника.
Сам механізм було нескладно описати. Пропустіть уривок через еталонну мовну модель, і проза, яку модель вважає дуже передбачуваною, з низькою perplexity, сприймається як типова для машини, оскільки генерація зазвичай надає перевагу ймовірнішому наступному слову, а не несподіваному. Власна застаріла документація GPTZero навіть оприлюднила практичне правило: показник perplexity вище 85 сприймався як такий, що з більшою ймовірністю є людським, а не машинним. Цей поріг походив від одного постачальника, для однієї моделі, в один момент часу, і сам GPTZero більше його не підтримує.
Як GPTZero працює зараз: класифікатор на рівні речення
Центр підтримки GPTZero прямо зазначає, що компанія припинила використовувати perplexity і burstiness для виявлення станом на осінь 2023 року, після переходу на архітектуру глибокого навчання. Її поточна сторінка про технологію, перевірена для цього матеріалу, підтверджує, що перехід є повним: там описано наскрізний підхід глибокого навчання, навчений на текстах з вебу, освіти та широкого спектра мовних моделей, який працює як модель класифікації речення за реченням і видає ймовірність та показник упевненості. Perplexity і burstiness на цій сторінці ніде не згадуються.
Відтоді він також додав рівень захисту, Paraphraser Shield, створений для виявлення AI-тексту, який було пропущено через інструмент перефразування, щоб обійти виявлення. Ви можете вставити текст, завантажити документи Word, PDF та файли зображень, а також до п'ятдесяти файлів одночасно. Уся ця інфраструктура не має нічого спільного з підрахунком того, як часто еталонна модель вгадала б те саме слово.
Гуманізуйте свою власну статтю
Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.
Що насправді показує звіт GPTZero
Результат GPTZero містить три частини: класифікацію як AI, людський або змішаний текст, відсоток, що виражає ймовірність моделі того, що документ було написано AI, і позначку впевненості, яка описує, наскільки надійним є саме це передбачення. Позначка має більше значення, ніж може здатися. GPTZero пов'язує "highly confident" з рівнем помилки нижче 2 percent і "low confidence" з рівнем помилки 14 percent або вище, тобто з таким широким діапазоном, що той самий відсоток у заголовку може мати зовсім різну вагу в різних звітах.
Платні скани додають підсвічування на рівні речень, і його слід читати правильно. GPTZero описує підсвічені речення як ті, що непропорційно впливають на загальний бал, а не як перелік звинувачень проти окремих рядків. Речення може не бути підсвіченим і все одно сформувати результат, оскільки класифікатор читає документ як ціле, а не голосує речення за реченням.
| Report element | Що це вам повідомляє |
|---|---|
| Classification | Один ярлик: AI, human, або mixed |
| AI probability score | Відсоток, що відображає, наскільки ймовірно, на думку моделі, документ написано AI |
| Confidence label | Діапазон від високої впевненості, за якої похибка становить менше 2 percent, до низької впевненості, 14 percent або вище |
| Sentence highlighting | Позначає речення, що найбільше сприяють балу в Advanced Scan, а не кожне речення, пов'язане з ним |
Жоден із цих елементів звіту не існував у своїй нинішній формі, коли пояснення perplexity-and-burstiness ще було публічним описом GPTZero про себе. Інтерфейс змінився разом із методом.
Чому опис Perplexity and Burstiness досі поширюється
Початкове пояснення GPTZero досі доступне онлайн, досі індексується і досі є одним із чіткіших загальних описів того, як perplexity і burstiness працюють як концепти. Пошукові системи та інші сайти продовжують на нього посилатися, а деякі вказують на широко поширений огляд 2026 року, який стверджує, що інструмент і досі непомітно працює з шаром perplexity and burstiness поряд зі своїм класифікатором. Власні поточні сторінки GPTZero, сторінка технології та обидві статті підтримки, стверджують протилежне: ці терміни було вилучено, а не просто приховано за лаштунками. Сторінка, що описує концепт в абстрактному вигляді, не є тим самим, що сторінка, яка описує сучасний метод цього інструменту, і саме ототожнення цих двох речей є головною причиною того, що плутанина триває вже три роки після закінчення строку її актуальності.
Це має значення не лише як дрібниця. Студенту або колезі, якому кажуть знизити perplexity або розподілити довжину речень саме для того, щоб обійти GPTZero, дають пораду, спрямовану на версію продукту, яка перестала працювати у 2023 році. Те, що рухає класифікатор речень, є пов’язаним, але іншим питанням, ближчим до ширшого опису того, як AI detectors насправді працюють, ніж до будь-якої з цих статистик окремо. GPTZero не припинив вимірювати їх, за власним твердженням, вони входять до семи показників, що живлять поточну модель, але вони перестали бути тим, що вирішує відповідь.
Що GPTZero стверджує, що не може робити
Заявлені показники точності GPTZero є настільки сильними, наскільки постачальник, імовірно, опублікує щодо власного продукту: 96.5 percent точності на змішаних документах, загальний рівень хибнопозитивних спрацьовувань, який компанія обмежує 1 percent, і 1.1 percent саме для есе TOEFL, поширеного замінника для письма англійською мовою не для носіїв мови. Ці числа походять із власної оцінки GPTZero, без посилання на незалежне відтворення на сторінці, де їх наведено.
Власна сторінка обмежень GPTZero є конкретнішою, ніж маркетингові цифри. Компанія стверджує, що точність поліпшується, коли подається більше тексту, і знижується на рівні речення та абзацу порівняно з повним документом. Вона стверджує, що її навчальні дані переважно складаються з дорослої англомовної прози, тому текст, який відхиляється від цього зразка, важче надійно класифікувати. Вона стверджує, що класифікатор не навчено виявляти AI text, який було суттєво змінено після генерації. І вона прямо стверджує, що інший машинно згенерований або дуже процедурний текст, а не лише вихід чатбота, може бути позначений так само.
Усе це не є підставою вважати число GPTZero беззаперечним, і це не єдиний детектор, який варто розуміти на власних умовах. Читачі, яким цікаво, на що насправді реагує такий класифікатор, можуть побачити варіант цього шаблону самі за допомогою безплатного перевірника перплексії або безплатного перевірника burstiness, двох елементів повнішої колекції безплатних інструментів, що охоплює інші статистичні шари, на які спирається такий звіт.
Дві головні статистики GPTZero мають власні сторінки: що вимірює перплексія в AI detection, і арифметика ймовірності токенів, яка дає обидва числа.
Інструмент, який готовий так точно назвати власні сліпі зони, заслуговує на більшу довіру, ніж той, що не визнає жодних, а наступний незрозумілий відсоток у звіті є добрим місцем, щоб почати з'ясовувати, який саме тип інструменту його породив.
Часті запитання
Ні. Центр підтримки GPTZero зазначає, що компанія припинила використовувати perplexity і burstiness для виявлення станом на осінь 2023 року, після переходу на класифікатор глибокого навчання. Його поточна сторінка про технологію описує модель класифікації речення за реченням і не згадує жоден із цих термінів. Опис і далі поширюється, тому що власний пояснювальний матеріал GPTZero 2023 року популяризував обидва слова ще до зміни методу.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.