Как работает GPTZero
GPTZero сделал perplexity и burstiness известными, а затем тихо отказался от обоих. Здесь объясняется, что его классификатор измеряет сейчас, что на самом деле показывает отчет и где сам инструмент указывает свои ограничения.
Введите "how gptzero works" в поисковую строку, и большая часть результатов по-прежнему описывает perplexity и burstiness, две статистики, которые сделал известными сам основатель в первые недели после выхода ChatGPT. Это описание было точным в январе 2023 года. С осени того же года оно больше не является точным, поскольку, как говорится в собственной документации GPTZero, компания заменила этот метод чем-то совершенно иным. Разрыв между тем, что инструмент делал при запуске, и тем, что он делает сейчас, достаточно велик, чтобы большинство объяснений, которые до сих пор циркулируют, описывали продукт, которого больше не существует.
Сегодня GPTZero применяет классификатор на уровне предложений к большому смешанному корпусу текстов, созданных людьми и AI, а не вычисление perplexity. Современный GPTZero по-прежнему выдает одно итоговое число, но арифметика иная. Подсветка на уровне предложений под этим итоговым числом также имеет иное значение, чем в 2023 году. Обе версии этой истории полезно знать, ту, которая сделала эти термины известными, и ту, которая действительно работает сегодня.
История: как perplexity и burstiness сделали GPTZero известным
2 января 2023 года тогдашний студент Принстона Эдвард Тянь выпустил публичную демонстрацию GPTZero, всего через несколько недель после выхода ChatGPT. На его исходной странице с объяснением описывается, как он использовал две статистики, заимствованные из языкового моделирования, чтобы определить, когда языковая модель что-то написала. Perplexity, это показатель того, насколько эталонная модель была удивлена выбором слов в тексте. Burstiness, это название GPTZero для того, насколько сильно это удивление колебалось по ходу документа. Именно эти страницы с объяснением и стали причиной того, что оба слова вообще вошли в повседневный разговор об AI-письме. Большинство людей, которые сегодня могут определить perplexity или burstiness, узнали эти термины от GPTZero, а не из учебника.
Сам механизм было несложно описать. Пропустите отрывок через эталонную языковую модель, и проза, которую модель считает весьма предсказуемой, с низкой perplexity, воспринимается как типичная для машины, поскольку генерация обычно отдаёт предпочтение наиболее вероятному следующему слову, а не неожиданному. В собственной, уже снятой с публикации документации GPTZero даже приводилось практическое правило: показатель perplexity выше 85 считался более вероятным для человека, чем для машины. Этот порог был взят у одного поставщика, для одной модели, в один конкретный момент времени, и сама GPTZero больше его не поддерживает.
Как GPTZero работает сейчас: классификатор на уровне предложения
Центр поддержки GPTZero прямо указывает, что компания перестала использовать perplexity и burstiness для обнаружения начиная с осени 2023 года, после перехода на архитектуру глубокого обучения. На текущей странице о технологии, проверенной для этого материала, переход подтверждается полностью: там описан сквозной подход глубокого обучения, обученный на текстах из веба, образования и ряда языковых моделей, который использует модель классификации по предложениям и выдаёт вероятность и показатель уверенности. Perplexity и burstiness на этой странице не упоминаются нигде.
С тех пор компания также добавила слой защиты, Paraphraser Shield, предназначенный для выявления AI-текста, который был пропущен через инструмент перефразирования, чтобы обойти обнаружение. Можно вставить текст, загрузить документы Word, PDF и файлы изображений, а также до пятидесяти файлов одновременно. Всё это инфраструктурное решение не имеет никакого отношения к подсчёту того, как часто эталонная модель угадала бы то же самое слово.
Очеловечить свою работу
Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.
Что на самом деле показывает отчёт GPTZero
Результат GPTZero включает три части: классификацию как AI, человек или смешанный текст, процент, выражающий вероятность модели того, что документ был написан AI, и метку уверенности, описывающую, насколько надёжно данное конкретное предсказание. Эта метка важнее, чем может показаться. GPTZero связывает "highly confident" с уровнем ошибки ниже 2 percent, а "low confidence" с уровнем ошибки 14 percent или выше, и этот диапазон достаточно широк, чтобы один и тот же процент в заголовке мог иметь совершенно разный вес от одного отчёта к другому.
Платные сканы добавляют подсветку на уровне предложений, и её следует читать правильно. GPTZero описывает подсвеченные предложения как те, которые непропорционально влияют на общий балл, а не как список обвинений против отдельных строк. Предложение может не быть подсвечено и при этом всё равно повлиять на результат, потому что классификатор читает документ как целое, а не голосует по предложениям по отдельности.
| Элемент отчёта | Что он сообщает |
|---|---|
| Классификация | Одна метка: AI, human или mixed |
| Оценка вероятности AI | Процент, отражающий, насколько, по оценке модели, документ был написан AI |
| Метка уверенности | Диапазон от высокой уверенности, при уровне ошибки ниже 2 percent, до низкой уверенности, 14 percent или выше |
| Подсветка предложений | Отмечает предложения, вносящие наибольший вклад в оценку в Advanced Scan, а не каждое предложение, связанное с ней |
Ни один из этих элементов отчёта не существовал в своей нынешней форме, когда объяснение perplexity и burstiness ещё было публичным описанием GPTZero самого себя. Интерфейс изменился вместе с методом.
Почему описание Perplexity и Burstiness по-прежнему циркулирует
Первоначальное объяснение GPTZero по-прежнему находится в сети, по-прежнему индексируется и по-прежнему остаётся одним из более ясных общих описаний того, как perplexity и burstiness работают как концепции. Поисковые системы и другие сайты продолжают на него ссылаться, а некоторые указывают на широко распространявшийся обзор 2026 года, в котором утверждается, что инструмент по-прежнему незаметно использует слой perplexity и burstiness наряду со своим классификатором. Собственные текущие страницы GPTZero, страница технологии и обе статьи поддержки, говорят об обратном: эти термины были сняты с использования, а не просто скрыты за кулисами. Страница, описывающая концепцию в абстрактном виде, не то же самое, что страница, описывающая нынешний метод этого инструмента, и именно смешение этих двух вещей в значительной степени объясняет, почему путаница сохраняется уже три года после истечения срока её актуальности.
Это важно не только как любопытная деталь. Студенту или коллеге, которому советуют снизить perplexity или распределить длину предложений специально, чтобы обойти GPTZero, дают совет, рассчитанный на версию продукта, которая перестала работать в 2023 году. То, что делает классификатор предложений, связано с этим, но это другой вопрос, ближе к более общему описанию того, как AI detectors на самом деле работают, чем к любой из этих статистик по отдельности. GPTZero не перестал измерять их, по собственному утверждению, они входят в число семи индикаторов, питающих текущую модель, но они перестали быть тем, что определяет ответ.
Что GPTZero утверждает, что он не может делать
Заявленные GPTZero показатели точности примерно настолько высоки, насколько поставщик обычно готов публиковать о собственном продукте: 96.5 percent точности на смешанных документах, общий уровень ложноположительных срабатываний, который компания ограничивает 1 percent, и 1.1 percent specifically на эссе TOEFL, распространённом заменителе текстов на английском языке, написанных не носителями. Эти цифры взяты из собственной оценки GPTZero, при этом на странице, где они приведены, не указана независимая репликация.
Собственная страница GPTZero с ограничениями более конкретна, чем маркетинговые цифры. Компания заявляет, что точность повышается по мере увеличения объёма поданного текста и снижается на уровне предложения и абзаца по сравнению с полным документом. Она заявляет, что её обучающие данные в основном состоят из англоязычной прозы взрослых авторов, поэтому текст, который отклоняется от этого шаблона, труднее надёжно классифицировать. Она заявляет, что классификатор не обучен выявлять AI text, который был сильно изменён после генерации. И она прямо заявляет, что другой машинно-сгенерированный или сильно процедурный текст, а не только вывод чатбота, может быть отмечен таким же образом.
Ничто из этого не является основанием считать число GPTZero не подлежащим сомнению, и это не единственный детектор, который стоит понимать на его собственных условиях. Читатели, которым интересно, на что на самом деле реагирует такой классификатор, могут сами увидеть вариант этого паттерна с помощью бесплатного perplexity checker или бесплатного burstiness checker, двух элементов более полного набора бесплатных инструментов, охватывающего другие статистические слои, на которые опирается такой отчет.
У двух основных статистик GPTZero есть собственные страницы: что измеряет perplexity в AI detection и арифметика вероятности токенов, которая порождает оба числа.
Инструмент, готовый столь точно обозначить собственные слепые зоны, заслуживает большего доверия, чем тот, который не признает ни одной, и следующий необъясненный процент в отчете, это хорошее место, чтобы начать спрашивать, какой именно инструмент его породил.
Часто задаваемые вопросы
Нет. Служба поддержки GPTZero указывает, что компания перестала использовать perplexity и burstiness для обнаружения с осени 2023 года, после перехода на классификатор глубокого обучения. На текущей странице о технологии описана модель классификации по предложениям, и ни один из этих терминов там не упоминается. Это описание продолжает циркулировать, потому что собственный разбор GPTZero за 2023 год сделал оба слова популярными до изменения метода.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.