Обзор детектора AI Pangram: инструмент, который исследователи продолжают проверять
Pangram публикует показатель ложных срабатываний примерно 1 из 10,000, и, в отличие от большинства разработчиков детекторов, теперь имеет недавние независимые исследования, указывающие в том же направлении. Рецензируемое исследование 2026 года из Vrije Universiteit Brussel показало, что это был единственный из четырех инструментов, который дал удовлетворительные результаты на работах уровня магистратуры. Вот что измеряли исследования, где доказательная база по-прежнему слаба и что не может доказать ни один результат детектора.
Pangram это AI detector, который независимые исследователи постоянно выделяют, и это делает его достойным более внимательного рассмотрения, чем обычная таблица показателей поставщика. Его разработчик, Pangram Labs, публикует показатель ложноположительных срабатываний примерно 1 на 10,000 и заявленную точность 99.98 percent. Это собственные цифры компании, измеренные на ее собственных бенчмарках. Pangram отличается от большинства участников рынка тем, что, на этот раз, недавние внешние исследования указывают в том же общем направлении.
За последний год появились две независимые оценки: рецензируемое исследование Vrije Universiteit Brussel, опубликованное Springer в June 2026, и рабочий документ Booth School University of Chicago, о котором сообщалось в Chicago Booth Review в December 2025. В обоих Pangram был явно впереди более известных конкурентов, включая Turnitin, GPTZero и Copyleaks. Ни одно из исследований не делает оценку какого-либо detector доказательством чего-либо о конкретном документе, и оба прямо это указывают.
Далее рассматривается, что Pangram заявляет о себе, что именно измеряли два исследования, где доказательная база по-прежнему слаба и что рост этого инструмента говорит об остальной сфере detection.
Что такое Pangram и кто его использует
Pangram Labs это небольшая компания, основанная в 2023 в Brooklyn AI researchers, которые ранее работали в Tesla и Google. Продукт проверяет вставленный или загруженный текст и выдает оценку того, какая его часть сгенерирована AI, с выделением на уровне предложений, а также, в платных планах, с обнаружением изображений и проверкой на плагиат.
Его пользовательская база выглядит иначе, чем у Turnitin. Turnitin продается учреждениям и работает внутри learning management systems, Pangram может использовать любой человек с бесплатной учетной записью, что означает, что студенты, редакторы, сотрудники журналов и специалисты по приему используют его напрямую. Это новичок на этом рынке, и именно к нему все чаще обращаются исследователи академической добросовестности, когда им нужна точка сравнения, именно потому, что в тестах он продолжает показывать результаты, которых не дают действующие лидеры.
Что заявляет поставщик
Главная страница Pangram рекламирует точность 99.98 percent и указывает, что её доля ложноположительных срабатываний, то есть доля, с которой человеческие документы ошибочно помечаются как AI, в настоящее время составляет 1 in 10,000. Публикация в блоге компании о ложноположительных срабатываниях, написанная её CTO, разбивает этот общий показатель по жанрам: 0.004 percent для академических эссе, 0.001 percent для научных аннотаций, а также указывает на слабые места, которые сама компания раскрывает, например 0.05 percent для поэзии и 0.23 percent для рецептов. Компания также утверждает, что её модель по-прежнему обнаруживает AI текст после его обработки так называемыми humanizer tools.
Все эти числа являются самоотчётными данными из собственных тестовых наборов поставщика, и в той же публикации содержатся оговорки самого поставщика: модель лучше всего работает с более длинным текстом, написанным полными предложениями, а компания не рекомендует проверять короткие списки в виде маркеров или сильно формализованный текст. Следует учитывать обе эти стороны. Утверждения необычно конкретны и необычно низки, но это всё ещё лишь утверждения, пока их не проверит кто-то вне компании.

Что показывает независимое доказательство
Самым сильным на сегодняшний день тестом является рецензируемое исследование Van Vlasselaer, Van Droogenbroeck и Spruyt из Vrije Universiteit Brussel, опубликованное в июне 2026 года в International Journal for Educational Integrity. Команда создала 160 академических работ магистерского уровня, каждая объемом не менее 4,000 слов: 40 были написаны реальными студентами до 2019 года, 40 были полностью сгенерированы с помощью GPT-4o Deep Research, 40 были гибридными, и 40 были сгенерированы ИИ, а затем намеренно очеловечены. Все они были пропущены через Turnitin, GPTZero, Copyleaks и Pangram.
В отношении полностью сгенерированных ИИ работ исследование сообщает, что Turnitin, GPTZero и Copyleaks "completely failed to detect the AI-generated content." Turnitin оценил каждую из этих 40 работ в диапазоне от 0 до 20 percent AI; медианные оценки всех трех действующих инструментов были ниже 20 percent для работ, которые на 100 percent были написаны машиной. Pangram достиг строгой точности 65 percent и инклюзивной точности 97.5 percent на том же наборе, ошибочно классифицировав одну работу. На наборе очеловеченных работ Pangram правильно определил ИИ-контент в 37 из 40 случаев, что дало строгую точность 92.5 percent, тогда как GPTZero показал 2.5 percent, Copyleaks 22.5 percent, а Turnitin 50 percent.
| Инструмент | Полностью ИИ работы, строгая точность | Очеловеченные ИИ работы, строгая точность | Человеческие работы, правильно признанные не ИИ |
|---|---|---|---|
| Pangram | 65% | 92.5% | 100% |
| Turnitin | 0% | 50% | 100% |
| GPTZero | 0% | 2.5% | 100% |
| Copyleaks | 0% | 22.5% | 100% |
Второй набор данных представляет собой рабочую статью Брайана Джабаряна и Алекса Имаса из Chicago Booth, кратко изложенную в Chicago Booth Review в декабре 2025 года. Проверяя детекторы примерно на 2,000 фрагментах, написанных человеком, в шести форматах, а также на версиях, созданных ИИ четырьмя передовыми моделями, они обнаружили, что доля ложноположительных срабатываний Pangram была по существу нулевой при большинстве порогов принятия решения, а точность никогда не опускалась ниже 99.8 percent на их корпусе, при этом доля ложноотрицательных результатов составляла от 2 до 4 percent в зависимости от модели. Исследователи предлагают, чтобы учреждения приняли строгий предельный порог политики, например не более 0.5 percent человеческого текста, помеченного как подозрительный, прежде чем доверять любому детектору в операционной практике. Следует отметить различие в статусе, статья Booth является рабочей статьей, она еще не прошла рецензирование, и в ней тестировался немодифицированный текст ИИ, а не гуманизированные академические работы.
Ложноположительные срабатывания и кто от них страдает
Ложноположительные срабатывания, это та область, где ущерб от детекторов концентрируется, и закономерность, зафиксированная в этой отрасли, состоит в том, что пометки непропорционально часто приходятся на авторов, для которых английский не является родным. Исследование VUB стоит прочитать именно по этому вопросу, его 40 человеческих работ были все написаны авторами, для которых английский не является родным, и все четыре инструмента, включая Pangram, пропустили 100 percent из них. Это действительно обнадеживающий результат, и это также 40 работ. Выборка такого размера не может подтвердить показатель вроде 0.004 percent, только собственное гораздо более масштабное внутреннее тестирование вендора дает такие точные числа, и ни одна внешняя сторона не воспроизвела их в таком масштабе.
Раздел исследования, посвященный реальным условиям, показывает, почему осторожность сохраняется даже при хороших бенчмарках. Когда исследователи прогнали Pangram по 1,163 реальным магистерским диссертациям 2024 и 2025 годов, он отметил 45.5 percent из них на некотором уровне, при этом медианная оценочная доля AI среди отмеченных случаев составила 30 percent, и для ни одной из этих диссертаций не существует ground truth. Авторы говорят прямо: оценки обнаружения полезны как первоначальные сигналы и никогда не должны быть единственным доказательством при решениях с высокими ставками. Студенту, которому предъявлено обвинение, по-прежнему нужны процессуально обоснованные способы доказать авторство, каким бы детектором ни было получено это число.
Очеловечить свою работу
Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.
Цены и доступ
Сайт Pangram предлагает 20 бесплатных проверок в день после регистрации учетной записи, а платные подписки увеличивают объем кредитов и добавляют такие функции, как обнаружение плагиата. Эта модель доступа не менее важна, чем показатели точности: в отличие от Turnitin, с которым автор сталкивается только тогда, когда учреждение запускает его против него, Pangram можно проверить напрямую, так что автор может увидеть тот же класс сигнала, который рецензент мог бы увидеть до подачи чего-либо.
Место Pangram в ландшафте детекторов
Краткое изложение поля от авторов VUB предельно ясно: "Из четырех инструментов обнаружения AI, изученных здесь, в данный момент только один показал удовлетворительные результаты." Это предложение говорит не меньше о действующих инструментах, чем о Pangram. Turnitin, инструмент, на который на самом деле полагается большинство учреждений, получил для полностью AI generated набора ноль, а его отдельно задокументированная история false positive уже заставила университеты осторожно относиться к его оценкам. Все эти инструменты измеряют статистические свойства текста, и лежащие в основе механизмы объясняют и то, почему более новый подход Pangram к обучению может вырваться вперед, и то, почему каждый из них по-прежнему остается вероятностным.
Честный вывод: Pangram в настоящее время является лучшим поддерживаемым детектором в независимом тестировании, с большим отрывом, на основании недавних данных. Однако эти данные также ограничены. Два исследования, одно рецензируемое, одно нет, оба за последний год, в основном на английском языке, в основном длинные академические и веб-тексты. Обнаружение представляет собой гонку вооружений против моделей, которые меняются ежеквартально, и инструмент, который лидирует в 2026 году, сохраняет это лидерство только до следующего поколения текста. Оценка Pangram является более точно откалиброванной оценкой, чем у его конкурентов. Это по-прежнему оценка, а не доказательство того, что сделал какой-либо конкретный человек.
См. полное сравнение
Pangram является одним из инструментов на переполненном, неоднородном поле. Чтобы увидеть, как он соотносится с Turnitin, GPTZero, Copyleaks, ZeroGPT и остальными по тем же критериям, см. полное руководство AI detectors compared.
Что показало наше собственное исследование
В исследовании согласованности детекторов TextPulse Research девять коммерческих ИИ-детекторов оценили одни и те же 90 академических текстов. Один из них был гибридным текстом из 455 слов: написанные человеком начало и концовка вокруг сгенерированной ИИ средней части из 168 слов. Pangram оценил этот текст в 34% ИИ, тогда как вердикты остальных инструментов по тем же словам разошлись от 0% до 95.7% ИИ. Полная статья, корпус и матрица оценок по каждому инструменту открыто доступны на TextPulse Research.

Часто задаваемые вопросы
Собственные утверждения Pangram состоят в том, что точность составляет 99.98 percent, а показатель ложных срабатываний равен примерно 1 из 10,000, что измерялось на внутренних тестах. Необычно для этой отрасли, недавние независимые работы указывают в том же направлении: рецензируемое исследование Vrije Universiteit Brussel от июня 2026 года показало, что это был единственный из четырех инструментов, который надежно выявлял полностью AI generated и humanized работы уровня магистратуры, а рабочая статья Chicago Booth показала показатель ложных срабатываний, близкий к нулю, на своем корпусе. Независимая доказательная база сильна, но недавняя и ограничена по охвату.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.