GPTZero 如何运作
GPTZero 让困惑度和突发度成名, 随后悄然弃用二者。这里说明它现在的分类器测量什么, 报告实际显示什么, 以及该工具如何说明自身的局限。
在搜索栏中输入“how gptzero works”,返回的大多数内容仍在描述困惑度和突发性,这两个统计指标是其创始人在ChatGPT发布后的最初几周内让世人熟知的。该描述在2023年1月是准确的。自那年秋季起就不再准确,因为GPTZero自己的文档说,公司已将该方法替换为完全不同的东西。工具在上线时所做的事情与它如今所做的事情之间存在足够大的差距,以至于今天仍在流传的大多数解释都在描述一个已经不复存在的产品。
如今,GPTZero会对大量混合语料中的文本逐句进行分类,这些语料包含人类生成文本和AI生成文本,而不是进行困惑度计算。如今的GPTZero仍会给出一个单一的标题数字,但其运算方式不同。标题数字下方的句子级高亮,其含义也不同于2023年。两种版本的故事都值得了解,那个让这些术语变得出名的版本,以及那个确实在今天运行的版本。

历史回顾:困惑度与突发性如何让GPTZero声名大噪
2023年1月2日,当时的普林斯顿大学学生Edward Tian在ChatGPT发布仅数周之后,发布了GPTZero的公开演示。他最初的说明页面描述了他如何使用从语言建模借来的两个统计量来检测语言模型何时写出了某些内容。Perplexity是一个分数,用于衡量参考模型对文本中的用词选择有多么感到意外。Burstiness是GPTZero对这种意外在一篇文档中波动程度的命名。正是这些说明页面,才使得这两个词在关于AI写作的日常对话中得以进入。今天大多数能够定义perplexity或burstiness的人,并不是从教科书学到这些术语,而是从GPTZero学到的。
机制本身很容易描述。将一段文字输入参考语言模型,然后对模型认为高度可预测的散文进行处理。低perplexity会让文本呈现出机器典型的特征,因为生成往往会在“可能的下一个词”和“令人意外的词”之间偏向前者。GPTZero其自身已退役的文档甚至发布了一条经验法则:perplexity分数高于85时,更可能是人类而非机器。这个阈值来自某一家供应商、某一个模型、在某一时点,而GPTZero本身不再支持这一说法。
GPTZero现在如何工作:基于句子层面的分类器
GPTZero的支持中心直截了当地表示:“截至2023年秋季,GPTZero不再使用perplexity和burstiness来进行AI检测,因为我们迁移到了基于深度学习的架构。”它的当前技术页面也证实了这种切换是彻底的。该页面描述了“一种端到端的深度学习方法,在来自网络、教育以及由多种LLM生成的文本数据集上进行训练”,其中“一个逐句的分类模型会确定文本由AI创建的概率和置信度”。在该页面上,perplexity和burstiness完全没有出现。
自那以后,它还增加了一层防护,Paraphraser Shield, 用于捕捉已经被重写工具处理过、以规避检测的 AI 文本。你可以粘贴文本,上传 Word 文档、PDF 和图像文件,并且一次最多可上传五十个文件。所有这些基础设施都与统计某个参考模型会多频繁猜到同一个词无关。
GPTZero 报告究竟向你展示了什么
GPTZero 的结果包含三个部分:对 AI、人工或混合的分类,一个百分比,用于表示该模型认为文档是 AI 撰写的概率,以及一个置信度标签,用于描述该特定预测有多可靠。这个标签比你可能想象的更重要。GPTZero 将“高度自信”对应的错误率设定为低于 2 percent,将“低置信度”对应的错误率设定为 14 percent 或更高。这个范围足够宽,以至于同一个标题百分比在不同报告之间可能具有非常不同的权重。
付费扫描会提供句子级别的高亮,而且值得正确阅读。GPTZero 将这些高亮句子描述为那些对整体评分产生不成比例影响的句子,而不是针对单独某一行的指控清单。一句话可能不会被高亮,但仍然塑造了结果,因为分类器会将文档作为整体来读取,而不是逐句投票。
| 报告要素 | 它告诉你什么 |
|---|---|
| 分类 | 单一标签:AI、人工或混合 |
| AI 概率分数 | 一个百分比,用于反映模型判断该文档为 AI 撰写的可能性 |
| 置信度标签 | 从高度自信、错误率低于 2 percent,到低置信度、错误率为 14 percent 或更高 |
| 句子高亮 | 在 Advanced Scan 上标记对得分贡献最大的句子,而不是与之相关的每一句 |
当 perplexity-and-burstiness explainer 仍然是 GPTZero 对自身的公开描述时,这些报告要素都不存在于当前这种形式中。界面会随着方法一起改变。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。
为什么“困惑度和突发性”描述仍在流传
GPTZero的原始说明仍在线,仍被收录,仍是对困惑度和突发性作为概念如何运作的更清晰的通用性描述之一。搜索引擎和其他网站持续引用它,且有人指向一篇广泛流传的2026年综述,声称该工具仍在其分类器旁边悄悄运行一层困惑度和突发性。GPTZero自身的当前页面,即技术页面以及两篇支持文章,给出的说法相反:这些术语已被弃用,而不是仅仅在幕后被隐藏。用抽象方式描述某个概念的页面,并不等同于描述该工具当下方法的页面,将两者视为可互换,正是这种混淆得以在其到期日之后持续三年的主要原因。
这件事不止关乎琐事。有人告诉学生或同事降低困惑度,或把句子长度拉开以专门对抗GPTZero,这份建议实际上是针对一个在2023年停止运行的产品版本。什么会改变句子分类器,这是一个相关但不同的问题,更接近对AI检测器实际如何工作这一更广泛说明,而不是仅凭其中任一项统计数据。就GPTZero自身的说法而言,它并没有停止对这些指标的测量,它们在当前模型中作为七项指标之一参与供给,但它们不再是决定答案的那一项。
GPTZero称它无法做到的事情是什么
GPTZero的已发布基准测试大致与供应商可能为其自身产品发布的强度相当。该公司报告称,“在检测AI生成文本与人类写作之间的准确率为99%”,并表示“在评估AI与人类文本时,我们将GPTZero的误报率控制在不超过1%”,同时在提交内容混合AI与人类写作的情况下记录“96.5%的准确率”,在TOEFL论文上为1.1%,而TOEFL论文是衡量非母语英语写作的常见替代样本。这些数据来自GPTZero自身的评估,发表于2025年1月,页面中未引用任何独立复现实证来支持这些结果。该页面还确实对大多数供应商所依赖的说法作出了否认,称“永远不可能有100%的保证”,并指出任何声称相反的人,可能在其数据或评估方法上存在缺陷。
GPTZero自身的局限性页面比营销数据更具体。该公司表示,随着提交文本的增多,准确率会提高,并且与完整文档相比,在句子和段落层面准确率会下降。它表示其训练数据主要是成人英语散文,因此偏离该模式的文本更难被可靠地分类。它表示分类器并未训练来捕捉在生成之后被大幅修改过的AI文本。并且它明确指出,其他机器生成或高度程序化的写作,不仅仅是聊天机器人输出,也可能以同样方式被标记。
这些都不是理由去把GPTZero的数字视为毫无疑问的结论,而且它也并非唯一值得在其自身语境下理解的检测器。对像这样的分类器究竟会对什么作出响应感到好奇的读者,可以通过免费的perplexity checker或免费的burstiness checker亲自查看该模式的一个版本,这两项工具属于更完整的免费工具集合,用于覆盖这类报告所依据的其他统计层面。
GPTZero的两个核心统计数据都有各自的专页:在AI检测中,困惑度衡量的是什么,以及产生这两个数值的令牌概率运算逻辑。
一个愿意以如此精确的方式点名自身盲点的工具,值得的信任度要高于声称没有盲点的工具,而报告中下一个未解释的百分比,是开始追问是哪一种工具生成了它的一个良好起点。
我们自己的研究发现了什么
在 TextPulse Research 的检测器一致性研究中,九款商用 AI 检测器对同样的 90 篇学术文本进行了评分。其中一篇是 455 词的混合文本:开头和结尾由人工撰写,中间是 168 词的 AI 生成段落。GPTZero 将这篇文本判为 41.2% AI,而其他工具对同样文字的判定从 0% 到 95.7% 不等。完整论文、语料库和每款工具的分数矩阵开放于 TextPulse Research。

常见问题
不是。GPTZero 的支持中心说明, 公司自 2023 年秋季起在检测中停止使用困惑度和突发度, 转而采用深度学习分类器。其当前技术页面描述的是逐句分类模型, 并未提及这两个术语。之所以这一说法仍在流传, 是因为 GPTZero 自己在 2023 年的说明文中先让这两个词广为人知, 之后方法才发生变化。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.