AI Detection

AI 检测器准确吗?误报与偏差

供应商公布的误报率低于 1%。独立研究者在非母语英语写作上测试同样的检测器时,发现误报率超过 60%。以下是证据所显示的内容。

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin 声称其假阳性率低于 1%。一组独立研究人员对来自非英语母语者的更广泛写作样本测试了多种检测器。他们发现,在同一类写作上,平均假阳性率超过 60%。这两个数字都是真实的,都已发表,而且都涉及向同一市场销售的检测器。AI 检测器准确吗?这取决于你测试的是哪一类人群,你使用了哪一种检测器,以及你的供应商最初是如何定义它的。

本文不会重新解释检测器如何计算该分数。其机制,perplexity,token probability,分类器如何训练,已在别处详细说明,如果你还没有读过,最好先读一读。这里重要的是,一旦分数存在,接下来会发生什么, 它有多常出错,最常对谁的写作出错,以及一次错误指控对一个什么都没做错的人究竟意味着什么代价。

AI 检测器准确吗?

并不稳定,而且营销说法与独立测试之间的差距已有充分记录。由 Debora Weber-Wulff 领导的一组研究人员于 2023 年公布了他们对 14 种检测工具的研究结果,其中包括 12 种免费工具和 2 种商业工具,这些工具是在人类文本与 ChatGPT 文本混合样本上进行测试的。他们发现,这些工具没有一个是准确或可靠的,而且存在一种内置偏差,倾向于把机器文本标记为人类文本,而不是相反。此次测试中包含的两种商业工具是 Turnitin 和 PlagiarismCheck。该测试中的所有工具在文本被改写后表现都更差。

但两年过去,情况并非停滞不前。芝加哥大学 Booth School 的一篇工作论文,由 Brian Jabarian 和 Alex Imas 撰写,将三个新进入者,Pangram、GPTZero 和 Originality.ai,以及一个开源竞争者,放在近 2,000 篇人类撰写的文本上进行测试,这些文本来自博客、新闻、评论和小说。在受控测试条件下,这组工具中表现最好的一个准确率从未低于 99.8%,并且将其误报率保持在较低水平。开源模型的表现与随机猜测者一样好。情况确实已经有所改善。某种程度上。只是一点点。

但问题在于“受控”这个词。基准段落是干净的、完整的,并且是在已知条件下生成的。提交的论文并不可靠地具备这些特征。Turnitin 自己的首席产品官曾公开表示,现实世界的结果可能与实验室结果并不相同,尽管这对于一家供应商来说是少见而有用的承认。下一节将把供应商给出的数字与独立研究者的数字并列展示,这样差距就不是被断言出来的,而是可见的。

供应商声称与独立测试

下表将四种检测器自称的表现,与独立研究者在直接测试这些工具时测得的结果并列。请结合阅读中间两列,不要只看供应商一列。

检测器厂商声称的准确率独立观察结果厂商对误报的说明
Turnitin在标记前需达到 98% 置信阈值,文档层面的误报率低于 1%约 80% 准确率,在 2023 年的一项比较中位列 12 种工具之首,但使用的是该工具的早期版本在 AI 写作比例超过 20% 的阈值以上,文档层面低于 1%,句子层面约 4%
GPTZero在独立 RAID 基准测试中,误报率为 1% 时,AI 文本检测率为 95.7%对短段落的准确率为 96%,在 2025 年芝加哥大学 Booth 的一项研究中误报率低于 1%在 RAID 基准测试中报告的误报率为 1%
Originality.ai准确率为 99%,误报率为 0.5%(Lite model),1.5%(Turbo model)误报率低于 1%,但在同一 Booth 研究中漏检了 10% 到 40% 的 AI 写作文本按模型层级分别公布误报数据
Pangram其称错误率比竞争工具低超过 38 倍,且表示对非英语母语写作者没有偏见在 Booth 研究中,准确率从未低于 99.8%,误报率接近于零声称在 10 个文本领域和 8 个语言模型中误报率接近于零

有两点值得注意。第一,所有厂商数据都来自由厂商控制的实验室,而 Booth 的数据来自没有任何产品可卖的研究人员。第二,Turnitin 在中间那一列中完全没有出现,因为 2025 年的研究并未测试它。在表中,它的独立数据基于 2023 年的一项较早比较,但使用的是该工具的旧版本,因此在将该表视为同类比较时,应记住这一点。

Turnitin 的 AI 检测有多准确?

Turnitin 不公布单一的准确率数字。它公布的是一个阈值和一种权衡。该公司表示,只有在其有 98% 的把握认定被标记部分是 AI 写作时,才会标记文档,而正是这一阈值使文档层面的假阳性率保持在 1% 以下。Turnitin 估计,它能够识别大约 85% 的 AI 辅助写作,其余部分则是有意放过,而不是冒着错误指控的风险。

Turnitin 在句子层面返回的实际假阳性百分比, 即界面高亮具体行而不是整篇文档时, 实际上更接近 4%。如果一位教授截取的是单个被标记的段落,而不是整篇文档的分数,那么这个数字就值得知道,因为被高亮的句子出错的可能性,明显高于它旁边的文档分数。

还值得注意的是,Turnitin 已经直接承认了这一差距。他们发现,最初的真实世界结果, 尤其是较短文档, 的假阳性率高于实验室测试所预期的水平。因此,他们把可计分的最小文档长度从 150 词调整到 300 词。这就是供应商根据已公布数字在实验室外站不住脚而对自身产品作出的调整,这一点和任何独立研究一样说明问题。

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

假阳性实际上给学生带来什么代价

这件事发生在耶鲁大学管理学院的一名 executive MBA 学生身上。该学生因违规被指控,从最字面意义上说都是如此。涉及的检测工具是 GPTZero。这名学生在一门金融课程中的期末考试被一名助教标记,助教认为这份作业篇幅很长,内容繁复,标点和语法几乎完美。而这位教授当时正把它交给 GPTZero 检测,该工具将这些答案判定为很可能是 AI 生成的。

他未通过该课程,并被停学一年。他于2025年2月在联邦法院提起的诉讼称,Yale自身的政策正是出于这一原因限制使用GPTZero等工具,即其对非英语母语者存在已记录的误报率,而他使用该工具违反了该政策。他的诉状还援引了这样一项事实,即GPTZero对Yale前校长和商学院院长撰写的学术写作给出了100% AI-generated评分。

法官在2025年5月拒绝发布早期禁令。此案至今尚未解决, 这是我写作时的情况。原告是一名法国国民,他主张,对非英语母语者已知的同样偏见导致了他的写作呈现出那样的结果。我们将在下一节讨论这一点。没有争议的是代价, 从学位项目中损失一年, 不及格成绩, 法律费用, 以及为一个分数争执数月,而不是去获得学位。1%的误报率听起来很小,直到庞大的人群使它落到某个具体的人身上。

为什么AI检测器会将非英语母语者误判为AI生成?

很糟糕,而且差距很大。这是最早对此给出量化的研究得出的结论。Stanford研究人员将七种广泛使用的GPT检测器用于91篇由非英语母语者撰写的TOEFL作文,以及88篇美国八年级学生的作文。检测器几乎每次都能正确识别八年级作文。至于TOEFL作文,这些作文由成年人撰写,他们的英语流利到足以参加研究生水平的英语考试,检测器的平均误报率为61.3%。在91篇作文中,有89篇至少被七种检测器中的一种标记为由GPT生成;其中18篇作文被全部七种检测器标记。

其机制与支配其他检测的机制相同, 可预测的词汇和更简单的句子结构会被视为低困惑度, 而低困惑度又会被视为机器生成, 不论执笔者是谁。以第二语言写作的作者会依赖成熟的表达方式, 因为这正是额外语言流利程度的真实表现, 而这恰恰是检测器被设计用来标记的特征。

处于这种位置的作者, 并不适合只被建议更自然地写作, 因为被标记的正是自然。TextPulse 的 面向 ESL 学术写作者的页面 更深入地说明了这种风险背后的措辞模式, 包括哪些变化可以改变它们, 而不改变句子的含义。

这并非孤立案例。2025年12月, 发布了一个新的基准, 明确用于评估这些检测器中的偏差。它包含超过 200,000 个样本, 涵盖多个人口统计群体和语言。尽管距离 Stanford 的首次研究已经过去两年, 且纳入了同一批检测器的许多不同模型版本, 这一基准仍然揭示, 对英语学习者的偏向依然存在。

并非所有供应商都是如此。Pangram 自身的技术文档指出, 其分类器并不偏向于非母语英语使用者。Chicago Booth 的研究人员并未独立测试这一说法, 但这确实表明, 新一代检测器在构建时已经将这一问题纳入考虑, 而不是将其忽视。

如果你想在任何人对你的写作评分之前, 先查看它处于什么位置, 一个 免费困惑度检查器 可以给出与检测器会计算出的相同底层数值, 而无需先向任何机构提交内容。

还有谁会被标记, 以及为什么

非英语母语者承担着已记录的最大风险,但同样的统计逻辑也会捕捉到其他写作。Weber-Wulff 的团队发现,他们测试的全部 14 种工具在处理改写文本时准确性都更低,这说明相当一部分学术写作在任何检测器运行之前,已经经过校对者、编辑或导师的红笔修改。

这并不意味着这个数字毫无意义,只是说,在它能够说明某个具体个人之前,需要有佐证。如果一篇文本读起来很一致,句长相近,整体节奏相似,那么无论是谁写的,也无论出于什么原因,它都会得到更像机器写作的分数。与其猜测,不如直接使用免费 burstiness 检测器来检查。

什么样的 AI 检测政策才算有可辩护性

Yale 早已有一项政策,据称限制使用 GPTZero 之类的工具,原因与本文所述大致相同, 即存在已记录的误报率,以及对非英语母语写作者的已记录偏见。因此,这与其说是一个不幸学生的故事,不如说是既有规则未被遵守的故事。当一项政策真正执行分数与裁定之间的区别时,分数就会成为一个输入,而不是裁定。

  • 将分数视为一个输入,绝不把它作为认定不端行为的唯一依据
  • 在对学生使用该工具之前,向学生披露其公开的误报率
  • 对短篇提交和非英语写作采取额外谨慎,这两者都是已记录的薄弱点
  • 保证一条不需要推翻统计结果的申诉路径

这些都不罕见。它更接近于在其他任何地方应当如何对待单一法庭科学证据, 有用、可核查,而且绝不能单独构成充分依据。

对于个体写作者来说,同样的原则在分数出现之前就适用,而不是之后。来自任何工具的单一数字都只是估计,而不是裁定,把它当作任一方向上的确定性, 无论是安全还是被抓住, 都是在要求这个数字承担它无法支持的内容。

TextPulse 自己的 AI humanizer 工具会基于同样的逻辑报告 Human Score, 这是根据你的文本本身计算出的估计值,而不是检测器对其作出的裁定。它可作为一个信号,说明一份草稿当前的可读方式,而不是对任何特定检测器会给出什么结论的承诺。

准确性问题可以分解为更窄的几个问题,每个问题都有自己的页面。检测器将人类写作标记出来的比率另有专门讨论,Turnitin 的误报率ZeroGPT 的准确性也有具体证据。如果某个分数已经被用来对付你,还有一些实用内容,分别讨论当你被指控在论文中使用 AI 时该怎么做,讨论你可以收集哪些证据来证明你没有使用 AI,以及讨论如何撰写申诉信,以其自身标准回应该分数。

任何报告上的数字都会随着供应商重新训练其模型,以及研究人员继续用更困难的案例测试它们而不断变化。但不应变化的是其背后的习惯, 将一个分数视为若干测量中的一项,询问它是在什么人群上验证的,并询问供应商没有说明的、关于那些它仍然会出错的案例。

Frequently Asked Questions

是。Weber-Wulff 及其同事在 2023 年的一项比较中发现,AI 检测工具“既不准确也不可靠”,而非母语英语写作者面临最高的已记录风险,一项研究发现,在 TOEFL 论文上的平均误报率超过 60%。单一分数本身并不能证明任何事情,这也是为什么它绝不应成为指控背后的唯一证据。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI 检测器准确吗?误报解析 | TextPulse.ai