AI 检测器准确吗?误报与偏差
厂商公布的误报率低于 1 percent。独立研究者将同样的检测器用于非母语英语写作时,发现误报率超过 60 percent。以下是证据所显示的内容。
Turnitin 声称其误报率低于 1%。一组独立研究人员在来自非英语母语者的更广泛写作样本上测试了多种检测器。他们发现,在同一类写作上,平均误报率超过 60%。这两个数字都是真实的,都已发表,而且都涉及向同一市场销售的检测器。AI 检测器准确吗?这取决于你测试的是哪一类人群,你使用的是哪一种检测器,以及你的供应商最初是如何定义它的。
本文不会重新解释检测器如何计算该分数。其机制,perplexity,token probability,分类器如何训练,已在其他地方详细说明,如果你还没有读过,值得先读一读。这里重要的是,一旦分数存在,接下来会发生什么, 它有多常出错,最常对谁的写作出错,以及一次错误指控对一个什么都没做错的人究竟意味着什么代价。
AI 检测器准确吗?
并不稳定,而且营销说法与独立测试之间的差距已有充分记录。由 Debora Weber-Wulff 领导的一组研究人员于 2023 年公布了他们对 14 种检测工具的研究结果,其中包括 12 种免费工具和 2 种商业工具,这些工具被用来对照人类文本与 ChatGPT 文本的混合样本进行测试。他们发现,这些工具没有一个是准确或可靠的,而且存在内置偏差,更倾向于把机器文本标记为人类文本,而不是相反。此次测试中包含的两种商业工具是 Turnitin 和 PlagiarismCheck。所有工具在文本被改写后表现都更差。
但两年过去,情况并非停滞不前。芝加哥大学 Booth School 的一篇工作论文,由 Brian Jabarian 和 Alex Imas 撰写,将三个新进入者,Pangram、GPTZero 和 Originality.ai,以及一个开源竞争者,放在近 2,000 篇人类撰写的文本中进行检验,这些文本来自博客、新闻、评论和小说。在受控测试条件下,这组工具中表现最好的一个准确率从未低于 99.8 percent,并且将误报率保持在较低水平。开源模型的表现与随机猜测者相当。情况确实已经变好了。某种程度上。只是一点点。
但关键在于“受控”这个词。基准段落是干净、完整并且在已知条件下生成的。提交的论文却没有一项能稳定满足这些特征。正如 Turnitin 自己的首席产品官公开所说,现实世界的结果未必与实验室结果完全一致,尽管这对供应商来说是一个罕见而有用的承认。下一节将把供应商给出的数字与独立测试的数字并列展示,这样差距就会是可见的,而不是被口头宣称出来的。
供应商声称与独立测试
下表将四种检测器对自身的声称,与独立研究者在直接测试这些工具时测得的结果并列。请将中间两列合并阅读,不要只看供应商那一列。
| 检测器 | 供应商声称的准确率 | 独立观察结果 | 供应商对误报的说明 |
|---|---|---|---|
| Turnitin | 在标记前设定98%置信阈值,文档级误报率低于1% | 约80%的准确率,在2023年一项比较中位列12种工具之首,但使用的是该工具的早期版本 | 在20% AI-written阈值以上,文档级误报率低于1%,句子级约为4% |
| GPTZero | 在独立 RAID 基准测试中,1%误报率下实现95.7%的AI文本检测率 | 在短段落上准确率为96%,在2025年芝加哥大学 Booth 研究中误报率低于1% | 在 RAID 基准测试中报告1%的误报率 |
| Originality.ai | 99%的准确率,0.5%的误报率(Lite model),1.5%(Turbo model) | 误报率低于1%,但在同一 Booth 研究中漏检了10%到40%的AI-written文本 | 按模型层级分别公布误报数据 |
| Pangram | 其称错误率比竞争工具低38倍以上,并表示对非英语母语写作者没有偏见 | 在 Booth 研究中,准确率从未低于99.8%,误报率接近零 | 称在10个文本领域和8个语言模型上误报率接近零 |
有两点值得注意。第一,所有供应商数据都来自由供应商控制的实验室,而 Booth 数据来自没有任何产品可卖的研究人员。第二,Turnitin 在中间那一列中完全没有出现,因为2025年的研究并未测试它。在表中,它的独立数据基于更早的2023年比较,但使用的是该工具的旧版本,因此在将这张表视为同类比较时,应记住这一点。
Turnitin 的 AI 检测有多准确?
Turnitin 不发布单一的准确率数字。它发布的是一个阈值和一种权衡。该公司表示,只有当其对被标记部分是 AI 写作的判断达到 98 percent 的把握时,才会标记一份文档,而且正是这一阈值将文档层面的假阳性率控制在 1 percent 以下。Turnitin 估计,它能够识别大约 85 percent 的 AI 辅助写作,其余部分则是有意放过,而不是冒着错误指控的风险。
Turnitin 在句子层面返回的实际假阳性百分比, 也就是界面突出显示具体行而不是整份文档时, 实际上更接近 4 percent。如果一位教授截取的是单个被标记段落,而不是整份文档的分数,那么这个数字就值得知道,因为被高亮的句子出错的可能性明显高于其旁边的文档分数。
还值得注意的是,Turnitin 也直接承认了这一差距。他们发现,最初的真实世界结果, 尤其是对于较短的文档, 的假阳性率高于基于实验室测试所预期的水平。因此,他们把可计分的最小文档长度从 150 调整到 300 words。这说明,供应商在调整自己的产品,因为公布的数字在实验室之外并不成立,这一点和任何独立研究一样能说明问题。
假阳性实际上给学生带来的代价是什么
这件事发生在 Yale's School of Management 的一名 executive MBA 学生身上。该学生被指控违反规定,这是字面意义上的指控。所使用的检测器是 GPTZero。这名学生在一门金融课程中的期末考试被一名教学助理标记出来,因为该助理认为这份写作篇幅很长、结构繁复,而且标点和语法几乎完美。而这位特定教授把它交给 GPTZero 检测,结果该工具将这些答案判定为很可能由 AI 生成。
他未通过该课程,并被停学一年。他于 2025 年 2 月在联邦法院提起的诉讼称,Yale 自身的政策正是出于这一原因限制使用 GPTZero 等工具,即其针对非英语母语者已被记录的误报率,而且他是在违反该政策的情况下使用了它。他的诉状还援引了这样一项事实,即 GPTZero 对 Yale 前任校长以及商学院院长撰写的学术写作给出了 100 percent 的 AI 生成评分。
法官在 2025 年 5 月拒绝签发早期禁令。此案至今仍未解决, 以我写作时的情况而言。原告是一名法国公民,他主张,针对非英语母语者的同样已知偏差导致了他的写作呈现出当时的表现。下一节我们将讨论这一点。没有争议的是代价, 从学位项目中损失一年, 不及格成绩, 法律费用, 以及为一个分数争执数月, 而不是去获得学位。1 percent 的误报率听起来很小,直到庞大的人群使它落到某个具体的人身上。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。
哪些写作特征会使人类文本看起来像机器生成的
四类普通写作承担的风险最大,而且它们都不涉及任何人做错事。短文档、高度程式化的写作、引用或模板化材料,以及经过严格校对的写作,往往都会被判定为比自由写成的散文更可预测,而这正是每个检测器实际上在测量的唯一属性。一个免费 burstiness 检查器可以直接测量同样的变化性,这比阅读对它的描述更快地看出这种模式。
有些文体在设计上就是程式化的。方法部分、实验报告、标准求职信和文献综述,都更偏好惯用表达而不是新颖表达,因为正是这种惯例使文档对读者可用。研究者在真实写作上直接检验了这一点, 他们将1980年至2023年间发表的14,400篇期刊摘要, 也就是早于任何大型语言模型出现的年份, 输入一个公开可用的检测器。最多有8 percent被标记为AI生成, 不论发表年份如何, 而《新英格兰医学杂志》的摘要被标记的比例为10.24 percent, 这是所测试的五种期刊中最高的假阳性率。
该测试不可能是在检测任何与ChatGPT有关的东西, 因为在它所抽样的大多数年份里, ChatGPT并不存在。它检测到的是文体。更正式地说, 按照2026年关于检测问题的统计分析, 不可能构建一种检测器, 既能区分一条因为由软件写成而可预测的句子, 又能区分一条因为它本来就是该文体中你会写出的那类句子而可预测的句子。它们从外部看完全一样。
大量编辑会把文本推向类似的方向。初稿保留了作者特有的不规则之处, 比如词序奇特, 或者因为思路延展而变得冗长的句子。彻底的校对, 尤其是再经过另一种工具处理的校对, 往往会恰好把这些不规则之处抹平。迄今为止规模最大的独立检测工具比较测试了14种工具, 发现一旦样本文本经过改写或机器翻译, 所有工具的准确率都会进一步下降。
| 写作特征 | 为什么它会降低文档的表观不可预测性 | 证据显示了什么 |
|---|---|---|
| 短篇提交 | 文本越少,自然变化的空间就越小,而这种变化正是区分人类节奏与机器节奏的关键 | 短文档的得分会因少数几句不寻常的句子而更大幅度波动 |
| 公式化或学科特定写作 | 体裁规范更奖励可预期的短语,而不是有创造性的短语 | 14,400 篇 ChatGPT 之前的期刊摘要, 1980 to 2023, 仍然触发了最高 8% 的误报, 其中一家期刊的摘要达到了 10.24% |
| 经过大量编辑或改写的草稿 | 润色会抹平检测器读作人类特征的个体不规则性 | 一项独立的 14 工具比较发现, 在改写或机器翻译之后, 准确率进一步下降 |
| 引用或模板化材料 | 被引用的段落带有其来源的统计特征, 而不是引用作者的统计特征 | 不排除引文的检测器会根据借用文本来给周围文档打分 |
为什么 AI 检测器会把非英语母语者误判为 AI 生成?
误判得很严重,而且幅度很大。这是最早对这一问题进行量化的研究得出的结论。斯坦福研究人员将七种广泛使用的 GPT 检测器用于 91 篇非英语母语者写的 TOEFL 论文,以及 88 篇美国八年级学生的作文。检测器几乎每次都能正确识别八年级作文。至于 TOEFL 论文,这些论文由成年人撰写,他们的英语已经流利到足以参加研究生水平的英语测试,检测器平均给出的误报率为 61.3 percent。在 91 篇论文中,有 89 篇至少被七种检测器中的一种标记为由 GPT 生成,其中 18 篇被全部七种检测器标记。
其机制与其他检测机制相同, 预测性词汇和更简单的句子结构会被视为低困惑度, 而低困惑度又会被视为机器生成, 不论执笔者是谁。以第二语言写作的作者往往依赖成熟的表达方式, 因为这正是额外语言流利度的实际表现, 而这恰恰是检测器被设计用来标记的特征。
处于这种位置的作者, 并不适合只被建议更自然地写作, 因为被标记的正是自然。TextPulse 的 面向 ESL 学术写作者的页面 更深入地讨论了这种风险背后的措辞模式, 包括哪些变化可以改变它们, 而不改变句子的含义。
这并不是孤立案例。2025 年 12 月, 发布了一项新的基准测试, 明确用于评估这些检测器中的偏差。它包含了跨多个人口统计特征和语言的 200,000 多个样本。尽管距离 Stanford 的首次研究已经过去两年, 且纳入了同一批检测器的许多不同模型版本, 这项基准测试仍然揭示, 对 英语学习者 的偏差依然存在。
并非所有供应商都是如此。Pangram 自身的技术文档指出, 其分类器并不歧视非母语英语使用者。Chicago Booth 的研究人员并未独立检验这一说法, 但这确实表明, 新一代检测器在构建时已经考虑到这一问题, 而不是忽视它。
如果你想在他人评分之前先查看自己的写作处于什么位置, 一个免费的困惑度检查器可以给你与检测器会计算出的相同基础数值, 而无需先向任何机构提交内容。
还有谁会被标记, 以及原因
非母语英语使用者承担着已记录的最大风险,但同样的统计逻辑也会捕捉其他写作。Weber-Wulff 的团队发现,他们测试的全部 14 种工具在处理改写文本时准确性都更低,这说明相当一部分学术写作在任何人对其运行检测器之前,已经经过校对者、编辑或导师的红笔修改。
这并不意味着这个数字毫无意义,只是它在说明某个具体的人之前,需要先得到佐证。如果一篇文本读起来很一致,句子长度相近,整体节奏相似,那么无论是谁写的,也无论出于什么原因,它都会被打出更像机器生成的分数。与其猜测,不如直接使用免费 burstiness 检查器来核查。
第二个较少被讨论的群体面临相关问题。研究人员比较了大约 60,000 条 Reddit 帖子,将其分为一部分被认为可能由自闭症作者撰写的帖子和一组普通样本,并将两者都输入一个基于 GPT-2 的检测器。两组总体上都低于 2 percent 被标记,但可能由自闭症作者撰写的子集被标记的比例显著高于普通样本。倾向于字面化、重复、紧密模式化措辞的写作,这是某些自闭症交流风格中有记录的特征,恰好会产生检测器旨在捕捉的低变化文本。
为什么自信的分数并不等于自信的指控
假阳性率听起来像是在指某个被标记为有问题的学生实际上无辜的概率。但并不是。它描述的是一项测试对所有接受测试的人是如何运作的。而这两个问题不同,答案也不同,就像医学或安全领域中的任何筛查测试一样。
来自 Griffith University 一位研究者的 2026年3月统计分析把其背后的数学关系明确化了。将 AI 检测视为对学生写作者群体而不是对某一份孤立文档所施加的测试,就会出现一种权衡关系, 只要该群体中有一部分人的写作方式与典型 AI 输出自然重叠, 与体裁惯例接近, 与第二语言学习者的写作范围接近, 那么任何真正有能力识别 AI 写作的检测器, 都必须在这部分重叠人群中的一部分样本上误判。这并不是在说某个特定检测器构建得不好。它是用单一文档、且没有其他证据来测试一个多样化群体时所固有的属性。
论文中的说明性示例本身就显示了所涉及的规模。假设某学生群体中有 10 percent 的成员写作方式与典型 AI 输出足够接近,而某个检测器被调校为识别出 80 percent 的真实 AI 写作。此时数学上就要求,在该群体中平均误报率至少为 7.5 percent。这不是检测器工程设计上的缺陷, 而是该群体写作与被检测对象在统计上重叠程度的直接结果。
若按一所拥有 10,000 名学生的大学来推算,仅这一下限就意味着在整个群体中大约会有 750 次误报标记, 这是在没有其他证据可供权衡的情况下,用单一文档测试一个多样化群体所带来的数学后果。论文作者明确指出,这些具体数字只是说明性的,并非在某所真实院校中测得。该示例展示的是问题的形态,而不是对任何一所校园的具体预测。
什么样的 AI 检测政策才算站得住脚
Yale 已经有一项据称限制使用 GPTZero 等工具的政策,其理由与本文所阐述的原因几乎一致, 即有记录的误报率,以及对非英语母语写作者的有记录偏差。因此,这与其说是一个不幸学生的故事,不如说是既有规则未被遵守的结果。当一项政策真正把分数与裁定区分开来时,分数就会成为一个输入,而不是裁定本身。
- 将该分数视为一个输入,而不是认定学术不端的唯一依据
- 在将该工具用于学生之前,向学生披露其公开的误报率
- 对短篇提交和非母语英语写作采取额外谨慎,这两者都是已记录的薄弱点
- 保证一条不需要推翻统计结果的申诉途径
这些都不算特殊。它更接近于任何单一法庭科学证据在其他场合应当被对待的方式, 有用、可核查,而且单独来看永远不足以成立。
对于单个作者而言,同样的原则适用于分数出现之前,而不是之后。来自任何工具的单一数值都只是估计,而不是裁定,把它当作任一方向上的确定结论, 无论是安全还是被抓到, 都是在要求这个数值承担它无法支持的内容。
TextPulse 自己的 AI humanizer tool 也基于同样的逻辑报告 Human Score, 这是根据你自己的文本计算出的估计,而不是检测器对其作出的裁定。它有助于作为一个信号,说明当前草稿读起来如何,而不是对任何特定检测器会说什么作出承诺。
准确性问题可以拆分为更窄的问题,每个问题都有自己的页面。关于 Turnitin 的误报率 和 ZeroGPT 的准确性 的具体证据是分别讨论的。如果某个分数已经被用来对付你,这里有一些实用内容,分别涉及 当你被指控在论文中使用 AI 时该怎么做,涉及你可以收集哪些证据来 证明你没有使用 AI,以及涉及 撰写申诉信,以其自身标准回应该分数。
任何报告上的数值都会随着供应商重新训练其模型,以及研究人员继续用更困难的案例测试它们而不断变化。但不应变化的是其下方的习惯, 将分数视为若干测量中的一项,询问它是在什么人群上验证的,并询问供应商没有说明哪些它仍然会出错的案例。
常见问题
是。Weber-Wulff 及其同事在 2023 年的一项比较中发现,AI 检测工具“既不准确,也不可靠”,而非母语英语写作者面临的已记录风险最高,一项研究发现,在 TOEFL 论文上,平均误报率超过 60 percent。单一分数本身并不能证明任何事情,因此它绝不应成为指控背后的唯一证据。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.