AI 检测器误报:为什么人类写作会被标记
厂商公布的误报率接近 1%。对同样工具、不同写作的独立测试,往往会得到不同结果。以下说明究竟是什么触发了误报,以及一旦出现该数字,它实际意味着什么,又不意味着什么。
1982年,《新英格兰医学杂志》发表了一篇关于骨髓移植患者巨细胞病毒的论文。它通过了同行评审,并在档案中存放了四十年。2023年,研究人员将其输入一个 OpenAI 公开发布的 AI 写作检测器,该工具将其评定为 99.96 percent 可能由 AI 生成,而这篇论文据称所依据的模型在三十七年后才出现。这就是最纯粹形式的 AI detector false positive, 一份被标记为机器写作的文档,而它实际上不可能是机器写作的。
这个例子之所以极端,只在于其时间上的错位。其背后的模式, 即检测器把公式化、可预测的散文视为机器生成,而不论作者是谁或写于何时, 在日常提交中不断出现, 包括论文、求职信、实验报告、个人陈述。本文讨论 false positive 的成因、哪些类型的写作最容易受到影响,以及为什么单个被标记的分数并不是它看起来像的那种证据。
什么是 AI detector false positive?
AI detector false positive 是一段人类写作的文本,却被检测工具评分为 AI 生成。这里衡量的不是作者的写作过程、诚实性或能力。该工具比较的是句子的统计形态,即词语选择和结构有多可预测,与它学会关联为机器输出的形态进行对照。
供应商通常将 false positive rate 报告为一个很小的单一百分比,通常低于 one or two percent。这个数字描述的是供应商自行构建的基准测试上的受控实验,而不是对任何单个文档的保证。关于 AI detectors 是否准确 的更广泛问题已经被独立测试过,结果完全不同,有时远高于任何供应商给出的数字。本文范围更窄, 只讨论哪些类型的写作会提高这种风险,以及一个被标记的分数能告诉人们什么,不能告诉人们什么。
哪些写作特征会让人类文本看起来像机器生成
四类普通写作承担的风险最大,而且它们都不涉及任何人做错事。短文档、高度公式化的写作、引用或模板化材料,以及经过严格校对的写作,往往都比自由撰写的散文更容易被评为更可预测,而这正是每一种检测器实际上在测量的唯一属性。一个免费 burstiness 检查器可以直接测量同样的变化,这比阅读对它的描述更快地看出这种模式。
有些文体在设计上就是公式化的。方法部分、实验室报告、标准求职信和文献综述都更奖励惯用表达,而不是创新表达,因为正是这种惯例使文档对读者可用。研究人员在真实写作上直接测试了这一点, 他们将1980年到2023年间发表的14,400篇期刊摘要, 也就是早于任何大型语言模型出现的年份, 输入一个公开可用的检测器。多达8 percent被标记为 AI 生成,不论发表年份如何,而《New England Journal of Medicine》的摘要被标记的比例为10.24 percent,是五种受测期刊中最高的假阳性率。
这个测试不可能是在检测 ChatGPT 的任何东西,因为在它采样的大多数年份里 ChatGPT 并不存在。它检测到的是文体。更正式地说,正如2026年对检测问题的统计分析所指出的那样,不可能构建出一种检测器,能够区分这样两种句子, 一种之所以可预测,是因为它由软件写成,另一种之所以可预测,是因为它属于你在该文体中会写出的那类内容。从外部看,它们完全一样。
大量编辑也会把文本推向类似的方向。初稿带有作者特有的不规则性, 例如奇怪的词序, 或者因为思路延展而变长的句子。彻底的校对过程, 尤其是再经过另一种工具处理时, 往往会恰好把这些不规则性抹平。迄今为止规模最大的检测工具独立比较测试了其中14种, 结果发现, 一旦样本文本被改写或机器翻译, 所有工具的准确率都进一步下降。
| 写作特征 | 为什么它会降低文档表面上的不可预测性 | 证据显示了什么 |
|---|---|---|
| 短篇提交 | 文本越少, 自然变化的空间就越小, 而这种变化正是区分人类节奏与机器节奏的关键 | 短文档上的得分会因少数几句不寻常的句子而更大幅度波动 |
| 公式化或学科特定的写作 | 体裁惯例奖励的是预期中的短语, 而不是有创造性的短语 | 14,400篇ChatGPT之前的期刊摘要, 即1980到2023年间的摘要, 仍然触发了最高8%的误报, 某一期刊的摘要达到了10.24% |
| 经过大量编辑或改写的草稿 | 润色会抹平检测器视为人类写作的那些个体不规则性 | 一项独立的14工具比较发现, 在改写或机器翻译之后, 准确率进一步下降 |
| 引文或模板化材料 | 被引用的段落带有其来源的统计特征, 而不是引用作者的统计特征 | 不排除引文的检测器会根据借用文本来给整篇文档评分 |
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
为什么公布的比率与现实中的比率并不一致
每一种主要检测器公布的误报率都接近1%或更低。对同样工具进行的独立测试, 在不同条件下针对不同文档运行, 却常常报告高得多的结果, 有时甚至高出10倍或更多。这两组数字都可能是准确的, 但它们描述的几乎没有共同之处, 因为它们测量的并不是同一件事。
Turnitin 是一个有用的例子,正因为它公布的细节比大多数竞争对手更多, 它给出的文档层面假阳性率低于 1 percent,前提是提交内容中有超过 20 percent 被标记为 AI 写作,同时公司声明现实世界中的结果与其自身实验室测试不同。The Washington Post 在 2023 年将 16 份真实文档送入同一工具,发现其中超过一半至少部分被误判,包括一篇完全由人类撰写的论文被标记为部分 AI 生成。两个数字都不是捏造的。它们来自不同的样本、不同的阈值,以及对什么算作标记的不同定义。
同样的差距也出现在整个行业,而不只是某一家公司的身上。那项对 14 种工具的比较发现,它们每一种的总体准确率都低于 80 percent,而且在任何改写出现之前,这 14 种工具中有 6 种会对未经修改的人类写作产生假阳性。已公布的数字描述的是一个基准测试。它并不描述此刻摆在教授面前的那份文档。
为什么一个自信的分数并不等于自信的指控
假阳性率听起来像是在说,被标记为有问题的某个学生实际上无辜的概率。但并不是。它描述的是一项测试对所有接受测试者的作用方式。而这两个问题不同,答案也不同,就像医学或安全领域中的任何筛查测试一样。
Griffith University 一位研究者在 2026 年 3 月发表的统计分析把其背后的数学关系明确化了。将 AI 检测视为施加于学生写作者群体的一项测试,而不是施加于某一份孤立文档的测试,就会出现一个权衡, 只要该群体中有一部分人的写作方式与典型 AI 输出自然重叠,接近体裁惯例,接近第二语言学习者的表达范围,那么任何真正有能力识别 AI 写作的检测器,都必须在这部分重叠人群中的一部分上误报。这并不是在说某个特定检测器构造得很差。它是用单一文档、且没有其他证据来测试一个多样化群体时所具有的性质。
论文自身的示例清楚显示了所涉及的规模。假设某学生群体中有 10 percent 的人写作风格接近典型的 AI 输出,而检测器被调校为捕捉 80 percent 的实际 AI 生成作品。那么,数学上就要求该群体的平均假阳性率至少为 7.5 percent。这并不是检测器工程设计上的缺陷,而是该群体写作在统计上与被检测对象重叠程度的直接结果。
按 10,000 名学生的大学规模来计算,仅这一下限就意味着整个群体中大约会有 750 个误报,这是一种数学上的结果,因为它是在没有其他证据可供权衡的情况下,用单一文档去测试一个多样化群体。论文作者明确指出,这些具体数字只是示例,并非在某所真实机构中测得。这个例子展示的是问题的形态,而不是对任何一所校园的具体预测。
这并不意味着被标记的分数毫无意义。它意味着,这个分数只是一个较弱的、群体层面的信号,却被要求回答关于单个个体的问题,这种不匹配并不是任何供应商的润饰所能单独完全弥补的。负责任的解读会把这个数字视为收集更好证据的提示, 例如草稿、版本历史,以及某人确实在写作时留下的通常文书痕迹。TextPulse 的免费工具让写作者在其他人之前先查看草稿在这些相同指标上的当前位置,这与试图击败某个特定检测器是不同的技术用途。
哪些写作者面临最高风险
研究显示,有两类人比其他任何群体都更突出, 一类是用第二语言写作的人,另一类是由于与其论文写作方式无关的原因而天然具有很强结构性或重复性写作风格的人。这两类写作者都会落入检测器所要捕捉的同一种统计特征之中。
非英语母语者承担着已记录的最大风险。独立测试一再发现,检测器将流利的第二语言学术写作误判为机器生成内容的比例,远高于对母语写作的误判比例。TextPulse 的 面向 ESL 学术写作者的页面 更深入地说明了这一风险背后的机制,包括哪些措辞模式导致了这一问题。
第二个较少被讨论的群体面临着相关问题。研究人员比较了大约 60,000 条 Reddit 帖子,这些帖子分为一个被认定为可能由自闭症作者撰写的子集和一个普通样本,并将两者都输入一个基于 GPT-2 的检测器。两组总体上被标记的比例都低于 2 percent,但可能属于自闭症作者的子集被标记的比例显著高于普通样本。倾向于字面化、重复性强、模式紧密的措辞,这是一部分自闭症交流风格中已被记录的特征,会产生恰好是检测器旨在捕捉的那种低变化文本。
有两家供应商公布了足够的信息,可以用来核查这一说法。Turnitin 自身的误报率 已单独列出,ZeroGPT 的准确率 也在其单独页面上进行了考察。这些错误最严重地落在谁身上,是另一个独立的问题,而 为什么非英语母语写作者更常被标记 也有其自己的答案。
这一切短期内都不太可能变得更简单。检测器会继续提高对真正机器写作文本的识别能力,而人口多样性也会继续带来某种比例的误判,仅靠更好的工程设计无法将其完全消除。更有用的转变已经在一些机构中发生, 即把分数视为对话的起点,而不是终点,并在相信其适用于眼前文档之前,先询问已公布的比率实际是在什么人群上测试出来的。
Frequently Asked Questions
AI 检测器误报,是指由人类撰写的文本被检测工具错误地判定为 AI 生成。这是因为检测器衡量的是一段文字有多可预测,而不是谁写了它。篇幅短、公式化、经过大量编辑,或以第二语言写成的文本,常常会因为与作者身份无关的原因而显得可预测,这就足以触发标记。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.