AI Detection

为什么 AI 检测器对非母语英语写作者存在偏见

2023 年斯坦福研究发现,AI 检测器将流利的非母语英语写作误判为机器生成的比例,远高于母语写作。以下说明这种差距背后的机制,以及当同样的论文被改写为更丰富的词汇时发生了什么。

7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

对非母语者存在偏见的 AI 检测器,并不是一种主观抱怨。2023 年一项经过同行评审的 Stanford 研究直接测量了这一点。研究人员将七种广泛使用的 GPT 检测器应用于 91 篇由非英语母语者撰写的真实 TOEFL 论文,以及 88 篇由美国八年级学生撰写的论文,然后比较了各组的得分情况。

这些检测器几乎每次都能正确识别八年级论文。对于 TOEFL 论文,这些论文由已经通过研究生水平英语能力考试的成年人撰写,同样的七种工具给出的平均误报率为 61.22 percent。91 篇论文中有 89 篇,接近 98 percent,至少被这七种工具中的一种标记为 AI 生成。

TextPulse 对 AI 检测器准确性的更广泛证据 的概述涵盖了这一引人注目的发现,以及此后由此引发的诉讼。该研究在几乎所有被引用的地方都被略过的,是其机制, 也就是,为什么一位研究生水平英语使用者的文字一开始会被读成机器生成,以及当它不再这样被读取时会发生什么。

对非母语者存在偏见的 AI 检测器, 其机制

检测器从不读取语义。它读取的是,在前文词语的基础上,每个词有多么可预测,并且当模型本可以提前猜出其中大部分内容时,就会给一段文本较低分。词汇多样性, 即作者所使用的词汇范围有多广,而不是重复使用较小的一组安全词汇, 以及句法可预测性, 即句子结构与该语言最常见模式的贴合程度有多高,而不是对其加以变化, 是两种会拉低该分数的语言产出特征。

这种区分很重要,因为这两者在页面上的呈现方式不同。词汇多样性指的是词语本身, 一个作者如果在三句不同的句子里分别使用“obtain”“acquire”和“secure”,读起来会比三次都写“get”的作者更为多样,哪怕这些句子在其他方面完全相同。句法可预测性指的是结构, 主语、动词、宾语一再重复,而不是以从属从句开头或以一个出人意料的词结尾的句子。处于考试情境下的第二语言写作者,有充分理由在这两方面都采用更稳妥的版本。

第二语言写作在这两方面都更少,这一点是稳定可见的,而且这并不是缺陷。使用附加语言写作的人会依赖最可能正确的词汇和句式模式,因为在语言尚未完全自动化时,猜错的代价更高。记录了这种检测器偏差的 Stanford 论文引用了一系列应用语言学研究,所描述的正是这一模式,而且这一结论早在 AI 检测器出现之前就已确立, 第二语言写作中词汇丰富度降低、词汇多样性降低以及句子结构更简单,都是有文献记录、可测量的特征,而不是其他任何事情的迹象。

母语写作与非母语写作之间的差距,会表现为 perplexity 的差异,这也是检测器用来判断一段文字是否由机器生成的同一项测量。无论是谁写的,较低的 perplexity 都更像机器生成,而非母语写作由于与 chatbot 毫无关系的原因,在这一尺度上会更低。这个差距是否真的是驱动检测器的因素,而不是巧合,是一个可以检验的问题。Stanford 团队直接测试了这一点。

当同样的论文用更丰富的词汇重写时发生了什么

研究人员取用了同样的 91 篇 TOEFL 论文,这些论文曾触发 61.22 percent 的平均误报率,并要求 ChatGPT 仅用一条指令对其进行修改, "Enhance the word choices to sound more like that of a native speaker." 内容、论证或语法都没有被要求改变。经过这一次修改后,同样七个检测器的平均误报率降至 11.77 percent,下降了将近五十个百分点,而且每个检测器都一致标记的论文数量从十八篇降至一篇。

随后,研究人员又反向进行了实验。他们取用了 88 篇母语者的八年级论文,这些论文最初几乎每次都被检测器正确评分,并要求 ChatGPT 将其词汇选择简化得像非母语者所写。那些同样由母语者撰写的论文上的平均误报率从 5.19 percent 跃升至 56.65 percent。论文的作者身份并没有改变。改变的只有词汇,而检测器追随的是词汇。

Perplexity 在两个方向上都与误分类率同步变化, 当 TOEFL 论文被丰富化时,它急剧上升,当八年级论文被简化时,它又急剧下降。作者据此得出一个直白的结论, 检测器实际上所响应的从来不是作者身份,而是用词,这是一种任何写作者的词汇都可能承载的属性,不论他们是在何处学会英语。

这种偏差在不同检测器之间有多一致

这七个检测器在大多数方面并不一致,唯一一致的是错误发生的方向。它们每一个都更频繁地标记 TOEFL 论文,而不是八年级论文,但幅度各不相同。

检测器误报率,TOEFL 论文误报率,母语论文
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

这些是 2023 年的数据,基于当时存在的工具进行测量。此后,其中几项已经发生了彻底变化, OpenAI 在这项测试四个月后的 2023 年 7 月关闭了自己的检测器,因为它发现该检测器只能正确标记 26 percent 的实际 AI 写作文本,同时仍会将 9 percent 的人类写作误标。没有改变的是这种差距的方向。一个更广泛的偏差基准专门用于测试检测器在不同人口统计和语言类别中的表现,于 2025 年 12 月发表,并针对四种较新的开源工具运行,结果仍然报告了对代表性不足的作者群体持续更低的召回率。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

这种偏差在较新的检测器中仍然会出现吗?

Stanford 研究现在已经是几代 AI 之前的成果,其作者自己也指出了这一局限, 一个规模较小的试点样本,以及主要基于 GPT-2 构建的检测器,而 GPT-2 比今天用于检测的模型小得多,也旧得多。这提出了一个合理的问题。更好的技术是否已经缩小了这种差距?

最新的专门测试表明,答案是否定的。2026年2月,苏丹卡布斯大学的一项研究测试了两种现有的商业检测器,Turnitin 和 Originality,使用192篇文本进行对比,这些文本混合了真实的 ChatGPT 之前的 EFL 学生写作、专业人类写作、AI 生成文本,以及人类与 AI 的混合文本。结果显示,这两种工具的总体准确率分别为69 percent和61 percent,而在混合类别上的准确率,也就是实际经过编辑后会产生的那类写作,接近于零。同一项研究还揭示了另一种与语言因素并行存在的偏差, 即科学写作的准确率比人文学科写作低28 to 38个百分点。

这两项发现都不是某一款产品有缺陷。两种不同的检测器架构,在相隔三年、由不同研究团队、基于不同语料进行测试后,持续得出同样的结果, 受体裁规范塑造的写作,或第二语言写作,比既不属于前者也不属于后者的写作,更接近这些工具所称的机器生成文本。TextPulse 的免费工具让作者在任何内容提交给机构的检测器之前,就能检查同样的统计特征。

独立证据表明,这一差距是真实存在的,而不是测试伪影

TOEFL 结果的第一个问题在于,可以认为它们只适用于一项很小的2023年试点研究。对此,同一研究团队在另一项研究中作出了回应,该研究使用的数据与检测器完全无关。他们考察了 ICLR 2023 接收的1,574篇论文,ICLR 是一个重要的机器学习会议,并将样本限制为在 ChatGPT 出现之前提交和评审的摘要。

来自英语并非主要语言国家的作者所写的摘要,其困惑度显著低于来自以英语为母语国家的作者所写的摘要,而且即使在控制了每篇论文被审稿人评分的高低之后,这一差异仍然存在。这个样本不可能是由任何试图让自己听起来更像或更不像聊天机器人的人所塑造的。ChatGPT 在投稿窗口关闭时距离发布还有三个月。母语与非母语学术写作之间的困惑度差距,并不是检测器发明出来的东西,而是它们继承下来的东西。

一项关于 AI 检测作为测试问题的 2026 年统计分析,对同一结论给出了形式化表述。每当一组作者产生的语言在总体上与典型 AI 输出有重叠时,任何真正有能力识别 AI 写作的检测器,都必须对该组具体承担更高的假阳性率。这是对多样化人群进行测试时的一种数学性质,而不是某一工具的缺陷。非母语英语写作者是这一重叠最清楚、已有记录的案例。

这对第二语言写作者意味着什么

这一切并不是在主张你写得不要像自己。它的意义在于,在分数出现之前,先知道实际测量的是什么。检测器把你的文字读作可预测性,反映的是第二语言写作的一个真实统计特征,而不是你使用了某种你并未使用的工具的证据。

开展原始研究的 Stanford 研究者指出了他们自己发现的一个令人不安的含义, 同样的词汇调整会降低假阳性风险,而这种修改也正是写作者可能出于完全不同的原因而想要进行的修改, 例如更清晰的措辞,更精确的词语,而不论任何检测器如何。TextPulse 的 面向 ESL 学术写作者的页面 说明了这种修改在真实句子中是什么样子,与任何检测分数无关。

更新的检测器开始明确考虑这一模式。Pangram,较新的商业进入者之一,在其技术文档中声明,其分类器并不会对非英语母语写作者存在偏见,尽管这一说法来自供应商,而非独立测试。一个免费 perplexity 检查器显示的是同一基础测量,任何这类工具都会从一段文字中计算出这一测量,而且不会先把草稿发送到任何地方。

两个实用的配套内容位于同一组中, 何时使用 a, an 和 the,这是该模式最常见的单一来源,以及更一般的如何在英语学术写作中听起来自然

两年后,研究仍在沿着同一方向不断积累,跨越不同团队、不同检测器和不同测试设计。未能跟上的是一种被广泛采用的制度性回应, 在信任某个检测器用于任何一位写作者之前,先用一系列写作者对其进行审计,而不是在某个特定学生已经被指控之后才这样做。在这成为常规之前,证明一次错误标记不成立的负担,恰好落在这项研究所说最可能收到错误标记的那些写作者身上。

XLinkedInFacebook

常见问题

AI 检测器对非母语者有偏见是一项经过同行评审的发现,而非猜测。2023 年斯坦福研究发现,7 种广泛使用的 GPT 检测器平均将 61.22 percent 的真实 TOEFL 论文误判为 AI 生成,而对母语者论文的判断几乎总是正确。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI 检测器对非母语者有偏见:原因 | TextPulse.ai