AI Detection

为什么 AI 检测器对非母语英语写作者存在偏见

2023 年 Stanford 研究发现,AI 检测器将流利的非母语英语写作误判为机器生成的比例,远高于母语写作。以下说明这一差异背后的机制,以及当同样的论文被改写为更丰富的词汇时发生了什么。

更新于 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

针对非母语者存在偏见的 AI 检测器,这并不是一种主观抱怨。2023 年一项经过同行评审的 Stanford 研究直接测量了这一点。研究人员将七种广泛使用的 GPT 检测器应用于 91 篇由非母语英语使用者写作的真实 TOEFL 论文,以及 88 篇由美国八年级学生写作的论文,然后比较了每个群体的得分情况。

这些检测器几乎每次都能正确识别八年级论文。对于 TOEFL 论文,这些论文由已经通过研究生水平英语能力考试的成年人写成,同样的七种工具给出的平均误报率为 61.22 percent。91 篇论文中有 89 篇,接近 98 percent,至少被这七种工具中的一种标记为 AI 生成。

TextPulse 对关于 AI 检测器准确性的更广泛证据的概述涵盖了这一头条发现,以及此后由它引发的诉讼。几乎在所有引用该研究的地方都被略过的是其机制,也就是,为什么研究生水平英语使用者的文字一开始会被读成机器生成,以及当它不再以这种方式被阅读时会发生什么。

针对非母语者存在偏见的 AI 检测器,其机制

检测器从不读取含义。它读取的是,在给定前文的情况下,每个词有多可预测,并且当模型本可以提前猜到其中大部分内容时,就会给一段文字打低分。词汇多样性, 即作者所使用的词汇范围有多广,而不是重复使用较小的一组安全词汇, 以及句法可预测性, 即句子结构与该语言最常见模式的贴合程度有多高,而不是对其加以变化, 是推动这一分数下降的语言产出两个特征。

这种区分很重要,因为这两者在页面上的呈现方式不同。词汇多样性指的是词语本身, 一个作者如果在三句不同的句子里分别使用“obtain”“acquire”和“secure”,读起来就比连续三次使用“get”的作者更为多样,即使这些句子在其他方面完全相同。句法可预测性指的是结构, 主语、动词、宾语一再重复,而不是以从句开头或以一个出人意料的词结尾的句子。处于考试情境下的第二语言写作者,有充分理由在这两方面都默认采用更稳妥的版本。

第二语言写作稳定地表现出这两方面都更少,但这并不是缺陷。使用额外语言进行写作的人会依赖最可能正确的词汇和句式,因为在语言尚未完全自动化时,猜错的代价更高。记录了检测器偏差的 Stanford 论文引用了一系列应用语言学研究,正是关于这一模式的,这些研究早在 AI 检测器出现之前就已确立, 第二语言写作中词汇丰富度降低、词汇多样性降低以及句法结构更简单,都是有记录、可测量的特征,而不是其他任何事情的迹象。

母语写作与非母语写作之间的这种差距,会表现为 perplexity 的差异,这也是检测器用来判断一段文字是否由机器生成的同一项测量。无论是谁写的,较低的 perplexity 都会显得更像机器生成,而非母语写作在这一尺度上处于更低位置,其原因与聊天机器人毫无关系。真正驱动检测器的是否就是这种差距,而不是巧合,这是一个可以检验的问题。Stanford 团队直接测试了这一点。

当同样的论文被用更丰富的词汇改写时发生了什么

研究人员取用了同样的 91 篇 TOEFL 论文,这些论文曾触发 61.22 percent 的平均误报率,并让 ChatGPT 仅用一条指令对其进行修改, "Enhance the word choices to sound more like that of a native speaker." 内容、论证或语法都没有被要求改变。经过这一次修改后,同样七个检测器的平均误报率降至 11.77 percent,下降了将近五十个百分点,而每个检测器一致标记的论文数量则从十八篇降至一篇。

随后,研究人员又反向进行了实验。他们取用了 88 篇母语者的八年级论文,这些论文最初几乎每次都被检测器正确评分,并让 ChatGPT 将其词汇选择简化,仿佛是由非母语者写成。那些同样由母语者撰写的论文上的平均误报率从 5.19 percent 升至 56.65 percent。论文的作者身份并未改变。改变的只有词汇,而检测器也随之跟着词汇变化。

Perplexity 与误分类率在两个方向上都同步变化, 当 TOEFL 论文被丰富化时,它急剧上升, 当八年级论文被简化时,它又急剧下降。作者据此得出一个直白的结论, 检测器实际响应的从来都不是作者身份,而是词汇选择, 这是一种任何作者的词汇都可能承载的属性,不论他们是在何处学会英语。

这种偏差在不同检测器之间有多一致

这七个检测器在很多方面都没有达成一致,唯一一致的是错误发生的方向。它们每一个都比八年级论文更频繁地标记 TOEFL 论文,但幅度各不相同。

检测器误报率, TOEFL 论文误报率, 母语论文
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

这些数据来自 2023 年,基于当时存在的工具测得。此后,其中几项已经发生了彻底变化, OpenAI 于 2023 年 7 月关闭了自己的检测器, 也就是这项测试四个月后, 因为它发现该检测器只能正确标记 26 percent 的实际 AI 写作文本, 同时仍会将 9 percent 的人类写作误标。没有改变的是这种差距的方向。一个更广泛的偏差基准专门用于测试不同人口统计和语言类别中的检测器,于 2025 年 12 月发表,并针对四种较新的开源工具运行,结果仍然报告了对代表性不足的作者群体持续更低的召回率。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。

免费开始

这种偏差在较新的检测器中仍然会出现吗?

Stanford 研究现在已经是几代 AI 之前的成果,而其作者自己也指出了这一局限, 一个规模很小的试点样本,以及主要基于 GPT-2 构建的检测器,而 GPT-2 远比今天用于检测的模型更小,也更早。由此引出一个合理的问题。更好的技术是否已经缩小了这一差距?

最近的一项专门测试给出的答案是否定的。2026年2月,Sultan Qaboos University 的一项研究测试了两种当前的商业检测器,Turnitin 和 Originality,使用了192篇文本,这些文本混合了真实的、ChatGPT 之前的 EFL 学生写作、专业人类写作、AI 生成文本,以及人类与 AI 的混合文本。结果显示,这两种工具的总体准确率分别为69 percent和61 percent,而在混合类别上的准确率,也就是实际经过编辑后会产生的那类写作,接近于零。该研究还揭示了与语言偏差并行存在的第二种偏差, 科学写作的准确率比人文学科写作低28 to 38个百分点。

这两个发现都不是某一款产品有缺陷。两种不同的检测器架构,分别在三年间隔后、由不同研究团队、基于不同语料进行测试,却持续得出同样的结果, 受体裁规范塑造的写作,或受第二语言影响的写作,比既不属于前者也不属于后者的写作,更接近这些工具所称的机器生成文本。TextPulse's free tools 让写作者在任何内容进入机构的检测器之前,就能检查同样的统计特征。

独立证据表明这一差距是真实存在的,而不是测试伪影

TOEFL 结果的第一个问题在于,可以认为它们只适用于一个很小的2023年试点研究。对此,同一研究团队在另一项研究中作出了回应,该研究使用的数据与检测器完全无关。他们考察了 ICLR 2023 接收的1,574篇论文,ICLR 是一个重要的机器学习会议,并将样本限制为在 ChatGPT 出现之前提交和评审的摘要。

来自英语不是主要语言国家的作者所写的摘要,其困惑度显著低于来自以英语为母语国家的作者所写的摘要,而且即使在控制了每篇论文被审稿人评分的高低之后,这一差异仍然存在。这个样本不可能被任何试图让文本听起来更像或更不像聊天机器人的人所塑造。ChatGPT 在投稿窗口关闭时距离发布还有三个月。母语与非母语学术写作之间的困惑度差距,并不是检测器凭空发明出来的,而是它们继承下来的。

一项于 2026 年发表的、将 AI 检测作为检验问题的统计分析,对同一结论给出了正式表述。每当某一组作者产出的语言在总体上与典型 AI 输出存在重叠时,任何真正有能力识别 AI 写作的检测器,都必须对该组特别承担更高的误报率,这是一种检验多样化人群的数学性质,而不是某一工具的缺陷。非母语英语作者是这一重叠最清楚、最有文献记录的案例。

这对以第二语言写作的作者意味着什么

这并不是在主张写作时更不像自己。它提醒人们,在分数出现之前,先了解实际测量的是什么。若检测器把你的行文判定为可预测,它捕捉到的是第二语言写作的真实统计特征,而不是你使用了某种你并未使用的工具的证据。

进行原始研究的 Stanford 研究人员指出了他们自己发现中的一个令人不安的含义, 同样的词汇调整既会降低误报风险,也正是作者出于完全不同的原因可能希望进行的那类修改, 例如更清晰的措辞、更精确的用词,而不论任何检测器如何。TextPulse 的面向 ESL 学术写作者的页面说明了这种修改在真实句子中会是什么样子,与任何检测分数无关。

更新的检测器开始明确考虑这一模式。Pangram,较新的商业进入者之一,在其技术文档中说明,其分类器并不偏向非母语英语写作者,尽管这一说法来自供应商,而非独立测试。一个免费 perplexity checker显示的是这些工具从一段文字中计算出的同一底层测量,而不会先把草稿发送到其他地方。

同一组中还有两个实用的配套内容:when to use a, an and the,这是该模式最常见的单一来源,以及更一般的how to sound natural in English academic writing

两年过去,研究仍在沿着同一方向不断积累,涉及不同团队、不同检测器和不同测试设计。跟上这一进展的,是一种尚未被广泛采用的机构回应, 在信任某个检测器用于任何一类写作者之前,先用一组不同写作者对其进行审计,而不是等到某个特定学生已经被指控之后才这样做。在这成为常规之前,证明一次错误标记不成立的负担,恰恰落在这项研究所说最可能收到错误标记的那些写作者身上。

XLinkedInFacebook

常见问题

AI 检测器对非母语者有偏见是一项经过同行评审的发现,而不是猜测。2023 年 Stanford 研究发现,七种广泛使用的 GPT 检测器平均将 61.22 percent 的真实 TOEFL 论文误判为 AI 生成,而对母语者论文的判断几乎每次都正确。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化的最新动态

获取关于学术写作、AI 检测和人性化处理的提示,直接发送到你的收件箱。

无垃圾邮件。可随时取消订阅。