AI Detection

AI 检测器如何工作?困惑度、突发性与词元概率

AI 检测器并不像读者那样识别机器写作。它们衡量你的文本有多可预测,然后把这一点转化为分数。一旦理解这一点,技术本身及其失效方式都会更容易理解。

更新于 12 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

你的大学已经开始使用 AI detector 对提交内容进行检测,而一份报告返回了一个你没有预料到的数值。在你试图对其提出异议之前,先了解这个数值的含义会有帮助。AI detector 是如何工作的?它们并不是像人一样阅读机器写作。它们衡量的是你的文本对语言模型来说有多可预测,然后把这种可预测性转化为一个分数。这个过程中的任何部分都不会考察你的意思、你的论证,或者你是否真的写了这篇东西。

我花了多年时间构建从统计上拆解文本的工具,而理解检测最有用的一点是:它测量的是典型性,而不是来源。一旦明白这一点,这项技术及其失效之处都会变得更容易理解。

检测器实际在测量什么

检测器并不知道任何内容是谁写的。它所拥有的是一个语言模型和一个评分函数。该模型从左到右读取你的文本,并在每个位置上生成一个关于下一个词应该是什么的概率分布。给它短语 "the results of the",它会把 "study" 排在最高,"experiment" 稍低一些,而 "marmalade" 则接近零。

因此,检测器只向你的文档提出一个问题:这段文本有多频繁地选择了模型所预期的那个词?那些不断落在高概率词上的写作看起来像机器生成的,因为文本生成器正是这样做的。模型一次又一次地从自身分布的顶部进行采样,持续数千个 token。

这就是为什么从整体上说,这一类别比营销所暗示的更不稳固。检测器并不是在寻找水印或指纹。它只是注意到你的散文在统计上并不出人意料,而不出人意料的散文除了 chatbot 之外还有许多成因。

Perplexity, 模型感到多惊讶

核心指标称为 perplexity,这比听起来更容易。取模型对每个实际出现的词分配的概率,计算这些概率的对数平均值,再对结果取指数。得到的是一个单一数值,用来描述模型对你的文档有多意外。你可以检查你自己草稿的 perplexity,而不是靠猜测。

低 perplexity 表示文本沿着模型预期的方向展开。高 perplexity 表示它不断转向模型没有预料到的方向。人类写作往往更高,因为人们会选择不寻常的具体名词,不同寻常的结构,以及从意想不到之处开始的句子。生成文本往往更低,因为解码过程本身就是为了尽量避免这些写法。

比较两种方法部分的开头。"The results of the study were statistically significant" 是几乎任何模型都会高置信度预测出的序列,因为它不包含意外信息。"Two of the three cohorts drifted before week six, which we had not planned for" 则远不那么可预测,因为它包含具体而别扭的信息,无法从论文其余部分推断出来。第二句让检测器付出真实的惊讶,而这种惊讶正是它被识别为人类写作的依据。

Burstiness, 不是平均值,而是方差

单靠 perplexity 还不够,因为一篇文档即使整体平均值完全合理,底层也可能异常一致。真正重要的是文本内部的变化,而这正是 burstiness 所衡量的内容, 即随着写作推进,句子长度和句子层面的 perplexity 波动有多大。burstiness checker会直接显示这种分布。

当我们有把握时,速度会加快, 当我们在保留余地时,速度会放慢,而这种节奏会进入散文之中。人类是分段写作的。一个段落可能以一个八个词的简短陈述句开头,接着进入一个三十四个词的句子,其中包含三个分句和一个插入语,然后又回到较为简洁的表达。

模型输出并不能可靠地做到这一点。句子会聚集在平均长度附近。段落会以整齐的成组形式出现。每个部分都以重述自身标题开始。它读起来很流畅,但得分很差,因为句子之间的低方差是检测器所拥有的最强信号之一。暴露它的并不是某一句话,而是这种一致性。

信号它衡量什么为什么机器文本得分低
困惑度模型对你的用词有多意外,以整篇文档的平均值计算解码时按设计会从高概率词元中采样
突发性句子长度和可预测性在文本中变化的幅度输出会聚集在平均值附近,而不是大幅摆动
词元概率其他两个指标所依据的逐词似然连续出现许多单独看都并不显眼的选择

词元概率以及分数的来源

这两个数值都建立在第三个数值之上, 即逐词元对数似然, 这是其他一切计算所依据的原始材料。一些工具会直接向你展示它, 标出你的文本最可预测的那些片段。这些标记并不是对具体句子的指控, 无论界面暗示什么。它们只是对文档层面数值贡献最大的部分。

研究方法已经超越了简单阈值。DetectGPT 及其后续方法关注曲率, 它们会对你的文本做轻微扰动, 然后检查似然是否会按生成文本通常呈现的模式下降。其他方法则在两个不同模型下比较同一段文字, 并将分歧作为信号。

一个后果对任何正在接受评估的人都很重要。由于这些指标是相对于某个特定参考模型计算的,分数始终是相对于该模型而言的。两个检测器可以读取同一段文字,却得出完全不同的判断,而且两者都没有故障。它们只是用不同的参照点回答同一个问题。

第二个后果较少被提及。模型只有在某段文字与其训练内容相似时,才能将其识别为可预测,因此,随着参考模型与文本生成来源之间的差距扩大,检测质量会下降。更新的生成器、非常规学科以及英语以外的语言,都会拉大这一差距。这也是为什么在受控基准中测得的准确率,往往一旦面对真实的提交材料就难以维持的原因之一。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。

免费开始

为什么 AI 文本会被检测出来

语言模型如何选择下一个词

如果任其自行运行,语言模型只会报告其完整的候选下一个词排序列表,并让别的机制来做选择。在实践中,解码策略会自动逐词做出这一选择,而所运行的策略不同,即使底层模型从未改变,输出的样子也会随之改变。

贪婪解码总是选择概率最高的那个词。在提出 nucleus sampling 作为修正方法的论文中,Ari Holtzman 及其合著者指出,遵循这一策略会产生他们所说的“平淡且异常重复”的文本。Beam search 会同时跟踪若干个可能的续写,然后再确定其中一个,它也会遇到同样问题的类似版本。

采样策略会重新引入一定的随机性,但这种随机性是受控的。Temperature 会在抽取一个词之前,调整模型对自身最优候选的偏好强度。Nucleus sampling,有时也称为 top-p,会将分布截断为概率总和超过某一阈值的最小词集合,并且只从该集合中抽取,原始论文将其描述为从分布的动态 nucleus 中采样,而不是从其不可靠的尾部采样。

即使这些设置中最不确定的那一种,仍然是从一个短名单中抽取,而这个短名单是围绕模型已经认为可能性较高的内容构建的。人类写作从来不是通过对词汇进行排序并从前列中抽取而生成的,因此它会不断超出那个短名单。意义有时存在于那个从未进入名单的词中。

词汇平坦性:更少、更安全的词

词汇平坦性是同一种习惯在词语层面的表现。在句子的每一个位置,都可能有几十个词在语法上合理地继续下去,但其中少数词在模型的排序中明显高于其余词,而解码过程总是落到这少数词上。把这种选择乘以文档中的每一个句子,实际使用的词汇范围就会比长度相近的人类写作明显收窄。

这种效应是累积的,而不是保持恒定。一个模型如果在第一句中倾向于选择排名最高的词,就更可能建立出这样的上下文, 使得第二句中排名最高的词也同样常见,因为常见词往往跟在常见词后面。人类作者会不断打断这种漂移,转而寻找具体的技术术语,稍微不寻常的动词,或者真正指称事物本身而不是其安全近似的词。这种差异会表现为生成版本中的工作词汇量明显更小,即使两个版本描述的是同一组底层事实。

这是一种整段文字的属性,而不是某个单独词语选择的属性。一个安全词并不能证明什么。一整页这样的词,句句都在追逐同一等级的常见词汇,才是检测器在词语层面真正要识别的信号。

句法同质性:相同的结构,反复出现

句法同质性是句子层面的对应现象。它关注的不是句子有多长,而是一个段落使用了多少种不同的语法结构, 例如句子如何开头,分句如何彼此连接,过渡词在多大程度上承担了把一个想法连接到下一个想法的工作。一个持续预测统计上最可能的下一种结构的模型,会收敛到少数几种结构的轮换,并不断重复它们。

一个段落可以在句子长度上有所变化,但如果每个句子都遵循相同的主语, 谓语, 补语结构,以相同类型的过渡开头,或以相同方式收束,它仍然会读起来在句法上很平。可预测性存在于模式之中,而不在词数之中,这一区别在burstiness 实际衡量什么的指南中有更深入的说明。

什么会收窄解码优化文本往往会做什么人类写作往往会做什么
用词在每一步都选定最可能的常见词会使用更具体或不那么常见的词来命名实际事物
句首重复少数几种安全的过渡性开头变化句子的开头方式,包括模型会判定为较不可能的开头
从句结构在一段文字中重复一两种偏好的语法结构根据句子的需要混合简单结构和复杂结构

人类往往会做出的选择

狭窄范围的另一面,是落在其外的内容。描述真实事件的人会选择精确的数字,而不是四舍五入后的数字,会承认没有奏效的部分,会在句子中途打断并修正自己的思路,或者选择一个正确而非典型的词。从语言模型的角度看,这些选择中的每一个都是低概率 token,正是解码机制试图避免的那类选择。

这并不意味着具体或不寻常的写作就一定不会触发任何标记,也不意味着流畅、正确的写作默认就可疑。方法部分、法律条款,或经过大量编辑的终稿,可能会因为与模型无关的原因落入狭窄范围,因此单一分数描述的是一种模式,而不是对是谁输入它的裁决。

看到你自己的草稿落在那个区间的什么位置,比猜测更有用。TextPulse 的 免费 perplexity 检查器burstiness 检查器分别衡量词级可预测性和句子之间的节奏,因此,单一的词汇平淡和重复的句式会作为两种不同信号显现出来,而不是合并成一个数字。

由此引出两个更窄的页面。Turnitin 如何具体检测 AI是其中之一,其相似度分数与 AI 分数之间的差异是另一个,因为这两者经常被彼此混淆。

这两者都属于更广泛的免费工具集合,适合任何想亲自查看这种模式,而不是盲目相信单一数字的人。

如今网络内容有多少是 AI 生成的?

根据若干指标,机器生成文本如今在网上已经超过人类写作文本。Amazon Web Services 的一个团队分析了来自网络的 6.4 billion 个句子,发现其中 57.1% 作为机器翻译存在,覆盖三种或更多语言,其中很大一部分质量较低。SEO 公司 Graphite 在 2025 年的一项分析发现,新发布的网页文章中略高于一半是 AI 生成的。Wikipedia 也不例外, Princeton 的一项研究对 2024 年 8 月创建的页面进行测量,发现大约每 20 篇新的英文文章中就有 1 篇在很大程度上是 AI 生成的。

这一比例正在上升,因为模型输出的成本比人类写作低几个数量级,而且所有商业激励都指向同一方向。如今,整个平台甚至完全不需要人类作者:Chirper 是一个完全由 AI 账户构成的社交网络,人类只能观看,SocialAI 则出售一种信息流,在其中发给你的每一条回复都是机器人。论坛、评论区和留言线程在更小的规模上呈现出同样的模式。

对于检测而言,这改变了基准率。一个读取2023年任意网络文本的分类器可以假定其中大部分是人类写作的,而2026年的分类器则不能。它也会反馈到模型本身,因为每一代新模型都在一个已经被前代模型写入内容的网络上训练,这也是检测器所依据的词汇习惯会扩散而不是消退的原因之一。

对你自己的写作而言,其后果很直接, 人类写作的散文正在成为少数类,而评分者、编辑和读者都知道这一点。怀疑程度上升如今已成为默认状态,这正是理解检测器能够测量什么、不能测量什么如此重要的原因。

商业检测器在此基础上增加了什么

机构实际购买的工具并不运行教科书式的困惑度。Turnitin、GPTZero、Originality和其他工具会在大规模标注的人类文本与机器文本集合上训练监督式分类器,并将统计特征与文体特征结合使用。分类器学到的是在其训练数据中区分这两堆文本的任何特征,这比一般意义上的“AI写作”更狭窄,也更具历史局限性。

训练依赖性是一个隐蔽的问题。一个主要基于某一代模型输出训练的分类器,必须推广到更新的模型、陌生的学科,以及那些英语并不类似其训练分布的作者。供应商会公布他们自己评估中的准确率,而独立基准测试在同样的工具上往往远低于这些数字。

在不过度解读分数的情况下阅读分数

检测器报告通常以百分比形式出现,而这个百分比经常被误读。它并不是你的文档中由机器写成的比例。根据工具不同,它可能是分类器的置信度,或者是跨过某个内部阈值的句子所占比例,而供应商往往对具体含义说得很含糊。两份都显示60%的报告,可能意味着非常不同的事情。

了解一个分数为何会因与作者无关的原因而变化,也很重要。短文更嘈杂,因为可供平均值稳定下来的文本更少,一篇五百词的文章只要有两三句不寻常的句子,分数就可能大幅波动。引文内容也会被计入,除非工具将其剔除,因此,一篇充满块引用的文献综述会继承其所引用内容的可预测性。充满标准术语的技术段落也会以同样方式表现。

如果你收到标记,合适的回应是提供证据,而不是围绕该指标争论。版本历史、草稿、笔记和检索记录都能说明写作过程,而过程才是失当审查小组真正能够评估的内容。没有任何人能指出一个阈值,用来区分谨慎的作者和模型。

为什么检测器会标记并非任何模型生成的写作

误报并不是罕见故障。它们直接源于对典型性的测量。任何真正可预测的写作都会得到可预测的分数,不论是谁写的。

非母语英语写作者受影响最大。Stanford 的研究人员发现,检测器将大量非母语者的论文误判为机器生成,而对母语者论文的分类则是正确的。原因是机械性的,而非恶意的, 以第二语言写作的人往往依赖于陈旧的结构和更常见的词汇。这正是低困惑度的特征,因此,ESL 写作者因谨慎写作而被标记

学术规范会造成同样的问题。方法部分本就应当公式化。法律写作、技术文档和临床报告都更重视标准措辞,而不是新颖措辞。大量编辑会进一步加剧这一点,因为润色草稿通常意味着去除那些构成你统计特征的不规则之处。

机构已经注意到了。Vanderbilt 关闭了 Turnitin 的 AI 检测功能,而不是依据其无法核实的分数采取行动,其他大学也限制了这些数字在学术不端程序中的使用方式。应当把检测器分数视为一条薄弱的证据,而不是裁决。

这对你自己的写作意味着什么

由其工作机制得出的实际建议并不复杂,也不涉及任何作弊。要有意识地变化句子长度,因为过于一致的句式才会被识别出来。保留具体细节, 真实的数字, 真实的限制, 第六周出了什么问题。笼统的合格表现最容易被判定为机器生成,而具体性既是更好的写作,也是更强的信号。

也要保留你自己的表达方式。如果你有自己惯常的说法,就保留下来。把草稿不断打磨到听起来像领域里其他任何论文一样的冲动,正是会降低你的 perplexity 的那种冲动。

有一点要避免, 有些工具会故意引入语法错误来提高 perplexity。这在指标上是有效的,但对于任何需要评分或同行评审的内容来说都是糟糕的做法,因为你是在用一种可疑换取一种确定。目标是写出读起来像你自己的文字,而不是故意把文字破坏掉以欺骗评分器。这就是为人类读者改写与为了欺骗评分器而破坏文本之间的全部区别。

如果你想直接查看自己草稿中的这些数字,而不是只相信一个黑箱的说法,那么底层测量并不神秘。免费文本分析工具会显示你的行文处于什么位置,你可以自行判断那些平直的段落是否属于值得修正的文体问题。

XLinkedInFacebook

常见问题

是的,而且这种情况是可预见的。检测器衡量的是文本在统计上有多可预测,而不是谁写的,因此任何真正公式化的写作都会得出机器生成的分数。独立基准测试持续报告的准确率低于供应商的宣称,而且已有多所大学限制这些分数的使用方式。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化的最新动态

获取关于学术写作、AI 检测和人性化处理的提示,直接发送到你的收件箱。

无垃圾邮件。可随时取消订阅。