AI Detection

为什么 AI 文本会被检测出来?真正的原因

AI 写作背后的解码过程在每一步都偏向更可能的词语和更可能的句式,这就是为什么 AI 文本会被检测出来,即使它读起来很流畅。本文讨论词汇平坦性、句法一致性,以及只有人类作者才往往会做出的具体选择,而不涉及底层数学。

5 min
Why does ai text get detected: illustration of AI-generated writing sitting in a narrow band of a language model's probability distribution

如果你让一个语言模型补全句子“The weather today is,”它不会去选像“cerulean”或“apocalyptic”这样的颜色词。相反,它会尝试说“sunny”、“cloudy”或“nice”,因为在它所训练的语料中,这些词最常出现在该短语之后。选择句子中下一个词的软件,正是被设计成偏向这种答案。

为什么 AI 文本会被检测出来?因为选择“sunny”而不是“cerulean”的同一种偏好,会贯穿整篇文档,逐词推进,而其结果落在比人类实际所处范围更窄的一段可能写作区间内。检测器不需要抓住谎言。它只需要注意到,一段文字不断落入这个狭窄区间。

以下内容都不需要公式。其机制体现在一个思想上,并在三个不同尺度上重复出现, 词语选择、句子结构,以及写作者几乎不假思索就会抓取的那个具体细节。这些尺度都汇入一个更广泛的问题,即AI 检测器究竟如何工作,而一旦把根本原因说清楚,这一点就更容易看见。

为什么 AI 文本会被检测出来?简短答案

AI 文本会被检测出来,因为把模型预测转化为完整句子的解码过程,在每一步都被构建为偏向更可能出现的词,而这种做法如果在连续数千个词上始终如一地执行,就会产生一种写作,其所占据的语言范围比人类通常所占据的更窄。即使每个句子在语法上都完美无误、在事实上也准确无误,统计工具仍然可以发现这种狭窄性。

由这一单一原因会产生三个症状。词汇会收缩到最安全、最常见的词。句子结构会收缩到少数几种偏好的形式。并且,人类几乎出于本能所做出的那种具体而略显不寻常的选择,那个奇特的词、插入的旁白、那个几乎不增加成本却极难预测的细节,往往根本不会出现。

语言模型如何选择下一个词

如果任其自然,语言模型只会报告其所有可能下一个词的完整排序列表,并让别的东西来选择。实际上,解码策略会自动逐词做出这一选择,而运行中的策略不同,即使底层模型从不改变,输出的样子也会改变。

贪婪解码总是选择概率最高的单个词。在提出 nucleus sampling 作为修正方法的论文中,Ari Holtzman 及其合著者指出,遵循这一策略会生成他们自己所说的“平淡而又奇怪地重复”的文本。Beam search 会在确定一个结果之前同时跟踪若干个可能的续写,它也会遇到同样问题的类似版本。

采样策略会重新引入一定随机性,但这种随机性是受控的。Temperature 会在抽取一个词之前,调整模型对其自身最优选择的偏好强度。Nucleus sampling,有时称为 top-p,会将分布截断为概率总和超过某一阈值的最小词集合,并且只从该集合中抽取,原始论文将其描述为从分布的动态 nucleus 中采样,而不是从其不可靠的尾部采样。

即使这些设置中最不确定的一种,仍然只是从一个围绕模型已经认为可能的内容所构建的候选短名单中抽取。人类写作从来不是通过对词汇表排序并从顶部抽取而生成的,因此它会不断超出那份短名单。意义有时存在于那个从未进入名单的词中。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

词汇平坦性, 更少、更安全的词

词汇平坦性是同一种习惯在词级别上的表现。在句子的每一个位置,都可能有几十个词在语义上合理地续写下去,但其中少数词在模型的排序中远高于其余词,而解码总是落到这少数词上。把这种选择乘以文档中的每一个句子,实际使用的词汇范围就会比同等长度的人类写作更明显地收窄。

这种效应会不断累积,而不是保持不变。一个模型如果在第一句中倾向于选择排名最高的词,那么它更可能建立出一种语境,使得第二句中的排名最高词也同样常见,因为常见词往往跟随常见词。人类作者会不断打断这种漂移,去寻找更具体的技术术语、稍微不寻常的动词、指称真实事物而不是其安全近似的那个词。即使两种版本描述的是同一底层事实,这种差异也会表现为生成版本的工作词汇量可测地更小。

这是一种整段文字的属性,而不是任何单个词语选择的属性。一个安全词语并不能证明什么。连续一页这样的词语,句句都去选择同一等级的常见词汇,这才是检测器在词语层面真正要识别的信号所依据的东西。

句法一致性, 相同的结构,反复出现

句法一致性是句子层面的对应概念。它关注的不是一句话有多长,而是一个段落使用了多少种不同的语法结构, 句子如何开头,分句如何彼此连接,过渡词在多大程度上承担了把一个想法连接到下一个想法的工作。一个模型如果持续预测统计上更可能出现的下一个结构,就会收敛到少数几种结构的轮换,并反复使用它们。

一段文字即使句子长度有所变化,如果每个句子都遵循相同的主语, 谓语, 宾语结构,以同类过渡语开头,或以相同方式收束,读起来仍然会在句法上显得平板。可预测性存在于模式之中,而不在词数之中,这一区分在关于burstiness 实际衡量什么的指南中有更深入的说明。

什么会收窄经解码优化的文本往往会做什么人类写作往往会做什么
用词在每一步都选择最可能的常见词会选择更具体或不那么常见、能够指称实际事物的词
句首重复使用少量安全的过渡性开头变化句子的开头方式,包括模型会判定为较不可能的开头
从句结构在一段文字中重复一两种偏好的语法结构根据句子的需要混合简单和复杂结构

人类才倾向于做出的选择

窄范围的另一面,是落在其外的内容。描述真实事件的人会选择精确的数字,而不是四舍五入后的数字,会承认没有奏效的部分,会在句子进行到一半时插入修正,或者选择一个正确而非典型的词。从语言模型的角度看,这些选择中的每一个都是低概率 token,正是解码机制被设计用来避免的那类选择。

这并不意味着具体或不寻常的写作就能免于所有标记,也不意味着流畅、正确的写作默认就可疑。方法部分、法律条款,或者经过大量编辑的终稿,可能会因为与模型无关的原因落入窄范围,因此单一分数描述的是一种模式,而不是对是谁输入它的裁决。

看清你自己的草稿落在该范围的什么位置,比猜测更有用。TextPulse 的 免费 perplexity checkerburstiness checker 分别衡量词级可预测性和句与句之间的节奏,因此,平直的词汇和重复的句子结构会作为两个不同信号显现出来,而不是合并成一个数字。

由此引出两个更具体的页面。Turnitin 如何具体检测 AI是其中之一,其相似度分数与 AI 分数之间的差异是另一个,因为这两者经常被彼此混淆。

二者都位于更广泛的免费工具集合中,供任何希望亲自查看这种模式,而不是盲目相信单一数字的人使用。

XLinkedInFacebook

常见问题

为什么 AI 文本会被检测出来?因为生成它的解码过程在每一步都偏向更可能的词语和更可能的句法结构,这会产生一种写作,其语言分布比典型的人类写作更窄。检测器测量的是这种狭窄性,而不是理解意义,因此即使是流畅、准确的散文,这种模式也会显现出来。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。