AI Detection

AI 检测中的困惑度是什么?

困惑度是语言模型用来描述它对你的用词有多意外的数值。本文追溯这一指标在 1977 年的起源,推导其公式,并解释为什么同一段文字会因阅读它的模型不同而得出不同分数。

更新于 6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

搜索 perplexity 和 AI detection 时,前几条结果中有几条实际上指向一个无关的产品, 一种由 AI 驱动的搜索引擎,恰好也叫做 Perplexity。检测器实际报告的这个指标,与那家公司除了这个词之外并无关联。它来自比 GPTZero 或该搜索引擎更早几十年的语音识别研究,衡量的内容也比二者都更窄, 即语言模型对页面上已有词语感到多么意外。

那么,在 AI detection 中,perplexity 是什么?perplexity 是一个分数,用来描述语言模型对一段文字中的确切词语预测得有多好,它通过对模型自身概率取平均,并将结果转换为一个单一数值而得出。分数低,表示模型持续猜对。分数高,表示模型持续感到意外。

这一概念早于市面上任何 AI detector,单凭它本身并不能说明一份文档是谁写的。一旦数字背后的算术变得可见,报告上的分数就不再像裁定,而更像它实际所是的东西, 对用词的描述。

Free perplexity checker scoring word-level predictability: a repetitive paragraph scores 62 of 100 estimated word variation with a 51% type-token ratio
perplexity checker 上的词汇多样性较低, 87 个词中只有 44 个不同词,因此相同的词承担了过多文本内容。这种可预测性正是基于 perplexity 的 detector 所读取的内容。

AI detection 中的 perplexity 是什么?

困惑度是借自语言建模的一种测量。它评估模型对一段文本中出现的具体词语预测得有多好,并将该分数报告为一个单一数值。检测器将同样的测量应用于提交的文档, 一个低数值, 意味着模型的猜测与实际词语高度一致, 会被解读为机器作者身份的标志, 而一个高数值则会被解读为人类作者身份的标志。这个计算过程并不读取文档的论证、引文或主题内容。它只逐个词地读取每个词有多么可预期。

检测器并没有发明这种测量。它们借用了语音识别和机器翻译系统数十年来一直用来判断模型对普通语言预测得有多好的工具,并将其重新用作作者身份的替代指标,而这并不是它最初被设计来完成的工作。

这一切与前面提到的那个无关的搜索引擎毫无关系。检测器报告的困惑度从来不是公司名称,也从来不大写, 它只是词序列的一种普通统计属性,会根据所给的任何文本重新计算。

困惑度实际上是如何计算的

这种计算的历史比任何 AI 产品都更早。Frederick Jelinek, Robert Mercer, Lalit Bahl 和 James Baker 于 1977 年引入困惑度,用来衡量统计模型完成一项语音识别任务有多困难,这比任何人将该术语用于论文或实验报告都早了几十年。自那以后,其定义并未改变。

在文档的每个位置,模型都会为实际接下来的那个词输出一个概率,例如,常见转换可能是 0.72,不寻常的转换可能是 0.03。困惑度对整段文本中这些概率的对数取平均,然后再用指数运算对该平均值进行反变换。

there's中的指数项所起的作用,比表面看起来更大。对数概率的平均,正是我们计算交叉熵时所做的事情,而交叉熵是用信息论的方式来说明,在给定模型所作预测的情况下,编码一个序列需要多少比特。不过,困惑度把比特的数量转换回一种我们更容易理解的东西, 一个有效的选择数,而不是一个抽象的比特计数。

在这些运算之后保留下来的东西,有一种清晰、几乎带有物理意味的解释。一个每次都完全确定的模型,其困惑度为 1,这是该尺度的下限。一个把每个位置都视为在八十个等可能词语之间均匀抛硬币的模型,其困惑度为 80。

大多数真实文档都会落在这两个极端之间的某个位置,而具体在哪里,取决于作者、主题,以及由哪个模型来阅读。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。

免费开始

为什么人类写作往往得分不同

模型的预期完全由前文逐词构建而成。在短语'the treatment group showed a statistically'之后,绝大多数语法完整的续写都会是'significant',而一个在大量科学写作上训练过的模型会毫不迟疑地给这个词分配很高的概率。人类作者写到同样的短语时,也可能会选'significant',因为这个短语本身就是该文体的固定表达。差距会在别处显现, 例如两句之后选用的名词,括号里补充的一句说明,报告到小数点后一个奇怪位数而不是一个整齐位数的那个数字。

这并不是什么技巧。一个写真实数据的人如果试图去抓住那个精确的数字、那个准确的限定词、那个稍微更窄的词,他们是在抓取那些属于研究本身而不是属于文体的东西。而这些选择中的每一个,都会让模型多承受一点意外。分数要累加的,正是这种意外。

推断所做的工作比测量所能支持的更多。困惑度直接衡量可预测性。它只有在假定可预测的写作在人类中很少见、而在模型中很常见时,才会推断作者身份,这一假定通常是合理的,但有时会以一种具体、可识别的方式出错,因为可预测性是文本可能具有的一种属性,其原因与是谁输入它无关。

为什么同一段文字会得到不同分数

这个分数也比看上去更不具可移植性,因为它从来不是在真空中测量的。困惑度总是相对于某一个特定参考模型的训练来计算,而这种依赖关系会带来单一定义无法单独呈现的问题。

因素变化的内容原因
由哪个模型进行阅读同一段文字在一个模型上可能得分较低,在另一个模型上可能得分较高困惑度始终只相对于某一个模型的训练数据来测量,而不同模型是在不同文本上训练的
该段文字是否为广泛复现的文本一份著名的历史文献或教科书式定义,即使人逐字输入检测器,也可能得到较低的困惑度分数Pangram Labs 以《独立宣言》为例指出,它在训练数据中被引用得如此频繁,以至于模型对其中每一句话都不感到意外
检测器是否能够看到词元概率像 ChatGPT、Gemini 和 Claude 这样的封闭式商业模型不会公开困惑度所需的逐词概率检测器使用一个替代的开放模型来近似该分数,而不是针对实际生成文本的模型计算困惑度

这一切都不会使该数值变得毫无意义,只是会让它作为单独的裁决更不值得信赖。GPTZero 的官方文档曾经给出过一个粗略经验法则,即 perplexity 高于 85 时更可能是人类写作,但某一供应商在某一模型上的阈值,并不能迁移到另一种工具与另一种模型的比较中。一个报告单一分数的检测器,是把上面所有因素压缩成一个数值,却没有说明究竟是哪一些因素起了作用。

perplexity 分数实际上告诉你什么

商业检测器在报告上打印出单一数值之前,会先把 perplexity 与句子层面的模式、分类器训练以及其他若干信号合并起来。关于AI 检测器实际上如何工作的更完整图景另有说明,其中解释了这个数值其余部分的来源。

句子与句子之间的节奏是一种相关但独立的信号,burstiness 检查器会从其自身定义出发加以考察,它关注的是一段文本内部有多大的变化,而不是任何单个词语。

这些数值都不能证明一份文档是谁写的,包括 TextPulse 根据提交的草稿计算出的估计 Human Score,它描述的是文本本身,而不是对文本作出裁决。这个想法的简化版本,即词汇多样性而非完整模型概率,驱动着本网站上的免费 perplexity 检查器,在相信报告对他人文本的说法之前,值得先拿一段来源已知的段落来试用。

perplexity 检查器与 TextPulse 其余的免费工具并列放置,因此对一份草稿进行完整检查,涵盖文本、词汇、节奏以及其他所有方面时,不必同时打开十几个独立标签页。

困惑度是这些系统依赖的两个统计量之一。另一个是 突发性,即句子长度和结构的变化,而这两者的底层是生成分数的词元概率算术

报告上的一个数字,是一长串算术运算的终点,而不是关于某段内容由谁写成的争论的起点。一旦这些算术不再神秘,更有意思的问题是,究竟是什么使一份文档在一开始就显得出人意料或可预测,而这实际上是一个关于写作本身的问题。

XLinkedInFacebook

常见问题

不是。AI 检测中的困惑度是语言建模中沿用数十年的统计测量,用来描述一段文本对模型来说有多可预测。Perplexity AI 是一家无关的公司,提供基于 AI 的搜索产品。两者只共享一个名称,除此之外没有任何关系,把它们混为一谈无助于理解检测器的报告。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化的最新动态

获取关于学术写作、AI 检测和人性化处理的提示,直接发送到你的收件箱。

无垃圾邮件。可随时取消订阅。