AI Humanization

如何降低你的 AI 检测分数

一份按优先级排序的说明,讲述究竟哪些改动会真正影响 AI 检测分数,从几乎不变的修改到影响最大的修改,以及为什么只追逐这个数字本身是错误的目标。

6 min
Ranked list showing how to lower ai score, from synonym swaps to sentence variety to original evidence

学生将一段文字送入检测器,看到分数为 82 percent,便在不改变任何一句句子结构的情况下把十几个词换成同义词,然后再次检查。这个数字几乎没有变化。整个故事是这样的, 有些修改几乎不会产生任何影响,而有一种修改的影响比其余修改加起来还要大,原因与是否能骗过软件毫无关系。

本文将按真正重要的顺序说明如何降低 AI 分数, 哪些修改几乎不会被计入,哪些会显著改变数字,哪一种改变最大,以及原因何在。本文也会说明这个数字实际上在衡量什么,因为较低的分数之所以值得追求,是因为它对应一个真实的理由, 更清晰、更具体的写作,而不是一个本身就值得追逐的糟糕目标。

Turnitin AI writing report showing 71% detected as AI, the combined share of likely AI-generated and AI-paraphrased text in a submission
本指南讨论的数字, Turnitin 的 AI writing overview 将一份提交评分为 71% AI,并且它自己也提醒,在作出任何决定之前都需要人工审查该分数。

AI 分数实际上衡量什么

语言模型通过一次又一次预测下一个最可能的词来写作,这会产生一种特定的统计特征, 句子长度聚集在一起,过渡词来自少数几个安全选项,词语选择落在该语境中预期范围的中心附近。AI 检测分数是对一段文字与这种特征有多接近的估计,它由一个经过训练、用来识别这种特征的分类器生成,而不是对是谁输入了这句话的事实判断。

检测器并不都以相同方式定义这个数字。Turnitin 说明得很明确,它的百分比“表示提交内容中符合条件的文本量,而 Turnitin 的 AI 写作检测模型判断这些文本很可能是由 AI 生成的”,并且明确指出,这指的是被标记文本所占的比例,而不是概率或置信度分数。其他检测器输出的结果更接近句子本身的置信值。无论哪种情况,关于这些数字背后机制的完整说明都值得在AI 检测器如何工作中阅读。这里更重要的是更简单的一点, 这个数字始终是统计估计,而下面的每一项修改都通过改变其所依据的统计特征来起作用,而不是通过掩盖其中涉及模型这一事实。

同义词替换几乎不会改变 AI 分数

把一个词换成一个不那么常见的同义词,几乎不会改变分类器所评分的模式,因为这不会改变句子的长度、从句结构和节奏。一个经过训练、用来识别句式是否均匀的模型,并不在意句子是说 enables 还是 allows。它在意的是,连续三句的长度几乎相同,而且开头方式也相同。

一个平直的句子写道:“The platform enables users to efficiently accomplish routine tasks without additional training.” 逐词替换后,它变成:“The platform allows users to efficiently complete routine tasks without extra training.” 长度相同,从句顺序相同,节奏相同。读者也许会注意到一个稍有不同的词。一个按句子层面模式对整段文字评分的分类器,几乎没有新的内容可供利用。

这并不是反对修正固定词汇的论点。像 facilitate、robust 和 myriad 这样的词值得删去,因为细心的读者会注意到它们,而免费的 AI word cleaner 能在几秒内捕捉到其中大多数。它反对的是指望这一步承担主要工作。如果在经过词汇处理后分数几乎没有变化,那是预期中的结果,而不是这一步失败的迹象。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

句子多样性会进一步推动它

模型一次只预测一个 token,并没有内在理由让第三句比第二句更短,所以如果不加干预,段落会收敛到一个狭窄的长度和形式范围。正是这种规律性,而不是任何单个词,才是更强的信号,因为一个针对机器输出训练的分类器已经见过这种模式成千上万次。

三句平直的话读起来是这样的: "The results were significant. The findings supported the hypothesis. The data was analyzed using standard methods." 如果为了多样性重写,同样的内容会变成: "The results were significant, and they supported the hypothesis, though the standard analysis needed a second pass once two of the outlying cases were removed." 现在,一句话同时承载了主张及其复杂性,而且整段在长度和从句结构上都出现了真实变化。这正是 burstiness checker 在对不均匀性评分时所衡量的内容,也正因为如此,这种编辑比词汇处理更能推动分数变化。

这些都不难在一两页纸上手工完成。大声朗读段落,标出任何两句或三句听起来长度和形式相同的连续句,然后把其中一句拆开,或者用一个真正起作用的逗号把两句合并成一句。本节背后的句子层面编辑,会在 如何将 AI 文本人性化的完整讲解中逐步说明,并提供更多详细示例。

你自己的证据对 AI 分数的影响最大

语言模型无法接触到你项目中实际发生了什么。让它撰写一项研究时,它会默认采用最稳妥的表述,这种表述几乎适用于同一主题上的任何研究,因为那是它所拥有的唯一材料。带有来自特定来源的具体主张的句子,不是模型仅凭提示词就会生成的句子,而这种差距正是最能拉动分数变化的因素。

一个泛泛的句子: "The intervention had a positive effect on outcomes for participants." 这句话可以描述数百项研究。用作者自己的材料改写后: "Attendance records showed the effect held only for students who came to more than six sessions, a threshold the original design had not anticipated." 这句话更长,更具体,而且只能描述这项研究。若让一个参考模型继续同样的提示词,它不会猜到六次课程这一细节,因为提示词中没有任何内容暗示它存在。

这也是最能改进写作的编辑方式,不管任何检测器报告什么,这一点值得认真思考。一个具体数字,一个命名的局限,或者直接引用而不是改写成含糊主张的来源,这些都会让段落对读者更有说服力,而它们也会推动分数变化这一事实,更接近副作用,而不是目标。

编辑对分数的典型影响原因
用同义词替换词语很小到几乎没有句子长度、结构和节奏保持不变
改变句子长度和结构中等到较大打破分类器被训练去识别的统一模式
加入你自己的证据或主张最大引入了模型无法仅凭提示词生成的内容

如何在不追逐错误目标的情况下降低 AI 分数

上面的每个数字都是估计值,不是裁决。Turnitin 在其自身文档中也明确指出,其 AI 写作检测“may not always be accurate”,并且“should not be used as the sole basis for adverse actions against a student.” 一个分数可能因为与作者身份毫无关系的原因而变化,也可能在一篇由人从头写成的文本上保持不变。把这个数字当作关于某句话是谁写的事实,这正是围绕这一话题的大部分焦虑来源,而这也并不是这个数字自称所代表的东西。

这也是为什么单纯把分数降下来并不是一个好的目标。追逐一个数字,可能会把写作者推向那些最容易自动化的修改,改一改词汇,调整几处从句顺序,而跳过最重要的一点, 加入只有写作者本人真正拥有的具体材料。以这种方式获得的较低分数才值得保留。

追求更低分数也可能在文体上把段落推向错误方向, 对每个论断都加上保留语,堆叠限定语,加入一些只为打断节奏而存在、并非为了表达内容的填充句。这些都不能修正底层模式,而且都会让段落更难读。真正会改变分数的修改, 句式多样性和具体证据, 也正是能按其自身标准改进写作的修改,这在一次修改开始显得像填充而不是改进时,是一个有用的检验。

TextPulse 的 AI humanizer 会把上述句子层面和结构层面的修改一次性应用到整篇文档中,并报告一个根据这些相同信号计算出的估计 Human Score,而不是声称任何指定的检测器都会通过。使用得当时,它可以作为长文档的快速初步处理。它仍然无法加入最能提升分数的那一项,因为在实际工作发生时,它根本不在场。那一部分仍然属于写作者。

在此之前,有两个问题值得先弄清楚:AI humanizers 是否真的有效,以及 它们是否适合用于你打算提交的作品

上面的顺序也是在截止日期前有限时间应优先投入的事项清单。如果时间紧张,可以跳过同义词替换这一步。不要跳过那个补回只有你才能写出的细节的段落,因为那是任何改写软件都无法替你完成的唯一修改。

XLinkedInFacebook

常见问题

加入你自己的材料,一个具体数字,一个命名的限制,或者一个你确实读过的来源所支持的论断,比任何单一修改都更能改变分数,因为语言模型无法仅凭提示生成这些细节。句子长度的变化排在其次。用同义词替换影响最小,因为它们不会改变句子结构。这一顺序是如何降低 ai 分数而不只是操纵数字的核心。

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。