AI 人性化工具真的有效吗?
几乎每个针对这个问题排名靠前的页面,都是由一家想出售人性化工具的公司投放的。这里改为说明机制:这些工具实际改变了什么,为什么其中一些会影响检测器分数而另一些不会,以及激进改写会在意思和引文上带来什么风险。
在搜索栏中输入“do ai humanizers work”,几乎每一个给出答案的页面都在销售某种产品。这并不是阴谋,只是一个显而易见的激励机制:一家开发改写工具的公司,不会把失败的情况放在最前面。实际情况介于两者之间,这取决于“work”是什么意思。AI humanizer 工具会改变一段文字的某些具体、可测量的属性。其中一些变化会影响检测器的分数,另一些则不会。还有一些变化会以真实代价损害段落实际表达的内容。
AI humanizer 是一种将 AI 生成文本改写为改变其统计指纹的工具, 这些指纹包括用词、句子长度、标点习惯,以及检测器实际测量的属性。某个具体的 humanizer 是否适合用于有评分的作业,或者它与普通的释义工具相比如何,是另外的问题,各自有自己的答案。这里的问题更窄, 改写在机械层面究竟做了什么,以及这种机制的哪些部分 वास्तव上会影响分数。
这不是测试结果。TextPulse 并没有对 humanizer 工具做过受控比较, 即使我们做过,轶事性的胜利也几乎没有什么意义。但理解其机制会有帮助, 也就是当你通过某些操作去改变一段文字时会发生什么,为什么其中一些会影响分数而另一些不会,以及为了换取更低的数字你要承担什么风险。下面的内容依据关于检测器如何被规避的已发表研究,以及其他媒体自身公布的测试,来解释这一机制, 一段文字中发生了什么变化,为什么其中一些会影响分数而另一些不会,以及一次大幅改写为了更低的数字会带来什么风险。
AI humanizer 实际改变了什么
市面上的每一种 humanizer 都会以某种组合方式做三件事:把单个词替换为更不易预测的同义词,重新排列或合并句子以打破长度一致性,并且偶尔会整体改写一段文字,而不是仅作调整。第一种几乎只是表面修饰。第二种最为重要,因为句子长度变化,也就是 burstiness,是大多数 detector 在给出分数之前计算的两个指标之一,另一个是词语选择在每一时刻有多可预测。
这种差异在单个句子中就能看出来。"The study employed a robust methodology" 逐词替换后变成 "The study used a strong approach,",读起来稍微更自然一些,但句子的形状几乎没有变化。若重构后,则会变成 "Because the sample skewed young, the researchers ran a mixed-methods design rather than a single survey." 这会带来不同的长度,不同的从句结构,以及对试图预测后续内容的模型而言不同程度的意外性。只有第二个版本触及了 detector 旨在测量的信号。
这种区别并非理论上的。detector 不是在读取意义。它是在评估一段文字与语言模型本会生成的模式有多接近,而这正是我们关于 how to humanize AI text 的指南所教你要手动打破的模式,而且是一句一句地打破。humanizer 工具在更大规模上、一次性完成的是同一类工作。
这些变化中,哪些实际上会改变分数
最清楚的证据来自研究人员,他们构建了一个专门的改写模型 DIPPER,专门用来测试这类攻击。将其用于 DetectGPT, 一种研究充分的检测方法时,DIPPER 的改写在固定 1 percent 假阳性率下,把检测准确率从 70.3 percent 降到了 4.6 percent,研究人员还报告说,这些改写并未显著改变源文本的含义。这是经过测量的效果,不是营销说法, 也就是说,在句子层面重构一段文字,确实可以大幅改变分数。
这就是该结果与某个商业 humanizer 的营销页面之间的差距。这在很大程度上解释了为什么不同工具之间以及不同评审者之间的结果会如此不同。DIPPER 是一个研究模型。它是在受控条件下构建和测试的,用于评估某一个已公开记录的检测器。所有案例都使用了相同的改写强度。浏览器中的工具做的是同一类编辑,即词语替换和句子重组。但它并不具备研究论文对另一端检测器或对改写质量的那种控制程度。
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
为什么在一个检测器上的较低分数不会转移到另一个检测器
检测器并不是从同一个参照点测量同一件事。关于AI 检测器如何工作的配套文章已经完整说明了其机制,但这里相关的要点很简单, 每个检测器都是相对于其自身的参考模型来评分的,因此,对一个检测器看起来不可预测的编辑,对另一个检测器仍然可能看起来普通。
对一系列商业和开源检测器进行编辑、释义、提示和组合攻击压力测试的研究人员发现,性能平均下降了 35 percent,但并不均匀。他们的结论是,几乎没有任何检测器能在每一种攻击类型下保持稳健,而且每一个检测器都有不同的、具体的漏洞,而不是某一种共同的弱点。对单个 humanizer 的真实世界测试说明了同样的模式, 同一段重写后的段落在两个不同的检测器上都得到了 100 percent AI,在第三个检测器上仍然是 100 percent,而在第四个检测器上降到了 88 percent,这一切都来自同一次通过同一个工具的处理。
激进重写的代价
该类别的营销很少提到重写幅度很大时另一侧的失败模式, 一个工具如果改动句子的程度足以改变分数, 也可能改动到失去原意。一家媒体将同一段 AI 生成的段落通过十种不同的人性化工具处理, 并将结果与原文核对。若干工具生成的句子已经不再能被解析为英语。其中一个把指令 "Tap your Apple ID" 改写成了 "Faucet your Apple ID." 另一个把 "Understanding LinkedIn Premium" 变成了 "Grasping LinkedIn Premium," 审阅者指出这 "根本没有传达相同的意思。" 他们的总体结论是, 这些工具 "似乎完全没有把握文章整体含义的任何感觉。"
学术写作对这种失败的容忍度低于产品博客文章。一个语气缓和词被替换成更强的断言, "may indicate" 被改写为 "shows," 会改变引文实际上是在支持什么, 而围绕引语重新排列句子, 可能会把引文与它原本紧挨着的主张分开。一个 in-text citation fixer 可以在不编造原始来源从未支持的细节的情况下, 将一个已经偏离其所在句子的引文重新放回原位, 但它无法告诉你, 该主张本身是否仍然与来源所说的内容一致。无论如何, 一段引文密集的部分都值得手动检查。
| 编辑类型 | 对检测器分数的典型影响 | 可能出错的地方 |
|---|---|---|
| 将单个词替换为同义词 | 较小,通常处于检测器的正常噪声范围内 | 一个缓和词可能会变成比原文所支持的更强的主张 |
| 重排或合并句子 | 影响最大,也最稳定, 这正是 burstiness 所衡量的内容 | 一个引文可能最终与它原本所附着的主张脱离 |
| 整体改写一段文字 | 在该工具所针对的检测器上影响很大,在其他地方则不可预测 | 输出最有可能不再能被解析为一个句子 |
| 加入填充内容,例如零散的拼写错误或插入语 | 几乎没有,或完全没有, 这只是表面修饰,不是结构性改变 | 对人类读者来说显得人为,但并没有修正底层模式 |
那么,AI humanizers 有效吗?
上面的证据实际上表明的是,humanizers 确实会可靠地改变检测器所测量的统计特征,这是一种真实的机械效应,而不是营销说法。它们并不能可靠地保证通过任何特定的检测器,因为检测器之间本来就会有分歧,而且工具为了追求这种保证而越激进地改写,就越可能在过程中损失一些意义。
"Do humanizers work" 实际上是三个问题,却被写成了一句话, 工具是否改变了模式,这种改变是否能在你关心的特定检测器上保留下来,以及句子是否仍然表达了你的本意。第一个问题的答案通常是肯定的,以上证据如此表明。其他两个问题则取决于工具、检测器,以及这次处理运行得有多激进。
TextPulse 的 AI humanizer 工具是围绕这种取舍而不是围绕一种承诺构建的。它会改写文档,并报告一个估计的 Human Score,这个分数是根据检测器使用的相同信号计算得出的,其中包括句子节奏和词语可预测性,而不是声称任何指定的检测器都会通过它。之所以专门提供免费方案,正是为了让你在决定上方表格中的这种取舍是否值得用于完整文档之前,先逐行查看一次通过实际上会改变什么。
可用性和安全性是两个不同的测试,而 安全性问题有单独的一页。更尖锐的版本也是如此, Turnitin 遇到 humanized text 时会做什么。
值得信任的工具,是那些向你展示发生了什么变化并让你检查的工具,而不是那些要求你相信着陆页上某个百分比的工具。在提交任何内容之前,请将改写后的段落与原文对照阅读,就像你会检查研究助理的初稿一样,因为这在功能上正是 humanizer 的作用。
Frequently Asked Questions
AI 人性化工具是否足够可靠,能够保证通过?没有任何单一工具可以确定这一点。人性化工具会改变句子结构和词语可预测性,而这正是检测器衡量的信号,因此分数往往会下降,但检测器彼此之间本来就会有差异。变化是否能在你关心的特定检测器上保留,是一个比它是否真的发生过更不确定的问题。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.