如何将 AI 文本人性化:完整指南
一份关于如何手工将 AI 文本人性化的实用讲解, 包括真实的修改前后对照, 对人工编辑无法修正之处的诚实分析, 以及 AI humanizer 工具在哪些情况下值得它节省的时间。
ChatGPT 在不到一分钟内就能返回一份初稿,读起来流畅,并且说出了你想表达的一切。问题在于,它也读起来像 ChatGPT 交回的其他每一份初稿, 同样的节奏,同样安全的词汇,同样习惯于重复刚刚写出的标题。学习如何使 AI 文本更像人写的,实际上就是学习如何逐句消除这种雷同,在它到达检测器或已经看过一百份类似初稿的读者之前完成这一点。
使 AI 文本更像人写的,指的是把机器生成的初稿编辑到其句子节奏、用词和结构读起来像一个人的写作,而不是语言模型对最佳答案的统计平均。有些编辑只需几分钟。有些编辑,若面对整份文档,则乏味到确实需要工具来承担其作用。本指南按最有帮助的顺序涵盖这两部分, 先讲编辑,再讲 AI humanizer 工具如何补足人工编辑无法完成的部分。
顺便说明一下,对于用英式拼写搜索 "humanise AI" 的人来说,这一技术完全相同,只是字母不同。
为什么 AI 文本每次听起来都一样?
其工作方式是,语言模型通过反复预测下一个最可能的词来写作,这一过程会重复成千上万次。正因如此,你才会得到流畅而稳妥的写作, 句子长度往往大致相同,段落以对标题的重述开头,过渡则依赖同样少数几个连接词。所有这些都不是缺陷。它们是在大规模上优化预期词语时必然出现的结果。
关于这一点,我们在配套文章 how AI detectors work 中有详细说明。这里我们关注的是理解上最重要的内容, 下面的每一项编辑都会打破模型不得不生成的某种模式。它们都无法掩盖模型曾参与其中这一事实,因为句子层面的编辑做不到这一点。检测器在显示百分比之前计算的两个最常见指标是 perplexity 和 burstiness。
打破节奏, 调整句长和结构
最能说明问题的是句子节奏。模型一次只能预测一个 token。它没有动机把第三句写得比第二句更短。并且,当你不加干预时,段落会自然趋向某种特定的长度和形状。下面是一个平直排列的例子: "The results of the study were statistically significant. The findings support the original hypothesis. The data was analyzed using standard methods." 三个平直的句子,长度相同,每次都以相同的方式开头。
把它打散后,同样的信息会变成这样: "The results were statistically significant, which supported the hypothesis, though two of the three variables moved less than expected, so the standard analysis needed a second pass." 现在,一个句子把主张及其复杂性一起承载了,逗号完成了原本三个平直句子分别完成的工作。这种不均匀性,正是 burstiness checker 在给段落评分时所测量的内容,而且它是这份清单里最快的编辑,因为你只是重新安排已经写好的从句,而不是创造新内容。
结构的另一半在于主要观点放在哪里。模型往往会先铺垫再给出要点,或者把要点埋在从属从句里。具体主张放在前面通常更好,限定条件放在后面: "Although sample sizes varied across sites, the effect held" 比 "The effect held at every site, even though two of them ran a third of the planned sample." 更安全,也更含糊。把主张放在前面,附带说明就成了证据,而不是回避。
删掉那些暴露它的词
有些词在机器生成的草稿中出现的频率,明显高于人类写作文本中的频率,不是因为它们错了,而是因为它们在模型对正式语体的概率分布中恰好处在最合适的位置。用 facilitate 而不是 help。用 robust 而不是 strong。用 myriad 而不是 many。用 underscore 而不是 show。这些词都没有错误。它们只是最稳妥、最平均的选择,而这正是模型最先抓取它们的原因。
一个平淡的句子写道: "The study employed a robust methodology to facilitate a wide-ranging understanding of the myriad factors involved." 同样的意思,如果用人真正会选择的措辞来表达,就是: "The study used a mixed-methods design to work out which of several factors mattered most." 第二个版本并没有更不准确。它只是没有那么普通。
把 robust 换成 strong 不会改变句子长度,也不会改变检测器实际在评分的节奏。仅靠词语替换本身不会起多大作用。明白这一点,会帮助你警惕一种想法, 即只做一次同义词替换就能一劳永逸,而不需要进一步修改。它也会帮助读者看出,这段文字在努力程度上有所下降。上面的结构性修改仍然必须与之同时进行。将一段文字交给 AI word cleaner 处理,可以迅速发现词汇层面的可疑信号。
修正检测器和读者都会注意到的标点习惯
标点有其自身的特征。它过度依赖一两个标点符号,而且使用这些符号的频率远高于普通写作,最常见的是把破折号当作通用连接符,而逗号、句号或冒号同样可以胜任。当天一段文字试图每隔三句就使用同一个标点时,它会变得重复,并开始听起来像一种习惯性动作,而不是一种风格。
分号和冒号也会被同样过度使用,通常用来连接两个从句,而这两个从句分开写成两个句子时会更自然。"The results were mixed; some participants improved while others showed no change" 在语法上没有问题,但在文体上已经显得陈旧。用两个句子可以承载同样的信息,而且更从容: "The results were mixed. Some participants improved. Others showed no change at all." 大声朗读一段文字可以发现其中大部分问题,因为耳朵会比眼睛更早察觉重复的节奏。
一个em dash remover在几秒钟内就能处理这一步中的机械部分。TextPulse 自身的内部文体规则完全禁止使用该字符,而本指南也遵循同样的规则。至于判断句子是更适合写成一个分句还是两个分句,这仍然需要人来决定。
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
用具体的句子替换泛泛的表述
这份清单中的最后一项修改最耗时,也最重要。语言模型并不记得你的实际项目,因此它会默认采用最稳妥的措辞, 也就是得体、含糊,并且对同一主题下几乎任何论文都适用的表述。
“The intervention was found to have a positive effect on student outcomes.” 这是被动、泛泛的说法,几乎可以描述一百项不同的研究。“The tutoring program raised test scores by roughly half a grade, but only for students who attended more than six sessions.” 这是主动、具体的说法,只能描述你的研究。它也更长,而且读者会相信这一句,因为模型不可能凭空猜出 six-session 这一细节。必须先有人观察数据,才能注意到这一点。
这也是语言模型无法替你完成的修改,humanizer tool 也包括在内。工具可以改变句子的长度,也可以替换你的词汇,但它在有趣的事情发生时并不在场,因此它无法给你一个你从未提供过的细节。回到你的笔记,而不是再回到改写工具。
人工编辑无法修正什么
上面的每一项修改都是免费的,而且只需几分钟就能处理一个单独的段落。真正的问题在于篇幅。对讨论帖写一段五段式回复,手工完成只需十五分钟。若是一章四十页的论文,以同样的细致程度重写,则需要数天,而几乎没有人会为了一章花这么多时间。
下表是一个规划指南,不是测量结果。这些时间是针对一般学术散文的工作估计,并且会随着写作密度的变化而变化。
| 人工编辑 | 它修正什么 | 耗时 | 它无法修正什么 |
|---|---|---|---|
| 改变句子长度和结构 | 统一的节奏,最强的 burstiness 信号 | 每 1,000 词约 10 到 15 分钟 | 词语层面的特征,单靠节奏变化无法触及 |
| 删去套话词汇 | 细心读者会半注意到的单个词语 | 通过一次查找筛选,5 到 10 分钟 | 围绕词语存在的平淡句子节奏 |
| 修正标点习惯 | 重复出现的标记,例如破折号或一串分号 | 约 5 分钟 | 表层以下的任何内容, 这一轮只是表面修饰 |
| 加入具体细节 | 可能属于该主题任何论文的笼统论断 | 每 1,000 词 20 到 30 分钟,如果还得去追查细节则更久 | 没有, 如果你确实有可加入的细节 |
| 用 humanizer 工具完整处理一遍 | 整篇文档的一致性,速度快,适合作为长稿的第一轮处理 | 不到一分钟,再加上你自己的审阅时间 | 对任何特定检测器的确定性,以及工具从未获得的任何细节 |
这五行都不足以让一篇长文完全达到要求。这正是下一节要讨论的内容。
AI humanizer 工具究竟在什么地方真正发挥作用
专门的 AI humanizer 工具,有时也被作为 ChatGPT humanizer 销售,因为大多数草稿都是从这里开始的, 会把这些修改一起应用到整篇文档上,包括节奏和词汇,而且是在制作咖啡所需的时间内完成,而不是每段花十五分钟。无论它们被称为什么, AI humanizer 工具, AI text humanizer, AI paragraph rewriter 或 AI to human text converter,好的工具都会做同样的事情, 改变句子的结构和用词,同时保留意思。措辞变化的幅度会因段落而异。
TextPulse 的工作方式如下。它会重写完整草稿,并根据同样的信号返回一个估计的 Human Score,这不是对任何特定检测器都会通过的承诺。这种谨慎并非我们独有,Grammarly 自己的 AI humanizer 页面明确写道,其工具“not intended to bypass AI detectors”,这对任何 humanizing 处理能够诚实承诺的内容都是恰当的描述。如果你来这里是为了让 AI 文本无法被检测到,那么诚实的答案是,没有任何修改和任何工具能够保证这一点,因为各个检测器彼此并不一致,而且会在不通知的情况下变化。
一个负责任的 AI humanizer 工具可以提供一个快速的初步处理和一个可供继续工作的分数。目标是通过使模式不那么均匀来降低 AI 分数,而不是直接欺骗这个数字。AI rewrite 旨在在文档层面实现与细致人工编辑在段落层面相同的事情。请手动加入上一节中的具体、有人味的细节,因为工具在有趣的事情发生时并不在场。
如果你正在处理一个有截止日期的项目,你可以使用 AI humanizer for students,它使用相同的机制,但已经把学术规范考虑在内。顺序比工具更重要,因为即使是谨慎措辞中的通用句子,仍然是通用的。你仍然需要手动完成具体细节的处理。
如何在接下来的十分钟内将 AI 文本人性化
把上面的修改按顺序排列,它们就形成一个简短的流程,而不是一份需要记忆的清单。应用到一页内容上,大约 300 到 400 个词,十分钟大致可以这样分配。
- 大声读一遍这一段,并标出每个听起来在长度或形式上与相邻句子完全相同的句子。
- 把其中两三句最平的句子拆开,把每句的主要论点移到开头。
- 查找诸如 facilitate、robust、myriad 和 underscore 之类的套话词汇,并把它们分别换成你实际会说的更朴素的词。
- 删除或替换重复的破折号和分号,并把每一处修改都大声读出来,检查它是否仍然听起来自然。
- 在每个段落中补回一个具体细节,一个数字、一个名字、一个限制条件,只有真正做过这项工作的人才会知道。
- 如果草稿超过一页或两页,先用 AI humanizer 工具做第一遍处理,然后对剩下仍显平淡的部分重复步骤一到五。
这里有几条线索会各自展开成独立页面。这些工具是否真的有效,以及它们是否可以安全用于有评分的作业,是两个不同的问题,答案也不同,而Turnitin 在提交后如何处理 humanized text则是第三个问题。对于更具体的问题,还有关于降低 AI 分数以及逐段编辑 ChatGPT 输出的分步文章。
这些做法都不能生成 undetectable 的写作,任何诚实的指南都不应承诺这一点。它们生成的是听起来像你确实花了那十分钟写出来的文字,而这才是更持久的目标, 无论检测器是否真的看到它,读者都会信任具体而不平整的散文。
Frequently Asked Questions
是的, 对于任何较短的内容都可以。了解如何手工将 AI 文本人性化, 关键在于四项修改, 变化句子长度, 删除套话词汇, 修正重复的标点, 并在每个段落补回一个具体细节。一个页面需要十到十五分钟。限制在于长度, 对长文档做同样细致的处理会变成数小时的工作, 这正是工具开始体现价值的地方。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.