AI Humanization

我的写作听起来像 AI 吗?自我检查

为那些自己完成写作、却现在无法听出自己行文的人提供的自我诊断。为什么合格、经过训练、反复修改的学术写作会触发与机器输出相同的信号,应该检查哪五项,以及其中哪些不必再道歉。

5 min
A self-check answering does my writing sound like ai, with a human-written paragraph beside the signals a reader misreads

你写了它。整整四个晚上,每一句都写出来了,桌边还摊着资料。然后,一个检测器返回一个数字,或者一位主管说措辞听起来像是生成的,你把自己的段落来回读了三遍,却再也分辨不出来了。

“我的写作听起来像 AI 吗?”这是一个合理的问题,也有一个具体的答案。对大多数提出这个问题的人来说,答案是,这些写作听起来很有条理。合格、经过教学、经过编辑的学术散文,在表面上与机器输出有很大相似之处,因为语言模型就是在合格、经过教学、经过编辑的散文上训练出来的。下面是一种自我检查方法,看看你自己写的草稿应当关注什么,发现问题时意味着什么,以及其中有多少应当原样保留。

为什么人类写作会触发相同的信号

我们有一个语言模型,它是在那些人们认为写得好的文本上训练出来的,已发表论文、经过编辑的新闻报道、教科书、文档。它输出的是这些内容的平均值,而这几乎正是你在写作课程中被教导要做到的。第一句是主题句。每个段落只表达一个观点。过渡有明确提示。全文保持一致的语体。每一项都是评分标准,每一项都会减少检测器所测量的统计变异。

最容易因此被误判的是两类人。把英语作为第二语言或第三语言来写作的人,被教导把正式语体视为安全语体,而正式语体正是模型默认采用的语体。谨慎的修订者则因相反的原因被误判, 修订会消除变异,因此一章的第八稿比第二稿更少那种读起来像人写的粗糙感。其背后的机制都在AI writing patterns 完整指南中,在你改动任何一句话之前,值得先读一读。

我的写作听起来像 AI 吗?进行这五项检查

按顺序对你自己写的草稿做五项检查。每一项只需要几分钟,而且都不需要工具或账户。

  1. 句子长度分布。统计连续十个句子的词数。如果其中八个落在十五到二十五个词之间,你的范围就很窄。大多数人类草稿在一页中的某处至少会有一个少于八个词的句子。
  2. 段落开头形态。只按顺序阅读每个段落的第一句。如果每一句都在展开段落之前先把段落点明,那么这种形态就是一致的,即使内容完全是你自己的。
  3. 动词的具体性。在你的结果或发现部分,给每个主要动词加下划线。统计有多少个动词命名的是你实际执行过的操作,再统计有多少个只是展示性动词,这类动词可以出现在任何主题的任何论文中。
  4. 正式词汇密度。取你最密集的三个段落,统计每一百词中的抽象正式词汇数量, underscores, showcases, multifaceted, comprehensive。两个真正发挥作用的词是普通的学术散文。五个都没有发挥作用,就是这种模式。
  5. 具体性测试。找出每一个即使把你的主题换成别的主题也仍然成立的句子。这些句子无论是谁输入的,读起来都像是生成出来的,而这正是读者说某个段落有机器写作感的原因。

检查第五项最重要,而且没有任何检测器会执行它。一个在更换主语后仍然成立的句子,起初就没有携带关于你主题的信息。这就是读者会感知到的属性,而且它是可以修正的,而句子长度永远做不到这一点。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

要改什么,以及要原样保留什么

人们对自己文章中大多数令人担忧的地方,其实都应该保持不动。组织结构不是缺陷,表面整洁也不能证明任何事情。下表把常见信号分成了值得处理的部分,以及应该停止为之道歉的部分。

你注意到的内容你自己的写作为什么会这样是改还是保留
各段落长度都差不多你先按结构起草,然后再按字数限制修改保留。长度应当服从论证,有时论证本身就是均衡的
句子长度都落在很窄的范围内期刊的行文风格和字数要求都会把你推向每句一个分句改三四处。把逻辑本来就连在一起的成对句子合并,再删短一处到六个词
全文都使用正式的拉丁语系动词论文模板和语言课程会把正式语体教成最安全的选择改掉那些没有实际作用的。保留你所在学科所界定的术语
明显的提示语很多, first, second, finally评分标准要求提示语,所以你是有意加进去的大多保留。删掉那些在提示读者一个段落,而读者其实已经能看出来的部分
任何地方都没有缩略形式在大多数期刊和大多数院系中,学术语体都不使用缩略形式保留。无论检测器更偏好什么,缩略形式对这种文体来说都是不合适的
多处使用三项并列列表三个项目正好适合一句话,而且评分规则会奖励这种形式改一两处。每个列表都保持对称,比任何单个词都更能说明问题
没有错别字,没有失误,没有粗糙之处你校对过,而且不止一次保留。干净的表面并不能说明作者身份

最后一行是人们最常争论的。没有人应该为了显得像人而在论文里故意加一个错别字,而任何让你这样做的建议,都是在要求你为了满足某个数值而损害一份提交稿。

两分钟朗读检查

大声以正常语速朗读三段文字。有两件事会显现出来,而默读会把它们隐藏起来。第一是呼吸,完全没有短句的散文会让你无处停顿,你会在看见之前先听出来。第二是强调。由真正关心论证的人写出的段落,通常会有一句比其余句子承担更重的分量,而你会不自觉地把重音放在它上面。没有这种句子的段落是平的,而平淡才是人们实际上在检测的东西。

如果读起来很平,修正就发生在句子所表达的内容这一层面。删去任何可能属于另一篇论文的句子。把数字放回去。凡是两句话表达一个要点的地方,就只表达一次。TextPulse 的 AI word cleaner 会替你统计整章中的词汇密度,而平淡则需要你自己来修正。

如果检测器已经标记了它

检测器分数是对一段文本的概率估计。它并不是关于是谁输入了这段文字的事实认定。被检测器标记的作者包括上文所述的两类人, 第二语言写作者和频繁修订者。回应被标记文本的最佳方式,是在事后重写被标记的段落。也就是说,改变你原本打算依赖的证据。事后重写被标记段落是可用的最弱回应,因为它改变了你原本会依赖的证据。

相反,要保留过程证据, 版本历史、带日期的笔记、你所依据的阅读清单、在此之前的草稿。实际操作中这会是什么样子,以及院系实际上会接受什么,已在 如何证明你没有使用 AI 一文中说明。

TextPulse 的 AI humanizer 会报告一个根据文本计算得出的估计 Human Score,这是一种对散文的解读,而不是对作者的裁决,并且本网站上的任何工具都不声称知道某个检测器会对某一页面作出什么判断。

具体词汇被单独列出,见那些暴露 ChatGPT 的词语页面,而造成最大损害的那个单一动词则被单独解释。

值得用这个问题替换前一个问题的是,这个问题更为尖锐。不要问一段文字是否听起来像机器,而要问其中哪一句只有你可能写出来。如果答案是都不是,那就是需要修改的段落,而且即使在一个完全没有检测器的年份里,花时间修改它也会是值得的。

XLinkedInFacebook

常见问题

通常是,这也是最常见的触发原因。提出“我的写作听起来像 AI 吗”的人,几乎总是在对结构作出反应, 主题句、带有提示的过渡和一致的语体都是评分标准,而这些也正是语言模型默认生成的内容。组织结构并不能说明文本是谁写的,删掉它只会让写作更差。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。