AI Humanization

AI 写作模式:暴露其特征的词语、节奏与标点

机器写成的散文有其特征, 可预测的词语, 统一的句子节奏, 以破折号代替逗号, 以及一种会重复其自身标题的论证结构。下面说明每个层面实际呈现的样子, 并给出有来源的例子, 而不是凭感觉判断。

更新于 13 min
Table of AI writing patterns, overused words such as "delve" and "underscore", next to plainer human alternatives

读一遍这句话,看看你是否已经知道它出自哪里:研究者持续强调动机与成就之间的复杂互动,而不断增长的研究也强调自我调节在学业成功中所起的关键作用。它没有任何错误。每个分句都符合语法,每个词都是真实存在的词,评分者也不会扣掉一分。但它读起来仍像是从机器里出来的,因为它确实如此。这正是本文要讨论的内容。

AI 写作模式是指在用词、句子节奏、标点和结构上可重复出现的习惯,这些习惯使机器起草的散文一眼就能被识别出来。它们聚集在四个层面, 模型倾向选择的词语、句子的形态、它依赖的标点,以及它组织整体论证的方式。单独看,任何一个都不能证明什么。放在同一段中,它们就很难被忽视。

完成这项工作的机器被称为统计检测器。它根据语言模型所预期的内容,给每个词的可预测性打分。一份报告包含该分数背后的 perplexity 和 burstiness 数学内容,关于这一点的更详细说明见另一篇关于 AI 检测器如何工作 的文章。本文其余部分列出的是读者可以在页面上听见、数出或指出来的 AI 写作特征。即使检测器出错、不可用,或者与问题无关,这也可能很重要。下面的内容不需要模型,也不需要订阅。

为什么 AI 写作模式听起来像机器?

在句子层面,语言模型所做的事情与人不同, 它是在一个经过训练、旨在显得得体而非独特的系统中,一次又一次地选择统计上最可能的下一个词。在这种规模上,得体会产生流畅、正确、却令人难忘的散文,这正是机器感的根源。读者常常说不出这类段落究竟哪里不对,只会觉得它读起来平淡,而下面的四个层面正是这种平淡所在。

词语选择是读者最先注意到的层面, 也就是正式、戏剧化的词语出现在不该出现的地方。句子节奏则更为隐蔽, 一个段落里每个句子的长度都大致相同。标点和格式也带有各自的特征, 破折号被当作通用连接件使用, 项目符号列表把原本在作者脑中并不是列表的文本切分开来。结构是最不显眼的部分, 它会重述自己的标题, 恰好覆盖三点, 然后以对自身的总结收束。

先从词语开始, 这是最容易指出的部分, 也是记录最充分的部分。

AI 最常滥用哪些词?

你会一再看到这些正式、略带戏剧化的词语, "delve"、"underscore"、"showcase" 和 "pivotal" 是记录最充分的一些。Dmitry Kobak 和另外三位合著者着手识别这种语言。他们分析了 2010 年到 2024 年的 15.1 million PubMed 摘要, 并识别出一组在 ChatGPT 发布时频率急剧上升的词语。"delve" 上升幅度最大, 这项研究发表于 Science Advances 的 2025 年 7 月, 估计它在 2024 年的频率约为 2023 年之前的 28 倍。紧随其后的是 "underscore" 和 "showcase"。作者估计, 至少有 13.5 percent 的 2024 年摘要带有 AI 辅助的迹象, 在一些国家和出版机构中这一比例上升到 40 percent 以上。

模型为何会收敛到这些特定词语, 这一点比模式本身更不明确。COLING 2025 的一项研究将 21 个过度代表的词语与模型架构、训练数据以及用于微调聊天机器人的人类反馈进行测试, 发现反馈阶段是最可能的促成因素, 但并不能完全解释这一效应。对此的解读也仍有争议, 2026 年 PNAS 期刊中的一篇交流文章就对词频变化在多大程度上直接衡量 AI 使用提出了质疑, 在把这里任何单一数字视为既定事实之前, 这一点值得记住。

这不仅适用于期刊摘要。在一项比较50万篇学生作文和AI生成作文的研究中,研究人员比较了论文的长度和用词,发现人类作文总体上更长,词汇也更丰富。在一项针对四个机器学习会议提交的同行评审的研究中,包括ICLR 2024和NeurIPS 2023,研究人员使用同样的方法估计,评审文本中有6%到15%被LLM实质性修改。当评审在截止日期临近时提交时,更有可能受到LLM的影响。

AI 过度使用的词或短语谨慎的作者会改用什么
delve (into)look at, examine
underscoreshow, stress
showcasepresent, demonstrate
pivotalmain, deciding
robustsolid, reliable
intricatecomplex, detailed
meticulouscareful, thorough
tapestrymix, range
testamentsign, evidence
boastshas, includes
fosterencourage, support
garnergain, attract
multifacetedmany-sided, complex
holisticwhole, overall
nuancedcareful, precise
invaluableuseful, valuable
realmfield, area
embark onbegin, start
unlockopen up, make possible
interplayrelationship, link

这些词单独看都没有问题。方法部分把一项发现称为稳健,是正确使用这个词,而一位历史学家描述一段复杂的法律论证,也不是在向聊天机器人认罪。看起来像机器生成的,是密度, 在一个段落里出现三四个这样的词,却没有承担任何具体作用,像模型那样把它们堆叠起来,因为每一个都是独立看来最安全的下一个选择。用 TextPulse 的免费 AI 词语清理器快速检查一下,就能直接标出这种密度。

为什么 AI 句子的长度总是听起来差不多?

模型构造每个句子的方式,和它构造上一个句子的方式一样,而不是在某处把一个观点压缩成六个词,又在别处把它展开成三十个词,所以输出往往始终保持几乎相同的长度。这种变化,或者说缺乏变化,可以通过大声朗读一段文字来听出来,这与检测器根据同一底层属性计算出的 burstiness 分数是不同的练习。

还有两个较小的习惯,会在近距离阅读时暴露这种节奏。模型喜欢用一个悬垂分词来结束句子,它只是暗示重要性,却没有增加信息,例如先提出一个主张,再强调需要进一步研究,或者指出该领域正在发生更广泛的转变。它也会使用并列结构来显得平衡,类似于该方法不仅高效,而且可扩展。这样说一次,这种结构并不显眼。每一段都这样说,就像一个只替换名词的模板。

三的法则

在短语层面,三的组合也是模型的默认节奏, 一个名词前面接三个形容词,列表中有三个例子,连续三个从句以相同方式构成。偶尔出现三项组合,一直都是英语的一部分。放置得当的三项组合并不是任何问题的症状。关键在于频率。三本身不是问题。几乎每一段都出现三,才是问题。

仅靠计数就足以在没有任何专门训练的情况下发现其中大部分。读一段文字,并标记每个句子的词数。如果你的所有标记都与前一个相差不超过几个词,那么这种节奏就是线索。使用 TextPulse 的免费 burstiness 检查器来自动计数并绘制图表,这对于一段长到无法逐句目测的文字很有用。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。

免费开始

长破折号和其他标点线索

为什么这种标记成为首选

长破折号大概是机器写作中最常被归咎的标点。你可能把它看作一种长破折号,用来替代逗号、冒号或句号,把一个句子的两部分连接起来。长破折号并不新,也不是 AI 发明的。自从有了各种文体指南以来,从 Chicago 到 AP,它们一直允许你把它用于强调和中断。而且许多职业写作者会有意使用它。

它之所以在机器输出中如此常见,可能有一个平凡的原因, 这个标记在经过编辑、专业排版的散文中很常见,而语言模型正是在这类文本上训练的,并且它让句子可以继续推进,而不必落到句号上。一个被设计用来生成流畅、连贯文本的模型会经常抓住这种灵活性,而且比大多数人在手写草稿时更常这样做。

它出现的频率在很大程度上取决于生成文本的系统。2025年中期的一次并排测试向六个聊天机器人提供了相同的提示,并统计了这种标记的出现次数, 三个系统在不到六百个词中返回了八次或九次,一个在将近一千个词中使用了两次,还有两个完全没有使用。频率是你面前这段文字所由之模型的属性,而不是 AI 写作的固定特征。OpenAI 在 2025年11月增加了一项设置,允许用户告诉 ChatGPT 停止使用这种标记并真正照做,这使得即便是这一线索现在也在某种程度上变成了可选项。

这些都不能证明该标记本身说明了任何事情。许多谨慎的作者会有意使用它,许多从未接触过聊天机器人的学生论文也会使用它,有时只是因为老师曾经这样教过他们。真正值得检查的是密度, 一页中每隔一句就依赖这个标记的文本,读起来与一页有意只用两次的文本不同。TextPulse 的 free em dash remover 会检查这种密度,并针对每一次出现建议使用逗号、冒号、句号或连字符。

项目符号、加粗文本和标题

同一层面还包括句子以下的格式决定。正文中间出现一个项目符号列表,而作者脑中从未把它当作列表。其余文档使用句子式大小写时,标题却采用标题式大小写。每个项目符号开头都有一个加粗短语,像一个迷你标题。这些都不是标点符号,但它们都来自同一个地方, 一个为聊天窗口而格式化的模型,在那里,视觉结构取代了散文通常承担的过渡。

结构和论证形态

最后一层位于句子之上,而且最难通过替换词语来修正,因为它是论证本身的形态。机器写成的部分常常先用稍有不同的措辞重述自己的标题,然后依次展开两到三个支持点,不管每一点实际上有多重要,都赋予大致相同的分量,最后总结刚才说过的话,而不是补充任何新内容。

一种相关的习惯在较长篇幅中也经常出现, 一个部分先列出某事做得好的地方,然后用 however 之类的词转折,再以同样整齐的三点列出挑战,最后指向一个大概会解决这些问题的未来。真实的论证比这更不平整。人类作者通常更在意其中一个观点,而不是另外两个,会给它更多篇幅,也不需要向读者交代一个对称的结尾。

这也是公式化学术写作看起来可能与机器写作极为相似的层次,因为方法部分或文献综述本来就应遵循固定结构。差别存在于这种结构之内。机器写成的文献综述会按通常顺序点名某一领域的常见要点。人写的文献综述则会论证哪些要点重要,以及为什么重要,即使是在严格模板之内也是如此,因为它所捍卫的是一个真实立场。

判断一篇你没有写过的文本

最值得注意的四个迹象

具体性差距是读者在完全没有工具时所能利用的最强迹象。机器起草的文字会提出在任何概括层次上都成立、却又不落实到任何具体层次的主张。它会说研究已经考察了这个问题,却不指明哪项研究,说效应显著,却不给出大小,说这种做法在该行业很常见,却不点出哪家公司或哪一年。人类作者在相同字数限制下,往往会把这些字数花在一件具体的事情上,因为他们确实有一件具体的事情,并且希望把它写进去。

无法核实的引文是清单中唯一接近证据的迹象,而且也是最少见的。一个格式无可挑剔、归属于真实期刊、带有一个却查不到记录的标识符的参考文献,几乎不可能是偶然生成的。在你不确定的投稿中,先检查三条参考文献,再检查其他任何内容。这个过程只需两分钟,而且要么能直接结束问题,要么能把最强的信号从表中移除。

词汇密度是大多数读者首先会注意到的迹象,也是最容易误判的一个。信号在于密度,而不在于任何单个词语。单个正式动词属于正常的学术语体,而一段中有五个正式动词却没有承担任何具体功能,就构成了一种模式。对一篇较长的投稿逐字手工统计很慢,而 TextPulse 的免费 AI 词语清理器会自动标出这些聚集,从而把一种模糊印象转化为你可以在页面上指认的东西。

四种特征中最微妙的是一种始终不变的语域。人类作者在两千个词的篇幅里几乎总会有些许失衡之处, 例如在三句长句之后接上一句短句, 插入一个括号中的旁注, 作出一个本不必作出的判断, 或者仅仅因为喜欢而选用某个词。机器起草的散文会从第一行到最后一行保持同一种语域。有些文体本就禁止所有这些做法, 因此, 这一特征在方法部分中的参考价值远低于在个人陈述中。

看起来很强但其实并非如此的特征

无可挑剔的语法并不能证明任何事情。拼写和标点在二十年来一直可以自动化处理, 而任何认真使用检查工具的作者都会得到同样干净的表面。正式语域也不能证明任何事情, 因为正式性正是大多数学术和职业文体按规范所需要的。大量使用标题、加粗文本和项目符号列表, 早在其他任何因素之前, 就是一种版式惯例, 而且许多作者在聊天机器人向任何人展示它之前很多年就已经接受了这种训练。标点习惯同样只占很低的权重, 尤其是 em dash, 它被要求承担的意义远远超过一个符号所能承受的范围。

检测器分数也属于这一类, 这往往会让人感到意外。分数是对文本可预测性的统计判断, 而可预测的散文正是谨慎的人类每天都会写出的东西, 这也正是误报会出现的原因。检测器输出只是一个输入, 仍然需要人来作出决定, 而 TextPulse 的 关于 AI 检测器如何工作的说明 在任何人把这个数字当作结论之前, 先说明了它在衡量什么。

当一篇文本触发多个特征时该怎么做

先检查可检查的部分。抽取三条引文、一个数字和一个命名事实,并逐一核实。仅这一轮就能把内容稀薄的文本与伪造的文本区分开来,而这两者需要截然不同的应对方式。接着,把提交内容与同一作者先前在监督下写过的内容进行比较,因为同一作者在语体上突然变化,比对单篇文档作任何绝对判断都更有分量。然后提出一个只有作者才能回答的问题,关于他们自己的文本, 为什么选这个来源而不是显而易见的替代来源,第三部分原本打算论证什么,哪一段让他们最为费力。写过这篇东西的人会立刻作答。

遵循已经存在的政策,而不是你本来会写的政策。如今大多数机构都明确规定,谁可以提出疑虑,哪些证据可被采纳,以及会向作者告知什么,而跳过这一顺序,正是把一个合理问题变成申诉的原因。处在这一问题另一侧的作者,如果被告知自己的作品读起来像机器起草的,他们要做的事情不同,TextPulse's AI humanizer 会根据文本本身计算一个估计的 Human Score,而不是给出任何检测器的裁定。

把同样的测试用于你自己的草稿更难,你的写作是否听起来像 AI 另有专页。词汇本身则单独编目,列在一份暴露 ChatGPT 的词语清单中。

这九个迹象足以让人提出一个问题,而且问题始终相同, 这段文本知道什么,而流利的猜测不会知道什么?先对引文提出这个问题。那是任何提交内容中唯一会自行作答的部分,无需先指控任何人。

这些迹象能证明一段文本是 AI 写的吗?

没有任何单一特征能够证明什么,全部特征加在一起也不能。受编辑或教授的压力时,谨慎的学术写作者也可能写出具有其中若干特征的段落, 例如缺少代词, 但并未借助聊天机器人。非英语母语写作者也可能使用课堂上教给他们的安全词汇,而被教导使用正式连接词的学生也可能使用其中许多特征。词汇清单并不能证明有不当行为, 这是一种会让谨慎写作者被错误指控的错误。我们应该指出这种错误,而不是默默重复它。

工具能够负责任地做的,是显示模式,而不是裁定写作。TextPulse 的 AI humanizer 所能提供的,是基于眼前文本对 Human Score 的估计。这是对草稿与这些表层模式相比所处位置的一种解读,而不是任何检测器给出的裁决,也不是对明天另一种工具会说什么的承诺。它是一个你可以用作决策起点的数字,就像拼写检查器标记一个词,但并不判断其周围的句子是否真的好。

上面的每一种特征都有自己的页面。词汇本身已在一篇关于暴露 ChatGPT 的词语的文章中加以整理,并分别讨论了使用破折号的习惯以及模型为何会特别选择某个动词。更广泛的标签也有说明:AI slop 的含义AI fluff 的含义,以及一份实用指南,用于判断某些内容是否由 AI 写成。如果担心的是你自己的草稿,而不是别人的,那么还有一篇关于从你的写作中移除 AI 词语的文章。

下次你在阅读自己的文字时,如果其中有些地方感觉不太对,不要只是找一个同义词来替换它。试着把它大声读出来。数一数每个句子里的词数。问问自己,每个词在这里究竟起什么作用。这正是细心的编辑在这一切被命名之前很久就一直在进行的审读。

XLinkedInFacebook

常见问题

因为一些看起来像机器生成的表层模式, 例如正式词汇, 统一的句子长度, 整齐的三段式结构, 也会出现在在截止期限压力或大量编辑下完成的谨慎人类写作中。这些只是特征, 不是来源证明。一段文字可以同时具备这些特征, 但仍然完全是你自己的作品。

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

获取 AI 人性化的最新动态

获取关于学术写作、AI 检测和人性化处理的提示,直接发送到你的收件箱。

无垃圾邮件。可随时取消订阅。