AI写作模式:暴露其痕迹的词语、节奏与标点
机器生成的散文有其特征:可预测的词语、统一的句子节奏、由破折号承担逗号的功能,以及一种会重复自身标题的论证结构。下面将结合有来源的例子,说明每个层面实际是什么样子,而不是只凭感觉判断。
读一遍这句话,看看你是否已经知道它出自哪里:研究人员持续强调动机与成就之间的复杂互动,而越来越多的研究强调自我调节在学业成功中所起的关键作用。它没有任何错误。每个分句都符合语法,每个词都是真实存在的词,评分者也不会扣掉一分。但它读起来仍像是从机器里掉出来的,因为它确实如此。这正是本文要讨论的内容。
AI 写作模式是指在用词、句子节奏、标点和结构上可重复出现的习惯,这些习惯使机器起草的散文一眼就能被识别出来。它们集中体现在四个层面, 模型倾向选择的词语、句子的形态、它依赖的标点,以及它组织整篇论证的方式。单独看,任何一种都不能证明什么。放在同一段中,它们就很难被忽视。
完成这件事的机器被称为统计检测器。它根据语言模型的预期,给每个词的可预测性打分。一份报告包含该分数背后的 perplexity 和 burstiness 数学内容,另一篇关于 AI 检测器如何工作 的文章对此有更详细的说明。本文其余部分列出的是 AI 写作的可识别迹象,读者可以在页面上听出来、数出来,或者直接指出来。即使检测器出错、不可用,或者与问题无关,这些迹象仍然可能重要。下面的内容不需要模型,也不需要订阅。
为什么 AI 写作模式听起来像机器?
语言模型在句子层面所做的事情与人不同, 它一再在一个被训练得显得称职而非独特的系统中,选择统计上最可能的下一个词。这个尺度上的称职会产生流畅、正确、却容易被忘记的散文,这正是机器感的根源。读者往往说不清那样的段落究竟哪里不对,只会觉得它读起来很平,而下面这四个层面正是这种平淡所在。
词语选择是读者最先注意到的层面, 也就是正式、戏剧化的词语出现在它们不该出现的地方。句子节奏则更为隐蔽, 表现为一段文字中每个句子的长度大致相同。标点和格式各自带有自己的特征, 破折号被当作通用连接件使用, 项目符号列表把原本在作者脑中并不是列表的文本切分开来。结构是最不显眼的部分, 它会重述自己的标题, 恰好覆盖三个要点, 然后以对自身的概括作结。
先从词语开始, 这是最容易指出, 也最有文献记录的一层。
AI 过度使用哪些词语?
你会一次又一次看到这些正式、略带戏剧化的词语, "delve"、"underscore"、"showcase" 和 "pivotal" 是记录最充分的一批。Dmitry Kobak 和三位合著者着手识别这种语言。他们分析了 2010 年到 2024 年间 15.1 million 篇 PubMed 摘要, 并识别出一组在 ChatGPT 发布时频率急剧上升的词语。"delve" 上升得最明显, 这项发表于 2025 年 7 月 Science Advances 的研究估计, 它在 2024 年的使用频率约为 2023 年之前的 28 倍。紧随其后的是 "underscore" 和 "showcase"。作者估计, 至少 13.5% 的 2024 年摘要带有 AI 辅助的迹象, 在一些国家和出版机构中这一比例上升到 40% 以上。
模型为何会收敛到这些特定词语, 其原因比这一模式本身更不明确。一项 COLING 2025 研究将 21 个过度代表的词语与模型架构、训练数据以及用于微调聊天机器人的人类反馈进行检验, 发现反馈阶段是最可能的促成因素, 但并不能完全解释这一效应。对此的解释也仍有争议, 2026 年 PNAS 期刊中的一场交锋就对词频变化究竟能在多大程度上直接衡量 AI 使用提出了质疑, 在把这里任何单一数字视为既定事实之前, 这一点值得记住。
这不仅对期刊摘要成立。在一项比较50万篇学生作文和AI生成作文的研究中,研究人员比较了论文的长度和用词,发现人类作文总体更长,词汇也更丰富。在一项针对提交给四个机器学习会议的同行评审的研究中,包括ICLR 2024和NeurIPS 2023,研究人员使用同样的技术估计,评审文本中有6%到15%被LLM实质性修改过。当评审在截止日期临近时提交时,更有可能受到LLM的影响。
| AI过度使用的词或短语 | 谨慎作者会改用的表达 |
|---|---|
| delve (into) | look at, examine |
| underscore | show, stress |
| showcase | present, demonstrate |
| pivotal | main, deciding |
| robust | solid, reliable |
| intricate | complex, detailed |
| meticulous | careful, thorough |
| tapestry | mix, range |
| testament | sign, evidence |
| boasts | has, includes |
| foster | encourage, support |
| garner | gain, attract |
| multifaceted | many-sided, complex |
| holistic | whole, overall |
| nuanced | careful, precise |
| invaluable | useful, valuable |
| realm | field, area |
| embark on | begin, start |
| unlock | open up, make possible |
| interplay | relationship, link |
这些词单独来看都没有问题。方法部分把某项发现称为稳健,是在正确使用这个词,而一位描述复杂法律论证的历史学家并不是在向聊天机器人坦白。看起来像机器生成的,是密度, 三个或四个这样的词挤在同一段里,没有承担任何具体作用,像模型那样堆叠起来,因为每一个词都是独立看来最安全的下一个选择。用 TextPulse 的免费 AI 词语清理器快速检查,就会直接标出这种密度。
为什么 AI 句子的长度总是听起来差不多?
模型构造每个句子的方式,和它构造上一个句子的方式一样,不会在某处把一个观点压缩成六个词,却在别处把它展开成三十个词,所以输出往往始终保持几乎相同的长度。这种变化,或者说缺乏变化,是你可以通过大声朗读一段文字听出来的,这与检测器根据同一底层特征计算出的 burstiness 分数是不同的练习。
两个较小的习惯会在近距离暴露这种节奏。模型喜欢用一个悬垂分词来结束句子,这种结构在不增加信息的情况下暗示其重要性,例如先提出一个主张,再强调需要进一步研究,或者反映该领域更广泛的转变。它也会使用并列结构来显得平衡,类似于该方法不仅高效,而且可扩展。这样说一次,这种结构并不显眼。每一段都这样说,就像一个只替换名词的模板。
三的法则
在短语层面,三项一组也是模型的默认节奏, 一个名词前放三个形容词,列表中给出三个例子,连续三条以相同方式构造的分句。偶尔出现三项一组一直都是英语的一部分。放置得当的三项一组并不是什么症状。关键在于频率。问题不在于三。问题在于三几乎每一段都出现。
计数就足以在没有任何专门训练的情况下发现其中的大部分问题。读一段文字,并标出每个句子的词数。如果你的所有标记都只比前一个多或少几个词,那么节奏就是线索。使用 TextPulse 的 免费 burstiness 检查器 来自动计数并绘制图表,这对一段长到无法逐句凭肉眼判断的文字很有用。
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
破折号和其他标点线索
为什么这种标记成了首选
破折号大概是机器写作中最常被归咎的标点。你可能把它看作那种长破折号,它会替代逗号、冒号或句号,用来连接句子的两部分。破折号并不新,也不是 AI 发明的东西。只要有文体指南存在,从 Chicago 到 AP,它们就一直允许你把它用于强调和插入中断。而且许多职业写作者会有意使用它。
它之所以在机器输出中如此常见,可能原因很平常, 这种标记在经过编辑、专业排版的散文中很常见,而语言模型正是从这类文本中训练出来的,并且它能让句子继续推进,而不必落到句号上。一个被设计为生成流畅、连贯文本的模型会经常使用这种灵活性,比大多数人在手写草稿时更常这样做。
其出现频率会因生成文本的系统而有很大差异。2025年中期的一次并排测试给六个聊天机器人同样的提示,并统计了这种标记的次数, 三个系统在不到六百个词中返回了八次或九次,一个在将近一千个词中用了两次,还有两个完全没有使用。频率是产生你面前这段文字的那个模型的属性,而不是 AI 写作的固定特征。OpenAI 在 2025年11月增加了一个设置,允许用户告诉 ChatGPT 停止使用这种标记并且真正照做,这使得即使是这一线索如今也在一定程度上变成可选的了。
这些都不能使该标记本身成为任何事物的证据。许多谨慎的作者会有意使用它,许多从未接触过 chatbot 的学生论文也会使用它,有时只是因为老师教过他们这样做。真正值得检查的是密度:一页每隔一句就依赖这个标记,与一页有意只用两次的文章,读起来是不同的。TextPulse 的 free em dash remover 会检查这种密度,并针对每一处用法提出逗号、冒号、句号或连字符。
项目符号、加粗文本和标题
同一层面涵盖句子以下的格式决定。正文中间出现的项目符号列表,而作者脑中从未把它当作列表。文档其余部分使用句子式大小写时,标题却使用标题式大小写。每个项目符号开头都有一个加粗短语,像一个迷你标题。这些都不是标点符号,但它们都来自同一个地方, 一个为聊天窗口而格式化的模型,在那里,视觉结构取代了散文通常承担的过渡。
结构与论证形态
最后一层位于句子之上,最难通过替换词语来修正,因为它就是论证本身的形态。机器写成的部分常常先用稍有不同的措辞重述自己的标题,然后依次展开两到三个支持点,不论各自实际重要性如何,都赋予大致相同的分量,最后总结刚才说过的话,而不是补充任何新内容。
一种相关的习惯在较长文本中也经常出现:某一部分先列出某事做得好的地方,然后用 however 之类的词转折,再以同样整齐的三点列出挑战,最后指向一个大概会解决这些问题的未来。真正的论证比这更不平整。人类作者通常更重视其中一个观点,而不是另外两个,会给它更多篇幅,也不欠读者一个对称的收束。
这也是公式化学术写作看起来会与机器写作极为相似的层次,因为方法部分或文献综述本来就应当遵循固定的结构。差别存在于这种结构之内。机器写成的文献综述会按通常顺序提及某个领域的常见要点。人写成的文献综述则会论证哪些要点重要,以及为什么重要,即使是在严格的模板之内,因为它所捍卫的是一个真实立场。
这些迹象能证明一篇文本是 AI 写的吗?
没有任何单一迹象能够证明什么,完整的一组迹象也不能。在编辑或教授的压力下,谨慎的学术写作者可以写出带有其中若干特征的段落,例如缺少代词,但并不需要聊天机器人帮助。非英语母语写作者也可能使用他们在课堂上学到的安全词汇,而被教导使用正式连接词的学生也可能使用这些特征中的许多。词汇表并不能证明不当行为, 这是一种会让谨慎写作者被错误指控的错误。我们应当指出这种错误,而不是默默重复它。
工具能够负责任地做的,是展示这种模式,而不是裁定文本。我们通过 TextPulse 的 AI humanizer 所能提供的,是基于眼前文本对 Human Score 的估计。这是对一份草稿与这些表层模式相符程度的解读,不是任何检测器给出的裁决,也不是对明天另一种工具会说什么的承诺。它是一个你可以用作决策起点的数字,就像拼写检查器会标出一个词,却不会判断其周围句子是否写得好。
上面每一种迹象都有自己单独的一页。词汇本身已在一篇关于 暴露 ChatGPT 的词语 的文章中加以整理,并分别讨论了 em dash 的习惯 以及 模型为何特别偏向某个动词。更广泛的标签也有涉及:AI slop 的含义、AI fluff 的含义,以及一份关于 判断某内容是否由 AI 写成 的实用指南。如果担心的不是别人的文字,而是你自己的草稿,那么还有一篇关于 从你的写作中移除 AI 词语 的文章。
下次你在阅读自己的文字,而其中某处感觉不太对时,不要只是找一个同义词来替换它。试着改为大声读出来。数一数每个句子里的词数。问问自己,每个词在这里究竟起什么作用。早在这一切有名称之前,细心的编辑就是这样审读的。
Frequently Asked Questions
因为一些看起来像机器生成的表层模式,例如正式词汇、统一的句子长度、整齐的三段式结构,也会出现在认真写作但赶工或经过大量编辑的人类文本中。这些只是痕迹,不是来源证明。一段文字可以同时具备这些特征,但仍然完全是你自己的作品。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.