AI Detection

如何提高写作中的困惑度和句子变化度

有意提高困惑度和句子变化度,通常只是意味着把文章写得更好, 也就是变化句长,混合从句结构,并选择真正贴切的词,而不是仅仅在扫描时看起来合适的词。这里有具体的前后对比例子,以及何时这会从写作技巧变成坏主意。

6 min
Before and after example showing how to increase burstiness and perplexity by varying sentence length and word choice

搜索如何提高 burstiness,大多数结果都会承诺一种捷径, 例如同义词替换,随手插入一个很长的句子,或者顺带故意违反一点语法规则。实际上,真正推动数值变化的并不是这些。提高一段文字中的 perplexity 和 burstiness,主要是句子结构的问题,这正是细心的编辑本来就会实践的技艺,只不过这里是有意为之,而不是出于习惯。

这是一篇实用文章,不是机制说明。burstiness 背后的公式,以及这个术语究竟从何而来,已在 关于 burstiness 实际衡量什么的配套文章中说明,perplexity 也有一篇承担同样任务的配套文章。这里接下来讨论的是技巧, 也就是构造句子的具体方法,使两项指标都更高,并附上修改前后的例子,以及对何时这不再是写作建议而会变成坏主意的诚实说明。

如何通过有意变化句长来提高 burstiness

Burstiness 衡量的是句子之间的分布差异,而不是平均长度,所以最快的手段是有意扩大这种差异,而不是让整段文字慢慢滑向一种舒适的固定长度。大多数初稿都会落入一种没人有意选择的节奏, 三个十二到十六个词的句子会让人觉得安全,于是第四个和第五个也会在无人决定的情况下沿用同样的模式。

修改前: 'The sample size limited statistical power. The results should be interpreted with caution. Future research should address this limitation with larger cohorts.' 三个句子,每个八到十一词,始终保持同一种语体。修改后: 'The sample was little, which limited statistical power in ways worth saying plainly rather than hedging around. That matters. A single larger cohort could shift the effect size enough to change which claims the paper is entitled to make.' 内容相同,但分布完全不同。

目标根本不是不惜一切代价追求最大化的多样性。若一段文字在每一行都交替出现一个四十词的句子和一个两个词的句子,读起来更像一种习惯性动作,而不是节奏。其目的更接近一个人自然地口头展开解释的方式, 当一个想法需要空间时,用一个较长的铺垫句, 当它不需要时,用一个简短的句子。

混合从句结构,而不是重复同一种结构

一段文字即使词数有变化,如果每个句子的构造方式都相同, 主语,动词,宾语,句号,重复, 也会显得平淡。Burstiness 不仅回应长度,也回应结构上的多样性,因为读者,或者预测下一个可能结构的模型,会被一个以从属从句开头,或以疑问句开头的句子打乱,而此前几个句子都以主语开头。

之前, “该干预降低了焦虑评分。该效果在不同年龄组中都成立。其机制仍不清楚。” 连续三个以主语开头的句子。之后, “干预后,焦虑评分下降了。它是否在所有年龄组中都成立,需要再核查一次,而结果确实如此。仍然缺少的是一种能够解释其原因的机制。” 这两个版本之间,底层发现没有任何变化,变化的只是读者必须经过的结构,才能抵达这一发现。

这并不是为了复杂而复杂。前置的从属从句只有在确实为后面的句子提供必要铺垫时才有其位置, 例如时间标记、条件或让步。若只是为了多样性而生硬添加,且没有任何理由支撑,它读起来就完全像它本来的样子, 只是装饰,而不是结构。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

选择具体的词,而不是预期中的词

Perplexity 作用于词语层面,因此上面的句长处理只承担了一半的工作。模型会给泛化的下一个词分配很高的概率, significant, notable, important,或者同类文章中成千上万篇都会在那个位置选用的任何词。写出实际的数字、实际的机制,或者审稿人提出的实际异议,给模型带来的意外远远大于那个只是稳妥的词。

之前: 'The findings were major and have important implications for the field.' 这句话由审稿人预期的词语构成,顺序也符合审稿人的预期。之后: 'Three of four cohorts cleared the threshold; the fourth missed it by two points, which the discussion section never explains.' 第二个版本只能描述这项特定研究。第一个版本几乎可以放在任何学科中任何论文的结尾。

这并不意味着在句子中填充不必要的细节。它的意思是保留已经真实且具体的细节,而不是把它们抹平为初稿在截止期限前容易写出的通用短语。一个精确的数字,一个命名的限制,一个特定的反例,之所以更难生成,是因为它们更不可预测,而它们也恰好是更好的句子。

让一个短句接在长句之后落地

前两种技巧是逐句起作用的。这一种关注的是一个句子相对于其邻句所起的作用。一个长句,如果在限定语之后再叠加一个从句,再加一个具体细节,就会制造出一个开口。紧接着用一个简短的句子打断它,会破坏读者以及分类器原本会进入的节奏。

之前: 'The treatment group showed improvement across three of the four measures tracked, and while the fourth measure didn't reach statistical significance, the trend was directionally consistent with the other three, suggesting the null result there may reflect a power issue rather than a true absence of effect, a possibility the original protocol didn't expect.' 一个句子承载了五个想法。之后: 'The treatment group improved on three of four measures. The fourth didn't reach significance, though the trend pointed the same way. That gap was not in the original protocol.' 长版本和短版本最终表达的意思几乎相同,但只有其中一个给读者留下了喘息的空间。

每个段落只用一个短句,才算物尽其用。连续出现几个短句,就开始像从广告文案里借来的习惯性动作,每次三个词,这本身就是一种单一化,而且和始终不变一样,都会有效地削弱段落的层次。

上面并非每一种技巧都作用于同一个杠杆。有些更能改变 perplexity,有些更能改变 burstiness,还有少数会同时改变两者。

技巧主要改变原因
变化句长Burstiness扩大最短句和最长句之间的差距,而这正是基于离散度的指标所追踪的内容
混合从句结构两者打破了从一句到下一句保持固定模式的预期
选择具体词语Perplexity一个有名有实的细节,比一个泛泛的占位说法,对模型造成的意外更大
长句之后接短句Burstiness制造出方差计算旨在捕捉的那种鲜明对比

为可读而写,不是为分数而写

上面的每一种技巧,本质上也只是良好的编辑。变化句长,混合从句结构,不写安全的概括,而是点明具体细节, 即使完全不关心 AI 检测的编辑,也会出于同样的原因做出同样的修改,因为这样读起来更好。这种重叠并非偶然。细心的读者和 perplexity 计算,回应的是写作中的同一个属性, 也就是其中有多少内容在真正发挥作用,而不是用预期中的短语填充篇幅。

这种重叠在目标从写得好转向打败某个数字的那一刻就会瓦解。仅仅为了抬高平均值而故意拉长一句话,故意把一个结构写得别扭,或者为了稀有而不是为了恰当去选一个词,这一切都会提高分数,却让写作变得更差,这是一笔糟糕的交易,甚至在考虑它对真正评分或审阅的人读起来如何之前就是如此。检测器也从来不是房间里唯一的读者,而是为了迎合某一个统计指标而写出的散文,往往谁也迎合不了。

TextPulse 自己的 免费 perplexity checker免费 burstiness checker 正是为这种自我检查而设计的, 粘贴一份草稿,看看它处于什么位置,再判断一段平直的文字究竟是值得修改的文体问题,还是仅仅一种猜测。TextPulse 的其余 免费工具集合 覆盖了同一问题的其他层面,词语选择、结构、语气,提供比单独任一指标更完整的判断。

同样的技巧,如果不附带该指标来描述,就是 在学术写作中变化句子长度。它值得与更广泛的问题结合起来看,即 为什么 AI 文本会被检测出来,这样修改才能始终针对原因。

这一切都不要求相信单一数字能够说明一篇写作的全部真相,考虑到这些指标如何纳入对 AI 检测器实际如何工作 的更完整说明,这一点值得记住。一段朗读起来顺畅、留有呼吸空间,并且至少有一句只能由真正了解材料的人写出的段落,往往会自行处理好其余部分。

XLinkedInFacebook

常见问题

如何提高句子变化度,关键在于拉开最短句和最长句之间的差距,而不是让每个句子的长度都接近相同。由三个连续的十二词句子组成的段落,几乎没有变化幅度。用一个短句和一个更长、更详细的句子打破这种模式,会立刻提高这一指标,而且通常读起来也更好。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。