免费困惑度检测器 衡量词级可预测性

困惑度衡量的是一个狭窄的问题, 即语言模型对句中下一个词有多意外。这个免费困惑度检测器从你真正可以修改的一侧近似这一点, 即词语变化, 以长度稳健的 MATTR 指标、普通 type-token ratio, 以及草稿最依赖的词语列表来评分。狭窄而重复的词汇会让模型更容易猜中, 也会出于同样原因降低读者的注意力。句子层面的节奏是另一个问题, 由 burstiness 检测器处理, 本页只关注单个词。

使用对长度更稳健的 MATTR 分数、你的词元比,以及你的草稿最依赖的词语来估计词汇变化。

你的文本

0 / 1,000 词

词汇变化
你的估计词汇变化会显示在这里,包括你的类型-标记比,以及草稿中重复最多的词。词汇多样性较低是使行文显得平淡、机械的特征之一。
粘贴后即刻评估词汇多样性计算在你的设备上运行
使用 TextPulse.ai 的学术研究人员使用 TextPulse.ai 的学术研究人员使用 TextPulse.ai 的学术研究人员使用 TextPulse.ai 的学术研究人员使用 TextPulse.ai 的学术研究人员使用 TextPulse.ai 的学术研究人员

84,000+

国际研究人员

4.9

平均评分

深受在以下期刊发表论文的研究人员信赖

Elsevier logoSpringer Nature logoWiley logoIEEE logoTaylor & Francis logoSAGE Publishing logoCambridge University Press logoOxford University Press logoMDPI logo

困惑度检测器如何为草稿评分

01

添加要评分的文本

一段文字就足以开始, 完整章节则能得到最稳定的结果。任何研究或 AI 辅助草稿都适用。

02

查看词汇评分

MATTR 采用 0-100 量表并附带判断区间, 同时显示你的 type-token ratio 和独特词数。

03

处理真正重要的重复

重复词语列表会指出草稿依赖过少词语的地方。围绕关键术语变换动词和连接词, 术语本身保持不变。

本检测器如何衡量词级可预测性

对任何长度都稳定

普通 TTR 会随着文本增长而下降, 仅仅因为连接词和冠词必须重复出现, 这会悄然惩罚较长的提交。这里的核心数值是 MATTR, 以滚动 50 词窗口计算, 因而两页内容和十页章节都按同一标准衡量。

指出重复最严重的词

单一数值不能告诉你该改什么。词语列表会准确排序哪些术语承担了过多篇幅, 并先过滤掉常见功能词。

本网站其他位置使用的同一指标

这与 TextPulse humanizer 编辑视图中 perplexity 卡片所示的词汇变化计算完全相同, 这里只是在你的设备上运行。

简单测量

输出的是词汇数据, 即一个分数、一个比率和一个列表。它们都不附带作者性判断, 因为这些数字都无法诚实地支持这种判断。

困惑度衡量什么, 又遗漏什么

语言建模赋予了困惑度最初的任务, 即衡量模型对其尚未见过的序列下一个 token 的预测效果。若模型因前文采用熟悉、陈旧的表达而持续猜中, 就会得到较低数值。若作者持续选择更具体、较少见的词语, 使模型的首选猜测不断落空, 就会得到更高数值。这个术语在工程领域之外传播开来, 是因为读者注意到一种粗略对应, 即对机器而言可预测的文本, 往往也会因同样的根本原因而对翻页的人显得可预测, 这也是专为识别 AI 写作而构建的检测器最初就按可预测性评分的原因

网页无法运行真正的语言模型,因此这个检查器只能衡量无需模型即可获得的困惑度中的一个要素, 也就是词汇重复的程度。基础指标 type-token ratio 统计不同词与总词数的比例,它有一个已知缺陷, 随着篇幅增长,这个比率会自动下降,因为无论作者如何变化其他部分,功能词都必须反复出现。MATTR 通过在文本上滑动一个固定的 50 词窗口,并对每个位置内的比率取平均来修正这一点,这使得一篇短摘要和一整章能够放在可比的基础上。较低的结果几乎总是源于同一个原因, 少数几个词承担了大部分工作,这种可测量的信号我们的文体特征分类研究发现,它承载了人类与 AI 学术写作之间大部分区分。

并非所有重复都是值得修正的缺陷。一个研究如果只在文中首次点名某个构念,那么在稿件的其余部分就必须以完全相同的方式继续命名它,而当审稿人发现该名称在同义词之间漂移时,他们会把它视为定义层面的问题,而不是风格选择。值得移除的重复通常出现在这些已固定术语的周围,而不是术语本身:动词、连接词、以及那些承担周边说明工作的描述性短语。把一个疲惫的动词换成更精确的动词,作为附带效果会提高得分,因为句子实际表达得更多,这两件事应当按这个顺序发生。

措辞选择只是让散文读起来自然的一个维度。句子层面的节奏由 burstiness checker 单独衡量;AI 起草时过度使用的特定词汇会由 AI word cleaner 单独处理。当需要重写可预测的措辞而不是衡量时,这项工作由 TextPulse humanizer 完成。

Which words to vary, and which to keep fixed

A vocabulary score rewards editing some parts of a draft and punishes editing others. Telling the two apart is most of the revision skill.

Vary this

Everyday connective language

A paragraph that runs "the results show" three times has a variety problem with a one-line fix: results can confirm, narrow, contradict or complicate, and every one of those verbs says something more exact than "show". The same logic covers connectors: however, although, whereas and despite each draw a distinction that a recycled "but" erases.

Hold constant

Defined constructs and key terms

A paper that names "working memory capacity" once has to keep naming it exactly that on every later page. Swapping in "cognitive load" halfway through for variety's sake changes the claim, and a reviewer reads that kind of drift as a definitional problem, not a style choice. Expect your key terms to top the repeated-word list this checker produces; that repetition is doing its job.

Skip this

Synonym padding

Trading a plain word for a rare one to move the number does not help: "use" says nothing more once it becomes "utilize". Real variety comes from making a more specific claim, not from dressing up an identical one. If a swap adds no precision, the plain word was already correct.

谁会使用困惑度检查器

本科生和研究生写作者

找出一篇论文依赖哪些词,然后练习用新的措辞来承载论证框架,而不是重复它。

教师和博士研究人员

在审稿人于稿件中多次遇到某个重复动词之前就将其发现,尤其是在快速起草的结果和讨论部分。

内容和 SEO 团队

重复的词汇对人和排名系统来说都显得像模板化内容。在署名发布前先运行一次。

第二语言写作者

第二语言中较小的工作词汇量会首先表现为重复。随着你的主动词汇范围逐步扩大,跟踪分数变化。

困惑度检查器常见问题

还有更多问题吗? 浏览完整常见问题

可预测的措辞很容易被识别。
修正需要贯穿整篇草稿。

TextPulse humanizer 会在整篇手稿中重写词汇、措辞和句子节奏,同时保持含义和你的术语不变,并将每一处修改都显示在修订痕迹中,供你逐行接受或拒绝。