免费困惑度检测器 衡量词级可预测性
困惑度只衡量一件很窄的事, 即语言模型对句子中下一个词有多意外。这个免费困惑度检测器从你真正可以修改的一侧近似这一点, 即词语变化, 采用对长度更稳健的 MATTR 指标、普通的 type-token ratio, 以及一份草稿最依赖的词语列表进行评分。狭窄、重复的词汇会让模型更容易猜中, 也会让读者更难保持注意力, 原因相同。句子层面的节奏是另一个问题, 由 burstiness 检测器处理, 本页只关注单个词。
使用对长度更稳健的 MATTR 分数、你的 type-token ratio,以及草稿中最常依赖的词语,估计词汇变化。
0 / 1,000 词
84,000+
国际研究人员
平均评分
受到发表在以下期刊中的研究人员信赖
困惑度检测器如何为草稿评分
添加要评分的文本
一段文字就足以开始, 完整章节则能提供最稳定的读数。任何研究稿或 AI 辅助草稿都可以。
查看词汇评分
在 0-100 量表上的 MATTR, 附带判定区间, 以及您的 type-token ratio 和唯一词计数。
处理真正重要的重复
重复词列表会指出草稿过度依赖哪些词。请围绕关键术语调整动词和连接词, 术语本身保持不变。
本检测器如何衡量词级可预测性
对任何长度都保持稳定
普通 TTR 会随着文本变长而下降, 只是因为连接词和冠词必须重复出现, 这会悄然惩罚较长的提交。这里的核心数值是 MATTR, 以滚动的五十词窗口计算, 因此两页的章节和十页的篇章都按同一标准衡量。
指出重复最严重的词
单一数值并不能告诉您该改什么。词语列表会准确排序出哪些术语承担了过多篇幅, 并先过滤掉常见功能词。
本网站其他位置使用的相同指标
这与 TextPulse humanizer 编辑视图中困惑度卡片所示的词汇变化计算完全相同, 这里只是在您的设备上运行。
直接的测量
输出的是词汇数据, 即一个分数、一个比率、一份列表。它们不附带作者身份判断, 因为这些数字都不能诚实地支持这种判断。
困惑度衡量什么, 又遗漏什么
语言建模赋予了困惑度最初的任务, 即衡量模型对一个尚未见过的序列的下一个 token 预测得有多好。若模型总能猜对, 因为其前方文本依赖熟悉、陈旧的措辞, 就会得到较低的数值。若模型的首选猜测总是出错, 因为作者不断选择具体且不那么常见的词语, 就会得到较高的数值。这个术语在工程领域之外传播后, 读者注意到一种粗略对应, 即对机器而言显得可预测的文本, 往往也会对翻页阅读的人显得可预测, 原因在于同一层面的基础机制。
网页无法运行真正的语言模型,因此这个检查器衡量的是在没有模型时仍可获得的困惑度成分之一, 也就是你的词汇重复了多少。基础指标,type-token ratio,统计不同词数与总词数的比例,但它有一个已知缺陷, 随着篇幅增长,这个比例会自动下降,因为无论作者如何变化其他内容,功能词都必须反复出现。MATTR 通过在文本上滑动一个固定的五十词窗口,并对每个位置内的比例取平均来修正这一点,这使得一篇简短摘要和一整章内容可以放在可比的基础上。较低的结果几乎总是源于同一个原因, 少数几个词承担了大部分工作。
并非所有重复都值得修正。一项首次命名某个概念的研究,在整篇手稿中都必须始终使用同一个名称,而审稿人如果发现该名称在同义词之间漂移,会将其视为定义问题,而不是文体选择。值得删除的重复,出现在这些固定术语周围,而不是术语内部, 即动词、连接词、以及承担周边表达功能的描述性短语。用一个更准确的动词替换一个陈旧的动词,会提高分数,但这只是句子实际表达更多内容的副作用,而这两件事本来就应该按这个顺序发生。
词语选择只是自然可读散文的一个维度。句子层面的节奏由 burstiness checker 单独测量, AI 起草中常见的特定词汇则由 AI word cleaner 单独处理。当某种可预测措辞需要重写而不是测量时,这就是 TextPulse humanizer 的工作。
Which words to vary, and which to keep fixed
A vocabulary score rewards editing some parts of a draft and punishes editing others. Telling the two apart is most of the revision skill.
Everyday connective language
A paragraph that runs "the results show" three times has a variety problem with a one-line fix: results can confirm, narrow, contradict or complicate, and every one of those verbs says something more exact than "show". The same logic covers connectors: however, although, whereas and despite each draw a distinction that a recycled "but" erases.
Defined constructs and key terms
A paper that names "working memory capacity" once has to keep naming it exactly that on every later page. Swapping in "cognitive load" halfway through for variety's sake changes the claim, and a reviewer reads that kind of drift as a definitional problem, not a style choice. Expect your key terms to top the repeated-word list this checker produces; that repetition is doing its job.
Synonym padding
Trading a plain word for a rare one to move the number does not help: "use" says nothing more once it becomes "utilize". Real variety comes from making a more specific claim, not from dressing up an identical one. If a swap adds no precision, the plain word was already correct.
谁会使用困惑度检查器
本科生和研究生作者
找出一篇论文依赖哪些词语,然后练习用新的措辞替换论证框架,而不是重复它。
教师和博士研究人员
在审稿人于手稿中多次遇到某个重复动词之前先发现它,尤其是在快速起草的结果和讨论部分。
内容和 SEO 团队
重复的词汇对人和排名系统来说都像模板化内容。在署名前先运行一次检查。
第二语言写作者
第二语言中较小的工作词汇量最先表现为重复。随着你的主动词汇范围逐渐扩大,持续跟踪分数。
可预测的措辞很容易被识别。
修正需要贯穿整篇草稿。
TextPulse humanizer 会在整篇稿件中重写词汇、措辞和句子节奏,同时保持原意和你的术语不变,所有修改都会以 tracked changes 显示,供你逐行接受或拒绝。