AI Detection

Turnitin 相似度分数与 AI 分数:两份不同的报告

相似度分数和 AI 分数回答的是不同的问题,因此一篇论文在其中一个分数上可能很低,而在另一个分数上很高,但这两个数字都不一定有误。它们各自衡量什么,什么会触发它,以及高分能够和不能证明什么。

5 min
Turnitin similarity vs AI score comparison chart showing two independent report numbers

一份报告上会出现两个数字, 一个相似度分数为 3 percent, 一个 AI 分数为 88 percent。自然的理解是, 它们一定是在衡量同一件事, 因而较低的数字应该意味着较高的数字也很可能不对。事实并非如此。Turnitin similarity vs AI score 是对两个独立系统的比较, 这两个系统检查的是两种不同的内容, 一份提交可以在其中一个上得分很低, 在另一个上得分很高, 而这两个数字都不一定有误。

相似度系统比 AI 系统更早出现, 它的设计是为了捕捉与已存在内容相匹配的文本。AI 系统则更新, 被加入同一份 Similarity Report 中, 作为其自身独立的测量, 其设计是估计一段文字是否读起来像机器生成的, 不论它是否与任何现有内容相匹配。根据 Turnitin 自己的文档, 这两个系统完全独立, 彼此不相互影响。本文其余部分。

Turnitin Similarity vs AI Score, 每个数字分别报告什么

Turnitin 将这两个指标视为捆绑在一个产品中的不同测量, 而不是同一结果的两个视角。Similarity Report 会将一份提交与网页内容、学术出版物以及此前提交的学生论文数据库进行比对, 并返回该提交文本中与数据库中已有内容相匹配的百分比。AI writing detection 则运行完全不同的模型, 作为其自身独立分数被加入同一份报告中, 该模型经过训练, 用于判断一段文字的散文风格与机器生成写作的相似程度, 完全不参考任何外部数据库。关于Turnitin 的 AI 分类器如何得出该数字的更完整机制, 另有说明, 这里重要的是, 它回答的是一个与同一份报告中相似度引擎不同的问题。

相似度分数实际上衡量什么

相似度是一种匹配练习,而不是判断。Turnitin 自身的说明明确指出,该工具并不检查抄袭。它只检查重叠部分,并将解释留给阅读报告的教师。一个正确标出的引文,一个在整个子领域中共享的方法部分短语,一份参考文献表,其格式与期刊中每篇论文的参考文献表格式一致, 这些都可能被记为匹配,因为系统统计的是重叠的文本字符串,而不是判断这种重叠是否正当。

这也就是为什么相似度得分为零所证明的内容,比表面看起来更少。它只意味着,提交内容中没有在 Turnitin 的索引来源中其他地方出现过的、长而连续的一段文本。它并不能说明其中那些句子是如何生成的,因为生成一个在数据库中与任何内容都不匹配的句子,并不等同于生成一个语言模型不会预测出来的句子。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

AI 分数实际上衡量的是什么

AI 分数没有可供比对的数据库。分类器读取提交的文字,并根据它从人类写作和 AI 生成写作的示例中学到的模式,估计这段文字来自模型而非人的可能性。这个估计完全不取决于某个精确句子是否曾经在任何地方出现过。一个句子可以完全独特,在这次提交之前从未被任何人输入过,但如果它的用词和节奏符合语言模型通常会产生的模式,它仍然可能在统计上看起来像 AI 输出。

这与更广泛的 AI 检测器实际上如何工作 的完整说明所涵盖的统计领域相同, 即词级可预测性和句子级节奏,合并为一个文档分数。Turnitin 版本的这种分类器是专有的,但其基本前提, 即生成文本往往比人类写作更符合统计上的典型模式, 与这一类别中的每一种工具背后的原理相同。

相似度分数AI 分数
它衡量什么提交文本与其他已索引文档有多少内容相匹配这篇文章的行文在多大程度上类似于统计上典型的 AI 生成写作
什么会触发高数值长引文、该领域常见的固定表述、重复使用的材料,或与先前提交内容相匹配整篇文档中句子节奏一致,且用词始终可预测
高数值不能证明什么匹配文本被不当使用。正确引用的材料仍然可能被登记为匹配。任何单个句子都是由 AI 生成的。分类器读取的是文档的整体模式,而不是孤立的一行。

论文可以同时有 0 Percent 相似度和 90 Percent AI 分数吗?

可以,而且这种组合并不是故障。这两个分数回答的是不同的问题,因此高和低的四种组合都可能出现,而每一种都意味着文本是如何生成的不同情况。

  • 低相似度,低 AI 分数: 普通的原创写作,同时也呈现出典型的人类变异。对于大多数真实学生作业来说,这是常见情况。
  • 低相似度,高 AI 分数: 原创句子,并非从任何地方复制而来,但在统计上读起来是可预测的,正如生成文本往往呈现的那样。未经编辑的 AI 写作的特征,没有人从现有来源对其进行改写。
  • 高相似度,低 AI 分数: 文本与现有的人类写作来源高度匹配,但没有分类器将其与生成内容联系起来的那种统计平坦性。被复制的文本,由较旧的工具而不是较新的工具发现。
  • 高相似度,高 AI 分数: 文本与一个现有来源相匹配,而该来源本身就是 AI 生成的,例如先前提交的 AI 写作论文,或已经从开放网络中被索引的一页 AI 生成文本。

这些组合都不需要软件方面的任何特殊处理。它们源于这样一个事实,即一个系统检查是否匹配,另一个系统检查是否符合某种模式,而一段文本可以具有这两种属性中的任一种、两者兼有,或者两者皆无。

高 AI 分数说明什么,以及不能说明什么

高 AI 分数是统计估计,不是从文本中逼供出来的供认。它表示摆在分类器面前的这段文字,在用词和节奏上,类似于模型在训练中被关联为 AI 生成的那类写作。它并不能把某个具体句子确定为机器写成,也不知道文档实际上是如何生成的,只知道它完成之后读起来是什么样子。TextPulse 对其自身数值也持同样立场, 它报告的是根据面前文本计算出的估计 Human Score,而不是关于究竟是哪种工具, 如果有的话, 接触过该文档的裁定。

对这两个数值中的任何一个, 较低的相似度分数或较高的 AI 分数, 实际上的回应都是一样的, 把它当作进一步查看的理由,而不是一眼就接受或否定的结论。草稿、笔记和版本历史能够说明文档实际上是如何写成的,而百分比在任何一份报告中都做不到这一点。任何想知道分类器在自己的草稿中究竟对什么作出反应的人,都可以在生成任何报告之前,借助一个免费 perplexity 检查器亲自看到同样的词级模式。

TextPulse 的免费工具集合涵盖了在草稿交给教师之前值得检查的其他统计层面,不仅仅是这里比较的这两个。

一旦这两个数值被区分开来,接下来的问题就是什么才算是合适的 Turnitin 分数。对于学生最常遇到的另一种检测器,GPTZero 的工作原理在其单独页面中有说明。

这两个数字将继续并排出现在同一份报告中,而且匆忙阅读的人仍会把它们当作一个数字来理解。知道每一个数字实际上在回答哪个问题,才能把一对令人困惑的百分比转化为两条彼此独立且有用的信息。

XLinkedInFacebook

常见问题

Turnitin 相似度与 AI 分数的区别在于各自检查的内容不同。相似度分数报告提交内容中有多少与 Turnitin 的网页、出版物和以往学生论文数据库中的文本相匹配。AI 分数则是一个独立的测量,用于估计这段文字在多大程度上读起来像机器生成的内容,完全不参考任何数据库。Turnitin 自己的文档说明,这两个数值不会相互影响。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。