AI Detection

Turnitin 相似度分数与 AI 分数:两份不同的报告

相似度分数和 AI 分数回答的是不同的问题,因此一篇论文在其中一个分数上可能很低,而在另一个分数上很高,但这两个数字都不一定有误。每个分数衡量什么,什么会触发它,以及高分能够和不能证明什么。

更新于 5 min
Turnitin similarity vs AI score comparison chart showing two independent report numbers

一份报告上出现两个数字, 一个是 3 percent 的相似度分数, 另一个是 88 percent 的 AI 分数。直观上看, 它们似乎必须在衡量同一件事, 因此较低的数字应该意味着较高的数字也大概不对。但事实并非如此。Turnitin similarity vs AI score 是对两个独立系统的比较, 这两个系统检查的是两种不同的内容, 一份提交可以在其中一个上得分低, 在另一个上得分高, 而这两个数字都不一定有误。

它比 AI 那个更早出现, 用于捕捉与已存在内容相匹配的文本。它更新一些, 被加入同一个 Similarity Report 中, 作为其自身独立的测量, 用于估计一段文字是否读起来像机器生成的, 不论它是否与任何内容匹配。根据 Turnitin's own documentation, 它们完全独立, 彼此不相互影响。本文其余部分也是如此。

Turnitin similarity report showing 12% overall similarity, with match groups of 115 not cited or quoted at 9% and 41 missing quotations at 3%, top sources across internet, publications and student papers, and zero integrity flags
相似度报告回答一个问题, 这段文本有多少与 Turnitin 数据库中已存在的内容相匹配。这里是 12%, 被分成匹配组和来源, 且没有触发任何完整性标记。
Turnitin AI writing overview showing 71% detected as AI, made up of 18 segments marked AI-generated only at 71% and zero segments marked AI-paraphrased, beside a caution that reviewers should understand the limits of AI detection
AI 写作报告是一个独立文档,拥有自己的编号。同一篇论文显示 71% 被检测为 AI,由仅 AI 生成和 AI 改写文本两部分构成,旁边还印有 Turnitin 对检测局限性的警示。

Turnitin 相似度与 AI 分数:每个数字报告什么

Turnitin 将这两者视为不同的测量,它们被整合在同一产品中,而不是同一结果的两种视图。相似度报告将提交内容与网页内容、学术出版物以及先前提交的学生论文数据库进行比对,并返回提交文本中与数据库中已有内容相匹配的百分比。AI 写作检测则运行完全不同的模型,它被加入同一份报告中,作为一个独立分数,该模型旨在判断一段文字的散文风格与机器生成写作的相似程度,完全不参考任何外部数据库。关于 Turnitin 的 AI 分类器如何得出该数字 的更完整机制,另有专门说明。这里需要关注的是,它回答的问题与同一份报告中的相似度引擎并不相同。

相似度分数实际衡量什么

相似度是一种匹配练习,而不是判断。Turnitin 自身的说明明确指出,该工具并不检查抄袭。它只检查重叠部分,并将解释留给阅读报告的教师。一个正确标出的引文,一个在整个子领域中通用的方法部分短语,一份参考文献列表,其格式与期刊中每篇论文的参考文献列表格式一致, 这些都可能被记录为匹配,因为系统统计的是重叠的文本字符串,而不是判断这种重叠是否正当。

这也是为什么相似度分数为零所证明的内容,比表面看起来更少。它表示提交内容中没有在 Turnitin 的索引来源中其他地方出现过的、长而连续的文本片段。它并不能说明其中那些句子是如何生成的,因为生成一个在数据库中找不到匹配的句子,与生成一个语言模型不会预测出来的句子,并不是同一种能力。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。

免费开始

AI 分数实际衡量的是什么

AI 分数没有可供核对的数据库。分类器会读取提交的文章,并根据它从人类写作和 AI 生成写作的示例中学到的模式,估计这段文字更可能来自模型还是来自人。这个估计完全不取决于某个精确句子是否曾经在任何地方出现过。一个句子可以完全独特,在这次提交之前从未被任何人输入过,但如果它的用词和节奏符合语言模型通常会生成的模式,它仍然可能在统计上看起来像 AI 输出。

这与更广泛的 AI 检测器实际上如何工作 的说明中完整讨论的统计领域是相同的, 也就是词级可预测性和句子级节奏,合并为一个文档分数。Turnitin 版本的这种分类器是专有的,但其底层前提, 即生成文本往往在统计上比人类写作更典型, 与这一类别中的每一种工具背后的基本逻辑相同。

相似度分数AI 分数
它衡量什么提交文本中有多少与其他已索引文档相匹配散文在多大程度上类似于统计上典型的 AI 生成写作
什么会触发高分长引文、常见的学科特定措辞、重复使用的材料,或与先前提交内容相匹配整篇文档中句子节奏一致,且词语选择始终可预测
高分不能证明什么匹配的文本被不当使用。正确引用的材料仍然可能被识别为匹配。任何单个句子都是由 AI 生成的。分类器读取的是文档的整体模式,而不是孤立的一行。

一篇论文可以有 0 Percent 相似度和 90 Percent AI 分数吗?

可以,而且这种组合并不是故障。这两个分数回答的是不同的问题,因此高低的四种组合都可能出现,而且每一种都意味着文本是如何产生的不同情况。

  • 低相似度,低 AI 分数, 普通的原创写作,同时也呈现出典型的人类变异。对于大多数真实的学生作业来说,这是常见情况。
  • 低相似度,高 AI 分数, 原创句子,并非从任何地方复制而来,但在统计上读起来像生成文本通常呈现的那样可预测。它是不经编辑的 AI 写作的特征,没有人从现有来源对其进行改写。
  • 高相似度,低 AI 分数, 文本与现有人类写作来源高度匹配,但没有分类器将其与生成内容联系起来的那种统计平板性。被复制的文本,由较旧的工具而不是较新的工具发现。
  • 高相似度,高 AI 分数, 文本与现有来源相匹配,而该来源本身就是 AI 生成的,例如先前提交的 AI 写作论文,或已经从开放网络中被索引的 AI 生成文本页面。

这些组合都不需要软件端有任何异常之处。它们之所以成立,是因为一个系统检查是否匹配,另一个系统检查是否符合某种模式,而一段文本可以同时具有其中任一属性、两者兼具,或者两者皆无。

高 AI 分数能证明什么,不能证明什么

高 AI 分数是一种统计估计,而不是从文本中提取出的供认。它表示,放在分类器面前的这段文字,在用词和节奏上,与模型训练时被用来关联 AI 生成的写作类型相似。它不能把某个具体句子确定为机器写成,也不了解文档实际上是如何生成的,只知道它完成后读起来是什么样子。TextPulse 对其自身数值也持同样立场, 它报告的是根据面前文本计算出的估计 Human Score,而不是关于是否有某个工具接触过该文档的裁定。

对于这两个数值中的任意一个, 无论是较低的相似度分数还是较高的 AI 分数,实际应对方式都相同, 把它当作进一步查看的理由,而不是一眼就接受或否定的结论。草稿、笔记和版本历史能够说明文档实际上是如何写成的,这一点任何百分比都无法做到,无论是哪份报告。任何想知道分类器在自己的草稿中究竟对什么作出反应的人,都可以先用一个免费 perplexity 检查器亲自看到同样的词级模式,然后再生成任何报告。

TextPulse 的免费工具集合涵盖了在草稿交到教师手中之前值得检查的其他统计层面,不只是这里比较的这两个。

一旦这两个数值分开来看,下一个问题就是什么才算是合适的 Turnitin 分数。对于学生最常遇到的另一种检测器,GPTZero 的工作原理在其单独页面中有说明。

这两个数字将继续并排出现在同一份报告中,而且在匆忙阅读的人看来,它们仍会被当作一个数字来理解。弄清楚每一个数字实际上在回答哪个问题,才能把一对令人困惑的百分比,转化为两条彼此独立且有用的信息。

XLinkedInFacebook

常见问题

Turnitin 相似度与 AI 分数的区别在于各自检查的内容不同。相似度分数报告提交内容中有多少与 Turnitin 的网页、出版物和以往学生论文数据库中的文本相匹配。AI 分数则是一个独立的测量,用于估计这段文字在多大程度上读起来像机器生成的内容,完全不参考任何数据库。Turnitin 自己的文档说明,这两个数值彼此不会相互影响。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化的最新动态

获取关于学术写作、AI 检测和人性化处理的提示,直接发送到你的收件箱。

无垃圾邮件。可随时取消订阅。