什么是合格的 Turnitin 分数?
Turnitin 不公布可接受的相似度百分比,机构会自行制定指导标准。本文解释了究竟是什么因素导致分数偏高或偏低,为什么引文和参考文献列表会使分数升高而并无问题,以及如何阅读数字背后的匹配细分,而不是只看数字本身。
一名学生被导师告知,低于十五 percent 都可以。另一名同样在同一系里的学生,其论文在走廊里被标记为十二 percent,因为其中三个百分点落在一个连续的段落内,附近没有引号。两人都正确理解了 Turnitin 的相似度分数。该工具从一开始就不是为了给出一个单一的及格或不及格数字而设计的。
那么,什么才是一个好的 Turnitin 分数?并不存在这样的数字。Turnitin 不公布可接受的百分比,不对提交内容评分,并且明确表示,这个数值本身并不能衡量抄袭。每所机构都会制定自己的指导意见,而且往往其中的每位导师也会如此,因此同一份报告在一个办公室里看起来平平无奇,在隔壁办公室却可能令人担忧。真正值得学习的,是如何解读其背后的内容。

什么是一个好的 Turnitin 分数?
Turnitin 从未公布过可被视为良好、安全或可接受的数字, 原因很明确, 相似度分数衡量的是提交内容中有多少文本与 Turnitin 数据库中已有文本相匹配, 而不是这些重叠是否被不当使用。高分完全可能来自被正确引用和标注的材料。低分也可能高于一篇论文, 该论文对某一来源进行了足够接近的改写, 以至于会让阅卷人感到担忧, 但却完全不会触发匹配引擎。把这个数字当作成绩来读, 就是把工具的用途理解反了。
像 10 到 20 percent 这样的数字作为一种非正式经验法则被广泛流传,在论坛和学习指南中反复出现,直到它开始听起来像是官方标准。它并不是官方标准。Turnitin 并未设定这样的数字,而一种忽视文档长度、引文密度和学科惯例的经验法则,一旦遇到真正的论文就会失效。由 30 个正确引用的来源构成的文献综述,仅凭引文本身就可能超过 20 percent。单个措辞接近原文但没有引号的段落,即使低于 5 percent,也仍然可能是更严重的问题。
相似度分数实际上衡量的是什么
Turnitin 对其工具的描述几乎正是如此。Boise State University 的说明,借用了 Turnitin 自己的表述,解释说,相似度分数是论文内容与 Turnitin 数据库中已有材料相匹配的百分比,而这个百分比本身并不是对论文是否包含剽窃材料的判断。这一区分确实在发挥作用, 匹配是机械性的,是一串词语与别处另一串词语的对应,而判断这种重叠是否得到了恰当标注,则需要人来完成,而不是算法。
匹配所依据的数据库有意设计得很广泛, 包括当前和归档的学生提交内容、开放网络,以及大量学术出版物。上述内容都不会被读取其含义。系统只会找出重叠的词语字符串,并报告它们覆盖了提交内容的多少,因此,带引号的句子和未标明出处而直接复制的句子,可能产生完全相同的匹配结果。只有报告的详细视图才能显示二者的区别。
为什么高分完全可能是正当的
学术写作中的两个常见特征就足以解释其中大部分情况。被引用的段落会按设计产生匹配,因为这些词语是有意复制并在页面上标明为他人所有。参考文献列表同样会稳定地匹配,因为作者姓名、期刊标题和引文格式会在成千上万篇引用相同来源的论文中重复出现。这两者都正是规范学术写作应有的样子。
并排来看,膨胀的分数和实际问题一眼就不同。
| 匹配到的内容 | 发生原因 | 是否值得进一步查看? |
|---|---|---|
| 带引号并附有引文的引用段落 | 这些文字是有意复制的,并且在页面上注明了出处 | 不,这正是正确引用的样子 |
| 参考文献列表或书目 | 作者姓名、期刊标题和引文格式会在许多其他论文中重复出现 | 不,除非未应用排除设置 |
| 标准方法或程序性表述 | 某一学科的共享词汇会在论文中以相同方式描述同一过程 | 很少,除非整段内容是直接搬用而不是重新撰写 |
| 一段很长、不断开的段落,没有引号,并且与单一来源相匹配 | 这些措辞与另一位作者的句子足够接近,以至于匹配引擎能够捕捉到 | 是的,这种模式值得打开来源核查 |
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工写作,同时不改动重要词语或引文。
为什么低分数仍可能掩盖问题
一个低数值回答的是一个比表面看起来更狭窄的问题, 也就是少量文本是否与 Turnitin 的数据库逐字对应,仅此而已。改写如果在保留另一位作者的结构和论证的同时改变了足够多的措辞,就可能得分接近零,但仍然是严重的学术诚信问题,因为该引擎处理的是词串,而不是被借用的思想。翻译内容,或来自 Turnitin 索引数据库之外的材料,也会以同样方式表现, 没有可匹配内容,就不会被标记。
伪造来源会从另一个方向造成同样的盲区。一个不存在的参考文献不可能与任何内容匹配,因为根本没有任何东西可供它匹配,而相似度分数也无法标记一个从一开始就从未真实存在过的引文。TextPulse 的 免费 AI 引文检查器正是为填补这一空缺而存在的, 它会在读者不得不费力去发现这一缺口之前,将参考文献列表中的每一条条目与这些来源本应出现的实际登记库进行核对。
在完全转向这个数字之前,还有一个区别值得说明。一个相似度分数较低的提交,仍然可能带有 Turnitin 单独的 AI 写作指标,这是一种为捕捉另一类问题而设计的不同测量方式,本网站关于 Turnitin 是否 वास्तव能检测 ChatGPT 的指南中对此有说明。这两个百分比的计算方式并不相同,而本文只讨论相似度分数本身。
如何阅读报告,而不是只看数字
在打开匹配细分之前,不要先对总分作出反应。Turnitin 会按对总分的贡献大小,对构成分数的来源进行排序。一个总计 22% 的结果,如果由 11 个来源各贡献 2% 组成,与一个仅由 1 个来源构成的总计 22% 并不是同一种情况。前一种模式通常反映的是许多常见短语之间的重叠。后一种则值得直接查看该来源实际说了什么。
Turnitin 还会把同一个百分比分入不同的颜色区间,Loughborough College 面向学生的官方说明中也复现了这一点: 蓝色表示没有匹配文本,绿色表示从 1 个词到 24%,黄色表示 25% 到 49%,橙色表示 50% 到 74%,红色表示 75% 及以上。该学院的官方说明明确指出,这些颜色并不意味着什么: 相似度检查并不表示提交内容包含抄袭材料。颜色只是为了便于查看报告,而不是给出裁定。
无论机构自身的设置是否将引文和参考文献从计数中排除,都值得核查,因为同一份提交会因该切换的设置不同而产生两个不同的数字。只要可见,这一切都不复杂。只有在没有人翻到报告的第一页之后时,它才是不可见的。
如果你的分数让你感到意外,该怎么做
不要对合计总数作出反应,而应逐一重新打开每个被标记的来源。确认正在评分的版本是否排除了引文和参考文献,因为学生在起草时看到的数字,并不总是与教师在提交时看到的数字采用相同的配置。若确实出现了真实的无归属匹配,直接修正引文,而不是改写句子以绕过匹配引擎,因为那样只是处理症状,而问题仍然存在。
如果这个数字仍然与导师的预期不一致,就直接询问该部门自身采用的惯例是什么。上面的各部分已经表明,这里并不存在一个必须精确达到的单一标准,因此答案应当来自对该作业具有本地权限的人,而不是来自任何人都可以事先查到的某个百分比。TextPulse 的 免费工具集合涵盖了在报告送达他人收件箱之前值得运行的引文和起草检查。
来自不同工具的分数并不可互换,而 GPTZero 的工作原理已在其单独页面中说明,同时也说明了位于两者下方的 perplexity 统计量。
该分数之所以呈现出这样的表现,是因为其下方的匹配运行方式,而如今同一份报告中紧挨着它的较新数字则基于不同的机制,这一点已由本网站关于AI 检测器实际如何工作的指南完整说明。把任一数字当作裁决,都会跳过报告中唯一值得阅读的部分。
常见问题
什么是合格的 Turnitin 分数?并不存在这样的数值。Turnitin 不公布可接受的百分比,相似度分数衡量的是文本与其数据库的匹配程度,而不是抄袭了多少。一个正确引用的文献综述,仅因引文就可能超过二十 percent,而一处未标注来源的改写甚至可能低于 five。应阅读匹配到的来源,而不是标题中的数字。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.