AI Detection

Turnitin 如何逐步检测 AI

Turnitin 的 AI 写作检测器不会把整篇文档作为一个整体来读取。它会将提交内容分成若干片段,对每一段分别评分,再对结果取平均,最后才在报告中给出百分比。本文说明这一流程,它会标记 ChatGPT、Claude 和 Gemini 中的哪些内容,独立测试发现它遗漏了什么,以及究竟是谁能看到这个数字。

18 min
How does Turnitin detect AI: diagram of the segment, score and average pipeline behind a Turnitin AI writing report

Turnitin 报告可以只给出一个数字,比如 42%,而几乎不说明它是如何得出的,除非有人去查其背后的机制。这个数字不是从整篇文档直接读出的,也不是猜测。它是一个特定的、经过文档记录的流程的最终结果,而该流程对每一次提交都以相同方式运行。

那么 Turnitin 如何检测 AI?它通过将一份提交拆分为若干部分,依据这些部分是否可能由 AI 生成或由 AI 生成后再改写,分别对其评分,然后对这些分数取平均,以确定报告中显示的总体百分比得分。该流程的每个阶段都在 Turnitin 自己的文档中有说明,而不是从外部逆向推断出来的。

这里具体讨论的是 Turnitin 的 AI 写作检测功能,它是一个独立于较早的相似性或抄袭检查的系统,后者将一份提交与其他文档进行比对。下面的机制属于更广泛的问题AI 检测器实际上如何工作的一部分,而 Turnitin 之所以是一个有用的实例,正是因为它公开了比大多数供应商更多的自身方法。接下来先说明这一流程,然后说明它在实践中会标记什么、独立测试发现它会遗漏什么,以及机构内部究竟是谁会看到结果。

Turnitin homepage positioning the product for authentic learning in an AI world, with AI writing detection and Turnitin Clarity featured
Turnitin 自身的表述, 在现有相似性工作流程中识别 AI 生成的写作,并将 Clarity 作为面向 AI 的产品线。

Turnitin 如何检测 AI?流程概述

Turnitin 的 AI 写作检测器按固定顺序运行四个步骤。首先,它检查一份文档是否包含足够的合格散文文本,以便能够进行评分。其次,它将这些文本划分为若干段,每段大约几百个词。第三,模型分别对每个段落进行评分。第四,所有段落分数会被平均,汇总为读者实际看到的单一文档级百分比。

AI 写作报告不是相似度报告

Turnitin 的 AI 写作报告是一个独立产品,不同于用于检查抄袭的相似度报告。它们基于不同的模型运行,并在同一界面的不同标签页中显示。相似度分数将提交内容与已发表来源及其他学生论文的数据库进行比对,并返回匹配的百分比。AI 分数则完全不同, 分类器读取散文文本,为每个计分段落分配一个由 AI 生成的可能性,并将这些分数汇总为单一的文档百分比。由于它们衡量的是不同的内容,一份提交的相似度分数可以是 2 percent,而 AI 分数可以是 60 percent,反之亦然。

AI 百分比的范围也比字面上看起来更窄。它描述的是模型预测由 AI 撰写的合格散文所占比例,而不是整份文档,因为代码块、项目符号、标题和短格式写作会在计算分数之前被移除。就本文撰写时而言,该检测器仅运行于英文、西班牙文和日文文本。

第一步, 将文档分割为若干块

在任何内容被评分之前,Turnitin 的模型会将提交内容划分为若干块,每块大约几百个词,约合每块五到十个句子。分段首先发生,是因为该模型被设计为对这种大小的块进行评分,而不是对单个句子评分,也不是一次性对整篇论文评分。

只有散文文本才计入一个块。该模型旨在读取长篇写作。包含散文以及表格或代码的文档,会被计为含有一定比例的散文文本,但可能不会描述文档中的全部散文文本。这是因为检测器对一组数据进行评分,而这组数据不包括代码块、项目符号或短格式文本。这就是为什么文档可能返回一个只描述所提交内容一部分的百分比。

按块评分还有一个较少被提及但值得指出的后果。一个由 AI 起草的句子,若位于一个原本由人类撰写、且有几百个词的块中,它会与该块中的其他所有内容一起被平均计算,因此它对该块自身得分的影响,会因周围人类撰写文本与其共享同一块而被稀释。一个较短的 AI 起草插入内容仍然会进入模型。只是,与一个从第一个词到最后一个词都由 AI 起草的块相比,它所占权重更小。

第二步, 对每个段落评分

每个块都单独评分,与文档中的其他任何块彼此独立。模型会预测这段特定文本是人类撰写、AI 生成,还是 AI 生成后再改写,这是一种三分法,而不是简单的是或否。

这是一类独立的类别,而不只是 AI 生成的延伸,这表明改写会削弱检测,确实存在一个现实问题。2023 年的一项研究支持了这一点,该研究发现,将 AI 生成文本通过一个专门的改写模型后,研究型检测器 DetectGPT 的准确率从 70.3% 降至 4.6%,同时假阳性率保持在 1% 不变。看起来 Turnitin 并未就其自身的三分类器对同样技术的抗性发表任何内容。设置这一类别是有记录依据的。

按片段级别而不是整篇文档级别进行评分,是一种有意的设计选择。一篇九十页的论文如果只有两段是 AI 起草的,而一篇五页的短文却完全由 AI 起草,这两者是不同的问题,而对各个片段取平均,正是让一个文档级别的数值能够反映这种差异,而不是把它抹平的原因。

Turnitin 并未像公开其流水线步骤那样详细公开这种按片段模型的内部架构。它是一个在标注样本上训练的监督分类器,不是 TextPulse 关于AI 检测中的 perplexity 实际衡量什么一文所讨论的那种原始下一个词元分数上的简单阈值,不过,同样的底层思想,也就是异常可预测的文本,几乎肯定是这种分类器学会识别的内容的一部分。

第三步, 汇总为文档级百分比

各个片段的分数会被平均,形成报告中显示的单一百分比。这个百分比表示符合条件的散文文本所占的比例,仅限长篇写作,即模型预测为 AI 生成,或先由 AI 生成再经改写的部分。它是已评分片段所占的比例,而不是声称文档中精确有多少词是由机器逐字输入的。

报告上的百分比就是平均值。这就是为什么两份都返回百分之四十的文档,细看时可能会很不一样。一份可能有百分之四十的片段被评分为完全由 AI 生成。另一份则可能每个片段都被评分为部分可能,平均后得到相同的总百分比。它并不会显示是哪一种模式产生了这个结果。

Turnitin AI writing overview reporting 71% detected as AI, listing 18 segments as AI-generated only at 71% and zero segments as AI-paraphrased at 0%
这种平均步骤的输出, 一个单一的总百分比,下面列出两个类别。这里 71% 被检测为 AI,全部都在 AI-generated only 类别中,而 AI-paraphrased 中为零。

Turnitin 能检测 ChatGPT、Claude 或 Gemini 吗?

通常可以,只要文档包含大量 AI 写作,分类器并不在意其由哪家厂商生成。Turnitin 表示,其模型关注的是写作模式,而不是品牌名称,自 2023 年原始 GPT-3.5 和 GPT-4 发布以来,其覆盖范围已多次扩展。当前指南将 GPT-5 系列、Gemini 和 Claude 列为其训练所针对的系统之一,并且会持续加入新的模型版本。使用 Gemini、Claude 或 DeepSeek 的学生,并不会因为换了不同公司就绕过检测器。

受此影响的提交比例已经上升。Turnitin 在 2025 年 10 月至 2026 年 2 月期间扫描的论文中,约有 15 percent 显示 80 percent 或更多为 AI 生成写作,而该工具在 2023 年 4 月推出时,这一比例约为 3 percent。

改写后的 AI 文本会被单独归类,而不是直接放行,这就是上文所述的三分法分类。Turnitin 的文档将其判定为仅为 AI 生成的文本,与其判定为 AI 生成后又经 AI 改写的文本区分开来,并且在 2025 年 8 月,它增加了专门针对 AI bypasser 工具的检测,这类工具旨在将机器输出改写后绕过检测器。这并不意味着改写毫无意义,也不意味着每一段改写内容都会被抓到。它的意思是,默认认为改写对 Turnitin 不可见的假设,已经过时有一段时间了。该工具如何处理特指的改写文本以及DeepSeek 输出,另有说明。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

最低字数要求与星号阈值

在 Turnitin 的 AI 检测器生成任何分数之前,提交内容必须至少包含 300 words 的合格散文文本,早先的最低要求是 150-word。低于这一长度时,根本没有足够的文本可供分段并取平均的过程运行。

300 词的下限与前文所述的单个评分区块的规模相一致,即几百个词,五到十个句子。正好处于最低限度的文档,实际上只是向流水线提供了大约一个区块量的合格文本用于平均,而不是多个区块,这也是为什么接近该下限的报告更可能落入较不可靠的范围,而下一个阈值正是用来标记这一范围的原因。

Turnitin 也不会显示低于 20% 阈值的百分比。自 2024 年 7 月起,报告会在百分号旁显示一个星号,而不是数字。报告行为中的这一单一变化比流水线中的任何其他部分都更容易造成混淆,因此下面专门设一节说明。

条件报告显示什么原因
少于 300 词的合格散文完全没有 AI 分数文本不足,无法可靠运行分段并取平均的流水线
分数会低于 20%百分号旁显示星号,而不是数字Turnitin 自身文档报告,在该范围内假阳性率明显更高
分数为 20% 或更高具体百分比Turnitin 认为其可靠性足以以数字形式显示

Turnitin 上的星号分数是什么意思?

Turnitin AI 写作报告中的星号表示模型检测到了一些 AI 写作,但少于文档的 20%,而 Turnitin 不会在该范围内公布数字。原本应显示百分比的位置,报告改为在百分号旁显示星号。Turnitin 自身的产品文档直接说明了这一点: "When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed."

因此,星号既不是错误,也不是缺失的分数,更不是上传出问题的标志。它是供应商有意作出的决定,即不公布一个它认为不足以可靠呈现的数值。

为什么 Turnitin 会隐藏 20 percent 以下的数字

因为这一范围正是工具最容易出错的地方,而 Turnitin 自己的准确性承诺也明确将其排除在外。该公司承诺将其误报率控制在“AI writing 超过 20% 的文档中低于 1%”。请仔细看这一适用范围, 这项承诺本身就内置了一个下限,而这个下限正是同样的 20 percent。低于这条线时,公司并不声称具有同样的可靠性,因此,与其打印一个读者必然会当作精确值的小数字,不如完全不显示。星号的存在是为了避免误报,也就是说,它的存在是为了避免向教师提供一个会误导人类撰写文档的数值。

这一推理与前面所描述的机制一致。文档层面的分数是若干几百词片段的平均值。当只有很小一部分片段被判定为 AI 时,所得平均值所依据的信号非常少,系统也就无法可靠地区分真实的 8 percent 和虚假的 8 percent。不显示该数字是对此最诚实的回应,这也正是 300-word 最低字数限制背后的同一种考虑。

星号在大学中的实际含义

在实际操作中,大多数机构会把星号视为无需采取行动的标记,并将其理解为与人类撰写作品一致的低分。理由很直接。如果开发该检测器的供应商都不愿为这一范围内的数值背书,教师就没有任何实质内容可以拿去与学生讨论,更不用说提交给学术不端委员会了。对于大多数学术诚信流程而言,显示星号的报告在功能上等同于一份干净的报告。

这描述的是结果在实际中如何被使用,如果你正盯着这样的结果,这一点值得知道。但这并不等同于对文档实际性质的判断,而这种区别在两个方向上都很重要。

星号不表示什么

  • 它不是人类作者身份的证明。Turnitin 正在谨慎地拒绝对该文档给出明确分数,这说明的是检测器本身,而不是作者。
  • 它不等同于零。完全没有 AI 写作的文档和只有一个 AI 辅助段落的文档,可能会产生相同的星号,这正是分数被隐藏的原因。
  • 它不能在不同提交之间直接比较。两个星号只说明两份文档都低于同一阈值,并不说明它们彼此之间如何比较。
  • 它不是相似度分数。抄袭匹配是另一个标签页中的单独报告,无论 AI 指示器如何,它都会显示自己的百分比。

值得记住的实际后果是,轻度的 AI 辅助编辑,也就是在帮助下重写一个段落,其余部分未经协助完成,往往会产生星号,而不是一个较小的百分比。无论有无数字,都不能单独解决这个问题,这与下面的准确率数据从另一个方向得出的结论相同。

Turnitin 对准确率的主张,以及这些数字属于谁

Turnitin 发布了自己的准确率数据,应当将其准确地理解为供应商自身的验证数字,而不是独立审计。其公开材料称,对于模型判定 AI 写作超过 20% 的文档,假阳性率低于 1%,这一阈值与上文所述的星号截断点一致。随后,该程序又因应关于检测器偏差的研究,扩展到了英语学习者写作样本。

Turnitin 表示,它已将该数值与一个大型基线进行核验,这个基线由 ChatGPT 出现之前提交的人类撰写论文构成。Turnitin 的材料对该基线的确切规模说法并不一致,FAQ 页面引用的是 700,000 篇论文,而 Turnitin 首席产品官的一篇博客文章引用的是 800,000,并且两者都附带了低于 1% 的相同说法。Turnitin 的材料还描述了一种权衡,这是公司自己的说法, 更积极地捕捉 AI 生成内容意味着会漏掉其中大约 15%。

该公司也在公开场合修订了自己的说法。2023 年,在发布后不久,Turnitin 的首席产品官承认,实验室测试并未预测在真实使用中会出现多少误报,尤其是在较短的提交中,并报告了约 4 percent 的句子级误报率。将可评分的最小长度从 150 词提高到 300 词,就是对这一差距的回应。

合并来看,这些数字描述的是一种具体的权衡,而不是单一的准确率数值。低于 1% 的误报率听起来几乎可以忽略不计,直到它被按进入系统的提交数量进行放大,而 15% 的漏检率意味着相当一部分 AI 生成内容会被有意评分为人类撰写,这不是故障,而是设计如此。Turnitin 自己的材料把这两个数字呈现为系统预期中的平衡,而不是把它们当作该工具只是正确或只是错误的证据。

独立测试发现了什么

独立测试补充了供应商数字所没有的细节,其精神与更广泛的 对 AI 检测器的独立测试一致,后者不断揭示实验室条件与真实提交之间的差距。Temple University 的 Center for the Advancement of Teaching 进行了一项较为严谨的检验。研究人员提交了 120 份写作样本,平均分为完全由人类撰写、完全由 AI 生成、经过改写工具处理的 AI 生成文本,以及结合人类与 AI 贡献的混合文本,并记录了 Turnitin 对每一份样本的返回结果。

该工具正确识别了 93 percent 的纯人工样本和 77 percent 的纯 AI 生成样本。在更难的问题上,准确率进一步下降。Turnitin 仅将 63 percent 的改写后 AI 样本准确识别为 AI 生成,将只有 43 percent 的混合样本识别为既非完全人工也非完全 AI。这些类别最接近 AI 辅助写作的实际生成方式,而研究人员特别指出,混合文本很可能会在真实提交中占据越来越大的一部分,因为越来越多的课程会布置使用 AI 完成部分任务的作业。

What was testedTurnitin's result
100% human-written samples93% correctly identified as human
100% AI-generated samples77% correctly identified as AI
AI text run through a paraphrasing tool63% correctly identified as AI
Hybrid samples, part human and part AI43% correctly identified as neither 0% nor 100%
Documents with over 20% flagged (Turnitin's own figure)Under 1% false positive rate

这些都不是 Turnitin 一方的独立发现。公司外部的研究人员在有关 Turnitin 自身偏差研究的报道中被引用,他们对情况的描述更为复杂,尤其是对于非英语母语写作者和经过大量编辑的草稿。

句子级高亮为何会失效

文档级分数并不是教师可以打开的唯一视图,另一种视图的可靠性更低。一些界面会显示一份标记报告,将特定句子突出显示为可能由 AI 写成。Temple 的研究人员将这些高亮内容与其混合样本中实际由 AI 写成的句子进行比对,发现二者之间没有关系。如果教师转发的是一段被高亮的段落截图,而不是摘要百分比,这一点就很重要, 整体文档分数的表现明显优于句子级高亮。

谁 वास्तव上会看到分数

默认情况下,AI 分数并不是面向学生的报告的一部分。它位于单独的选项卡中,对教师和管理员可见,学生只有在教师选择共享报告或直接向其展示时才能看到。这与相似度分数存在实质性的结构差异,相似度分数通常在提交被处理后,学生可以在同一系统中自行查看。

同样的情况也适用于某门课程是否根本具备该功能,这属于机构层面的决定,超出教师权限。账户级管理员可以为整个机构开启或关闭 Turnitin 的 AI 检测。若某所大学已将其关闭,某位讲师可能无法开启,反之亦然。两所不同大学的两名学生可以提交可比的作业,却因与他们各自写了什么无关的原因,而对这一工具有截然不同的体验。

为什么一些大学关闭了它

Waterloo 大学于 2025 年 9 月停止使用 Turnitin 的 AI 检测功能,其公开说明异常直接。该大学指出,这一工具已被记录的不可靠性、对第一语言不是英语的学生的偏见,以及其内部测试结果,其中至少有一个案例是完全由人类撰写的文本却被判定为 100 percent AI-generated。综合该工具的费用,大学得出结论,成本大于收益,因此将精力转向评估设计重构和 AI 素养培训。

Waterloo 是更大分歧的一个可见例子,而不是一个例外。那些保持该功能开启的大学,通常增加的是防护措施,而不是把分数本身当作裁定,在任何正式程序开始之前要求先与学生进行一次对话,并把这个数字视为开启这场对话的理由,而不是结束它的理由。进一步阅读大学如何处理 AI 政策,会让这一模式更加清楚, 是否会有分数送达你,完全取决于在你的研讨课教室之上很高层做出的决定,而不是这项技术本身的固定属性。

高分证明了什么,以及没有证明什么

较高的 AI 分数是证据,不是裁定。Turnitin 本身将这一百分比表述为供教师判断的一个数据点,而不是不当行为的认定,上面的准确率数字解释了这种表述为何重要, 即使是表现相当不错的文档级分数,也会误读相当一部分经过大量编辑、改写或混合写作的文本,而句子级高亮的可靠性则明显低于汇总数字。这并不保证任何单个分数都是错误的。它的意思是,一个百分比是提出问题的理由,而不是可以一眼接受的认定。

单一的文档级百分比把四个独立步骤压缩成一个数字,而这些步骤都不会读取意义,也不会检查论证是否成立。理解一份报告,更直接的方法是看一段较短的文本在这类管线所依据的底层统计信号上如何得分,而不是把这个百分比当作裁定。TextPulse 的免费 perplexity 检查器会对你自己的草稿运行一种简化版的、基于词级评分的检测,且不经过任何机构管线,而它的免费 burstiness 检查器则覆盖同一测量中的句子节奏部分。这两者都给出的是你自己写作的读数,而不是对 Turnitin 会如何评价它的预测。没有任何工具能够对一个它并不控制的系统作出这种负责任的承诺。

Turnitin 报告两个数字,它们衡量的是彼此无关的内容。二者分别是什么,以及在了解该百分比所指内容之后,什么才真正算是一个好的 Turnitin 分数,都另有说明。若干相关问题也各有独立页面:教授是否能看出你使用了 ChatGPT,即使完全没有任何检测器也能判断,我会不会被抓到这一更直接的说法,以及针对特定场景的护理课程中的 AI 检测大学招生办公室是否会进行这些检查。更广泛的框架则见于另一篇关于学术诚信与 AI的文章。

这些内容都不太可能是最终版本。自 2023 年以来,Turnitin 已不止一次重写其阈值、可见性规则和模型覆盖范围,而 2026 年 8 月也不会是最后定论。它与 TextPulse 的其余免费工具集合并列,供任何希望在把某一机构的百分比视为最终结论之前先获得第二个信号的人使用。

我们自己的研究发现了什么

在 TextPulse Research 的检测器一致性研究中,九款商用 AI 检测器对同样的 90 篇学术文本进行了评分。其中一篇是 455 词的混合文本:开头和结尾由人工撰写,中间是 168 词的 AI 生成段落。Turnitin 将这篇文本判为 26.8% AI,而其他工具对同样文字的判定从 0% 到 95.7% 不等。完整论文、语料库和每款工具的分数矩阵开放于 TextPulse Research

Turnitin 对研究语料库中混合文本的判定。
Turnitin 对研究语料库中混合文本的判定。
XLinkedInFacebook

常见问题

Turnitin 如何检测 AI?它会把一份提交内容分成若干几百词的片段,分别判断每个片段看起来是否像 AI 生成或 AI 生成后再改写的内容,然后把这些片段分数取平均,得到报告中显示的单一百分比。只要提交内容达到最低词数要求,这一流程就会以相同方式运行。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。