AI Detection

Turnitin 能检测 ChatGPT 吗?它能抓到什么,漏掉什么

Turnitin 的 AI 写作报告和抄袭报告是不同的产品,面向不同的受众,也有不同的准确性记录。以下说明 AI 分数实际衡量什么,独立测试显示它在哪些地方失效,以及为什么你的报告可能和室友的不一样。

8 min
Illustration answering can Turnitin detect ChatGPT, showing the AI writing report displayed separately from the similarity report

可以,但仅限于一种特定类型的 AI 使用,而且只会出现在大多数学生从未见过的一份报告中。Turnitin 的 AI 写作指示器会标记那些在统计上看起来像语言模型生成的散文,而且它对所扫描论文中的越来越大一部分都这样做:在 2025 年 10 月到 2026 年 2 月之间,约有 15% 的论文显示 80% 或以上的 AI 生成写作,而在该工具于 2023 年 4 月推出时,这一比例约为 3%。它是否会标记你的具体提交,取决于大多数关于 can Turnitin detect ChatGPT 的回答会略过的细节, AI 报告与抄袭报告有何不同,究竟是谁能看到这个数字,以及这个数字有多大概率是错误的。

本文讨论的是这一单一产品的运作机制,而不是一般意义上的学术诚信。它说明 AI 写作报告衡量的是什么,独立测试发现它在哪些方面判断正确,在哪些方面判断错误,以及为什么两名提交相同作业的学生,可能会因为就读的大学不同而得到不同结果。以上内容都不会改变你所在课程手册中关于可接受 AI 使用的规定。它所做的,是用对黑箱内部实际内容的描述,取代对其的猜测。

Can Turnitin Detect ChatGPT? 报告实际显示了什么

Turnitin 的 AI 写作报告是一个独立产品,与检查抄袭的相似度报告不同。它们运行在不同的模型上,并在同一界面的不同标签页中显示。相似度分数会查看你的提交内容,并将其与已发表来源和其他学生论文的数据库进行比较,从而返回匹配的百分比。AI 分数则完全不同, 它是一个分类器,逐句读取你的散文,为每一句分配一个被 AI 生成的可能性,然后把这些句子层面的分数汇总为一个单一的文档百分比。由于它们衡量的是不同的东西,一份提交的相似度分数可能是 2%,而 AI 分数可能是 60%,反之亦然。

这个百分比实际上比听起来更窄。它指的是模型预测为由 AI 撰写的合格散文所占比例, 不是整个文档, 因为在计算分数时, 它们会移除代码块、项目符号、标题和短篇写作等内容。该检测器只能应用于至少包含 300 个词的长篇散文文档, 截至本文撰写时, 它也只适用于英语、西班牙语和日语文本。正如你可能预期的那样, 将它与AI 检测器通常如何计算该分数并置来看, 这里的模式很熟悉, 一个看起来精确的文档级数字, 是建立在比标题数字所暗示的更窄的文本切片之上的。

哪些内容会被显示为 AI, ChatGPT 及其他

Turnitin 说, 其分类器寻找的是写作模式, 而不是品牌名称, 自 2023 年最初推出 GPT-3.5 和 GPT-4 以来, 其覆盖范围已多次扩大。当前指南将 GPT-5 系列、Gemini 和 Claude 列为其训练所针对的系统之一, 并且会持续加入新的模型版本。这包括从未直接接触过 ChatGPT 的文本。改用 Gemini、Claude 或 DeepSeek 的学生, 并不是仅仅通过选择不同公司就在规避检测器, Turnitin 对该模型的说明明确指出, 它并不依据是哪家供应商生成了文本, 只依据文本读起来如何。

经过改写的 AI 文本会被归入单独类别, 而不是被直接放行。Turnitin 的文档将其判断为仅由 AI 生成的文本, 与其判断为由 AI 生成且随后又被 AI 改写的文本区分开来, 并且在 2025 年 8 月, 它增加了专门针对 AI 绕过工具的检测, 这些工具旨在将机器输出重写后绕过检测器。这并不意味着改写毫无意义, 也不意味着每一段重写内容都会被抓到。它意味着, 认为改写默认对 Turnitin 不可见的假设, 已经过时有一段时间了。

Turnitin 的 AI 分数有多准确?

Turnitin 的准确性主张归结为一个核心数字:它声称,在超过 20% 的文本被标记的文档中,其误报率保持在 1% 以下。该公司还表示,它会将其模型的每个新版本与 700,000 篇在 ChatGPT 出现之前写成的学术论文进行测试,以验证这一准确性。这是一个针对特定情境的、可检验的主张。应当正是这样来理解它。Turnitin 在 2023 年还提出过其他关于准确性的主张,这些主张出现在其上线后不久。该公司的首席产品官公开承认,实验室测试并不能预测在真实使用中会出现多少误报,尤其是在较短的提交中,并表示在实际环境中的误报百分比高于测试中的结果。他报告称,句子层面的误报率约为 4%,并指出 Turnitin 因此将可评分提交的最小长度从 150 词提高到 300 词。目前的最小长度仍然是 300 词。

独立测试补充了供应商数字所没有提供的细节。Temple University 的 Center for the Advancement of Teaching 进行了一项较为严谨的检验,其精神与 AI 检测器的独立测试一致,这类测试不断揭示实验室条件与真实提交之间的差距。研究人员提交了 120 份写作样本,平均分为完全由人类写作、完全由 AI 生成、经过改写工具处理的 AI 生成文本,以及结合人类与 AI 贡献的混合文本,并记录了 Turnitin 对每份样本的返回结果。该工具正确识别了 93% 的纯人类样本,以及 77% 的纯 AI 生成样本。

在更难的问题上,准确率进一步下降。Turnitin 仅能准确将 63% 的改写后 AI 样本识别为 AI 生成,将 43% 的混合样本识别为既非完全人类也非完全 AI,而这两类最接近 AI 辅助写作实际的生成方式。尤其是混合文本,研究人员对此很感兴趣,因为他们认为,随着越来越多课程布置要求学生在部分工作中使用 AI 的任务,它很可能会占据真实提交内容的很大一部分,甚至可能是大多数。

测试内容Turnitin 的结果
100% 人类撰写的样本93% 被正确识别为人类
100% AI 生成的样本77% 被正确识别为 AI
经过改写工具处理的 AI 文本63% 被正确识别为 AI
混合样本,部分人类,部分 AI43% 被正确识别为既非 0% 也非 100%
超过 20% 被标记的文档, Turnitin 自身给出的数字低于 1% 的误报率

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

即使数字看起来正确,问题仍然会在这里暴露出来

文档层面的分数并不是教师唯一能看到的内容,而另一种视图的可靠性更低。有些界面允许教师打开标记报告,将特定句子突出显示为可能由 AI 撰写。Temple 的研究人员将这些高亮与其混合样本中实际由 AI 撰写的句子进行对照,发现两者之间没有关系。如果教授发给你的是一张高亮段落的截图,而不是摘要百分比,这一点就很重要, 因为整体文档分数的表现明显优于句子层面的高亮。

较低分数的处理方式也不同,而且比过去更加谨慎。自 2024 年 7 月以来,只要其模型估计一份文档中少于 20% 是 AI 撰写的,Turnitin 就会用星号代替数字,因为在这一范围内,该工具最可能在两个方向上都出错。轻度 AI 辅助编辑,例如有一段在帮助下改写,其余部分独立完成,往往不会显示任何可见百分比,而不是显示一个较小的百分比,因此在把没有数字视为任何结论的证据之前,了解这一点是值得的。

谁 वास्तव际上会看到这个数字

AI 分数默认不属于学生可见报告的一部分。它位于单独的选项卡中,教师和管理员可以看到,学生只有在教师选择共享报告或直接向其展示时才能看到。这与相似度分数存在真正的结构性差异,相似度分数通常在提交被处理后,学生可以在同一系统中自行查看。

同样的情况也适用于某门课程是否 वास्तव际上启用了该功能,这是一项高于教师层面的机构决定。账户级管理员可以为整个机构开启或关闭 Turnitin 的 AI 检测。如果大学关闭了该功能,某位讲师可能无法将其开启,反之亦然。来自一所大学的学生向另一所大学的学生提交相似的作业,可能会对这一工具有非常不同的体验,而这些差异与他们各自写了什么毫无关系。

为什么有些大学已经将其关闭

Waterloo大学于2025年9月停止使用Turnitin的AI检测功能,其公开说明异常直接。该大学指出,该工具已有记录的不可靠性、对第一语言不是英语的学生的偏见,以及其内部测试结果,其中至少有一个完全由人类撰写的文本被评为100% AI生成。与该工具的费用相比,大学认为成本大于收益,因此将工作重心转向评估重设计和AI素养培训。

Waterloo是更广泛分歧中的一个可见例子,而不是例外。继续开启该功能的大学通常增加了防护措施,而不是把分数本身当作结论,要求在任何正式程序开始之前先与学生进行对话,并把这个数字视为开启该对话的理由,而不是结束它的理由。进一步阅读大学如何处理AI政策,这种模式会更清楚: 是否会有人看到分数,取决于在你的研讨课教室上方很远处作出的决定,而不是取决于该技术本身的固定属性。

高分证明了什么,以及不能证明什么

较高的AI分数是证据,不是结论。Turnitin本身将该百分比表述为供教师判断的一个数据点,而不是不当行为的认定,上述准确率数据解释了这种表述为何重要: 即使是表现相当不错的文档级分数,也会误读相当一部分经过大量编辑、改写或混合写作的文本,而句子级高亮的可靠性明显低于汇总数字。这并不保证任何单个分数都是错误的。它的意思是,一个百分比是提出问题的理由,而不是可以一眼接受的认定。如果你想在别人给出分数之前先看看自己的写作处于什么位置,那么分类器会反应的那些低变化、通用措辞模式,可以直接用free perplexity checker检查。

TextPulse 的 面向学生的 AI humanizer 采用同样的统计基础,其 免费 burstiness 检查器 也是如此,用于同一测量中句子节奏这一半部分。它会根据你的草稿给出一个估计的 Human Score,而不是预测 Turnitin 会如何评价它。对于一个并不控制的系统,没有任何工具能够负责任地作出这样的承诺。应将其视为对你自己写作的第二次阅读,仅此而已。

其中若干问题各自都有单独页面。教授是否能在完全没有任何检测器的情况下看出你使用了 ChatGPT,以及更直接的版本,我会不会被抓到,都分别作了回答。Turnitin 对改写文本的表现,以及 Turnitin 是否专门检测 DeepSeek 输出,也是如此。针对特定场景,还有关于 护理专业中的 AI 检测,以及关于 大学招生办公室是否进行这些检查 的文章。更广泛的框架则放在一篇关于 学术诚信与 AI 的单独文章中。

这些内容都不太可能是最终版本。自 2023 年以来,Turnitin 已不止一次重写其阈值、可见性规则和模型覆盖范围,而 2026 年 8 月也不会是最后的定论。真正保持不变的是一种值得养成的习惯,不论某门课程使用哪一种检测器, 都应如此, 写作时要有足够具体、足够不均匀、真正属于你自己的细节,使分类器恰好怎么想都变得无关紧要。

Frequently Asked Questions

Turnitin 的 AI 写作指示器就是为回答这个问题而存在的。Turnitin 能检测 ChatGPT 吗?通常可以,只要文档包含大量 AI 写作,分类器就会标记出看起来在统计上符合语言模型特征的散文,而且 Turnitin 自己的数据表明,如今大约 15% 的被扫描论文被判定为高度 AI 写作。它也经常漏检,独立测试发现,在改写后的 AI 写作上,准确率降至 63%,在混合文本上降至 43%。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Turnitin 能检测 ChatGPT 吗?它实际能抓到什么 | TextPulse.ai