AI Detection

GPTZero 与 Turnitin:哪一个决定你的成绩

GPTZero 和 Turnitin 常被当作同一种测试的两个版本。其实并非如此。一个由你的大学授权,并附着在你的实际提交上。另一个是你可以在午夜自行运行的消费级产品。以下说明二者的区别。

6 min
Table comparing GPTZero vs Turnitin on who can run each one, what a marker sees, and what each one costs

在截止日期前一晚的11点,一名学生把自己的论文粘贴进 GPTZero,看到一个数字升到40%以上。恐慌随之而来,但这个数字与他们所在大学的实际提交系统在第二天早晨文件上传后报告的任何结果都没有关系,因为 GPTZero vs Turnitin 是对面向两类不同购买者的产品的比较,而不是对同一种测试的两个版本的比较。

Turnitin 是大学购买并接入作业提交门户的产品。GPTZero 是任何人今晚都可以在浏览器中打开、粘贴文本并在几秒内得到一个数字的产品,无论其机构是否曾经获得许可。两者都声称能够识别 AI 生成的写作。两者都没有公布任何表明一方会预测另一方的数字。

本文围绕这一区别展开, 说明每个产品实际上是什么, 批改者看到的是什么, 以及为什么自行运行得到的分数并不是官方分数的预览。关于作者试图改变检测器报告结果时会发生什么这一更广泛的问题, 我们的 comparison of AI humanizer tools 说明了这些产品在哪些方面有帮助, 又在哪些方面没有帮助。

GPTZero result screen highly confident a text is entirely human: 99% human probability on an academic methods paragraph
GPTZero 对人类撰写文本的判断, 一段方法部分文字得到99%的人类判定。Turnitin 以不同方式呈现其 AI 估计, 作为教师相似性报告工作流程中的一个百分比。

GPTZero vs Turnitin: 为什么学生会混淆这两个不同的产品

这种困惑是可以理解的,因为在大多数学生的脑海里,这两者都出现在同一个句子中, “the AI checker.” Turnitin 是它二十年来一直运行的抄袭匹配 Similarity Report 的配套工具,授权给某个机构,并在该机构自己的管理设置中开启或关闭。GPTZero 最初作为一个独立的 AI 检测器推出,供任何人直接使用,后来又增加了抄袭检查、语法纠正以及其他自身的写作质量功能,并且还拥有自己的机构授权协议,据 GPTZero 自己的数字,合作院校超过 3,500 所。

这种重叠很重要, GPTZero 并不纯粹是面向消费者的产品,因为有些机构也将其作为自己的官方检查工具来授权使用。相比之下,Turnitin 这一侧多年来始终保持一致, 没有任何公开页面允许个人注册并付费,将自己的论文通过其 AI Writing Indicator 运行,只有机构授权才能做到这一点。如果这种区别对你正在做出的决定具有关键作用,请直接向 Turnitin 确认。

购买方的差异塑造了后续的一切。Turnitin 面向的是需要为一次提交附上一份一致记录的机构,因此其输出存在于一份报告中,管理员可以在数月后的申诉过程中再次打开。GPTZero 面向的是希望在接下来的三十秒内得到答案的个人,因此其输出是一个你读完就关闭的屏幕。对各自的购买者而言,这两种设计都没有错。它的确意味着,这两个数字是在不同压力下产生的,而一个为向某个人提供快速答案而设计的产品,没有理由与一个为经受纪律处分程序而设计的产品保持一致。

GPTZero vs Turnitin 一览

下表将两者放在一起,围绕学生或评分者真正关心的四个问题进行比较, 谁可以运行它,评分者看到什么,它测量什么,以及它的费用是多少。有些单元格有意留空,因为在本次检查时,这两个供应商各自的定价页面都没有呈现出可用的美元金额。

TurnitinGPTZero
谁可以运行它只有拥有 Turnitin 许可证的机构可以使用, 不存在供个人写作者使用的消费者产品任何个人都可以直接注册, GPTZero 也会单独向机构授权
标记者看到什么AI Writing Indicator 显示在 Similarity Report 的教师和管理员视图中, 学生默认看不到它学生选择分享的任何内容, 自行运行得到的分数不会自动进入教师视图, 除非该机构另行授权 GPTZero 用于其自身工作流程
它衡量什么被判定为可能由 AI 生成或经 AI 改写的合格散文文本所占比例, 以重叠句段的平均值计算根据 GPTZero 自身的产品说明, 其衡量的是包括 Claude, ChatGPT, GPT-5, 和 Gemini 在内的指定模型所生成的 AI 内容
它的费用没有公开的消费者价格, 直接向机构销售个人可使用免费层级, 也有付费的 Professional 和 Enterprise 或 Team 方案, 但在本次检查时, GPTZero 自己的定价页面未能显示可用的美元金额

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

每个分数实际上衡量什么

Turnitin 对其百分比的定义非常明确, 即, “合格文本”所占比例, 这里指长篇文档中的散文句子, 其模型将这些句子判定为可能由 AI 生成, 或可能由 AI 生成后再经改写工具或绕过工具修改。文档会被拆分为大约五到十个句子的重叠片段, 每个句子从 0 到 1 评分, 然后将片段分数平均为标记者看到的单一数值。提交内容必须至少包含 300 words 的合格散文, 才会生成任何分数。

GPTZero 自己的网站声明了一个标题为“99% Accuracy”的数字,并将其检测器描述为经过第三方测试验证,覆盖来自包括 Claude、ChatGPT、GPT-5 和 Gemini 在内的已命名模型的输出。至少在本次审查所见范围内,GPTZero 的公开页面并未说明 Turnitin 所记录的句子级机制,即一份文档如何被分段、评分,并平均汇总为那个标题数字。这个缺口本身就值得单独指出, 一个供应商以足够详细的方式公布其方法,便于审计,另一个供应商公布的是结果。一个免费的 burstiness checker 至少可以让你看到自己的草稿在这些分类器往往读取的统计信号之一上处于什么位置,而不受最终打开文件的具体命名工具影响。

谁能看到分数,以及它何时真正到达评分者手中

Turnitin 自己的说明明确指出,其 AI writing detection 指示器和报告默认情况下学生不可见。只有在所在机构启用该功能后,教师才能在 Similarity Report 查看器中看到百分比,而学生能够看到自己分数的唯一途径,是教师手动下载报告并直接分享给学生。

GPTZero 的分数默认则相反, 无论是谁运行它,都会立刻看到结果,不管是学生在检查草稿,还是教师在任何机构合同之外手动检查提交内容。这种非正式性有双重影响。2023 年在 UC Davis,一位教授在将学生 William Quarterman 的作品直接通过 GPTZero 检查后,以抄袭为由判定其不及格,完全不在任何类似 Turnitin 的机构工作流程之内,这一事件发生在另一起涉及 Turnitin 自身 AI detector 的案件公开之前数日。没有任何机构层面的许可,但一位对成绩有权力的人选择直接据此采取行动。这是一个真实的成绩。

前一晚的 GPTZero 分数为何不能预测 Turnitin 的分数

这两个数字在数学上没有任何联系。训练数据不同,评分机制不同,最低字数要求不同,文件处理规则不同, 一个工具给出的分数,无法就另一个工具在同一份文档上会报告什么,提供任何经过校准的信息。Turnitin 自己的指南也就其工具单独使用时强调了同一点, 分数是供教育者判断的数据,而不是对不当行为本身的判定。

实际差异还会进一步累积。Turnitin 只对符合条件的长篇散文进行评分,并且必须先有 300 words 才会返回任何结果,所以一篇较短的反思性文章不会得到分数,而消费者检测器则会在单个段落上返回一个百分比。文档处理也不同, 什么算作正文,什么会被跳过,作为标题、图注、块引用或参考文献条目,都是各个供应商按自己的标准作出的决定,而且都没有完整公开。把同一个文件输入这两个工具,从严格意义上说,它们在任何模型给某个词打分之前,读到的就是两份不同的文档。

这两个工具都存在有记录的失误率。Turnitin 声称,在已经被标记为超过 20% AI 的文档上,其文档层面的假阳性率低于 1%,句子层面的假阳性率约为 4%,这些数字足够具体,以至于 Vanderbilt University 在 2023 年关闭 Turnitin 的 AI 检测器时,曾直接点名引用它们。

Originality.ai 是第三个值得与 Turnitin 并列考察的检测器,而这种比较有其单独页面。至于这些工具本身,而不是检测器,学术写作中最好的 AI humanizer 则另行评估。

通过 TextPulse 的免费工具或其他方式,将你的草稿与同类统计信号进行比对,确实能告诉你一些关于写作的真实信息。但它仍然不会告诉你评分者实际的 Turnitin 报告写了什么,因为那个数字从一开始就不是你可以自行运行的。

XLinkedInFacebook

常见问题

不是。GPTZero vs Turnitin 是对两个产品的比较,它们使用不同的训练数据、不同的评分机制,以及不同的最低字数要求,因此任何一个分数都不能预测另一个。学生在截止日期前一晚自行进行的 GPTZero 检测,与其大学基于 Turnitin 的提交系统次日报告之间,没有经过校准的对应关系。

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。