Turnitin 假阳性率:数据说明了什么
Turnitin 公布了两个假阳性数据,而不是一个,而且两者都不能描述摆在某位教授面前的那篇论文。以下说明文档层级与句子层级的区分、20% 以下的星号标记,以及如何把百分之几转化为学生的实际人数。
Turnitin 的假阳性率不是一个单一数字。该公司公布了两个数字, 一个是在文档层面低于 1 percent, 另一个是在句子层面接近 4 percent。这两个数字都是真实的, 都已公布, 但单独任何一个都不足以说明摆在某位教授面前的那篇具体论文。
这两个数字之间的差距, 以及当其中任一数字被应用到一门真实课程而不是单个文档时会发生什么, 正是本文要讨论的内容: Turnitin 自身说明了什么, 这两个数字实际上涵盖什么, 以及如何通过计算把百分之几的分数转化为学生的实际人数。
根据 Turnitin, Turnitin 的假阳性率是什么?
在文档层面, 用该公司自己的话说: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." 这一条件与数字本身同样重要。低于 1 percent 的数字并不是针对 Turnitin 评分的每一篇论文的说法。它只描述了那些在模型自身估计中已经超过 20 percent AI-written 阈值的论文子集。
在句子层面, 当界面突出显示单独的行而不是整篇文档时, Turnitin 自己给出的数字大约高出四倍。"Our sentence-level false positive rate is around 4%," 该公司表示。"There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin 还补充说, 这些错误标记的句子并不是随机分布的: 在 54 percent 的情况下, 一个被错误标记的句子会紧挨着真实的 AI writing, 该公司将此作为整篇文档评分通常比任何单独高亮行更稳健的部分原因。
文档层面和句子层面并不是同一种说法
这个两层拆分是修订后的表述,不是 Turnitin 的原始立场。该公司在 2023 年 4 月推出时,公布的是一个低于 1% 的单一数值,完全没有区分文档层面与句子层面。随后,随着机构开始引用这一数字,并且教育媒体报道现实场景中的误报率高于预期,Turnitin 的首席产品官公布了上文所用的拆分,同时还说明了两项为回应这一问题而作出的产品改动, 将可评分文档的最小长度从 150 词提高到 300 词,以及改变文档中开头和结尾句子的计分方式。
300 词的下限存在于一个相关原因。Turnitin 将其从最初的 150 词最低要求提高,是因为公司用自己的话发现,文本越长,准确性越高。与上文所述误报率的测量对象相比,短提交, 一页反思、半成品草稿、讨论帖,给模型提供的信号更少,因此低于该下限的内容根本不会得到 AI 分数,而不是得到一个不可靠的分数。
| 层级 | Turnitin 所述比率 | 其实际涵盖的内容 |
|---|---|---|
| 文档层面 | 低于 1% | 仅限于已经被标记为 20% 或以上 AI 写作的文档, 即整份提交的总体百分比 |
| 句子层面 | 约 4% | AI 写作报告中高亮显示的任何单独句子,不论文档的总体分数如何 |
| 低于 20% 的文档阈值 | 不显示数字 | Turnitin 显示的是星号而不是百分比,表示该范围内的结果可靠性较低 |
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
算术:一个百分之几的分数对真实群体意味着什么
这项计算是在范德堡大学于 2023 年 8 月计算与 Turnitin 的 AI 检测相关的错误率时公开完成的。说明如何进行这项计算的最佳例子,是范德堡大学自己对这些数字的推算。在一篇关于其决定关闭 Turnitin 的 AI 检测器的博客文章中,他们指出,"[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
这个数字是范德堡大学根据供应商公布的数值并结合自身提交量作出的外推,而不是单独测得的结果。这种算术结构超出了单一大学的学生人数范围。将低于 1% 的比率应用于几百篇论文,只会产生少数被错误标记的学生,容易被忽视。将同样的比率应用于数万篇论文,也就是一所真实大学每年提交的规模,则会产生数百个而不是少数几个,因为这里是一个很小的百分比与一个很大的总体相乘,而不是孤立地看待。
这一切都不能证明现实世界中的比率与实验室数值完全一致。Turnitin 自己的首席产品官已经公开承认,现实世界的结果与实验室测试不同,这也是公司最初修订其表述的部分原因。上面的算术把 Turnitin 自己声明的数字当作一个值得认真对待的输入,而不是把它当作工具在处理那些与精心挑选的基准完全不同的提交内容时,实际会发生情况的上限。
该比率不涵盖什么
低于 20 percent 阈值的结果不会附带一个小百分比。它会显示一个星号,而不是一个数字,Turnitin 之所以作出这一选择,是因为在该范围内,这个工具在两个方向上都最不可靠,独立的教育媒体报道以及公司在该范围内对低置信度的表述都证实了这一点。轻微编辑, 只修改一段并在帮助下完成,其余部分独立写成,可能完全不会产生可见分数,而不是一个较小的分数,在缺少数字时,值得先知道这一点,因为它可能被解读为指控,也可能被解读为完全合格的证明。TextPulse 的 关于什么算是良好的 Turnitin 分数的指南 从报告读者的角度讨论了同一个阈值。
那么,已发布的假阳性率应当如何解读?
应当把它看作供应商针对一种比表面看起来更狭窄的条件所给出的数字,而不是针对摆在某位特定教授面前那篇论文的陈述。Turnitin 对其自身输出的表述也是如此, 公司明确指出,其 AI writing detection technology 并不提供“对不当行为的判定”,只提供“供教育工作者作出知情决定的数据”。关于 AI detectors 是否真的准确 的更广泛证据也支持同样的解读, 已发布的比率描述的是一个基准,而不是当前正在评分的文档。
想知道自己的草稿在同类统计测量中的位置,而不是靠猜测的作者,可以在任何内容进入机构的 detector 之前,直接用 free perplexity checker 检查。这与事后试图对分数提出异议是不同的用途,而且在这里,先看到数字的是作者,而不是管理员。
对于使用其他系统的机构,ZeroGPT 的准确性已另行讨论。受这些错误影响最严重的群体,非母语英语写作者,也有专门页面讨论。
最容易受到这一算术影响的人群也并非均匀分布。非英语母语写作者承担着落入这些百分比错误一侧的最大已记录风险,而这正是TextPulse 面向 ESL 学术写作者的页面所围绕的受众。Turnitin 会在重新训练其模型时继续修订这些数字。不会改变的是这一算术本身:如此小的比率仍然需要如此大的人群作为其消失的容器,而大多数真实提交并没有这种运气。
常见问题
根据 Turnitin 自己公布的数据,Turnitin 的假阳性率不是一个单一数字。在文档层级,Turnitin 声称低于 1%,但这只适用于已被标记为 20% 或以上由 AI 写成的文档。在句子层级,单独的行会被高亮显示,公司给出的数字约为 4%。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.