Winston AI 评测:99.98% 准确率主张与证据
Winston AI 宣称 99.98% 准确率,这是检测器行业中最高的自我宣称数值,基于公司从未公开的内部测试集测得。同行评审的 RAID 基准在固定 5% 假阳性率下将其总体准确率定为 71%,在四个受测商业检测器中仍居第二。以下说明每个数字实际衡量的内容,以及这款工具真正适合哪些人。
Winston AI 宣称准确率为 99.98%,这是任何主流 AI 检测器中其自称的最高数值。这个数字出现在公司主页上,紧挨着“The Most Trusted AI Detector”这几个字,而且它来自公司的内部测试,而不是外部实验室。与之同时公布的,没有方法、测试集规模、人类与 AI 样本比例,或运行阈值。这个主张与其文档之间的差距,是谨慎读者首先需要了解的关于这款工具的事情。
第二点是,Winston 确实接受过外部测试,这一点比某些检测器能够做到的更多。RAID 基准测试是一项在 ACL 2024 上 प्रस्तुत的同行评审研究,它让 Winston 与大约 6.2 million 篇机器生成文本进行对比,并在将误报率固定为 5% 的情况下测得 71.0% 的总体准确率。这与 99.98% 相去甚远。它还把 Winston 排在所测试的四款商业检测器中的第二位,位于 GPTZero 和 ZeroGPT 之前。这两个事实都很重要,而且彼此并不相互抵消。
下面将说明 Winston 是什么、面向哪些用户、供应商声称了什么、99.98% 的自我基准在统计上能够意味着什么,不能意味着什么,以及独立数据实际上显示了什么。
什么是 Winston AI,谁在使用它?
Winston AI 是一款付费的订阅制检测器,明确面向教育工作者和内容出版商。它的功能列表很像教师的工作流程, 公司网站描述了可从扫描文档、照片和手写内容中提取文本的 OCR,列在其支持平台中的 Google Classroom 集成,AI 检测之外的抄袭检查器,以及用于管理批量提交的文档组织功能。供应商称它可以检测来自 ChatGPT、Gemini、Claude、LLaMA “以及更多” 的输出。
界面中最具辨识度的部分是按句输出。Winston 并不只返回一个百分比,而是生成其所谓的 AI prediction map, 即一种按颜色编码、逐句评估文档哪些部分看起来像机器生成的结果。对于教育工作者来说,这种图谱比单纯的分数更有用,因为它显示了工具的怀疑集中在何处。不过,它也很容易被过度解读,下文将讨论这一点。

公司声称了什么?
Winston AI 首页上的醒目主张是“99.98% Accurate.”。截至本文写作时,展示这一数字的页面并未公布测试语料是如何构建的,包含多少样本,使用了怎样的人类文本与 AI 文本混合比例,或者在测量该数字时检测器设定的判定阈值是什么。这在这个行业并不罕见, 同样的供应商准确率主张与独立证据之间的差距几乎存在于市场上的每一种检测器。Winston 版本的这一主张,只是任何人给出的最大数字。
99.98% 的自我基准测试实际上意味着什么?
先认真看一下这个算术。99.98% 的准确率意味着每 10,000 个样本中有 2 个错误。要真正测出这个数字,公司至少需要一个带标签的测试集,其中包含数以万计的文档,并且每一段文本的真实来源都能被确定无疑地知道。然后,这个数字只描述该语料上的表现, 即那些 AI 模型、那些提示词、那些体裁、那个文本长度,以及在某一个选定阈值下的表现。
这些都不需要恶意。一个在由流行聊天模型生成的论文上训练、然后又在由流行聊天模型生成的论文语料库上测试的检测器,确实会得到接近上限的分数。问题在于可迁移性。一旦输入文本来自不同的模型、不同的采样策略,或者来自一位自然风格异常均匀的作者,用来测量基准的数据语料库就不再能描述正在被判断的文本。内部基准是由对结果最有利的一方,在其自行选择的条件下进行的受控实验。它是一种证据,但属于最弱的一类,而且缺失的方法学意味着公司外部的任何人甚至都无法核查它。
独立测试显示了什么?
包含 Winston 的最严格公开测试是 RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors,这是一项由 Dugan 及其同事完成、并在 ACL 2024 上 प्रस्तुत的同行评审研究。RAID 评估了 12 个检测器,包括 4 个商业产品,针对大约 6.2 million 个生成文本,覆盖 11 个语言模型、8 个写作领域、4 种解码策略和 11 种对抗性攻击,并将每个检测器都校准到相同的 5% 假阳性率,因此这些分数具有可比性。
| 检测器 | RAID 中的总体准确率, FPR 固定为 5% |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
对该表格有两种解读,而且两种解读同时都是真实的。Winston 的 71.0% 远远达不到 99.98%,但 Winston 在可获得的最难公开基准上,仍然击败了其三个商业竞争对手中的两个。平均值也掩盖了一个很有说明性的分布。在 RAID 的按模型结果中,Winston 在 ChatGPT 输出上得分 99.6%,在 GPT-4 输出上得分 98.8%,接近其自身宣传的数值,但在 GPT-2 文本上降至 47.6%,在来自基础 MPT-30B 模型的文本上降至 24.8%。在经过改写的机器文本上,其准确率下降到 52.6%。
这种分布就是 99.98% 这一说法的缩影。对于看起来像检测器大概经过调校的那类文本,也就是近期聊天模型写出的普通散文,Winston 的表现接近其营销说法。离开这一分布后,性能便急剧下滑。一个由分布内文本构建的内部基准,确实可能给出一个接近完美的数字,却几乎不能告诉你真实收件箱中那种由模型、编辑和改写混合而成的杂乱内容。检测器所依赖的统计信号,在我们关于AI 检测器如何工作的说明中有更深入的讨论。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
误报, 谁会受害?
RAID 的设计使一种权衡变得可见,而厂商营销很少呈现这一点, 研究中的每一个准确率分数都是在将误报率固定为 5% 之后测得的。在这一校准下, 每 20 份真正的人类文档中就有 1 份会被标记。检测器可以通过提高阈值来降低这一比率, 但代价只是捕捉更少的 AI 文本, 这两个数字会一起变化, 而厂商若只引用其中一个而不提另一个, 就只是在引用一半结果。
这些错误的负担并不是平均分担的。那种公式化、传统化、低方差的写作,对每一种统计检测器来说都读起来像机器生成的文本,而这种描述适用于方法部分、文献综述,以及以第二语言写作的作者所写的谨慎散文。AI detectors 以更高比例标记非母语英语使用者的模式已在整个行业中得到记录,而 Winston 的方法并不能免于这一点。逐句预测图也应当同样谨慎看待, 红色高亮的句子只是关于词语模式的统计观察,不是关于作者身份的证据。面对错误标记的学生应当从文档记录入手,而不是从认错开始, 我们关于如何证明你没有使用 AI的指南说明了真正有说服力的内容。
定价与访问
Winston 是一款付费产品,提供有限试用。Winston 列出的方案包括, 14 天免费试用,含 2,000 credits, Essential 方案每月 $18, 或按年计费时每月 $10, 含 100,000 月度 credits, Advanced 方案每月 $29, 或按年 $16, 该方案增加了团队席位和更大规模的扫描, 以及更高一级的 Elite 方案。对于一位独立教育者筛查一整个班级的提交内容来说,这使 Winston 处于冲动购买的价位,价格低于机构合同,能力又强于大多数免费工具。
Winston 在检测器格局中的位置
根据独立证据,Winston 是一款中价位的商业检测器,其表现优于市场上的免费层级,但不及其自身宣传。它适合希望获得逐句可见性、Classroom 集成以及抄袭检查于一体的低成本工具的教育者,并且把每一次结果都视为对话的起点,而不是裁决。它不适合任何需要让分数充当证据的人,因为没有任何检测器的分数能够做到这一点。
完整比较
Winston 只是拥挤市场中的一个检测器,其 71% 与 99.98% 的差距,是整个行业普遍模式的一个例子。若要了解它在同样以证据为先的标准下,与 Turnitin、GPTZero、Originality、ZeroGPT 以及其他工具相比如何,请参阅我们的完整指南AI 检测器比较。
我们自己的研究发现了什么
在 TextPulse Research 的检测器一致性研究中,九款商用 AI 检测器对同样的 90 篇学术文本进行了评分。其中一篇是 455 词的混合文本:开头和结尾由人工撰写,中间是 168 词的 AI 生成段落。Winston AI 将这篇文本判为 7% AI,而其他工具对同样文字的判定从 0% 到 95.7% 不等。完整论文、语料库和每款工具的分数矩阵开放于 TextPulse Research。

常见问题
99.98% 这一数字是 Winston AI 自身的主张,基于公司未公开的内部测试集测得。在 ACL 2024 上展示的同行评审 RAID 基准中,Winston 在将假阳性率固定为 5% 时,总体准确率为 71.0%,不过在专门针对 ChatGPT 输出时达到了 99.6%。这一主张描述的是所选语料,而不是现实世界中的表现。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.