AI Detection

ZeroGPT 准确吗?

ZeroGPT 自己的 FAQ 声称其在内部测试中的准确率接近 98%,并且另外承认,公式化写作无论作者是谁,都可能被判读为 AI。以下说明公司对其方法的表述、针对这一具体产品的独立测试发现,以及免费分数实际有何用途。

4 min
ZeroGPT accuracy: the company's own claimed rate next to its disclosed limitations on formulaic writing

ZeroGPT 准确率,按该公司当前自身的说法,是一个“在内部评估中逼近 >98%”的比率,公司也承认,这一数字来自它对自身进行的测试,而不是来自外部实验室。这个单一限定词,内部,几乎就是读者在把任何免费检测器的百分比当作既定事实之前所需要知道的全部。

ZeroGPT 是使用最广泛的免费 AI 检测器之一,主要因为它不收费,并且能在几秒内给出答案。AI 检测器中普遍出现的,供应商声明与独立测试之间的差距在这里同样存在。下面将说明公司目前对其自身准确率和方法的表述,这种方法实际上似乎测量了什么,以及为什么这类工具在学术读者提交的那类写作中,往往会以特定且可预测的方式误判。

ZeroGPT homepage detector with a 15,000 character free input and no signup required
本评述的核心免费预检, 15,000 个字符, 无需账户。

根据公司说法,ZeroGPT 准确率是什么?

ZeroGPT 自己的 FAQ 表示,公司“提供行业领先的准确率,并持续改进以保持一流表现,正逼近内部评估中的 >98%。”这是一家供应商对其自身产品的声明,由公司自己测试,措辞中也确实包含了真实的保留语气, “逼近”某个数字,并不等同于已经达到并保持该数字,而“内部评估”意味着没有外部机构公布过可对应的数值。页面上没有说明该内部测试集有多大,包含什么内容,或者公司外部是否有人审查过其方法。

该公司建议至少使用 150 到 200 个词的文本以获得稳定结果,使用 500 到 1,000 个词或更多可进一步提高可靠性,并直接说明非常短或经过大量编辑的片段“携带的信号更少”。这一单独披露比标题中的百分比更重要。它是供应商自身承认,分数的可信度仅取决于输入文本的长度和未被改动的程度,而真实提交并不总能满足这一条件。

ZeroGPT 实际使用的是什么方法?

ZeroGPT 将其底层系统称为 DeepAnalyse,其网站将其描述为一种“旨在优化准确性并尽量减少假阳性和假阴性的多阶段方法”,能够“从宏观层面读到微观层面”。其 FAQ 在品牌表述之下描述了更具体的内容, 即对“token 模式、burstiness、entropy,以及在混合数据集上训练的集成分类器特征”的分析。

Burstiness 和 entropy 并非 ZeroGPT 独有。它们是相同的统计属性,即句子长度和节奏变化的程度,以及下一个词的可预测性,TextPulse 关于AI 检测器如何工作的说明将其作为这整个工具类别背后的通用机制加以阐述。一个免费 perplexity 检查器会直接显示同一个底层数值,而不要求写作者先相信任何单一供应商的百分比。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

为什么学术写作会让这些检测器出错?

ZeroGPT FAQ 对此的表述是:“高度润色、公式化或低 entropy 的写作可能看起来像 AI。”学术写作正是为了高度润色、公式化、低 entropy 的写作而设计的。方法部分、文献综述和正式求职信都更青睐传统表达而非创新表达,因为传统表达首先使文档对读者可用,而这种传统恰恰就是供应商自身披露中所称的、构成风险的低 entropy 模式。

独立的、经过同行评审的测试表明,为什么这种失效模式对某些作者的影响比对其他作者更大。2023年一项 Stanford 研究将七种广泛使用的检测器,包括 ZeroGPT,应用于91篇由非英语母语者撰写的真实 TOEFL 论文,以及88篇由美国八年级学生撰写的论文。ZeroGPT 将48%的 TOEFL 论文标记为 AI 生成,而八年级论文的标记率为0%,这与该研究中每一种检测器显示的错误方向相同,只是规模不同。

这种差距并非 ZeroGPT 独有,也不是什么新信息。它与检测器行业中记录在案的非母语作者偏差模式相同,TextPulse 的关于为什么 AI 检测器对非母语者存在偏差的页面对此有更深入的讨论。这个差距对一款免费消费级工具具体说明的是,供应商自己披露的限制,即低熵写作会被读作机器生成,并不是假设。同行评审测试在该公司当前 FAQ 用其自己的措辞说明这一机制之前数年,就已经在这款确切产品上捕捉到了这一现象。

免费的检测器分数能证明某一份文档的任何事情吗?

单独来看,不能。ZeroGPT 的百分比并不能证明关于某一特定文档的任何事情,无论正向还是反向。它只是一个模型的估计,这个模型建立在公司未以任何公司外部人士能够核查的形式公开的内部测试之上,并且应用于长度、编辑历史和文体都会改变解读的写作,而供应商自己的 FAQ 已经承认了这些变化。把单一的免费分数当作裁决,要求这个分数承担的意义,已经超过了发布它的公司对它本身的主张。

分数真正有用的范围更窄,也更平常, 它只是对一份草稿当前所处位置的快速、零成本判断,依据的是与付费机构工具同样的统计测量,而在其他人看到之前进行。TextPulse 的免费工具直接覆盖这一相同领域,而不要求写作者先猜测几个免费检测器的分数中哪一个更值得信任。

准确率数字掩盖了错误落在谁身上,以及是什么触发了它们。了解何时使用 a, an 和 the可以消除一种会引发标记的模式,而误报究竟意味着什么则另行说明。

这并不会使 ZeroGPT 的数字毫无意义,也不会使这个数字本身足够。分数只是一个起始估计,由公司仅作概述、且未向外部测试开放的方法生成,针对的是一种仅凭体裁就可能在任何相关人员做错任何事之前改变结果的写作。那个 FAQ 页面上承载最多信息的两个词不是百分比,而是紧挨着它的限定语, internal, 和 pushing toward。免费分数是关于草稿的一场对话的起点,而不是其中的结案陈词。

我们自己的研究发现了什么

在 TextPulse Research 的检测器一致性研究中,九款商用 AI 检测器对同样的 90 篇学术文本进行了评分。其中一篇是 455 词的混合文本:开头和结尾由人工撰写,中间是 168 词的 AI 生成段落。ZeroGPT 将这篇文本判为 7.6% AI,而其他工具对同样文字的判定从 0% 到 95.7% 不等。完整论文、语料库和每款工具的分数矩阵开放于 TextPulse Research

ZeroGPT 对研究语料库中混合文本的判定。
ZeroGPT 对研究语料库中混合文本的判定。
XLinkedInFacebook

常见问题

根据 ZeroGPT 公司目前自己的说法,ZeroGPT 准确性达到“接近 >98% 的内部评估”这一水平。该数字来自公司对其自身产品所做的测试,而不是来自外部实验室,且该供应商自己的 FAQ 另外指出,高度润饰或公式化的写作,无论作者是谁,都可能被读作 AI 生成。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。