Pangram AI Detector 评测:研究人员持续验证的工具
Pangram 公布的误报率约为 1 in 10,000,而且与大多数检测器供应商不同,它现在有近期的独立研究指向同一方向。来自 Vrije Universiteit Brussel 的一项经同行评审的 2026 年研究发现,在四种工具中,只有它在硕士层级论文上给出了令人满意的结果。以下说明这些研究测量了什么,证据在哪些方面仍然薄弱,以及任何检测器分数都无法证明什么。
Pangram 是独立研究人员不断点名提及的 AI 检测器,这使它值得比通常的供应商评分表更仔细地审视。其开发者 Pangram Labs 公布的假阳性率约为 1 in 10,000,标题式准确率为 99.98 percent。这些都是公司自己的数字,基于其自己的基准测得。Pangram 与大多数同类产品的区别在于,至少这一次,近期的外部研究指向了大致相同的方向。
过去一年内出现了两项独立评估, 一项是 Vrije Universiteit Brussel 的同行评审研究,由 Springer 于 June 2026 发表,另一项是 University of Chicago Booth School 的工作论文,由 Chicago Booth Review 在 December 2025 报道。两者都将 Pangram 明显置于更知名的竞争对手之上,包括 Turnitin、GPTZero 和 Copyleaks。两项研究都没有把任何检测器的分数视为对某一特定文档具有证明力的证据,而且它们也明确说明了这一点。
以下内容将说明 Pangram 对自身的主张,这两项研究实际测量了什么,证据在哪些方面仍然薄弱,以及这一工具的崛起对整个检测领域意味着什么。
Pangram 是什么,以及谁在使用它
Pangram Labs 是一家小公司,成立于 2023 年,总部位于 Brooklyn,由此前在 Tesla 和 Google 工作的 AI 研究人员创立。该产品会检查粘贴或上传的文本,并返回其中有多少是 AI 生成的估计值,同时提供句子级高亮,在付费方案中还包括图像检测和抄袭检查。
它的用户群与 Turnitin 不同。Turnitin 面向机构销售,并在学习管理系统中运行, 而 Pangram 任何拥有免费账户的人都可以使用,这意味着学生、编辑、期刊工作人员和招生审阅者会直接使用它。它是这一市场中的后来者,而且越来越多地成为学术诚信研究人员在需要比较基准时会选择的工具,正因为它在现有产品表现不佳的测试中持续表现良好。
供应商的主张
Pangram 的首页宣称准确率为 99.98 percent,并说明其误报率,即人类文档被错误标记为 AI 的比率,目前为 1 in 10,000。一篇关于误报的公司博客文章由其 CTO 撰写,将这一总体数字按文体细分为, 学术论文为 0.004 percent,科学摘要为 0.001 percent,公司自身也披露了较弱的部分,例如诗歌为 0.05 percent,食谱为 0.23 percent。该公司还声称,其模型在文本经过所谓 humanizer 工具处理后,仍然能够检测出 AI 文本。
这些数字全部来自供应商自身测试集的自报结果,而同一篇文章也附带了供应商自己的限制说明, 该模型在由完整句子构成的较长文本上效果最好,公司不建议对简短的项目符号列表或高度程式化的文本进行筛查。应同时注意这两个方面。这些主张异常具体,也异常低,但在公司外部有人核查之前,它们仍然只是主张。

独立证据显示什么
迄今为止最有力的测试是一项经同行评审的研究,由 Vrije Universiteit Brussel 的 Van Vlasselaer、Van Droogenbroeck 和 Spruyt 完成,发表于 2026 年 6 月,刊登于 International Journal for Educational Integrity。研究团队构建了 160 篇硕士层级的学术论文,每篇至少 4,000 词,其中 40 篇由 2019 年前的真实学生撰写,40 篇完全由 GPT-4o Deep Research 生成,40 篇为混合文本,另有 40 篇先由 AI 生成后再刻意人工化处理。他们将所有论文分别输入 Turnitin、GPTZero、Copyleaks 和 Pangram。
对于完全由 AI 生成的论文,研究报告称 Turnitin、GPTZero 和 Copyleaks “完全未能检测出 AI 生成内容”。Turnitin 对这 40 篇论文中的每一篇给出的 AI 比例都在 0 到 20 percent 之间,这三种既有工具在这些 100 percent 机器写作的论文上的中位数评分都低于 20 percent。Pangram 在同一组样本上的严格准确率达到 65 percent,包容性准确率达到 97.5 percent,仅将一篇论文误判。对于人工化处理后的样本,Pangram 在 40 个案例中正确识别出 37 个含有 AI 内容,严格准确率为 92.5 percent,而 GPTZero 仅为 2.5 percent,Copyleaks 为 22.5 percent,Turnitin 为 50 percent。
| 工具 | 完全 AI 论文, 严格准确率 | 人工化 AI 论文, 严格准确率 | 正确判定为人类论文的比例 |
|---|---|---|---|
| Pangram | 65% | 92.5% | 100% |
| Turnitin | 0% | 50% | 100% |
| GPTZero | 0% | 2.5% | 100% |
| Copyleaks | 0% | 22.5% | 100% |
第二个数据点是一篇由 Chicago Booth 的 Brian Jabarian 和 Alex Imas 撰写的工作论文,2025年12月在 Chicago Booth Review 中作了概述。研究者在大约2,000段人类撰写的文本上测试了检测器,这些文本跨越六种媒介,另加来自四个前沿模型的 AI 版本。他们发现,Pangram 的误报率在大多数判定阈值下几乎为零,在其语料库上的准确率从未低于99.8%,而漏报率则根据模型不同介于2%到4%之间。研究者建议,机构在将任何检测器用于实际操作之前,应采用严格的政策上限,例如将被标记的人类写作比例限制在不超过0.5%。请注意状态上的差异, Booth 论文是一篇工作论文,尚未经过同行评审,而且它测试的是未经修改的 AI 文本,而不是经过人类化处理的学术论文。
误报以及受影响的人群
误报是检测器损害最集中的地方,而这一行业中记录下来的模式是,标记会不成比例地落在非英语母语写作者身上。VUB 研究在这一点上尤其值得阅读, 其40篇人类论文全部由非英语母语者撰写,而包括 Pangram 在内的四种工具都对它们给出了100%的通过率。这确实是一个令人鼓舞的结果,但它也只是40篇论文。这样的样本规模无法证实0.004%这样的比率, 只有供应商自身规模大得多的内部测试才能产生如此精细的数字,而没有任何外部机构在同等规模上复制过这些结果。
该研究的真实世界部分显示了为什么即使在良好的基准测试下,谨慎仍然必要。当研究人员将 Pangram 用于 2024 年和 2025 年的 1,163 篇实际硕士论文时,它在某种程度上标记了其中 45.5 percent,且在被标记的案例中,估计的 AI 占比中位数为 30 percent,而这些论文都不存在任何真实标签。作者表述得很直接, 检测分数只是有用的初步提示,绝不应在高风险决策中作为唯一证据。面对指控的学生仍然需要 基于程序的方式来证明作者身份,无论是哪一种检测器给出了这个数值。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
定价与访问
Pangram 的网站在注册账户后提供每天 20 次免费检查,付费订阅则增加额度和诸如抄袭检测之类的功能。这样的访问模式与准确率数字同样重要, 不同于 Turnitin, 作者只有在机构用它对其进行检测时才会接触到它,Pangram 可以直接检查,因此作者能够看到审稿人在提交任何内容之前可能看到的同类信号。
Pangram 在检测器格局中的位置
VUB 作者对该领域的总结很直白: "在这里研究的四种 AI 检测工具中,目前只有一种产生了令人满意的结果。" 这句话既说明了 Pangram,也说明了现有主流工具。Turnitin, 也就是大多数机构实际依赖的工具,对完全由 AI 生成的集合得分为零,而其 单独记录的误报情况 已经迫使大学谨慎对待其分数。所有这些工具都在测量文本的统计特征,而 其底层机制 既解释了为什么 Pangram 更新的训练方法能够领先,也解释了为什么它们每一种都仍然是概率性的。
坦率的结论是,基于近期证据,Pangram 目前是在独立测试中支持度最好的检测器,而且优势相当明显。不过,这些证据的范围也很有限。共有两项研究,一项经过同行评审,一项没有,均来自过去一年,主要是英文文本,且主要是长篇学术文本和网页文本。检测是一场与每季度都会变化的模型之间的军备竞赛,而在 2026 年领先的工具,只会领先到下一代文本出现为止。Pangram 分数比其竞争对手给出的结果更具校准性。它仍然只是一个估计值,而不是任何特定个人所做之事的证据。
查看完整比较
Pangram 只是一个工具,处在一个拥挤且不均衡的领域中。若要了解它与 Turnitin、GPTZero、Copyleaks、ZeroGPT 以及其他工具在相同标准下的表现对比,请参阅完整的 AI detectors compared 指南。
我们自己的研究发现了什么
在 TextPulse Research 的检测器一致性研究中,九款商用 AI 检测器对同样的 90 篇学术文本进行了评分。其中一篇是 455 词的混合文本:开头和结尾由人工撰写,中间是 168 词的 AI 生成段落。Pangram 将这篇文本判为 34% AI,而其他工具对同样文字的判定从 0% 到 95.7% 不等。完整论文、语料库和每款工具的分数矩阵开放于 TextPulse Research。

常见问题
Pangram 自身宣称的准确率为 99.98 percent,误报率约为 1 in 10,000,依据的是内部基准测试。就这个行业而言,这一点不同寻常,因为近期的独立研究也指向同一方向, 一项经同行评审的 2026 年 6 月 Vrije Universiteit Brussel 研究发现,在四种工具中,只有它能够可靠地检测完全由 AI 生成以及经过人类化处理的硕士层级论文,一篇 Chicago Booth 工作论文则发现其在所用语料上的误报率接近于零。独立证据较强,但时间较近且范围有限。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.