Compilatio AI Detector 评测:欧洲的机构检测器
Compilatio 是欧洲大学授权使用的检测器,而美国的综述通常默认 Turnitin:它由法国开发,已被50多个国家的1100多所学校使用,也是唯一一种学生可以在提交前自行运行于自己作品上的主要机构检测器。它声称对 AI 文本的识别可靠性为94%到99%,误报率低于1%。唯一一项纳入它的同行评审研究将其排在14款工具中的第二位,并得出结论称其测试的工具既不准确也不可靠。以下是证据所支持的内容。
Compilatio 是欧洲大学授权使用的 AI 检测器,而美国的综述通常默认是 Turnitin。它由法国开发,在抄袭检测领域已有二十多年,其官网称,已在 50 多个国家配备了超过 1,100 所学校。如果你在法国、比利时、瑞士或西班牙撰写论文,这往往就是读取它的软件。
其准确性主张很具体, 对 AI 生成段落的检测“可靠率为 94% 到 99%”,且“误报率低于 1%”。唯一一项纳入 Compilatio 的同行评审研究将其在十四种工具中排在第二位,位于 Turnitin 之后,并得出结论称,其测试的工具“既不准确,也不可靠”。
在研究者认定不可靠的领域里位居第二,这正是本评测所讨论的张力。Compilatio 还做了一件其他机构竞争对手都不做的事, 它把同一款检测器卖给被评估的学生,起价为 4.99 欧元。
Compilatio 是什么,谁 वास्तव上在使用它?
Compilatio 销售四种产品,按持有文档的人来区分。Magister 是面向教师的相似性检查器。Magister+ 在此基础上增加了 AI 检测、深度改写检测、多语言和翻译检测,以及语法检查。Studium 是学生版本,以积分出售。Compilatio Copyright 面向在发表前检查作品的专业写作者和编辑。

该公司报告称,其用户超过一百万,覆盖 50 多个国家,并且 95% 的学校每年都会续订。其服务器位于法国,这对于在将学生作业发送给美国处理方之前权衡 GDPR 义务的欧洲机构来说,确实是一个卖点,这也是 Compilatio 在法语系统中的地位,类似于 Turnitin 在英语系统中的地位。
Compilatio 对其自身准确性的说法
该供应商的AI detector 页面声称,对 AI 生成段落的检测具有“94% 到 99% 的可靠率”,并且“误报率低于 1%”,其中该范围会随文档长度、语言和学术内容类型而变化。它表示,该检测器覆盖 35 种以上语言,并可识别来自 ChatGPT 的输出,涵盖 GPT-5.2、GPT-5.1、GPT-5、GPT-4.5、GPT-4o 和 GPT-4o Mini,以及 Gemini、Claude、DeepSeek 和 Copilot。结果会以 0 到 100 之间的百分比呈现给教师,用于估计文档中有多少内容是机器生成的。
在其官方博客上,该公司将这一数字置于背景中加以说明:它报告其 2023 年检测器的准确率为“超过 70%”,并称自那以后可靠性“提高了超过 20%”。这在检测器网站上并不常见,供应商会公布其产品过去的得分。
免责声明也异常直接。Compilatio 表示,“AI 生成内容的百分比应始终谨慎解读,并辅以人工分析”,“AI detectors 不能声称自己 100% 准确”,以及“最终判断应始终由教育者和学生作出”。将这一点与那些宣称 99% 确定性却不附带任何保留意见的竞争者相比,这种呈现方式在同类产品中更为诚实。不过,这仍然是供应商测试,由销售该产品的公司执行并报告。
独立证据显示了什么
真正重要的研究是Weber-Wulff 及其同事在 International Journal for Educational Integrity发表的研究,该研究测试了十四个系统, 十二个公开可用的工具,加上商业产品 Turnitin 和 PlagiarismCheck。在准确性方面,论文报告称, “Turnitin 在所有准确性分类方法中都获得了最高分,其次是 Compilatio 和 GPT-2 Output Detector”。在十四个系统中排名第二,是 Compilatio 能取得的最佳独立排名。
该论文对整个类别的判断,比这一排名听起来更严厉。作者得出结论称, “现有检测工具既不准确也不可靠,并且主要偏向于将输出分类为人类撰写,而不是检测 AI 生成文本”,并且“内容混淆技术会显著恶化工具的性能”。一种倾向于把文本判定为人类撰写的检测器,在假阳性方面会显得非常出色,但会漏掉它本应捕捉到的 AI 文本,这正是低于 1% 假阳性率说法背后的权衡。
| 问题 | Compilatio 发布的内容 | 独立测试所确立的内容 |
|---|---|---|
| 对 AI 段落的可靠性 | 94 到 99%,来自供应商自身测试 | 在十四个工具中排名第二,而该研究的总体结论是这一类别并不可靠 |
| 假阳性 | 低于 1% | 没有针对 Compilatio 的独立数据, 所测试的工具都偏向于将文本判定为人类撰写 |
| 改写或混淆后的 AI | Magister+ 将“深度改写”的检测作为卖点 | 混淆在所测试的工具中“显著恶化”了性能 |
| 语言 | 超过 35 种 | 未按语言进行独立基准测试 |
有两个注意事项分别指向相反的方向,而且二者都应当出现在任何诚实的解读中。那项研究针对的是 2023 年代的模型,因此它并不能说明当前检测器如何处理 GPT-5 输出,而 Compilatio 此后自称提升了 20 个百分点的说法也不会体现在其中。与此相对,最近一次大型机构间直接比较,即 2026 年 Vrije Universiteit Brussel 的研究,把 Pangram、GPTZero、Copyleaks 和 Turnitin 用于 160 篇长篇学术论文,但并未纳入 Compilatio。因此,它宣称的 94 to 99% 也没有来自外部的当前确认,无论正反皆然。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
改写主张才是有意思的部分
大多数检测器只出售一个数字。Magister+ 则出售多个数字,而额外的那些直接针对规避行为。它宣称能够“检测深度改写”,并将其界定为语义抄袭,同时还宣称能够“检测多语言相似性, 翻译”,用于先用一种语言起草,再翻译成另一种语言的改写文本。它还报告“‘无法识别语言’段落的百分比和位置”,这是一种把字符隐藏在文档中的手法,使文本无法被肉眼读取。
这一功能组合正是针对学生试图通过相似性检查的两种最常见方式, 对来源文本进行转述,以及对其进行翻译。它是否真的能达到所宣称的速率,恰恰是尚未经过独立测试的部分,而 Weber-Wulff 发现混淆会显著削弱检测效果,这一结论适用于当时的工具,而不是这一特定功能。无论如何,值得理解的是,转述和 AI 检测是两个不同的问题,相关内容见 Turnitin 是否检测转述文本,而分类器实际读取的信号则在 AI 检测器如何工作 中有说明。使用 free burstiness checker 检查草稿自身的句子变化,比供应商的标题式百分比更能说明检测器会对什么作出反应。
定价与访问权限,包括 Turnitin 不提供的部分
Studium 以分析积分出售,每 250 个词 1 个积分,有效期为六个月,可用于多个文档。套餐分别为 20 个积分,价格 4.99 欧元,对应 5,000 个词,80 个积分,价格 12.99 欧元,对应 20,000 个词,160 个积分,价格 19.99 欧元,对应 40,000 个词,以及 400 个积分,价格 34.99 欧元,对应 100,000 个词。首次部分分析免费,可预览前三个匹配来源。所在机构已订阅的学生每年可获得 40 个免费积分,约合 10,000 个词。
Magister 和 Magister+ 没有公开价格。机构需申请报价,这在市场这一半中很常见。
访问方式比价格更重要。由 Turnitin 评估的学生不能先用自己的草稿运行 Turnitin,而通过其 LMS 由 Copyleaks 评估的学生通常无法看到其分数所依据的完整报告。Compilatio 机构中的学生可以以一杯咖啡的价格购买同样的 AI 检测,并在提交任何内容之前阅读结果。这是本评述中最具实际价值的事实。
Compilatio 在检测器格局中的位置
Compilatio 是可信的欧洲机构选项,而且它比大多数竞争者更为谨慎地呈现自身, 采用范围而非单一数值,公布其用于评分的内容说明,并明确指出该百分比并非裁决。这些都对它有利。
其证据基础仍然比部署范围更薄弱。关于它,独立确立的事实只有一项, 一篇同行评审研究中的第 2 名,共 14 个位置,针对 2023 模型,而该研究认为整个类别都不可靠。94 到 99% 这一数字是供应商自身给出的,且使 Magister+ 具有独特性的改写与翻译检测根本没有外部测试。以上都不意味着该工具不好。它意味着,Compilatio 的百分比只是一个需要进一步查看的理由,而不是任何结论的证明,这也是其自身文档所说明的。
公平性问题在这里与该类别中的其他情况一样适用,而且它对用第二语言写作的学生影响最为严重,这一模式已在为什么 AI 检测器对非母语英语写作者存在偏见中得到记录。如果某个分数被用来对付你自己写的作品,实际应对方法见如何证明你没有使用 AI,而更广泛的准确性情况见AI 检测器准确吗。
完整比较
Compilatio 是学生、研究人员或评分者很可能会遇到的十个检测器之一,而本次评审发现的模式, 前端是自信的供应商数据,背后是薄弱的独立记录, 在所有这些检测器中都重复出现。关于它与 Turnitin、GPTZero、Copyleaks、Pangram、Originality.ai 以及其他工具在同一证据优先标准下的比较,请参见完整的AI 检测器比较指南。
常见问题
Compilatio 声称其对 AI 生成段落的检测可靠性为94%到99%,误报率低于1%,这些数据来自其自身测试,并指出该范围会随文档长度、语言和内容类型而变化。独立地看,唯一一项纳入它的同行评审研究,Weber-Wulff 及其同事发表于 International Journal for Educational Integrity,将其排在14款工具中的第二位,仅次于 Turnitin,同时得出结论称所测试的工具既不准确也不可靠,并且倾向于将文本归类为人类撰写。该研究使用的是2023年时期的模型,目前尚未发表针对 Compilatio 的最新独立测试。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.