2026年学术写作最佳AI检测器:10款工具比较
这十款检测器中有两款公布了相同的99.98%标题准确率。其中一款说明了背后的研究者,并按文类拆分了误报率。另一款则没有说明任何测试。十款工具从四个维度进行比较, 购买者是谁, 它们宣称什么, 这些宣称背后有什么证据, 以及报告实际显示什么, 另外还包括一种可能完全取代评分的过程追踪模型。
这里的十种工具中,有两种公布了相同的标题数字, 99.98% 准确率。其中一种说明了给出这一数字的研究人员和大学,并按内容类型拆分了其误报率。另一种则根本没有说明任何测试。在任何并列比较的 AI 检测器集合中,这种对比都是最有用的信息,而且在这些页面上的每一个价格都发生变化之后,它仍然会有用。
本指南比较 2026 年学术写作中最好的 AI 检测器, Turnitin, GPTZero, Copyleaks, Originality.ai, Pangram, Winston AI, ZeroGPT, Scribbr, Sapling 和 Compilatio, 也就是学生、研究人员、评分者或编辑最可能接触到的十种工具。它们面向不同买家销售,采用不同定价模式,并返回不同类型的信息。仅按准确率比较,几乎会忽略决定你的文本被哪一种工具处理,以及处理之后会发生什么的全部关键因素。
真正不同的四件事
检测器的营销页面在一个数字上趋同,而在其他所有方面分化。四个问题将这些产品区分开来,而主页上的百分比只是其中之一。
- 它面向谁销售。授权给机构、且只向教师展示的工具,与任何人都可以在浏览器中注册使用的工具,所处位置不同,而这种差异决定了究竟是谁会看到关于你的结果。
- 它公布什么数字。这里的每一家供应商都公布某种主张,从一个单纯的百分比,到一个精确到四位数字的误报率。
- 这个数字背后是否有一项有名称的测试。这个维度最清楚地区分了这十种工具,也是任何供应商比较表都不会使用的维度。
- 报告实际返回什么。文档级百分比、句子级高亮、可解释性视图和可共享报告是四种不同的对象,而基于其中一种对象提出的指控,与基于另一种对象提出的指控,属于不同的讨论。
第三个问题值得仔细思考。一个带有明确机构、明确数据集和明确方法的百分比,可以被争论、复制或质疑。一个背后什么都没有的百分比,只能被相信或忽略,而相信并不是不当行为听证的依据。困惑度是较早一代检测器最依赖的统计属性,它的可测量性足以让一个免费困惑度检查器向你展示它在你自己写作中的表现,不过下面没有任何供应商把其判定结果报告为困惑度分数。
比较表, 每个工具面向谁销售,以及它声称什么
| 检测器 | 销售对象 | 获取方式 | 核心主张 | 主张所依据的命名测试 |
|---|---|---|---|---|
| Turnitin | 持牌机构中的教育工作者和管理员 | 仅限机构许可 | 文档误报率低于 1%,高于 20% 阈值 | Turnitin 自有验证集, 未命名外部研究 |
| GPTZero | 教师、学生、写作者、招聘人员、出版商 | 直接注册,免费层级 | 99% 准确率, 混合文档为 96.5% | 指向 RAID, 一个第三方基准, 以及 Penn State 合作项目 |
| Copyleaks | 教育和企业, 可在 Canvas、Blackboard 和 Moodle 中使用 | 直接注册和 LMS 许可 | 准确率超过 99%, 误报率为 0.03% | 存在独立数据, 即下文的 2026 VUB 研究 |
| Originality.ai | 写作者、编辑、营销人员、机构、企业 | 直接注册, 基于积分 | 在最新 AI 模型上准确率为 99% | 其自身的准确率研究以及第三方同行评审研究 |
| Pangram | 大学、学校和企业 | 直接注册, 机构和 API 方案 | 99.98% 准确率, 误报率为 1/10,000 | 一项其归因于 Chicago Booth 和 University of Maryland 研究人员的研究 |
| Winston AI | 个人、团队、网站认证客户 | 直接注册, 基于积分 | 99.98% 准确率, 并称这是达到该水平的唯一检测器 | 未命名 |
| ZeroGPT | 个人, 无需注册的预检 | 免费, 15,000 字符, 无账户 | 内部评估中高于 98% | 未命名, 该数字为供应商自有 |
| Scribbr | 学生,免费检查器加高级层级 | 浏览器内免费使用 | 测试文本中有 78% 被正确识别 | Scribbr 自己进行的比较, 由 Scribbr 自行运行 |
| Sapling | 开发者和支持团队, 以 API 为先 | 直接注册, 公共 API, 浏览器扩展 | 逐句 AI 概率 | 未命名, 独立评测彼此之间存在显著分歧 |
| Compilatio | 欧洲机构和学生, 在法语系统中最强 | 机构许可, 或学生直接购买, 价格从 4.99 euros 起 | 94 到 99% 的可靠性, 误报率低于 1% | 在 14 种工具中排名第 2, Weber-Wulff et al. 2023 |
有一行的表现与其他行不同。Turnitin 不能由被评估者购买,不能由其在提交前运行,而且会把结果返回给其他人。Compilatio 也以同样方式由机构授权,但它还直接向学生出售同样的检测,因此它是唯一一种机构检测器,你可以先在自己的草稿上运行。这里其他所有检测器,都是学生、作者或编辑今天下午就可以在浏览器中打开并指向自己文本的产品。
准确性声明,以及哪些有命名的测试作为依据
Winston AI 和 Pangram 发布了相同的数字。Winston 声称它是“唯一准确率达到 99.98% 的 AI 检测器”。Pangram 的主页写道:“以 99.98% 的准确率检测 AI 生成内容。受到全球大学、学校和企业的信任。”这些数字完全相同,但其依据远非如此。
Pangram 指明了其来源。其自身页面将这一统计数据归因于芝加哥大学 Booth School of Business 和 University of Maryland 的研究人员所做的一项比较研究,并公布了按内容类型划分的误报分析。Winston 的页面没有指明任何研究, 也没有指明任何数据集、样本量或 99.98% 这一数字的方法。那里可见的可信度标记是 SOC 2 和 GDPR 徽章以及媒体标志,它们说明的是安全状况和媒体报道,而不是检测性能。每一项声明的完整拆解都见于专门评测:Pangram 评测 和 Winston AI 评测。
这十项中最具体的数字由 Turnitin 发布,而且是错误率,不是准确率:在其 20% 阈值以上,文档层面的误报率低于 1%,句子层面的错误概率约为 4%,以及在文档中漏掉 15% 的 AI 文本的声明概率,这一公开的漏检率几乎没有人会引用。Turnitin 的检测器如何工作以及其误报率在实践中意味着什么另有单独说明。
GPTZero 公布了 99% 的准确率,并指向 RAID, 一个第三方基准,以及宾夕法尼亚州立大学的研究合作,这使它比单纯的数字多了一步,但比引用少了一步。Originality.ai 公布了在最新 AI 模型上的 99%,引用了其自身研究和第三方同行评审工作,同时还公布了应当统领本节的这句话: "Any AI detector accuracy claim that is not transparently supported by methodology, benchmark data, and independent or reproducible analysis should be viewed skeptically." 若将这一标准一视同仁地应用,就会对本页上的每一个数字提出同样的问题,包括两个 99.98% 的说法。ZeroGPT 的数字,基于内部评估高于 98%,同样没有附带具名测试, the ZeroGPT accuracy review 追溯了这一数字的来源。Scribbr 的 78% 至少坦率说明了其规模,尽管该测试是 Scribbr 自己的。
同样的标准也必须适用于我们自己的数字。TextPulse 在其 academic AI humanizer 上公布了针对 Turnitin AI 的 92.33%、针对 Originality.ai 的 89.12% 以及针对 GPTZero 的 87.91% 的实测通过率。这些都是来自供应商测试的供应商数据,和 Winston's 以及 Pangram's 的情况完全一样,而且这个市场任一方的任何工具都无法保证检测器会对某一特定文档报告什么结果。
学术写作的前 10 个 AI 检测器
每一项都涵盖同样四件事: 引擎如何工作,供应商声称了什么,独立证据显示了什么,以及谁 वास्तव际使用该工具。每个部分链接的专门评测会更深入地展开。
1. Turnitin: 机构默认选项

Turnitin 的 AI 写作指示器是一种在学术散文上训练的深度学习分类器。它会将提交内容拆分为若干重叠的片段,每个片段约几百个词,对每个片段中模型生成文本的统计模式进行评分,并将结果汇总为教师看到的文档百分比。只有长篇散文才计入合格文本,项目符号列表、引文和参考文献均被排除。
Turnitin 公布的是错误率,而不是准确率, 对于超过其 20% 阈值的论文,文档假阳性率低于 1%,对任何单个被标出的句子,错误可能性约为 4%,并且其声明的漏检概率是文档中 15% 的 AI 文本。2026 年的 VUB 研究比供应商自己的数字更为严苛, 在测试集中 40 篇完全由 AI 生成的论文中,Turnitin 对每一篇都报告了 0% 的 AI。它之所以仍是默认选项,是因为它嵌入在已有超过 16,000 所机构许可的抄袭检测流程中, 这是 Turnitin 自己的统计,而且只有教师和管理员能看到分数。它也是本页中被回撤最多的工具, 多所主要大学因假阳性担忧而停用了它,相关情况见 universities that stopped using Turnitin。How Turnitin detects AI 和 similarity versus AI score 介绍了其机制。
2. GPTZero: 最大的学生端品牌

GPTZero 于 2023 年 1 月推出,最初是一个困惑度和突发性检查器,此后已将其引擎重建为多层分类器。一次扫描会返回文档判定、在 AI、人类和混合之间分配的概率、按句高亮显示推动结果的段落,以及一个 AI 词汇列表。其主页声称 99% 准确率、17 million 用户和 1 million 教育工作者, 免费层每次扫描可接受约 10,000 个字符, 公司还发布了一个 ESL 校准, 旨在减少对非母语英语写作的误报。
从证据来看,它处于中游。它引用了第三方 RAID 基准测试和 Penn State 研究合作,这比单纯的宣称更进一步,但在 VUB 研究中,它在完全由 AI 生成的论文上的中位得分仍低于 20%, 且不同论文之间波动很大。它是学生在提交前最常用来预先检查自己草稿的工具。GPTZero 的工作原理逐层讲解了报告;GPTZero 与 Turnitin 的比较解释了为什么两者会对同一文本得出不同结论。
3. Copyleaks: 你 LMS 中的检测器

Copyleaks 将 AI 检测和抄袭检查作为一个企业产品出售, 并接入 Canvas、Blackboard 和 Moodle, 其语言覆盖范围在这十款工具中最广: 该供应商列出了 30 多种语言, 并为每种语言提供检测模型。一次扫描会返回带高亮段落的文档百分比。该供应商声称准确率超过 99%, 误报率为 0.03%, 免费扫描器可接受约 25,000 个字符。
独立记录是这一论点中较弱的一半。在 VUB 研究中,Copyleaks 没有将 40 篇完全由 AI 生成的论文中的任何一篇判定为完全由 AI 撰写,只对其中 40 篇中的 10 篇给出了哪怕部分的标记,并且在那些 100% 机器生成的论文上,报告的 AI 占比中位数仍低于 20%。不过,它确实让全部 40 篇人类撰写的论文都通过了,这些论文每一篇都出自非英语母语作者之手,这对其在误报方面的表现构成了真正有利的证据。Copyleaks 评测提供了完整情况。
4. Originality.ai: 为出版商而建,不是为课堂而建

Originality.ai 面向出版商、SEO 机构以及筛查自由撰稿内容的内容团队,而每一项设计选择都源于这一买家, 按额度计费,每 100 words 1 个额度,提供 API、Chrome 扩展、抄袭检测和事实核查附加功能,以及一个可调的 AI 容许度滑块,使编辑能够设定可接受的 AI 辅助文本比例。它会针对每一代新的语言模型重新训练检测模型,并声称对最新模型的准确率达到 99%,其依据是自身研究和第三方同行评审研究。
在独立测试中,它的表现相当不错,在 RAID 基准测试中属于最强的商业工具之一,而且其校准是有意设得更为激进的, 它宁可多报,也不愿少报。对于出版商来说,这样的权衡是合适的,但对于学术不端委员会来说则不合适,而当它的预检分数与大学工具后来显示的结果不一致时,这一点是最需要理解的。Originality.ai versus Turnitin说明了这一差距。
5. Pangram: 独立研究持续更偏向它的那个工具

Pangram 是这里最年轻的工具,也是研究人员持续验证的工具。其分类器经过专门训练,以将误报率保持在接近零的水平,并且其报告包含一个可解释性视图,显示哪些短语促成了判定。功能覆盖 20 多种语言,支持带 OCR 的文件上传、浏览器扩展和 Google Docs 集成, 免费层每天可扫描最多 2,000 个词。该供应商声称准确率为 99.98%,误报率为 1 in 10,000,并按不同文类公布了细分结果。
不同寻常的是,独立证据与营销说法指向同一方向。2026 年的 VUB 研究发现,在四个受测工具中,只有它在完全由 AI 生成的论文上的中位数得分接近真实值,并且在混合论文和人类化论文上也最为接近。来自 Chicago Booth 和 Maryland 研究人员的 NBER 工作论文发现,它是唯一一个在保持对改写文本表现强劲的同时,将误报率控制在 0.5% 或以下的检测器。这两项研究都较新且范围有限,但本页没有其他工具拥有如此多的当前证据支持。Pangram 评测对这两项研究进行了细致解读。
6. Winston AI: 最大的说法, 最少的证据

Winston AI 是一款基于积分的检测器,面向教育工作者和内容团队。其功能设置很实用, 包括逐句热力图, 可读取拍摄和手写页面的 OCR, 抄袭附加功能, 以及 Google Classroom 集成。首页声称准确率为 99.98% 且用户超过 10 million, 这一准确率数字来自内部测试, 网站上任何地方都没有公布方法、数据集或样本量。
最好的独立参照是 RAID 基准测试, 见 ACL 2024, 在固定 5% 误报率下, Winston 对 AI 文本的总体检测率为 71%: 对 ChatGPT 风格输出表现极佳, 达到 99.6%, 但对较旧和开源模型要弱得多, 对改写文本则降至 52.6%。这是一个能力尚可但标题数字夸大的工具。The Winston AI review 详细考察了这一说法。
7. ZeroGPT: 免费预检

ZeroGPT 是流量最高的免费预检: 无需账户即可粘贴最多 15,000 个字符, 立即得到一个百分比, 以及其称为 DeepAnalyse 技术所标出的句子。该供应商声称其内部评估准确率高于 98%, 但未命名任何外部测试。独立比较一致将其置于商业领域的底部附近, 而且同一文本在不同运行中的得分会波动。作为粗略的初步查看, 它无害, 但作为结论, 它是本页最缺乏可辩护性的工具。The ZeroGPT accuracy review 追溯了其主张的来源。
8. Scribbr: 采用授权引擎的可信品牌

Scribbr 的 AI 检测器是在 Scribbr 品牌下运行的 QuillBot 检测引擎, 结果面板显示引擎版本, 而 Scribbr 的关于页面将两家公司都置于 Learneo 家族之中。免费层在浏览器中扫描约 1,200 个词, 无需注册, 并将结果分为 AI-generated, AI-refined 和 human-written 三类。根据 Scribbr 自身 2026 年 7 月的比较, 免费检测器识别了 78% 的测试文本, 高级版本识别了 84%, 在该样本中没有出现误报。
这些是免费层中已公布的最佳数字, 它们来自 Scribbr 自行设计、执行并评分的一项测试, 在该测试中, 其企业姊妹公司并列第一。学生信任这款检测器, 是因为 Scribbr 的引用和论文写作指南建立了这种信任, 检测器继承了这一点。The Scribbr review 说明了免费版和高级版实际测量的内容。
9. Sapling: 开发者工具

Sapling 的检测器来自一家 NLP 公司, 其主营业务是为客户支持团队提供写作辅助, 这一点也体现在产品上, 该组中最易访问的 API, 逐句概率评分与 perplexity 视图, 以及可在 Google Docs, Gmail, Zendesk 和 Salesforce 内部扫描文本的浏览器扩展。免费检测上限为 2,000 个字符, 付费方案将上限提高到 100,000。
它的独立记录在这十款中最不稳定, 在 Scribbr 的比较中有 68% 且零误报, 在 2023 年的 arXiv 基准测试中几乎完全失准, 还有至少一篇实测评测认为它把一切都标记为伪造。单篇评测得分对任何检测器都很难推广, 而 Sapling 是最清楚的例证。Sapling 评测对此作了分析。
10. Compilatio, 欧洲的机构对应工具

Compilatio 是欧洲机构许可使用的抄袭与 AI 套件, 在以美国为中心的综述默认使用 Turnitin 的场景中, 它在法语环境中最强, 将 AI 检测与相似性检查整合到同一个面向教师的工作流程中, 并提供一个按额度销售相同检查的学生版。它声称可靠率为 94 to 99% 且误报率低于 1%, 并且除 Turnitin 之外, 它是这里唯一一个在同行评审测试中接近前列的工具, 在 Weber-Wulff 及其同事的研究中位列十四项中的第二。若你在欧盟学习, 读取你论文的检测器很可能就是它。Compilatio 评测说明了这一排名能够, 以及不能, 证明什么。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
iThenticate, 出版商案头上的检测器
这里还值得单独介绍另一个 Turnitin 产品,因为大多数研究者是在看不见它的情况下接触到它的。iThenticate 是 Turnitin 面向出版商、期刊和研究机构的筛查工具,专为在发表前检查稿件而设计,而不是用于评分课程作业。它的定位是带着信心发表, 在高风险文稿发出前筛查潜在的不当行为。数千种学术期刊通过 Crossref 的 Similarity Check 服务将投稿送入其中,因此,如果你曾向同行评审期刊投稿,那么无论是否有人告诉过你,你的稿件很可能已经经过 iThenticate。

有两点使它不同于上面的 Turnitin 一行。它以文稿为先,而不是以课程为先, 没有班级,没有作业,每篇稿件对应一份报告。并且不同于 Turnitin,它可以由被评估者本人购买。积分可直接在网站上购买,按文稿计价,这使它成为 Turnitin 家族中唯一一种作者可以在期刊处理之前自行对自己的稿件进行检查的工具。该报告首先是一份相似性报告,会与已发表文献和网络内容进行比对,而 Turnitin 也将 iThenticate 列为其面向符合条件客户的 AI 写作检测产品之一。
对于学术写作者来说,其实际用途狭窄但真实存在, 即在提交前对最终稿进行原创性检查,而且由期刊很可能会使用其工具的同一家公司来运行。报告本身不会修正任何内容。它只会标记重叠内容和可能的 AI 写作,而对被标记的文字进行修改仍然是你的工作,这正是学术 AI humanizer所要完成的投稿清单中的一半。
独立研究对这一类别的看法
供应商给出的数字集中在 99% 左右。已发表研究并非如此。Weber-Wulff 及其同事在 2023 年发表于 International Journal for Educational Integrity 的研究中测试了 14 个系统,其中包括 Turnitin,而 Liang 及其同事同年在 Patterns 中发现,非英语母语者撰写的 91 篇 TOEFL 论文中有 89 篇,即 97.8%,被至少 7 个检测器中的 1 个标记为 AI,其中 18 篇被全部 7 个检测器标记。
对上述工具最直接的学术检验是 2026 年的 VUB 研究,以开放获取形式发表于 International Journal for Educational Integrity:真实的硕士论文,4 个商业检测器,以及在 4 个检测器中的 3 个上,对完全由 AI 生成的论文的中位数低于 20%。Jabarian 和 Imas 在 NBER 工作论文 w34223 中,构建了一个语料库,包含 1,992 篇 2020 年之前的人类文本和 1,992 篇来自 4 个前沿模型的 AI 文本,并对 Pangram、GPTZero、Originality.ai 以及一个开源基线进行了压力测试:商业检测器优于该基线,而且只有一个工具在跨改写文本时仍保持较强表现的同时,将假阳性率控制在 0.5% 或以下。该开源基线将 30% 到 69% 的人类文本标记出来,这就是为什么上方表格中没有免费的 GitHub 检测器。
OpenAI 于 2023 年 7 月 20 日撤下了其自有的 AI Text Classifier,并表示它“由于准确率较低而不再可用”。Giray、Roe 和 Espiritu 于 2026 年 3 月在 English Teaching: Practice & Critique 发表的文章,直截了当地指出了公平性问题:“这些工具会不成比例地标记多语学生的真实写作,从而造成一种寒蝉效应,反过来又会促使人们使用 AI,以避免被错误指控。”这一发现背后的模式已在检测器如何对待非母语英语写作中得到记录。
各机构已经针对误报记录采取了行动。Vanderbilt 于 2023 年 8 月停用了 Turnitin 的 AI 检测器,理由是,按照其在 2022 年提交的 75,000 篇论文计算,1% 的误报率意味着大约有 750 篇论文会被错误标记。Michigan State 的说明指出,AI 检测工具不应成为对学生采取不利措施的唯一依据,而 University of Texas at Austin 则根本不认可 AI 检测软件。作为一个类别,AI 检测器究竟有多准确,是一个独立于你的机构所许可使用的是哪一款工具的问题。
绕过评分的模型, 过程追踪
针对误报问题,另一种答案正引起机构关注, 不再对成品文本评分,而是记录文档是如何写成的。Grammarly 的 Authorship 功能和评估平台 Cadmus 都是这样运作的,它们会在写作过程发生时捕捉写作过程、输入、粘贴和修订历史。对于确实是手动输入完成的论文,过程记录不可能产生误报,这正是促使大学关闭检测器的那种失效模式。其权衡是不同的,监控问题取代了统计问题,但如果你的机构采用了其中一种方案,那么上文关于检测器的争论对你来说就基本无关紧要了, 证据是过程日志,而不是概率分数。
如何解读你拿到的检测器分数
一个数字几乎总是脱离其上下文而出现。四个问题足以恢复其中相当一部分,使之能够进行有意义的讨论。
- 是哪种工具,以及是哪一个数值。文档级百分比和句子级高亮来自同一供应商,但它们对应的是不同的已公布错误率,Turnitin 的分别是 1% 和约 4%。
- 供应商关于错误所公布了什么。一种工具如果说明了漏检率和误报率,就已经告诉你它的局限在哪里。一种工具如果只公布准确率百分比,则没有。
- 该分数是证据还是提示。Michigan State 的表述,即这些工具不应作为不利处分的唯一依据,是一种常见的机构立场,在申诉中值得引用。申诉信指南说明了如何操作。
- 你所在机构的政策实际上写了什么。检测器是否获得许可,其输出是否可用于违规处理,以及学生可以提出什么请求,这些内容都写在某处,而且各大学之间差异很大。
Turnitin 对 humanized text 的处理方式会单独回答,同时还会结合更广泛的 humanizer 替代方案调查一起说明。
检测器供应商会继续公布整数,而大多数供应商也会继续拒绝说明这些数字的来源。你的工作是否落入这十种情况中的哪一种,由阅读者决定,因此,有用的准备是,在任何人向你引用百分比之前,先了解该工具对其自身错误率公布了什么。TextPulse 当前定价单独放在一个页面上,在那里更新,而不是放在汇总页中。
我们自己的研究发现了什么
在 TextPulse Research 的检测器一致性研究中,九款商用 AI 检测器对同样的 90 篇学术文本进行了评分。其中一篇是 455 词的混合文本:开头和结尾由人工撰写,中间是 168 词的 AI 生成段落。Copyleaks 将这篇文本判为 0% AI,而其他工具对同样文字的判定从 0% 到 95.7% 不等。完整论文、语料库和每款工具的分数矩阵开放于 TextPulse Research。


常见问题
没有任何厂商宣称可以最终定论,但最新的独立证据更支持Pangram: 2026年布鲁塞尔自由大学在International Journal for Educational Integrity发表的一项研究发现,它是唯一一款在完全由AI生成的学术论文上,其中位数得分接近真实值的工具,而GPTZero、Copyleaks和Turnitin返回的中位数都低于20%,NBER工作论文则发现它是唯一一款将误报率控制在0.5%或以下的检测器。这两项研究都较新且范围有限,任何检测器的输出都不能单独作为证据。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.