Academic Writing

幻觉引用:在提交前审查你的论文

伪造的参考文献并不是乱码式的参考文献。它带着看似合理的作者、合适的标题、真实的期刊和看起来有效的 DOI,因此再读一遍也无法发现它。于 2026 年发表的文献规模审查发现,至少包含一条伪造参考文献的论文比例在三年内大约增长了十倍。下面是你应先对自己的参考文献表执行的审查。

11 min
Checklist for a hallucinated citation audit: DOI resolution, title matching, author-year cross-check, and journal name verification

2023年6月,纽约一名联邦法官对两名律师作出处罚,因为他们提交的一份书状建立在至少六个并不存在的法院案件之上。Steven Schwartz 曾向 ChatGPT 寻求支持性先例,收到了一些案件名称和引述的推理,这些内容都显得合情合理,然后他在自己没有打开任何一个案件的情况下提交了该书状。P. Kevin Castel 法官对他处以五千美元罚款,并命令他向每一位真实法官寄送一封信,因为这些法官的名字曾被附会到一份伪造的意见书上。

参考文献表也可能落入同样的境地。解决办法是在编辑、导师或审稿人替你进行之前,先对你自己的参考文献表进行一次幻觉引文审计。这不仅仅是由使用聊天机器人起草所导致的问题。一个记忆中的引文,实际上从未真正存在过,合著者的题目被稍微抄错,或者一篇预印本在接收后其最终引文发生了变化,这些都可能在参考文献表中留下与伪造引文相同类型的缺口。下面的审计可以发现所有这些问题,不论任何单条记录是如何出现在那里。

幻觉引文到底有多常见?

其范围在很大程度上取决于生成草稿的模型。Walters 和 Wilder,于 2023 年发表在 Scientific Reports 上,将 GPT-3.5 和 GPT-4 生成的参考文献表与真实学术写作提示进行了对照测试, 共计 636 条引文,来自 84 份 AI 生成的参考文献表,每个模型 42 份。GPT-3.5 的引文中有 55% 完全是伪造的,而 GPT-4 为 18%。即使是真实引文,也未必完全无误, GPT-3.5 的真实引文中有 43%,GPT-4 中有 24%,仍然在作者、题目、年份或刊物中的某处存在实质性错误。

关于 AI 生成引文的法律研究显示出更高的失败率,但该研究衡量的是另一种失败,即虚构的判例裁定,而不是伪造的书目信息,因此这一数字不适合直接移用于学术语境。两个领域共有的,是其根本原因, 一个生成看起来合理的引文的模型,是在优化引文通常应有的样子,而不是优化它是否 वास्तव存在。TextPulse 自己关于ChatGPT 是否编造参考文献的文章,专门讨论的是那个聊天机器人, 而这项审计则不受限于具体是哪一种工具,或是哪一位共同作者的记忆,生成了你面前的条目。

2026 年文献规模审计发现了什么

这些模型层面的比率描述的是聊天机器人输出了什么。另一个问题, 也是对任何向期刊投稿的人更重要的问题,是一条伪造参考文献在草稿到已发表论文之间的每一次检查中,有多大概率能够存活下来。2026 年 5 月,相隔一天发布的两项审计在文献规模上回答了这一问题,而答案是,这种失败已不再罕见。

发表于 The Lancet 的一项审计,筛查了 PubMed Central Open Access 上约 2.5 million 篇生物医学论文中的参考文献,覆盖 2023 年 1 月至 2026 年 2 月。数千条参考文献指向并不存在的研究,分布在 2,800 多篇已发表论文中。趋势比总数更重要。

时期至少含有一条伪造参考文献的论文每 10,000 篇论文
20231 in 2,8283.5
20251 in 45821.8
2026, 前七周1 in 27736.1

这大约是在三年内增长了十倍,而2026年的数字取自七周而不是整整一年,因此它只是一个早期读数,而不是已经确定的年度比率。它所表明的是,伪造的参考文献正在进入同行评审场所的印刷出版物,并且在这一过程中已经通过了作者、合著者、编辑和审稿人。

配套研究,Zhao and colleagues on non-existent citations,将范围扩大到 arXiv、bioRxiv、SSRN 和 PubMed Central 中的111 million references,并对仅2025年就给出了146,932条幻觉引文的保守下限。它更有用的发现关乎分布而不是总量, 伪造参考文献集中出现在 AI 采用速度较快的领域,以及规模较小和处于职业早期的作者团队中。如果你是独立作者,或者是一个没有研究办公室替你核查参考文献的小团队,那么你就属于这类最容易出错的人群,这也说明,与其假定下游会有人处理,不如自己进行审查。

哪些模型伪造得最多,以及什么实际上能减少这种情况

诚实的回答是,目前没有严格的公开基准能够专门比较今天的主要模型在引文伪造方面谁更严重。流传着一些小规模的非正式比较,通常是把几十条参考文献手工输入两三个聊天机器人,但样本太少,无法据此对它们进行排序。把其中任何一个当作排行榜,都会让一个自信但错误的说法进入论文。

能够成立的是上文 Walters 和 Wilder 数据中的代际比较,其中较新的模型伪造的频率大约只有较旧模型的三分之一。

Model testedCitations entirely fabricatedGenuine citations still carrying a substantive error
GPT-3.555%43%
GPT-418%24%

文献中反复出现三种模式,其重要性超过任何单一排名。较大的模型比小模型更少编造。能够实际搜索并检索来源的模型,比仅凭参数作答的模型编造得明显更少,这是迄今任何人测得的最大单一效应。而且,冷门来源比知名来源危险得多,因为一篇被大量引用的论文会在训练数据中反复出现,因此更可能被正确复现,而一篇小众论文则更可能由碎片重建。

实际解读是,没有任何模型安全到可以跳过检查,而最可能出错的条目,恰恰是你最无法凭记忆核实的那些, 专业引文、冷门会议论文、你最后添加的来源。

自动化检查能发现什么,以及它在哪里停止

先用检查器跑一遍列表,比手工核对四十个 DOI 更快,而本网站的免费 AI 引文检查器正是针对 Crossref、OpenAlex 和 Semantic Scholar 做这件事。在依赖这类工具之前,值得先了解它做得不好的地方。

Badalova and Mayr 对五种幻觉引文检测器所做的 2026 年评估发现,它们能提供有用的早期警示,但仍受四个因素限制, 从文档中清晰提取参考文献、条目本身元数据不完整、数据库覆盖不均,以及彼此不一致的注册库。只有第一项在你粘贴列表而不是上传 PDF 时才会消失。

你自己审查的后果,是一条关于解释的规则。检查器最强的是发现最关键的问题,也就是一个 DOI 解析到与条目所声称的不同论文,这几乎可以视为定论。它在图书、章节、学位论文、会议论文集、非常新的作品以及非英语出版物方面最弱,因为这些内容在各处的索引都很稀疏,而且经常会返回未找到,尽管它们完全真实。未找到只是提示你手工核查,绝不是结论。下面的人工步骤,就是用来处理自动检查无法判定的内容。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

在提交前解析每一个 DOI

DOI,即 Digital Object Identifier,按理应通过 doi.org 解析器精确解析到一条记录。把参考文献列表中的 DOI 输入解析器,一个有效的 DOI 会落到该文章出版社页面上。一个 DOI 如果解析到无关文章、完全不同的期刊,或者根本没有结果,这些都是现成的幻觉检查中最快的一类,因为编造引文的模型通常会顺手编造一个看起来合理的 DOI 字符串,而不是复用真实的 DOI。

一个能够正确解析的 DOI,并不能自动证明该引文是真实的。有些伪造参考文献会借用一篇无关论文的真实 DOI,这个 DOI 解析时不会报错,并且会指向一篇真实文章,但那篇文章与它所声称支持的论点毫无关系。你要阅读 DOI 落到的页面,而不只是看它是否成功加载。

将每一个标题与真实数据库逐一比对

在覆盖你所在领域的数据库中搜索精确标题,标题要加引号,不要在开放网络上搜索。可以使用类似 Crossref 的工具,生物医学研究可用 PubMed,或者使用你所在学科自己的索引。如果你使用 Crossref,可以用其免费的访客搜索,通过标题和第一作者查找参考文献,或者在不确定标题时通过作者和页码查找。这会返回 DOI 以及其记录中的完整元数据。如果没有匹配项,或者返回的是一篇真实论文但作者完全不同,那么你可能遇到的是第二类幻觉, 一个损坏的 DOI。

标题检索能发现一种 DOI 检查无法发现的特定错误, 一条引文附着了一个可用且真实的 DOI,但对应的是错误的标题,因为编号和文本是分别拼接的,从未真正相互核对。如果数据库中的标题与你参考文献表中的标题不太一致,应将其视为伪造,直到你能解释这种不一致,而不是把它当作一个可以悄悄更正的笔误。

核对作者列表和发表年份

幻觉生成的引文常常作者正确而论文错误,因为领域内真实且知名的姓名,正是模型在寻找看似合理的引文时会给出的内容。在你已经打开的数据库中,检索该作者自己的发表列表,查看你的参考文献表所声称的年份。如果该作者在那一年发表了三篇论文,而没有一篇与你的标题相符,那么这条引文很可能是捏造的,它是由一个真实姓名和一个真实年份构成的,但这两者实际上从未一起出现过。

相反的模式也会出现, 一篇真实论文,标题正确,却附着了错误的年份,通常是预印本的年份,而不是最终发表的年份,或者是会议版本却引用了期刊后来的发表年份。就审查的严格意义而言,这两者都不属于伪造,但它们都会把读者引向文献管理器或合著者,而后者又无法找到你所引用的内容,这与同一问题已经足够接近,应在同一轮检查中修正。

识别看似合理但捏造的期刊名称

一个虚构的期刊名称被设计得听起来与真实期刊完全一样, 一个看似合理的学科领域, 一个看似合理的形容词, 一个名称与实际期刊足够接近, 以至于没有人会停下来核查它。"The Journal of Applied Cognitive Studies" 是虚构的, "The Journal of Applied Psychology" 和 "Journal of Cognitive Science" 都真实存在, 而把两者的部分拼接起来的名称之所以显得熟悉, 正是因为这个原因。

单独搜索期刊名称, 用引号括起来, 并查找出版方自己的期刊页面和当前 ISSN, 不要只看某个其他网站引用同一条参考文献的结果。真实期刊会有主页, 列出编辑、当前卷和期, 以及与之对应的合法 ISSN。一个没有出版方页面、没有 ISSN、也没有其他文章引用其成果的名称, 是整个核查中最清楚的信号, 说明该参考文献并不存在。

将你的幻觉引文核查变成可重复的清单

在参考文献列表被视为最终版之前, 按顺序对每一条参考文献执行这些检查。顺序的重要性不如四项都覆盖到, 一条引文可能通过一项检查, 但仍然在另一项上失败。

检查它能发现什么
DOI 解析一个无法导向任何地方的 DOI, 或导向一篇无关文章的 DOI
标题与数据库匹配一个附着在错误标题上的真实 DOI, 或一个完全没有返回结果的标题
作者加年份交叉核对一个真实作者的名字被附在他们在该年份并未撰写的论文上
期刊名称核验一个听起来合理的期刊, 但没有 ISSN, 没有出版方页面, 也并不存在

TextPulse 的 AI 引文检查器会自动对完整参考文献表执行这一轮检查,其速度比在较长的参考文献目录中手动逐一完成这四项检查更快,不过,阅读它标出的内容仍然值得自己去做,而不是仅凭信任就接受或拒绝某个标记。就 DOI 步骤而言,专门的 DOI 到引文查询可以免去为每条记录逐一前往解析器的过程。

一份干净的参考文献目录只是稿件送出前的若干检查之一。降低期刊投稿的 AI 分数另有说明,随后出现的 给审稿人的回复信也是如此。

在你提交之前,再通读一遍自己的论文,这一点并不能被任何这些步骤所替代。如果在事实核对无误之后,某一部分读起来仍然显得泛泛而谈,AI humanizer可以在不改动任何一条引文的情况下润色行文, TextPulse 的 学术写作中将 AI 文本人性化的指南按部分说明了这一过程。能够顺利解析的参考文献目录,与读起来像是你自己声音的稿件,是两项彼此独立的检查,值得连续执行,而不是指望其中一项替代另一项。

XLinkedInFacebook

常见问题

幻觉引用审查是在提交前对完整参考文献表进行的可重复检查, 包括解析每个 DOI, 将每个标题与真实数据库比对, 交叉核对作者列表和年份, 并确认期刊名称确实存在。它可以发现伪造参考文献, 不论这些参考文献是由聊天机器人、引文管理器错误, 还是记忆偏差放进去的。

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。