ChatGPT 会编造参考文献吗?伪造研究发现了什么
六项研究,四个领域,三年。ChatGPT 编造参考文献的比例从个位数到超过一半不等,而如果不说明模型版本和日期,这个数字毫无意义。
在2025年6月,Deakin University的研究人员要求GPT-4o就心理健康主题撰写六篇文献综述。在它生成的176条引文中,35条完全不存在。另有64条指向真实论文,但附带了错误的细节。也就是说,每五条参考文献中就有一条是凭空捏造的,而这一模型发布于ChatGPT的引文问题首次在印刷文献中被测量一年多之后。
ChatGPT会编造参考文献吗?会,而且在2026年,它在当前模型上仍然会这样做,不仅仅是在2023年引发关注的那个版本上。这个开放性问题从来不是它是否会发生,而是发生得有多频繁,而这个数字会随着模型、版本、领域以及测试运行日期而变化。
ChatGPT会编造参考文献吗?
会。语言模型会根据前文预测下一个最可能的词。除非你在产品中加入检索或搜索步骤,否则它不会去查找任何内容。如果让它去预测一条引文应当是什么样子,它会生成一条看起来正确的引文, 作者姓名、年份、期刊名称、卷号、DOI,但不会核实这些信息是否都与真实发表的文献相符。其中一些可能是偶然准确,或者只是机械记忆的结果。另一些则会从头编造出来,而且看起来完全一样。
为什么捏造率需要模型版本和日期
因为这个比率不是一个固定数字。在这项被引用最多的研究中,ChatGPT-3.5在一组简短文献综述中的引文里捏造了55%,而由同一研究人员在相同42个主题上测试的ChatGPT-4捏造了18%。同一项研究,同样的提示,同一天测试。唯一改变的是模型,而该比率下降了三分之二。
日期与模型名称同样重要。该研究中的 GPT-4 指的是 OpenAI 在 2023 年中期提供的任何版本。2026 年一项针对十个当前模型和研究代理的研究,总共检查了超过 220,000 个引文链接,发现捏造率从 3% 到 13% 不等,具体数值取决于特定模型,以及产品使用的是搜索锚定还是深度研究模式。这两个数字都没有错。它们描述的是相隔将近三年测量的不同内容。
领域也很重要,而且独立于模型。我们还看到,一项经济学研究使用同样的 GPT-3.5 和 GPT-4 组合,发现 GPT-3.5 的引文中有超过 30% 是编造的,而 GPT-4 的比例仍高于 20%,这与多学科研究的结果接近。与此同时,医学系统综述研究专门测试了被标注为 2023 年 3 月版本的 GPT-4,在完全不同的任务上测得 28.6%, 该任务是为已有系统综述提取参考文献,而不是从头撰写新的文献摘要。
已发表研究的发现
六项研究在 2023 年至 2026 年间开展,涵盖医学、法律、经济学和一般学术写作,得出了同一个发现,只是表述方式不同, 无论 AI 工具给出的是哪个模型,或它是在何时生成的,都要检查它提供的每一条参考文献。
| Study and field | Model and version | Date tested | Sample | Fabrication rate |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisciplinary) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (economics) | GPT-3.5 and GPT-4 | 2023 | Prompts from Journal of Economic Literature topics | Over 30% (3.5), over 20% (4) |
| Chelli et al, JMIR (medical systematic reviews) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 references, 11 reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law) | ChatGPT-4 and Llama 2 | 2024 | Random federal court case questions | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (mental health reviews) | GPT-4o | Tested June 2025 | 176 citations, 6 reviews | 19.9% fully fabricated, 56% fabricated or flawed |
| Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Over 220,000 citation URLs | 3% to 13% depending on model |
法律研究补充了一个原始百分比无法体现的细节, 同一项研究发现, 模型难以预测自身的幻觉, 并且往往会接受用户对某一案件的错误前提, 而不是加以纠正。伪造引文是一种失败模式。一个连自身不确定性都无法标记的模型, 则是更难处理的问题, 而且这在恰恰是错误引文代价最高的领域中表现得最为明显。
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
自 2023 年以来, ChatGPT 是否有所改进?
某种程度上如此,而且并不均匀。最清楚的单一前后对比出现在 Walters 和 Wilder 的研究本身中, GPT-3.5 到 GPT-4, 同一天,捏造率从 55% 降到 18%。再往前看,到了 2025 年中期的 GPT-4o,Linardon 团队测得的比率是 19.9%,不过那是一项更难也更狭窄的任务,涉及同一研究领域中的 6 篇文献综述,而不是分散在 42 个无关主题上的简短摘要。再往前看一步,在 2026 年初测试、并开启搜索或 deep-research 功能的模型中,大多数的范围降到个位数,3 to 9%,不过其中一种 deep-research 模式仍达到 13.3%。
这些都不是一条直线向下。Linardon 的数值介于 2023 年的 GPT-4 数值和 2023 年的 GPT-3.5 数值之间,而该模型发布于两者之后一年多,因为它是在一项更难的任务上测试的, 即在一个大量源材料本身就难以找到的领域中生成真实的文献综述。捏造率描述的是某个模型在某项任务、某个日期上的表现。只要改变这三者中的任意一个,数值就会变化,有时变化很大。
今天仍然会影响该数值的变量,不只有模型家族。2025 年一项研究评估了 8 个免费聊天机器人, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat 和 Perplexity, 在 5 个学术领域中的 400 条参考文献,发现所生成参考文献中只有 26.5% 完全正确。Grok 和 DeepSeek 在该测试中没有生成任何捏造参考文献。Claude、Copilot 和 Perplexity 属于表现最差者之列。两个建立在相近底层技术之上的产品,在同一个月、针对相同提示进行测试,却落在范围的两端,这与上面的模型和日期表所传达的是同一教训,只是应用在产品而不是版本上。
为什么捏造的引文看起来真实
伪造引文并不是显而易见的占位符。Walters 和 Wilder 发现,他们编造的条目带有真实的作者姓名,这些作者确实在实际领域发表论文,并且附着在真实存在的期刊标题上,格式也足以通过快速的视觉检查。Linardon 的团队发现了更尖锐的情况, GPT-4o 生成的 35 条伪造引文中,有 33 条附带了 DOI,而其中 64% 的 DOI 指向了一篇真实发表的、主题完全无关的论文, 不是失效链接,也不是错误页面,而是别人的实际研究,被拿来充当一个并不存在的来源。
如何检查 ChatGPT 引文是否真实
应在 Google Scholar 或期刊自身网站中检索精确标题,而不要仅仅信任 DOI,因为一个可用的 DOI 可能完全指向错误的论文。应核对作者列表、年份和期刊是否与实际检索结果一致,而不只是确认能检索到某些内容。对聊天机器人给出的每一条参考文献都应这样做,而不仅是那些看起来陌生的条目,因为这些研究中的伪造条目就是专门设计成看起来普通的。
应将不熟悉或较窄的主题视为比主流主题风险更高。Linardon 的团队发现,在一个研究充分的病症, 重度抑郁障碍, 中,伪造率接近 6%,而在同一组综述中的另外两个研究较少的病症中,伪造率接近 30%。这个模式在心理健康领域之外也成立, 一个模型在拥挤的领域中有更多真实文本可供提取模式,而在稀薄的领域中则有更多空间去进行看似合理的编造。
一种 AI 引文检查器会将每一条条目与真实的学术数据库进行比对,从而自动完成这一检索,而不是把它留给对每一条参考文献都要手动查询的过程,这正是大多数人在截止期限压力下会跳过的部分,也正是在这种条件下,伪造引文最有可能一路保留到最终稿中。
在已完成的参考文献表中发现它们本身就是一个独立的程序,并且有自己的页面。对于真实的引文,如何按 APA 引用 ChatGPT 已逐步说明。
这一切都不会改变你在确认引文真实之后如何格式化它。这是另一个问题:How to cite ChatGPT 涵盖 APA、MLA、Chicago 和 IEEE,用于对话本身,而引文生成器处理普通参考文献的方式相同,不论你采用哪种写作格式。任何引文格式都无法修正对从未发表之内容的引用。该检查发生在格式化之前,针对每一条参考文献,不论是哪一个模型写了你的草稿,或其标签声称的是哪个版本。
Frequently Asked Questions
ChatGPT 会编造参考文献吗?会,至少在迄今测试过的每个模型上,以及 2023 年至 2026 年间发表的每一项研究中都是如此。该比例因模型版本、学科领域和日期而有巨大差异,从最新的有依据模型上的大约 3%,到 2023 年 GPT-3.5 上的远超一半,因此单一数字从来都不是完整答案。
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.