ChatGPTは参考文献を捏造するのか, 捏造研究が示したこと
6件の研究, 4分野, 3年。ChatGPTが参考文献を捏造する割合は一桁台から半数を大きく超える水準まで幅があり, その数値はモデルの版と日付が付されていなければ何の意味も持たない。
2025年6月、Deakin Universityの研究者はGPT-4oに、メンタルヘルスのトピックについて6本の文献レビューを書くよう依頼した。生成された176件の引用文献のうち、35件は実在しなかった。さらに64件は、実在する論文を指していたが、付随する詳細が誤っていた。これは、ChatGPTの引用文献問題が印刷物で初めて測定されてから1年以上後に公開されたモデルによるものであり、5件に1件は完全に捏造されていたことになる。
ChatGPTは参考文献を捏造するのか。はい、そしてそれは2026年になってもなお続いている。しかも、2023年に見出しを飾った版だけでなく、現在のモデルでもそうである。未解決の問いは、これが起こるかどうかではなかった。どの程度の頻度で起こるかであり、その数値はモデル、版、分野、そして試験を実施した日付によって変動する。
ChatGPTは参考文献を捏造するのか
はい。言語モデルは、それ以前のすべてを踏まえて、次に来るもっともらしい語を予測する。製品に検索または情報検索の手順を追加しない限り、何も調べない。引用文献がどのような形をしているかを予測するように任せれば、著者名、年、雑誌名、巻号、DOIを備えた、正しそうに見えるものを作るが、それらのいずれも実在の出版物と一致するかどうかは検証しない。偶然または機械的な記憶によって正確になるものもある。完全に作り話として生成され、見た目はまったく同じものもある。
捏造率にモデル版と日付が必要な理由
なぜなら、その率は1つの数値ではないからである。この点で最も頻繁に引用される研究では、ChatGPT-3.5は短い文献レビューの集合に含まれる引用文献の55パーセントを捏造し、同じ研究者が同じ42のトピックについて試験したChatGPT-4は18パーセントを捏造した。同じ研究、同じプロンプト、同じ試験日である。変わったのはモデルだけであり、その率は3分の2低下した。
日付は、モデル名と同じくらい重要である。その研究におけるGPT-4は、2023年半ばにOpenAIが提供していたものを意味していた。2026年の、10の現行モデルと研究エージェントを対象とし、合計で220,000件を超える引用リンクを確認した研究では、捏造率は3%から13%の範囲であり、正確な数値は特定のモデルと、その製品が検索による根拠付けを用いたか、deep researchモードを用いたかによって異なっていた。どちらの数値も誤りではない。これらは、ほぼ3年離れた時点で測定された異なる事柄を記述している。
分野もまた、モデルとは独立に重要である。経済学の研究を同じGPT-3.5とGPT-4の組み合わせに通した別の研究でも、GPT-3.5の引用の30%超が捏造であり、GPT-4でも20%をなお上回る率が示されている。これは多分野研究で見出された結果に近い。一方、医学系の系統的レビュー研究では、特に2023年3月版と表示されたGPT-4のビルドを検証し、まったく異なる課題、すなわち新しい文献要約を一から書くのではなく、既存の系統的レビューのために参考文献を抽出する作業において、28.6%を測定した。
公表された研究が明らかにしたこと
2023年から2026年にかけて、医学、法学、経済学、一般的な学術執筆にわたって実施された6件の研究は、6通りの異なる言い方で述べられた同じ結論に収束している。どのモデルが生成したか、またいつ生成されたかにかかわらず、AIツールが示す参考文献はすべて確認しなければならない。
| 研究と分野 | モデルとバージョン | 試験日 | サンプル | 捏造率 |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisciplinary) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (economics) | GPT-3.5 and GPT-4 | 2023 | Journal of Economic Literature のトピックからのプロンプト | 30%超 (3.5), 20%超 (4) |
| Chelli et al, JMIR (medical systematic reviews) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 references, 11 reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law) | ChatGPT-4 and Llama 2 | 2024 | Random federal court case questions | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (mental health reviews) | GPT-4o | Tested June 2025 | 176 citations, 6 reviews | 19.9% fully fabricated, 56% fabricated or flawed |
| Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Over 220,000 citation URLs | 3% to 13% depending on model |
法学研究は、生の割合だけでは捉えられない詳細を加えている。同じ研究は、モデルが自らの幻覚を予測することに苦戦し、ある事件についてユーザーの誤った前提を訂正するよりも受け入れる傾向があることを示した。捏造された引用は一つの失敗形態にすぎない。さらに、自身の不確実性を指摘できないモデルは、より難しい問題であり、誤った引用のコストが最も高いまさにその分野で最も顕著に現れる。
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
ChatGPT は 2023 年以降に改善したのか?
ある程度は、そして不均一にである。最も明確な単一の前後比較は、Walters and Wilder の研究そのものにある。GPT-3.5 から GPT-4 へ、同日で、捏造は55% から18% に減少した。2025年半ばの GPT-4o に進むと、Linardon のチームが測定した率は19.9% であり、より難しくより狭い課題、すなわち42の無関係なトピックにまたがる短い要約ではなく、単一の研究分野における6本の文献レビューであった。さらに、検索機能または deep-research 機能を有効にしたモデルを2026年初頭に試験すると、ほとんどのモデルで範囲は一桁台に下がり、3 to 9% となったが、ある deep-research モードはなお13.3% に達した。
しかし、そのいずれも一直線に下がるわけではない。Linardon の数値は、2023年の GPT-4 の数値と2023年の GPT-3.5 の数値の間に位置するが、両者より1年以上後に公開されたモデルである。なぜなら、それはより難しい課題、すなわち、出典資料の多く自体が見つけにくい分野における実際の文献レビュー生成で試験されたからである。捏造率は、ある日付におけるある課題上のあるモデルを表す。三つの要素のうち一つでも変えれば、その数値は動き、ときには大きく動く。
今日なお数値を動かす変数は、モデル系列だけではない。2025年の研究では、5つの学術分野にわたる400件の参考文献について、ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat and Perplexity という8つの無料チャットボットを評価し、生成された参考文献全体のうち完全に正確だったのは26.5% にすぎなかった。この試験では、Grok と DeepSeek は捏造された参考文献を一つも生成しなかった。Claude, Copilot and Perplexity は最も成績の悪いものの一部であった。比較可能な基盤技術の上に構築され、同じ月に、同じプロンプトで試験された2つの製品が、範囲の両端に位置したのであり、これは上のモデルと日付の表と同じ教訓を、版ではなく製品に適用したものである。
なぜ捏造された引用は本物らしく見えるのか
捏造された引用は、明白なプレースホルダーではない。Walters と Wilder は、彼らの作り出した項目が実在の著者名を伴い、その著者たちは実際の分野で出版しており、実在するジャーナル名に付され、簡単な目視確認を通過するのに十分な形式で整えられていることを見いだした。Linardon のチームは、さらに明確なことを見いだした。GPT-4o が生成した 35 件の捏造引用のうち 33 件には DOI が付されており、その DOI の 64% は、まったく無関係な話題の実在する公表済み論文へと導いた。死んだリンクでもエラーページでもなく、存在しない出典の代わりに、他者の実際の研究が置かれていたのである。
ChatGPT の引用が実在するかどうかを確認する方法
DOI だけを信頼するのではなく、Google Scholar かジャーナル自身のサイトで正確な題名を検索すること。機能する DOI であっても、完全に誤った論文を指している可能性があるからである。著者一覧、年、ジャーナルが、実際に表示される内容と一致するかを確認し、何かが表示されるというだけでは不十分である。チャットボットが示した参考文献は、見慣れないものだけでなく、すべてについてこれを行うこと。これらの研究における捏造項目は、まさに普通に見えるように作られていたからである。
見慣れない、または範囲の狭い話題は、主流の話題よりも高リスクとして扱うこと。Linardon のチームは、十分に研究されている疾患である major depressive disorder では捏造が約 6% であったのに対し、同じレビュー群に含まれる、あまり研究されていない 2 つの疾患では約 30% であったことを見いだした。この傾向はメンタルヘルスの外でも成り立つ。モデルは、混み合った分野ではより多くの実在テキストからパターンを引き出せる一方、薄い分野ではもっともらしく捏造する余地が大きいのである。
各項目を実在の学術データベースと照合する AI citation checker は、その検索を自動化し、各参考文献ごとの手作業の確認に任せない。締切の圧力の下で最も省略されやすいのはまさにその部分であり、捏造された引用が最終稿に残りやすいのも、まさにその条件の下である。
完成した参考文献一覧の中でそれらを見つけること には、それ自体の手順があり、専用のページがある。実在する引用については、APA で ChatGPT を引用する方法 が段階的に示されている。
これらはいずれも、いったんそれが実在すると確認した後に引用をどのように整形するかを変えるものではない。それは別の問題である。How to cite ChatGPT は APA, MLA, Chicago and IEEE を扱うのはそのやり取り自体についてであり、citation generator は通常の参考文献を処理するが、どのスタイルで書いていても同じように扱う。どの引用形式でも修正できないのは、そもそも公表されなかったものへの参照である。その確認は整形の前に、すべての参考文献について行われる。下書きをどのモデルが書いたか、あるいはそのラベルがどの版を主張しているかにかかわらない。
Frequently Asked Questions
ChatGPTは参考文献を捏造するのか。はい, これまでに試験されたすべてのモデルで, 2023年から2026年にかけて公表されたすべての研究でそうである。割合はモデルの版, 分野, 日付によって大きく異なり, 最も新しい根拠付きモデルではおよそ3%から, 2023年のGPT-3.5では半数を大きく超える水準まで及ぶため, 単一の数値だけでは全体像は分からない。
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.