幻覚引用: 提出前に論文を監査する
捏造された参考文献は、乱れた参考文献ではない。もっともらしい著者名、適切な題名、実在する雑誌、そして有効に見えるDOIを伴って現れるため、もう一度読んでも見抜けない。2026年に公表された文献規模の監査では、少なくとも1件の捏造参考文献を含む論文の割合が3年でおよそ10倍に増加したことが示された。以下は、自分の一覧に対して最初に実行すべき監査である。
2023年6月、ニューヨークの連邦判事は、少なくとも6件の存在しない裁判例に基づいて作成された準備書面を提出した2人の弁護士に制裁を科した。Steven Schwartzは、ChatGPTに支持判例を求め、もっともらしく聞こえる事件名と引用された理由付けを受け取り、自分では一件の事件も開かないまま準備書面を提出した。P. Kevin Castel判事は彼に5000ドルの罰金を科し、捏造された意見に名前を付されていた実在の判事全員に宛てた書簡を提出するよう命じた。
参考文献リストも同じ状況に陥りうる。対処法は、編集者、指導教員、または査読者があなたに代わって行う前に、自分の参考文献リストに対して幻覚引用監査を実施することである。これは、単にチャットボットを用いて下書きしたことによって生じる問題だけではない。記憶違いのために実際には存在しなかった引用、共同著者の題名をわずかに誤って写したこと、あるいは採択後に最終的な引用情報が変わったプレプリントも、捏造された引用と同種の欠落を参考文献リストに生じさせうる。以下の監査は、各項目がどのようにそこに入ったかにかかわらず、それらすべてを検出する。
幻覚引用は実際にはどの程度一般的なのか?
その範囲は、どのモデルが下書きを生成したかに大きく左右される。Walters and Wilderは、2023年にScientific Reportsで発表した研究で、GPT-3.5とGPT-4が生成した参考文献リストを実際の学術的執筆プロンプトと照合した。対象は、AIが生成した84の参考文献リストから抽出した636件の引用であり、各モデル42件ずつであった。GPT-3.5の引用の55パーセントは完全に捏造されたものであり、GPT-4では18パーセントであった。実在するものも必ずしも問題がないわけではなかった。GPT-3.5の真正な引用の43パーセント、GPT-4の24パーセントには、著者、題名、年、または掲載媒体のいずれかに実質的な誤りがなお含まれていた。
AI生成の引用に関する法学研究では、さらに高い失敗率が示されていますが、その研究が測定している失敗は別のものであり、捏造された書誌参照ではなく、幻覚化された判例の内容です。したがって、その数値を学術文脈に持ち込むべきではありません。両分野に共通するのは根本原因です。もっともらしい引用を生成するモデルは、その引用が通常どのように見えるかを最適化しており、実際にその引用が存在するかどうかを最適化しているわけではありません。TextPulse自身によるChatGPTが参考文献を捏造するかどうかに関する記事は、この chatbot を特に扱っていますが、この監査は、どのツールが、あるいはどの共同著者の記憶が、目の前の項目を作成したのかにかかわらず有効です。
2026年の文献規模の監査で何が明らかになったか
モデル単位の比率は、chatbot から何が出力されるかを示しています。別の問いであり、雑誌に投稿する者にとって重要なのは、捏造された参考文献が下書きから掲載論文に至るまでの各確認をどの程度生き残るかです。2026年5月に1日違いで公表された2件の監査は、文献規模でこの問いに答え、その失敗はもはやまれではないという結果を示しました。
The Lancetに掲載された監査は、PubMed Central Open Access にある約250万本の生物医学論文全体で参考文献を調査し、2023年1月から2026年2月までを対象としました。数千件の参考文献が実在しない研究を指しており、その対象は2,800本を超える掲載論文に及んでいました。総数よりも傾向のほうが重要です。
| 期間 | 少なくとも1件の捏造参考文献を含む論文 | 10,000本あたり |
|---|---|---|
| 2023年 | 2,828本に1本 | 3.5 |
| 2025年 | 458本に1本 | 21.8 |
| 2026年、最初の7週間 | 277本に1本 | 36.1 |
これは3年間でおよそ10倍の増加であり、2026年の数値は1年分ではなく7週間から算出されているため、確定した年率ではなく初期的な観測値である。ここで明らかなのは、捏造された参考文献が、著者、共著者、編集者、査読者を通過して、査読付き媒体に掲載されているということである。
関連研究である、存在しない引用に関するZhaoらの研究は、対象をarXiv、bioRxiv、SSRN、PubMed Centralにわたる1億1100万件の参考文献へと広げ、2025年だけで少なくとも146,932件の幻覚引用があったという保守的な下限を示した。より有用な知見は量ではなく分布に関するものである。捏造された参考文献は、AIの導入が速い分野と、少人数で若手の著者チームに集中している。もしあなたが単独著者であるか、参考文献を点検する研究支援部門を持たない少人数のグループであるなら、誤りが最も起こりやすい集団に属していることになる。したがって、下流の誰かが確認してくれると想定するより、自分で監査を行うべきだという論拠になる。
どのモデルが最も捏造し、何が実際にそれを減らすのか
率直に言えば、引用の捏造に限って今日の主要モデル同士を順位付けする厳密な公開ベンチマークは存在しない。小規模な非公式比較は流通しているが、通常は数十件の参考文献を2つか3つのチャットボットに手作業で通した程度であり、そのサンプルはあまりに薄く、相互の順位付けを支えるには足りない。そのようなものを順位表として扱うことが、確信に満ちた誤った主張を論文に入り込ませる方法である。
上で示したWaltersとWilderのデータにおける世代間比較は妥当であり、より新しいモデルは古いモデルのおよそ3分の1の頻度で捏造していた。
| 検証したモデル | 完全に捏造された引用 | 実在するが重大な誤りを含む引用 |
|---|---|---|
| GPT-3.5 | 55% | 43% |
| GPT-4 | 18% | 24% |
文献全体にわたって再現されるパターンは3つあり、いずれも単一の順位付けより重要である。大規模モデルは小規模モデルよりも捏造が少ない。実際に検索して出典を取得できるモデルは、パラメータのみから回答するモデルよりも捏造が大幅に少なく、これはこれまでに測定された効果の中で最大である。そして、あまり知られていない出典は、よく知られた出典よりもはるかに危険である。なぜなら、引用数の多い論文は学習データに十分な頻度で現れるため正しく再現されやすい一方、専門的な論文は断片から再構成される可能性が高いからである。
実務上の解釈としては、どのモデルも確認を省略できるほど安全ではなく、誤りである可能性が最も高い項目は、記憶だけでは検証しにくいもの、すなわち専門的な引用、あまり知られていない会議論文、最後に追加した出典である。
自動チェックが検出するものと、その限界
まず一覧をチェッカーに通すことは、40件のDOIを手作業で照合するより速く、このサイトの無料AI引用チェッカーは、Crossref、OpenAlex、Semantic Scholarに対してまさにそれを行う。こうした種類のツールが何を苦手とするかを知っておくことは、それに依存する前に価値がある。
2026年の5つの幻覚引用検出器の評価であるBadalova and Mayrは、これらが有用な早期警告を与える一方で、4つの要因によって制約されることを見いだした。すなわち、文書から参考文献を正確に抽出すること、項目自体に含まれる不完全なメタデータ、データベースの網羅性のばらつき、そして相互に一致しないレジストリである。このうち、PDFをアップロードするのではなく一覧を貼り付ける場合に消えるのは最初の1つだけである。
あなた自身の監査における帰結は、解釈に関する規則である。チェッカーが最も強いのは、最も重要な発見、すなわち、ある DOI が記載された文献とは別の論文に解決される場合であり、これはほぼ決定的である。いっぽうで、書籍、章、学位論文、会議録、ごく最近の研究、非英語の掲載先には最も弱く、これらはどの場所でも索引付けが薄く、しかも完全に真正であるにもかかわらず、しばしば未発見として返される。未発見は手作業で確認するための指示であり、決して判定ではない。以下の手動手順は、自動処理では判断できなかったものに対して適用するものである。
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
提出前にすべての DOI を解決する
DOI, すなわち Digital Object Identifier は、doi.org の解決器を通じて正確に 1 件の記録に解決されることになっている。参考文献一覧から DOI を解決器に入力すると、機能するものはその正確な論文の出版社ページに到達する。無関係な論文、まったく別の雑誌、あるいは何も返さない DOI は、利用可能な幻覚検出の中でも最も速いものの一つである。というのも、文献を捏造するモデルは、実在の DOI を再利用するのではなく、それに見えそうな DOI 文字列をそれらしく作ることが通常だからである。
正しく解決される DOI であっても、その引用が真正であることの自動的な証明ではない。捏造された参考文献の中には、無関係な論文の実在の DOI を借用するものがあり、それはエラーなく解決され、主張を支えるはずの内容とは何の関係もない実在の論文を指す。読み込まれたという事実だけでなく、DOI が到達したページそのものを読むべきである。
すべてのタイトルを実在のデータベースと照合する
正確なタイトルを、引用符付きで、その分野を網羅するデータベースで検索してください。オープンウェブではありません。Crossref、生物医学分野なら PubMed、あるいは自分の専門分野の索引のようなものを使ってください。Crossref を使う場合は、無料のゲスト検索で、タイトルと第一著者、またはタイトルに自信がない場合は著者名とページ番号で文献を検索できます。これにより、登録されているものについて DOI と完全なメタデータが返されます。該当がない場合、または返ってきたものが著者がまったく異なる実在の論文である場合、2つ目の種類の幻覚、つまり壊れた DOI を見ている可能性があります。
タイトル検索は、DOI 確認では見つからない特定の失敗を捉えます。それは、番号と本文が別々に組み立てられ、互いに実際には照合されないままになっていたために、正しく機能する実在の DOI が誤ったタイトルに付いた引用です。データベースのタイトルが参考文献一覧のタイトルと十分に一致しない場合は、静かに修正すべき টাইपोではなく、不一致を説明できるまでは捏造として扱ってください。
著者一覧と出版年を照合する
幻覚による引用は、著者は正しく、論文は誤っていることがよくあります。なぜなら、その分野で実在し、著名な名前こそが、もっともらしい引用を求めるモデルが出力しやすいものだからです。すでに開いているデータベースで、その著者の出版一覧を検索し、参考文献一覧が示す年を確認してください。その著者がその年に3本の論文を発表していて、そのどれもタイトルと一致しないなら、その引用は非常に高い確率で捏造です。実在する名前と実在する年から作られたものの、その2つが実際には一緒になったことはなかったのです。
逆のパターンも見られます。正しいタイトルの実在論文が誤った年に付されている場合です。通常、それは最終出版年ではなくプレプリントの年であるか、会議版を後年の雑誌掲載年で引用しているものです。監査の厳密な意味ではどちらも捏造ではありませんが、どちらも読者を文献管理ソフトや共著者のもとへ向かわせ、そこで引用したものが見つからないという事態を招きます。同じ問題にかなり近いので、同じ作業の中で修正してください。
もっともらしいが捏造された雑誌名を見分ける
捏造されたジャーナル名は、まるで本物のように聞こえるよう作られている。もっともらしい分野名、もっともらしい形容詞、実在するジャーナルに十分近い名前で、誰も確認しようとしないほどである。「The Journal of Applied Cognitive Studies」は捏造であり、「The Journal of Applied Psychology」と「Journal of Cognitive Science」はどちらも実在する。両者の要素をつなぎ合わせた名前は、まさにその理由で見慣れたものとして読まれる。
ジャーナル名はそれだけを、引用符で囲んで検索し、同じ参考文献を別のサイトが引用している結果だけでなく、出版社自身のジャーナルページと現在のISSNを確認する。実在するジャーナルには、編集者、現在の巻号、そして正式に登録されたISSNを示すホームページがある。出版社ページもISSNもなく、そこからの論文を引用する他の論文もない名前は、監査全体の中で、その参考文献が存在しないことを示す最も明確な兆候である。
幻覚による引用監査を再現可能なチェックリストに変える
最終的な文献一覧と見なす前に、すべての参考文献について、これらの確認を順に実施する。順序はそれほど重要ではないが、4つすべてを確認することが重要である。ある引用は1つの確認には合格しても、別の確認では不合格になりうる。
| 確認項目 | 検出できるもの |
|---|---|
| DOI解決 | どこにもつながらないDOI、または無関係な論文に至るDOI |
| タイトルとデータベースの照合 | 誤ったタイトルに付された実在のDOI、または結果がまったく返らないタイトル |
| 著者と年の相互確認 | その年にその著者が書いていない論文に付された実在の著者名 |
| ジャーナル名の確認 | もっともらしく聞こえるが、ISSNも出版社ページもなく、実在もしないジャーナル |
TextPulseのAI引用チェッカーは、この確認の一部を参考文献一覧全体に対して自動で実行し、長い参考文献表で4つの確認を1件ずつ手作業で行うよりも速いが、そこで指摘された箇所を読むことは、信頼してそのまま受け入れたり却下したりするのではなく、自分で行う価値がある。DOIの段階に限って言えば、専用のDOIから引用への検索を使えば、各項目について解決先に1件ずつ確認しに行く手間を省ける。
整った参考文献表は、原稿を提出する前に行ういくつかの確認の1つである。ジャーナル投稿のためにAIスコアを下げることは別に扱っており、それに続く査読者への返答レターも同様である。
これらはどれも、提出前に自分の論文をもう一度読むことに代わるものではない。事実関係が合っていても、ある節がなお一般的に読めるなら、AI humanizerを使えば、引用を1つも触らずに文章を整えられる。TextPulseの学術執筆におけるAIテキストの人間化ガイドは、その確認を節ごとに扱っている。きちんと解決される参考文献表と、自分自身の声として読める原稿は別々の確認であり、一方が他方を担うと信じるよりも、続けて実行する価値がある。
よくある質問
幻覚引用監査とは、提出前に参考文献一覧全体に対して行う再現可能な確認であり、すべてのDOIを解決し、すべての題名を実在するデータベースと照合し、著者一覧と年を相互確認し、雑誌名が実際に存在することを確かめるものである。チャットボット、文献管理ソフトの誤り、あるいは記憶違いのいずれが原因であっても、捏造された参考文献を検出できる。
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.