Academic Writing

AIが書いた注釈が存在しない論文を記述する理由

捏造された参考文献は、誰かがそれを検索するまでは、本物とまったく同じように見えることがある。下に付された注釈のほうが偽造しにくい。そこには、誰も書いていない論文について、その方法と結果を詳細に述べる流暢な段落がある。

5 min
Table showing how ai hallucinated citations in bibliographies differ from genuine ones

監督者は、同じ文の形を十回続けて読み、注釈付き参考文献を開き、それを声に出して、一ページずつ読み進める。この研究は、X と Y の関係を検討し、参加者のサンプルを用いて Z を探究し、さらなる研究が必要であることを見いだした。すべての項目は流暢に読める。題名で検索した十二の出典のうち二つは存在しない。

参考文献における AI による幻覚化された引用は、通常、参考文献行では自らを明かさない。捏造された著者名と捏造された雑誌名は、誰かがそれらを検索するまでは、本物とまったく同じように見えることがある。捏造を最初に、ほとんど毎回、見抜かせるのは、その下に置かれた注釈である。つまり、書かれていない論文について、その方法と結果を詳細に記述するほど十分に自信のある段落である。

参考文献における AI による幻覚化された引用を見分ける方法

注釈を参考文献行より先に読むこと。引用それ自体、著者名、年、雑誌名、DOI は、いずれも言語モデルが何千回も見てきた小さな構造化パターンにすぎず、実体が何もなくても、偶然や記憶によって正しく見えることがある。これに対して注釈は、その特定の論文が実際に何をしたのかについて、真偽を確かめられるかどうかが分かる程度の詳細さで述べなければならない。モデルが出典を検索も読解もしないなら、これを確実に行うことはできず、その結果は DOI を確認するずっと前に、一般論的であることとして現れる。

なぜ注釈のほうが引用よりも多くを明かすのか

捏造された引用は、参考文献のふりをした推測である。もっともらしい著者、もっともらしい雑誌名、適切な桁数を持つ DOI らしき文字列である。捏造された注釈は、理解のふりをした推測であり、理解を全段落にわたって説得力をもって偽装することは、はるかに難しい。モデルは、サンプル、方法、そして結果の方向性を断定しなければならず、これらの細部の一つ一つが、実際の論文がそれを否定しうる箇所である。

それが、注釈が、単なる引用よりも読者にとって確認しやすい理由でもある。参考文献は、出典が実在するかどうかにかかわらず同じ形式で整えられるため、その形だけでは情報は漏れない。注釈は、特定の内容について特定の主張を行うので、実際の論文によって裏づけられるか、そうでないかのどちらかであり、本物の要旨を数分見ればどちらかが分かる。

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

モデルが、実際には論文を一度も読んでいないときに書くもの

言語モデルに、題名と大まかな主題しか与えられていない出典の注釈を書かせると、拒否も曖昧化もしない。訓練中に見た何千もの類似した要旨から、その題名の論文ならおそらく含むであろう段落を予測し、行ごとに引用できる論文に対して使うのと同じ自信に満ちた文体で返す。

それは、その主題の近くでこれまで書かれてきたあらゆるものの平均のように読める。睡眠と記憶に関する研究の正直な要約なら、実際の研究参加者の名称、実際に用いられた検査、報告された実際の効果量が示される。作り話の要約なら、その研究は人々の睡眠の質と記憶を調べ、それらの間に強い関連があると分かった、と述べるだろう。これは、別の無関係な題名の下に置いても違和感のないほど一般的である。

確認すべき点真正な注釈には通常これがある捏造されたものには通常代わりにこれがある
数値実際の要旨と一致する、具体的なサンプルサイズ、効果量、または割合数値がないか、実際の出典のどこにも現れない、丸められた検証不能な数値
方法実際に名指しされた方法, 具体的な検定, 研究デザイン, またはデータセット方法名のない, 「ある研究」や「ある分析」への曖昧な言及
限界著者自身が挙げた, その研究デザインに固有の1つの限界この分野のほとんどどの論文にも当てはまる一般的な限界
参考文献の一致その引用が, 注釈と題名が一致する実在の記録に解決されるその参考文献が解決されないか, 別の無関係な論文に解決される

これらの確認はいずれも, 論文全体を読むことを必要としない。必要なのは, 一度開いて, 注釈中の具体的な主張が実際に要旨に現れているかどうかを確認できる程度の時間だけである。

捏造率にモデルの版と日付が必要な理由

この問題の規模は測定されているが, その測定結果は互いに一致しない。なぜなら, それらは最初から同じものを測っていなかったからである。2023年の同じ日に, 同じ42の学術トピックについて ChatGPT-3.5 と ChatGPT-4 を検証したところ, 研究者は GPT-3.5 の引用の55パーセントが完全に捏造であり, GPT-4 では18パーセントであることを見いだした。プロンプトは同じで, 研究者も同じで, 日付も同じであった。変わったのはモデルだけであり, その率は3分の2低下した。

別の研究では、書誌引用ではなく幻覚化された事実を検証し、2024年に公表された研究において、ChatGPT-4は実在する連邦裁判所事件に関する検証可能な質問で58 percentの割合で誤りを示し、Llama 2は88 percentの割合で誤りを示した。この数値は、異なるモデルに対する別の課題を示しており、上記の引用捏造の数値と合わせて一つの総合的な率として平均すべきではない。両研究が一致しているのは問題の形である。モデルの版と日付が付されていない百分率は、何も具体的には示さない。2023年から2026年にまたがるこの種の6件の研究全体に見られるより広い傾向は、それ自体が一つの主題であり、does ChatGPT make up references がそれを詳しく扱っている。書誌に関して特に重要なのは、誰かがDOIを確認する前に、その注記が捏造を見抜かせるかどうかという、より狭い点にとどまる。

AIで作成された注釈付き参考文献の各項目を確認する方法

まず参考文献行から始める。Google Scholarまたはその雑誌の公式サイトで正確な題名を検索し、DOIは実際にその題名に解決されるまでは未確認として扱うこと。なぜなら、捏造された引用でも、他人の実在する無関係な論文に至るDOIを含みうるからである。実在する学術データベースに対して各項目を照合するAI citation checker は、各資料ごとに手作業で検索する代わりに、その検索を自動化する。

次に、注記を、その内容がどれほどもっともらしく聞こえるかではなく、原典そのものと照合する。実際の要旨を開き、注記が主張するサンプル、方法、結果が本当にそこにあるかを確認する。論文自身の要旨に基づいて各要約を作成する無料の annotated bibliography generator は、記憶だけで作成したものではなく、真に原典に基づく注記がどのように見えるかを、そうでないものの隣で示している。

監査を通過した項目については、APAでChatGPTを引用する方法MLAでChatGPTを引用する方法 が、それぞれ手順ごとに示されている。

これらはいずれも、実在を確認した後のエントリの書式を変えるものではない。ChatGPT 自体を引用する方法は別の問題であり、APA, MLA, Chicago, IEEE について詳しく扱われている。また、引用生成ツールは、様式にかかわらず通常の参考文献を同じように整形する。しかし、どちらも捉えられないのは、誰も書いていない論文を説明する注釈であり、それが十分に流暢であったため、誰も確認しようと思わなかったという点である。

XLinkedInFacebook

よくある質問

引用文献は見た目が正しければよいからである。もっともらしい著者名、雑誌名、DOI があれば、一見しただけでは通ってしまう。注釈は正しくなければならない。なぜなら、それは論文の方法と結果について特定の主張を行い、その主張が実際の出典と一致するか、しないかのいずれかだからである。論文を一度も読んでいないモデルは、要約の内容よりも参考文献の形をはるかに容易に偽装できる。

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.