教授はChatGPTを使ったかどうか見分けられるか?
検出ソフトウェアは、多くの学生が考えるほど重要ではありません。ここでは、既にあなたの文章を読んだ教授が、草稿があなたらしくなくなったときに実際に何に気づくのかを、試験官に関する画期的な盲検研究から、誰かがスキャンを実行するよりずっと前に現れる具体的で確認可能な兆候まで、説明します。
レディング大学で行われた盲検試験では、63件のChatGPTの回答が、1,134件の真正な学生提出物の中に混ぜられ、実際の学部心理学試験に投入され、通常の試験採点者が、それがどれであるかを知らないまま、すべてを採点した。PLOS ONEに2024年6月に掲載されたこの結果では、AIの回答の94パーセントがまったく指摘されず、平均すると実際の学生よりも約半段階高い成績境界に達し、2:1からfirst classの範囲に集中していた。
教授は、あなたがChatGPTを使ったかどうかを見分けられるのか。多くの場合、答えは否であり、それは採点者がその書き手の作品を以前に見たことがない状態で、単一の盲検読解をしただけでは分からない。もう一つの試験は、あなた自身の教授である。あなたの特定のエッセイを採点する教授は、通常、すでにあなたの文章を読んでおり、セミナーであなたの向かいに座ったことがあり、あなたの議論が応答すべき特定のテクストを設定している。レディングの研究には、そのどれも存在しなかった。まさにそこが、実際の授業と、見知らぬ人に渡された試験答案とを分ける点である。
教授はあなたがChatGPTを使ったかどうかを見分けられるのか, まず彼らがすでに知っていることから始める
TurnitinのAI writing indicatorは、この問いが出るときに多くの学生が思い浮かべるソフトウェアであり、それが何を検出し、何を見逃すかは、推測する価値のある謎ではなく、特定され文書化された事柄である。しかし、多くの教員は主としてダッシュボード上のパーセンテージを見ているわけではない。彼らが見ているのは、あなたの他の文書を入れたフォルダの隣に置ける文書である。第3週のディスカッション投稿、質問を添えてメールした下書き、2か月前のセミナーであなたがうまく答えられなかった指名発言である。
教授があなたの文章について持つ実際の知識こそが、「教授はただ分かる」という言い方の背後にある実際の仕組みである。それは、あなたの構文、典型的な誤り、あなたがよく用いる論点、そして、誰もあなたの雄弁さを採点していないときに書く具体性の水準についての実例から生じる。洗練度が突然上がると目立つのは、明確な理由があるからである。それは、その基準線と一致しないからである。盲検研究で初めて採点する者には、そもそも比較対象がなかった。
査読者のブラインド研究で何が分かったのか、そしてそれが全体像ではない理由
Readingの研究は、見出しの数字の下にある詳細のほうが見出しそのものよりも有用であるため、もう少し立ち止まって検討する価値がある。AIの回答のうち、何らかの学術的不正の懸念として指摘されたのは6.35 percentにすぎず、AIが書いたものとして具体的に指摘されたのは3.17 percentだけだった。残りは、他の答案とまったく同じように印を付けられ、採点され、返却された。これは、他の場所で最も注目を集めているAI検出ソフトウェアにおける偽陽性とバイアスとは別の問題である。この研究が測定したのは、いずれの側にもアルゴリズムを用いずに、人間が生の能力で見分けられるかどうかであった。
しかし、だからといって査読者が不注意だという意味ではない。この研究は、特定のことを検証するために設計された。すなわち、書いた本人についての他の情報が何もない状態で、ある文章を初めて目にした採点者が、それを同じ問いに対する人間の回答と見分けられるかどうかである。これは検出問題の中でも最も難しい形に近く、研究者たちは意図的にそのように設計した。ReadingのPeter Scarfeは、この研究が公表された際に、「our research shows it is of international importance to understand how AI will affect the integrity of educational assessments」と述べた。これは、ある一学科の好奇心ではなく、部門全体に関わる問題である。
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
下書きを見抜く具体的な手がかり
ソフトウェアが関与する前に、4種類の証拠が現れやすく、しかもそのどれも特別な訓練を必要としない。すでにあなたの文章を知っている教員が、検出ツールを開かなくてもそれらを見抜けるのは、そのための一部である。
| 兆候 | 実際にはどのように見えるか |
|---|---|
| エッセイの途中で文体が変わる | いつもの声で書かれた2つの段落の後に、別の、より形式的な書き手が引き継いだように読める段落が続く |
| モジュールが一度も設定していない出典 | 読書リストに載っていなかったり、ゼミで取り上げられたりしなかった文献への引用が、実際に扱った文献の引用と並んでいる |
| ゼミの痕跡がない論証 | 課題が出された週に授業で20分かけて議論した具体的な反論を無視する主張 |
| 未編集の出力が本文に残っている | 紛れ込んだ指示、繰り返された語句、あるいは提出前に誰も読み返さなかったチャット文の残りとしか意味をなさない一文 |
最終稿に未編集のAI出力が残っていることは、珍しい手がかりのように聞こえるが、時間的制約の下でそれがどれほど頻繁に起こるかを見ると、そうではない。Alcorn State Universityの歴史学教員Jason Gibsonは、2026年7月にこれを直接検証した。試験の指示文の中に白文字で命令を隠し、ページ上では見えないようにして、答えのどこかに意味をなさない形でMadagascarという語を入れよとしたのである。35人の学生のうち32人がまさにそれを行い、産業革命についての解答の中に「Madagascar floats sideways through the afternoon」のような文を作った。
その件については検出器は不要だった。彼は学生たちに見つけたことを伝え、成績に異議を申し立てる機会を与えた。2人が申し立て、1人は成功した。その学生は隠された一文を読んでいたのであり、画面のダークモードによって白文字が見えるようになっていたのである。未編集のAI出力を見つけるのに、法科学ソフトウェアはほとんど必要ない。通常は、誰かが解答を読むだけで足りる。
誰も実際には読んでいない文章についての自信に満ちた散文
時に、決定的な手がかりは、そもそも存在しない引用である。2024年に The American Economist に掲載された研究では、Journal of Economic Literature から取られたプロンプトを用いて GPT-3.5 と GPT-4 を検証し、GPT-3.5 が生成した引用の30パーセント超が完全な捏造であり、その割合は GPT-4 でもわずかに良い程度にすぎないことが示された。モデルは引用を書くときに何かを参照しているわけではない。訓練データの中で著者名、題名、年が一緒に現れるため、それらしい引用を生成しているのであり、対応する出典が実在するからではない。
別の場合には、出典自体は実在するが、シラバスからは正当化しようがないことがある。これは、University of Bolton における初期の、よく記録された事例で学生をつまずかせた状況に近い。リーダーシップ理論に関するエッセイを調査した担当者は、節ごとに文体が変化していること、論理的につながらない記述があること、そして出典一覧がコース独自の Moodle システムで利用できる2つのジャーナルだけから構成され、指定読書リストからのものが一切ないことを確認した。
ある引用は、実在するが驚くほど無名な2022年の論文で、Harry Potter をリーダーシップ理論に適用したものだった。これは、シラバスに基づいて学んでいる学生が偶然たどり着くような出典ではまったくない。実際、そのエッセイは第三者の執筆サービスから購入されたものであり、大学の調査では、その一部で ChatGPT が使われていたと結論づけられた。そして学生は課題に不合格となり、再受験しなければならなかった。最終的にそれを見抜いたのは、そのモジュールで実際に何が課されていたかを知っており、エッセイがそれに基づいて構成されていないことに気づいた採点者だった。
これが意味しないこと, そして代わりに身につけるべき習慣
このことは、すべての不整合が直ちに疑いを招くという意味ではないし、洗練された文章が本質的に危険だという意味でもない。教員は、単一の怪しい文ではなく、提出物全体にわたるパターンを読んでいる。そして、正当な懸念が生じた後に続く手続きは、正式な段階に進む前に、証拠と対話に関する独自の規則に従って進行する。
この種のことを脇に置いても、より有用な習慣は、提出後ではなく提出前に、自分の下書きについて、読者が気づくのとまったく同じ種類の文体のずれを確認することである。無料のフォーマル度チェッカーは、自分の通常の文体から外れた段落を検出し、教授が目視で気づくのと同じ変化を示す。これは校正の習慣であって、裏技ではなく、下書きの一語たりとも chatbot に触れていなくても、触れていても機能する。
この問いをより率直に言い換えた ChatGPT を使うと見つかるのか という問いには、別に答えがある。さらに狭い、Turnitin は言い換えたテキストを検出するのか という問いにも別の答えがあり、実際に多くの学生がつまずくのはそこである。
TextPulse の 学生向け AI humanizer は、同じ基本的な考え方に基づいている。つまり、特定の教授のソフトウェアが何と言うかについての主張ではなく、自分の文章の統計的な形から構築された推定 Human Score を報告するのである。なぜなら、いかなるツールも、それが制御していないシステムについて、そのようなことを責任を持って約束することはできないからである。提出前に自分の下書きに対して用いると、事後に誰かと議論するための手段ではなく、自分の声を第二の、利害のない読み手として確認する機能を果たす。エッセイが行ごとにより具体的で、真に自分らしく読めるほど、こうしたことが問題になる必要は少なくなる。
よくある質問
多くの場合、そうです。ただし、ソフトウェアだけではまれです。教授はChatGPTを使ったかどうか見分けられるか。盲検採点に関する大学研究は、見知らぬ採点者が1つの答案を採点するだけでは見抜けないことを示唆しています。2024年のある研究では、試験官はAIが書いた試験答案の94 percentを見逃しました。あなた自身の担当教員は、あなたの過去の文章や、その授業で実際に扱った具体的な内容など、より多くの手がかりを持っているのが通常であり、実際の多くの事例はそこにかかっています。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.