AI Detection

AI検出器が非ネイティブ英語話者に不利である理由

2023年のStanfordの研究では、流暢な非ネイティブ英語の文章が、ネイティブの文章よりもはるかに高い割合で機械生成と誤認されることが示された。ここでは、その差を生む仕組みと、同じエッセイをより豊かな語彙で書き換えたときに何が起きたかを示す。

7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

AI detectorsが非ネイティブ話者に対して偏っているというのは、主観的な不満ではない。2023年の査読付きStanford研究は、それを直接測定した。研究者は、広く使われている7つのGPT detectorsを、非ネイティブの英語話者が書いた実際のTOEFLエッセイ91本と、アメリカの8年生が書いたエッセイ88本に適用し、その後、各 समूहがどのように評価されたかを比較した。

detectorsは8年生のエッセイを、ほぼ毎回正しく読み取った。すでに大学院レベルの英語能力試験に合格していた成人が書いたTOEFLエッセイでは、同じ7つのツールが平均61.22 percentの偽陽性率を示した。91本のエッセイのうち89本、ほぼ98 percentが、7つのツールの少なくとも1つによってAI-generatedと判定された。

TextPulseのAI detectorの精度に関するより広い証拠の概要では、その見出しとなる発見と、それがその後に生んだ訴訟を扱っている。この研究が引用されるほとんどすべての場面で省かれているのは、その仕組みである。なぜ大学院レベルの英語話者の文章が、そもそも機械が作ったもののように読まれるのか、そしてそう読まれなくなると何が変わるのか、という点である。

非ネイティブ話者に対して偏ったAI Detectors, その仕組み

detectorは意味を読まない。直前までの語を踏まえたときに、各語がどれほど予測可能かを読み取り、モデルがその大半を事前に推測できた場合に、文章に低いスコアを与える。語彙の多様性, つまり書き手が限られた安全な語の小さな集合を繰り返すのではなく、どれほど広い語彙を用いているか, と、統語的予測可能性, つまり文構造が言語で最も一般的なパターンにどれほど近く、それをどれほど変化させているか, は、言語産出の2つの特性であり、このスコアを下げる。

この区別が重要なのは、両者がページ上で異なる形で現れるからである。語彙的多様性は語そのものに関わる。たとえば、ある書き手が3つの異なる文で「obtain」「acquire」「secure」を用いるなら、その書き手は「get」を3回使う場合よりも、より多様に読まれる。ただし、他の点で文が同一であってもそうである。統語的予測可能性は構造に関わる。主語、動詞、目的語が何度も繰り返されるのであって、従属節で始まる文や、予想外の語で終わる文ではない。試験条件下で書く第二言語話者には、これらのより安全な形に頼る十分な理由がある。

第二言語での執筆は、これら両方の程度が一貫して低く示されるが、それは欠陥ではない。追加の言語で書く書き手は、最も正確である可能性が高い語彙と文型に依拠する。なぜなら、その言語がまだ完全に自動化されていない場合、誤って推測することの代償が大きいからである。検出器の偏りを記録したStanfordの論文は、AI検出器が存在するより前に確立されていた、まさにこのパターンに関する応用言語学研究の蓄積を引用している。すなわち、語彙の豊かさの低下、語彙的多様性の低下、そしてより単純な文構造は、第二言語での執筆における文書化可能で測定可能な特徴であり、それ以外の何かの兆候ではない。

母語話者の執筆と非母語話者の執筆の間にあるその差は、perplexity の差として現れる。これは、ある文章が機械生成かどうかを判断するために検出器が用いるのと同じ測定である。perplexity が低いほど、誰が作成したかにかかわらず、より機械的に読まれる。そして、非母語話者の執筆は、chatbot とは無関係な理由で、その尺度の低い位置にある。その差が本当に検出器を動かしているのか、それとも単なる偶然なのかは、検証可能な問いである。Stanford のチームはそれを直接検証した。

同じエッセイがより豊かな語彙で書き換えられたときに何が起きたか

研究者たちは、61.22 percent の平均偽陽性率を引き起こしていた同じ 91 本の TOEFL エッセイを取り上げ、ChatGPT に単一の指示で修正させた。「語彙選択を、より母語話者らしく聞こえるように改善せよ。」内容、論旨、文法については、いかなる変更も指示しなかった。その 1 回の修正の後、同じ 7 つの検出器における平均偽陽性率は 11.77 percent に低下し、ほぼ 50 percentage points の減少となった。また、すべての検出器が一致してフラグを立てたエッセイ数は 18 から 1 に減少した。

研究者たちは次に、実験を逆向きに行った。検出器が当初はほぼ毎回正しく判定していた 88 本の母語話者の 8 年生のエッセイを取り上げ、ChatGPT に、非母語話者が書いたかのように語彙選択を単純化させた。同じ母語話者によるエッセイにおける平均偽陽性率は、5.19 percent から 56.65 percent に跳ね上がった。エッセイの著者は変わっていない。変わったのは語彙だけであり、検出器はその語彙に従ったのである。

Perplexity は、誤分類率と両方向で完全に連動していた。TOEFL エッセイが語彙的に豊かになると急上昇し、8 年生のエッセイが単純化されると急低下した。著者たちはここから率直な結論を導いている。検出器が実際に反応していたのは、著者性では決してなかった。語彙選択であり、それは、英語をどこで学んだかにかかわらず、どの書き手の語彙にも備わりうる属性である。

異なる検出器の間で、この偏りはどの程度一貫しているのか

7 つの検出器は、多くの点では一致しなかったが、誤りがどちらの方向に生じるかについては一致していた。いずれも TOEFL エッセイを 8 年生のエッセイよりはるかに高い頻度でフラグ付けしたが、その差の大きさは検出器ごとに大きく異なっていた。

検出器偽陽性率, TOEFLエッセイ偽陽性率, ネイティブのエッセイ
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

これらは2023年の数値であり、当時存在していたツールを対象に測定されたものである。その後、いくつかは完全に変化した。OpenAIは2023年7月、この検証の4か月後に自社の検出器を停止した。実際のAI生成テキストを正しく判定できたのは26パーセントにすぎず、それでも人間の文章の9パーセントを誤ってAI生成と分類していたことが判明したためである。変わっていないのは、その差の方向である。人口統計学的および言語的カテゴリーをまたいで検出器を試験するために特別に構築された、より広範なバイアス・ベンチマークは、2025年12月に公表され、4つの新しいオープンソース・ツールに対して実施されたが、それでもなお、過小代表の書き手集団に対して一貫して低い再現率を報告した。

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

このバイアスは新しい検出器でも依然として現れるのか?

Stanfordの研究は、現在ではすでに数世代前のAIに関するものであり、著者自身も限界を明示している。小規模な予備サンプルであること、そして検出器が主としてGPT-2に基づいて構築されていたことだ。GPT-2は、今日の検出を支えるモデルよりもはるかに小さく、古いモデルである。それは妥当な疑問を生む。より優れた技術によって、その差は埋まったのだろうか?

最新の専用テストは、まだそうではないと示している。2026年2月にSultan Qaboos Universityで行われた研究では、研究者たちは、真正なChatGPT以前のEFL学生の文章、専門的な人間の文章、AI生成テキスト、そして人間とAIの混成テキストを混ぜた192本のテキストに対して、現在の商用検出器であるTurnitinとOriginalityの2つを検証した。結果は、2つのツールの全体的な正確性がそれぞれ69パーセントと61パーセントであり、編集作業が実際に生み出す種類の文章である混成カテゴリでは、正確性がほぼゼロまで低下した。同じ研究は、言語に関する偏りとは別に、もう1つの偏りも明らかにした。科学系の文章に対する正確性は、人文系の文章に対する正確性より28から38パーセントポイント低かった。

どちらの発見も、単一の欠陥製品に関するものではない。3年離れた時点で、異なる研究チームが異なるコーパスを用いて検証した2種類の検出器アーキテクチャは、同じ結果に繰り返し到達している。すなわち、ジャンルの慣習や第二言語によって形作られた文章は、どちらでもない文章よりも、これらのツールが機械生成と呼ぶものに近く位置づけられるという結果である。TextPulse's free toolsでは、著者は、いずれかが機関の検出器に届く前に、その同じ統計的プロファイルを確認できる。

独立した証拠は、その差が実在し、検査上の人工物ではないことを示している

TOEFLの結果に関する最初の問題は、それが2023年の小規模な試験的研究にしか当てはまらないと主張できる点にある。この点は、検出器とはまったく関係のないデータを用いた別の研究で、同じ研究チームによって応答された。彼らは、ChatGPTが存在する前に提出され査読された要旨に対象を限定し、主要な機械学習会議であるICLR 2023に採択された1,574本の論文を調査した。

英語が第一言語ではない国を拠点とする著者は、英語を母語とする国を拠点とする著者よりも、要旨の perplexity が有意に低いものを書いており、その差は各論文が査読者によってどれほど高く評価されたかを統制した後でも維持された。このサンプルは、誰かが chatbot のように、あるいはそうでないように聞こえようとして形作ったものではありえなかった。ChatGPT が公開される3か月前に投稿期間は終了していた。母語話者と非母語話者の学術文書の間にある perplexity の差は、検出器が作り出したものではない。それは、検出器が受け継いだものである。

AI 検出を検定問題として扱う2026年の統計分析は、同じ結論を形式的に示している。ある書き手集団が、全体として典型的な AI 出力と重なる言語を生成する場合、AI によって書かれたテキストを実際に検出する力を持つ検出器は、その集団に対して特に、より高い偽陽性率を伴わなければならない。これは、個々のツールの欠陥ではなく、多様な集団を検定することに伴う数学的性質である。非母語の英語を書く人々は、まさにその重なりが文書化された最も明確な事例である。

第二言語で書く著者にとって、これが意味すること

これらはどれも、自分らしさを失ってまで書くべきだという主張ではない。スコアが出る前に、実際に何が測定されているのかを知るべきだという理由である。あなたの文章を予測可能だと読む検出器は、第二言語で書かれた文章に固有の実際の統計的性質を拾っているのであって、あなたが使っていないツールを使った証拠を示しているのではない。

元の研究を行った Stanford の研究者たちは、自らの発見が持つ不快な含意を指摘している。偽陽性のリスクを下げる同じ語彙調整は、検出器とは無関係に、より明確な言い回しやより正確な語を求めて著者が行いたいと考える種類の修正でもある。TextPulse のESL の学術著者向けページでは、その種の修正が実際の文でどのように見えるかを、検出スコアとは切り離して扱っている。

新しい検出器は、このパターンを明示的に考慮し始めている。Pangramは、比較的新しい商業参入企業の一つであり、自社の技術文書の中で、その分類器は非母語の英語話者に対して偏っていないと述べているが、その主張は独立した検証ではなく、ベンダーによるものである。free perplexity checkerは、これらのツールが文章の一部から計算するのと同じ基礎的な測定値を、下書きをどこかに送信することなく示す。

実用上の補助となるものが、同じ領域に二つある。when to use a, an and theは、このパターンの単一で最も一般的な原因であり、より一般的にはhow to sound natural in English academic writingである。

研究は、その後2年にわたって、異なる研究チーム、異なる検出器、異なる試験設計を通じて、同じ方向に積み重なり続けている。追いついていないのは、広く採用された制度的対応である。すなわち、特定の学生がすでに告発された後ではなく、いずれか一人に信頼を置く前に、さまざまな書き手に対して検出器を監査することである。それが日常的にならない限り、誤検出が誤りであることを証明する負担は、まさにこの研究が最も誤検出を受けやすいと述べる書き手にのしかかる。

XLinkedInFacebook

よくある質問

AI検出器が非ネイティブ話者に不利であることは、査読付きの知見であり、推測ではない。2023年のStanfordの研究では、広く使われている7つのGPT検出器が、実際のTOEFLエッセイの平均61.22 percentをAI生成と誤分類した一方で、ネイティブ話者のエッセイはほぼ常に正しく判定した。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.