AI Detection

AI検出器が非ネイティブ英語話者に不利な理由

2023年のStanford研究は、流暢な非ネイティブ英語の文章が、ネイティブの文章よりもはるかに高い割合で機械生成と誤認されることを示した。ここでは、その差を生む仕組みと、同じエッセイをより豊かな語彙で書き換えたときに何が起きたかを示す。

最終更新日 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

AI detectors biased against non-native speakersは、主観的な不満ではない。2023年の査読付きStanford研究は、それを直接測定した。研究者たちは、非ネイティブの英語話者が書いた91本の実際のTOEFLエッセイと、アメリカの8年生が書いた88本のエッセイに対して、広く使われている7つのGPT detectorを適用し、その後、各 समूहがどのように採点されたかを比較した。

これらのdetectorは、8年生のエッセイをほぼ毎回正しく読み取った。すでに大学院レベルの英語能力試験に合格していた成人が書いたTOEFLエッセイでは、同じ7つのツールが平均61.22 percentのfalse positive rateを示した。91本のエッセイのうち89本、ほぼ98 percentが、7つのツールの少なくとも1つによってAI-generatedと判定された。

TextPulseによるAI detectorの精度に関するより広い証拠の概説は、この見出しとなる知見と、その後それが引き起こした訴訟を扱っている。研究が引用されるほとんどすべての場面で省かれているのは、その仕組みである。なぜ大学院レベルの英語話者の散文が、そもそも機械生成のように読まれるのか、そしてそう読まれなくなったときに何が変わるのか。

非ネイティブ話者に不利なAI detector, その仕組み

detectorは意味を読まない。直前までに続いた語を踏まえて、各語がどれほど予測可能かを読み取り、モデルがその大半を事前に推測できた場合に低いスコアを付ける。語彙の多様性, すなわち、書き手が限られた安全な語の集合を繰り返すのではなく、どれほど広い語彙を用いるかという性質, と、統語的予測可能性, すなわち、文構造が言語で最も一般的なパターンにどれほど近く、それをどれほど変化させているかという性質, は、言語産出の2つの属性であり、このスコアを下げる。

この区別が重要なのは、両者がページ上で異なる形で現れるからである。語彙的多様性は語そのものに関わる。たとえば、ある書き手が3つの異なる文で「obtain」「acquire」「secure」を用いるなら、その書き手は「get」を3回使う場合よりも、より多様に読まれる。文がそれ以外では同一であってもそうである。統語的予測可能性は構造に関わる。主語、動詞、目的語が何度も繰り返されるのであって、従属節で始まる文や、予想外の語で終わる文ではない。試験条件下で書く第二言語話者には、両方についてより安全な形に頼る十分な理由がある。

第二言語での執筆は、両方の特徴が少ないことを一貫して示すが、それは欠陥ではない。追加の言語で書く書き手は、誤りを推測することの代償が、その言語がまだ完全には自動化されていない場合により大きいので、正しい可能性が最も高い語彙と文パターンに依拠する。検出器の偏りを記録したStanfordの論文は、AI検出器が存在するはるか以前に確立されていた、まさにこのパターンに関する応用言語学研究の蓄積を引用している。語彙的豊かさの低下、語彙的多様性の低下、そしてより単純な文構造は、第二言語での執筆における、何か別のものの兆候ではなく、記録可能で測定可能な特徴である。

母語話者の執筆と非母語話者の執筆とのその差は、perplexity の差として現れる。これは、ある文章が機械生成されたものかどうかを判断するために detector が用いるのと同じ測定である。perplexity が低いほど、誰が作成したかにかかわらず、より機械的に読まれる。そして、非母語話者の執筆は、chatbot とは何の関係もない理由で、その尺度の低い位置にある。その差が、単なる偶然ではなく、本当に detector を駆動しているのかどうかは、検証可能な問いである。Stanford のチームはそれを直接検証した。

同じエッセイがより豊かな語彙で書き換えられたときに何が起きたか

研究者たちは、61.22 percent の平均偽陽性率を引き起こしていた同じ91本のTOEFLエッセイを取り上げ、ChatGPTに単一の指示で修正させた。「語彙選択を、より母語話者らしく聞こえるように改善せよ。」内容、論旨、文法については、いかなる変更も指示しなかった。その1回の修正の後、同じ7つの検出器における平均偽陽性率は11.77 percentに低下し、ほぼ50ポイントの減少となった。また、すべての検出器が一致してフラグを立てたエッセイ数は18本から1本へと減少した。

研究者たちは次に、実験を逆向きに行った。もともと検出器がほぼ毎回正しく判定していた、母語話者による88本の8年生のエッセイを取り上げ、ChatGPTにそれらの語彙選択を非母語話者が書いたかのように単純化させた。同じ母語話者作成のエッセイにおける平均偽陽性率は、5.19 percentから56.65 percentへと跳ね上がった。エッセイの著者は変わっていない。変わったのは語彙だけであり、検出器はその語彙に従った。

Perplexityは、誤分類率と完全に連動して両方向に変化した。TOEFLエッセイが語彙的に豊かにされると急上昇し、8年生のエッセイが単純化されると急低下した。著者たちはここから率直な結論を導いている。検出器が実際に反応していたのは、著者性では決してなかった。それは語彙選択であり、英語をどこで学んだかにかかわらず、あらゆる書き手の語彙が担いうる属性である。

このバイアスは異なる検出器間でどの程度一貫しているか

7つの検出器は、誤りがどちらの方向に生じるかを除けば、ほとんど一致しなかった。いずれもTOEFLエッセイを8年生のエッセイよりはるかに高い頻度でフラグ付けしたが、その差は大きく異なっていた。

検出器偽陽性率, TOEFLエッセイ偽陽性率, ネイティブのエッセイ
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

これらは2023年の数値であり、当時存在していたツールを用いて測定されたものである。その後、いくつかは完全に変化した。OpenAIは2023年7月、この検証の4か月後に自社の検出器を停止した。実際のAI生成テキストの26パーセントしか正しく検出できず、それでも人間の文章の9パーセントを誤ってAI生成と判定していたことが判明したためである。変わっていないのは、この差の方向である。人口統計的および言語的カテゴリーを横断して検出器を検証するために特別に構築され、2025年12月に公表され、4つの新しいオープンソースツールに対して実施された、より広範なバイアス・ベンチマークでも、過小代表の執筆者 समूहに対して一貫して低い再現率が報告された。

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

このバイアスは新しい検出器でもなお現れるのか?

Stanfordの研究は、現在では数世代前のAIに関するものであり、著者自身も限界を明示している。すなわち、小規模な予備サンプルであること、そして検出器が主としてGPT-2に基づいて構築されていたことだ。GPT-2は、今日の検出を支えるモデルよりもはるかに小さく、古いモデルである。これは妥当な疑問を生む。より優れた技術によって、この差は解消されたのだろうか。

最新の専用テストでは、まだそうではないと示されている。2026年2月に Sultan Qaboos University で行われた研究では、研究者たちが、現在の商用検出器である Turnitin と Originality の2つを、真正な ChatGPT以前のEFL学生の文章、専門的な人間の文章、AI生成テキスト、そして人間とAIのハイブリッドテキストを混在させた192本のテキストに対して検証した。その結果、2つのツールの全体的な正確性はそれぞれ69 percentと61 percentであり、実際に編集作業が生み出す種類の文章であるハイブリッド分類に対する正確性は、ほぼゼロまで低下した。同じ研究は、言語に関する偏りと並行してもう1つの偏りも明らかにした。科学系の文章に対する正確性は、人文系の文章に対する正確性より28 to 38 percentage points低かった。

いずれの発見も、単一の欠陥ある製品に関するものではない。3年離れた時点で、異なる研究チームが異なるコーパスを用いて検証した2種類の検出器アーキテクチャが、同じ結果に繰り返し到達している。すなわち、ジャンルの慣習や第二言語によって形作られた文章は、どちらでもない文章よりも、これらのツールが機械生成と呼ぶものに近く位置づけられるのである。TextPulse's free toolsを使えば、著者は、いずれかが機関の検出器にかけられる前に、その同じ統計的プロファイルを確認できる。

独立した証拠は、その差が実在し、試験上の人工物ではないことを示している

TOEFLの結果に関する最初の問題は、それが2023年の小規模な予備研究にしか当てはまらないと主張できる点にある。この点は、検出器とはまったく関係のないデータを用いた別の研究で、同じ研究チームによって回答された。彼らは、主要な機械学習会議である ICLR 2023 に採択された1,574本の論文を調査し、ChatGPT が存在する前に提出され、査読された要旨にサンプルを限定した。

英語が第一言語ではない国を拠点とする著者は、英語を母語とする国を拠点とする著者よりも、要旨の perplexity が有意に低かった。この差は、各論文が査読者によってどれほど高く評価されたかを統制した後でも維持された。このサンプルは、誰かが ChatGPT のようにも、そうでないようにも聞こえるよう意図して形作ったものではあり得なかった。ChatGPT が公開されるまで、投稿期間の終了時点でなお3か月あったからである。英語を母語とする学術文書とそうでない学術文書の間にある perplexity の差は、検出器が作り出したものではない。それは、検出器が受け継いだものである。

AI 検出を検査問題として扱う2026年の統計分析は、同じ結論を形式的に示している。ある集団の書き手が、全体として典型的な AI 出力と重なる言語を生成する場合、AI によって書かれたテキストを実際に検出する力を持つ検出器は、その集団に対して特に、より高い偽陽性率を伴わなければならない。これは、特定の一つのツールの欠陥ではなく、多様な集団を検査することに伴う数学的性質である。英語を母語としない書き手は、まさにその重なりが文書化された最も明確な事例である。

第二言語で書く書き手にとって、これは何を意味するのか

これらはどれも、自分らしさを失ってまで書くべきだという主張ではない。採点が下される前に、実際に何が測定されているのかを知るべきだという理由である。あなたの文章を予測可能だと読む検出器は、第二言語での執筆に固有の実際の統計的性質を拾っているのであって、あなたが使っていないツールを使った証拠を示しているのではない。

元の研究を実施した Stanford の研究者は、自らの発見がもつ不快な含意を指摘している。偽陽性のリスクを下げる同じ語彙調整は、まったく別の理由から書き手が望むかもしれない修正、すなわち、より明確な言い回し、より正確な語への置き換えでもある。検出器の有無にかかわらず、である。TextPulse のESL の学術的な書き手向けページでは、その種の修正が実際の文でどのように見えるかを、検出スコアとは切り離して扱っている。

新しい検出器は、このパターンを明示的に考慮し始めている。Pangramは、比較的新しい商業参入企業の一つであり、自社の技術文書の中で、その分類器は非母語の英語話者に対して偏っていないと述べているが、その主張は独立した検証ではなく、ベンダー自身によるものである。free perplexity checkerは、これらのツールのいずれもが文章片から算出する同じ基礎的な測定値を、下書きをどこかへ送信することなく示す。

実用上の補助となるものが同じ群に二つある。when to use a, an and theは、このパターンの単一で最も一般的な原因であり、より一般的にはhow to sound natural in English academic writingである。

研究は2年後も同じ方向に蓄積し続けており、異なる研究チーム、異なる検出器、異なる試験設計にまたがっている。追いついていないのは、広く採用された制度的対応である。すなわち、特定の学生がすでに告発された後ではなく、いずれか一人に信頼を置く前に、さまざまな書き手に対して検出器を監査することである。これが日常的な手順になるまでは、誤ったフラグが誤りであることを証明する負担は、まさにこの研究が最もその対象になりやすいと述べている書き手たちにかかる。

XLinkedInFacebook

よくある質問

AI検出器が非ネイティブ話者に不利であることは、査読付きの知見であり、推測ではない。2023年のStanford研究では、広く使われている7つのGPT検出器が、実際のTOEFLエッセイの平均61.22 percentをAI生成と誤分類した一方で、ネイティブ話者のエッセイはほぼ常に正しく判定した。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI人間化の最新情報を受け取る

学術ライティング、AI検出、そして人間化に関するヒントを、受信箱へお届けします。

スパムはありません。いつでも配信停止できます。