AI検出器が非ネイティブ英語話者に不利な理由
2023年のStanford研究は、流暢な非ネイティブ英語の文章が、ネイティブの文章よりもはるかに高い割合で機械生成と誤認されることを示した。ここでは、その差を生む仕組みと、同じエッセイをより豊かな語彙で書き換えたときに何が起きたかを示す。
7 min read
AIによる文章を人間らしくする方法を解説する専門記事。AI検出でスコア低め、引用を保持し、より良い学術論文を書く。
2023年のStanford研究は、流暢な非ネイティブ英語の文章が、ネイティブの文章よりもはるかに高い割合で機械生成と誤認されることを示した。ここでは、その差を生む仕組みと、同じエッセイをより豊かな語彙で書き換えたときに何が起きたかを示す。
バースト性は、平均文長がどれほど長いかではなく、文章全体で文長がどれほど広く変動するかを測定する。この投稿では、この用語の由来、ばらつきが実際にどのように計算されるか、そして言語モデルの出力がなぜ文長の狭い範囲に収まりやすいのかを説明する。
パープレキシティは、言語モデルが語の選択にどれほど驚いたかを記述するために生成する数である。本稿では、この指標を1977年の起源までたどり、式を順に検討し、同じ文章でも、どのモデルが読んでいるかによって異なるスコアになりうる理由を説明する。
ベンダーは偽陽性率が1%未満であると公表している。独立研究者が同じ検出器を非母語英語の文章に対して検証したところ, 60%を超える率が示された。以下に, 証拠が示す内容を述べる。
AI検出器は、読者のように機械による文章を認識するわけではない。まず、あなたの文章がどれほど予測可能かを測定し、それをスコアに変換する。この点が理解できれば、技術そのものとその失敗の両方が、よりよく理解できる。
お使いの言語に翻訳されていない投稿は、英語ブログにあります。