AI Detection

Turnitinの偽陽性率: 数値が示すもの

Turnitinは2つの偽陽性の数値を公表しており、1つではない。そして、どちらも目の前にある特定の教授の論文を説明するものではない。ここでは、文書レベルと文レベルの区分、20%未満の注記、そして百分の一未満の割合を実際の学生数に換算する計算を示す。

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

Turnitinの偽陽性率は、1つの数値ではない。同社は2つの数値を公表している。文書レベルでは1 percent未満、文レベルでは4 percentに近い数値である。どちらも実在し、どちらも公表されているが、どちらか一方だけでは、目の前にある特定の論文についてはほとんど何も示さない。

この2つの数値の間にある差、そしてどちらか一方が単一の文書ではなく実際の授業に適用されたときに何が起こるのか, これが本稿で検討する点である。すなわち、Turnitin自身が何を述べているのか、2つの数値が実際には何を対象としているのか、そして百分率のごく一部が学生の実数に変わるときの算術である。

Turnitinによれば、Turnitinの偽陽性率とは何か

文書レベルでは、同社自身の言葉で次のように述べている。「Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing.」この条件は、数値と同じくらい重要である。1 percent未満という数値は、Turnitinが採点するすべての論文についての主張ではない。これは、モデル自身の推定で20 percentのAI執筆閾値をすでに超えた論文の部分集合のみを説明している。

文レベルでは、インターフェースが文書全体ではなく個々の行を強調表示するが、Turnitinの数値はおよそ4倍高い。同社は「Our sentence-level false positive rate is around 4%,」と述べている。「There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written.」Turnitinはさらに、この誤って判定された文は無作為に散らばるのではないと付け加えている。54 percentの確率で、誤ってフラグが付けられた文は真のAI執筆の直後に位置しており、同社はこれを、文書全体のスコアが単一の強調表示された行よりも安定しやすい理由の一部として示している。

文書レベルと文レベルは同じ主張ではない

この二層の分割は、改訂されたメッセージであり、Turnitinの当初の立場ではない。2023年4月の提供開始時、同社は文書と文の区別をまったく設けず、1パーセント未満という単一の数値を公表していた。教育機関がその数値を引用し始め、教育系メディアが実際の運用では想定より高い偽陽性を報じた後、Turnitinの最高製品責任者は、上で用いた内訳を公表した。あわせて、これに対応して行われた2つの製品変更、すなわち、採点対象となる文書の最小長を150語から300語に引き上げたこと、そして文書内の冒頭文と末尾文の採点方法を変更したことも示した。

300語の下限が存在するのは、関連する理由による。Turnitinは、同社自身の言葉によれば、テキスト量が増えるほど精度が向上することを確認した後、当初の150語の最小値からこれを引き上げた。短い提出物, 1ページの振り返り, 途中までの下書き, ディスカッション投稿では、モデルが利用できる手がかりが、上記の偽陽性率が測定された対象よりも少ない。そのため、この下限を下回るものには、信頼性の低いAIスコアではなく、そもそもAIスコアが付与されない。

レベルTurnitinが示す率実際に対象とする範囲
文書レベル1%未満すでに20%以上AI生成と判定された文書のみ, 文書全体の総合割合
文レベル約4%AI writing report内で強調表示された個々の文, 文書全体のスコアにかかわらない
20%の文書しきい値未満数値は表示されないTurnitinは割合の代わりにアスタリスクを表示し, その範囲では結果の信頼性が低いことを示す

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

算術, 実際の集団において1パーセント未満が何を意味するか

この計算は、Vanderbilt Universityが2023年8月にTurnitinのAI検出に関連する誤判定率を算出した際に、公に行われた。こうした計算を行う最良の例は、Vanderbilt自身による数値の算出である。TurnitinのAI検出を停止するという決定についてのブログ投稿で、同大学は次のように述べている。「[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI.」

その数値は、ベンダーが公表した数値をVanderbilt自身の件数に当てはめた同大学独自の外挿であり、別途測定された結果ではない。この算術の形は、1つの大学の在籍者数を超えて一般化できる。1パーセント未満の率を数百本の論文に適用すると、誤ってフラグを立てられる学生は少数にとどまり、見落とされやすい。同じ率を、実際の大学が毎年提出する規模である数万本の論文に適用すると、少数ではなく数百件が生じる。これは、小さな割合と大きな母集団が、それぞれを独立に考えるのではなく、掛け合わされるからである。

しかし、これだけでは実世界の率が実験室での数値と正確に一致することは証明されない。Turnitinの最高製品責任者自身も、公の場で、実世界の結果は実験室での試験とは異なると認めており、それが同社が当初メッセージを修正した理由の一部である。上の算術は、Turnitinが自ら示した数値を、実際に起こることの上限としてではなく、慎重に受け止める価値のある入力として扱っている。なぜなら、そのツールが採点している提出物は、整えられたベンチマークとはまったく異なるからである。

その率が対象としないもの

20パーセントのしきい値を下回る結果には、小さな割合が付くことはない。代わりに数値ではなくアスタリスクが付く。Turnitinがそうしたのは、その範囲ではこのツールがどちらの方向にも最も信頼性が低いからであり、この判断は独立した教育系報道と、その範囲における同社自身の低信頼性という位置づけによって裏づけられている。軽い修正、つまり1つの段落だけを助けを借りて改訂し、残りは自力で書いた場合でも、小さなスコアどころか可視のスコアがまったく出ないことがある。数値が欠けていることを告発と読むのか、それとも問題なしと読むのか、その前に知っておく価値がある。TextPulseのTurnitinの良いスコアの基準に関するガイドは、同じしきい値を報告書の読み手側から扱っている。

では、公表された偽陽性率はどのように読むべきか。

それは、最初に見えるよりも狭い条件についてのベンダーの数値として読むべきであり、目の前にある特定の教授の前に置かれた論文についての断定として読むべきではない。Turnitinも自社の出力を同じように位置づけている。同社は、AI writing detection technologyは「不正行為の判定」を提供するものではなく、「教育者が情報に基づいた判断を下すためのデータ」を提供するだけだと明言している。AI detectorsがそもそも正確かどうかに関するより広い証拠も、同じ読み方を裏づけている。公表された率は基準値を示すのであって、現在採点されている文書を示すものではない。

自分の下書きが同種の統計的測定のどこに位置するのかを知りたい書き手は、推測するのではなく、機関のdetectorに届く前に無料のperplexity checkerで直接確認できる。それは、後からスコアに異議を唱えようとするのとは異なる技術の使い方であり、書き手が管理者ではなく最初に数値を見ることができる唯一の場面である。

ZeroGPTの正確性は別途検討されているので、所属機関がそれを使っている場合はそちらを参照されたい。こうした誤りの影響を最も強く受ける集団である非ネイティブの英語話者の書き手については、専用のページがある。

この算術の影響を最も受けやすい集団も、均等に分布しているわけではない。非母語英語話者の執筆者は、これらの割合のいずれかで不利な側に回るという、文書化された最大のリスクを負っており、まさにそれを対象としてTextPulseのESL学術執筆者向けページは構成されている。Turnitinは、モデルを再学習させるたびに、これらの数値を改訂し続けるだろう。変わらないのは算術そのものだ。この程度の小さな率でも、消えてしまうためにはこれほど大きな母集団が必要であり、実際の提出物の大半はそこまで幸運ではない。

XLinkedInFacebook

よくある質問

Turnitinの偽陽性率は、同社自身が公表した数値によれば、単一の数値ではない。文書レベルでは、Turnitinは1%未満の率を示しているが、それはすでに20%以上がAI生成と判定された文書に限られる。文レベルでは、個々の行が強調表示されるが、同社自身の数値は約4%である。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI人間化の最新情報を受け取る

学術ライティング、AI検出、そして人間化に関するヒントを、受信箱へお届けします。

スパムはありません。いつでも配信停止できます。