GPTZeroとTurnitin: どちらが成績を決めるのか
GPTZeroとTurnitinは、同じ試験の二つの版のように扱われがちである。しかし、そうではない。一方は大学にライセンスされ、実際の提出物に結び付いている。他方は、深夜に自分で実行できる消費者向け製品である。以下では、その違いを示す。
締切前夜の午後11時、学生が自分のエッセイをGPTZeroに貼り付け、数値が40 percentを超えて上昇するのを見ている。そこで不安が生じるが、その数値は、翌朝にファイルを提出した後に大学の実際の提出システムが報告する内容とは何の関係もない。なぜなら、GPTZero vs Turnitinは、同じ試験の2つの版ではなく、2つの異なる購入者向けに作られた製品同士の比較だからである。
Turnitinは、大学が購入し、課題提出ポータルに組み込む製品である。GPTZeroは、誰でも今夜ブラウザで開き、テキストを貼り付け、数秒以内に数値を受け取ることができる製品であり、その機関がこれまでにライセンスを取得したことがあるかどうかは問わない。両者とも、AI生成の文章を検出すると主張している。しかし、どちらも一方が他方を予測することを示す数値は公表していない。
本稿はこの区別に焦点を当てる。各製品が実際には何であるか、採点者が何を見るのか、そして自己実行のスコアが公式のスコアの予告ではない理由である。書き手が検出器の報告内容を変えようとしたときに何が起こるかという、より広い問いについては、AI humanizerツールの比較で、それらの製品がどこで役立ち、どこで役立たないかを扱っている。

GPTZero vs Turnitin: なぜ学生は2つの異なる製品を混同するのか
この混同は理解できる。というのも、学生の頭の中では、両者はたいてい同じ文の中にあるからである, 「the AI checker」。Turnitinは、20年間運用してきた盗用照合のSimilarity Reportに付随するものとして、機関向けにライセンスされ、その機関の管理設定でオンまたはオフにされる。GPTZeroは、誰でも直接使える独立したAI検出ツールとして開始され、その後、盗用チェック、文法修正、その他の独自の文章品質機能を追加し、さらにGPTZero自身の公表数値によれば、3,500以上の大学との機関向けライセンス契約も結んでいる。
この重なりは重要である。GPTZeroは純粋な消費者向け製品ではなく、一部の機関はそれを自らの公式チェックとしてもライセンスしているからである。これに対してTurnitin側は、何年も一貫している。個人が登録して料金を支払い、自分の論文をそのAI Writing Indicatorに通すことを許す公開ページは一度もなく、それを行えるのは機関向けライセンスだけである。あなたが行おうとしている判断にとってこの区別が重要であるなら、Turnitinに直接確認すべきである。
購入者の違いが、その後のすべてを形作る。Turnitinは、提出物に結び付いた一貫した記録を必要とする機関に販売されるため、その出力は、管理者が異議申し立ての際に数か月後でも再度開ける報告書の中に残る。GPTZeroは、次の30秒で答えを欲しがる個人に販売されるため、その出力は、読んで閉じる画面である。どちらの設計も、その購入者にとって誤りではない。重要なのは、2つの数値が異なる圧力の下で生成されているということであり、1人に迅速な答えを与えるよう設計された製品が、懲戒手続きに耐えるよう設計された製品と一致する理由はないということである。
GPTZeroとTurnitinの概観
以下の表は、学生または採点者にとって実際に重要な4つの問い、すなわち、誰が実行できるか、採点者には何が見えるか、何を測定するか、そしていくらかかるか、について両者を並べている。いくつかの欄は意図的に空欄のままである。今回の確認時点では、どちらのベンダーの価格ページも、利用可能なドル額を表示しなかったからである。
| Turnitin | GPTZero | |
|---|---|---|
| 誰が実行できるか | Turnitin のライセンスを持つ機関のみであり、個人の執筆者向けの消費者向け製品は存在しない | 個人であれば誰でも直接登録できる, GPTZero は機関向けにも別途ライセンスを提供している |
| 採点者が見るもの | AI Writing Indicator は Similarity Report の教員用および管理者用表示内に現れる, 学生は既定ではこれを見ない | 学生が共有することを選んだ内容のみである, 自己実行のスコアは, 機関が自らの業務フローのために GPTZero を別途ライセンスしない限り, 教員の表示に自動的に入る経路を持たない |
| 何を測定するか | 適格な散文テキストのうち, AI によって生成された可能性が高い, または AI によって言い換えられた可能性が高いと採点された割合であり, 重なり合う文セグメント全体で平均される | Claude, ChatGPT, GPT-5, Gemini を含む名指しされたモデル全体の AI 生成コンテンツであり, GPTZero 自身の製品説明による |
| 費用 | 公表された個人向け価格はない, 機関に直接販売される | 個人向けの無料層がある, 有料の Professional および Enterprise または Team プランが存在するが, この確認時点では GPTZero の価格ページに使用可能なドル表記の金額は表示されなかった |
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
各スコアが実際に何を測定するか
Turnitin は自社の割合を正確に定義している, すなわち, 「適格なテキスト」のうちの割合であり, これは長文文書における散文文を意味し, そのモデルが AI によって生成された可能性が高い, または AI によって生成された可能性が高く, その後に言い換えツールまたは回避ツールによって修正されたと採点した部分である。文書はおよそ 5 から 10 文の重なり合うセグメントに分割され, 各文は 0 から 1 で採点され, セグメントのスコアが平均されて, 採点者が見る単一の数値になる。提出物は, いかなるスコアも生成される前に, 少なくとも 300 語の適格な散文を必要とする。
GPTZero自身のサイトは、見出しとして「99% Accuracy」の数値を掲げ、その検出器が第三者によるテストで検証されていると説明し、Claude、ChatGPT、GPT-5、Geminiを含む名指しされたモデルの出力を対象としていると述べている。だが、GPTZeroの公開ページには、このレビューで確認できた限りでは、Turnitinが文書化している文レベルの仕組み、すなわち文書がどのように分割され、採点され、その見出しの数値へと平均化されるのかは示されていない。この隔たりは、それ自体を明示しておく価値がある。あるベンダーは監査可能な程度に方法を公開し、別のベンダーは結果だけを公開している。無料のburstiness checkerは、最終的にどの名のツールがファイルを開くかとは独立に、こうした分類器が読み取る傾向のある統計的シグナルの一つについて、自分の下書きがどこに位置するかを少なくとも示してくれる。
誰がスコアを見るのか、そしてそれが実際に採点者に届くのはいつか
Turnitin自身のガイダンスは、そのAI writing detectionの指標とレポートは、既定では学生には表示されないと明確に述べている。教育機関がこの機能を有効化した後、教員はSimilarity Reportビューア内でその割合を見ることができ、学生が自分のスコアを見る唯一の経路は、教員がレポートを手動でダウンロードし、直接共有することである。
GPTZeroのスコアは、既定ではその逆に働く。実行した者は誰でも直ちにそれを見ることができ、それが下書きを確認する学生であれ、教育機関の契約の外で提出物を手動で確認する教員であれ同じである。この非公式性は両方向に作用する。2023年にUC Davisで、ある教授は、学生William Quartermanの作業をGPTZeroに直接通した後、剽窃として不合格にした。これはTurnitin型の制度的なワークフローの完全に外側で行われ、Turnitin自身のAI detectorに関わる別件が公になる数日前のことだった。誰もそれを制度的にライセンスしてはいなかったが、成績に対する権限を持つ人物がそれに直接基づいて行動することを選んだ。実際の成績だった。
前夜のGPTZeroスコアがTurnitinのスコアを予測しない理由
この2つの数値の間には、数学的なつながりは何もありません。学習データが異なり、採点の仕組みが異なり、最小語数が異なり、ファイル処理の規則が異なります。ある一方のスコアは、同じ文書について他方が何を示すかについて、較正された情報を何も与えません。Turnitin自身のガイダンスも、そのツールを単独で見た場合について同じ点を強調しています。すなわち、そのスコアは教育者の判断のためのデータであり、それ自体で不正行為を確定するものではありません。
実務上の差異はさらに重なります。Turnitinは、条件を満たす長文の散文のみを採点し、何らかの結果を返すには300語が必要です。そのため、短い省察文ではスコアは出ませんが、一般向けのチェッカーでは1段落でもパーセンテージが返されます。文書の処理も異なります。本文として何を数えるか、見出し、キャプション、ブロック引用、参考文献項目として何を除外するかは、各ベンダーがそれぞれの基準で決めることであり、どちらも完全には公開していません。両方のツールに同じファイルを与えても、モデルが1語を採点する前に、実際には2つの異なる文書を読んでいるのです。
両方のツールには、文書化された失敗率があります。Turnitinは、すでに20%を超えるAIとしてフラグが付けられた文書について、文書レベルで1%未満の偽陽性率を示し、文レベルでは約4%であると述べています。これらは十分に具体的な数値であり、Vanderbilt Universityが2023年にTurnitinのAI検出機能を停止した際に、その数値を名指しで引用したほどです。
Originality.aiは、Turnitinの隣に置いて検討する価値のある第3の検出器です。そして、その比較には専用のページがあります。検出器ではなくツールとしては、学術執筆に最適なAIヒューマナイザーが別途評価されています。
TextPulseの無料ツールなどを通じて、自分の下書きを同種の統計的シグナルと照合することは、その文章について実際の何かを示します。それでも、採点者の実際のTurnitinレポートが何を示すかは分かりません。なぜなら、その数値は、そもそもあなたが実行するためのものではなかったからです。
よくある質問
いいえ。GPTZeroとTurnitinの比較は、訓練データ、採点の仕組み、最小語数が異なる二つの製品の比較であるため、どちらのスコアも他方を予測しない。締切前夜に学生自身が行うGPTZeroの確認は、翌日に大学のTurnitin統合提出システムが示す結果と、較正された関係を持たない。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.