TurnitinはChatGPTを検出できるか, 何を捉え, 何を見逃すか
TurnitinのAI執筆レポートと剽窃レポートは異なる製品であり, 対象とする利用者も精度の記録も異なる。ここでは, AIスコアが実際に何を測定するのか, 独立した検証でどこに限界が示されたのか, そしてなぜあなたのレポートがルームメイトのものと同じにならないのかを示す。
はい、ただし特定の種類のAI利用に限られ、しかもほとんどの学生が目にしない報告書の中でです。TurnitinのAI writing indicatorは、統計的に見て言語モデルに典型的な文章を検出し、スキャンしたエッセイのうち増加しつつある割合に対してそれを行います。2025年10月から2026年2月の間に、約15%が80%以上のAI生成文章を示し、これはこのツールが2023年4月に開始された当初の約3%から増加しています。あなたの特定の提出物にそれが付くかどうかは、can Turnitin detect ChatGPTに対する多くの回答が飛ばしてしまう細部, つまりAI reportがplagiarism reportとどう異なるか、実際にその数値を誰が表示されるのか、そしてその数値がどのくらいの頻度で誤っているのかに左右されます。
この投稿は、一般的な学術的誠実性ではなく、その一つの製品の仕組みを扱います。AI writing reportが何を測定するのか、独立した検証で何が正しく、何が誤っていると分かったのか、そして同じ課題を提出した二人の学生が、通う大学によって異なる結果を受ける可能性があるのはなぜかを示します。これらはいずれも、受講科目のハンドブックがAI利用の許容範囲について述べている内容を変えるものではありません。ブラックボックスについての推測を、その内部に実際に何があるのかという説明に置き換えるものです。
Can Turnitin Detect ChatGPT? レポートが実際に示すもの
TurnitinのAI writing reportは、plagiarismを確認するsimilarity reportとは別の製品です。両者は異なるモデルで動作し、同じインターフェース内の異なるタブに表示されます。similarity scoreは提出物を見て、既に公開された資料や他の学生の論文のデータベースと比較し、一致する割合を返します。AI scoreは全く別のことを行います。これは文章を文ごとに読み、各文がAI-generatedである可能性を割り当て、その文単位のスコアを文書全体の単一の割合にまとめる分類器です。測定しているものが異なるため、提出物はsimilarity scoreが2%でAI scoreが60%になることも、その逆になることもあります。
この割合は、実際には見た目よりも狭い範囲を示している。これは、モデルがAIによって書かれたと予測した適格な散文の割合であり、文書全体ではない。というのも、スコアを算出する際に、コードブロック、箇条書き、見出し、短文の文章などは除外されるからである。この検出機能を適用できるのは、少なくとも300語の長文散文を含む文書に限られ、執筆時点では英語、スペイン語、日本語のテキストのみが対象である。予想されるように、AI検出器がそのスコアをどのように算出するかを一般論として見ると、ここでの傾向はおなじみである。見た目には正確そうな文書レベルの数値が、見出しの数値が示唆するよりも狭い範囲のテキストから作られているのである。
AIとして表示されるもの, ChatGPTとその他
Turnitinは、自社の分類器がブランド名ではなく書字パターンを探すと述べており、2023年の最初のGPT-3.5およびGPT-4の公開以来、その対象範囲は繰り返し拡大してきた。現在のガイダンスでは、GPT-5シリーズ、Gemini、Claudeが、学習対象としているシステムの中に挙げられており、新しいモデルの公開は継続的に追加されている。これには、ChatGPTに一切触れていないテキストも含まれる。代わりにGemini、Claude、DeepSeekを使った学生が、単に別の会社を選んだからといって検出器を回避していることにはならない。Turnitin自身のモデル説明は、どのベンダーがそのテキストを生成したかではなく、そのテキストがどのように読まれるかだけに基づいていることを明確にしている。
言い換えられたAIテキストは、無条件に見逃されるのではなく、独自のカテゴリとして扱われる。Turnitinの文書では、AI生成と判断したテキストのみと、AI生成と判断したうえでさらにAIによって言い換えられたテキストとを区別しており、2025年8月には、機械生成の出力を検出器をすり抜けるように書き換えるために作られたAI回避ツールを特に対象とする検出機能を追加した。これは、言い換えが無意味であるとか、書き換えられたすべての箇所が検出されるという意味ではない。意味するのは、言い換えはデフォルトではTurnitinに見えないという前提が、すでにかなり前から時代遅れになっているということである。
TurnitinのAIスコアはどの程度正確か?
Turnitinの正確性に関する主張は、1つの主要な数値に集約される。すなわち、テキストの20%を超える部分がフラグ付けされた文書において、偽陽性率を1%未満に維持していると同社は述べている。また同社は、この正確性を検証するために、ChatGPTが存在する以前に書かれた700,000本の学術論文を用いて、自社モデルの各新バージョンをテストしているとも述べている。これは、特定の条件下に関する具体的で検証可能な主張である。そのままの意味で読む価値がある。Turnitinは、立ち上げ直後の2023年にも、正確性について他の主張を行っている。同社の最高製品責任者は、実験室でのテストでは実運用でどれほど多くの偽陽性が現れるかは予測できなかったと公に認め、とりわけ短い提出物では、偽陽性の割合がテスト時よりも実環境で高かったと述べた。同氏は、文レベルの偽陽性率を約4%と報告し、その結果として、Turnitinが採点可能な提出物の最小長を150語から300語へ引き上げたと指摘した。現在の最小長もなお300語である。
独立したテストは、ベンダーの数値だけでは分からない詳細を加える。Temple University's Center for the Advancement of Teachingは、AI検出器の独立テストが実験室条件と実際の提出物との間にある隔たりを繰り返し示してきたのと同じ趣旨で、利用可能なものの中でもより慎重な検証の1つを実施した。研究者は120件の執筆サンプルを提出し、それらを完全な人間による執筆、完全なAI生成文、パラフレーズツールを通したAI生成文、人間とAIの寄与を組み合わせたハイブリッド文書に均等に分け、Turnitinが各サンプルに対して返した結果を記録した。このツールは、純粋な人間によるサンプルの93%、純粋なAI生成サンプルの77%を正しく識別した。
より難しい質問では、精度はさらに低下した。Turnitinは、言い換えられたAIサンプルのうちAI生成と正しく識別したのはわずか63%であり、ハイブリッドサンプルのうち完全に人間でも完全にAIでもないものとして正しく識別したのは43%にすぎなかった。これらは、AIを用いた文章が実際にどのように作成されるかに最も近いカテゴリである。とりわけハイブリッドテキストは研究者の関心を引いた。というのも、今後はより多くの授業で、作業の一部にAIを使うよう学生に求める課題が出されるため、実際の提出物の大きな部分、おそらくは過半数を占めるようになると彼らは考えているからである。
| 何が検証されたか | Turnitinの結果 |
|---|---|
| 100%人間が執筆したサンプル | 93%が人間として正しく識別された |
| 100% AI生成のサンプル | 77%がAIとして正しく識別された |
| 言い換えツールを通したAIテキスト | 63%がAIとして正しく識別された |
| 人間とAIが一部ずつ書いたハイブリッドサンプル | 43%が0%でも100%でもないものとして正しく識別された |
| 20%を超えてフラグが付いた文書, Turnitin自身の数値 | 1%未満の偽陽性率 |
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
数値は正しく見えても、そこで破綻する場合
文書全体のスコアだけが教員に見えるものではなく、別の表示のほうは信頼性が低い。いくつかのインターフェースでは、教員がフラグ報告を開き、特定の文をAIが書いた可能性が高いものとして強調表示できる。Templeの研究者は、その強調表示を、自分たちのハイブリッドサンプルのどの文が実際にAIによって書かれていたかと照合したが、両者の間に関連は見いだせなかった。これは、教授が要約パーセンテージではなく、強調表示された段落のスクリーンショットを送ってきた場合に重要である。文書全体のスコアは、文レベルの強調表示よりもかなり良好に機能したからである。
低いスコアの扱いは、以前よりもさらに異なり、より慎重である。2024年7月以降、Turnitinは、モデルが文書の20%未満をAI生成と推定した場合、数値の代わりにアスタリスクを表示している。これは、その範囲が、ツールがいずれの方向にも誤りやすい領域だからである。軽いAI支援の編集、つまり1つの段落だけが支援を受けて書き換えられ、残りは支援なしで書かれた場合、しばしば小さな割合ではなく、可視の割合がまったく表示されない。したがって、数値がないことを何らかの証拠として扱う前に、その点を知っておく価値がある。
誰が実際にその数値を見るのか
AIスコアは、既定では学生向けレポートの一部ではない。それは独立したタブにあり、教員と管理者にのみ表示され、学生がそれを見るのは、教員がレポートを共有するか、直接提示することを選んだ場合に限られる。これは類似度スコアとは実質的に異なる構造である。類似度スコアは、提出物が処理された後、通常は学生自身が同じシステム内で確認できる。
同じことは、特定の授業でそもそもこの機能が存在するかどうかにも当てはまる。これは教員を超えた、機関レベルの判断である。アカウントレベルの管理者は、TurnitinのAI検出を組織全体で有効にも無効にもできる。大学がそれを無効にしていれば、ある講師は有効化できないことがあり、その逆もある。ある大学の学生が、別の大学の別の学生と似た課題を提出しても、どちらが何を書いたかとは無関係な理由により、このツールの体験は大きく異なりうる。
なぜ一部の大学はそれを無効にしたのか
Waterloo大学は2025年9月にTurnitinのAI検出機能を停止したが、その公表された理由は異例なほど率直である。同大学は、このツールの信頼性が文書化された形で低いこと、第一言語が英語ではない学生に対する偏り、そして少なくとも1件、完全に人間が書いた文章が100% AI-generatedと判定された事例を含む独自の内部テストを挙げた。ツールの費用と比較した結果、同大学は費用が便益を上回ると結論づけ、代わりに評価設計の見直しとAIリテラシー研修へと取り組みを振り向けた。
Waterlooは例外というより、より広い分岐を示す一つの目に見える例である。この機能を有効のままにしている大学は、一般にスコアをそれ自体で結論とみなすのではなく、保護措置を追加している。すなわち、正式な手続きが始まる前に学生と対話することを求め、数値を、その対話を終わらせる理由ではなく始める理由として扱っている。大学がAI方針をどのように扱っているかをより広く読むと、この傾向はより明確になる。スコアが実際に示されるかどうかは、技術そのものの固定的な性質ではなく、あなたのゼミ室よりはるか上位で下された判断に依存している。
高いスコアが証明することと、証明しないこと
高いAIスコアは証拠であって、結論ではない。Turnitin自体も、この割合を不正行為の認定ではなく、教員の判断のための一つのデータ点として位置づけている。上の正確性の数値が、その位置づけが重要である理由を示している。文書全体のスコアであっても、かなり良好に機能する場合でさえ、大幅に編集された文章、言い換えられた文章、あるいは混成的な文章のかなりの部分を誤って読み取るのであり、文単位のハイライトは要約数値よりも著しく信頼性が低い。とはいえ、個々のスコアが誤りであることが保証されるわけではない。つまり、ある割合が示されても、それは見た瞬間に受け入れるべき認定ではなく、問いを立てる理由である。自分の文章が他者による判定の前にどの位置にあるかを見たいなら、分類器が反応しやすい、変化の少ない一般的な表現のパターンは、free perplexity checkerで直接確認できる。
TextPulseの学生向けAIヒューマナイザーは、同じ統計的基盤の上で機能し、同じ測定の文のリズム側に対応する無料のburstinessチェッカーも同様です。これは、Turnitinがそれについて何を言うかを予測するのではなく、あなた自身の下書きに基づく推定Human Scoreを示します。いかなるツールも、制御していないシステムについてそのようなことを責任を持って約束することはできません。これは、自分の文章をもう一度読むための第二の見方として扱うべきであり、それ以上ではありません。
これらの質問のいくつかには、それぞれ独自のページがあります。検出器を一切使わずに教授があなたがChatGPTを使ったと見抜けるかどうか、そしてそれをより直接的に言い換えた見つかるかについては、別々に答えています。言い換えられたテキストに対するTurnitinの挙動や、特にTurnitinがDeepSeekの出力を検出するかどうかも同様です。特定の状況については、看護学プログラムにおけるAI検出や、大学入学審査部門がこれらのチェックを行うかどうかを扱う記事があります。より広い枠組みは、学術的誠実性とAIに関する別の記事にあります。
これらのどれも、最終版になる可能性は低いです。Turnitinは2023年以降、しきい値、可視性ルール、モデルの対象範囲を何度も書き換えており、2026年8月が最後の言葉になるわけでもありません。変わらないのは、どの検出器をその授業が使うかにかかわらず持つ価値のある習慣です。分類器が何を考えようと問題にならないほど、十分に具体的で、不均一で、真に自分のものだと分かる細部を伴って書くことです。
Frequently Asked Questions
TurnitinのAI執筆インジケーターは, まさにこの問いに答えるために存在する。TurnitinはChatGPTを検出できるか。通常はできる, 文書に substantial なAI執筆が含まれている場合には, 分類器は言語モデルとして統計的に典型的に見える散文を指摘し, Turnitin自身のデータでは, 現在スキャンされたエッセイの約15%が強くAIで書かれたものとして判定されている。また, テキストを見逃すことも頻繁にあり, 独立した検証では, 言い換えられたAI執筆では精度が63%に, ハイブリッドテキストでは43%に低下したことが示されている。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.