2026年の学術執筆に最適なAI検出ツール: 10ツールの比較
この10個の検出ツールのうち2つは、同じ99.98%という見出しの精度数値を公表している。1つはその数値の背後にいる研究者を示し、偽陽性率をジャンル別に分けている。もう1つは、いかなる試験も示していない。10のツールを4つの軸で配置する, すなわち、誰が購入するのか、何を主張しているのか、その主張の背後にどのような証拠があるのか、そして報告書が実際に何を示しているのか, さらに、採点そのものに取って代わる可能性のあるプロセス追跡モデルも扱う。
ここにある10のツールのうち2つは、同じ見出し数値、99.98% accuracyを公表している。そのうち1つは、その数値の背後にある研究者と大学を明示し、false positive rateをコンテンツのジャンル別に示している。もう1つは、いかなるテスト名も示していない。この対比は、AI detectorsを並べて比較する際に最も有用な点であり、これらの各ページの価格がすべて変わった後でも、なお有用である。
このガイドは、2026年における学術文書作成向けの最良のAI detectors, Turnitin, GPTZero, Copyleaks, Originality.ai, Pangram, Winston AI, ZeroGPT, Scribbr, Sapling, Compilatioを比較する。これらは、学生、研究者、採点者、編集者が最も遭遇しやすい10のツールである。これらは異なる購入者向けに販売され、異なるモデルで価格設定され、異なる内容を返す。正確性だけで比較すると、どのツールに自分の文章が通されるのか、そして通された後に何が起こるのかを決めるほとんどすべてを見落とすことになる。
実際に異なる4つの点
Detectorの宣伝ページは1つの数値に収束し、それ以外のすべてで分岐する。これらの製品を分けるのは4つの問いであり、そのうちホームページ上の割合は1つにすぎない。
- 誰に販売されているか。機関向けにライセンスされ、教員にのみ表示されるツールは、ブラウザで誰でも登録できるツールとは異なる位置にあり、その違いによって、あなたに関する結果を誰が目にするのかが決まる。
- どの数値を公表しているか。ここにある各ベンダーは、単なる割合から、小数点以下4桁まで示した false positive rate まで、何らかの主張を公表している。
- その数値の背後に、名前のあるテストがあるかどうか。これは10の製品を最も明確に分ける軸であり、どのベンダー比較表にも使われていない軸である。
- 実際にレポートが何を返すか。文書全体の割合、文ごとのハイライト、解釈可能性の表示、共有可能なレポートは、いずれも異なる対象であり、1つに基づく非難は、別の1つに基づく非難とは異なる議論である。
3つ目の問いは、じっくり考える価値がある。名のある機関、名のあるデータセット、そしてその背後にある明示された方法を伴う割合は、反論も、再現も、異議申し立ても可能である。何も裏付けのない割合は、信じるか無視するかしかなく、信念は不正行為審問の根拠にはならない。Perplexityは、初期の検出器世代が最も強く依拠した統計的特性であり、十分に測定可能であるため、free perplexity checkerは、自分の文章でそれがどのように見えるかを示してくれる。ただし、以下のどのベンダーも、その判定をperplexityスコアとして報告してはいない。
比較表, それぞれが誰に販売されているか、そして何を主張しているか
| Detector | Sold to | How you get access | Headline claim | Named test behind the claim |
|---|---|---|---|---|
| Turnitin | 認可機関の教育者および管理者 | 機関ライセンスのみ | 20%の閾値を超える文書の偽陽性率は1%未満 | Turnitin独自の検証セット, 外部研究の名称はなし |
| GPTZero | 教師, 学生, 執筆者, 採用担当者, 出版社 | 直接登録, 無料プラン | 99%の精度, 混合文書では96.5% | 第三者ベンチマークである RAID と Penn State との提携を指している |
| Copyleaks | Canvas, Blackboard, Moodle 内の教育および企業向け | 直接登録およびLMSライセンス | 99%以上の精度, 偽陽性率0.03% | 独立したデータが存在する, 以下の2026年のVUB研究 |
| Originality.ai | 執筆者, 編集者, マーケター, エージェンシー, 企業 | 直接登録, クレジット制 | 最新のAIモデルで99%の精度 | 独自の精度研究に加え, 第三者による査読済み研究 |
| Pangram | 大学, 学校, 企業 | 直接登録, 機関向けおよびAPIプラン | 99.98%の精度, 偽陽性率は10,000分の1 | Chicago Booth と University of Maryland の研究者によるものとされる研究 |
| Winston AI | 個人, チーム, ウェブサイト認証の顧客 | 直接登録, クレジット制 | 99.98%の精度, それに到達した唯一の検出器とされる | なし |
| ZeroGPT | 個人, 登録不要の事前チェック | 無料, 15,000文字, アカウント不要 | 内部評価で98%以上 | なし, この数値はベンダー自身のもの |
| Scribbr | 学生, 無料チェッカーとプレミアムプラン | ブラウザで無料 | テスト文の78%を正しく識別 | Scribbr自身が実施したScribbr独自の比較 |
| Sapling | 開発者およびサポートチーム, APIファースト | 直接登録, 公開API, ブラウザ拡張機能 | 文ごとのAI確率 | なし, 独立したレビューは互いに大きく異なる |
| Compilatio | 欧州の機関および学生, とくにフランス語圏のシステムで強い | 機関ライセンス, または4.99 eurosからの学生による直接購入 | 94から99%の信頼性, 偽陽性は1%未満 | 14ツール中2位, Weber-Wulff et al. 2023 |
1行だけが他と異なる振る舞いを示します。Turnitinは評価対象者自身が購入することはできず、提出前にその人自身が実行することもできず、結果は別の相手に返されます。Compilatioは同じように機関によってライセンスされますが、学生にも同じ検査を直接販売しているため、自分の下書きに対して最初に実行できる機関向け検出ツールはこれだけです。ここにある他の検出ツールはすべて、学生、著者、または編集者がその日のうちにブラウザで開き、自分のテキストを指定できる製品です。
精度の主張と、その背後に名前のある試験があるもの
Winston AIとPangramは同じ数値を公表しています。Winstonは、自らを「99.98%の精度率を持つ唯一のAI検出ツール」と述べています。Pangramのホームページには、「AI生成コンテンツを99.98%の精度で検出します。世界中の大学、学校、企業から信頼されています。」とあります。数値は同一です。しかし、その根拠はそれに遠く及びません。
Pangramは出典を明示しています。同社自身のページでは、その統計を、University of ChicagoのBooth School of BusinessとUniversity of Marylandの研究者による比較研究に帰しており、コンテンツのジャンル別の偽陽性の内訳も公表しています。Winstonのページには研究名がありません。99.98%という数値について、データセット、サンプルサイズ、方法のいずれも示されていません。そこにある信頼性の指標はSOC 2とGDPRのバッジ、そして報道ロゴであり、検出性能ではなくセキュリティ体制とメディア露出を示すものです。各主張の詳細な検証は、専用レビューにあります。PangramのレビューとWinston AIのレビューです。
10件の中で最も具体的な数値を公表しているのはTurnitinであり、それらは精度率ではなくエラー率です。20%のしきい値を超える文書レベルの偽陽性率は1%未満、文レベルのエラー発生確率はおよそ4%、そして文書内のAIテキストの15%を見逃す可能性があると明記されていますが、この公表された見逃し率を引用し返す人はほとんどいません。Turnitinの検出ツールの仕組みとその偽陽性率が実務上何を意味するかは別に扱っています。
GPTZeroは99%の精度を公表し、第三者ベンチマークであるRAIDとPenn Stateの研究提携を挙げており、単なる数値よりは一段上だが、引用よりは一段下にある。Originality.aiは最新のAIモデルに対して99%を公表し、自社研究と第三者による査読済み研究を引用している。また、この節全体を支配すべき次の文も公表している。「方法論、ベンチマークデータ、独立した分析または再現可能な分析によって透明に裏づけられていないAI検出器の精度の主張は、懐疑的に見るべきである。」この基準を均等に適用すると、このページ上のすべての数値に同じ問いを向けることになる。99.98%という両方の主張も含まれる。ZeroGPTの数値は、内部評価で98%超とされているが、それについても名指しされた試験はない。the ZeroGPT accuracy reviewは、その数値の出所をたどっている。Scribbrの78%は、少なくともその規模については率直だが、試験自体はScribbr独自のものである。
同じ基準は、私たち自身の数値にも適用しなければならない。TextPulseは、academic AI humanizerについて、Turnitin AIで92.33%、Originality.aiで89.12%、GPTZeroで87.91%という測定済み通過率を公表している。これらはベンダーによる試験から得られたベンダーの数値であり、WinstonやPangramのものとまったく同じである。そして、この市場のどちらの側にあるどのツールも、検出器が特定の文書について何を報告するかを約束することはできない。
学術的執筆のためのAI検出器トップ10
各項目は、同じ4点を扱う。すなわち、エンジンがどのように動作するか、ベンダーが何を主張しているか、独立した証拠が何を示しているか、そして実際に誰がそのツールを使っているかである。各節からリンクされている専用レビューでは、さらに詳しく扱う。
1. Turnitin: 機関向けの標準

TurnitinのAI writing indicatorは、学術的な散文で訓練された深層学習分類器である。提出物を数百語からなる重なり合う区間に分割し、各区間についてモデル生成テキストの統計的パターンを採点し、その結果を教員が見る文書の割合に集約する。長文の散文のみが適格なテキストとして数えられ、箇条書き、引用、参考文献は除外される。
Turnitinは正確率ではなく誤り率を公表している。すなわち、20%のしきい値を超える論文については文書の偽陽性率が1%未満であり、強調表示された任意の単一文についてはおよそ4%の誤り可能性があり、文書内のAIテキストの15%を見逃す可能性があるとされている。2026年のVUB研究は、ベンダー自身の数値よりも厳しかった。Turnitinは、試験用データセットに含まれる40本の完全にAI生成された学位論文のすべてについて、AIを0%と報告した。これは、Turnitin自身の集計によれば、すでに16,000以上の機関がライセンスしている盗用検出のワークフローに組み込まれて出荷されるため、既定のままである。また、スコアを見るのは教員と管理者のみである。さらに、このページで最も撤回が進んだツールでもある。複数の主要大学が偽陽性の懸念からこれを無効化しており、その動向はTurnitinの使用をやめた大学に記録されている。TurnitinがAIを検出する仕組みと類似度とAIスコアの比較が、その仕組みを扱っている。
2. GPTZero: 最大の学生側ブランド

GPTZeroは2023年1月にperplexityおよびburstinessの検出器として公開され、その後、エンジンを多層分類器へと再構築した。スキャンでは、文書の判定、AI、人間、混在に分かれた確率、結果を左右した箇所の文ごとのハイライト、そしてAI語彙リストが返される。ホームページでは99%の精度、1,700万人のユーザー、100万人の教育者を主張している。無料版は1回のスキャンにつき約10,000文字を受け付け、同社は非母語話者の英語作文における誤検出を減らすことを意図したESL調整を公表している。
証拠の面では中位に位置する。第三者ベンチマークであるRAIDとPenn Stateの研究提携を挙げており、単なる主張よりは一段上であるが、VUBの研究では、完全にAI生成された論文に対する中央値スコアは20%未満にとどまり、個々の論文間で大きな変動があった。これは、学生が提出前に自分の下書きを事前確認するために最も頻繁に用いるツールである。GPTZeroの仕組みでは報告レイヤーを層ごとに説明し、GPTZero versus Turnitinでは、なぜ同じテキストに対して両者が異なる判断を下すのかを説明している。
3. Copyleaks: LMS内の検出器

Copyleaksは、AI検出と盗用チェックを1つの企業向け製品として販売しており、Canvas、Blackboard、Moodleに組み込まれている。10製品の中で最も広い言語対応を持ち、ベンダーは言語ごとの検出モデルを備えた30以上の言語を सूचीしている。スキャンでは、ハイライトされた箇所とともに文書の割合が返される。ベンダーは99%以上の精度と0.03%の偽陽性率を主張しており、無料スキャナーは約25,000文字を受け付ける。
独立した記録は、主張の弱い半分である。VUBの研究では、Copyleaksは40本の完全にAI生成された論文のうち1本も完全にAI執筆と判定せず、40本のうちわずか10本しか部分的にも検出せず、100%機械生成の論文に対して報告されたAI比率の中央値を20%未満に保った。一方で、非ネイティブ英語話者による40本の人間執筆論文はすべて通過させており、これは偽陽性に関して同製品を支持する実質的な証拠である。Copyleaksのレビューに全体像がある。
4. Originality.ai: 出版社向けに作られたものであり、教室向けではない

Originality.aiは、フリーランス原稿を選別する出版社、SEO代理店、コンテンツチームにサービスを提供しており、設計上のあらゆる選択はその購入者に由来する。すなわち、100語あたり1クレジットのクレジット制料金、API、Chrome拡張機能、盗用検出と事実確認の追加機能、そして編集者がAI支援テキストの許容範囲を設定できる調整可能なAI許容量スライダーである。同社は、新しい世代の言語モデルごとに検出モデルを再学習させており、最新のものについては99%の精度を主張し、自社研究および第三者による査読済み研究を引用している。
独立した試験ではまずまずの性能を示し、RAIDベンチマークでは商用ツールの中でも最も強力なものの一つである。また、その較正は意図的に厳格であり、過少検出よりも過剰検出を選ぶ。これは出版社にとっては適切なトレードオフであるが、不正行為審査委員会にとっては不適切であり、事前チェックのスコアが大学のツールで後に示される結果と食い違うときに理解すべき最も重要な点である。Originality.ai versus Turnitinがその差を示している。
5. Pangram: 独立研究が一貫して最も支持するもの

Pangramはここで最も新しいツールであり、研究者によって繰り返し検証されているものでもある。その分類器は、偽陽性をゼロに近づけることを特に目的として訓練されており、報告書には、どの語句が判定を導いたかを示す解釈可能性の表示が含まれている。機能は20以上の言語、OCR付きのファイルアップロード、ブラウザ拡張機能、Google Docs統合をカバーし、無料プランでは1日あたり最大2,000語をスキャンできる。ベンダーは99.98%の精度と10,000件に1件の偽陽性率を主張しており、ジャンル別の内訳付きで公表している。
珍しいことに、独立した証拠はマーケティングと同じ方向を示している。2026年のVUB研究では、完全にAI生成された論文に対する中央値スコアが真値に最も近かったのは、試験した4つのツールの中でこれだけであり、ハイブリッド論文や人間化された論文でも最も近く整合していたと示された。Chicago BoothとMarylandの研究者によるNBERワーキングペーパーでは、書き換えられたテキストに対して強さを保ちながら、偽陽性を0.5%以下に抑えた唯一の検出器であると示された。どちらの研究も新しく、範囲は限定的であるが、このページの他のどのツールよりも、現時点でこれほど多くの支持証拠を持つものはない。Pangramのレビューでは、両研究を詳しく検討している。
6. Winston AI: 最大の主張、最小の証拠

Winston AI は、教育者とコンテンツチームを対象としたクレジット制の検出ツールである。機能は実用的で、文ごとのヒートマップ、写真や手書きのページを読み取る OCR、盗用追加機能、Google Classroom 連携を備える。ホームページでは 99.98% の精度と 1,000 万人超のユーザーを主張しているが、この精度の数値は社内試験に基づくものであり、方法、データセット、サンプルサイズのいずれもサイト上のどこにも公開されていない。
最も信頼できる独立した基準点は RAID ベンチマーク, ACL 2024 である。ここでは Winston は 5% の偽陽性率を固定した条件で、AI 生成テキスト全体の 71% を検出した。ChatGPT 型の出力には 99.6% と非常に高い一方、古いモデルやオープンソースモデルにははるかに弱く、言い換えられたテキストでは 52.6% まで低下した。能力はあるが、見出しの数値は誇張されている。Winston AI のレビューでは、この主張を詳しく検討している。
7. ZeroGPT: 無料の事前確認

ZeroGPT は、最もアクセス数の多い無料の事前確認である。アカウントなしで最大 15,000 文字を貼り付けると、DeepAnalyse 技術と称するものから即座に割合と強調表示された文が返される。提供元は社内評価で 98% 超の精度を主張しているが、外部試験は一切示していない。独立比較では一貫して商用分野の下位に位置づけられ、同じテキストでも実行ごとにスコアが変動することがある。大まかな初見としては無害だが、判定としてはこのページで最も擁護しがたいツールである。ZeroGPT の精度レビューは、その主張を出典までたどっている。
8. Scribbr: ライセンス済みエンジンを用いる信頼ブランド

ScribbrのAIチェッカーは、Scribbrのブランド名の下にあるQuillBotの検出エンジンです。結果パネルにはエンジンのバージョンが表示され、Scribbrのaboutページでは両社がLearneoファミリーに属すると示されています。無料版はブラウザ内で約1,200語を、登録なしでスキャンし、AI生成、AI修正、人間作成の3区分で報告します。Scribbr自身の2026年7月の比較では、無料チェッカーはテスト文書の78%を識別し、プレミアム版は84%を識別し、このサンプルでは偽陽性は0でした。
これらは無料版で公表されている最良の数値であり、Scribbrが自ら設計し、実施し、採点したテストに基づいています。そのテストでは、同社の企業上の姉妹会社が首位に並びました。学生がこのチェッカーを信頼するのは、Scribbrの引用ガイドと論文ガイドがその信頼を築いたからであり、検出器はその信頼を引き継いでいます。Scribbrのレビューでは、無料版とプレミアム版が実際に何を測定しているかを扱っています。
9. Sapling: 開発者向けツール

Saplingの検出器は、主な事業がカスタマーサポートチーム向けの執筆支援であるNLP企業に由来しており、それが表れています。すなわち、この समूहで最も利用しやすいAPI、文ごとの確率スコアとperplexity表示、そしてGoogle Docs、Gmail、Zendesk、Salesforce内のテキストをスキャンするブラウザ拡張機能です。無料チェックは2,000文字で上限に達し、有料プランでは上限が100,000に引き上げられます。
その独立した記録は、10件の中で最も不安定である。Scribbrの比較では偽陽性が0で68%であり、2023年のarXivベンチマークではほぼ完全に見逃し、さらに少なくとも1件の実地レビューでは、すべてを偽物として判定した。単一レビューのスコアは、どの検出器についても一般化しにくく、Saplingはその最も明確な例である。Saplingのレビューでは、その理由を検討する。
10. Compilatio: ヨーロッパの制度的対応物

Compilatioは、米国中心の総覧がTurnitinを前提とする場面で、ヨーロッパの機関がライセンスする盗用およびAIのスイートである。フランス語圏の制度で最も強く、AI検出は類似性チェックと同じ教員向けワークフローに統合されており、学生版では同じチェックをクレジット単位で販売している。94から99%の信頼性率と1%未満の偽陽性を主張しており、査読付きテストで上位に入ったここでの唯一のツールはTurnitinのほかにはこれだけで、Weber-Wulffと共同研究者による14件中2位である。EUで学んでいるなら、あなたの論文を読んでいる検出器はこれである可能性が高い。Compilatioのレビューでは、その順位が何を示し、何を示さないのかを扱う。
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
iThenticate: 出版社の机上にある検出器
Turnitin の製品でもう一つ、ここで取り上げるべきものがあります。というのも、多くの研究者はそれを目にすることなく利用するからです。iThenticate は、出版社、学術誌、研究機関向けの Turnitin のスクリーニングツールであり、課題の採点ではなく、出版前の原稿確認のために作られています。その訴求点は、確信を持って出版することです。公開前に、重大な問題を含む可能性のある文書をスクリーニングします。数千の学術誌が Crossref の Similarity Check サービスを通じて投稿原稿をこれで確認しているため、査読付き学術誌に投稿したことがあるなら、誰にも告げられたかどうかにかかわらず、あなたの原稿はおそらく iThenticate を通過しています。

これが上の Turnitin の行と異なる点は二つあります。第一に、コース中心ではなく文書中心であることです。授業も課題もなく、原稿ごとに 1 件のレポートがあります。第二に、Turnitin とは異なり、評価される本人が購入できることです。クレジットはサイト上で直接販売され、文書ごとに価格が設定されているため、著者が自分の原稿に対して、学術誌に提出される前に自ら実行できる Turnitin ファミリーの唯一のツールとなっています。レポートはまず類似性レポートであり、公開済み文献とウェブとの照合を行います。また Turnitin は、対象顧客向けに AI writing detection を備える製品の一つとして iThenticate を挙げています。
学術ライターにとって、その実用的な用途は狭いが現実的である。すなわち、投稿前の最終原稿に対する独自性チェックであり、しかもその論文誌が用いる可能性の高いものと同じ会社のツールによって実施される。しかし、この報告書は何かを修正してくれるわけではない。重複とAIによる執筆の可能性を指摘するだけであり、指摘された文章を修正することは依然としてあなたの仕事である。これは、投稿チェックリストの半分に相当し、academic AI humanizerがそのために作られている。
独立した研究がこのカテゴリについて述べていること
ベンダーの数値は99%前後に集中している。だが、査読付き研究はそうではない。Weber-Wulff と共同研究者は、2023年に International Journal for Educational Integrity で14のシステムを検証し、その中には Turnitin も含まれていた。また Liang と共同研究者は同じ年に Patterns で、英語を母語としない話者による91本の TOEFL エッセイのうち89本、すなわち97.8%が、7つの検出器のうち少なくとも1つによってAIとして判定されたと報告した。さらに18本は7つすべてで判定された。
上記のツールに対する最も直接的な学術的検証は、2026年の VUB 研究である。International Journal for Educational Integrity にオープンアクセスで掲載されたこの研究では、実際の修士論文、4つの商用検出器、そして完全にAI生成された論文に対して4つのうち3つで中央値が20%未満であった。Jabarian と Imas は、NBER working paper w34223 において、2020年以前の人間によるテキスト1,992件と、4つの最先端モデルから得たAIテキスト1,992件からなるコーパスを構築し、Pangram、GPTZero、Originality.ai、およびオープンソースのベースラインを用いて厳密な検証を行った。商用検出器はベースラインを上回り、書き換えられたテキスト全体にわたって強さを保ちながら、偽陽性率を0.5%以下に維持できたのは1つのツールだけであった。オープンソースのベースラインは、人間のテキストの30%から69%をAIとして判定した。これが、上の表に無料の GitHub 検出器が含まれていない理由である。
OpenAIは2023年7月20日に自社のAI Text Classifierを撤回し、「精度が低いため、もはや利用できない」と述べた。Giray, Roe and Espirituは、2026年3月にEnglish Teaching: Practice & Critiqueに掲載された論文で、公平性の問題を明確に示している。「これらのツールは、多言語話者の学生による真正な文章を不均衡に検出し、誤った非難を避けるために逆説的にAIの使用を促す、萎縮効果を生み出す。」この知見の背後にあるパターンは、検出器が非母語の英語文章をどのように扱うかで記録されている。
機関は、偽陽性の実績を受けて対応してきた。Vanderbiltは2023年8月にTurnitinのAI検出器を無効化したが、その理由は、2022年に提出した75,000本の論文に対して1%の偽陽性率は、およそ750本の論文が誤ってラベル付けされることを意味するからであった。Michigan Stateの文書には、AI検出ツールは学生に対する不利益な措置の唯一の根拠であってはならないと記されており、University of Texas at AustinはAI検出ソフトウェアを一切推奨していない。AI検出器が実際にどれほど正確かは、どの製品を機関がライセンスしているかとは別の問題である。
採点を回避するモデル, プロセス追跡
偽陽性の問題に対する別の答えとして、機関の関心を集めているものがある。完成した文章を採点するのをやめ、代わりに文書がどのように書かれたかを記録するという方法である。GrammarlyのAuthorship機能と、評価プラットフォームであるCadmusは、いずれもこの方法で機能し、執筆過程、入力、貼り付け、改訂履歴を、その進行に応じて記録する。プロセス記録は、実際に টাইピングされたエッセイを偽陽性として判定することはできない。これは、まさに大学が検出器を停止した原因となった失敗様式である。トレードオフは異なり、統計の問題は監視の問題に置き換わるが、もしあなたの機関がこれらのいずれかを採用するなら、上記の検出器をめぐる議論は、あなたにとって大部分が無関係になる。証拠は確率スコアではなく、プロセスログである。
渡された検出器のスコアをどう読むか
文脈を伴わない数値は、ほとんど常に現れます。意味のある議論をするには、4つの問いでその文脈のかなりの部分を取り戻せます。
- どのツールか、そしてどの数値か。文書全体の割合と文レベルのハイライトでは、同じベンダーでも公表されている誤り率が異なり、Turnitin の場合はそれぞれ 1% と約 4% です。
- ベンダーが誤りについて何を公表したか。見逃し率と偽陽性率を明示するツールは、その限界がどこにあるかを示しています。正確率の割合だけを公表するツールは、そうではありません。
- そのスコアが証拠なのか、それともきっかけなのか。Michigan State の文言、すなわち、これらのツールは不利益処分の唯一の根拠であってはならないという記述は、一般的な機関方針であり、異議申立てで引用する価値があります。異議申立て書のガイドがその方法を示しています。
- 所属機関の方針が実際に何と述べているか。検出ツールがライセンスされているか、その出力を不正行為手続で使用できるか、学生が何を請求できるかは、どこかに文書化されており、大学ごとに大きく異なります。
Turnitin が humanized text に対して何を行うかは、humanizer の代替手段に関するより広い調査と併せて、別途説明されています。
検出ツールのベンダーは今後も概数を公表し続けるでしょうし、その数値の出所を明かすことを拒み続けるところが大半でしょう。あなたの作業がこの10項目のうちどれに当たるかは、それを読む人が決めます。したがって、有用な準備とは、誰かがあなたに割合を示す前に、そのツールが自社の誤り率について何を公表しているかを知っておくことです。現在の TextPulse の料金は別ページにあり、要約記事ではなくそこで更新されています。
私たち自身の研究でわかったこと
TextPulse Research の検出器一致性研究では、9つの商用AI検出器が同じ90本の学術テキストを評価しました。そのひとつが455語のハイブリッドテキストで、人間が書いた冒頭と結びの間に168語のAI生成部分を挟んだものです。Copyleaks はこのテキストを 0% AI と判定しましたが、同じ文章に対する他のツールの判定は 0% から 95.7% までばらつきました。論文全文、コーパス、ツール別スコア行列は TextPulse Research で公開されています。


よくある質問
いかなるベンダーの主張もそれ自体では決着をつけないが、最新の独立した証拠はPangramを支持している。2026年のVrije Universiteit BrusselによるInternational Journal for Educational Integrityの研究では、完全にAI生成された学術論文に対する中央値スコアが真の値に最も近かった唯一のツールであることが示され、GPTZero、Copyleaks、Turnitinは中央値が20%未満だった。さらに、NBERのワーキングペーパーでは、偽陽性を0.5%以下に抑えた唯一の検出ツールであることが示された。どちらの研究も新しく、範囲は限定的であり、いかなる検出ツールの出力もそれ自体では証拠ではない。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.