ZeroGPTは正確か?
ZeroGPT自身のFAQは、内部テストで98パーセントに迫る率を主張し、別途、定型的な文章は誰が書いたかにかかわらずAIとして読まれうると認めている。ここでは、同社が方法について何を述べているか、この製品そのものに対する独立したテストで何が見つかっているか、そして無料のスコアが実際に何に役立つのかを示す。
ZeroGPTの精度は、同社自身の現時点の主張によれば、「社内評価で98%超に向かっている」率であり、この数値は外部の研究機関ではなく、同社が自社で実施した試験に由来することを同社も認めている。この単一の条件付き表現である「社内」は、無料の検出器の百分率を確定した事実として扱う前に、読者が知るべきほとんどすべてである。
ZeroGPTは、最も広く使われている無料のAI検出器の一つであるが、その主な理由は、費用がかからず、数秒で結果を返すからである。AI検出器全般に見られる、ベンダーの主張と独立した検証との間の隔たりは、ここでも同様に見られる。以下では、同社が現在自社の精度と方法について何を述べているか、その方法が実際には何を測定しているように見えるか、そしてこの種のツールが、学術的な読者が提出するような文章に対して、なぜ特定の予測可能な形で誤作動しやすいのかを示す。

会社によれば、ZeroGPTの精度とは何か
ZeroGPTのFAQには、同社が「業界をリードする精度を提供し、継続的に改善されて最高水準の性能を維持しており、社内評価で98%超に向かっている」と記されている。これは、同社自身の製品について、同社自身が試験したベンダーの主張であり、文言そのものに実際の留保が組み込まれている。「向かっている」という表現は、その数値に到達し維持しているというのと同じ意味ではなく、「社内評価」とは、外部の第三者が同等の数値を公表していないことを意味する。ページ上には、その社内テストの規模、含まれていた内容、あるいは同社外の誰が方法論を検証したのかは示されていない。
同社は、安定した結果のために少なくとも150から200語のテキストを推奨し、500から1,000語以上で信頼性がさらに向上すると述べ、非常に短い、または大幅に編集された断片は「より少ないシグナルを持つ」と直接明言している。この単一の開示は、見出しの割合よりも重要である。これは、スコアの信頼性が入力の長さと未変更性に依存するにすぎないという、ベンダー自身の認めであり、実際の提出物が常に満たすとは限らない条件である。
ZeroGPTは実際にどのような方法を用いているのか?
ZeroGPTは、その基盤システムをDeepAnalyseと呼び、自社サイトでは「精度を最適化しつつ、偽陽性と偽陰性を最小化するよう設計された多段階の方法論」と説明し、テキストを「マクロレベルからミクロレベルへ」と読むとしている。そのFAQは、ブランド名の下にあるより具体的な内容として、「混合データセットで訓練されたトークンパターン、バースト性、エントロピー、およびアンサンブル分類器の特徴」の分析を説明している。
バースト性とエントロピーはZeroGPTに固有のものではない。それらは同じ統計的特性であり、文の長さとリズムがどの程度変化するか、そして次の語がどの程度予測可能かを示すものであり、TextPulseのAI検出器の仕組みに関する解説でも、この種のツール全体の一般的な機構として扱われている。無料のperplexityチェッカーは、その同じ基礎的な数値を、著者にまずいずれか一社の割合を信頼させることなく、直接示す。
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
なぜ学術文書はこれらの検出器を誤作動させるのか?
ZeroGPTのFAQはこれを次のように述べている。「高度に洗練され、定型的で、あるいは低エントロピーの文章はAIに似て見えることがある。」学術的散文は、高度に洗練され、定型的で、低エントロピーの文章のために設計されている。方法の節、先行研究のレビュー、正式なカバーレターはいずれも、独創的な表現よりも慣用的な表現を評価する。なぜなら、慣用こそが文書を読者にとって利用可能にする第一条件だからであり、その慣用こそが、ベンダー自身の開示がリスクとして名指しする低エントロピーのパターンなのである。
独立した査読付きの試験は、この失敗モードが、ある書き手には他の書き手よりも強く現れる理由を示している。2023年のStanfordの研究では、ZeroGPTを含む広く使われている7つの検出器を、英語を母語としない話者が書いた91本の実際のTOEFLエッセイと、米国の8年生が書いた88本のエッセイに対して実行した。ZeroGPTはTOEFLエッセイの48パーセントをAI生成と判定し、8年生のエッセイは0パーセントだった。この研究で示された各検出器の誤判定の方向は同じであり、ただ規模が異なるだけだった。
この差がZeroGPTに固有でないことは明らかであり、また新しい情報でもない。これは検出器業界全体で記録されてきた非ネイティブ書き手への偏りと同じパターンであり、TextPulseのAI検出器が非ネイティブ話者に対して偏っている理由に関する独自ページでより詳しく扱っている。無料の消費者向けツールについてこの差が具体的に示すのは、ベンダー自身が開示している制限、すなわち低エントロピーの文章は機械生成のように読まれるという点が、仮説ではないということである。査読付きの試験は、会社の現在のFAQがその仕組みを同社自身の言葉で述べる何年も前に、このまさにその製品でそれが起きていることを確認した。
無料の検出器のスコアは、1つの文書について何かを証明できるのか?
それ単独ではできない。ZeroGPTのパーセンテージは、どちらの方向においても、特定の文書について何かを証明するものではない。それは1つのモデルによる推定であり、会社が公表していない社内試験に基づいているため、会社の外部の誰も検証できない形では示されていない。また、長さ、編集履歴、ジャンルによって読み取りが変わる文章に適用されるが、その点はベンダー自身のFAQでもすでに認められている。単一の無料スコアを判定として扱うことは、そのスコアに対して、そのスコアを発行した会社が主張する以上のことを求めるものである。
スコアが本当に有用なのは、より狭く、より日常的な用途である。すなわち、原稿が現時点でどこに位置しているかを、同種の統計的測定に基づいて、費用をかけずに素早く把握することである。この測定は、有料の機関向けツールも同様に実行するものであり、他の誰かが目にする前に確認できる。TextPulseの無料ツールは、同じ領域を直接カバーし、複数の無料検出器のスコアのうち、どれを最初に信頼すべきかを執筆者に推測させることはない。
正確性の数値は、誤りが誰に及ぶのか、そして何がそれを引き起こすのかを隠してしまう。a, an and the をいつ使うかを知ることは、フラグを引き起こす一つのパターンを取り除くことになる。また、偽陽性が実際には何を意味するのかは別に説明されている。
これらのことは、ZeroGPTの数値を無意味にはしないし、その数値だけで十分だということにもならない。スコアは出発点となる推定値であり、同社が概要しか示しておらず、外部の検証に開放していない方法によって生成されるものである。そして、その結果は、ジャンルだけで結果が変わりうる文章に対して、関係者の誰も何も誤ったことをしていない段階で出される。あのFAQページで最も多くの情報を担っている二つの語は、百分率ではない。それは、そのすぐ隣に置かれた留保表現である, internal, and pushing toward. 無料のスコアは、原稿についての対話の出発点であって、その対話の結論ではない。
私たち自身の研究でわかったこと
TextPulse Research の検出器一致性研究では、9つの商用AI検出器が同じ90本の学術テキストを評価しました。そのひとつが455語のハイブリッドテキストで、人間が書いた冒頭と結びの間に168語のAI生成部分を挟んだものです。ZeroGPT はこのテキストを 7.6% AI と判定しましたが、同じ文章に対する他のツールの判定は 0% から 95.7% までばらつきました。論文全文、コーパス、ツール別スコア行列は TextPulse Research で公開されています。

よくある質問
ZeroGPTの精度は、同社自身の現在の主張によれば、「内部評価で98%超に迫る」水準に達する。この数値は、外部の研究機関ではなく、同社が自社製品に対して行ったテストに由来するものであり、ベンダー自身のFAQは別途、非常に洗練された文章や定型的な文章は、誰が書いたかにかかわらずAI生成として読まれうると述べている。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.