バースト性とは何か。なぜ均一な文が検出されるのか
バースト性は、平均文長がどれほど長いかではなく、文章全体で文長がどれほど広く変動するかを測定する。この投稿では、この用語の由来、ばらつきが実際にどのように計算されるか、そして言語モデルの出力がなぜ文長の狭い範囲に収まりやすいのかを説明する。
段落を声に出して読むと、ある種の平板さは、名前を付けられる前にすでに聞き取れる。すべての文が、おおむね同じ数の呼吸で着地するのであり、まるで誰も止め忘れたメトロノームのようである。読者は、何がまずいのかを言葉にする前にそのパターンに気づき、生成されたテキストを検出するために作られた検出器もまた、それに気づくよう設計されている。そのパターンの名称が burstiness であり、この語はどの AI detector よりも古い。
では、AI detector が意味する特定の意味での burstiness とは何か。それは、文の長さが一つの文章全体でどれほど大きく揺れ動くかを示す尺度であり、固定された数値と比べるのではなく、その文章自身の平均に対して算出される。短く切れた文が長くうねる文の隣に並ぶとき、その段落は bursty である。どの文も同じ長さに近いところへ収まるとき、その長さが6語であっても26語であっても、その段落は low burstiness である。
この統計量は、短い段落であれば手計算でも十分に求められるほど単純であり、一度それが見えるようになると、平板なページは漠然とした印象ではなく、指し示すことのできる数値になる。また、この統計量は、たまたま同じ名称を共有しているだけの、より古く無関係な統計量とはほとんど関係がない。
burstiness とは何か?
AI detector は、文の長さに文書全体を通じた変動があるとき、bursty と呼ばれる。AI detector がこの語を用いる意味での burstiness とは、文書全体にわたる文の長さのばらつきであり、一つの数値として表される。すなわち、それらの長さの標準偏差を平均で割ったものである。数値が高いほど、文は平均の周囲で大きく変動する。数値が低いほど、その平均が何であれ、文はその周囲に密に集まる。
この語自体は、はるかに古い統計学の語彙に属する。研究者は burstiness を用いて、地震、感染症の流行、ネットワークトラフィックなど、時間的に均等に広がるのではなく、ある時点に集中して起こるあらゆる現象を記述する。その分野でこれを測る一般的な方法の一つが Fano factor であり、これはある個数の分散をその平均で割った比である。
自然言語処理そのものの内部には、もう一つ、より古い意味もあり、この投稿が扱う文長の統計量と混同しやすい。1990年代のコーパス言語学者は burstiness を、個々の語がどのように集中的に現れるかを表すために用いた。ある文書が珍しい語を一度言及すると、その語を再び言及する可能性は、初回の独立した出現から予想されるよりもはるかに高くなる。Kenneth Church と William Gale は 1995年に Poisson mixtures においてこのパターンを統計的に扱い、情報検索システムも、反復された語をどの程度重く数えるべきかを重み付けする際に、今でもこれを調整している。この統計量は一つの語の反復を追跡する。この記事で扱う測定は別のものを追跡する。すなわち、どの語が埋めるかに依存しない、文全体の形である。
この記事の残りでは、この語をその第二の意味、すなわち語の再出現ではなく文の形という意味でのみ用いる。
なぜ平均よりもばらつきが重要なのか
二つの文書は、平均文長がまったく同じでも、読み味は全く異なりうる。平均が12語であっても、すべての文がほぼ12語前後で進む段落に属することもあれば、6語の文と18語の文が交互に現れる段落に属することもある。平均値だけでは、その二つの段落を区別できない。区別できるのは、平均の周囲にあるばらつきだけである。
統計学者なら、平均だけを比べることは、分布の第一モーメントの先を見ていない失敗だと言うだろう。検出器も、あるいは注意深い読者も、暗黙のうちに第二モーメントも確認している。すなわち、中心の周囲の形であり、平均だけでは決して明らかにできないものである。
同じ結果を報告する二つの方法を考えてみよう。「介入は大半の参加者で症状を軽減した。効果は年齢層を通じて一貫していた。この知見は、機序についてのさらなる検討を支持する。」三つの文はいずれも8語から9語であり、ばらつきはほとんどないリズムである。これに対して次を比べてみよう。「大半の参加者で症状は減少した。それは、その人が22歳であっても68歳であっても成り立った。これは、チームの誰も事前には予想していなかったことであり、次の研究が結果だけでなく機序を見なければならない理由である。」主張は同一である。しかし、それを運ぶリズムは同じではない。
平均値は、両方の段落を同一のものとして扱う。読者は、そしてどうやら検出器も、そうは扱わない。
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
バースト性の計算方法
計算は簡単である。各文の語数を数え、その一覧の標準偏差を取り、次にそれを平均値で割る。たとえば、八語、三十一語、十一語、二十四語、九語の文から成る一節を見れば、平均値のおよそ五十六パーセントのばらつき、すなわち大きなバーストが得られる。十五語、十六語、十四語、十七語、十五語の文から成る一節を見れば、二つの一節の平均の長さがほぼ同じであっても、約七パーセントのばらつきが得られる。
標準偏差をそのまま用いるだけでは、同じ役割は果たせない。平均が一文あたり十二語の一節における八語のばらつきは、平均が四十語の一節における八語のばらつきとは意味が異なるため、平均値で割ることによって初めて、その数値は一つの一節から次の一節へ比較可能になる。
この相対的な枠組みがあるからこそ、この統計量は、簡潔なニュース文体にも、密度の高い理論的文体にも同じように機能する。短く均一な文から成る技術的な節と、短く均一な文から成るくだけた段落は、どちらも低いバースト性として示されうる。というのも、この測定は、文の長さを絶対値で問うことはなく、各文が隣接する文の平均からどれだけ離れているかだけを問うからである。
これは、このサイトの無料バースト性チェッカーが貼り付けられた下書きに対して行うのと同一の計算であり、全文を一つの数値に圧縮するのではなく、各文を点として図示する。この尺度では、およそ二十パーセント未満は引き締まった均一なばらつきとして読まれ、およそ四十五パーセントを超えるものは大きなばらつきとして読まれ、編集された学術的文章の大半はその中間のどこかに位置する。
低分散の段落が紙面上でどのように見えるか
二つのパターンを並べてみれば、何に注目すべきかが分かっていれば、両者を見分けるのは容易である。
| 特徴 | 低分散の段落 | 高分散の段落 |
|---|---|---|
| 文の長さのパターン | ほぼすべての文が、その段落の平均から数語以内に収まっている | 短く切れた文が、長く複数節からなる文と並んでいる |
| 音読したとき | 強調のために自然に間を置く場所がない、一定で均一なリズム | 強調が実際に置かれる箇所に応じて、速くなったり遅くなったりするリズム |
| 典型的な原因 | モデルが一度に次の1文だけを予測して生成した未編集の出力、または誰も音読して確認していない初稿 | 効果を狙って文を短く切る書き手、または2つの薄い文を、その長さに見合う1文へまとめる書き手 |
どちらの列も、本質的に良い文章というわけではない。方法の節で5つの手順を5つの短い文で列挙するなら、それは左の列のように見えるはずであり、番号付きの手順の中に長く回りくどい文が入っていても、それは改善にはならない。このパターンが情報を持つようになるのは、どの種類の文章を見ているのかが分かってからである。
なぜ均一な文が検出対象になるのか
検出器が平坦なリズムを信号として扱うのは、文生成の仕組みによるのであって、均一な文それ自体が本質的に疑わしいからではない。AI detectorsが実際にどのように機能するかというより広い仕組みは別に扱っているが、簡単に言えば、モデルは1トークンずつ予測し、その際、暗黙のうちに文が終わりそうなタイミングも予測している。ここまでのテキストが与えられると、その時点で統計的に最も起こりやすい文の長さは他よりもいくぶん高くなり、最も確率の高い継続を選び続けるモデルは、文ごとに、文書全体を通して、その同じ起こりやすい長さの近くに何度も着地し続ける。
1つの平坦な段落だけでは、それ自体では何も証明しない。短い手順的な節は、そのように見えることが想定されている。検出器が実際に重み付けしているのは文書全体にわたるパターンであり、1つの段落における平坦さが局所的で意図的な選択なのか、それともその文章全体の各段落に共通するリズムなのかという点である。
語ごとの予測可能性は、関連はあるが別個の測定であり、このサイトの別の箇所でそれ自体として扱っている。これは文の形ではなく、個々の語の選択に注目する。
これらのいずれも、文書がモデルによって生成されたことを証明するものではない。また、平坦なリズムをそれ自体で निर्ण定的とみなすことは、単一の perplexity 数値を決定的とみなすのと同じ誤りを繰り返すことになる。誰にも音読されていない急いで書かれた初稿は、生成テキストと同じくらい容易に平坦になりうる。TextPulse の独自の推定 Human Score が、文レベルの変化と他のいくつかのシグナルを組み合わせ、いずれか一つに依拠していないのはそのためであり、このサイトの無料診断ツールが、個別にではなく相互に関連づけて読むよう設計されているのもそのためである。
定義よりも重要なのは、次の二つの追問である。検出器が今も 2023 年当時と同じように burstiness に重みを置いているかどうかが一つであり、自分の下書きでそれをどのように高めるかがもう一つである。ただし、文章を損なわないことが前提である。
平坦な段落は、その背後の仕組みが見えれば謎ではない。それは、すべての文が単一の次の語と同じように組み立てられ、最も抵抗の少ないものを求めて次に来るものへ手を伸ばすときに起こることである。その圧力が勝つかどうかは、書き手、あるいはモデルが、文ごとにそれに抗うかどうかにかかっている。
Frequently Asked Questions
文章におけるバースト性とは何か。それは、文章全体で文長がどれだけ変動するかを示すもので、文長の標準偏差を平均で割って測定する。短い文と長い文の間で大きく揺れる文章は、バースト性が高い。各文の長さがほぼ同じに近い文章は、その長さが短くても長くても、バースト性が低い。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.