AI Detection

Co je burstiness? Proč jsou jednotné věty označovány

Burstiness měří, jak široce se délky vět v textu rozptylují, nikoli jak dlouhá je průměrná věta. Tento příspěvek vysvětluje, odkud tento termín pochází, jak se rozptyl skutečně vypočítává a proč výstup jazykového modelu má tendenci ustalovat se v úzkém pásmu délek.

6 min
What is burstiness? A chart comparing uniform AI-generated sentence lengths to varied human sentence lengths.

Přečtěte odstavec nahlas a určitý druh plošnosti je slyšitelný dříve, než jej lze pojmenovat: každá věta dopadá přibližně po stejném počtu nádechů, jako metronom, který nikdo nezapnul. Čtenáři si vzorce všimnou dříve, než dokážou říci, co je na něm špatně, a detektory vytvořené k zachycení generovaného textu byly navrženy tak, aby si ho všímaly také. Název pro tento vzorec je burstiness, slovo starší než jakýkoli detektor AI.

Co je tedy burstiness, v konkrétním smyslu, v jakém jej chápe detektor? Je to míra toho, jak výrazně se délky vět v rámci úseku textu mění, počítaná vzhledem k průměru tohoto úseku, nikoli vůči nějakému pevnému číslu. Odstavec má vysokou burstiness, když krátké, úsečné věty stojí vedle dlouhých, rozvláčných. Odstavec má nízkou burstiness, když každá věta vychází blízko stejné délky, ať už je tato délka šest slov, nebo dvacet šest.

Tuto statistiku lze na krátkém odstavci spočítat ručně poměrně snadno, a jakmile je viditelná, plochá stránka přestává být vágním dojmem a stává se číslem, na které lze ukázat. Také má téměř nic společného se starší, nesouvisející statistikou, která jen náhodou sdílí její název.

Co je burstiness?

Detektor AI se označuje jako bursty, pokud v dokumentu existuje variabilita délky vět. Burstiness, jak toto slovo používá detektor AI, je rozptyl délek vět v dokumentu, vyjádřený jediným číslem, směrodatnou odchylkou těchto délek dělenou jejich průměrem. Vysoké číslo znamená, že se věty kolem průměru výrazně liší. Nízké číslo znamená, že se těsně shlukují kolem něj, bez ohledu na to, jaký tento průměr právě je.

Samotné slovo patří do mnohem staršího statistického slovníku. Výzkumníci používají burstiness k popisu zemětřesení, epidemií a síťového provozu, tedy čehokoli, co se shlukuje v čase místo toho, aby se rovnoměrně rozprostíralo, a jedním běžným způsobem, jak to v těchto oborech měřit, je Fano factor, poměr rozptylu počtu k jeho průměru.

Existuje také druhý, starší význam uvnitř samotného zpracování přirozeného jazyka, který lze snadno zaměnit se statistikou délky vět, o níž je tento příspěvek. Korpusoví lingvisté v 1990 používali burstiness k popisu toho, jak se jednotlivá slova shlukují: jakmile dokument zmíní neobvyklé slovo, je mnohem pravděpodobnější, že je zmíní znovu, než by naznačoval první, nezávislý výskyt. Kenneth Church a William Gale tomuto vzorci dali statistické zpracování v Poissonových směsích v 1995 a systémy pro vyhledávání informací se s ním stále vyrovnávají při vážení toho, jak moc by se opakované slovo mělo započítat. Tato statistika sleduje opakování jednoho slova. Měření v tomto příspěvku sleduje něco jiného, tvar celých vět, nezávisle na tom, která slova je vyplňují.

Zbytek tohoto příspěvku používá toto slovo pouze v tom druhém smyslu, tvar vět, nikoli opakování slov.

Proč je rozptyl důležitější než průměr

Dva dokumenty mohou mít přesně stejnou průměrnou délku vět a přitom se číst zcela odlišně. Průměr dvanáct slov může patřit odstavci, v němž má každá věta zhruba dvanáct slov, nebo takovému, kde se šestislovné věty střídají s osmnáctislovnými, a průměr tyto dva odstavce nerozliší. To dokáže pouze rozptyl kolem průměru.

Statistici by takové srovnání založené jen na průměru označili za selhání, protože se nepodívá za první moment rozdělení. Detektor, nebo pečlivý čtenář, implicitně kontroluje i druhý moment, tedy tvar kolem středu, který samotný průměr nikdy nemůže odhalit.

Zvažte dva způsoby, jak podat stejný výsledek. 'Intervence snížila příznaky u většiny účastníků. Účinek byl konzistentní napříč věkovými skupinami. Zjištění podporuje další zkoumání mechanismu.' Tři věty, každá o osmi až devíti slovech, tvoří rytmus s téměř žádným rozptylem. Nyní porovnejte: 'Příznaky ustoupily u většiny účastníků. To platilo bez ohledu na to, zda bylo dané osobě dvaadvacet nebo osmašedesát, což nikdo v týmu při zahájení nečekal, a právě proto se další studie musí zaměřit na mechanismus, nikoli jen na výsledek.' Tvrzení je totožné. Rytmus, který je nese, nikoli.

Průměr zachází s oběma odstavci jako s totožnými. Čtenář, a zjevně i detektor, nikoli.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Jak se vypočítává burstiness

Výpočet je krátký. Spočítejte slova v každé větě, vezměte směrodatnou odchylku tohoto seznamu a pak ji vydělte průměrem. Pokud se například podíváte na pasáž s větami o osmi, jednatřiceti, jedenácti, čtyřiadvaceti a devíti slovech, dostanete rozptyl přibližně padesáti šesti procent průměru, tedy široký burst. Pokud se podíváte na pasáž s větami o patnácti, šestnácti, čtrnácti, sedmnácti a patnácti slovech, dostanete rozptyl asi sedmi procent, i když obě pasáže mají téměř stejnou průměrnou délku.

Samotná surová směrodatná odchylka by stejnou práci neodvedla. Rozptyl osmi slov znamená něco jiného v pasáži s průměrem dvanáct slov na větu než v pasáži s průměrem čtyřicet, takže právě dělení průměrem činí číslo srovnatelným z jedné pasáže na druhou.

Právě toto relativní rámování je důvodem, proč statistika funguje stejně pro stručný novinářský styl i pro hutný teoretický styl. Technická část tvořená krátkými, jednotnými větami a neformální odstavec tvořený krátkými, jednotnými větami mohou obě vykazovat nízkou burstiness, protože měření se nikdy neptá, jak dlouhá je věta v absolutních termínech, ale pouze o kolik se každá z nich odchyluje od průměru svých sousedů.

Toto je tatáž výpočetní metoda, kterou na tomto webu používá free burstiness checker k analýze vloženého návrhu, přičemž každou větu zobrazuje jako bod, místo aby celý úsek stlačil do jediné hodnoty. Na této škále cokoli pod zhruba dvaceti procenty působí jako těsný, jednotný rozptyl a cokoli nad zhruba pětačtyřiceti procenty působí jako široký, přičemž většina upravené akademické prózy se pohybuje někde mezi tím.

Jak vypadá odstavec s nízkou variancí na stránce

Postavte tyto dva vzorce vedle sebe a po chvíli je snadné je odlišit, jakmile víte, na co se dívat.

VlastnostOdstavec s nízkou variabilitouOdstavec s vysokou variabilitou
Vzorec délky větTéměř každá věta se pohybuje v rozmezí několika slov od průměru odstavceKrátké, úsečné věty stojí vedle dlouhých, vícesouvětých vět
Čtení nahlasStálé, rovnoměrné tempo bez přirozeného místa pro pauzu kvůli důrazuRytmus, který zrychluje a zpomaluje, podle toho, kam skutečně dopadá důraz
Typická příčinaNeupravený výstup z modelu, který předpovídá vždy jednu pravděpodobnou následující větu, nebo první verze, kterou nikdo nečetl nahlas zpětAutor, který větu zkrátí pro účinek, nebo spojí dvě slabé věty do jedné, která si svou délkou zaslouží existovat

Žádný z těchto sloupců sám o sobě nepředstavuje dobré psaní. Metodická část, která uvádí pět kroků v pěti krátkých větách, má vypadat jako levý sloupec, a dlouhá, rozvláčná věta vložená do číslovaného postupu by ji nezlepšila. Vzorec se stává informativním teprve tehdy, když víte, o jaký typ pasáže jde.

Proč jsou jednotné věty označovány

Detektory považují plochý rytmus za signál kvůli tomu, jak funguje generování textu, ne proto, že by jednotné věty samy o sobě byly podezřelé. Širší mechanismy jak AI detektory ve skutečnosti fungují jsou popsány samostatně, stručně řečeno, model předpovídá vždy jeden token po druhém, včetně toho, kdy věta pravděpodobně skončí. Vzhledem k dosavadnímu textu je v daném okamžiku statisticky pravděpodobnější určitá délka věty než ostatní a model, který stále volí nejpravděpodobnější pokračování, se opakovaně dostává k téže pravděpodobné délce, větu za větou, napříč celým dokumentem.

Jeden plochý odstavec sám o sobě nic nedokazuje, krátké procedurální úseky tak mají vypadat. To, co detektor skutečně vyhodnocuje, je vzorec napříč celým dokumentem, tedy zda je plochost v jednom odstavci místní, záměrnou volbou, nebo rytmem každého odstavce v textu.

Předvídatelnost slovo od slova je související, ale samostatné měření, které je jinde na tomto webu rozebráno samostatně, a sleduje jednotlivé volby slov spíše než tvar věty.

Nic z toho neprokazuje, že dokument byl vygenerován modelem, a považovat plochý rytmus za rozhodující samo o sobě by opakovalo stejnou chybu jako považovat jediné číslo perplexity za rozhodující. Urychlený první návrh, který nikdo nečetl nahlas, se může zploštit stejně snadno jako generovaný text. To je jeden z důvodů, proč TextPulse's vlastní odhadované Human Score kombinuje variaci na úrovni vět s několika dalšími signály, místo aby se opíral o kterýkoli z nich samostatně, a proč jsou bezplatné diagnostické nástroje na tomto webu navrženy tak, aby se četly společně, nikoli izolovaně.

Důležitější než definice jsou dvě navazující otázky. Zda detektory stále váží burstiness stejně jako v roce 2023 je jedna z nich a jak ji zvýšit ve vlastních návrzích bez zničení stylu je druhá.

Plochý odstavec není záhadou, jakmile je viditelný mechanismus, který za ním stojí. Je to to, co se děje, když je každá věta sestavována stejným způsobem jako jediné další slovo, totiž tím, že se sahá po tom, co následuje, s nejmenším odporem. Zda tato tlaková síla zvítězí, závisí na tom, zda se jí autor, nebo model, staví proti ní větu po větě.

Frequently Asked Questions

Co je burstiness v psaní? Je to míra toho, o kolik se délka vět v textu mění, měřená jako směrodatná odchylka délek vět dělená jejich průměrem. Text s velkými výkyvy mezi krátkými a dlouhými větami má vysoký burstiness. Text, v němž má každá věta délku blízkou stejné hodnotě, má nízký burstiness, ať je tato délka krátká nebo dlouhá.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Co je burstiness? Proč jsou jednotné věty označovány | TextPulse.ai