Používají detektory AI stále perplexity a burstiness?
GPTZero proslavil perplexity a burstiness, poté oba pojmy tiše v podzimu 2023 nahradil hlubokým učícím klasifikátorem. Tento text sleduje, co se změnilo, co dnes skutečně dokumentují GPTZero a Turnitin a proč tyto dvě statistiky stále vysvětlují, proč je strojový text zjistitelný, i když je už ani jeden z těchto poskytovatelů přímo nepočítá.
Vyhledávání toho, jak GPTZero dnes detekuje text psaný AI, stále většinou vrací dvě statistiky, perplexity a burstiness, dvojici, která učinila tento nástroj během několika týdnů od jeho spuštění v lednu 2023 známým. Vlastní dokumentace podpory GPTZero nyní uvádí něco jiného, v podzimní části téhož roku přestala používat obě.
Je tedy burstiness stále používána detektory AI? Ne u nástroje, který tento pojem učinil běžně známým v akademickém prostředí. Centrum podpory GPTZero výslovně uvádí, že již nepoužívá perplexity ani burstiness, a místo toho přešlo na architekturu hlubokého učení. Turnitin, nástroj, se kterým se většina studentů ve skutečnosti setkává, nikdy žádný z těchto termínů jako součást své metody vůbec nezveřejnil. Tyto pojmy nezmizely z diskuse. Zmizely z produktů, které skutečně provádějí detekci.
Je burstiness stále používána detektory AI?
Ne, ne u GPTZero, a ne pod tímto názvem. Vlastní dokumentace podpory GPTZero to uvádí přímo: "As of autumn 2023, GPTZero no longer uses perplexity and burstiness for its AI detection because we migrated to a deep-learning based architecture." Vlastní návody Turnitin popisují opět jinou metodu, založenou na bodování částí odevzdané práce pomocí natrénovaného klasifikátoru, a ani jeden z těchto termínů se v této dokumentaci nikde neobjevuje. Dvě statistiky, které vymezily první vlnu detekce AI, nejsou tím, co nyní používají přední nástroje. To je užší tvrzení než říci, že byly odloženy stranou: vlastní vysvětlení GPTZero je stále řadí mezi sedm ukazatelů, které vstupují do jeho modelu. Přestaly být metodou, aniž přestaly být měřením, a rozdíl mezi těmito dvěma tvrzeními je z velké části jádrem této otázky.
Co se změnilo na podzim 2023
Dva pojmy nikdy nebyly nejasné. Vlastní rané vysvětlení GPTZero definovalo perplexity jako „míru toho, jak pravděpodobné by bylo, že model AI zvolí přesně stejnou sadu slov, jaká se nachází v dokumentu“, a burstiness jako „míru toho, jak moc se v celém dokumentu liší vzorce psaní a textové perplexity“, tedy statistiku na úrovni dokumentu, nikoli prostý počet délek vět. Obě definice jsou stále zveřejněny na webu GPTZero. Změnilo se to, který z těchto pojmů detektor skutečně používá.
„Migrated to a deep-learning based architecture“ je konkrétní tvrzení, nikoli marketingová fráze, a popisuje skutečnou změnu druhu. Skóre perplexity se počítá přímo ze vzorce, text se vede přes referenční jazykový model, zprůměrují se logaritmické pravděpodobnosti, výsledek se umocní exponenciální funkcí. Naproti tomu se trénuje klasifikátor založený na deep learning, ukazují se mu velká množství příkladů lidského a AI psaného textu, dokud se sám nenaučí libovolnou kombinaci rysů, která v těch trénovacích datech odděluje obě skupiny. Ve druhém přístupu nikdo pravidlo ručně nepíše. Model ho najde.
Oba vyřazené pojmy jsou jinde na tomto webu vysvětleny podrobně: co perplexity ve skutečnosti měří a co burstiness ve skutečnosti měří samostatně rozebírají jejich vlastní mechanismy do hloubky, včetně vzorců, na nichž jsou založeny. Tento text se úzce omezuje na to, zda je dnes některý z nich stále tím, co detektor používá.
Co GPTZero a Turnitin skutečně dokumentují dnes
Současná stránka technologie GPTZero, která popisuje, co je součástí produktu, uvádí, že jejich detektor je „end-to-end deep learning approach“, s „sentence-by-sentence classification model“, který vytváří pravděpodobnostní výstup se skóre jistoty. Perplexity ani burstiness se na této stránce nikde neobjevují, ani jako součást, ani jako starší funkce, ani v poznámce pod čarou.
Dokumentace Turnitin nikdy nebyla od počátku vystavěna kolem ani jednoho z těchto termínů. Její průvodce popisují odevzdání rozdělené na úseky po několika stovkách slov, přičemž každý úsek je ohodnocen natrénovaným modelem a skóre úseků se zprůměrují do jediného procenta, které zobrazuje zpráva. To je řízený klasifikátor pracující s úseky textu, tedy stejná rodina metody, k níž přešel GPTZero, nikoli výpočet perplexity a nikoli výpočet burstiness pod jiným názvem.
Posun je nejsnáze vidět vedle sebe.
| Co popisovaly rané výklady (2023) | Co popisuje současná dokumentace | |
|---|---|---|
| GPTZero | Perplexity a burstiness, hodnocené vůči referenčnímu modelu | Klasifikátor hlubokého učení po větách, který vrací pravděpodobnost a skóre jistoty |
| Turnitin | Nikdy nebylo zveřejněno, tyto termíny se v materiálech Turnitin v žádném okamžiku neobjevují | Úseky po několika stovkách slov hodnocené natrénovaným klasifikátorem, zprůměrované do jednoho procenta |
Zlidštit vlastní práci
Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.
Proč tyto pojmy stále vysvětlují zjistitelnost
Nic z toho neznamená, že perplexity a burstiness jsou nesprávné, pouze že jsou jako popis současného mechanismu zastaralé. Oba pojmy vždy popisovaly něco skutečného: Text generovaný vzorkováním směrem k nejpravděpodobnějším pokračováním vlastního modelu má tendenci být předvídatelnější, slovo po slově, než text, který člověk píše od nuly, a má tendenci méně se měnit z jedné věty na druhou. Základní pravidelnost se nezměnila jen proto, že dodavatel změnil architekturu svého detektoru. Změnilo se to, jak ji detektor vyhledává.
Trénovaný klasifikátor není výslovně vyzván, aby hledal perplexitu nebo burstiness. Místo toho je trénován na stejném základním rozlišení mezi lidským a strojovým textem, které měly tyto dvě statistiky zachytit. A zdá se vysoce nepravděpodobné, že by klasifikátor trénovaný k rozlišení těchto dvou skupin nezaměřil právě na tuto pravidelnost, jednu z nejspolehlivějších odlišností mezi nimi, také. Jde o závěr o tom, proč klasifikátor pravděpodobně funguje, nikoli o tvrzení o jeho zveřejněném seznamu příznaků, a tyto dvě věci je třeba držet odděleně.
Nezávislý výzkum podporuje myšlenku, že základní statistika má stále význam, a to i mimo produkt jediného dodavatele. DetectGPT, akademická metoda zero-shot publikovaná v roce 2023, se dívá na blízkého příbuzného perplexity, na to, jak strmě se kolem pasáže zakřivuje log-pravděpodobnostní funkce modelu, a dosahuje 0.95 AUROC na jednom benchmarku oproti 0.81 pro nejlepší předchozí zero-shot baseline, aniž by vůbec trénovala klasifikátor na označených příkladech. Jádrová myšlenka, že strojově generovaný text leží ve statisticky odlišné oblasti vlastního pravděpodobnostního prostoru modelu, je stále aktivním předmětem výzkumu. Prostě to není to, co GPTZero dodává uživatelům.
Proč to internet stále tak často chápe špatně
Většina zveřejněných vysvětlení toho, jak funguje detekce AI, byla napsána během spuštění GPTZero v lednu 2023 nebo krátce po něm, kdy byly perplexita a burstiness jediným veřejným rámcem, který sama společnost nabízela. Tyto původní vysvětlující stránky jsou dodnes dostupné. Oznámení o ukončení z podzimu 2023 je na samostatné stránce podpory, nikoli začleněné do nich, takže autor, který si přečetl první stránku a přestal pátrat, by neměl důvod vědět, že se metoda změnila méně než o rok později.
Recenze detektoru třetí strany, která koluje v roce 2026, tvrdí, že GPTZero stále používá perplexity a burstiness jako jednu vrstvu mezi několika v rámci většího systému. Toto tvrzení je v přímém rozporu s aktuální stránkou technologie GPTZero i s jeho vlastní dokumentací podpory a nic na webu GPTZero je nepotvrzuje. Společnost, která popisuje svůj vlastní dodaný produkt, má stále větší váhu než nepotvrzené tvrzení třetí strany o témže produktu, i když dokumentace dodavatele může být také chybná. Tento text se řídí vlastními stránkami GPTZero, nikoli recenzí, která opakuje starší příběh.
Co to znamená pro to, jak píšete
Praktické doporučení založené na burstiness se nestalo zbytečným jen proto, že toto slovo zmizelo z materiálů GPTZero. Záměrné střídání délky vět je stále, z mechanického hlediska, argumentem o vyhýbání se téže statistické uniformitě, kterou je klasifikátor velmi pravděpodobně trénován rozpoznávat, ať už tento signál uvnitř nazývá jakkoli. Základní rada přežila změnu architektury dodavatele, i když slovník, který ji popisuje, nikoli.
Nic z toho nevyžaduje, abyste někomu věřili jen na slovo, včetně tohoto příspěvku. Bezplatný kontrolor perplexity od TextPulse a širší sbírka bezplatných nástrojů vám umožní podívat se, kde se váš vlastní návrh nachází před detektorem, ať už jakékoli generace, ještě než to udělá on.
Pokud vás výsledek vrátí k vlastnímu textu, praktické navazující kroky jsou záměrně zvyšovat burstiness a střídat délku vět v rámci akademického odstavce, což je tatáž úloha popsaná bez metriky.
Mechanismus, který detektor používá, se bude dál měnit, GPTZero jej už jednou změnil. To, co zůstává konstantní, je skutečná otázka, plně rozebraná v průvodci tohoto webu, jak AI detektory skutečně fungují: zda je předvídatelné psaní totéž co strojově psané psaní, bez ohledu na to, který vzorec je v daném roce zrovna módní.
Často kladené otázky
Používá se burstiness stále u detektorů AI? Ne u GPTZero a ne pod tímto názvem. Vlastní podpůrná dokumentace GPTZero uvádí, že přestal používat perplexity a burstiness pro detekci od podzimu 2023, po přechodu na architekturu založenou na hlubokém učení. Turnitin nikdy nepublikoval ani jeden z těchto termínů jako součást své metody a obě společnosti nyní popisují místo toho natrénované klasifikátory.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.