AI Detection

Was ist Burstiness? Warum gleichförmige Sätze markiert werden

Burstiness misst, wie stark die Satzlängen über einen Textabschnitt schwanken, nicht wie lang der durchschnittliche Satz ist. Dieser Beitrag erklärt, woher der Begriff stammt, wie die Streuung tatsächlich berechnet wird und warum die Ausgabe eines language model dazu neigt, sich in einem engen Bereich von Satzlängen zu bewegen.

6 min
What is burstiness? A chart comparing uniform AI-generated sentence lengths to varied human sentence lengths.

Wenn man einen Absatz laut vorliest, ist eine bestimmte Art von Gleichförmigkeit hörbar, noch bevor sie benennbar ist: Jeder Satz landet ungefähr in derselben Anzahl von Atemzügen, wie ein Metronom, das niemand ausgeschaltet hat. Leserinnen und Leser bemerken das Muster, bevor sie sagen können, was daran falsch ist, und Detektoren, die darauf ausgelegt sind, generierten Text zu erkennen, wurden ebenfalls dafür entworfen, es zu bemerken. Der Name für dieses Muster ist burstiness, ein Wort, das älter ist als jeder AI detector.

Was ist also burstiness, in dem spezifischen Sinn, den ein detector meint? Es ist ein Maß dafür, wie stark die Satzlängen innerhalb eines Abschnitts schwanken, berechnet im Verhältnis zum eigenen Durchschnitt dieses Abschnitts und nicht gegen eine feste Zahl. Ein Absatz ist bursty, wenn kurze, knappe Sätze neben langen, verschachtelten Sätzen stehen. Ein Absatz hat eine geringe burstiness, wenn jeder Satz in etwa dieselbe Länge hat, unabhängig davon, ob diese Länge sechs Wörter oder sechsundzwanzig beträgt.

Die Statistik ist einfach genug, um sie bei einem kurzen Absatz von Hand zu berechnen, und sobald sie sichtbar wird, ist eine flache Seite nicht mehr nur ein vager Eindruck, sondern eine Zahl, auf die man zeigen kann. Sie hat außerdem fast nichts mit einer älteren, nicht verwandten Statistik zu tun, die zufällig denselben Namen trägt.

Was ist burstiness?

Ein AI detector wird als bursty bezeichnet, wenn es über ein Dokument hinweg Variabilität in der Satzlänge gibt. Burstiness, wie ein AI detector das Wort verwendet, ist die Streuung der Satzlängen über ein Dokument, ausgedrückt als eine einzelne Zahl: die Standardabweichung dieser Längen geteilt durch ihren Mittelwert. Eine hohe Zahl bedeutet, dass die Sätze stark um den Durchschnitt herum variieren. Eine niedrige Zahl bedeutet, dass sie eng um ihn gruppiert sind, unabhängig davon, wie dieser Durchschnitt ausfällt.

Das Wort selbst gehört zu einem viel älteren statistischen Vokabular. Forschende verwenden burstiness, um Erdbeben, Krankheitsausbrüche und Netzwerkverkehr zu beschreiben, also alles, was sich zeitlich bündelt, statt sich gleichmäßig zu verteilen, und eine gängige Methode, es in diesen Bereichen zu messen, ist der Fano factor, das Verhältnis der Varianz einer Zählung zu ihrem Mittelwert.

Es gibt auch eine zweite, ältere Bedeutung innerhalb der natürlichen Sprachverarbeitung selbst, die leicht mit der in diesem Beitrag behandelten Statistik der Satzlänge verwechselt werden kann. Korpuslinguisten verwendeten in den 1990er Jahren burstiness, um zu beschreiben, wie sich einzelne Wörter clustern: Sobald ein Dokument ein seltenes Wort erwähnt, wird es viel wahrscheinlicher, dass es dieses Wort erneut erwähnt, als es ein erstes, unabhängiges Auftreten vermuten ließe. Kenneth Church und William Gale gaben diesem Muster 1995 in Poisson-Mischungen seine statistische Behandlung, und Informationsabrufsysteme passen weiterhin darauf an, wie stark ein wiederholtes Wort gewichtet werden sollte. Diese Statistik erfasst die Wiederholung eines einzelnen Wortes. Die Messung in diesem Beitrag erfasst etwas anderes: die Form ganzer Sätze, unabhängig davon, welche Wörter sie füllen.

Der Rest dieses Beitrags verwendet das Wort nur in diesem zweiten Sinn: Satzform, nicht Wortwiederholung.

Warum die Streuung wichtiger ist als der Durchschnitt

Zwei Dokumente können genau dieselbe durchschnittliche Satzlänge haben und sich dennoch überhaupt nicht gleich lesen. Ein Durchschnitt von zwölf Wörtern kann zu einem Absatz gehören, in dem jeder Satz nahe bei zwölf Wörtern liegt, oder zu einem, in dem sich Sätze mit sechs Wörtern und Sätze mit achtzehn Wörtern abwechseln, und der Mittelwert kann diese beiden Absätze nicht unterscheiden. Nur die Streuung um den Mittelwert kann das.

Statistiker würden den Vergleich nur über den Mittelwert als ein Versäumnis bezeichnen, über den ersten Moment einer Verteilung hinauszusehen. Ein Detektor oder eine sorgfältige Leserin prüft implizit auch den zweiten Moment, die Form um das Zentrum, die der Mittelwert allein niemals offenbaren kann.

Betrachten Sie zwei Arten, dasselbe Ergebnis zu berichten. 'The intervention reduced symptoms in most participants. The effect was consistent across age groups. The finding supports further investigation into the mechanism.' Drei Sätze mit jeweils acht bis neun Wörtern ergeben einen Rhythmus mit fast keiner Streuung. Vergleichen Sie nun: 'Symptoms dropped in most participants. That held up whether the person was twenty-two or sixty-eight, which nobody on the team expected going in, and it is the reason the next study needs to look at mechanism rather than outcome alone.' Die Behauptung ist identisch. Der Rhythmus, der sie trägt, ist es nicht.

Der Mittelwert behandelt beide Absätze als identisch. Eine Leserin oder ein Leser, und offenbar auch ein Detektor, tut das nicht.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Wie Burstiness berechnet wird

Die Rechnung ist kurz. Zähle die Wörter in jedem Satz, berechne die Standardabweichung dieser Liste, und teile sie dann durch den Mittelwert. Wenn Sie sich etwa eine Passage mit Sätzen ansehen, die acht, einunddreißig, elf, vierundzwanzig und neun Wörter lang sind, erhalten Sie eine Streuung von rund sechsundfünfzig Prozent des Mittelwerts, also eine starke Burstiness. Wenn Sie sich eine Passage mit Sätzen ansehen, die fünfzehn, sechzehn, vierzehn, siebzehn und fünfzehn Wörter lang sind, erhalten Sie eine Streuung von etwa sieben Prozent, obwohl die beiden Passagen im Durchschnitt fast gleich lang sind.

Eine rohe Standardabweichung für sich allein würde nicht dieselbe Aufgabe erfüllen. Acht Wörter Streuung bedeuten in einer Passage mit durchschnittlich zwölf Wörtern pro Satz etwas anderes als in einer mit durchschnittlich vierzig Wörtern, daher ist die Teilung durch den Mittelwert das, was die Zahl von einer Passage zur nächsten vergleichbar macht.

Diese relative Einordnung ist der Grund, warum die Statistik bei einem knappen Nachrichtenstil und einem dichten theoretischen Stil auf dieselbe Weise funktioniert. Ein technischer Abschnitt, der aus kurzen, gleichförmigen Sätzen besteht, und ein lockerer Absatz, der aus kurzen, gleichförmigen Sätzen besteht, können beide als geringe Burstiness erscheinen, weil die Messung nie fragt, wie lang ein Satz absolut ist, sondern nur, wie weit jeder einzelne vom Durchschnitt seiner Nachbarn entfernt liegt.

Dies ist dieselbe Berechnung, die der free burstiness checker auf dieser Seite auf einen eingefügten Entwurf anwendet, indem er jeden Satz als Punkt darstellt, statt die gesamte Passage zu einer einzigen Zahl zu verdichten. Auf dieser Skala wirkt alles unter ungefähr zwanzig Prozent als enge, gleichförmige Streuung, und alles über ungefähr fünfundvierzig Prozent als weite Streuung, wobei die meisten überarbeiteten akademischen Texte irgendwo dazwischen liegen.

Wie ein Absatz mit geringer Varianz auf der Seite aussieht

Stellt man die beiden Muster nebeneinander, lassen sie sich leicht unterscheiden, sobald man weiß, worauf man achten muss.

MerkmalAbsatz mit geringer VarianzAbsatz mit hoher Varianz
SatzlängenmusterNahezu jeder Satz liegt innerhalb weniger Wörter vom Durchschnitt des Absatzes entferntKurze, knappe Sätze stehen neben langen Sätzen mit mehreren Teilsätzen
Beim VorlesenEin gleichmäßiges, ruhiges Tempo ohne natürliche Stelle für eine BetonungspauseEin Rhythmus, der schneller und langsamer wird und dem tatsächlichen Schwerpunkt folgt
Typische UrsacheUnbearbeitete Ausgabe eines Modells, das jeweils einen wahrscheinlichen nächsten Satz vorhersagt, oder ein erster Entwurf, den niemand laut gegengelesen hatEine Autorin oder ein Autor, die oder der einen Satz aus Wirkungsgründen abbricht, oder zwei knappe Sätze zu einem zusammenführt, der seine Länge rechtfertigt

Keine der beiden Spalten ist für sich genommen gutes Schreiben. Ein Methodenteil, der fünf Schritte in fünf kurzen Sätzen auflistet, soll genau wie die linke Spalte aussehen, und ein langer, verschachtelter Satz in einem nummerierten Verfahren würde ihn nicht verbessern. Das Muster wird erst dann aussagekräftig, wenn klar ist, um welche Art von Textabschnitt es sich handelt.

Warum gleichförmige Sätze markiert werden

Detektoren behandeln einen gleichmäßigen Rhythmus als Signal, weil dies mit der Art und Weise zusammenhängt, wie Textgenerierung funktioniert, nicht weil gleichförmige Sätze für sich genommen verdächtig wären. Die allgemeineren Mechanismen von how AI detectors actually work werden separat behandelt, die Kurzfassung lautet: Ein Modell sagt jeweils ein Token voraus, einschließlich implizit des Moments, in dem ein Satz wahrscheinlich endet. Angesichts des bisherigen Textes ist eine bestimmte Satzlänge in jedem gegebenen Moment statistisch wahrscheinlicher als die übrigen, und ein Modell, das immer die wahrscheinlichste Fortsetzung wählt, landet Satz für Satz im gesamten Dokument immer wieder nahe bei derselben wahrscheinlichen Länge.

Ein einzelner gleichförmiger Absatz beweist für sich genommen nichts, kurze Verfahrensabschnitte sollen genau so aussehen. Was ein Detektor tatsächlich bewertet, ist das Muster über das gesamte Dokument hinweg, also ob die Gleichförmigkeit in einem Absatz eine lokale, absichtliche Entscheidung ist oder der Rhythmus jedes Absatzes im Text.

Wort-für-Wort-Vorhersagbarkeit ist ein verwandtes, aber eigenständiges Maß, das an anderer Stelle auf dieser Website für sich behandelt wird, und es betrachtet einzelne Wortwahlentscheidungen statt die Form eines Satzes.

Nichts davon beweist, dass ein Dokument von einem Modell erzeugt wurde, und einen gleichförmigen Rhythmus für sich allein als entscheidend zu behandeln, würde denselben Fehler wiederholen wie eine einzelne Perplexity-Zahl als entscheidend zu behandeln. Ein hastig verfasster erster Entwurf, den niemand laut gelesen hat, kann ebenso leicht geglättet werden wie generierter Text. Das ist ein Grund dafür, dass TextPulse's eigener geschätzter Human Score die Variation auf Satzebene mit mehreren anderen Signalen kombiniert, statt sich auf eines davon zu stützen, und warum die kostenlosen Diagnosewerkzeuge auf dieser Website so aufgebaut sind, dass sie zusammen und nicht isoliert gelesen werden.

Zwei Anschlussfragen sind wichtiger als die Definition. Ob Detektoren Burstiness noch so gewichten, wie sie es 2023 taten, ist die eine, und wie man sie in eigenen Entwürfen erhöht, ohne die Prosa zu zerstören, ist die andere.

Ein gleichförmiger Absatz ist kein Rätsel, sobald der Mechanismus dahinter sichtbar ist. Es ist das, was geschieht, wenn jeder Satz auf dieselbe Weise aufgebaut wird wie ein einzelnes nächstes Wort, indem nach dem gesucht wird, was als Nächstes mit dem geringsten Widerstand kommt. Ob sich dieser Druck durchsetzt, hängt davon ab, ob der Autor oder das Modell ihm Satz für Satz entgegenwirkt.

Frequently Asked Questions

Was ist Burstiness im Schreiben? Es ist das Ausmaß, in dem die Satzlänge über einen Textabschnitt variiert, gemessen als Standardabweichung der Satzlängen geteilt durch ihren Mittelwert. Ein Textabschnitt mit starken Schwankungen zwischen kurzen und langen Sätzen hat eine hohe Burstiness. Ein Textabschnitt, in dem jeder Satz nahe an derselben Länge liegt, hat eine niedrige Burstiness, unabhängig davon, ob diese Länge kurz oder lang ist.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Was ist Burstiness? Warum gleichförmige Sätze markiert werden | TextPulse.ai