AI Detection

Verlassen KI-Detektoren sich noch auf Perplexity und Burstiness?

GPTZero machte Perplexity und Burstiness berühmt und stellte beide im Herbst 2023 stillschweigend auf einen Deep-Learning-Klassifikator um. Dieser Beitrag zeichnet nach, was sich geändert hat, was GPTZero und Turnitin heute tatsächlich dokumentieren, und warum die beiden Statistiken weiterhin erklären, weshalb maschineller Text erkennbar ist, obwohl keiner der beiden Anbieter sie direkt noch berechnet.

Zuletzt aktualisiert am 5 min
Is burstiness still used by AI detectors? GPTZero's 2023 shift from a statistical formula to a trained classifier.

Suche heute danach, wie GPTZero KI-Text erkennt, und das meiste, was zurückkommt, kreist weiterhin um zwei Statistiken, perplexity und burstiness, das Paar, das das Tool innerhalb weniger Wochen nach seinem Start im Januar 2023 berühmt machte. Die eigene Support-Dokumentation von GPTZero sagt inzwischen etwas anderes: Im Herbst desselben Jahres hörte das Tool auf, beide zu verwenden.

Wird burstiness also noch von KI-Detektoren verwendet? Nicht von dem Tool, das den Begriff in akademischen Kreisen zu einem geläufigen Wort machte. Das Support-Center von GPTZero erklärt ausdrücklich, dass es weder perplexity noch burstiness weiterhin verwendet, sondern stattdessen zu einer Deep-Learning-Architektur übergegangen ist. Turnitin, das Tool, dem die meisten Studierenden tatsächlich begegnen, hat beide Begriffe von Anfang an nie als Teil seiner Methode veröffentlicht. Die Konzepte sind nicht aus der Diskussion verschwunden. Sie sind aus den Produkten verschwunden, die tatsächlich erkennen.

Wird burstiness noch von KI-Detektoren verwendet?

Nein, nicht von GPTZero, und nicht unter diesem Namen. Die eigene Support-Dokumentation von GPTZero sagt es direkt: "As of autumn 2023, GPTZero no longer uses perplexity and burstiness for its AI detection because we migrated to a deep-learning based architecture." Die eigenen Leitfäden von Turnitin beschreiben wiederum eine andere Methode, die darauf beruht, Abschnitte einer Einreichung mit einem trainierten Klassifikator zu bewerten, und auch dort erscheint keiner der beiden Begriffe in der Dokumentation. Die beiden Statistiken, die die erste Welle der KI-Erkennung definierten, sind nicht das, was die führenden Tools derzeit einsetzen. Das ist enger gefasst, als zu sagen, sie seien verworfen worden: Die eigene Erklärung von GPTZero zählt sie weiterhin zu sieben Indikatoren, die in das Modell einfließen. Sie hörten auf, die Methode zu sein, ohne aufzuhören, eine Messgröße zu sein, und der Unterschied zwischen diesen beiden Aussagen ist der Kern dieser Frage.

Was sich im Herbst 2023 änderte

Die beiden Begriffe waren nie unklar. GPTZero's eigener früher Erklärtext definierte perplexity als "a measure of how likely an AI model would have chosen the exact same set of words as found in the document," und burstiness als "a measure of how much writing patterns and text perplexities vary over the entire document," eine Statistik auf Dokumentebene, nicht eine einfache Zählung der Satzlänge. Beide Definitionen sind weiterhin auf GPTZero's Website veröffentlicht. Was sich geändert hat, ist, welche von ihnen der Detektor tatsächlich ausführt.

"Migrated to a deep-learning based architecture" ist eine konkrete Behauptung, keine Marketingformel, und sie beschreibt eine reale Veränderung der Art. Ein perplexity-Wert wird direkt aus einer Formel berechnet: den Text durch ein Referenzsprachmodell laufen lassen, die Log-Wahrscheinlichkeiten mitteln, das Ergebnis exponentieren. Stattdessen wird ein Deep-Learning-Klassifikator trainiert, dem große Mengen menschlicher und von AI geschriebener Beispiele gezeigt werden, bis er selbstständig jene Kombination von Merkmalen lernt, die die beiden Haufen in diesen Trainingsdaten trennt. Niemand schreibt die Regel im zweiten Ansatz von Hand. Das Modell findet sie.

Beide ausgemusterten Begriffe werden an anderer Stelle auf dieser Website ausführlich erklärt: was perplexity tatsächlich misst und was burstiness tatsächlich misst behandeln jeweils ihre eigene Funktionsweise im Detail, einschließlich der zugrunde liegenden Formeln. Dieser Beitrag bleibt eng bei der Frage, ob eines von beiden heute noch das ist, was ein Detektor ausführt.

Was GPTZero und Turnitin heute tatsächlich dokumentieren

Die aktuelle GPTZero technology page, die beschreibt, was im Produkt ausgeliefert wird, erklärt, dass das Unternehmen "an end-to-end deep learning approach, trained on text datasets from the web, education, and AI-generated from a range of LLMs" einsetzt, wobei "a sentence-by-sentence classification model determines the probability and confidence that a text was created by AI". Perplexity und burstiness erscheinen auf dieser Seite nirgends, weder als Bestandteil noch als Altfunktion, nicht einmal in einer Fußnote.

Turnitins Dokumentation war von Anfang an weder um den einen noch um den anderen Begriff herum aufgebaut. In ihren Leitfäden wird eine Einreichung beschrieben, die in Abschnitte von jeweils einigen hundert Wörtern aufgeteilt wird, wobei jeder Abschnitt von einem trainierten Modell bewertet wird und die Abschnittswerte zu dem einzelnen Prozentsatz gemittelt werden, den ein Bericht anzeigt. Das ist ein überwachter Klassifikator, der auf Textsegmenten arbeitet, also dieselbe Methodenfamilie, zu der GPTZero übergegangen ist, und keine Perplexitätsberechnung und keine Burstiness-Berechnung unter anderem Namen.

Die Verschiebung lässt sich am einfachsten nebeneinander erkennen.

Was frühe Erklärungen beschrieben (2023)Was die aktuelle Dokumentation beschreibt
GPTZeroPerplexity und Burstiness, bewertet gegen ein ReferenzmodellEin Deep-Learning-Klassifikator auf Satzebene, der eine Wahrscheinlichkeit und einen Konfidenzwert ausgibt
TurnitinNie veröffentlicht, die Begriffe erscheinen in Turnitins eigenen Materialien zu keinem ZeitpunktAbschnitte von einigen hundert Wörtern, bewertet von einem trainierten Klassifikator, gemittelt zu einem Prozentwert

Ihre eigene Arbeit humanisieren

Verwandeln Sie Ihren KI-gestützten Text und lassen Sie ihn menschlich klingen, ohne wichtige Wörter oder Zitate anzutasten.

Kostenlos starten

Warum die Konzepte die Erkennbarkeit weiterhin erklären

Nichts davon macht Perplexity und Burstiness falsch, nur als Beschreibung des aktuellen Mechanismus veraltet. Beide Konzepte beschrieben immer etwas Reales: Text, der durch Sampling in Richtung der wahrscheinlichsten Fortsetzungen eines Modells erzeugt wird, ist Wort für Wort tendenziell vorhersagbarer als Text, den ein Mensch von Grund auf schreibt, und er variiert von einem Satz zum nächsten tendenziell weniger. Die zugrunde liegende Regelmäßigkeit hat sich nicht geändert, nur weil ein Anbieter die Architektur seines Detektors geändert hat. Geändert hat sich, wie der Detektor danach sucht.

Der trainierte Klassifikator wird nicht ausdrücklich aufgefordert, nach Perplexität oder Burstiness zu suchen. Vielmehr wird er auf genau denselben grundlegenden Unterschied zwischen menschlichem und maschinellem Text trainiert, den diese beiden Statistiken erfassen sollten. Und es erscheint höchst unwahrscheinlich, dass ein Klassifikator, der darauf trainiert ist, die beiden Haufen zu unterscheiden, nicht ebenfalls genau diese Regelmäßigkeit, eine der zuverlässigsten Differenzen zwischen den beiden, aufgreifen würde. Dies ist eine Schlussfolgerung darüber, warum der Klassifikator wahrscheinlich funktioniert, keine Behauptung über seine veröffentlichte Merkmalsliste, und beides sollte getrennt bleiben.

Unabhängige Forschung stützt die Annahme, dass die zugrunde liegende Statistik weiterhin wirksam ist, auch außerhalb eines einzelnen Anbieterprodukts. DetectGPT, ein akademisches Zero-Shot-Verfahren, das 2023 veröffentlicht wurde, betrachtet einen engen Verwandten der Perplexität, nämlich wie stark die Log-Wahrscheinlichkeitsfunktion eines Modells um eine Passage herum gekrümmt ist, und erreicht 0.95 AUROC auf einem Benchmark gegenüber 0.81 für die beste frühere Zero-Shot-Baseline, ohne überhaupt einen Klassifikator auf gelabelten Beispielen zu trainieren. Die Kernidee, dass maschinell erzeugter Text in einer statistisch unterscheidbaren Region des eigenen Wahrscheinlichkeitsraums eines Modells liegt, ist weiterhin Gegenstand aktiver Forschung. Sie ist lediglich nicht das, was GPTZero an Nutzer ausliefert.

Warum so viel im Internet das immer noch falsch versteht

Die meisten veröffentlichten Erklärungen dazu, wie KI-Erkennung funktioniert, wurden während oder kurz nach dem Start von GPTZero im Januar 2023 verfasst, als Perplexität und Burstiness die einzige öffentliche Rahmung waren, die das Unternehmen selbst anbot. Diese ursprünglichen Erklärseiten sind heute noch online. Der Hinweis auf die Einstellung im Herbst 2023 steht auf einer separaten Support-Seite, statt in diese Seiten eingearbeitet zu sein, sodass ein Autor, der die erste Seite las und die Recherche beendete, keinen Grund hätte zu wissen, dass sich die Methode weniger als ein Jahr später geändert hat.

Ein im Jahr 2026 kursierender Testbericht eines Drittanbieters behauptet, GPTZero verwende Perplexität und Burstiness weiterhin als eine Ebene unter mehreren innerhalb eines größeren Systems. Diese Behauptung steht in direktem Widerspruch zur aktuellen eigenen Technologieseite von GPTZero und zur eigenen Support-Dokumentation, und nichts auf der eigenen Website von GPTZero bestätigt sie. Die Beschreibung des eigenen ausgelieferten Produkts durch ein Unternehmen hat weiterhin Vorrang vor einer unbestätigten Behauptung eines Drittanbieters über dasselbe Produkt, auch wenn die Dokumentation des Anbieters ebenfalls falsch sein kann. Dieser Beitrag folgt den eigenen Seiten von GPTZero und nicht dem Testbericht, der die ältere Darstellung wiederholt.

Was Das Für Ihr Schreiben Bedeutet

Die praktische Anleitung, die auf Burstiness aufbaut, ist nicht allein deshalb nutzlos geworden, weil das Wort aus den eigenen Materialien von GPTZero verschwunden ist. Satzlängen absichtlich zu variieren ist weiterhin, mechanisch betrachtet, ein Argument dafür, dieselbe statistische Gleichförmigkeit zu vermeiden, die ein Klassifikator sehr wahrscheinlich darauf trainiert ist zu erkennen, wie auch immer er dieses Signal intern nennt. Der zugrunde liegende Rat hat die Architekturänderung des Anbieters überlebt, auch wenn das Vokabular, mit dem er beschrieben wird, dies nicht tat.

Nichts davon erfordert, jemandem einfach zu glauben, auch nicht diesem Beitrag. Der kostenlose Perplexity-Checker von TextPulse und die umfassendere Sammlung kostenloser Tools ermöglichen es Ihnen, zu prüfen, wo Ihr eigener Entwurf steht, bevor ein Detektor, welcher Generation auch immer, dies tut.

Wenn die Antwort Sie zu Ihrem eigenen Schreiben zurückführt, sind die praktischen nächsten Schritte Burstiness gezielt zu erhöhen und die Satzlänge innerhalb eines akademischen Absatzes zu variieren, was dieselbe Aufgabe ist, nur ohne die Metrik beschrieben.

Der Mechanismus, den ein Detektor ausführt, wird sich weiter verändern, GPTZero hat ihn bereits einmal verändert. Konstant bleibt die eigentliche Frage, die in der vollständigen Anleitung dazu, wie AI-Detektoren tatsächlich funktionieren dieser Website behandelt wird: ob vorhersehbares Schreiben dasselbe ist wie maschinell verfasstes Schreiben, unabhängig davon, welche Formel in einem bestimmten Jahr gerade in Mode ist.

XLinkedInFacebook

Häufig gestellte Fragen

Wird Burstiness noch von KI-Detektoren verwendet? Nicht von GPTZero, und nicht unter diesem Namen. Die eigene Support-Dokumentation von GPTZero erklärt, dass das Unternehmen Perplexity und Burstiness seit Herbst 2023 nicht mehr für die Erkennung verwendet, nachdem es auf eine Deep-Learning-basierte Architektur umgestellt hat. Turnitin hat nie einen der beiden Begriffe als Teil seiner Methode veröffentlicht, und beide Unternehmen beschreiben inzwischen trainierte Klassifikatoren.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Bleiben Sie über AI-Humanisierung auf dem Laufenden

Erhalten Sie Tipps zu akademischem Schreiben, AI-Erkennung und Humanisierung direkt in Ihren Posteingang.

Kein Spam. Jederzeit abbestellbar.