Что такое burstiness? Почему однообразные предложения помечаются
Burstiness измеряет, насколько сильно длина предложений колеблется в тексте, а не то, насколько длинным в среднем является предложение. В этой статье объясняется, откуда происходит этот термин, как именно вычисляется разброс и почему вывод language model обычно сводится к узкому диапазону длин.
Прочитайте абзац вслух, и определённая степень монотонности становится слышна ещё до того, как её можно назвать: каждое предложение завершается примерно после одинакового числа вдохов, как метроном, который никто не выключил. Читатели замечают этот рисунок раньше, чем могут сказать, что именно в нём не так, и детекторы, созданные для выявления сгенерированного текста, были спроектированы, чтобы замечать его тоже. Название этого рисунка, burstiness, слово, которое старше любого детектора AI.
Так что же такое burstiness, в том конкретном смысле, который имеет в виду детектор? Это мера того, насколько сильно длина предложений колеблется в пределах фрагмента текста, вычисляемая относительно собственного среднего этого фрагмента, а не по отношению к какому-либо фиксированному числу. Абзац обладает высокой burstiness, когда короткие, сжатые предложения стоят рядом с длинными, извилистыми. Абзац обладает низкой burstiness, когда каждое предложение оказывается близко к одной и той же длине, будь то шесть слов или двадцать шесть.
Эту статистику достаточно просто вычислить вручную на коротком абзаце, и, как только она становится видимой, плоская страница перестаёт быть расплывчатым впечатлением и превращается в число, на которое можно указать. Кроме того, она почти не связана с более старой, не относящейся к делу статистикой, которая просто носит то же название.
Что такое burstiness?
AI detector называется bursty, если в документе есть вариативность длины предложений. Burstiness, в том смысле, в каком это слово использует AI detector, это разброс длин предложений по всему документу, выраженный одним числом, стандартным отклонением этих длин, делённым на их среднее. Высокое число означает, что предложения сильно различаются вокруг среднего. Низкое число означает, что они тесно группируются вокруг него, независимо от того, каково это среднее.
Само слово относится к гораздо более старому статистическому словарю. Исследователи используют burstiness для описания землетрясений, вспышек заболеваний и сетевого трафика, всего, что группируется во времени, а не распределяется равномерно, и один распространённый способ измерять это в этих областях, это коэффициент Фано, отношение дисперсии счёта к его среднему.
Существует также второе, более старое значение внутри самой обработки естественного языка, которое легко спутать со статистикой длины предложения, о которой идет речь в этом посте. Корпусные лингвисты в 1990-х годах использовали burstiness для описания того, как группируются отдельные слова: как только документ упоминает редкое слово, вероятность упомянуть его снова становится гораздо выше, чем можно было бы ожидать по первому, независимому появлению. Kenneth Church и William Gale придали этому паттерну статистическую форму в пуассоновских смесях в 1995 году, и системы информационного поиска по-прежнему учитывают это при взвешивании того, насколько сильно должно засчитываться повторное слово. Эта статистика отслеживает повторение одного слова. Измерение в этом посте отслеживает нечто иное: форму целых предложений, независимо от того, какие слова их заполняют.
Остальная часть этого поста использует это слово только во втором смысле: форма предложения, а не повторяемость слова.
Почему разброс важнее среднего
Два документа могут иметь совершенно одинаковую среднюю длину предложения и при этом читаться совершенно по-разному. Среднее значение в двенадцать слов может относиться к абзацу, где каждое предложение близко к двенадцати словам, или к такому, где предложения из шести слов чередуются с предложениями из восемнадцати слов, и среднее не способно различить эти два абзаца. Это может сделать только разброс вокруг среднего.
Статистики назвали бы сравнение только по среднему неудачей, поскольку оно не выходит за пределы первого момента распределения. Детектор, или внимательный читатель, неявно проверяет и второй момент, тоже: форму вокруг центра, которую одно лишь среднее никогда не может выявить.
Рассмотрим два способа сообщить один и тот же результат. 'The intervention reduced symptoms in most participants. The effect was consistent across age groups. The finding supports further investigation into the mechanism.' Три предложения, по восемь или девять слов каждое, это ритм почти без какого-либо разброса. Теперь сравните: 'Symptoms dropped in most participants. That held up whether the person was twenty-two or sixty-eight, which nobody on the team expected going in, and it is the reason the next study needs to look at mechanism rather than outcome alone.' Утверждение то же самое. Ритм, который его несет, нет.
Среднее рассматривает оба абзаца как идентичные. Читатель, и, по-видимому, детектор, так не считает.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Как рассчитывается burstiness
Арифметика проста. Подсчитайте слова в каждом предложении, найдите стандартное отклонение этого ряда, затем разделите его на среднее. Например, если вы смотрите на отрывок, где предложения имеют длину восемь, тридцать одно, одиннадцать, двадцать четыре и девять слов, вы получаете разброс около пятидесяти шести процентов от среднего, то есть широкий burst. Если вы смотрите на отрывок, где предложения имеют длину пятнадцать, шестнадцать, четырнадцать, семнадцать и пятнадцать слов, вы получаете разброс около семи процентов, хотя средняя длина двух отрывков почти одинакова.
Одного лишь необработанного стандартного отклонения было бы недостаточно для той же задачи. Разброс в восемь слов означает нечто иное в отрывке со средним значением двенадцать слов на предложение, чем в отрывке со средним значением сорок, поэтому именно деление на среднее делает показатель сопоставимым от одного отрывка к другому.
Именно такое относительное представление объясняет, почему статистика работает одинаково для сжатого новостного стиля и для плотного теоретического. Технический раздел, построенный из коротких, однообразных предложений, и неформальный абзац, построенный из коротких, однообразных предложений, оба могут показывать низкий burstiness, потому что измерение никогда не спрашивает, насколько длинно предложение в абсолютных величинах, а только насколько каждое из них отклоняется от среднего соседних.
Это тот же самый расчёт, который выполняет free burstiness checker на этом сайте для вставленного черновика, отображая каждое предложение как точку, а не сжимая весь отрывок в одну величину. В этом масштабе всё, что ниже примерно двадцати процентов, выглядит как плотный, однородный разброс, а всё, что выше примерно сорока пяти процентов, выглядит как широкий, при этом большая часть отредактированной академической прозы оказывается где-то между ними.
Как выглядит абзац с низкой вариативностью на странице
Если поставить эти две модели рядом, их легко различить, когда вы знаете, на что смотреть.
| Признак | Абзац с низкой вариативностью | Абзац с высокой вариативностью |
|---|---|---|
| Паттерн длины предложений | Почти каждое предложение находится в пределах нескольких слов от среднего значения абзаца | Короткие, отрывистые предложения стоят рядом с длинными, многосоставными |
| Если читать вслух | Ровный, размеренный темп без естественного места для паузы ради акцента | Ритм, который то ускоряется, то замедляется, следуя за тем, где на самом деле падает акцент |
| Типичная причина | Неотредактированный вывод модели, предсказывающей по одному вероятному следующему предложению за раз, или первый черновик, который никто не перечитывал вслух | Автор намеренно обрывает предложение ради эффекта или объединяет два коротких предложения в одно, которое оправдывает свою длину |
Ни один из столбцов сам по себе не является хорошим письмом. Раздел с методами, где перечислены пять шагов в пяти коротких предложениях, и должен выглядеть как левый столбец, а длинное, извилистое предложение, вставленное в нумерованную процедуру, не улучшило бы его. Этот паттерн становится информативным только тогда, когда известно, какой именно фрагмент текста рассматривается.
Почему однообразные предложения помечаются
Детекторы рассматривают ровный ритм как сигнал из-за того, как работает генерация текста, а не потому, что однообразные предложения сами по себе обязательно вызывают подозрение. Более широкие механизмы того, как на самом деле работают детекторы AI, рассматриваются отдельно, кратко же можно сказать, что модель предсказывает по одному токену за раз, включая, неявно, момент, когда предложение, вероятно, закончится. При данном уже имеющемся тексте некоторая длина предложения статистически более вероятна, чем остальные, в любой конкретный момент, и модель, которая продолжает выбирать наиболее вероятное продолжение, снова и снова попадает примерно в эту же вероятную длину, предложение за предложением, по всему документу.
Один ровный абзац сам по себе ничего не доказывает, короткие процедурные разделы и должны выглядеть именно так. На самом деле детектор оценивает паттерн по всему документу, то есть является ли ровность в одном абзаце локальным, осознанным выбором или ритмом каждого абзаца в тексте.
Предсказуемость слово за словом является связанной, но отдельной метрикой, которая рассматривается на своих собственных основаниях в другом месте этого сайта, и она анализирует отдельные выборы слов, а не форму предложения.
Ничто из этого не доказывает, что документ был сгенерирован моделью, и считать ровный ритм решающим сам по себе означало бы повторить ту же ошибку, что и считать одно значение perplexity решающим. Спешно написанный первый черновик, который никто не прочитал вслух, может стать таким же ровным, как и сгенерированный текст. Отчасти поэтому собственный оценочный Human Score TextPulse сочетает вариативность на уровне предложений с несколькими другими сигналами, а не опирается на какой-то один из них, и поэтому бесплатные диагностические инструменты на этом сайте предназначены для совместного чтения, а не по отдельности.
Два последующих вопроса важнее самого определения. Сохраняют ли детекторы тот же вес burstiness, что и в 2023 году, это один из них, а как повысить его в собственных черновиках без ущерба для прозы, это другой.
Ровный абзац перестаёт быть загадкой, как только становится виден механизм, который за ним стоит. Это то, что происходит, когда каждое предложение строится так же, как одно следующее слово, то есть через выбор того, что идёт дальше, с наименьшим сопротивлением. Зависит ли это давление от того, кто пишет, или от модели, и удаётся ли ему ему противостоять, решается предложение за предложением.
Frequently Asked Questions
Что такое burstiness в письме? Это величина, на которую длина предложений варьируется в тексте, измеряемая как стандартное отклонение длин предложений, делённое на их среднее. Текст с большими колебаниями между короткими и длинными предложениями имеет высокую burstiness. Текст, в котором каждое предложение близко по длине к остальным, имеет низкую burstiness, независимо от того, короткая эта длина или длинная.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.