AI Detection

Как повысить perplexity и burstiness в вашем письме

Целенаправленное повышение perplexity и burstiness обычно просто означает писать лучше: варьировать длину предложений, смешивать структуры придаточных и выбирать слово, которое действительно подходит, а не то, которое лишь формально проходит. Конкретные примеры до и после, а также то, где это перестаёт быть мастерством и становится плохой идеей.

6 min
Before and after example showing how to increase burstiness and perplexity by varying sentence length and word choice

Поиск способов повысить burstiness обычно обещает короткий путь: заменить слово синонимом, вставить случайное длинное предложение, возможно, для верности нарушить правило грамматики. Но именно это не меняет показатель. Повышение perplexity и burstiness в тексте в основном сводится к архитектуре предложений, к тому же ремеслу, которое внимательный редактор и так уже практикует, только намеренно, а не по привычке.

Это практический материал, а не объяснение механизма. Формула, лежащая в основе burstiness, и то, откуда вообще взялся этот термин, рассматриваются в сопутствующем материале о том, что именно измеряет burstiness; у perplexity есть собственная сопутствующая публикация, выполняющая ту же задачу. Ниже речь пойдет о технике: о конкретных способах строить предложение так, чтобы повышать оба показателя, с примерами до и после, а также с честным разбором того, где это перестает быть советом по письму и становится плохой идеей.

Как повысить burstiness, намеренно варьируя длину предложений

Burstiness отслеживает разброс между вашими предложениями, а не их среднюю длину, поэтому самый быстрый рычаг, это сознательно расширять этот разброс, а не скатываться к одной удобной длине на весь абзац. Большинство первых черновиков выстраиваются в ритм, который никто не выбирал намеренно: три предложения в диапазоне от двенадцати до шестнадцати слов кажутся безопасными, поэтому четвертое и пятое следуют той же схеме, хотя никто не решил, что так и должно быть.

До: 'The sample size limited statistical power. The results should be interpreted with caution. Future research should address this limitation with larger cohorts.' Три предложения, по восемь, одиннадцать слов каждое, один регистр на всем протяжении. После: 'The sample was little, which limited statistical power in ways worth saying plainly rather than hedging around. That matters. A single larger cohort could shift the effect size enough to change which claims the paper is entitled to make.' То же содержание, совершенно иной разброс.

Цель не состоит в максимальном разнообразии любой ценой. Абзац, в котором предложение из сорока слов чередуется с предложением из двух слов в каждой строке, воспринимается скорее как тиковое повторение, чем как ритм. Задача ближе к тому, как человек естественно выстраивает устное объяснение: более длинное вводное предложение, когда идее нужно пространство, и короткое, когда оно не нужно.

Смешивайте структуры предложений вместо того, чтобы повторять одну и ту же

Абзац может варьировать число слов и при этом оставаться плоским, если каждое предложение построено одинаково: подлежащее, сказуемое, дополнение, точка, повтор. Burstiness зависит от структурного разнообразия не меньше, чем от длины, потому что читателя, или модель, предсказывающую следующую вероятную конструкцию, сбивает с толку предложение, которое начинается с придаточного предложения или с вопроса, после нескольких предложений, начинавшихся с подлежащего.

До: 'The intervention reduced anxiety scores. The effect held across age groups. The mechanism remains unclear.' Три предложения подряд, начинающиеся с подлежащего. После: 'Anxiety scores dropped after the intervention. Whether that held across every age group took a second look to confirm, and it did. What is still missing is a mechanism that explains why.' Между этими двумя версиями не изменилось ничего в самом результате, изменилась только архитектура, через которую читателю приходится пройти, чтобы к нему добраться.

Это не усложнение ради самого усложнения. Придаточное предложение в начале заслуживает своего места тогда, когда оно действительно подготавливает следующее за ним предложение: временной маркер, условие, уступка. Если его просто прикрепить ради разнообразия, без какого-либо обоснования, та же конструкция читается именно так, как она и есть, как украшение, а не как архитектура.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Выбирайте конкретное слово вместо ожидаемого

Perplexity работает на уровне слова, поэтому описанная выше работа с длиной предложений покрывает лишь половину задачи. Модель приписывает высокую вероятность общему следующему слову: значимый, заметный, важный, или любому другому, к которому потянулись бы тысяча других статей того же жанра в этом месте. Назвать фактическое число, фактический механизм или фактическое возражение, которое высказал рецензент, стоит модели гораздо большей неожиданности, чем слово, которое было лишь безопасным.

До: 'The findings were major and have important implications for the field.' Предложение, составленное из слов, которых ожидает рецензент, в порядке, которого ожидает рецензент. После: 'Three of four cohorts cleared the threshold; the fourth missed it by two points, which the discussion section never explains.' Вторая версия могла бы описывать только это конкретное исследование. Первая могла бы стоять в конце почти любой статьи в любой дисциплине.

Это не означает, что нужно наполнять предложение ненужными подробностями. Это означает, что нужно сохранять подробность, которая уже была истинной и конкретной, а не сглаживать ее до общей фразы, к которой первый черновик тянется под давлением срока. Точное число, названное ограничение, конкретный контрпример требуют больше усилий для создания, потому что они менее предсказуемы, и, кроме того, это просто более удачные предложения.

Пусть короткое предложение звучит после длинного

Предыдущие две техники работают предложение за предложением. Эта техника касается того, что делает предложение по отношению к соседнему. Длинное предложение, которое наращивает придаточное предложение на уточнение, а затем на конкретную деталь, создает открытое пространство. Если сразу после него поставить что-то короткое, это ломает ритм, в который иначе вошел бы читатель, а вместе с ним и классификатор.

До: 'The treatment group showed improvement across three of the four measures tracked, and while the fourth measure didn't reach statistical significance, the trend was directionally consistent with the other three, suggesting the null result there may reflect a power issue rather than a true absence of effect, a possibility the original protocol didn't expect.' Одно предложение, несущее пять идей. После: 'The treatment group improved on three of four measures. The fourth didn't reach significance, though the trend pointed the same way. That gap was not in the original protocol.' Длинная версия и короткая версия в итоге говорят почти одно и то же, но только одна из них дает читателю место, чтобы перевести дыхание.

Одно короткое предложение в каждом абзаце оправдывает своё место. Несколько таких предложений подряд начинают ощущаться как приём, заимствованный из рекламного текста, по три слова за раз, а это тоже своего рода однообразие и может сгладить абзац не хуже, чем полное отсутствие разнообразия.

Не каждая техника выше воздействует на один и тот же рычаг. Некоторые сильнее меняют perplexity, некоторые сильнее меняют burstiness, а некоторые меняют оба показателя сразу.

ТехникаВ основном меняетПочему
Варьирование длины предложенийBurstinessУвеличивает разрыв между самым коротким и самым длинным предложением, а именно это и отслеживает мера, основанная на разбросе
Смешение структур придаточных частейОбаНарушает ожидание фиксированного шаблона от одного предложения к следующему
Выбор конкретного словаPerplexityНазванная деталь вызывает у модели больше неожиданности, чем общий заполнитель
Короткое предложение после длинногоBurstinessСоздаёт резкий контраст, который и призван уловить расчёт дисперсии

Писать так, чтобы это читали, а не чтобы обойти оценку

Каждая из приведённых выше техник, по сути, является просто хорошей редактурой. Варьирование длины предложений, смешение структур придаточных частей, называние конкретной детали вместо безопасного обобщения: редактор, не интересующийся обнаружением AI, внёс бы те же изменения по той же причине, потому что текст в результате читается лучше. Это совпадение не случайно. Внимательный читатель и расчёт perplexity реагируют на одно и то же свойство текста, на то, какая его часть действительно выполняет работу, а какая лишь заполняет пространство ожидаемой фразой.

Перекрытие распадается в тот момент, когда цель меняется с хорошего письма на обыгрывание числа. Предложение, удлинённое без всякой причины, кроме повышения среднего значения, конструкция, намеренно сделанная тяжеловесной, слово, выбранное ради редкости, а не ради точности, всё это повышает оценку и ухудшает текст, что является плохой сделкой ещё до того, как учитывать, как он читается тем, кто на самом деле его оценивает или рецензирует. Детектор тоже никогда не бывает единственным читателем в комнате, и проза, написанная ради удовлетворения одной статистики, как правило, не удовлетворяет никого больше.

Собственные free perplexity checker и free burstiness checker TextPulse созданы именно для такого самопроверочного анализа, вставьте черновик, посмотрите, где он находится, и решите, является ли ровный фрагмент стилистической проблемой, которую стоит переработать, а не догадкой. Остальная free tools collection TextPulse охватывает другие уровни того же вопроса, выбор слов, структуру, тон, давая более полное прочтение, чем любое из этих измерений по отдельности.

Та же техника, описанная без привязки к метрике, это просто варьирование длины предложений в академическом письме. Её стоит сопоставить с более широким вопросом почему AI text вообще обнаруживается, чтобы правки оставались направленными на причину.

Ничто из этого не требует веры в то, что одно число говорит всю правду о тексте, и об этом стоит помнить, учитывая, как эти показатели вписываются в более полное объяснение как AI detectors на самом деле работают. Абзац, который хорошо звучит вслух, с пространством для дыхания и по крайней мере одним предложением, которое мог написать только человек, знающий материал, как правило, сам справляется с остальным.

XLinkedInFacebook

Часто задаваемые вопросы

Как увеличить burstiness, сводится к тому, чтобы расширить разрыв между самым коротким и самым длинным предложением, а не позволять каждому предложению оставаться почти одной и той же длины. Абзац, построенный из трёх предложений по двенадцать слов подряд, почти не имеет разброса. Если нарушить этот шаблон одним коротким предложением и одним более длинным, более подробным предложением, показатель сразу возрастает, и обычно это тоже читается лучше.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.