O que é burstiness? Por que frases uniformes são sinalizadas
Burstiness mede o quanto os comprimentos das frases oscilam ao longo de uma passagem, e não o tamanho da frase média. Este texto explica de onde vem o termo, como a dispersão é de fato calculada e por que a saída de um modelo de linguagem tende a se acomodar em uma faixa estreita de comprimentos.
Ler um parágrafo em voz alta torna audível, antes mesmo de ser nomeável, um certo tipo de uniformidade: cada frase termina aproximadamente no mesmo número de respirações, como um metrônomo que ninguém se lembrou de desligar. Os leitores percebem o padrão antes de conseguirem dizer o que há de errado com ele, e os detectores criados para identificar texto gerado também foram projetados para percebê-lo. O nome desse padrão é burstiness, uma palavra mais antiga do que qualquer detector de AI.
Então, o que é burstiness, no sentido específico que um detector atribui ao termo? É uma medida de quão amplamente os comprimentos das frases variam ao longo de uma passagem, calculada em relação à média dessa própria passagem, e não em comparação com qualquer número fixo. Um parágrafo é bursty quando frases curtas e concisas aparecem ao lado de frases longas e sinuosas. Um parágrafo tem baixa burstiness quando cada frase fica próxima do mesmo comprimento, seja esse comprimento de seis palavras ou de vinte e seis.
A estatística é simples o bastante para ser calculada à mão em um parágrafo curto e, uma vez visível, uma página uniforme deixa de ser uma impressão vaga e passa a ser um número que pode ser apontado. Ela também quase nada tem a ver com uma estatística mais antiga e não relacionada, que por acaso compartilha o mesmo nome.
O que é burstiness?
Um detector de AI é chamado de bursty se houver variabilidade no comprimento das frases ao longo de um documento. Burstiness, no uso que um detector de AI faz da palavra, é a dispersão dos comprimentos das frases em um documento, expressa como um único número: o desvio padrão desses comprimentos dividido por sua média. Um número alto significa que as frases variam amplamente em torno da média. Um número baixo significa que elas se agrupam de forma estreita em torno dela, independentemente de qual seja essa média.
A própria palavra pertence a um vocabulário estatístico muito mais antigo. Pesquisadores usam burstiness para descrever terremotos, surtos de doenças e tráfego de rede, qualquer coisa que se agrupe no tempo em vez de se distribuir de modo uniforme, e uma maneira comum de medi-la nesses campos é o fator de Fano, a razão entre a variância de uma contagem e sua média.
Há também um segundo significado, mais antigo, dentro da própria área de processamento de linguagem natural, fácil de confundir com a estatística de comprimento de sentença sobre a qual este texto trata. Linguistas de corpus, na década de 1990, usavam burstiness para descrever como palavras individuais se agrupam: uma vez que um documento menciona uma palavra incomum, torna-se muito mais provável mencioná-la novamente do que uma primeira ocorrência independente sugeriria. Kenneth Church e William Gale deram tratamento estatístico a esse padrão em misturas de Poisson em 1995, e os sistemas de recuperação de informação ainda o ajustam ao ponderar quanto uma palavra repetida deve contar. Essa estatística acompanha a repetição de uma palavra. A medida neste texto acompanha outra coisa: a forma de sentenças inteiras, independentemente de quais palavras as preenchem.
O restante deste texto usa a palavra apenas nesse segundo sentido: forma da sentença, não recorrência de palavras.
Por que a dispersão importa mais do que a média
Dois documentos podem compartilhar exatamente a mesma média de comprimento de sentença e não soar em nada parecidos. Uma média de doze palavras pode pertencer a um parágrafo em que cada sentença fica próxima de doze palavras, ou a outro em que sentenças de seis palavras alternam com sentenças de dezoito palavras, e a média não consegue distinguir esses dois parágrafos. Apenas a dispersão em torno da média pode fazê-lo.
Estatísticos chamariam a comparação baseada apenas na média de uma falha em olhar além do primeiro momento de uma distribuição. Um detector, ou um leitor cuidadoso, está implicitamente verificando também o segundo momento: a forma em torno do centro, que a média sozinha jamais pode revelar.
Considere duas maneiras de relatar o mesmo resultado. 'A intervenção reduziu os sintomas na maioria dos participantes. O efeito foi consistente entre faixas etárias. O achado sustenta investigação adicional sobre o mecanismo.' Três sentenças, com oito a nove palavras cada, formam um ritmo com quase nenhuma dispersão. Agora compare: 'Os sintomas diminuíram na maioria dos participantes. Isso se manteve tanto para a pessoa de vinte e dois anos quanto para a de sessenta e oito, o que ninguém da equipe esperava no início, e é por isso que o próximo estudo precisa examinar o mecanismo em vez de apenas o desfecho.' A afirmação é idêntica. O ritmo que a sustenta não é.
A média trata ambos os parágrafos como idênticos. Um leitor, e aparentemente um detector, não trata.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Como a burstiness é calculada
A aritmética é curta. Conte as palavras em cada frase, calcule o desvio padrão dessa lista e depois divida pela média. Por exemplo, se você observar uma passagem com frases de oito, trinta e um, onze, vinte e quatro e nove palavras, obtém uma dispersão de cerca de cinquenta e seis por cento da média, uma burstiness ampla. Se você observar uma passagem com frases de quinze, dezesseis, quatorze, dezessete e quinze palavras, obtém uma dispersão de cerca de sete por cento, embora as duas passagens tenham quase o mesmo comprimento médio.
Um desvio padrão bruto, por si só, não faria o mesmo trabalho. Oito palavras de dispersão significam algo diferente em uma passagem com média de doze palavras por frase do que em uma com média de quarenta, então dividir pela média é o que torna o número comparável de uma passagem para a seguinte.
Esse enquadramento relativo é a razão pela qual a estatística funciona do mesmo modo para um estilo jornalístico conciso e para um teórico denso. Uma seção técnica construída com frases curtas e uniformes e um parágrafo casual construído com frases curtas e uniformes podem ambos registrar baixa burstiness, porque a medição nunca pergunta quão longa é uma frase em termos absolutos, apenas quão distante cada uma está da média de suas vizinhas.
Este é o mesmo cálculo que o free burstiness checker neste site aplica a um rascunho colado, traçando cada frase como um ponto em vez de comprimir a passagem inteira em uma única figura. Nessa escala, qualquer valor abaixo de cerca de vinte por cento é lido como uma dispersão estreita e uniforme, e qualquer valor acima de cerca de quarenta e cinco por cento é lido como uma dispersão ampla, com a maior parte da prosa acadêmica editada situando-se em algum ponto entre esses extremos.
Como é um parágrafo de baixa variância na página
Coloque os dois padrões lado a lado e é fácil distingui-los assim que você sabe o que procurar.
| Traço | Parágrafo de baixa variância | Parágrafo de alta variância |
|---|---|---|
| Padrão de comprimento das frases | Quase toda frase fica dentro de poucas palavras da média do parágrafo | Frases curtas e truncadas aparecem ao lado de frases longas, com várias orações |
| Leitura em voz alta | Um ritmo constante e uniforme, sem um ponto natural para pausar e dar ênfase | Um ritmo que acelera e desacelera, acompanhando onde a ênfase de fato recai |
| Causa típica | Saída não editada de um modelo que prevê uma única próxima frase por vez, ou um primeiro rascunho que ninguém leu em voz alta | Um escritor que corta uma frase para produzir efeito, ou que funde duas frases curtas em uma só, que justifica seu comprimento |
Nenhuma das colunas é, por si só, uma boa escrita. Uma seção de métodos que lista cinco etapas em cinco frases curtas deve se parecer com a coluna da esquerda, e uma frase longa e sinuosa inserida em um procedimento numerado não a melhoraria. O padrão só se torna informativo quando se sabe que tipo de passagem está sendo analisada.
Por que frases uniformes são sinalizadas
Os detectores tratam um ritmo plano como um sinal porque é assim que a geração de texto funciona, e não porque frases uniformes sejam, por si mesmas, suspeitas. A mecânica mais ampla de como os detectores de IA realmente funcionam é tratada separadamente; a versão curta é que um modelo prevê um token por vez, incluindo, implicitamente, quando uma frase provavelmente termina. Dado o texto até aquele ponto, certo comprimento de frase é estatisticamente mais provável do que os demais em qualquer momento, e um modelo que continua escolhendo a continuação mais provável segue chegando perto desse mesmo comprimento provável, frase após frase, ao longo de um documento inteiro.
Um único parágrafo plano, por si só, não prova nada; seções procedimentais curtas devem mesmo se parecer com isso. O que um detector realmente pondera é o padrão ao longo de um documento inteiro: se a planura em um parágrafo é uma escolha local e intencional, ou o ritmo de todos os parágrafos do texto.
Previsibilidade palavra por palavra é uma medida relacionada, mas distinta, tratada em seus próprios termos em outra parte deste site, e ela observa escolhas individuais de palavras em vez da forma de uma frase.
Nada disso prova que um documento foi gerado por um modelo, e tratar um ritmo uniforme como decisivo por si só repetiria o mesmo erro de tratar um único número de perplexidade como decisivo. Um rascunho inicial apressado, que ninguém leu em voz alta, pode se tornar uniforme com a mesma facilidade com que um texto gerado pode. Isso faz parte do motivo pelo qual o próprio Human Score estimado do TextPulse combina variação em nível de frase com vários outros sinais, em vez de se apoiar em qualquer um deles isoladamente, e do motivo pelo qual as ferramentas diagnósticas gratuitas neste site foram construídas para serem lidas em conjunto, e não de forma isolada.
Duas perguntas de acompanhamento importam mais do que a definição. Se os detectores ainda ponderam a burstiness da mesma forma que faziam em 2023 é uma delas, e como aumentá-la em seus próprios rascunhos sem comprometer a prosa é a outra.
Um parágrafo uniforme não é um mistério quando o mecanismo por trás dele se torna visível. É o que acontece quando cada frase é construída da mesma maneira que uma única próxima palavra, ao buscar o que vem a seguir com a menor resistência. Se essa pressão prevalece depende do escritor, ou do modelo, resistindo a ela frase por frase.
Frequently Asked Questions
O que é burstiness na escrita? É a quantidade pela qual o comprimento das frases varia ao longo de uma passagem, medida como o desvio padrão dos comprimentos das frases dividido pela média deles. Uma passagem com grandes oscilações entre frases curtas e longas tem alta burstiness. Uma passagem em que cada frase fica próxima do mesmo comprimento tem baixa burstiness, seja esse comprimento curto ou longo.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.