AI Detection

¿Qué es la burstiness? Por qué se señalan las frases uniformes

La burstiness mide cuánto varían las longitudes de las frases en un pasaje, no cuánto se extiende la frase media. Esta entrada explica de dónde procede el término, cómo se calcula realmente la dispersión y por qué la salida de un language model tiende a estabilizarse en un intervalo estrecho de longitudes.

6 min
What is burstiness? A chart comparing uniform AI-generated sentence lengths to varied human sentence lengths.

Leer un párrafo en voz alta hace audible cierto tipo de planitud antes de que pueda nombrarse: cada oración cae aproximadamente en el mismo número de respiraciones, como un metrónomo que nadie recordó apagar. Los lectores perciben el patrón antes de poder decir qué le ocurre, y los detectores diseñados para captar texto generado también fueron concebidos para advertirlo. El nombre de ese patrón es burstiness, una palabra más antigua que cualquier detector de AI.

Entonces, ¿qué es burstiness, en el sentido específico en que lo entiende un detector? Es una medida de cuánto varían las longitudes de las oraciones a lo largo de un pasaje, calculada en relación con el promedio propio de ese pasaje y no frente a ningún número fijo. Un párrafo es bursty cuando las oraciones cortas y breves aparecen junto a otras largas y sinuosas. Un párrafo tiene baja burstiness cuando cada oración se sitúa cerca de la misma longitud, ya sean seis palabras o veintiséis.

La estadística es lo bastante simple como para calcularla a mano en un párrafo breve, y una vez que se hace visible, una página plana deja de ser una impresión vaga y se convierte en un número al que puede señalarse. Además, tiene casi nada que ver con una estadística más antigua y no relacionada que, por casualidad, comparte su nombre.

¿Qué es burstiness?

Un detector de AI se considera bursty si existe variabilidad en la longitud de las oraciones a lo largo de un documento. Burstiness, tal como la usa un detector de AI, es la dispersión de las longitudes de las oraciones en un documento, expresada como un único número: la desviación estándar de esas longitudes dividida por su media. Un número alto significa que las oraciones varían ampliamente alrededor del promedio. Un número bajo significa que se agrupan estrechamente en torno a él, independientemente de cuál sea ese promedio.

La palabra en sí pertenece a un vocabulario estadístico mucho más antiguo. Los investigadores usan burstiness para describir terremotos, brotes de enfermedades y tráfico de red, cualquier fenómeno que se agrupa en el tiempo en lugar de distribuirse de manera uniforme, y una forma común de medirlo en esos campos es el factor de Fano, la razón entre la varianza de un recuento y su media.

También existe un segundo significado, más antiguo, dentro del propio procesamiento del lenguaje natural, fácil de confundir con la estadística de longitud de oración de la que trata esta publicación. Los lingüistas de corpus en la década de 1990 usaron burstiness para describir cómo se agrupan las palabras individuales: una vez que un documento menciona una palabra poco frecuente, es mucho más probable que la vuelva a mencionar de lo que sugeriría una primera aparición independiente. Kenneth Church y William Gale dieron a ese patrón su tratamiento estadístico en mezclas de Poisson en 1995, y los sistemas de recuperación de información todavía ajustan este efecto al ponderar cuánto debe contar una palabra repetida. Esa estadística sigue la repetición de una palabra. La medición de esta publicación sigue otra cosa: la forma de oraciones completas, independientemente de qué palabras las llenen.

El resto de esta publicación usa la palabra solo en ese segundo sentido: la forma de la oración, no la recurrencia de palabras.

Por qué la dispersión importa más que el promedio

Dos documentos pueden compartir exactamente la misma longitud media de oración y no parecerse en nada. Un promedio de doce palabras puede corresponder a un párrafo en el que cada oración se mantiene cerca de doce palabras, o a uno en el que oraciones de seis palabras alternan con oraciones de dieciocho palabras, y la media no puede distinguir esos dos párrafos. Solo la dispersión alrededor de la media puede hacerlo.

Los estadísticos llamarían a la comparación basada solo en la media un fracaso al no mirar más allá del primer momento de una distribución. Un detector, o un lector cuidadoso, está comprobando implícitamente también el segundo momento: la forma alrededor del centro, que la media por sí sola nunca puede revelar.

Considere dos maneras de informar el mismo resultado. 'La intervención redujo los síntomas en la mayoría de los participantes. El efecto fue consistente entre grupos de edad. El hallazgo respalda una investigación adicional sobre el mecanismo.' Tres oraciones, de ocho a nueve palabras cada una, constituyen un ritmo con casi ninguna dispersión. Ahora compare: 'Los síntomas disminuyeron en la mayoría de los participantes. Eso se mantuvo tanto si la persona tenía veintidós como sesenta y ocho años, algo que nadie en el equipo esperaba de antemano, y esa es la razón por la que el siguiente estudio necesita examinar el mecanismo y no solo el resultado.' La afirmación es idéntica. El ritmo que la sostiene no lo es.

La media trata ambos párrafos como idénticos. Un lector, y al parecer un detector, no lo hace.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Cómo se calcula la variabilidad

La aritmética es breve. Cuenta las palabras de cada oración, toma la desviación estándar de esa lista y luego divídela por la media. Por ejemplo, si observas un pasaje con oraciones de ocho, treinta y uno, once, veinticuatro y nueve palabras, obtienes una dispersión de alrededor del cincuenta y seis por ciento de la media, una variabilidad amplia. Si observas un pasaje con oraciones de quince, dieciséis, catorce, diecisiete y quince palabras, obtienes una dispersión de aproximadamente siete por ciento, aunque los dos pasajes tengan casi la misma longitud media.

Una desviación estándar en bruto por sí sola no haría el mismo trabajo. Ocho palabras de dispersión significan algo distinto en un pasaje que promedia doce palabras por oración que en uno que promedia cuarenta, así que dividir por la media es lo que hace que la cifra sea comparable de un pasaje a otro.

Esa formulación relativa es la razón por la que la estadística funciona del mismo modo para un estilo periodístico conciso y para uno teórico denso. Una sección técnica construida con oraciones breves y uniformes y un párrafo informal construido con oraciones breves y uniformes pueden ambos registrarse como de baja variabilidad, porque la medición nunca pregunta cuán larga es una oración en términos absolutos, sino solo a qué distancia se sitúa cada una de la media de sus vecinas.

Este es el mismo cálculo que el free burstiness checker de este sitio aplica a un borrador pegado, trazando cada oración como un punto en lugar de comprimir todo el pasaje en una sola cifra. En esa escala, cualquier valor por debajo de aproximadamente veinte por ciento se lee como una dispersión ajustada y uniforme, y cualquier valor por encima de aproximadamente cuarenta y cinco por ciento se lee como una amplia, y la mayor parte de la prosa académica editada queda en algún punto intermedio.

Cómo se ve en la página un párrafo de baja variabilidad

Coloca los dos patrones uno junto al otro y es fácil distinguirlos una vez que sabes qué buscar.

RasgoPárrafo de baja variaciónPárrafo de alta variación
Patrón de longitud de las oracionesCasi cada oración se sitúa dentro de unas pocas palabras de la media del párrafoOraciones cortas y breves se sitúan junto a otras largas, con varias cláusulas
Leerlo en voz altaUn ritmo constante y uniforme, sin un lugar natural para hacer una pausa con énfasisUn ritmo que acelera y desacelera, siguiendo dónde cae realmente el énfasis
Causa típicaSalida sin editar de un modelo que predice una sola siguiente oración probable cada vez, o un primer borrador que nadie ha leído en voz altaUn escritor que corta una oración para lograr un efecto, o que fusiona dos oraciones delgadas en una sola que justifica su extensión

Ninguna de las dos columnas es, por sí misma, una buena escritura. Una sección de métodos que enumera cinco pasos en cinco oraciones cortas se supone que debe parecerse a la columna de la izquierda, y una oración larga y enrevesada insertada en un procedimiento numerado no la mejoraría. El patrón solo se vuelve informativo una vez que se sabe qué tipo de pasaje se está examinando.

Por qué se señalan las oraciones uniformes

Los detectores tratan un ritmo plano como una señal porque así funciona la generación de texto, no porque las oraciones uniformes sean por sí mismas sospechosas. La mecánica más amplia de cómo funcionan realmente los detectores de IA se aborda por separado, la versión breve es que un modelo predice un token cada vez, incluyendo, de forma implícita, cuándo es probable que termine una oración. Dado el texto hasta ese momento, cierta longitud de oración es estadísticamente más probable que el resto en cualquier instante dado, y un modelo que sigue eligiendo la continuación más probable sigue cayendo cerca de esa misma longitud probable, oración tras oración, a lo largo de todo un documento.

Un único párrafo plano no prueba nada por sí solo, las secciones procedimentales breves se supone que deben parecerse a eso. Lo que un detector está valorando en realidad es el patrón a lo largo de todo un documento, si la planitud de un párrafo es una elección local y deliberada, o el ritmo de cada párrafo del texto.

La predictibilidad palabra por palabra es una medida relacionada pero distinta, tratada en sus propios términos en otra parte de este sitio, y se fija en las elecciones de palabras individuales más que en la forma de una oración.

Nada de esto demuestra que un documento haya sido generado por un modelo, y tratar un ritmo uniforme como decisivo por sí solo repetiría el mismo error que tratar un único número de perplexity como decisivo. Un primer borrador apresurado que nadie ha leído en voz alta puede aplanarse con la misma facilidad con que puede hacerlo un texto generado. Esa es una de las razones por las que la propia puntuación estimada de Human Score de TextPulse combina la variación a nivel de oración con varias otras señales, en lugar de apoyarse en una sola de ellas, y por las que las herramientas diagnósticas gratuitas de este sitio están diseñadas para leerse conjuntamente y no de forma aislada.

Dos preguntas de seguimiento importan más que la definición. Si los detectores siguen ponderando la burstiness del mismo modo que en 2023 es una, y cómo aumentarla en sus propios borradores sin arruinar la prosa es la otra.

Un párrafo uniforme deja de ser un misterio una vez que el mecanismo que lo produce es visible. Es lo que ocurre cuando cada oración se construye del mismo modo que una sola palabra siguiente, al recurrir a lo que venga después con la menor resistencia. Si esa presión prevalece depende de que el escritor, o el modelo, se le oponga oración por oración.

Frequently Asked Questions

¿Qué es la burstiness en la escritura? Es la cantidad en que varía la longitud de las frases en un pasaje, medida como la desviación estándar de las longitudes de las frases dividida por su media. Un pasaje con grandes oscilaciones entre frases cortas y largas tiene una burstiness alta. Un pasaje en el que cada frase se mantiene cerca de la misma longitud tiene una burstiness baja, tanto si esa longitud es corta como si es larga.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.