AI Detection

¿Cómo funcionan los detectores de IA? Perplejidad, burstiness y probabilidad de token

Los detectores de IA no reconocen la escritura de máquina del modo en que lo hace un lector. Miden cuán predecible es su texto y luego convierten eso en una puntuación. Una vez que eso se entiende, tanto la tecnología como sus fallos tienen más sentido.

7 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

Su universidad ha empezado a pasar las entregas por un detector de IA, y ha llegado un informe con un número que usted no esperaba. Antes de intentar impugnarlo, conviene saber qué significa ese número. ¿Cómo funcionan los detectores de IA? No leen la escritura de una máquina como lo hace una persona. Miden cuán predecible es su texto para un modelo de lenguaje, y luego convierten esa predictibilidad en una puntuación. Nada en ese proceso examina lo que usted quiere decir, su argumento, ni si realmente escribió el texto.

He pasado años construyendo herramientas que descomponen el texto estadísticamente, y lo más útil para entender la detección es esto: es una medición de la tipicidad, no del origen. Una vez que eso se comprende, tanto la tecnología como sus fallos tienen mucho más sentido.

Qué está midiendo realmente un detector

Un detector no sabe quién escribió nada. Lo que tiene es un modelo de lenguaje y una función de puntuación. El modelo lee su texto de izquierda a derecha, y en cada punto produce una distribución de probabilidad sobre qué palabra debería venir después. Si le da las palabras "the results of the", situará "study" en el primer lugar, "experiment" un poco más abajo, y "marmalade" cerca de cero.

Así que el detector plantea una sola pregunta sobre su documento: ¿con qué frecuencia este texto eligió la palabra que el modelo esperaba? Una redacción que sigue cayendo en palabras de alta probabilidad parece hecha por una máquina, porque eso es exactamente lo que hace un generador de texto. El modelo toma muestras de la parte superior de su propia distribución, una y otra vez, durante miles de tokens.

Por eso toda la categoría se sostiene sobre una base más frágil de lo que sugiere el marketing. Un detector no está encontrando una marca de agua ni una huella digital. Está observando que su prosa es estadísticamente poco sorprendente, y la prosa poco sorprendente tiene muchas causas además de un chatbot.

Perplexity: cuán sorprendido está el modelo

La medida principal se llama perplexity, y es más fácil de lo que parece. Tome la probabilidad que el modelo asignó a cada palabra que realmente apareció, promedie los logaritmos de esas probabilidades y eleve el resultado. Lo que se obtiene es un único número que describe cuán sorprendido estuvo el modelo por su documento. Puede comprobar la perplexity de su propio borrador en lugar de adivinarla.

Una perplexity baja significa que el texto siguió el rumbo que el modelo esperaba. Una perplexity alta significa que siguió tomando giros que el modelo no esperaba. La escritura humana tiende a situarse más arriba, porque las personas recurren al sustantivo específico poco común, a la construcción inusual, a la oración que empieza en un lugar inesperado. El texto generado tiende a situarse más abajo, porque el proceso de decodificación está construido para evitar precisamente esos movimientos.

Compare dos maneras de abrir una sección de métodos. "The results of the study were statistically significant" es una secuencia que casi cualquier modelo predeciría con alta confianza, porque no aporta información inesperada. "Two of the three cohorts drifted before week six, which we had not planned for" es mucho menos predecible, porque aporta información específica y poco natural que no podría adivinarse a partir del resto del artículo. La segunda le cuesta al detector una sorpresa real, y esa sorpresa es lo que se registra como humano.

Burstiness: la varianza, no el promedio

La perplexity por sí sola no basta, porque un documento puede promediar un número perfectamente razonable y, sin embargo, ser sospechosamente uniforme por debajo. Lo que importa es la variación a lo largo de su texto, y eso es lo que mide burstiness: cuánto varían la longitud de las oraciones y la perplexity a nivel de oración a medida que avanza la escritura. Un burstiness checker le mostrará esa dispersión directamente.

Aceleramos cuando tenemos confianza y ralentizamos cuando estamos siendo cautelosos, y ese ritmo se conserva en la prosa. Las personas escriben en ráfagas. Un párrafo puede abrirse con una oración declarativa breve de ocho palabras, pasar a una oración de treinta y cuatro palabras que contiene tres cláusulas y un inciso, y luego volver a algo ágil.

La salida del modelo no hace esto de forma fiable. Las oraciones se agrupan cerca de la longitud media. Los párrafos aparecen en conjuntos ordenados. Cada sección comienza reformulando su propio encabezado. Se lee con fluidez y obtiene una mala puntuación, porque la baja variación entre oraciones es una de las señales más fuertes de las que dispone un detector. No es ninguna oración aislada la que lo delata. Es la uniformidad.

SeñalQué midePor qué el texto de máquina obtiene una puntuación baja
PerplexityCuánto sorprenden al modelo sus elecciones de palabras, promediado sobre el documentoLa decodificación toma muestras de tokens de alta probabilidad por diseño
BurstinessCuánto varían la longitud de las oraciones y la previsibilidad a lo largo del textoLa salida se agrupa cerca de la media en lugar de oscilar
Token probabilityLa probabilidad por palabra a partir de la cual se calculan las otras dosLargas secuencias de elecciones individualmente poco llamativas

Probabilidad de token y de dónde procede la puntuación

Ambas cifras se construyen a partir de una tercera, la log-verosimilitud por token, la materia prima a partir de la cual se calcula todo lo demás. Algunas herramientas se la muestran directamente, resaltando los tramos en los que su texto era más predecible. Esos resaltados no son acusaciones sobre oraciones concretas, por mucho que la interfaz lo sugiera. Son las partes que más contribuyeron a una cifra a nivel de documento.

Los enfoques de investigación han ido más allá de los umbrales simples. DetectGPT y sus descendientes examinan la curvatura, perturban ligeramente su texto y comprueban si la verosimilitud cae siguiendo el patrón que suele mostrar el texto generado. Otros comparan el mismo pasaje bajo dos modelos distintos y usan el desacuerdo como señal.

Una consecuencia importa para cualquiera que esté siendo evaluado. Como las métricas se calculan con respecto a un modelo de referencia concreto, una puntuación es siempre relativa a ese modelo. Dos detectores pueden leer el mismo párrafo y discrepar por completo, y ninguno está funcionando mal. Están respondiendo a la misma pregunta con puntos de referencia distintos.

La segunda consecuencia se señala con menos frecuencia. Un modelo solo puede encontrar predecible un pasaje si ese pasaje se parece a aquello con lo que fue entrenado, de modo que la calidad de la detección se degrada a medida que aumenta la distancia entre el modelo de referencia y lo que sea que produjo el texto. Los generadores más recientes, las disciplinas poco habituales y las lenguas distintas del inglés amplían esa distancia. Esa es una de las razones por las que la precisión medida en un benchmark controlado rara vez sobrevive al contacto con un conjunto real de entregas.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Lo que añaden los detectores comerciales

Las herramientas que las instituciones compran de verdad no ejecutan la perplexity de manual. Turnitin, GPTZero, Originality.ai y el resto entrenan clasificadores supervisados con grandes conjuntos etiquetados de texto humano y de máquina, utilizando rasgos estadísticos junto con rasgos estilísticos. Lo que aprende el clasificador es aquello que separa esos dos conjuntos en sus datos de entrenamiento, algo más estrecho y más histórico que la "escritura de IA" en general.

La dependencia del entrenamiento es el problema silencioso. Un clasificador entrenado principalmente con una generación de salidas de modelo tiene que generalizar a modelos más nuevos, a disciplinas desconocidas y a autores cuyo inglés no se parece a su distribución de entrenamiento. Los proveedores publican cifras de precisión a partir de sus propias evaluaciones, y los benchmarks independientes suelen situarse muy por debajo de esos números con las mismas herramientas.

Cómo leer una puntuación sin sobreinterpretarla

Un informe de detector suele presentarse como un porcentaje, y ese porcentaje se interpreta erróneamente con frecuencia. No es la proporción de su documento escrita por una máquina. Según la herramienta, es una confianza del clasificador, o la proporción de frases que superaron algún umbral interno, y los proveedores a menudo son imprecisos sobre cuál de estas opciones es. Dos informes que muestran ambos sesenta por ciento pueden significar cosas bastante distintas.

También conviene saber qué hace variar una puntuación por razones que no tienen nada que ver con quién la escribió. Los documentos breves son más ruidosos, porque hay menos texto sobre el que se asienten los promedios, y un ensayo de quinientas palabras puede oscilar mucho por la fuerza de dos o tres frases inusuales. El material citado también cuenta, salvo que la herramienta lo elimine, de modo que una revisión de literatura llena de citas en bloque hereda la previsibilidad de aquello que cita. Un pasaje técnico cargado de terminología estándar se comporta del mismo modo.

Si recibe una marca, la respuesta útil es la evidencia, no una discusión sobre la métrica. El historial de versiones, los borradores, las notas y los registros de búsqueda hablan del proceso, y el proceso es lo que un comité de mala conducta puede evaluar realmente. No existe ningún umbral que alguien pueda señalar y que separe a un escritor cuidadoso de un modelo.

Por qué los detectores marcan textos que ningún modelo produjo

Los falsos positivos no son un fallo raro. Se derivan directamente de medir la tipicidad. Cualquier texto que sea genuinamente predecible obtendrá una puntuación de predecible, independientemente de quién lo haya producido.

Los escritores de inglés no nativo son los más afectados. Investigadores de Stanford encontraron que los detectores clasificaban erróneamente como generada por máquina una gran parte de los ensayos de hablantes no nativos, mientras clasificaban correctamente los ensayos de hablantes nativos. La razón es mecánica, no maliciosa: quienes escriben en una segunda lengua tienden a recurrir a construcciones muy usadas y a un vocabulario más común. Ese es exactamente el perfil de baja perplexity, por eso a los escritores de ESL se les marca por escribir con cuidado.

Las convenciones académicas causan el mismo problema. Se supone que una sección de métodos debe ser formularia. La escritura jurídica, la documentación técnica y la redacción clínica recompensan todas la formulación estándar por encima de la inventiva. Una edición intensa lo agrava aún más, ya que pulir un borrador suele significar eliminar las irregularidades que llevaban su firma estadística.

Las instituciones lo han notado. Vanderbilt desactivó la función de detección de IA de Turnitin en lugar de actuar sobre puntuaciones que no podía verificar, y otras universidades han restringido cómo pueden usarse los números en los procedimientos por mala conducta. Trate la puntuación de un detector como una prueba débil, no como un veredicto.

Qué significa esto para su propia escritura

El consejo práctico que se deriva de la mecánica no es exótico, y nada de ello implica manipular nada. Varíe deliberadamente la longitud de sus frases, porque la uniformidad es lo que se registra. Conserve el detalle específico, la cifra real, la limitación real, lo que salió mal en la semana seis. La competencia genérica es lo que obtiene una puntuación de texto generado por máquina, y la especificidad es tanto una mejor escritura como una señal más fuerte.

Conserve también su propio modo de expresión. Si tiene una manera de decir las cosas, déjela ahí. El impulso de pulir un borrador hasta que suene como cualquier otro trabajo del campo es el impulso que reduce su perplexity.

Una cosa que debe evitar: algunas herramientas introducen deliberadamente errores gramaticales para aumentar la perplexity. Funciona en la métrica y es una idea terrible para cualquier texto calificado o sometido a revisión por pares, ya que está cambiando una sospecha por una certeza. El objetivo es una escritura que se lea como suya, no una escritura que haya sido dañada a propósito. Esa es toda la diferencia entre reescribir para un lector humano y romper el texto para engañar a un evaluador.

Si quiere ver estos números en su propio borrador en lugar de aceptar la palabra de una caja negra, las mediciones subyacentes no son secretas. Las herramientas gratuitas de análisis de texto le mostrarán dónde se sitúa su prosa, y usted podrá decidir por sí mismo si los tramos planos son un problema estilístico que merece la pena corregir.

Frequently Asked Questions

Sí, y de manera predecible. Los detectores miden cuán estadísticamente predecible es un texto, no quién lo escribió, así que cualquier escritura genuinamente formulaica obtiene una puntuación de texto generado por máquina. Los puntos de referencia independientes informan de forma consistente una precisión inferior a la que afirman los proveedores, y varias universidades han restringido cómo pueden usarse las puntuaciones.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

¿Cómo funcionan los detectores de IA? | TextPulse.ai