AI Detection

Probabilidad de token y log-verosimilitud en la detección de IA

La perplejidad atrae la atención, pero la aritmética que la sustenta es la probabilidad de token: lo que contiene realmente la distribución del modelo sobre la siguiente palabra, por qué la matemática de detección opera en espacio logarítmico en lugar de probabilidad bruta, y cómo una سلسلة de puntuaciones por token se convierte en un número.

6 min
Diagram illustrating token probability ai detection: a language model's next-token distribution turning into a log-likelihood score

Si le preguntas a un detector cómo llegó a esa puntuación, la mayoría de sus interfaces de usuario te dará la misma respuesta: un párrafo con algunas palabras sombreadas más oscuramente que otras. El sombreado no es una conjetura. Proviene de un número asociado a cada token del pasaje, calculado antes de que el detector toque siquiera perplexity, burstiness o un porcentaje final.

Es una probabilidad de token, y toda detección de probabilidad de token ai se basa en eso, desde la base. Cualquier número de métricas que un detector informe, incluidas las dos que tratamos en otra parte de este sitio, no es más que aritmética aplicada a una serie de estos números. La capa situada debajo de la capa en la que se detienen la mayoría de las explicaciones es donde hay que pensar en qué es realmente un token, qué significa la distribución del modelo sobre él y por qué la aritmética se realiza en espacio logarítmico en lugar de con probabilidad bruta. La mayoría de las explicaciones se detienen ahí.

Nada de esto necesita seguir siendo opaco. Un token, una distribución de probabilidad y un logaritmo son herramientas ordinarias, no secretos propietarios, y las mismas tres ideas explican cómo funcionan realmente los detectores de AI, desde el texto en bruto hasta un único número en un informe.

Detección de AI por probabilidad de token: de la distribución a la puntuación

La detección de AI por probabilidad de token funciona en tres etapas. Un modelo de lenguaje asigna una probabilidad a cada posible token siguiente dado lo que vino antes. Esas probabilidades por token se convierten en logaritmos y se suman a lo largo del pasaje, lo que evita un problema numérico con el que la multiplicación en bruto tropieza casi de inmediato. La suma resultante, promediada y reescalada, es lo que finalmente aparece como una cifra de perplexity o alimenta la decisión de un clasificador. Cada etapa es una pieza específica y comprobable de aritmética, no una caja negra.

Qué es realmente un token

Un token no es una palabra. Los modelos de lenguaje modernos dividen el texto en piezas subléxicas con un algoritmo como la codificación por pares de bytes, de modo que una palabra común como 'the' suele ser un token, una palabra menos común como 'perplexity' se divide en dos o tres piezas, y un nombre desconocido puede fragmentarse hasta caracteres individuales. Un pasaje de inglés ordinario se tokeniza de forma fiable en más piezas de las que tiene palabras, y conviene saberlo antes de confiar en cualquier recuento de palabras que una herramienta le devuelva.

El modelo nunca ve las palabras como lo hace un lector. Ve una secuencia de enteros, cada uno un índice dentro de un vocabulario fijo con el que se entrenó el modelo. Todo lo que hace token probability ai detection a partir de este punto opera sobre esa secuencia de enteros, no sobre la cadena original de letras, lo que en parte explica por qué el funcionamiento interno de un detector puede parecer desconectado de cómo una persona lee realmente una oración.

La distribución del modelo sobre el siguiente token

En cada posición de una secuencia, un modelo de lenguaje autorregresivo no produce una sola predicción. Produce una distribución completa de probabilidades sobre todo su vocabulario, decenas de miles de números que suman uno, y ordena cada posible token siguiente del más probable al menos probable según todo lo que ha precedido. Si se introduce en un modelo la frase 'the results of the', este distribuye la mayor parte de esa masa de probabilidad entre unos pocos sustantivos plausibles, 'study,' 'experiment,' 'analysis,' mientras asigna una fracción ínfima a algo como 'marmalade.'

El token que realmente aparece a continuación en un documento real ocupa algún lugar de esa clasificación, y la probabilidad asignada es la materia prima de la que se construye todo lo demás. Un modelo que produce su propio texto puede apoyarse directamente en esta distribución, eligiendo repetidamente entre las opciones cercanas a la parte superior. Un detector que lee el texto ya terminado de otra persona solo puede preguntar, a posteriori, cuánta probabilidad habría asignado el modelo a la elección que realmente se hizo.

La probabilidad de una secuencia completa es el producto de la probabilidad de cada token dado todo lo anterior; si encadenamos esa pregunta por token a lo largo de un documento entero usando la regla estándar de la probabilidad conjunta, el resultado final es un solo número que describe cuán esperado era el pasaje completo. Este producto es donde la aritmética empieza a fallar, y esa es la razón por la que existe la siguiente sección.

Humanice su propio artículo

Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.

Empezar gratis

Por qué la log-verosimilitud reemplaza la probabilidad bruta

Multiplicar probabilidades entre sí es matemáticamente correcto y prácticamente inútil más allá de unas pocas docenas de tokens. Cada probabilidad individual es una fracción menor que uno, así que un producto acumulado se reduce cada vez que se multiplica otro token, y se reduce con rapidez. A los pocos cientos de tokens, un producto bruto puede caer tan por debajo del número más pequeño que una computadora puede representar que se redondea a exactamente cero, un modo de fallo llamado underflow.

Una vez que eso ocurre, el número no transmite ninguna información en absoluto. Un documento que era simplemente improbable y un documento que era enormemente, caóticamente improbable ambos colapsan al mismo cero, sin forma de distinguirlos después. Los logaritmos corrigen esto porque el logaritmo de un producto es igual a la suma de los logaritmos, una identidad del álgebra básica. Sumar una cadena de números negativos ordinarios no sufre underflow como sí lo hace multiplicar una cadena de fracciones pequeñas, y además es más barato de calcular.

Longitud del pasaje (ilustrativa)Probabilidad bruta, un producto acumuladoSuma de las log-probabilidades
12 tokens con un ilustrativo 0.1 cada uno1 x 10 a la potencia de -12, aún representableaproximadamente -27.6
350 tokens con un ilustrativo 0.1 cada uno1 x 10 a la potencia de -350, sufre underflow hasta exactamente 0aproximadamente -805.9

Esta es una ilustración simplificada. Las probabilidades reales por token varían enormemente en lugar de situarse en un 0.1 fijo, pero la dirección del problema es exactamente correcta. Una vez que un producto bruto se desborda hasta cero, la comparación que un detector necesita realmente, si este documento era más o menos esperado que aquel, se vuelve imposible. La suma de las log-probabilidades nunca falla de ese modo. Permanece como un número preciso, ordinario y comparable, sin importar cuánto se extienda el pasaje, que es la razón real por la que la detectabilidad se mide en espacio logarítmico y no en espacio de probabilidad bruta.

De las puntuaciones por token a una puntuación de detección

Sumar las log-probabilidades a lo largo de un pasaje produce la log-verosimilitud total del documento bajo el modelo de referencia. Dividir por el número de tokens elimina el efecto de la longitud y deja la log-verosimilitud media por token, un número por fin comparable entre un ensayo de quinientas palabras y un capítulo de tesis de cinco mil palabras. Si se niega esa media y se exponentia, lo que se obtiene es la puntuación de perplexity, una métrica que este conjunto cubre en detalle en una revisión aparte de qué mide realmente perplexity.

Las mismas cifras por oración, seguidas para observar la variación a lo largo de un documento en lugar de reducirlas a una sola media, son de lo que se construye burstiness, una señal relacionada pero distinta de perplexity. Ambas parten de los mismos números por token descritos arriba. Solo realizan una aritmética distinta sobre ellos.

Una media simple no es la única manera de usar este material bruto, y la investigación ha avanzado mucho más allá de ella. DetectGPT, publicado en ICML 2023 por Mitchell, Lee, Khazatsky, Manning y Finn, parte de una propiedad distinta de la misma función de probabilidad: el texto muestreado de un modelo de lenguaje tiende a situarse en una región donde pequeñas reformulaciones hacen que la log-probabilidad disminuya en lugar de aumentar, un patrón que el artículo denomina curvatura negativa.

En lugar de entrenar un clasificador o usar una marca de agua, este método perturba un pasaje, produciendo pequeñas variaciones en cómo se reformula, y luego vuelve a puntuar cada variación con el mismo modelo. El artículo compara esto con la mejor línea base zero-shot y encuentra que, en texto generado por un modelo de 20-billion-parameter, este método alcanza 0.95 AUROC mientras que la mejor línea base zero-shot alcanza 0.81 AUROC.

La misma distribución, usada para marcar con agua en lugar de detectar

Hasta ahora, todo ha tratado la distribución de probabilidad como algo que se lee a posteriori. También puede tocarse en el momento de la generación, lo que invierte por completo el problema. Un método de 2023 de Kirchenbauer, Geiping, Wen, Katz, Miers y Goldstein selecciona una lista corta aleatorizada de tokens permitidos antes de que se produzca cada palabra, basándose en un hash de lo que vino antes, y orienta suavemente el muestreo hacia esa lista corta. El sesgo es invisible para un lector y luego puede recuperarse con una prueba estadística sobre un tramo breve de texto, sin necesidad de acceder al modelo original.

SynthID de Google DeepMind pone en producción una versión de esta idea: ajusta las puntuaciones de probabilidad del siguiente token en el momento de la generación y hoy está activo en la aplicación y la experiencia web de Gemini. OpenAI construyó un sistema comparable y no lo ha lanzado. Los informes atribuyen la decisión en parte a una encuesta en la que cerca del 30 percent de los usuarios de ChatGPT dijeron que la marca de agua les haría usar menos el producto, junto con preocupaciones sobre hasta qué punto una marca de agua resistiría la paráfrasis.

El informe de un detector muestra una palabra sombreada o un único porcentaje y se detiene ahí, sin mostrar nunca la distribución de la que procedía. El comprobador de perplexity gratuito de TextPulse ejecuta una versión simplificada de la misma puntuación por token frente a su propio borrador, lo que constituye una forma más directa de ver dónde se sitúa un pasaje que leer un veredicto de segunda mano.

Dos páginas vecinas recogen esto. Si los detectores siguen dependiendo de la burstiness ha cambiado desde 2023, y cómo GPTZero convierte estas mismas probabilidades en una puntuación se describe en su propia página.

Se sitúa junto al resto de las herramientas gratuitas de TextPulse, de modo que el mismo borrador puede comprobarse en cuanto al ritmo y la estructura, así como la predictibilidad a nivel de palabra, sin abrir una docena de pestañas separadas para hacerlo.

XLinkedInFacebook

Preguntas frecuentes

La detección de IA por probabilidad de token es la capa que subyace a todas las demás métricas de detección. Un modelo de lenguaje asigna una probabilidad a cada token de una secuencia, una pieza de palabra a la vez, basándose en todo lo que la precede. La perplejidad, las puntuaciones del clasificador y el porcentaje de un informe son todos aritmética aplicada después a esa secuencia de números, no una medición separada e independiente.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.