Probabilidad de token y log-verosimilitud en la detección de IA
La perplejidad atrae la atención, pero la aritmética que la sustenta es la probabilidad de token: lo que realmente contiene la distribución del modelo sobre la siguiente palabra, por qué la matemática de detección opera en espacio logarítmico en lugar de con probabilidad bruta, y cómo una secuencia de puntuaciones por token se convierte en un solo número.
Si usted pregunta a un detector cómo llegó a esa puntuación, la mayoría de sus interfaces de usuario le dará la misma respuesta: un párrafo con algunas palabras sombreadas más oscuramente que otras. El sombreado no es una conjetura. Proviene de un número asociado a cada token en el pasaje, calculado antes de que el detector toque perplexity, burstiness o un porcentaje final.
Es una probabilidad de token, y toda detección basada en probabilidad de token ai se apoya en eso, desde la base. Cualquier número de métricas que un detector informe, incluidas las dos que tratamos en otra parte de este sitio, es solo aritmética aplicada a una serie de estos números. La capa situada debajo de la capa en la que se detienen la mayoría de las explicaciones es donde hay que pensar en qué es realmente un token, qué significa la distribución del modelo sobre él y por qué la aritmética se realiza en espacio logarítmico en lugar de en probabilidad bruta. La mayoría de las explicaciones se detienen ahí.
Nada de esto necesita seguir siendo opaco. Un token, una distribución de probabilidad y un logaritmo son herramientas ordinarias, no secretos propietarios, y las mismas tres ideas explican cómo funcionan realmente los detectores de AI, desde el texto bruto hasta un único número en un informe.
Detección de AI basada en probabilidad de token: de la distribución a la puntuación
La detección de AI basada en probabilidad de token funciona en tres etapas. Un modelo de lenguaje asigna una probabilidad a cada posible token siguiente dado lo que vino antes. Esas probabilidades por token se convierten en logaritmos y se suman a lo largo del pasaje, lo que evita un problema numérico con el que la multiplicación bruta tropieza casi de inmediato. La suma resultante, promediada y reescalada, es lo que finalmente aparece como una cifra de perplexity o alimenta la decisión de un clasificador. Cada etapa es una pieza específica y verificable de aritmética, no una caja negra.
Qué es realmente un token
Un token no es una palabra. Los modelos de lenguaje modernos dividen el texto en fragmentos subléxicos con un algoritmo como la codificación por pares de bytes, de modo que una palabra común como 'the' suele ser un token, una palabra menos común como 'perplexity' se divide en dos o tres fragmentos, y un nombre desconocido puede fragmentarse hasta caracteres individuales. Un pasaje de inglés ordinario se tokeniza de forma fiable en más fragmentos de los que tiene palabras, algo que conviene saber antes de confiar en cualquier recuento de palabras que una herramienta le devuelva.
El modelo nunca ve las palabras como lo hace un lector. Ve una secuencia de enteros, cada uno un índice dentro de un vocabulario fijo con el que se entrenó el modelo. Todo lo que hace token probability ai detection a partir de este punto opera sobre esa secuencia de enteros, no sobre la cadena original de letras, lo que en parte explica por qué el funcionamiento interno de un detector puede parecer desconectado de cómo una persona lee realmente una oración.
La distribución del modelo sobre el siguiente token
En cada posición de una secuencia, un modelo de lenguaje autorregresivo no produce una sola predicción. Produce una distribución completa de probabilidades sobre todo su vocabulario, decenas de miles de números que suman uno, y ordena cada posible token siguiente del más probable al menos probable según todo lo que ha aparecido antes. Si se introduce en un modelo la frase 'the results of the', distribuye la mayor parte de esa masa de probabilidad entre unos pocos sustantivos plausibles, 'study,' 'experiment,' 'analysis,' mientras asigna una fracción ínfima a algo como 'marmalade.'
El token que realmente aparece a continuación en un documento real ocupa algún lugar en esa clasificación, y la probabilidad asignada es la materia prima de la que se construye todo lo demás. Un modelo que produce su propio texto puede apoyarse directamente en esta distribución, eligiendo repetidamente entre las opciones cercanas a la parte superior. Un detector que lee el texto terminado de otra persona solo puede preguntar, después del hecho, cuánta probabilidad habría asignado el modelo a la elección que realmente se hizo.
La probabilidad de una secuencia completa es el producto de la probabilidad de cada token dado todo lo anterior; si encadenamos esa pregunta por token a lo largo de un documento entero usando la regla estándar de la probabilidad conjunta, el resultado final es un solo número que describe cuán esperado era el pasaje completo. Este producto es donde la aritmética empieza a fallar, y esa es la razón por la que existe la sección siguiente.
Humanice su propio trabajo
Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.
Por qué la log-verosimilitud reemplaza la probabilidad bruta
Multiplicar probabilidades entre sí es matemáticamente correcto y, en la práctica, inútil después de unas pocas docenas de tokens. Cada probabilidad individual es una fracción menor que uno, así que un producto acumulado se reduce cada vez que se multiplica otro token, y se reduce con rapidez. Tras unos pocos cientos de tokens, un producto bruto puede caer tan por debajo del número más pequeño que un ordenador puede representar que se redondea a exactamente cero, un modo de fallo llamado underflow.
Una vez que eso ocurre, el número no aporta ninguna información. Un documento que era simplemente improbable y un documento que era enormemente, caóticamente improbable se reducen ambos al mismo cero, sin forma de distinguirlos después. Los logaritmos lo solucionan porque el logaritmo de un producto es igual a la suma de los logaritmos, una identidad del álgebra básica. Sumar una cadena de números negativos ordinarios no sufre underflow como sí lo hace multiplicar una cadena de fracciones pequeñas, y además es más barato de calcular.
| Longitud del pasaje (ilustrativa) | Probabilidad bruta, un producto acumulado | Suma de log-probabilidades |
|---|---|---|
| 12 tokens a un 0.1 ilustrativo cada uno | 1 x 10 to the power of -12, aún representable | aproximadamente -27.6 |
| 350 tokens a un 0.1 ilustrativo cada uno | 1 x 10 to the power of -350, sufre underflow hasta exactamente 0 | aproximadamente -805.9 |
Esta es una ilustración simplificada. Las probabilidades reales por token varían enormemente en lugar de situarse en un 0.1 fijo, pero la dirección del problema es exactamente correcta. Una vez que un producto bruto se desborda hacia cero, la comparación que un detector necesita realmente, si este documento era más o menos esperado que aquel, se vuelve imposible. La suma de las log-probabilidades nunca falla de esa manera. Permanece como un número preciso, ordinario y comparable, sin importar cuánto se extienda el pasaje, que es la razón real por la que la detectabilidad se mide en el espacio logarítmico y no en el espacio de probabilidad bruta.
De las puntuaciones por token a una puntuación de detección
Sumar las log-probabilidades a lo largo de un pasaje produce la log-verosimilitud total del documento bajo el modelo de referencia. Dividir por el número de tokens elimina el efecto de la longitud y deja la log-verosimilitud media por token, un número por fin comparable entre un ensayo de quinientas palabras y un capítulo de tesis de cinco mil palabras. Si se niega esa media y se aplica la exponenciación, lo que se obtiene es la puntuación de perplexity, una métrica que este conjunto cubre por completo en una revisión aparte de qué mide realmente perplexity.
Las mismas cifras por oración, seguidas para observar la variación a lo largo de un documento en lugar de reducirse a una sola media, son de lo que se construye burstiness, una señal relacionada pero distinta de perplexity. Ambas parten de los mismos números por token descritos arriba. Solo realizan una aritmética distinta sobre ellos.
Una media simple no es la única forma de usar esta materia prima, y la investigación ha avanzado mucho más allá de ella. DetectGPT, publicado en ICML 2023 por Mitchell, Lee, Khazatsky, Manning y Finn, parte de una propiedad distinta de la misma función de probabilidad: el texto muestreado de un modelo de lenguaje tiende a situarse en una región donde pequeñas reformulaciones hacen que la log-probabilidad disminuya en lugar de aumentar, un patrón que el artículo denomina curvatura negativa.
En lugar de entrenar un clasificador o usar una marca de agua, este método perturba un pasaje, produciendo pequeñas variaciones en su reformulación, y luego vuelve a puntuar cada variación con el mismo modelo. El artículo compara esto con la mejor línea base zero-shot y encuentra que, en texto generado por un modelo de 20-billion-parameter, este método alcanza 0.95 AUROC mientras que la mejor línea base zero-shot alcanza 0.81 AUROC.
La misma distribución, usada para marcar en lugar de detectar
Hasta ahora, todo ha tratado la distribución de probabilidad como algo que se lee después del hecho. También puede tocarse en el momento de la generación, lo que invierte por completo el problema. Un método de 2023 de Kirchenbauer, Geiping, Wen, Katz, Miers y Goldstein selecciona una lista corta aleatoria de tokens permitidos antes de que se produzca cada palabra, basada en un hash de lo que vino antes, y orienta suavemente el muestreo hacia esa lista corta. El sesgo es invisible para un lector y luego puede recuperarse con una prueba estadística sobre un tramo breve de texto, sin necesidad de acceder al modelo original.
SynthID de Google DeepMind pone en producción una versión de esta idea: ajusta las puntuaciones de probabilidad del siguiente token en el momento de la generación y hoy está disponible en la aplicación Gemini y en la experiencia web. OpenAI construyó un sistema comparable y no lo ha lanzado. Los informes atribuyen la decisión en parte a una encuesta en la que cerca del 30 percent de los usuarios de ChatGPT dijeron que la marca de agua les haría usar menos el producto, junto con preocupaciones sobre hasta qué punto una marca de agua sobreviviría a la paráfrasis.
El informe de un detector muestra una palabra sombreada o un único porcentaje y se detiene ahí, sin mostrar nunca la distribución de la que procedía. El comprobador gratuito de perplexity de TextPulse ejecuta una versión simplificada de la misma puntuación por token frente a su propio borrador, lo que constituye una forma más directa de ver dónde se sitúa un pasaje que leer un veredicto de segunda mano.
Dos páginas vecinas recogen esto. Si los detectores siguen dependiendo de la burstiness ha cambiado desde 2023, y cómo GPTZero convierte estas mismas probabilidades en una puntuación se describe en su propia página.
Se sitúa junto al resto de las herramientas gratuitas de TextPulse, de modo que el mismo borrador puede revisarse en cuanto al ritmo y la estructura, así como a la predictibilidad a nivel de palabra, sin abrir una docena de pestañas distintas para hacerlo.
Preguntas frecuentes
La detección de IA por probabilidad de token es la capa que subyace a todas las demás métricas de detección. Un modelo de lenguaje asigna una probabilidad a cada token de una secuencia, una pieza de palabra a la vez, basándose en todo lo que le precede. La perplejidad, las puntuaciones del clasificador y el porcentaje de un informe son todas aritméticas aplicadas después a esa secuencia de números, no una medición independiente y separada.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.