AI Detection

¿Cómo funcionan los detectores de IA? Perplejidad, variabilidad y probabilidad de tokens

Los detectores de IA no reconocen la escritura de máquina como lo hace un lector. Miden cuán predecible es tu texto y luego convierten eso en una puntuación. Una vez que eso se entiende, tanto la tecnología como sus fallos tienen más sentido.

Actualizado el 12 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

Su universidad ha empezado a pasar las entregas por un detector de IA, y ha llegado un informe con un número que usted no esperaba. Antes de intentar impugnarlo, conviene saber qué significa ese número. ¿Cómo funcionan los detectores de IA? No leen la escritura de una máquina como lo hace una persona. Miden cuán predecible es su texto para un modelo de lenguaje, y luego convierten esa predictibilidad en una puntuación. Nada en ese proceso examina lo que usted quiere decir, su argumento, ni si realmente escribió usted el texto.

He pasado años construyendo herramientas que descomponen el texto estadísticamente, y lo más útil que hay que entender sobre la detección es esto: es una medición de la tipicidad, no del origen. Una vez que eso se comprende, tanto la tecnología como sus fallos tienen mucho más sentido.

Qué está midiendo realmente un detector

Un detector no sabe quién escribió nada. Lo que tiene es un modelo de lenguaje y una función de puntuación. El modelo lee su texto de izquierda a derecha, y en cada punto produce una distribución de probabilidad sobre qué palabra debería venir después. Si se le dan las palabras "the results of the", situará "study" en primer lugar, "experiment" un poco más abajo, y "marmalade" cerca de cero.

Así que el detector plantea una sola pregunta sobre su documento: ¿con qué frecuencia este texto eligió la palabra que el modelo esperaba? Una escritura que sigue cayendo en palabras de alta probabilidad parece hecha por una máquina, porque eso es exactamente lo que hace un generador de texto. El modelo muestrea de la parte superior de su propia distribución, una y otra vez, durante miles de tokens.

Por eso toda la categoría se apoya en una base más inestable de lo que sugiere el marketing. Un detector no está encontrando una marca de agua ni una huella digital. Está observando que su prosa es estadísticamente poco sorprendente, y la prosa poco sorprendente tiene muchas causas además de un chatbot.

Perplejidad: cuán sorprendido está el modelo

La medida principal se llama perplejidad, y es más sencilla de lo que parece. Tome la probabilidad que el modelo asignó a cada palabra que realmente apareció, promedie los logaritmos de esas probabilidades y eleve el resultado. Lo que se obtiene es un único número que describe cuán sorprendido estuvo el modelo por su documento. Puede comprobar la perplejidad de su propio borrador en lugar de adivinarla.

Una perplejidad baja significa que el texto siguió el rumbo que el modelo esperaba. Una perplejidad alta significa que siguió tomando giros que el modelo no esperaba. La escritura humana tiende a situarse más arriba, porque las personas recurren al sustantivo específico poco común, a la construcción inusual, a la oración que empieza en un lugar inesperado. El texto generado tiende a situarse más abajo, porque el proceso de decodificación está diseñado para evitar exactamente esos movimientos.

Compare dos formas de abrir una sección de métodos. "The results of the study were statistically significant" es una secuencia que casi cualquier modelo predeciría con alta confianza, porque no aporta información inesperada. "Two of the three cohorts drifted before week six, which we had not planned for" es mucho menos predecible, porque aporta información específica y torpe que no podría adivinarse a partir del resto del artículo. La segunda le cuesta al detector una sorpresa real, y esa sorpresa es lo que se registra como humano.

Ráfaga: la varianza, no el promedio

La perplejidad por sí sola no basta, porque un documento puede promediar un número perfectamente razonable y, sin embargo, ser sospechosamente uniforme en su interior. Lo que importa es la variación a lo largo de su texto, y eso es lo que mide la ráfaga: cuánto oscilan la longitud de las oraciones y la perplejidad a nivel de oración a medida que avanza la escritura. Un comprobador de ráfaga le mostrará directamente esa dispersión.

Aceleramos cuando tenemos confianza y ralentizamos cuando estamos siendo cautelosos, y ese ritmo se mantiene en la prosa. Las personas escriben en ráfagas. Un párrafo puede abrirse con una oración declarativa breve de ocho palabras, pasar a una oración de treinta y cuatro palabras que contiene tres cláusulas y un inciso, y luego volver a algo ágil.

La salida del modelo no hace esto de manera fiable. Las oraciones se agrupan cerca de la longitud media. Los párrafos aparecen en conjuntos ordenados. Cada sección comienza reformulando su propio encabezado. Se lee con fluidez y obtiene una mala puntuación, porque la baja varianza entre oraciones es una de las señales más fuertes de las que dispone un detector. No es ninguna oración aislada lo que lo delata. Es la uniformidad.

SeñalQué midePor qué el texto generado por máquina obtiene una puntuación baja
PerplexityCuánto sorprenden al modelo sus elecciones de palabras, promediado sobre el documentoLa decodificación toma muestras de tokens de alta probabilidad por diseño
BurstinessCuánto varían la longitud de las oraciones y la predictibilidad a lo largo del textoLa salida se agrupa cerca de la media en lugar de oscilar
Token probabilityLa probabilidad por palabra a partir de la cual se calculan las otras dosLargas secuencias de elecciones individualmente poco llamativas

La probabilidad de token y de dónde procede la puntuación

Ambos números se construyen a partir de un tercero, la log-verosimilitud por token, la materia prima a partir de la cual se calcula todo lo demás. Algunas herramientas la muestran directamente, resaltando los tramos en los que su texto era más predecible. Esos resaltados no son acusaciones sobre oraciones concretas, por mucho que la interfaz lo sugiera. Son las partes que más contribuyeron a un número a nivel de documento.

Los enfoques de investigación han ido más allá de los umbrales simples. DetectGPT y sus descendientes examinan la curvatura, perturban ligeramente su texto y comprueban si la verosimilitud desciende según el patrón que el texto generado suele mostrar. Otros comparan el mismo pasaje bajo dos modelos distintos y utilizan el desacuerdo como señal.

Una consecuencia importa para cualquiera que esté siendo evaluado. Como las métricas se calculan frente a un modelo de referencia concreto, una puntuación es siempre relativa a ese modelo. Dos detectores pueden leer el mismo párrafo y discrepar por completo, y ninguno está funcionando mal. Están respondiendo a la misma pregunta con distintos puntos de referencia.

La segunda consecuencia se menciona con menos frecuencia. Un modelo solo puede encontrar predecible un pasaje si ese pasaje se parece a lo que se usó para entrenarlo, de modo que la calidad de la detección se degrada a medida que aumenta la distancia entre el modelo de referencia y lo que sea que produjo el texto. Los generadores más recientes, las disciplinas inusuales y los idiomas distintos del inglés amplían esa distancia. Es parte de la razón por la que la precisión medida en un benchmark controlado rara vez sobrevive al contacto con un conjunto real de entregas.

Humanice su propio trabajo

Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.

Empezar gratis

Por qué el texto de AI se detecta en absoluto

Cómo un modelo de lenguaje elige su siguiente palabra

Dejarlo a su aire, un modelo de lenguaje simplemente informaría de su lista completa ordenada de posibles palabras siguientes y dejaría que otra cosa eligiera. En la práctica, una estrategia de decodificación realiza esa elección automáticamente, palabra tras palabra, y la estrategia que esté en funcionamiento cambia el aspecto de la salida incluso cuando el modelo subyacente nunca cambia.

La decodificación greedy siempre selecciona la única palabra con mayor probabilidad. En el artículo que introdujo el nucleus sampling como solución, Ari Holtzman y coautores observaron que seguir esta estrategia conduce a un texto que, en sus propias palabras, es 'insípido y extrañamente repetitivo.' El beam search, que sigue varias continuaciones probables a la vez antes de decidirse por una, encuentra una versión similar del mismo problema.

Las estrategias de muestreo reintroducen cierta aleatoriedad, pero de forma controlada. La temperatura ajusta con qué nitidez el modelo favorece sus propias opciones principales antes de que se extraiga una palabra. El nucleus sampling, a veces llamado top-p, trunca la distribución al conjunto más pequeño de palabras cuya probabilidad combinada supera un umbral y extrae solo de ese conjunto, descrito en el artículo original como muestreo a partir de un núcleo dinámico de la distribución en lugar de su cola poco fiable.

Incluso la menos determinista de estas configuraciones sigue recurriendo a una lista reducida construida en torno a lo que el modelo ya considera probable. La escritura humana nunca se generó clasificando un vocabulario y extrayendo de la parte superior de esa clasificación, por lo que constantemente va más allá de esa lista reducida. El significado a veces reside en la palabra que nunca estuvo en la lista.

Planitud del vocabulario: menos palabras, más seguras

La planitud del vocabulario es la versión a nivel de palabra del mismo hábito. En cada punto de una oración, decenas de palabras podrían continuarla de manera plausible, pero unas pocas se sitúan muy por encima del resto en la clasificación del modelo, y la decodificación sigue cayendo en esas pocas. Si se multiplica esa elección por cada oración de un documento, el rango de palabras realmente utilizadas se estrecha de forma medible en comparación con una escritura humana de longitud similar.

El efecto se acumula en lugar de mantenerse constante. Un modelo que recurre a la palabra mejor clasificada en la primera oración tiene más probabilidades de establecer un contexto en el que la palabra mejor clasificada en la segunda oración también sea común, porque las palabras comunes tienden a seguir a las palabras comunes. Un escritor humano interrumpe constantemente esa deriva, recurriendo al término técnico específico, al verbo ligeramente inusual, a la palabra que nombra la cosa real en lugar de una aproximación segura de ella. Esa diferencia aparece como un vocabulario de trabajo mediblemente menor en la versión generada, incluso cuando ambas versiones describen los mismos hechos subyacentes.

Esto es una propiedad de todo el pasaje, no de una sola elección léxica. Una palabra segura no demuestra nada. Una página entera de ellas, con oración tras oración recurriendo al mismo nivel de vocabulario común, es lo que un detector a nivel de palabra está realmente construido para notar.

Uniformidad sintáctica: las mismas formas, repetidas

La uniformidad sintáctica es la versión a nivel de oración. No se trata de cuánto se extiende una oración. Se trata de cuántas formas gramaticales distintas utiliza un pasaje: cómo se abren las oraciones, cómo se enlazan las cláusulas entre sí, con qué frecuencia una palabra de transición hace el trabajo de conectar una idea con la siguiente. Un modelo que sigue prediciendo la estructura siguiente estadísticamente probable se instala en una pequeña rotación de formas y la repite.

Un párrafo puede variar la longitud de sus oraciones y aun así leerse como sintácticamente plano si cada oración sigue la misma estructura sujeto verbo complemento, comienza con el mismo tipo de transición o se resuelve del mismo modo. La previsibilidad reside en el patrón, no en el número de palabras, una distinción que se trata con más detalle en la guía sobre qué mide realmente burstiness.

Qué se estrechaQué tiende a hacer el texto optimizado para la decodificaciónQué tiende a hacer la escritura humana
Elección de palabrasSe decanta por la palabra común más probable en cada pasoRecurre a la palabra específica o menos común que nombra la cosa real
Apertura de la oraciónRepite una pequeña rotación de aperturas transicionales segurasVaría cómo comienza una oración, incluidas aperturas que un modelo clasificaría como menos probables
Estructura de las cláusulasRepite una o dos formas gramaticales preferidas a lo largo de un pasajeMezcla estructuras simples y complejas según lo que necesita una oración

Las elecciones que solo un humano tiende a hacer

La otra cara de una banda estrecha es lo que queda fuera de ella. Una persona que describe hechos reales recurre a la cifra exacta en lugar de una redonda, admite la parte que no funcionó, interrumpe una oración para corregirla a mitad de pensamiento o elige una palabra que es correcta en lugar de típica. Cada una de esas elecciones es, desde el punto de vista de un modelo de lenguaje, un token de baja probabilidad, exactamente el tipo de cosa que la decodificación está diseñada para evitar.

Nada de esto significa que la escritura específica o inusual esté a salvo de cualquier marca, ni que la escritura fluida y correcta sea sospechosa por defecto. Una sección de métodos, una cláusula legal o un borrador final muy editado pueden situarse en una banda estrecha por razones que no tienen nada que ver con un modelo, y por eso una sola puntuación es una descripción de un patrón y no un veredicto sobre quién lo escribió.

Ver dónde se sitúa el propio borrador en esa banda es más útil que adivinarlo. El comprobador gratuito de perplexity y el comprobador de burstiness de TextPulse miden por separado la predictibilidad a nivel de palabra y el ritmo de una frase a la siguiente, de modo que un vocabulario plano y una forma de frase repetida aparecen como dos señales distintas en lugar de un único número combinado.

De aquí se derivan dos páginas más específicas. Cómo detecta Turnitin la IA específicamente es una, y la diferencia entre su puntuación de similitud y su puntuación de IA es la otra, ya que ambas se confunden habitualmente entre sí.

Ambas forman parte de la colección de herramientas gratuitas más amplia, para cualquiera que quiera ver el patrón por sí mismo en lugar de confiar ciegamente en un único número.

¿Qué proporción de la web está generada ahora por IA?

Según varias medidas, el texto producido por máquinas supera ahora al texto escrito por humanos en línea. Un equipo de Amazon Web Services analizó 6.4 mil millones de frases de la web y encontró que el 57.1% existía como traducciones automáticas en tres o más idiomas, en gran parte de baja calidad. Un análisis de 2025 de la empresa de SEO Graphite encontró que algo más de la mitad de los artículos web publicados recientemente fueron generados por IA. Wikipedia no está exenta: un estudio de Princeton sobre páginas creadas en agosto de 2024 midió alrededor de uno de cada veinte nuevos artículos en inglés como sustancialmente generados por IA.

La proporción está aumentando, porque el coste de la salida de los modelos es órdenes de magnitud inferior al de la escritura humana y todos los incentivos comerciales apuntan en la misma dirección. Plataformas enteras funcionan ahora sin escritores humanos en absoluto: Chirper es una red social poblada íntegramente por cuentas de IA, donde los humanos solo pueden observar, y SocialAI vende un feed en el que cada respuesta que recibes procede de un bot. Los foros, las secciones de reseñas y los hilos de comentarios presentan el mismo patrón a menor escala.

Para la detección, esto cambia la tasa base. Un clasificador que leyera texto web arbitrario en 2023 podría asumir que la mayor parte era humana, un clasificador en 2026 no puede hacerlo. También retroalimenta a los propios modelos, ya que cada nueva generación se entrena con una web en la que sus predecesores ya habían escrito, lo que es una de las razones por las que los hábitos de vocabulario en los que se fijan los detectores se expanden en lugar de desvanecerse.

Para su propia escritura, la consecuencia es directa: la prosa escrita por humanos se está convirtiendo en la clase minoritaria, y los correctores, editores y lectores lo saben. La sospecha elevada es ahora el valor por defecto, y precisamente por eso conviene entender qué puede y qué no puede medir un detector.

Qué añaden los detectores comerciales por encima de eso

Las herramientas que las instituciones compran realmente no ejecutan la perplejidad de manual. Turnitin, GPTZero, Originality y el resto entrenan clasificadores supervisados con grandes conjuntos etiquetados de texto humano y de máquina, utilizando rasgos estadísticos junto con rasgos estilísticos. Lo que aprende el clasificador es aquello que separa esos dos montones en sus datos de entrenamiento, algo más estrecho y más histórico que la "escritura de IA" en general.

La dependencia del entrenamiento es el problema silencioso. Un clasificador entrenado principalmente con una generación de salidas de modelo tiene que generalizar a modelos más nuevos, a disciplinas desconocidas y a escritores cuyo inglés no se parece a su distribución de entrenamiento. Los proveedores publican cifras de exactitud a partir de sus propias evaluaciones, y los puntos de referencia independientes suelen situarse muy por debajo de esas cifras con las mismas herramientas.

Leer una puntuación sin sobreinterpretarla

Un informe de detector suele llegar como un porcentaje, y ese porcentaje se interpreta erróneamente con frecuencia. No es la proporción de su documento que ha escrito una máquina. Según la herramienta, es una confianza del clasificador, o la proporción de frases que superaron algún umbral interno, y los proveedores suelen ser imprecisos sobre cuál de estas opciones es. Dos informes que muestren ambos sesenta por ciento pueden significar cosas bastante distintas.

También conviene saber qué hace variar una puntuación por razones que no tienen nada que ver con quién la escribió. Los documentos breves son más ruidosos, porque hay menos texto sobre el que se asienten los promedios, y un ensayo de quinientas palabras puede oscilar mucho por la fuerza de dos o tres frases inusuales. El material citado también cuenta, salvo que la herramienta lo elimine, de modo que una revisión de literatura llena de citas en bloque hereda la previsibilidad de aquello que cita. Un pasaje técnico cargado de terminología estándar se comporta del mismo modo.

Si usted recibe una marca, la respuesta útil es la evidencia, no un argumento sobre la métrica. El historial de versiones, los borradores, las notas y los registros de búsqueda hablan del proceso, y el proceso es lo que un comité de mala conducta puede evaluar realmente. No existe ningún umbral que alguien pueda señalar y que separe a un escritor cuidadoso de un modelo.

Por qué los detectores marcan textos que ningún modelo produjo

Los falsos positivos no son un fallo raro. Se derivan directamente de medir la tipicidad. Cualquier texto que sea genuinamente predecible obtendrá una puntuación de predecible, con independencia de quién lo haya producido.

Los escritores de inglés no nativos son los más afectados. Investigadores de Stanford encontraron que los detectores clasificaban erróneamente como generados por máquina una gran parte de los ensayos de hablantes no nativos, mientras clasificaban correctamente los ensayos de hablantes nativos. La razón es mecánica, no maliciosa: los escritores que trabajan en una segunda lengua tienden a apoyarse en construcciones muy usadas y en un vocabulario más común. Ese es exactamente el perfil de baja perplexity, por lo que a los escritores de ESL se les marca por escribir con cuidado.

Las convenciones académicas causan el mismo problema. Se supone que una sección de métodos sea formularia. La escritura jurídica, la documentación técnica y la redacción clínica recompensan todas la formulación estándar por encima de la inventiva. Una edición intensa lo agrava aún más, ya que pulir un borrador suele significar eliminar las irregularidades que llevaban su firma estadística.

Las instituciones lo han notado. Vanderbilt desactivó la función de detección de IA de Turnitin en lugar de actuar sobre puntuaciones que no podía verificar, y otras universidades han restringido cómo pueden utilizarse los números en los procedimientos por mala conducta. Trate la puntuación de un detector como una prueba débil, no como un veredicto.

Qué significa esto para su propia escritura

El consejo práctico que se desprende de la mecánica no es exótico, y nada de ello implica manipular nada. Varíe deliberadamente la longitud de sus frases, porque la uniformidad es lo que se registra. Conserve el detalle específico, la cifra real, la limitación real, lo que salió mal en la semana seis. La competencia genérica es lo que obtiene una puntuación de texto generado por máquina, y la especificidad es a la vez mejor escritura y una señal más fuerte.

Conserve también su propio idioma. Si tiene una manera de expresar las cosas, déjela así. El impulso de pulir un borrador hasta que suene como cualquier otro artículo del campo es el impulso que reduce su perplexity.

Una cosa que conviene evitar, algunas herramientas introducen deliberadamente errores gramaticales para aumentar la perplexity. Funciona en la métrica y es una idea terrible para cualquier texto evaluado o sometido a revisión por pares, porque está cambiando una sospecha por una certeza. El objetivo es una escritura que se lea como suya, no una escritura que haya sido dañada a propósito. Esa es toda la diferencia entre reescribir para un lector humano y romper el texto para engañar a un evaluador.

Si quiere ver estos números en su propio borrador en lugar de aceptar la palabra de una caja negra, las mediciones subyacentes no son secretas. Las herramientas gratuitas de análisis de texto le mostrarán dónde se sitúa su prosa, y usted podrá decidir por sí mismo si los tramos planos son un problema estilístico que merece la pena corregir.

XLinkedInFacebook

Preguntas frecuentes

Sí, y de forma predecible. Los detectores miden cuán estadísticamente predecible es un texto, no quién lo escribió, así que cualquier escritura genuinamente formulaica obtiene una puntuación de texto generado por máquina. Los puntos de referencia independientes informan de forma consistente una precisión inferior a las afirmaciones de los proveedores, y varias universidades han restringido cómo pueden usarse las puntuaciones.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Manténgase al día sobre la humanización de IA

Reciba en su correo consejos sobre escritura académica, detección de IA y humanización.

Sin spam. Darse de baja en cualquier momento.