AI Detection

¿Son precisos los detectores de IA? Falsos positivos y sesgo

Los proveedores publican tasas de falsos positivos inferiores al 1 por ciento. Investigadores independientes que probaron los mismos detectores en textos en inglés de hablantes no nativos hallaron tasas superiores al 60 por ciento. Esto es lo que muestran las pruebas.

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin afirma que su tasa de falsos positivos es inferior al 1%. Un grupo de investigadores independientes probó múltiples detectores con una gama más amplia de muestras de escritura de hablantes no nativos de inglés. Encontraron que la tasa media de falsos positivos era superior al 60% en ese mismo tipo de escritura. Ambas cifras son reales, ambas se publicaron, y ambas se refieren a detectores que se venden al mismo mercado. ¿Son precisos los detectores de IA? Depende de qué población se haya probado, qué detector se haya usado y cómo lo definió su proveedor desde el principio.

Esta publicación no volverá a explicar cómo un detector calcula esa puntuación. El mecanismo, la perplejidad, la probabilidad de los tokens, cómo se entrena el clasificador, se explica en detalle en otro lugar, y conviene leerlo primero si no lo ha hecho. Lo que importa aquí es qué ocurre una vez que existe la puntuación: con qué frecuencia es incorrecta, sobre la escritura de quién se equivoca con mayor frecuencia y cuánto cuesta en realidad una acusación falsa a alguien que no hizo nada mal.

¿Son precisos los detectores de IA?

No de manera consistente, y la brecha entre las afirmaciones de marketing y las pruebas independientes está bien documentada. Un grupo de investigadores dirigido por Debora Weber-Wulff publicó sus hallazgos sobre 14 herramientas de detección, incluidas 12 gratuitas y dos comerciales, que se probaron con una mezcla de texto humano y de ChatGPT en 2023. Encontraron que ninguna de estas herramientas es precisa o fiable, con un sesgo incorporado para etiquetar el texto de máquina como humano en lugar de al revés. Dos de las herramientas comerciales incluidas en esta prueba fueron Turnitin y PlagiarismCheck. Todas las herramientas de esta prueba rindieron peor cuando el texto fue parafraseado.

Pero dos años después, las cosas no están estancadas. Un working paper de la Booth School de la University of Chicago, de Brian Jabarian y Alex Imas, sometió a prueba a tres recién llegados, Pangram, GPTZero y Originality.ai, y a un competidor de código abierto con casi 2,000 textos escritos por humanos procedentes de blogs, noticias, reseñas y ficción. En condiciones de prueba controladas, la mejor herramienta del conjunto nunca bajó del 99.8 percent de precisión y mantuvo su tasa de falsos positivos en un nivel bajo. El modelo de código abierto rindió tan bien como un adivinador aleatorio. Las cosas realmente han mejorado. Más o menos. Un poco.

Pero el problema es la palabra controladas. Los pasajes de referencia son limpios, completos y producidos bajo condiciones conocidas. Un ensayo entregado no es ninguna de esas cosas de manera fiable. Los resultados en el mundo real pueden no ser idénticos a los resultados de laboratorio, como el propio chief product officer de Turnitin ha dicho públicamente, aunque esa es una admisión rara y útil por parte de un proveedor. La siguiente sección coloca las cifras del proveedor junto a las independientes para que la brecha sea visible en lugar de simplemente afirmada.

Afirmaciones del proveedor frente a pruebas independientes

La tabla siguiente alinea lo que cuatro detectores afirman sobre sí mismos con lo que midieron investigadores independientes cuando probaron las herramientas directamente. Lea juntas las dos columnas centrales, no solo la columna del proveedor.

DetectorPrecisión declarada por el proveedorObservado de forma independienteLo que el proveedor dice sobre los falsos positivos
TurnitinUmbral de confianza del 98% antes de marcar; menos del 1% de falsos positivos a nivel de documentoAproximadamente 80% de precisión, la mejor de 12 herramientas en una comparación de 2023, en una versión anterior de la herramientaMenos del 1% a nivel de documento por encima de un umbral del 20% de texto escrito por IA; alrededor del 4% a nivel de oración
GPTZero95.7% de detección de texto de IA con una tasa de falsos positivos del 1% en el benchmark independiente RAID96% de precisión en pasajes breves; tasa de falsos positivos inferior al 1% en un estudio de 2025 de la University of Chicago BoothInforma de una tasa de falsos positivos del 1% en el benchmark RAID
Originality.ai99% de precisión; tasa de falsos positivos del 0.5% (modelo Lite), 1.5% (modelo Turbo)Tasa de falsos positivos inferior al 1%, pero pasó por alto entre el 10% y el 40% del texto escrito por IA en el mismo estudio de BoothPublica cifras separadas de falsos positivos por nivel de modelo
PangramTasas de error que afirma que son más de 38 veces inferiores a las de herramientas competidoras; afirma no tener sesgo contra escritores de inglés no nativosPrecisión nunca inferior al 99.8%, tasa de falsos positivos cercana a cero, en el estudio de BoothAfirma tasas de falsos positivos cercanas a cero en 10 dominios textuales y 8 modelos de lenguaje

Dos cosas destacan. Primero, todas las cifras del proveedor proceden de un laboratorio controlado por el proveedor y las cifras de Booth proceden de investigadores que no tienen nada que vender. Segundo, Turnitin no aparece en absoluto en esa columna intermedia, ya que el estudio de 2025 no lo probó. En la tabla, su cifra independiente se basa en una comparación anterior de 2023, pero se realizó sobre una versión más antigua de la herramienta, así que recuerde esto al mirar la tabla como una comparación de tipo similar.

¿Qué tan precisa es la detección de IA de Turnitin?

Turnitin no publica una cifra única de precisión. Publica, en cambio, un umbral y una compensación. La empresa ha dicho que solo marca un documento cuando tiene un 98 percent de confianza en que la parte señalada fue escrita por IA, y que este umbral es lo que mantiene la tasa de falsos positivos a nivel de documento por debajo del 1 percent. Turnitin ha estimado que detecta aproximadamente el 85 percent de la escritura asistida por IA, dejando pasar deliberadamente el resto en lugar de arriesgar una acusación errónea.

El porcentaje real de falsos positivos que Turnitin devuelve a nivel de oración, donde una interfaz resalta líneas específicas en lugar de un documento completo, en realidad se acerca al 4 percent. Este es el dato que conviene conocer si un profesor hace una captura de pantalla de un solo párrafo señalado en lugar de una puntuación de documento completo, porque una oración resaltada conlleva una probabilidad significativamente mayor de ser incorrecta que la puntuación del documento que aparece junto a ella.

También conviene señalar que Turnitin ha reconocido directamente esta diferencia. Encontraron que sus primeros resultados en el mundo real, en particular para documentos más cortos, tenían tasas de falsos positivos más altas de lo que se esperaba a partir de sus pruebas de laboratorio. Por ello, ajustaron la longitud mínima del documento para ser evaluado de 150 a 300 words. Eso es un proveedor ajustando su propio producto porque la cifra publicada no se sostuvo fuera del laboratorio, lo cual dice tanto como cualquier estudio independiente.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Lo que realmente le cuesta un falso positivo a un estudiante

Esto le ocurrió a un estudiante de Executive MBA en la School of Management de Yale. Al estudiante se le imputó una infracción, en el sentido más literal posible. El detector implicado fue GPTZero. El examen final del estudiante en un curso de finanzas había sido señalado por un asistente docente que pensó que la redacción era larga y elaborada, con puntuación y gramática casi perfectas. Y este profesor en particular lo estaba pasando por GPTZero, que calificó las respuestas como probablemente generadas por IA.

Reprobó la asignatura y fue suspendido durante un año. Su demanda, presentada ante un tribunal federal en febrero de 2025, sostiene que la propia política de Yale restringe el uso de herramientas como GPTZero precisamente por esta razón, su tasa documentada de falsos positivos contra hablantes no nativos de inglés, y que él la utilizó en contra de esa política. Su escrito también cita que GPTZero devolvió una puntuación del 100 por ciento de generada por IA en escritos académicos del propio ex presidente de la universidad de Yale y del decano de la escuela de negocios.

El juez se negó a dictar una medida cautelar temprana en mayo de 2025. El caso aún no se ha resuelto, al momento de escribir esto. El demandante, ciudadano francés, sostiene que el mismo sesgo conocido contra los hablantes no nativos de inglés hizo que su escritura se comportara de la manera en que lo hizo. Eso es lo que examinamos en la siguiente sección. Lo que no está en debate es el costo, un año perdido de un programa de grado, una calificación reprobatoria, gastos legales y varios meses de disputa por una puntuación en lugar de obtener un título. Una tasa de falsos positivos del 1 por ciento parece pequeña hasta que una población grande la convierte en algo específico.

¿Por qué los detectores de IA clasifican erróneamente a los hablantes no nativos de inglés?

Mal, y por un margen amplio. Esa es la conclusión del estudio que primero le puso una cifra. Investigadores de Stanford evaluaron siete detectores de GPT de uso extendido frente a 91 ensayos de TOEFL escritos por hablantes no nativos de inglés y 88 ensayos de alumnos de octavo grado de Estados Unidos. Los detectores leyeron correctamente casi siempre los ensayos de octavo grado. Cuando se trató de los ensayos de TOEFL, escritos por adultos lo bastante fluidos como para presentar una prueba de inglés de nivel de posgrado, los detectores arrojaron en promedio una tasa de falsos positivos del 61.3 por ciento. Ochenta y nueve de los 91 ensayos fueron marcados como generados por GPT por al menos uno de los siete detectores, 18 de esos ensayos fueron marcados por los siete detectores.

El mecanismo es el mismo que rige el resto de la detección: el vocabulario predecible y una construcción oracional más simple se leen como baja perplexity, y la baja perplexity se lee como producida por una máquina, independientemente de quién tenga la pluma. Los escritores que trabajan en una segunda lengua se apoyan en formulaciones bien establecidas porque así es como realmente se manifiesta la fluidez en una lengua adicional, y ese es precisamente el perfil que un detector fue construido para señalar.

Los escritores en esa situación no se benefician de un consejo que les diga simplemente que escriban de forma más natural, ya que lo natural es exactamente lo que fue señalado. La página de TextPulse para escritores académicos de ESL aborda con más detalle los patrones de formulación que hay detrás de ese riesgo, incluido qué los modifica sin cambiar lo que significa la oración.

Este no fue un caso aislado. En diciembre de 2025, se publicó un nuevo benchmark, diseñado explícitamente para evaluar el sesgo en estos detectores. Incluía más de 200,000 muestras en múltiples grupos demográficos y lenguas. A pesar de haberse publicado dos años después del primer estudio de Stanford e incluir muchas versiones distintas de los mismos detectores, este benchmark reveló que el sesgo hacia los aprendices de inglés sigue presente.

Este no es el caso de todos los proveedores. La propia documentación técnica de Pangram afirma que su clasificador no está sesgado contra hablantes no nativos de inglés. Los investigadores de Chicago Booth no probaron esta afirmación de manera independiente, pero sí muestra que la generación más reciente de detectores se está construyendo teniendo en cuenta el problema, en lugar de ignorarlo.

Si quiere ver dónde se sitúa su propia escritura antes de que otra persona la puntúe, un comprobador gratuito de perplexity le da el mismo número subyacente que calcularía un detector, sin enviar nada primero a una institución.

Quién más es señalado, y por qué

Los hablantes de inglés no nativos soportan el mayor riesgo documentado, pero la misma lógica estadística también detecta otros textos. El equipo de Weber-Wulff encontró que las 14 herramientas que probaron fueron menos precisas cuando las aplicaron a textos parafraseados, esto describe una parte significativa de la escritura académica que ha pasado por un corrector, un editor o la corrección en rojo de un supervisor antes de que alguien ejecute un detector sobre ella.

Nada de esto significa que el número sea sin sentido, solo que necesita corroboración antes de que signifique algo sobre una persona concreta. Si tiene un texto que se lee como uniforme, con longitudes de oración similares y un ritmo similar en todo momento, obtendrá una puntuación más parecida a la de una máquina, independientemente de quién lo haya escrito o por qué. Esto puede comprobarse directamente con un free burstiness checker en lugar de adivinarlo.

Cómo es una política de detección de IA defendible

Yale ya tenía una política que, según se informa, restringe herramientas como GPTZero, por razones muy cercanas a las que este artículo ha expuesto, una tasa documentada de falsos positivos y un sesgo documentado contra quienes escriben en inglés no nativo. Así que esto no es tanto la historia de un estudiante desafortunado como la de una norma existente que no se estaba aplicando. Cuando una política hace cumplir de verdad la diferencia entre una puntuación y un veredicto, entonces una puntuación pasa a ser una entrada más, en lugar de un veredicto.

  • Trate la puntuación como una entrada más, nunca como la única base para una conclusión de mala conducta
  • Informe a los estudiantes de la tasa de falsos positivos publicada de la herramienta antes de usarla contra ellos
  • Aplique especial cautela a las entregas breves y a la escritura en inglés no nativo, ambos puntos débiles documentados
  • Garantice una vía de apelación que no requiera refutar una estadística

Nada de esto es exótico. Se parece más a la forma en que debería tratarse cualquier prueba forense aislada en cualquier otro contexto, útil, verificable y nunca suficiente por sí sola.

Para un escritor individual, el mismo principio se aplica antes de que exista una puntuación, no después. Un solo número, de cualquier herramienta, es una estimación y no un veredicto, y tratarlo como certeza en cualquiera de las dos direcciones, seguro o detectado, exige al número más de lo que puede sostener.

La propia herramienta humanizadora de IA de TextPulse informa una puntuación humana según esa misma lógica: una estimación calculada a partir de su propio texto, no un veredicto de un detector sobre él, útil como señal de cómo se lee actualmente un borrador más que como una promesa sobre lo que dirá cualquier detector específico.

La cuestión de la exactitud se divide en otras más concretas, cada una con su propia página. La tasa con la que los detectores señalan textos humanos se trata por separado, al igual que la evidencia específica sobre la tasa de falsos positivos de Turnitin y sobre la exactitud de ZeroGPT. Si ya se ha usado una puntuación en su contra, hay apartados prácticos sobre qué hacer cuando se le acusa de usar IA, sobre la evidencia que puede reunir para demostrar que no usó IA, y sobre cómo redactar una carta de apelación que responda a la puntuación en sus propios términos.

El número de cualquier informe seguirá cambiando a medida que los proveedores reentrenen sus modelos y los investigadores sigan probándolos frente a casos más difíciles. Pero lo que no debería cambiar es el hábito que hay debajo: leer una puntuación como una medida entre varias, preguntar sobre qué población se validó y preguntar qué no está diciendo el proveedor sobre los casos en los que todavía se equivoca.

Frequently Asked Questions

Sí. Weber-Wulff y colegas encontraron que las herramientas de detección de IA eran 'ni precisas ni fiables' en una comparación de 2023, y los escritores no nativos de inglés afrontan el mayor riesgo documentado, con un estudio que halló una tasa media de falsos positivos superior al 60 por ciento en ensayos TOEFL. Una sola puntuación no prueba nada por sí sola, por eso nunca debe ser la única evidencia detrás de una acusación.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.