AI Detection

¿Son precisos los detectores de IA? Falsos positivos y sesgo

Los proveedores publican tasas de falsos positivos inferiores al 1 por ciento. Investigadores independientes que probaron los mismos detectores en escritura en inglés de no nativos hallaron tasas superiores al 60 por ciento. Esto es lo que muestran las pruebas.

Actualizado el 13 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin afirma que su tasa de falsos positivos es inferior al 1%. Un grupo de investigadores independientes probó varios detectores en una gama más amplia de muestras de escritura de hablantes no nativos de inglés. Encontraron que la tasa media de falsos positivos era superior al 60% en ese mismo tipo de escritura. Ambas cifras son reales, ambas fueron publicadas y ambas se refieren a detectores que se venden en el mismo mercado. ¿Son precisos los detectores de IA? Depende de qué población se haya probado, qué detector se haya usado y cómo lo definió su proveedor en primer lugar.

Esta entrada no volverá a explicar cómo calcula un detector esa puntuación. El mecanismo, la perplejidad, la probabilidad de los tokens, cómo se entrena el clasificador, está explicado en detalle en otro lugar, y conviene leerlo primero si no lo ha hecho. Lo que importa aquí es qué ocurre una vez que existe la puntuación, con qué frecuencia se equivoca, sobre la escritura de quién se equivoca con mayor frecuencia y qué cuesta en realidad una acusación falsa a alguien que no hizo nada mal.

¿Son precisos los detectores de IA?

No de forma consistente, y la brecha entre las afirmaciones de marketing y las pruebas independientes está bien documentada. Un grupo de investigadores dirigido por Debora Weber-Wulff publicó sus hallazgos sobre 14 herramientas de detección, incluidas 12 gratuitas y dos comerciales, que se probaron con una mezcla de texto humano y texto de ChatGPT en 2023. Encontraron que ninguna de estas herramientas es precisa o fiable, con un sesgo incorporado para etiquetar el texto generado por máquina como humano, y no al revés. Dos de las herramientas comerciales incluidas en esta prueba fueron Turnitin y PlagiarismCheck. Todas las herramientas de esta prueba rindieron peor cuando el texto fue parafraseado.

Pero dos años después, las cosas no están estancadas. Un working paper de la Booth School de la University of Chicago, de Brian Jabarian y Alex Imas, sometió a prueba a tres recién llegados, Pangram, GPTZero y Originality.ai, y a un competidor de código abierto con casi 2,000 textos escritos por humanos procedentes de blogs, noticias, reseñas y ficción. En condiciones de prueba controladas, la mejor herramienta del conjunto nunca bajó del 99.8 percent de precisión y mantuvo su tasa de falsos positivos en un nivel bajo. El modelo de código abierto rindió tan bien como un adivinador aleatorio. Las cosas realmente han mejorado. Más o menos. Un poco.

Pero el problema es la palabra controladas. Los pasajes de referencia son limpios, completos y producidos bajo condiciones conocidas. Un ensayo presentado no es ninguna de esas cosas de manera fiable. Los resultados en el mundo real pueden no ser idénticos a los resultados de laboratorio, como el propio chief product officer de Turnitin ha dicho públicamente, aunque esa es una admisión rara y útil por parte de un proveedor. La siguiente sección coloca las cifras del proveedor junto a las independientes para que la brecha sea visible en lugar de simplemente afirmada.

Reclamaciones del proveedor frente a pruebas independientes

La tabla siguiente alinea lo que cuatro detectores afirman sobre sí mismos con lo que midieron investigadores independientes cuando probaron las herramientas directamente. Lea juntas las dos columnas centrales, no solo la columna del proveedor.

DetectorPrecisión declarada por el proveedorObservado de forma independienteLo que el proveedor dice sobre los falsos positivos
TurnitinUmbral de confianza del 98% antes de marcar; menos del 1% de falsos positivos a nivel de documentoAproximadamente 80% de precisión, la mejor de 12 herramientas en una comparación de 2023, en una versión anterior de la herramientaMenos del 1% a nivel de documento por encima de un umbral del 20% de texto escrito por IA; aproximadamente 4% a nivel de oración
GPTZero95.7% de detección de texto de IA con una tasa de falsos positivos del 1% en el benchmark independiente RAID96% de precisión en pasajes breves; tasa de falsos positivos inferior al 1% en un estudio de 2025 de la Booth School of Business de la University of ChicagoInforma de una tasa de falsos positivos del 1% en el benchmark RAID
Originality.ai99% de precisión; tasa de falsos positivos del 0.5% (modelo Lite), 1.5% (modelo Turbo)Tasa de falsos positivos inferior al 1%, pero omitió entre el 10% y el 40% del texto escrito por IA en el mismo estudio de BoothPublica cifras separadas de falsos positivos por nivel de modelo
PangramTasas de error que afirma que son más de 38 veces inferiores a las de herramientas competidoras; sostiene que no existe sesgo contra escritores de inglés no nativosPrecisión nunca inferior al 99.8%, tasa de falsos positivos cercana a cero, en el estudio de BoothSostiene tasas de falsos positivos cercanas a cero en 10 dominios textuales y 8 modelos de lenguaje

Dos cosas destacan. En primer lugar, todas las cifras del proveedor proceden de un laboratorio controlado por el proveedor y las cifras de Booth proceden de investigadores que no tienen nada que vender. En segundo lugar, Turnitin no aparece en absoluto en esa columna intermedia, ya que el estudio de 2025 no lo probó. En la tabla, su cifra independiente se basa en una comparación anterior de 2023, pero se realizó sobre una versión más antigua de la herramienta, así que recuerde esto al mirar la tabla como una comparación equivalente.

¿Qué tan precisa es la detección de IA de Turnitin?

Turnitin no publica una sola cifra de precisión. Publica, en cambio, un umbral y una compensación. La empresa ha dicho que solo marca un documento cuando tiene un 98 percent de confianza de que la parte señalada está escrita por AI, y que este umbral es lo que mantiene la tasa de falsos positivos a nivel de documento por debajo del 1 percent. Turnitin ha estimado que detecta aproximadamente el 85 percent de la escritura asistida por AI, dejando pasar deliberadamente el resto en lugar de arriesgar una acusación errónea.

El porcentaje real de falsos positivos que Turnitin devuelve a nivel de oración, donde una interfaz resalta líneas concretas en lugar de un documento completo, en realidad se acerca más al 4 percent. Este es el dato que conviene conocer si un profesor hace una captura de pantalla de un solo párrafo señalado en lugar de una puntuación de documento completo, porque una oración resaltada conlleva una probabilidad significativamente mayor de ser errónea que la puntuación del documento que aparece junto a ella.

También conviene señalar que Turnitin ha reconocido directamente esta diferencia. Encontraron que sus primeros resultados en condiciones reales, especialmente para documentos más cortos, tenían tasas de falsos positivos más altas de lo que se esperaba a partir de sus pruebas de laboratorio. Por ello, ajustaron la longitud mínima del documento para ser evaluado de 150 a 300 words. Eso es un proveedor ajustando su propio producto porque la cifra publicada no se sostuvo fuera del laboratorio, lo cual dice tanto como cualquier estudio independiente.

Lo que realmente le cuesta a un estudiante un falso positivo

Esto le ocurrió a un estudiante de Executive MBA en la School of Management de Yale. El estudiante fue acusado de una infracción, en el sentido más literal posible. El detector implicado fue GPTZero. El examen final del estudiante en un curso de finanzas había sido señalado por un asistente docente que pensó que la redacción era larga y elaborada, con puntuación y gramática casi perfectas. Y este profesor en particular lo estaba pasando por GPTZero, que calificó las respuestas como probablemente generadas por AI.

Reprobó la asignatura y fue suspendido durante un año. Su demanda, presentada ante un tribunal federal en febrero de 2025, sostiene que la propia política de Yale restringe el uso de herramientas como GPTZero precisamente por esta razón, su tasa documentada de falsos positivos contra hablantes no nativos de inglés, y que él la utilizó en contra de esa política. Su escrito también cita que GPTZero devolvió una puntuación del 100 percent generada por IA en textos académicos del propio ex presidente de la universidad de Yale y del decano de la escuela de negocios.

El juez se negó a dictar una medida cautelar temprana en mayo de 2025. El caso aún no se ha resuelto, mientras escribo esto. El demandante, ciudadano francés, sostiene que el mismo sesgo conocido contra los hablantes no nativos de inglés hizo que su escritura rindiera de la manera en que lo hizo. Eso es lo que examinamos en la siguiente sección. Lo que no está en debate es el precio: un año perdido de un programa de grado, una calificación suspensa, gastos legales y varios meses luchando por una puntuación en lugar de obtener un título. Una tasa de falsos positivos del 1 percent parece pequeña hasta que una gran población la convierte en algo específico.

Humanice su propio trabajo

Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.

Empezar gratis

Qué rasgos de la escritura hacen que el texto humano parezca generado por máquina

Cuatro tipos de escritura ordinaria conllevan el mayor riesgo, y ninguno de ellos implica que una persona esté haciendo algo mal. Los documentos breves, la escritura muy formulaica, el material citado o basado en plantillas, y la escritura que ha sido corregida con esmero tienden todos a obtener una puntuación de mayor previsibilidad que la prosa compuesta libremente, que es la única propiedad que en realidad mide cualquier detector. Un comprobador gratuito de burstiness mide directamente esa misma variación, lo que constituye una forma más rápida de ver el patrón que leer una descripción de él.

Algunos géneros son formulaicos por diseño. Una sección de métodos, un informe de laboratorio, una carta de presentación estándar y una revisión de la literatura recompensan la frase convencional por encima de la inventiva, porque la convención es lo que hace que el documento sea utilizable para su lector. Los investigadores probaron esto directamente sobre escritura real: analizaron 14,400 resúmenes de revistas publicados entre 1980 y 2023, años antes de que existiera cualquier modelo de lenguaje grande, mediante un detector disponible públicamente. Hasta un 8 percent fueron señalados como generados por IA independientemente del año de publicación, y los resúmenes del New England Journal of Medicine fueron señalados en un 10.24 percent, la tasa de falsos positivos más alta de las cinco revistas analizadas.

La prueba no podría haber estado detectando nada sobre ChatGPT, ya que ChatGPT no existía durante la mayor parte de los años que muestreó. Detectó el género. Más formalmente, como diría el análisis estadístico de 2026 del problema de detección, no hay manera de construir un detector que distinga entre una oración que es predecible porque fue escrita por software y una oración que es predecible porque es el tipo de cosa que se escribe en su género. Desde fuera, se ven exactamente igual.

Una edición intensa empuja en una dirección similar. Un primer borrador conserva las irregularidades específicas de un escritor, el orden de palabras inusual, la oración que se alarga porque también lo hizo el pensamiento. Una revisión minuciosa, especialmente una realizada con otra herramienta, tiende a suavizar precisamente esas irregularidades. La mayor comparación independiente de herramientas de detección hasta la fecha probó 14 de ellas y encontró que la precisión disminuía aún más, para todas las herramientas, una vez que el texto de muestra había sido parafraseado o traducido automáticamente.

Rasgo de escrituraPor qué reduce la imprevisibilidad aparente de un documentoQué muestran las pruebas
Envíos brevesMenos texto deja menos margen para la variación natural que separa el ritmo humano del ritmo de la máquinaLas puntuaciones de los documentos breves fluctúan más por la fuerza de unas pocas frases inusuales
Escritura formulaica o específica de una disciplinaLa convención del género recompensa la frase esperada por encima de la inventiva14,400 resúmenes de revistas anteriores a ChatGPT (1980 a 2023) siguieron activando hasta un 8% de falsos positivos, los resúmenes de una revista alcanzaron el 10.24%
Borradores muy editados o parafraseadosUna pasada de pulido suaviza las irregularidades individuales que un detector lee como humanasUna comparación independiente de 14 herramientas encontró que la precisión disminuía aún más después de la paráfrasis o la traducción automática
Material citado o basado en plantillasEl pasaje citado lleva la firma estadística de su fuente, no la del autor que citaLos detectores que no excluyen las citas puntúan el documento circundante a partir de texto prestado

¿Por qué los detectores de IA clasifican erróneamente a los hablantes no nativos de inglés?

Mal, y por un margen amplio. Esa es la conclusión del estudio que primero le puso una cifra. Investigadores de Stanford aplicaron siete detectores de GPT de uso extendido a 91 ensayos de TOEFL escritos por hablantes no nativos de inglés y a 88 ensayos de alumnos de octavo grado de Estados Unidos. Los detectores leyeron correctamente casi siempre los ensayos de octavo grado. En el caso de los ensayos de TOEFL, escritos por adultos lo bastante fluidos como para realizar una prueba de inglés de nivel de posgrado, los detectores arrojaron una tasa media de falsos positivos del 61.3 percent. Ochenta y nueve de los 91 ensayos fueron señalados como generados por GPT por al menos uno de los siete detectores, 18 de esos ensayos fueron señalados por los siete detectores.

El mecanismo es el mismo que rige el resto de la detección: el vocabulario predecible y una construcción oracional más simple se leen como baja perplexity, y la baja perplexity se lee como texto generado por máquina, independientemente de quién tenga la pluma. Los escritores que trabajan en una segunda lengua se apoyan en formulaciones bien establecidas porque así es como realmente se manifiesta la fluidez en una lengua adicional, y ese es precisamente el perfil que un detector fue construido para señalar.

Los escritores en esa situación no se benefician de un consejo que les diga simplemente que escriban de manera más natural, ya que lo natural es exactamente lo que fue señalado. La página de TextPulse para escritores académicos de ESL aborda con más detalle los patrones de formulación que hay detrás de ese riesgo, incluido qué los modifica sin cambiar lo que significa la oración.

Este no fue un caso aislado. En diciembre de 2025, se publicó un nuevo benchmark, diseñado explícitamente para evaluar el sesgo en estos detectores. Incluía más de 200,000 muestras en múltiples demografías y lenguas. A pesar de haberse publicado dos años después del primer estudio de Stanford e incluir muchas versiones distintas de los mismos detectores, este benchmark reveló que el sesgo hacia los aprendices de inglés sigue presente.

Este no es el caso de todos los proveedores. La propia documentación técnica de Pangram afirma que su clasificador no está sesgado contra hablantes no nativos de inglés. Los investigadores de Chicago Booth no probaron esta afirmación de forma independiente, pero sí muestra que la generación más reciente de detectores se está construyendo teniendo en cuenta el problema, en lugar de ignorarlo.

Si quiere ver dónde se sitúa su propia escritura antes de que otra persona la evalúe, un comprobador gratuito de perplexity le da el mismo número subyacente que calcularía un detector, sin enviar nada primero a una institución.

Quién más es señalado, y por qué

Los hablantes no nativos de inglés soportan el mayor riesgo documentado, pero la misma lógica estadística también detecta otros textos. El equipo de Weber-Wulff encontró que las 14 herramientas que probaron fueron menos precisas cuando las aplicaron a textos parafraseados, esto describe una parte significativa de la escritura académica que ha pasado por un corrector, un editor o la corrección en rojo de un supervisor antes de que alguien ejecute un detector sobre ella.

Nada de esto significa que el número sea insignificante, solo que necesita corroboración antes de que signifique algo sobre una persona concreta. Si tiene un texto que se lee como uniforme, con longitudes de frase similares y un ritmo parecido en todo momento, obtendrá una puntuación más parecida a la de una máquina, independientemente de quién lo haya escrito o por qué. Esto puede comprobarse directamente con un free burstiness checker en lugar de suponerlo.

Un segundo grupo, menos discutido, afronta un problema relacionado. Los investigadores compararon aproximadamente 60,000 publicaciones de Reddit, divididas entre un subconjunto identificado como probablemente escrito por autores autistas y una muestra general, y pasaron ambas por un detector basado en GPT-2. Ambos grupos se mantuvieron por debajo del 2 percent en total de marcados, pero el subconjunto probablemente autista fue marcado a una tasa significativamente más alta que la muestra general. La escritura que se inclina hacia una formulación literal, repetitiva y de patrones estrechos, un rasgo documentado de algunos estilos de comunicación autista, produce exactamente el texto de baja variación que un detector está diseñado para captar.

Por qué una puntuación segura no es una acusación segura

Tasa de falsos positivos parece referirse a la probabilidad de que un estudiante señalado como problemático sea inocente. Pero no. Describe cómo funciona una prueba para todas las personas que la realizan. Y esas son preguntas distintas con respuestas distintas, igual que ocurre con cualquier prueba de cribado en medicina o seguridad.

Un análisis estadístico de marzo de 2026 de un investigador de Griffith University hace explícita la matemática subyacente. Si se trata la detección de IA como una prueba aplicada a una población de estudiantes escritores, en lugar de a un documento aislado, aparece una compensación: siempre que una parte de esa población escriba de un modo que se solape de forma natural con la salida típica de IA, cerca de la convención del género, cerca del rango de un aprendiz de segunda lengua, cualquier detector con capacidad real para detectar trabajo escrito por IA debe fallar en parte de ese segmento solapado. No se trata de una afirmación sobre un detector concreto mal construido. Es una propiedad de evaluar una población diversa con un solo documento y sin ninguna otra evidencia.

El propio ejemplo ilustrativo del artículo muestra la magnitud implicada. Supongamos que el 10 percent de una población estudiantil escribe lo bastante cerca de la salida típica de IA, y que un detector está ajustado para detectar el 80 percent del trabajo realmente escrito por IA. La matemática entonces exige una tasa media de falsos positivos de al menos 7.5 percent en esa población. Eso no es un defecto de la ingeniería del detector, es una consecuencia directa de cuánto se solapa estadísticamente la escritura de ese grupo con aquello que se está detectando.

Escalado a una universidad de 10,000 estudiantes, ese límite inferior por sí solo implica aproximadamente 750 falsas alertas en toda la población, una consecuencia matemática de evaluar una población diversa frente a un solo documento sin ninguna otra evidencia que ponderar. El autor del artículo es explícito al señalar que estas cifras concretas son ilustrativas y no medidas en una institución real. El ejemplo demuestra la forma del problema, no una predicción específica para un campus determinado.

Cómo es una política defendible de detección de IA

Yale ya tenía una política que, según se informa, restringe herramientas como GPTZero, por razones muy cercanas a las que este artículo ha expuesto: una tasa documentada de falsos positivos y un sesgo documentado contra escritores de inglés no nativos. Así que esto no es tanto la historia de un estudiante desafortunado como la de una norma existente que no se estaba cumpliendo. Cuando una política hace cumplir de verdad la diferencia entre una puntuación y un veredicto, entonces una puntuación pasa a ser una entrada más, en lugar de un veredicto.

  • Trate la puntuación como una entrada más, nunca como la única base para una conclusión de mala conducta
  • Divulgue a los estudiantes la tasa de falsos positivos publicada por la herramienta antes de usarla contra ellos
  • Aplique especial cautela a las entregas breves y a la escritura en inglés de hablantes no nativos, ambos puntos débiles documentados
  • Garantice una vía de apelación que no requiera refutar una estadística

Nada de esto es exótico. Se parece más a la forma en que cualquier prueba forense aislada debería tratarse en cualquier otro contexto, útil, verificable y nunca suficiente por sí sola.

Para un escritor individual, el mismo principio se aplica antes de que exista una puntuación, no después. Un solo número, de cualquier herramienta, es una estimación y no un veredicto, y tratarlo como certeza en cualquiera de las dos direcciones, seguro o descubierto, exige al número más de lo que puede sostener.

La propia herramienta AI humanizer de TextPulse informa una Puntuación Humana con esa misma lógica, una estimación calculada a partir de su propio texto, no un veredicto de un detector sobre él, útil como señal de cómo se lee actualmente un borrador más que como una promesa sobre lo que dirá cualquier detector específico.

La cuestión de la precisión se divide en otras más estrechas, cada una con su propia página. La evidencia específica sobre la tasa de falsos positivos de Turnitin y sobre la precisión de ZeroGPT se trata por separado. Si ya se ha usado una puntuación en su contra, hay piezas prácticas sobre qué hacer cuando se le acusa de usar AI, sobre la evidencia que puede reunir para demostrar que no usó AI, y sobre cómo escribir una carta de apelación que responda a la puntuación en sus propios términos.

El número de cualquier informe seguirá cambiando a medida que los proveedores reentrenen sus modelos y los investigadores sigan poniéndolos a prueba con casos más difíciles. Pero lo que no debería cambiar es el hábito que lo sustenta: leer una puntuación como una medición entre varias, preguntar sobre qué población se validó y preguntar qué no está diciendo el proveedor sobre los casos en los que todavía se equivoca.

XLinkedInFacebook

Preguntas frecuentes

Sí. Weber-Wulff y colegas encontraron que las herramientas de detección de IA eran 'ni precisas ni fiables' en una comparación de 2023, y los escritores no nativos de inglés afrontan el mayor riesgo documentado, con un estudio que halló una tasa media de falsos positivos superior al 60 por ciento en ensayos TOEFL. Una sola puntuación no prueba nada por sí sola, por eso nunca debe ser la única evidencia detrás de una acusación.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Manténgase al día sobre la humanización de IA

Reciba en su correo consejos sobre escritura académica, detección de IA y humanización.

Sin spam. Darse de baja en cualquier momento.