AI Detection

Por qué los detectores de IA están sesgados contra los escritores no nativos de inglés

Un estudio de Stanford de 2023 encontró que los detectores de IA leían erróneamente la escritura fluida en inglés de hablantes no nativos como si fuera generada por máquina a una tasa mucho mayor que la escritura de hablantes nativos. Aquí se explica el mecanismo detrás de esa diferencia y lo que ocurrió cuando los mismos ensayos se reescribieron con un vocabulario más rico.

Actualizado el 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

Los detectores de IA sesgados contra hablantes no nativos no es una queja subjetiva. Un estudio de Stanford revisado por pares de 2023 lo midió directamente. Los investigadores aplicaron siete detectores de GPT de uso extendido a 91 ensayos reales de TOEFL escritos por hablantes no nativos de inglés y a 88 ensayos escritos por alumnos estadounidenses de octavo grado, y luego compararon cómo puntuó cada grupo.

Los detectores leyeron correctamente casi siempre los ensayos de octavo grado. En los ensayos de TOEFL, escritos por adultos que ya habían aprobado un examen de competencia en inglés de nivel de posgrado, las mismas siete herramientas arrojaron una tasa media de falsos positivos del 61.22 percent. Ochenta y nueve de los noventa y un ensayos, casi el 98 percent, fueron señalados como generados por IA por al menos una de las siete herramientas.

La visión general de TextPulse sobre la evidencia más amplia sobre la precisión de los detectores de IA recoge ese hallazgo principal y las demandas judiciales en las que desde entonces ha influido. Lo que casi siempre se omite cuando se cita el estudio es el mecanismo: por qué la prosa de una persona con competencia en inglés de nivel de posgrado se lee, en primer lugar, como si estuviera hecha por una máquina, y qué cambia cuando deja de leerse así.

Detectores de IA sesgados contra hablantes no nativos, el mecanismo

Un detector nunca lee el significado. Lee cuán predecible es cada palabra, dadas las palabras que la precedieron, y asigna una puntuación baja a un pasaje cuando el modelo podría haber adivinado la mayor parte de él de antemano. La diversidad léxica, cuán amplio es el vocabulario del que se sirve un autor en lugar de repetir un conjunto más reducido de palabras seguras, y la predictibilidad sintáctica, cuán estrechamente sigue la estructura de la oración el patrón más común de la lengua en lugar de variarlo, son dos propiedades de la producción lingüística que reducen esa puntuación.

La distinción importa porque ambas aparecen de manera diferente en la página. La diversidad léxica se refiere a las palabras mismas: un autor que recurre a 'obtain,' 'acquire,' y 'secure' en tres oraciones distintas se lee como más variado que uno que escribe 'get' tres veces, incluso cuando las oraciones son por lo demás idénticas. La previsibilidad sintáctica se refiere a la estructura: sujeto, verbo, objeto, repetidos una y otra vez, en lugar de una oración que comienza con una cláusula subordinada o termina con una palabra inesperada. Un escritor de segunda lengua que trabaja en condiciones de examen tiene todas las razones para optar por la versión más segura de ambas.

La escritura en segunda lengua muestra de forma fiable menos de ambas, y no como una deficiencia. Un autor que opera en una lengua adicional se apoya en el vocabulario y en los patrones oracionales que tienen más probabilidades de ser correctos, porque equivocarse cuesta más cuando la lengua aún no es plenamente automática. El artículo de Stanford que documentó el sesgo del detector cita un conjunto de investigaciones de lingüística aplicada sobre exactamente este patrón, establecido mucho antes de que existieran los detectores de IA: se documentan rasgos medibles de la escritura en segunda lengua, como la riqueza léxica reducida, la diversidad léxica reducida y una estructura oracional más simple, en lugar de una señal de otra cosa.

Esa brecha entre la escritura nativa y la no nativa aparece como una diferencia de perplexity, la misma medida que ejecuta un detector para decidir si un pasaje fue generado por máquina. Una perplexity más baja se lee como más parecida a la de una máquina, independientemente de quién la haya producido, y la escritura no nativa se sitúa más abajo en esa escala por razones que no tienen nada que ver con un chatbot. Si esa brecha es realmente lo que impulsa a los detectores, en lugar de una coincidencia, es una cuestión comprobable. El equipo de Stanford la puso a prueba directamente.

Qué ocurrió cuando los mismos ensayos se reescribieron con un vocabulario más rico

Los investigadores tomaron los mismos 91 ensayos de TOEFL que habían provocado una tasa media de falsos positivos del 61.22 percent y pidieron a ChatGPT que los revisara mediante una sola instrucción: "Enhance the word choices to sound more like that of a native speaker." No se indicó cambiar nada del contenido, el argumento ni la gramática. Después de esa única edición, la tasa media de falsos positivos en los mismos siete detectores cayó al 11.77 percent, una disminución de casi cincuenta puntos porcentuales, y el número de ensayos que todos los detectores señalaron unánimemente bajó de dieciocho a uno.

Después, los investigadores invirtieron el experimento. Tomaron los 88 ensayos de octavo grado escritos por hablantes nativos, que los detectores habían calificado correctamente casi siempre al principio, y pidieron a ChatGPT que simplificara sus elecciones léxicas como si hubieran sido escritos por un hablante no nativo. La tasa media de falsos positivos en esos mismos ensayos escritos por nativos pasó del 5.19 percent al 56.65 percent. Los ensayos no cambiaron de autoría. Solo cambió el vocabulario, y los detectores siguieron el vocabulario.

Perplexity se movió en paralelo con la tasa de clasificación errónea en ambas direcciones: aumentó bruscamente cuando los ensayos de TOEFL se enriquecieron, y descendió bruscamente cuando los ensayos de octavo grado se simplificaron. Los autores extraen de ello una conclusión tajante: aquello a lo que los detectores respondían en realidad nunca fue la autoría. Fue la elección de palabras, una propiedad que el vocabulario de cualquier escritor puede transmitir con independencia de dónde aprendió inglés.

¿Hasta qué punto es coherente el sesgo entre distintos detectores?

Los siete detectores no coincidieron en mucho, salvo en la dirección en que se producía el error. Todos señalaron ensayos de TOEFL con mucha más frecuencia que ensayos de octavo grado, pero con márgenes muy distintos.

DetectorTasa de falsos positivos, ensayos TOEFLTasa de falsos positivos, ensayos de hablantes nativos
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Estas son cifras de 2023, medidas sobre las herramientas tal como existían entonces. Desde entonces, varias han cambiado por completo: OpenAI cerró su propio detector en julio de 2023, cuatro meses después de esta prueba, tras comprobar que solo identificaba correctamente el 26 por ciento del texto real escrito por IA, mientras seguía etiquetando erróneamente el 9 por ciento de la escritura humana. Lo que no ha cambiado es la dirección de la brecha. Un referente de sesgo más amplio, construido específicamente para probar detectores en categorías demográficas y lingüísticas, publicado en diciembre de 2025 y aplicado a cuatro herramientas de código abierto más recientes, seguía informando de una recuperación sistemáticamente menor para los grupos de escritores infrarrepresentados.

Humanice su propio trabajo

Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.

Empezar gratis

¿Sigue apareciendo este sesgo en detectores más recientes?

El estudio de Stanford ya tiene varias generaciones de IA de antigüedad, y sus propios autores señalaron la limitación ellos mismos: una pequeña muestra piloto, y detectores construidos sobre todo a partir de GPT-2, un modelo mucho más pequeño y antiguo que el que impulsa la detección hoy. Eso plantea una pregunta legítima. ¿Ha cerrado la brecha una tecnología mejor?

El test dedicado más reciente dice que todavía no. En un estudio de febrero de 2026 de la Sultan Qaboos University, los investigadores probaron dos detectores comerciales actuales, Turnitin y Originality, frente a 192 textos que mezclaban escritura auténtica de estudiantes de EFL anterior a ChatGPT, escritura humana profesional, texto generado por IA y texto híbrido humano-IA. Los resultados mostraron una precisión global del 69 percent y del 61 percent para las dos herramientas, y la precisión en la categoría híbrida, el tipo de escritura que realmente produce una pasada de edición, cayó casi a cero. El mismo estudio también reveló un segundo sesgo que operaba junto al sesgo lingüístico: la precisión en la escritura científica fue entre 28 y 38 puntos porcentuales inferior a la de la escritura de humanidades.

Ninguno de los dos hallazgos se refiere a un único producto defectuoso. Dos arquitecturas distintas de detectores, probadas con tres años de diferencia sobre corpus diferentes por equipos de investigación distintos, siguen llegando al mismo resultado: la escritura moldeada por la convención de género o por una segunda lengua se sitúa más cerca de lo que estas herramientas llaman hecho por máquina que la escritura que no lo está. Las herramientas gratuitas de TextPulse permiten a un autor comprobar ese mismo perfil estadístico antes de que llegue al detector de una institución.

La evidencia independiente de que la brecha es real, no un artefacto de prueba

El primer problema con los resultados del TOEFL es que podría sostenerse que solo se aplican a un pequeño estudio piloto de 2023. El mismo equipo de investigación respondió a esto en otro estudio que utilizó datos que no tienen nada que ver con los detectores. Examinaron 1,574 artículos aceptados en ICLR 2023, una importante conferencia de aprendizaje automático, restringiendo la muestra a resúmenes enviados y revisados antes de que existiera ChatGPT.

Los autores con base en países donde el inglés no es la lengua principal escribieron resúmenes con una perplejidad significativamente menor que los autores con base en países de habla inglesa nativa, y la diferencia se mantuvo incluso después de controlar cuán alta había sido la calificación de cada artículo por parte de los revisores. Esta muestra no pudo haber sido moldeada por nadie que intentara sonar más o menos como un chatbot. ChatGPT estaba a tres meses de su lanzamiento cuando se cerró la ventana de envío. La brecha de perplejidad entre la escritura académica nativa y no nativa no es algo que los detectores inventaran. Es algo que heredaron.

Un análisis estadístico de 2026 sobre la detección de IA como problema de prueba ofrece una versión formal de la misma conclusión. Siempre que un grupo de escritores produce un lenguaje que se solapa, en conjunto, con la salida típica de la IA, cualquier detector con capacidad real para detectar texto escrito por IA debe arrastrar una tasa más alta de falsos positivos para ese grupo en particular, una propiedad matemática de evaluar a una población diversa y no un defecto de una herramienta concreta. Los escritores no nativos de inglés son el caso documentado más claro de ese solapamiento exacto.

Qué significa esto para los escritores en una segunda lengua

Nada de esto es un argumento para escribir menos como uno mismo. Es una razón para saber qué se está midiendo realmente antes de que llegue una puntuación. Si un detector lee su prosa como predecible, está detectando una propiedad estadística real de la escritura en segunda lengua, no una prueba de que usted usó una herramienta que no usó.

Los investigadores de Stanford que realizaron el estudio original señalan una implicación incómoda de su propio hallazgo: el mismo ajuste de vocabulario que reduce el riesgo de falsos positivos es también el tipo de revisión que un escritor podría querer por razones totalmente distintas, una formulación más clara, una palabra más precisa, con independencia de cualquier detector. La página de TextPulse para escritores académicos de ESL cubre cómo se ve ese tipo de revisión en oraciones reales, al margen de cualquier cosa relacionada con una puntuación de detección.

Los detectores más recientes están empezando a tener en cuenta este patrón de forma explícita. Pangram, uno de los participantes comerciales más recientes, afirma en su propia documentación técnica que su clasificador no está sesgado contra escritores de inglés no nativos, aunque esa afirmación procede del proveedor y no de pruebas independientes. Un comprobador de perplexity gratuito muestra la misma medición subyacente que cualquiera de estas herramientas calcula a partir de un texto, sin enviar antes el borrador a ningún sitio.

Dos acompañantes prácticos se sitúan en el mismo grupo: cuándo usar a, an y the, que es la fuente individual más común del patrón, y cómo sonar natural en la escritura académica en inglés de manera más general.

La investigación sigue acumulándose en la misma dirección dos años después, a través de distintos equipos, distintos detectores y distintos diseños de prueba. Lo que no ha avanzado al mismo ritmo es una respuesta institucional ampliamente adoptada: auditar un detector frente a una gama de escritores antes de confiar en él para cualquiera de ellos, en lugar de hacerlo después de que un estudiante concreto ya haya sido acusado. Hasta que eso se convierta en una práctica rutinaria, la carga de demostrar que una falsa acusación es errónea recae precisamente en los escritores que esta investigación dice que tienen más probabilidades de recibir una.

XLinkedInFacebook

Preguntas frecuentes

Que los detectores de IA están sesgados contra los hablantes no nativos es un hallazgo revisado por pares, no una especulación. Un estudio de Stanford de 2023 encontró que siete detectores GPT de uso extendido clasificaron erróneamente un promedio de 61.22 por ciento de ensayos reales de TOEFL como generados por IA, mientras que leyeron correctamente casi siempre los ensayos de hablantes nativos.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Manténgase al día sobre la humanización de IA

Reciba en su correo consejos sobre escritura académica, detección de IA y humanización.

Sin spam. Darse de baja en cualquier momento.