AI Detection

Falsos positivos de detector de IA: por qué se marca la escritura humana

Los proveedores publican tasas de falsos positivos cercanas al uno por ciento. Las pruebas independientes de las mismas herramientas, sobre distinta escritura, suelen encontrar otra cosa. Aquí se explica qué activa realmente una falsa alarma, y qué significa y qué no significa el número una vez existe.

7 min
AI detector false positive: table comparing writing traits, from short documents to heavy editing, that trigger false flags in human text

En 1982, el New England Journal of Medicine publicó un artículo sobre citomegalovirus en pacientes sometidos a trasplante de médula ósea. Pasó la revisión por pares y permaneció en el archivo durante cuatro décadas. En 2023, los investigadores lo sometieron a un detector de escritura de IA que OpenAI había publicado de forma pública, y la herramienta lo calificó como 99.96 percent probable de haber sido generado por IA, treinta y siete años antes de que existiera el modelo por el que supuestamente había sido escrito. Ese es un falso positivo de detector de IA en su forma más pura: un documento señalado como escrito por una máquina que no puede haber sido escrito por una máquina.

Ese ejemplo es extremo solo en su cronología. El patrón subyacente, un detector que lee como producido por máquina una prosa formularia y predecible, con independencia de quién la escribió o cuándo, aparece constantemente en envíos ordinarios: ensayos, cartas de presentación, informes de laboratorio, declaraciones personales. Este texto aborda qué causa un falso positivo, qué tipos de escritura están más expuestos y por qué una sola puntuación señalada no es la prueba que parece ser.

¿Qué es un falso positivo de detector de IA?

El falso positivo de detector de IA es un texto escrito por una persona que una herramienta de detección puntúa como generado por IA. No se está midiendo nada sobre el proceso, la honestidad o la habilidad de quien escribe. La herramienta compara la forma estadística de la oración, cuán predecibles son las elecciones léxicas y la estructura, con la forma que aprendió a asociar con la producción de una máquina.

Los proveedores informan tasas de falsos positivos como un único porcentaje pequeño, por lo general inferior al uno o dos por ciento. Esa cifra describe una prueba controlada sobre un conjunto de referencia construido por el proveedor, no una garantía sobre ningún documento individual. La cuestión más amplia de si los detectores de IA son precisos en absoluto ya se ha probado de manera independiente, y los resultados se sitúan en otro lugar por completo, a veces mucho más altos que cualquier cifra del proveedor. Este texto se mantiene más acotado: qué tipos de escritura elevan ese riesgo y qué puede y qué no puede decir una puntuación señalada a alguien.

¿Qué rasgos de la escritura hacen que un texto humano parezca producido por una máquina?

Cuatro tipos de escritura ordinaria conllevan el mayor riesgo, y ninguno de ellos implica que una persona esté haciendo algo incorrecto. Los documentos breves, la escritura muy formulaica, el material citado o basado en plantillas, y la escritura que ha sido corregida con esmero, todos tienden a obtener puntuaciones de mayor previsibilidad que la prosa compuesta libremente, que es la única propiedad que en realidad mide cualquier detector. Un comprobador gratuito de burstiness mide directamente esa misma variación, lo que es una forma más rápida de ver el patrón que leer una descripción de él.

Algunos géneros son formulaicos por diseño. Una sección de métodos, un informe de laboratorio, una carta de presentación estándar y una revisión de la literatura recompensan la frase convencional por encima de la inventiva, porque la convención es lo que hace que el documento sea utilizable para su lector. Los investigadores probaron esto directamente con escritura real: analizaron 14,400 resúmenes de revistas publicados entre 1980 y 2023, años antes de que existiera cualquier modelo de lenguaje grande, mediante un detector disponible públicamente. Hasta el 8 percent fueron señalados como generados por AI, independientemente del año de publicación, y los resúmenes del New England Journal of Medicine fueron señalados con un 10.24 percent, la tasa más alta de falsos positivos de las cinco revistas analizadas.

La prueba no podría haber estado detectando nada sobre ChatGPT, ya que ChatGPT no existía durante la mayor parte de los años que muestreó. Detectó el género. Más formalmente, como diría el análisis estadístico de 2026 del problema de detección, no hay manera de construir un detector que distinga entre una oración que es predecible porque fue escrita por software y una oración que es predecible porque es el tipo de cosa que se escribe en su género. Desde fuera, se ven exactamente iguales.

La edición intensa empuja en una dirección similar. Un primer borrador conserva las irregularidades específicas de quien escribe, el orden de palabras poco habitual, la frase que se alarga porque el pensamiento también lo hizo. Una revisión minuciosa, especialmente una realizada con otra herramienta, tiende a suavizar precisamente esas irregularidades. La comparación independiente más amplia de herramientas de detección hasta la fecha evaluó 14 de ellas y encontró que la precisión descendía aún más, en todas las herramientas, una vez que el texto de muestra había sido parafraseado o traducido automáticamente.

Rasgo de escrituraPor qué reduce la aparente imprevisibilidad de un documentoLo que muestra la evidencia
Envíos brevesMenos texto deja menos espacio para la variación natural que separa el ritmo humano del ritmo de la máquinaLas puntuaciones en documentos breves oscilan más por la fuerza de unas pocas frases inusuales
Escritura formularia o específica de una disciplinaLa convención del género premia la frase esperada por encima de la inventiva14,400 resúmenes de revistas anteriores a ChatGPT (1980 a 2023) siguieron activando hasta un 8% de falsos positivos, los resúmenes de una revista alcanzaron 10.24%
Borradores muy editados o parafraseadosUna pasada de pulido suaviza las irregularidades individuales que un detector lee como humanasUna comparación independiente de 14 herramientas encontró que la precisión descendía aún más después de la paráfrasis o la traducción automática
Material citado o basado en plantillasEl pasaje citado conserva la firma estadística de su fuente, no la de quien citaLos detectores que no excluyen las citas puntúan el documento circundante a partir del texto prestado

Humanice su propio artículo

Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.

Empezar gratis

Por qué las tasas publicadas y las tasas del mundo real no coinciden

Cada detector importante publica una tasa de falsos positivos cercana al uno por ciento o inferior. Las pruebas independientes de esas mismas herramientas, realizadas sobre documentos distintos y en condiciones diferentes, informan de manera rutinaria cifras mucho más altas, a veces por un factor de diez o más. Ambas cifras pueden ser exactas y, aun así, describir casi nada en común, porque no están midiendo lo mismo.

Turnitin es un ejemplo útil precisamente porque publica más detalle que la mayoría de sus competidores: una tasa de falsos positivos inferior al 1 por ciento a nivel de documento, siempre que más del 20 percent de una entrega sea señalada como escrita por IA, junto con una declaración de la empresa de que los resultados del mundo real difieren de sus propias pruebas de laboratorio. The Washington Post pasó 16 documentos reales por la misma herramienta en 2023 y encontró que más de la mitad volvieron al menos parcialmente mal identificados, incluido un ensayo enteramente escrito por humanos marcado como parcialmente generado por IA. Ninguna de las dos cifras es inventada. Proceden de muestras distintas, umbrales distintos y definiciones distintas de lo que cuenta como una señal.

La misma brecha aparece en todo el sector, no solo en una empresa. Esa comparación de 14 herramientas encontró que todas quedaron por debajo del 80 percent de precisión global, y que seis de las catorce produjeron un falso positivo sobre escritura humana sin modificar antes de que entrara en escena cualquier paráfrasis. Un número publicado describe un punto de referencia. No describe el documento que en ese momento está delante de un profesor.

Por qué una puntuación segura no es una acusación segura

Tasa de falsos positivos suena como si se refiriera a la probabilidad de que un estudiante señalado como problemático sea inocente. Pero no. Describe cómo funciona una prueba para todas las personas que la realizan. Y esas son preguntas distintas con respuestas distintas, igual que en cualquier prueba de cribado en medicina o seguridad.

Un análisis estadístico de marzo de 2026 de un investigador de Griffith University hace explícita la matemática subyacente. Si se trata la detección de IA como una prueba aplicada a una población de escritores estudiantes, y no a un documento aislado, aparece un intercambio: siempre que alguna parte de esa población escriba de una manera que se solape de forma natural con la salida típica de IA, cerca de la convención del género, cerca del rango de un aprendiz de segunda lengua, cualquier detector con capacidad real para detectar trabajo escrito por IA debe fallar en parte de esa fracción solapada. Esto no es una afirmación sobre un detector concreto mal construido. Es una propiedad de probar a una población diversa con un solo documento y sin ninguna otra evidencia.

El propio ejemplo ilustrativo del artículo muestra la magnitud implicada. Suponga que el 10 percent de una población estudiantil escribe de forma lo bastante cercana a la salida típica de AI, y que un detector está ajustado para detectar el 80 percent del trabajo realmente escrito por AI. Las matemáticas exigen entonces una tasa media de falsos positivos de al menos 7.5 percent en esa población. Eso no es un defecto de la ingeniería del detector, es una consecuencia directa de cuánto se solapa estadísticamente la escritura de ese grupo con aquello que se está detectando.

Escalado a una universidad de 10,000 estudiantes, ese límite inferior por sí solo implica aproximadamente 750 falsas alertas en toda la población, una consecuencia matemática de someter a prueba una población diversa frente a un único documento sin ninguna otra evidencia que ponderar. El autor del artículo deja claro que estas cifras concretas son ilustrativas y no medidas en una institución real. El ejemplo demuestra la forma del problema, no una predicción específica para un campus determinado.

Nada de esto significa que una puntuación marcada carezca de sentido. Significa que la puntuación es una señal débil, a nivel poblacional, a la que se le pide responder una pregunta sobre una sola persona, un desajuste que ninguna cantidad de pulido por parte del proveedor puede cerrar por completo por sí sola. Una lectura responsable trata el número como una invitación a reunir mejores pruebas: borradores, historial de versiones, el rastro documental ordinario de alguien que realmente está escribiendo algo. Las herramientas gratuitas de TextPulse permiten a un escritor comprobar en qué punto se encuentra un borrador según estas mismas mediciones antes de que lo haga cualquier otra persona, lo cual es un uso distinto de la tecnología que intentar derrotar a cualquier detector específico.

Qué escritores afrontan el mayor riesgo

La investigación muestra dos grupos que destacan más que cualquier otro: las personas que escriben en una segunda lengua y las personas que, por razones no relacionadas con cómo escribieron su ensayo, son de forma natural escritores muy estructurados o repetitivos. Ambos tipos de escritores aparecen en la misma firma estadística que un detector está diseñado para captar.

Los hablantes de inglés no nativos soportan el mayor riesgo documentado. Las pruebas independientes han encontrado repetidamente que los detectores leen erróneamente la escritura académica fluida en una segunda lengua como generada por máquina a tasas mucho más altas que la escritura nativa. La página de TextPulse para escritores académicos de ESL explica con más detalle el mecanismo detrás de ese riesgo, incluida la clase de patrones de formulación que lo provocan.

Un segundo grupo, menos discutido, afronta un problema relacionado. Los investigadores compararon aproximadamente 60,000 publicaciones de Reddit, divididas entre un subconjunto identificado como probablemente escrito por autores autistas y una muestra general, y pasaron ambas por un detector basado en GPT-2. Ambos grupos se mantuvieron por debajo del 2 percent marcados en total, pero el subconjunto probablemente autista fue marcado a una tasa significativamente más alta que la muestra general. La escritura que se inclina hacia una formulación literal, repetitiva y estrechamente pautada, un rasgo documentado de algunos estilos de comunicación autistas, produce exactamente el texto de baja variación que un detector está diseñado para detectar.

Dos proveedores publican suficiente información para comprobar la afirmación. La tasa de falsos positivos de Turnitin se expone por separado, y la precisión de ZeroGPT se examina en su propia página. Sobre quién recaen con mayor dureza estos errores hay otra cuestión distinta, y por qué se marca con más frecuencia a los escritores de inglés no nativos tiene su propia respuesta.

Nada de esto es probable que se simplifique pronto. Los detectores seguirán mejorando en la detección de texto realmente escrito por máquina, y la diversidad de la población seguirá produciendo cierta tasa de acusaciones falsas que una mejor ingeniería por sí sola no puede cerrar por completo. El cambio más útil ya está ocurriendo en algunas instituciones, tratar una puntuación como el inicio de una conversación y no como su final, y preguntar sobre qué población se probó realmente una tasa publicada antes de confiar en que se aplica al documento que tienen delante.

Frequently Asked Questions

Un falso positivo de detector de IA es un texto escrito por humanos que una herramienta de detección puntúa incorrectamente como generado por IA. Ocurre porque los detectores miden cuán predecible es un pasaje, no quién lo escribió. La escritura breve, formulaica, muy editada o redactada en una segunda lengua a menudo se lee como predecible por razones que no tienen nada que ver con la autoría, lo cual basta para activar una marca.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Falsos positivos de detector de IA: por qué ocurre | TextPulse.ai