AI Detection

Tasa de falsos positivos de Turnitin: lo que dicen los números

Turnitin publica dos cifras de falsos positivos, no una, y ninguna describe el trabajo que tiene delante un profesor concreto. Aquí se presenta la división entre nivel de documento y nivel de oración, el asterisco por debajo del 20%, y la aritmética que convierte una fracción de un porcentaje en un recuento real de estudiantes.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

La tasa de falsos positivos de Turnitin no es un solo número. La empresa publica dos: una cifra inferior al 1 por ciento a nivel de documento, y otra más cercana al 4 por ciento a nivel de oración. Ambas son reales, ambas están publicadas, y ninguna por sí sola dice mucho sobre el trabajo concreto que tiene delante un profesor concreto.

La distancia entre esas dos cifras, y lo que ocurre una vez que cualquiera de ellas se aplica a una clase real en lugar de a un solo documento, es lo que desarrolla este texto: lo que afirma Turnitin, qué abarcan realmente los dos números, y la aritmética que convierte una fracción de un por ciento en un recuento real de estudiantes.

¿Cuál es la tasa de falsos positivos de Turnitin, según Turnitin?

A nivel de documento, en palabras de la propia empresa: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Esa condición importa tanto como el número. La cifra inferior al 1 por ciento no es una afirmación sobre cada trabajo que Turnitin evalúa. Describe solo el subconjunto de trabajos que ya superó un umbral del 20 por ciento de texto escrito por IA en la propia estimación del modelo.

A nivel de oración, donde una interfaz resalta líneas individuales en lugar de un documento completo, la cifra propia de Turnitin es aproximadamente cuatro veces mayor. "Our sentence-level false positive rate is around 4%," afirma la empresa. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin añade que estas oraciones erróneas no se dispersan al azar: en el 54 por ciento de los casos, una oración señalada falsamente aparece inmediatamente junto a texto auténtico generado por IA, lo que la empresa presenta como parte de la razón por la que una puntuación a nivel de documento suele sostenerse mejor que cualquier línea resaltada aislada.

A nivel de documento y a nivel de oración no se trata de la misma afirmación

Esta división en dos niveles es un mensaje revisado, no la posición original de Turnitin. En el lanzamiento de abril de 2023, la empresa publicó una única cifra inferior al 1 por ciento, sin ninguna distinción entre documento y oración. Después de que las instituciones empezaran a citar ese número y de que la prensa educativa informara de falsos positivos en el mundo real más altos de lo esperado, el director de producto de Turnitin publicó el desglose utilizado arriba, junto con dos cambios de producto realizados en respuesta: elevar la longitud mínima del documento puntuable de 150 a 300 palabras, y cambiar cómo se puntúan las oraciones iniciales y finales de un documento.

El umbral de 300 palabras existe por una razón relacionada. Turnitin lo elevó desde un mínimo original de 150 palabras después de comprobar, en palabras de la propia empresa, que la precisión aumenta con más texto. Una entrega breve, una reflexión de una página, un borrador parcial, una publicación en un foro de discusión, ofrece al modelo menos señal con la que trabajar que aquella frente a la cual se midieron las cifras de falsos positivos anteriores, y esa es parte de la razón por la que cualquier texto por debajo de ese umbral no recibe ninguna puntuación de IA, en lugar de una poco fiable.

NivelTasa declarada por TurnitinLo que realmente cubre
Nivel de documentoPor debajo del 1%Solo documentos ya marcados con un 20% o más como escritos por IA, el porcentaje global de toda la entrega
Nivel de oraciónAproximadamente 4%Cualquier oración individual resaltada dentro del informe de escritura por IA, independientemente de la puntuación global del documento
Por debajo del umbral del 20% del documentoNo se muestra ninguna cifraTurnitin muestra un asterisco en lugar de un porcentaje, marcando el resultado como menos fiable en ese rango

Humanice su propio artículo

Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.

Empezar gratis

La aritmética: lo que significa una fracción de un porcentaje para una cohorte real

El cálculo se hizo públicamente cuando Vanderbilt University calculó las tasas de error asociadas con la detección de IA de Turnitin en agosto de 2023. El mejor ejemplo de cómo hacer este cálculo es el propio desarrollo de los números por parte de Vanderbilt. En una entrada de blog sobre su decisión de desactivar el detector de IA de Turnitin, señalaron: "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."

Esta cifra es una extrapolación propia de Vanderbilt a partir del número publicado por el proveedor, aplicada al propio volumen de Vanderbilt, no un resultado medido por separado. La estructura de la aritmética se generaliza más allá del número de estudiantes de una universidad. Una tasa inferior al 1 percent aplicada a unos pocos cientos de trabajos produce un puñado de estudiantes marcados erróneamente, fácil de pasar por alto. La misma tasa aplicada a decenas de miles de trabajos, la escala que una universidad real presenta cada año, produce cientos en lugar de un puñado, porque se están multiplicando un porcentaje pequeño y una población grande, en vez de considerarlos de forma aislada.

Nada de esto demuestra que la tasa del mundo real coincida exactamente con la cifra de laboratorio. El propio chief product officer de Turnitin ha reconocido públicamente que los resultados del mundo real difieren de las pruebas de laboratorio, en parte por lo que la empresa revisó su mensaje en primer lugar. La aritmética anterior trata el propio número declarado por Turnitin como una entrada que merece tomarse en serio, no como un límite de lo que realmente ocurre una vez que una herramienta está puntuando entregas que no se parecen en nada a un conjunto de referencia seleccionado.

Lo que la tasa no cubre

Un resultado por debajo del umbral del 20 percent no recibe un pequeño porcentaje adjunto. Recibe un asterisco en lugar de un número, una elección que Turnitin hizo porque ese intervalo es donde la herramienta es menos fiable en cualquiera de las dos direcciones, corroborada por informes independientes de la prensa educativa junto con la propia formulación de baja confianza de la empresa para ese intervalo. Una edición ligera, un párrafo revisado con ayuda y el resto escrito sin asistencia, puede no producir ninguna puntuación visible en absoluto en lugar de una pequeña, algo que conviene saber antes de que un número ausente se lea como una acusación o como un certificado de buena salud. La guía de TextPulse sobre qué cuenta como una buena puntuación de Turnitin cubre ese mismo umbral desde el lado del lector del informe.

Entonces, ¿cómo debe leerse una tasa de falsos positivos publicada?

Como una cifra de un proveedor sobre una condición más restringida de lo que parece describir al principio, no como una afirmación sobre el trabajo que tiene delante un profesor concreto. Turnitin enmarca su propia salida del mismo modo: la empresa afirma claramente que su tecnología de detección de escritura con AI no ofrece "una determinación de mala conducta", solo "datos para que los educadores tomen una decisión informada". La evidencia más amplia sobre si los detectores de AI son precisos en absoluto respalda la misma lectura: una tasa publicada describe un punto de referencia, no el documento que se está calificando en ese momento.

Los autores que quieran saber en qué punto de la misma clase de medición estadística se sitúa su propio borrador, en lugar de adivinar, pueden comprobarlo directamente con un comprobador gratuito de perplexity antes de que llegue al detector de una institución. Ese es un uso distinto de la tecnología al de intentar discutir una puntuación después del hecho, y es el único caso en que un autor, en lugar de un administrador, ve primero el número.

La precisión de ZeroGPT se examina por separado para cualquiera cuya institución utilice ese sistema. El grupo sobre el que recaen con mayor dureza estos errores, los autores de inglés no nativo, es objeto de su propia página.

La población más expuesta a esta aritmética tampoco está distribuida de manera uniforme. Los escritores de inglés no nativos asumen el mayor riesgo documentado de quedar del lado equivocado de cualquiera de estos porcentajes, que es exactamente el público en torno al cual se construye la página de TextPulse para escritores académicos de ESL. Turnitin seguirá revisando estas cifras a medida que reentrene su modelo. Lo que no cambiará es la aritmética misma: una tasa tan pequeña sigue necesitando una población tan grande en la que desaparecer, y la mayoría de las entregas reales no tienen esa suerte.

XLinkedInFacebook

Preguntas frecuentes

La tasa de falsos positivos de Turnitin, según sus propias cifras publicadas, no es un número único. A nivel de documento, Turnitin afirma una tasa inferior al 1 por ciento, pero solo para documentos que ya han sido marcados con un 20 por ciento o más de texto escrito por IA. A nivel de oración, donde se resaltan líneas individuales, la cifra propia de la empresa es de alrededor del 4 por ciento.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Mantente al día sobre la humanización con AI

Recibe en tu correo consejos sobre redacción académica, detección de AI y humanización.

Sin spam. Cancela la suscripción en cualquier momento.