¿Puede Turnitin detectar texto de IA humanizado?
Turnitin dice que su indicador de escritura con IA ya cubre texto pasado por un humanizador. Lo que esa afirmación significa y no significa, por qué un documento humanizado a veces sigue obteniendo una puntuación alta y a veces no, y qué valor tiene el número para un estudiante en cualquier caso.
Turnitin responde a esta pregunta en su propio sitio de soporte, y la respuesta es más específica que cualquiera de los dos lados del argumento habitual. Su indicador de escritura con IA, Turnitin says, ya incluye la detección de contenido generado por IA que puede haber sido humanizado o pasado por un bypasser para evitar la detección. Ese es un proveedor describiendo su propio producto. También es el lugar adecuado para empezar, porque indica qué afirma cubrir el modelo.
Entonces, ¿puede Turnitin detectar texto humanizado? La pregunta tiene una forma más estrecha y más útil. El modelo de Turnitin no busca la huella de un humanizer y no mantiene una lista de herramientas. Puntúa la prosa oración por oración según la cercanía con que la escritura coincide con los patrones estadísticos del texto generado por máquina, y luego promedia esas puntuaciones en todo el documento. Que un pasaje humanizado siga obteniendo una puntuación alta depende de cuánto haya cambiado esa pauta la reescritura, y de cuánto del documento se haya reescrito en absoluto.
¿Puede Turnitin detectar texto humanizado? Lo que afirma Turnitin
Su posición publicada es un sí claro. Al responder si puede detectar contenido que ha pasado por un humanizer, su orientación afirma: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." La misma página da la misma respuesta para las herramientas de paráfrasis con IA.
Esa afirmación no aparece como un segundo número en algún lugar del informe. Turnitin la integra en el único porcentaje de escritura con IA, y la definición publicada de ese porcentaje lo dice directamente: cubre texto que el modelo determina que probablemente fue generado por IA, o probablemente generado y luego modificado por un parafraseador con IA o un bypasser. Hay una sola puntuación, y ya tiene en cuenta la reescritura en la medida en que el modelo es capaz de hacerlo.
Lea con atención, eso es una afirmación sobre la cobertura más que una afirmación sobre la precisión. Turnitin está diciendo que el texto humanizado estaba dentro del alcance cuando se construyó el modelo. Se queda muy lejos de decir que todo documento humanizado obtiene una puntuación alta, y sus propias cifras publicadas, más abajo, describen un modelo que trata las oraciones individuales como inciertas.
Qué está puntuando realmente el Indicador de Escritura de IA
No es un porcentaje. Es una fracción de texto, así que no es un nivel de confianza. Es una medida de cuánto texto dentro de su documento nuestro modelo cree que probablemente haya sido generado por IA. Lo llamamos texto cualificado, lo que significa que son oraciones en prosa en un formato de escritura de extensión larga. No incluye listas con viñetas, ni código, ni tablas, ni fragmentos breves. Y por eso puede ver números distintos para el mismo trabajo según cuánto de él sea prosa continua.
El mecanismo subyacente es lo bastante simple como para imaginarlo. Turnitin divide un documento en segmentos superpuestos de unos pocos cientos de palabras, aproximadamente de cinco a diez oraciones cada uno, superpuestos para que cada oración reciba una puntuación en contexto. Cada oración recibe un valor entre 0 y 1. Luego, las puntuaciones de los segmentos se promedian a lo largo del documento para producir el único número que ve un instructor. Un relato paso a paso de cómo Turnitin detecta IA recorre cada etapa con más detalle.
Ese paso de promediado importa más para el texto humanizado que cualquier otra cosa en la canalización, y es la parte que casi nadie tiene en cuenta. La cifra que lee un instructor es una media aritmética de juicios a nivel de segmento. Un documento puede estar reescrito en un 50% y situarse en un punto intermedio por razones que tienen poco que ver con lo buena que fue la reescritura.
Por qué la salida humanizada a veces sigue obteniendo una puntuación alta
La razón más común es la cobertura. Un humanizador aplicado a una introducción y a una conclusión deja intactos la revisión de la literatura y el debate, y esos segmentos llevan sus puntuaciones originales directamente al promedio. En un capítulo largo, reescribir las páginas iniciales cambia unos pocos segmentos y deja el resto exactamente como estaba, lo que produce un movimiento menor del que el autor espera de un trabajo que parecía sustancial.
La segunda razón es la profundidad de la reescritura. Una pasada que sustituye vocabulario mientras mantiene en su lugar las longitudes de las oraciones, el orden de las cláusulas y las elecciones de transición deja en gran medida intacto el patrón con el que se entrenó el clasificador. El modelo puntúa la forma de la prosa, así que cambiar qué palabras llenan esa forma hace menos de lo que la mayoría supone. Un free perplexity checker mostrará cuán predecible sigue leyéndose un pasaje después de una reescritura, lo que es una señal más informativa que una comparación a nivel de palabra entre antes y después.
La tercera razón es que una reescritura puede instalar su propia regularidad. Un programa que aplica la misma transformación a cada párrafo producirá un nuevo patrón que es tan regular como el anterior. Si cada oración tiene el mismo tipo de corte conjunto a través de ella, o si a cada oración se le añade el mismo tipo de cláusula de atenuación en el mismo lugar, esas oraciones serán percibidas por un clasificador con la misma uniformidad con que lo habrían sido si todas hubieran tenido la misma longitud desde el principio.
| Situación | Lo que hace la puntuación de IA | Por qué |
|---|---|---|
| Solo se reescribió una parte del documento | Desciende menos de lo esperado | Los segmentos no tocados conservan sus puntuaciones originales en el promedio |
| Se cambió el vocabulario, pero se mantuvo la estructura de las oraciones | Se mueve muy poco | El clasificador puntúa patrones a nivel de oración que el intercambio dejó en su sitio |
| Las oraciones se reestructuraron de verdad en todo el texto | Se mueve más | Se rompe el ritmo uniforme que el modelo fue entrenado para reconocer |
| Se presentaron menos de 300 palabras de prosa | No se genera ninguna puntuación | Turnitin requiere 300 palabras de prosa que cumplan los requisitos antes de informar un porcentaje |
| El resultado cae por debajo del 20 percent | Un asterisco en lugar de una cifra | Turnitin señala los resultados de ese intervalo como menos fiables |
Por qué la misma reescritura a veces produce una puntuación baja
Un documento humanizado puede devolver una puntuación baja por razones que no tienen nada que ver con la reescritura. Turnitin necesita al menos 300 palabras de prosa que cumplan los requisitos antes de generar en absoluto un porcentaje de IA, un umbral que elevó desde las 150 palabras originales con el argumento declarado de que la precisión mejora con un poco más de texto. Un texto breve de reflexión no produce ninguna cifra, y la ausencia de puntuación no es lo mismo que una puntuación limpia.
Turnitin marca con un asterisco un intervalo por debajo del 20 percent en lugar de dar un porcentaje exacto, porque dentro de este intervalo hay una mayor incidencia de falsos positivos. En el momento del lanzamiento, la cobertura educativa también se refirió a este comportamiento, diciendo que los resultados informados como menos del 20 percent escritos por IA tenían una mayor incidencia de falsos positivos y, por lo tanto, Turnitin añadió avisos. Un documento situado en esa banda ha sido marcado como un intervalo que Turnitin se niega a informar con precisión, lo cual es algo distinto de haber sido aprobado.
También existe una barrera institucional por encima de todo ello. Turnitin procesa una entrega para la detección de escritura con IA solo si la institución ha activado la función, y los administradores pueden desactivarla en toda la cuenta. Vanderbilt University hizo exactamente eso en agosto de 2023, citando la entonces publicada tasa de falsos positivos del 1 percent de Turnitin frente a aproximadamente 75,000 entregas anuales, el sesgo contra escritores no nativos de inglés, y la falta de transparencia sobre cómo funciona el modelo. Un estudiante en una institución con la función desactivada no tiene puntuación de IA en ninguna entrega, humanizada o de otro tipo.
Y cuando la reescritura fue genuinamente estructural, la puntuación puede bajar porque el patrón medido cambió. Turnitin informa de una estimación calculada a partir de patrones de escritura, de modo que el texto cuyos patrones difieren obtiene una puntuación distinta. El mecanismo funciona en ambas direcciones, y esa es la parte incómoda, la escritura humana original a veces obtiene una puntuación alta por exactamente la misma razón.
Humanice su propio artículo
Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.
Qué afirma cada proveedor de humanizadores, y qué está documentado
Una regla rige la tabla. La columna central es el propio lenguaje de marketing del proveedor, tomado de su propio sitio donde ese sitio sirva como fuente. La columna derecha registra lo que realmente respalda cada afirmación, que en la mayoría de los casos no es ningún conjunto de datos, fecha ni método. No existe ninguna prueba pública comparativa directa para estas marcas.
| Brand | Lo que afirma el proveedor | Lo que está documentado |
|---|---|---|
| Undetectable.ai | Enumera el paso de detectores de IA como una característica del producto sin una cifra asociada, y ofrece reembolsar el coste de la humanización si el resultado se marca como no humano | El reembolso es una condición comercial, no hay ningún conjunto de datos, fecha ni resultado desglosado por detector que respalde la afirmación |
| QuillBot | No hace ninguna afirmación de detección o evasión para la función de humanizador en sus propias páginas. Su detector de IA independiente se describe solo como un detector de contenido generado por IA | QuillBot vende el humanizador dentro de una suite general de escritura y no hace ninguna afirmación específica sobre Turnitin para él |
| WriteHuman | Clasificado en el primer puesto en un Humanizer Leaderboard, y descrito como el humanizador de IA premium para escritura seria | El leaderboard no cita ninguna metodología ni muestra, y WriteHuman no adjunta ninguna cifra numérica de precisión a la clasificación |
| Walter Writes AI | Comercializa una humanización amplia en más de 80 idiomas sin una afirmación específica sobre Turnitin | No hay datos de prueba en ningún sentido |
| HIX Bypass | Comercializa páginas de evasión desglosadas por detector sin una cifra específica sobre Turnitin | HIX Bypass y BypassGPT son productos distintos en dominios distintos, por lo que conviene confirmar a cuál se refiere una afirmación |
| StealthGPT | Un promedio humano del 98% en Turnitin y del 95% en GPTZero, cada uno a partir de una ejecución declarada de 30 muestras con cero detecciones, además de una garantía de devolución del dinero si se detecta a un suscriptor | Autoinformado. No se publica junto a las cifras ningún conjunto de datos, selección de muestras, fecha ni método, y 30 documentos es una ejecución pequeña para una afirmación sobre un modelo que puntúa millones de envíos |
| Phrasly | Se posiciona como un eliminador de detección de IA, no publica datos de prueba | No hay ninguna afirmación pública en ningún sentido. Las cifras que circulan en reseñas son de segunda mano y se excluyen aquí por principio |
| Grammarly | No comercializa su reescritura como evasión de detección en absoluto. Su página de detector de IA afirma una precisión de detección del 99% y una clasificación en primer lugar en el benchmark independiente de RAID | La misma página de Grammarly afirma que ningún detector de IA es 100% preciso. Su función Authorship etiqueta el texto como escrito por un humano, creado con IA o editado con Grammarly |
| TextPulse | Una tasa de paso del 92.33% en Turnitin AI, 89.12% en Originality.ai y 87.91% en GPTZero, medida sobre un corpus académico de 2,000 documentos | Medido y publicado por TextPulse, por lo tanto autoinformado como todas las cifras anteriores. El tamaño del corpus y los detectores se nombran, no se promete ningún resultado de detector para ningún documento individual |
Tres cosas se desprenden de esa tabla. La mayoría de estas herramientas no publica ninguna afirmación de detector que pueda comprobarse. Un par adjuntan un tamaño de muestra a una cifra, lo cual es más de lo que consigue el resto de la categoría. Y ninguna publica un conjunto de datos que alguien ajeno a la empresa pueda ejecutar por sí mismo. Sin embargo, conviene reconocer el mérito de cada marca donde lo tiene. Undetectable.ai pone un reembolso detrás de su afirmación, lo cual es un compromiso concreto y no un adjetivo. WriteHuman publica límites exactos por nivel de solicitudes y de palabras, de modo que el comprador sabe qué está obteniendo. Grammarly matiza su propia cifra de precisión en la misma página en la que la presenta, lo cual es más de lo que hacen la mayoría de los proveedores de detectores. Y que QuillBot se niegue a hacer en absoluto una afirmación de bypass es la posición más defendible de la lista.
Por qué nadie fuera del proveedor puede comprobar estas cifras
Un proveedor de humanización que afirma una tasa de aprobación en Turnitin está describiendo ejecuciones realizadas mediante una cuenta que controla, sobre documentos que seleccionó, en una fecha que por lo general no indica, frente a un clasificador que Turnitin revisa a medida que se publican nuevos modelos de lenguaje. Eso es cierto para la cifra de treinta muestras de StealthGPT y también para la cifra de 2,000 documentos que publica este sitio. El tamaño del corpus cambia cuánta variación aleatoria hay en una cifra. No convierte un informe propio en una auditoría.
La otra mitad del problema es que la propia lista de modelos que Turnitin afirma detectar se edita a medida que llegan nuevas versiones. Esa tasa de aprobación medida frente al clasificador del trimestre pasado describe al clasificador del trimestre pasado y nada más. Por qué eso significa que nadie puede nombrar un mejor humanizador de IA para eludir Turnitin se expone por separado. Toda cifra en la página principal de cualquier humanizador, incluida la de este sitio, es una instantánea que lleva una fecha que el proveedor quizá nunca haya publicado.
Cómo leer una afirmación de bypass antes de pagar por ella
Cuatro preguntas separan una afirmación que merece consideración de una afirmación que merece ser ignorada, y se aplican a cada fila de la tabla anterior, incluida la última.
- ¿Cuántos documentos se probaron, y quién los eligió? Un porcentaje sin tamaño de muestra detrás es un eslogan que lleva un número.
- ¿En qué fecha, y frente a qué versión del detector? Los modelos de detección se revisan a medida que se publican nuevos modelos de lenguaje, y una tasa de acierto sin fecha envejece rápido.
- ¿La garantía es un reembolso o un resultado? Una promesa de devolución del dinero traslada un pequeño riesgo financiero y no hace absolutamente nada respecto a un comité de integridad académica.
- ¿Qué dice el proveedor que ocurre con una cita, un término técnico o una cita en bloque? La mayoría de las páginas de humanizer no dicen nada, lo cual en sí mismo es una respuesta.
Esa última pregunta decide más que la aritmética del detector para cualquiera que presente trabajo académico. Una reescritura que obtiene una buena puntuación y generaliza en silencio una frase de métodos le ha costado a usted aquello sobre lo que estaba siendo evaluado. El humanizer académico de TextPulse documenta la preservación de citas en APA, MLA, IEEE, Chicago, Harvard y Vancouver, freeze terms para bloquear el vocabulario exacto antes de ejecutar un pase, y entrenamiento con texto académico revisado por pares con una salida mantenida en Flesch-Kincaid grado 13 a 18. Esas son afirmaciones sobre lo que ocurre con el texto, que es un tipo de afirmación distinto de un porcentaje sobre un detector, y un lector puede verificarlas en la salida en menos de un minuto.
Qué significa la puntuación para un estudiante, en cualquier caso
Turnitin es claro al afirmar que el indicador de escritura con IA no es una constatación de mala conducta. La página del producto de Turnitin afirma explícitamente que Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." También deja claro que Turnitin proporciona información para permitir que los docentes tomen una decisión informada basada en las políticas de su institución. Esto se reafirma al advertir que el modelo "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."
Los estudiantes no ven la puntuación por defecto. Turnitin afirma claramente que el indicador y el informe de detección de escritura con IA no son visibles para los estudiantes, y la única forma de ver uno es que un instructor descargue el informe como PDF y se lo entregue. Un estudiante que revisa su propio borrador está revisando una herramienta distinta, entrenada con datos diferentes, y los dos números no tienen obligación de coincidir.
Esto deja sin resolver la parte que ninguna puntuación aclara. Si se permitió o no la asistencia de IA es una cuestión para el curso y la institución, y una AI use policy la responde de una manera que un porcentaje nunca responde. Una puntuación alta en un uso permitido y divulgado es una conversación con evidencia detrás. Una puntuación baja en un uso no divulgado que la política prohíbe sigue siendo un uso no divulgado.
Para un escritor que edita su propio borrador, la lectura práctica de todo esto es que la puntuación sigue a la escritura. El modelo de Turnitin mide el patrón a nivel de oración en un documento completo, de modo que las reescrituras parciales producen un movimiento parcial y los cambios de vocabulario producen muy poco movimiento, si es que producen alguno. La explicación completa de how to humanize AI text desarrolla las ediciones estructurales que cambian el patrón, en el orden que más lo modifica.
El AI humanizer de TextPulse aplica esas ediciones estructurales a un documento completo de una sola vez y muestra un Human Score estimado calculado a partir del propio texto, nunca una predicción de lo que dirá ningún detector nombrado. Ninguna herramienta puede prometer un resultado en Turnitin, porque ninguna herramienta puede ver dentro del modelo de Turnitin. Cualquier producto que afirme lo contrario está describiendo un resultado que no tiene forma de observar.
La distinción entre un humanizer y un paraphraser importa aquí, al igual que la razón por la que el texto parafraseado sigue siendo marcado.
El número es la parte menos interesante de esto. Lo que decide el resultado son los veinte minutos después de que un marcador lo mira: si el trabajo puede mostrar su proceso, un historial de borradores, un conjunto de notas, fuentes sobre las que el autor puede hablar sin abrirlas. Esa evidencia está disponible para cualquiera que hizo el trabajo, y sobrevive a una puntuación que una reescritura no logró mover.
Preguntas frecuentes
La propia guía de Turnitin dice que su indicador de IA incluye la detección de contenido que puede haber sido humanizado o pasado por un bypasser. Lo que el producto realmente genera es un porcentaje de texto que cumple los criterios, no un veredicto sobre la autoría. Así que la respuesta práctica a si Turnitin puede detectar texto humanizado es que la puntuación refleja cuánto del patrón de escritura de la máquina sobrevivió a la reescritura.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.