AI Detection

Reseña de Winston AI: la afirmación de 99.98% de precisión frente a la evidencia

Winston AI anuncia 99.98% de precisión, la cifra autoproclamada más alta en el sector de los detectores, medida en un conjunto de prueba interno que la empresa nunca ha publicado. El benchmark RAID revisado por pares situó su precisión global en 71% con una tasa de falsos positivos fija de 5%, todavía en segundo lugar entre los cuatro detectores comerciales evaluados. Aquí se explica qué mide realmente cada cifra y a quién le conviene de verdad esta herramienta.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI anuncia una precisión del 99.98%, la cifra autoproclamada más alta de cualquier detector de IA convencional. El número aparece en la página principal de la empresa junto a las palabras "The Most Trusted AI Detector", y procede de pruebas internas de la propia empresa, no de un laboratorio externo. No se publica junto a él ninguna metodología, tamaño del conjunto de prueba, proporción de muestras humanas frente a muestras de IA ni umbral de funcionamiento. Esa distancia entre la afirmación y su documentación es lo primero que un lector cuidadoso necesita saber sobre esta herramienta.

Lo segundo es que Winston sí ha sido probado por terceros, lo cual es más de lo que pueden decir algunos detectores. El benchmark RAID, un estudio revisado por pares presentado en ACL 2024, sometió a Winston a aproximadamente 6.2 millones de textos generados por máquina y midió una precisión global del 71.0% con la tasa de falsos positivos fijada en 5%. Eso está muy lejos del 99.98%. También situó a Winston en segundo lugar de los cuatro detectores comerciales evaluados, por delante de GPTZero y ZeroGPT. Ambos hechos importan, y ninguno anula al otro.

Lo que sigue es qué es Winston y para quién está diseñado, qué afirma el proveedor, qué puede y qué no puede significar estadísticamente un auto-benchmark de 99.98%, y qué muestran en realidad las cifras independientes.

¿Qué es Winston AI y quién lo usa?

Winston AI es un detector de pago, basado en suscripción, dirigido de forma explícita a docentes y editores de contenido. Su lista de funciones se lee como el flujo de trabajo de un profesor: el sitio de la empresa describe OCR que extrae texto de documentos escaneados, fotos y escritura a mano, una integración con Google Classroom incluida entre sus plataformas compatibles, un comprobador de plagio junto con la detección de IA, y organización de documentos para gestionar lotes de entregas. El proveedor afirma que detecta resultados de ChatGPT, Gemini, Claude, LLaMA "and much more".

La parte más distintiva de la interfaz es la salida por oración. En lugar de devolver solo un único porcentaje, Winston produce lo que llama un mapa de predicción de IA: una evaluación codificada por colores, oración por oración, de qué partes de un documento parecen generadas por máquina. Para un educador, ese mapa es más útil que una puntuación desnuda, porque muestra dónde se concentra la sospecha de la herramienta. También es fácil sobreinterpretarlo, un punto que se aborda más abajo.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
La insignia en cuestión: 99.98% accurate, en la página principal, sin ningún estudio identificado detrás de ella.

¿Qué afirma la empresa?

La afirmación principal en la página principal de Winston AI es "99.98% Accurate." A fecha de redacción de este texto, la página que presenta esa cifra no publica cómo se construyó el corpus de prueba, cuántas muestras contenía, qué mezcla de texto humano y de IA utilizó, ni en qué umbral de decisión se configuró el detector cuando se midió la cifra. Eso no es inusual en esta industria, la misma brecha entre las afirmaciones de precisión de los proveedores y la evidencia independiente se extiende por casi todos los detectores del mercado. La versión de Winston de la afirmación es simplemente el número más grande que alguien le ha atribuido.

¿Qué puede significar realmente una autoevaluación de referencia de 99.98%?

Tómese en serio la aritmética por un momento. Una tasa de precisión de 99.98% significa 2 errores por cada 10,000 muestras. Para medir esa cifra en absoluto, una empresa necesita un conjunto de prueba etiquetado de al menos decenas de miles de documentos en el que se conozca con certeza el origen verdadero de cada texto. Entonces, el número solo describe el rendimiento en ese corpus, esos modelos de IA, esos prompts, esos géneros, esa longitud de texto, en un umbral elegido.

Nada de eso requiere mala fe. Un detector entrenado con ensayos generados por modelos de chat populares, y luego probado con un corpus de ensayos generados por modelos de chat populares, obtendrá realmente una puntuación cercana al máximo. El problema es la transferibilidad. En el momento en que el texto entrante procede de un modelo distinto, de una estrategia de muestreo distinta, o de un autor cuyo estilo natural es inusualmente uniforme, el corpus sobre el que se midió el benchmark ya no describe el texto que se está juzgando. Un benchmark interno es un experimento controlado realizado por la parte con mayor interés en su resultado, en condiciones elegidas por ella misma. Es evidencia, pero es la clase más débil, y la metodología que falta significa que nadie fuera de la empresa puede siquiera comprobarla.

¿Qué muestra la prueba independiente?

La prueba pública más rigurosa que incluye Winston es RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, un estudio revisado por pares de Dugan y colegas presentado en ACL 2024. RAID evaluó 12 detectores, incluidos cuatro productos comerciales, frente a aproximadamente 6.2 millones de generaciones que abarcan 11 modelos de lenguaje, 8 dominios de escritura, 4 estrategias de decodificación y 11 ataques adversarios, con cada detector calibrado al mismo 5% de tasa de falsos positivos para que las puntuaciones sean comparables.

DetectorPrecisión global en RAID (FPR fijada en 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

Dos lecturas de esa tabla son honestas al mismo tiempo. El 71.0% de Winston está muy lejos de 99.98%, y aun así Winston superó a dos de sus tres rivales comerciales en el punto de referencia público más difícil disponible. Los promedios también ocultan una dispersión reveladora. En los resultados por modelo de RAID, Winston obtuvo 99.6% en la salida de ChatGPT y 98.8% en la salida de GPT-4, cerca de su propia cifra anunciada, pero cayó a 47.6% en texto de GPT-2 y a 24.8% en texto del modelo base MPT-30B. En texto de máquina parafraseado, su precisión descendió a 52.6%.

Esa dispersión es, en miniatura, toda la historia de la afirmación de 99.98%. En texto que se parece a aquello para lo que presumiblemente se ajustó el detector, modelos de chat recientes que escriben prosa sencilla, Winston rinde cerca de lo que promete su marketing. Fuera de esa distribución, el rendimiento se desploma. Un punto de referencia interno construido a partir de texto dentro de la distribución puede producir de verdad una cifra casi perfecta y, al mismo tiempo, no decir casi nada sobre la mezcla desordenada de modelos, ediciones y paráfrasis que contiene una bandeja de entrada real. Las señales estadísticas en las que se apoyan los detectores se explican con más detalle en nuestra guía sobre cómo funcionan los detectores de IA.

Humanice su propio artículo

Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.

Empezar gratis

Falsos positivos, ¿quién sale perjudicado?

El diseño de RAID hace visible una compensación que el marketing de los proveedores rara vez muestra, cada puntuación de precisión del estudio se midió después de fijar la tasa de falsos positivos en 5%. Con esa calibración, 1 de cada 20 documentos genuinamente humanos queda marcado. Un detector puede reducir esa tasa elevando su umbral, pero solo a costa de detectar menos texto de IA, ambas cifras se mueven juntas, y un proveedor que cite una sin la otra está citando la mitad de un resultado.

La carga de esos errores no se distribuye de manera uniforme. La escritura que es formulaica, convencional y de baja varianza se lee como propia de una máquina para todo detector estadístico, y esa descripción se ajusta a las secciones de métodos, las revisiones de literatura y la prosa cuidadosa de quienes escriben en una segunda lengua. El patrón de AI detectors flagging non-native English speakers at elevated rates está documentado en todo el sector, y nada en el método de Winston lo exime. El mapa de predicción por oración merece la misma cautela, una oración resaltada en rojo es una observación estadística sobre patrones de palabras, no una prueba sobre la autoría. Los estudiantes que se enfrenten a una señalización errónea deberían partir de la documentación, no de la confesión, nuestra guía sobre how to prove you did not use AI explica qué es lo que realmente persuade.

Precios y acceso

Winston es un producto de pago con una prueba limitada. Winston indica una prueba gratuita de 14 días con 2,000 créditos, un plan Essential a $18 por mes, o $10 por mes facturado anualmente, con 100,000 créditos mensuales, un plan Advanced a $29 por mes, o $16 anuales, que añade puestos de equipo y análisis más amplios, y un nivel Elite por encima de ese. Para un docente individual que revisa un conjunto de entregas equivalente al de una clase, eso sitúa a Winston en el terreno de la compra impulsiva, más barato que los contratos institucionales, más capaz que la mayoría de las herramientas gratuitas.

Dónde encaja Winston en el panorama de los detectores

Según la evidencia independiente, Winston es un detector comercial de precio medio que rinde mejor que el nivel gratuito del mercado y peor que su propia publicidad. Conviene a un docente que quiere visibilidad por oración, integración con Classroom y comprobación de plagio en una sola herramienta económica, y que trata cada resultado como un estímulo para una conversación, no como un veredicto. No conviene a nadie que necesite que la puntuación funcione como prueba, porque la puntuación de ningún detector lo hace.

La comparación completa

Winston es un detector entre muchos en un campo saturado, y su diferencia entre 71% y 99.98% es un ejemplo de un patrón que afecta a todo el sector. Para ver cómo se compara con Turnitin, GPTZero, Originality, ZeroGPT y el resto en los mismos términos basados en la evidencia, consulte nuestra guía completa sobre detectores de IA comparados.

Lo que encontró nuestra propia investigación

En el estudio de concordancia entre detectores de TextPulse Research, nueve detectores comerciales de IA calificaron los mismos 90 textos académicos. Uno era un texto híbrido de 455 palabras: una apertura y un cierre escritos por humanos alrededor de una parte central de 168 palabras generada por IA. Winston AI puntuó este texto con 7% de IA, mientras que los veredictos de las demás herramientas sobre las mismas palabras fueron de 0% a 95.7% de IA. El artículo completo, el corpus y la matriz de puntuaciones por herramienta están en acceso abierto en TextPulse Research.

Winston AI ante el texto híbrido del corpus del estudio.
Winston AI ante el texto híbrido del corpus del estudio.
XLinkedInFacebook

Preguntas frecuentes

La cifra de 99.98% es la propia afirmación de Winston AI, medida en un conjunto de prueba interno que la empresa no ha publicado. En el benchmark RAID revisado por pares presentado en ACL 2024, Winston obtuvo 71.0% de precisión global con la tasa de falsos positivos fijada en 5%, aunque alcanzó 99.6% específicamente en la salida de ChatGPT. La afirmación describe un corpus elegido, no el rendimiento en el mundo real.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Mantente al día sobre la humanización con AI

Recibe en tu correo consejos sobre redacción académica, detección de AI y humanización.

Sin spam. Cancela la suscripción en cualquier momento.