Cómo funciona GPTZero
GPTZero hizo famosos perplexity y burstiness, y luego retiró ambos discretamente. Aquí se explica qué mide ahora su clasificador, qué muestra realmente un informe y cuáles son los límites que la herramienta reconoce.
Escriba "how gptzero works" en una barra de búsqueda y la mayor parte de lo que aparece todavía describe la perplejidad y la irregularidad, las dos estadísticas que su propio fundador hizo famosas en las primeras semanas tras el lanzamiento de ChatGPT. Esa descripción era exacta en enero de 2023. No ha sido exacta desde el otoño de ese año, cuando la propia documentación de GPTZero dice que la empresa sustituyó ese método por otra cosa por completo. La distancia entre lo que hacía la herramienta en su lanzamiento y lo que hace ahora es lo bastante grande como para que la mayoría de las explicaciones que siguen circulando hoy describan un producto que ya no existe.
Hoy, GPTZero ejecuta un clasificador oración por oración sobre un gran corpus mixto de textos generados por humanos y textos generados por IA, en lugar de un cálculo de perplejidad. El GPTZero actual sigue proporcionando un único número principal, pero la aritmética es distinta. El resaltado a nivel de oración bajo ese número principal también tiene un significado diferente del que tenía en 2023. Ambas versiones de la historia merecen conocerse, la que hizo famosos los términos y la que realmente funciona hoy.
La historia, cómo la perplejidad y la irregularidad hicieron famoso a GPTZero
El 2 de enero de 2023, Edward Tian, entonces estudiante de Princeton, publicó una demostración pública de GPTZero, apenas unas semanas después de que saliera ChatGPT. Su página explicativa original describe cómo utilizó dos estadísticas tomadas del modelado del lenguaje para detectar cuándo un modelo de lenguaje ha escrito algo. La perplejidad es una puntuación de cuán sorprendido estuvo un modelo de referencia por las elecciones de palabras en el texto. La irregularidad es el nombre que GPTZero da a cuánto fluctúa esa sorpresa a lo largo de un documento. Esas páginas explicativas son la razón por la que ambas palabras entraron en absoluto en la conversación cotidiana sobre la escritura con IA. La mayoría de las personas que hoy pueden definir perplejidad o irregularidad aprendieron los términos de GPTZero, no de un libro de texto.
El mecanismo en sí era sencillo de describir. Se introduce un pasaje en un modelo de lenguaje de referencia, y la prosa que el modelo considera altamente predecible, con baja perplejidad, se lee como típica de una máquina, ya que la generación tiende a favorecer la siguiente palabra probable en lugar de la sorprendente. La propia documentación retirada de GPTZero incluso publicó una regla práctica: una puntuación de perplejidad superior a 85 se leía como más probable humana que de máquina. Ese umbral procedía de un proveedor, en un modelo, en un momento concreto, y el propio GPTZero ya no lo respalda.
Cómo funciona ahora GPTZero: un clasificador a nivel de oración
El centro de soporte de GPTZero afirma de manera explícita que la empresa dejó de usar perplejidad y burstiness para la detección a partir del otoño de 2023, tras migrar a una arquitectura de aprendizaje profundo. Su página tecnológica actual, consultada para este texto, confirma que el cambio es total: describe un enfoque de aprendizaje profundo de extremo a extremo entrenado con texto de la web, de la educación y de una gama de modelos de lenguaje, que ejecuta un modelo de clasificación oración por oración y produce una probabilidad y una puntuación de confianza. Perplejidad y burstiness no aparecen en ninguna parte de esa página.
Desde entonces, también ha añadido una capa de defensa, un Paraphraser Shield, diseñado para detectar texto de IA que ha pasado por una herramienta de reescritura para eludir la detección. Se puede pegar texto, cargar documentos de Word, PDFs y archivos de imagen, y hasta cincuenta archivos a la vez. Nada de esa infraestructura tiene relación alguna con contar cuántas veces un modelo de referencia habría adivinado la misma palabra.
Humanice su propio artículo
Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.
Qué muestra realmente un informe de GPTZero
Un resultado de GPTZero contiene tres partes: una clasificación de IA, humana o mixta, un porcentaje que expresa la probabilidad del modelo de que el documento haya sido escrito por IA, y una etiqueta de confianza que describe cuán fiable es esa predicción concreta. La etiqueta importa más de lo que podría parecer. GPTZero vincula "highly confident" con una tasa de error inferior al 2 percent y "low confidence" con una tasa de error del 14 percent o superior, un intervalo lo bastante amplio como para que el mismo porcentaje titular pueda tener un peso muy distinto de un informe a otro.
Los escaneos de pago añaden resaltado a nivel de oración, y conviene leerlo correctamente. GPTZero describe las oraciones resaltadas como aquellas que afectan de manera desproporcionada a la puntuación global, no como una lista de acusaciones contra líneas individuales. Una oración puede no estar resaltada y aun así haber influido en el resultado, porque el clasificador lee el documento como un todo en lugar de votar oración por oración.
| Elemento del informe | Qué le indica |
|---|---|
| Clasificación | Una sola etiqueta: AI, humano o mixto |
| Puntuación de probabilidad de AI | Un porcentaje que refleja la probabilidad con la que el modelo juzga que el documento fue escrito por AI |
| Etiqueta de confianza | Va desde muy alta confianza, con una tasa de error inferior al 2 percent, hasta baja confianza, 14 percent o superior |
| Resaltado de oraciones | Marca las oraciones que más contribuyen a la puntuación en Advanced Scan, no todas las oraciones vinculadas a ella |
Ninguno de estos elementos del informe existía en su forma actual cuando la explicación de perplexity y burstiness seguía siendo la descripción pública de GPTZero sobre sí mismo. La interfaz cambió junto con el método.
Por qué la descripción de Perplexity y Burstiness sigue circulando
La explicación original de GPTZero sigue en línea, sigue indexada y sigue siendo una de las descripciones generales más claras de cómo funcionan perplexity y burstiness como conceptos. Los motores de búsqueda y otros sitios siguen citándola, y algunos remiten a una reseña ampliamente compartida de 2026 que afirma que la herramienta sigue ejecutando en silencio una capa de perplexity y burstiness junto con su clasificador. Las páginas actuales de GPTZero, la página de tecnología y ambos artículos de soporte, dicen lo contrario: los términos fueron retirados, no simplemente ocultados entre bastidores. Una página que describe un concepto en abstracto no es lo mismo que una página que describe el método actual de esta herramienta, y tratar ambas como intercambiables es en gran medida la razón por la que la confusión ha persistido tres años después de su fecha de caducidad.
Esto importa más allá de la trivialidad. A un estudiante o colega al que se le diga que reduzca la perplexity o que distribuya la longitud de las oraciones específicamente para vencer a GPTZero se le está dando un consejo dirigido a una versión del producto que dejó de funcionar en 2023. Lo que mueve a un clasificador de oraciones es una cuestión relacionada pero distinta, más cercana al relato general de cómo funcionan realmente los detectores de AI que a cualquiera de esas dos estadísticas por sí sola. GPTZero no ha dejado de medirlas, según su propia cuenta siguen entre siete indicadores que alimentan el modelo actual, pero dejaron de ser el elemento que decide la respuesta.
Lo que GPTZero dice que no puede hacer
Las cifras de precisión declaradas por GPTZero son tan sólidas como cabe esperar que un proveedor publique sobre su propio producto: 96.5 percent de precisión en documentos mixtos, una tasa global de falsos positivos que la empresa limita al 1 percent, y 1.1 percent específicamente en ensayos de TOEFL, un sustituto habitual de la escritura en inglés de hablantes no nativos. Esas cifras proceden de la propia evaluación de GPTZero, sin que en la página que las informa se cite ninguna replicación independiente.
La propia página de limitaciones de GPTZero es más específica que las cifras de marketing. La empresa afirma que la precisión mejora a medida que se envía más texto y disminuye en el nivel de oración y párrafo en comparación con el documento completo. Afirma que sus datos de entrenamiento son en su mayor parte prosa en inglés de adultos, de modo que el texto que se aparta de ese patrón es más difícil de clasificar con fiabilidad. Afirma que el clasificador no está entrenado para detectar texto de AI que ha sido modificado de forma intensa después de su generación. Y afirma con claridad que otras escrituras generadas por máquina o muy procedimentales, no solo la salida de un chatbot, pueden ser señaladas del mismo modo.
Nada de eso es una razón para tratar el número de GPTZero como incuestionable, y no es el único detector que merezca entenderse en sus propios términos. Los lectores que tengan curiosidad por saber a qué responde realmente un clasificador como este pueden ver por sí mismos una versión de ese patrón con un comprobador gratuito de perplexity o un comprobador gratuito de burstiness, dos partes de una colección gratuita de herramientas más completa que cubre las otras capas estadísticas en las que se apoya un informe como este.
Las dos estadísticas principales de GPTZero tienen sus propias páginas: qué mide perplexity en la detección con IA, y la aritmética de la probabilidad de los tokens que produce ambas cifras.
Una herramienta dispuesta a nombrar sus propios puntos ciegos con esta precisión merece más confianza que una que no reconoce ninguno, y el siguiente porcentaje sin explicar en un informe es un buen lugar para empezar a preguntar qué clase de herramienta lo produjo.
Preguntas frecuentes
No. El centro de ayuda de GPTZero indica que la empresa dejó de usar perplexity y burstiness para la detección a partir del otoño de 2023, después de cambiar a un clasificador de aprendizaje profundo. Su página tecnológica actual describe un modelo de clasificación oración por oración y no menciona ninguno de los dos términos. La descripción sigue circulando porque el propio explicador de GPTZero de 2023 popularizó ambas palabras antes de que cambiara el método.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.