Cómo funciona GPTZero
GPTZero hizo famosos perplexity y burstiness, y luego retiró ambos en silencio. Aquí se explica qué mide ahora su clasificador, qué muestra realmente un informe y cuáles son los límites que la herramienta reconoce.
Escriba "how gptzero works" en una barra de búsqueda y la mayor parte de lo que aparece sigue describiendo la perplexity y la burstiness, las dos estadísticas que el propio fundador de GPTZero hizo famosas en las primeras semanas después del lanzamiento de ChatGPT. Esa descripción era precisa en enero de 2023. No ha sido precisa desde el otoño de ese año, cuando la propia documentación de GPTZero indica que la empresa sustituyó ese método por otro completamente distinto. La brecha entre lo que la herramienta hacía en el lanzamiento y lo que hace ahora es lo bastante amplia como para que la mayoría de las explicaciones que siguen circulando hoy describan un producto que ya no existe.
Hoy, GPTZero ejecuta un clasificador por frases sobre un corpus amplio y mixto de textos generados por humanos y textos generados por IA, en lugar de un cálculo de perplexity. GPTZero sigue ofreciendo hoy un único número de titular, pero la aritmética es distinta. El resaltado a nivel de frase debajo del número de titular también tiene un significado diferente al que tenía en 2023. Ambas versiones de la historia merecen conocerse: la que hizo famosos los términos, y la que realmente se ejecuta hoy.

La historia: cómo la perplexity y la burstiness hicieron famoso a GPTZero
El 2 de enero de 2023, el entonces estudiante de Princeton Edward Tian publicó una demostración pública de GPTZero, apenas unas semanas después de que saliera ChatGPT. Su página original de explicación describe cómo utilizó dos estadísticas tomadas del modelado del lenguaje para detectar cuándo un modelo de lenguaje ha escrito algo. La Perplexity es una puntuación de qué tan sorprendido estaba un modelo de referencia por las elecciones de palabras del texto. La Burstiness es el nombre de GPTZero para indicar cuánto fluctúa esa sorpresa a lo largo de un documento. Esas páginas de explicación son la razón por la que ambas palabras entraron en la conversación cotidiana sobre la escritura con IA. La mayoría de las personas que hoy pueden definir la Perplexity o la Burstiness aprendieron los términos de GPTZero, no de un libro de texto.
El mecanismo en sí era sencillo de describir. Se introduce un fragmento en un modelo de lenguaje de referencia, y la prosa que el modelo encuentra altamente predecible, con baja Perplexity, se lee como típica de una máquina, ya que la generación tiende a favorecer la siguiente palabra más probable frente a la sorprendente. La documentación retirada de GPTZero incluso publicó una regla general: una puntuación de Perplexity por encima de 85 se interpretaba como más probable que fuera humana que de máquina. Ese umbral procedía de un solo proveedor, en un solo modelo, en un momento dado, y GPTZero ya no lo respalda.
Cómo funciona GPTZero ahora: un clasificador a nivel de oración
El centro de soporte de GPTZero lo afirma de manera directa: "A partir del otoño de 2023, GPTZero ya no utiliza la Perplexity y la Burstiness para su detección de IA porque migramos a una arquitectura basada en aprendizaje profundo". Su página de tecnología actual confirma que el cambio es total. Describe "un enfoque de aprendizaje profundo de extremo a extremo, entrenado con conjuntos de datos de texto de la web, la educación y el contenido generado por IA a partir de una variedad de LLMs", en el que "un modelo de clasificación, oración por oración, determina la probabilidad y la confianza de que un texto haya sido creado por IA". La Perplexity y la Burstiness no aparecen en ninguna parte de esa página.
Desde entonces, también se ha añadido una capa de defensa, un Paraphraser Shield, diseñado para detectar texto generado por IA que se ha sometido a una herramienta de reescritura para eludir la detección. Puede pegar texto, cargar documentos de Word, PDFs y archivos de imagen, y hasta cincuenta archivos a la vez. Ninguna de esa infraestructura tiene que ver con contar la frecuencia con la que un modelo de referencia habría adivinado la misma palabra.
Qué muestra realmente un informe de GPTZero
Un resultado de GPTZero incluye tres partes: una clasificación de IA, humano o mixto, un porcentaje que expresa la probabilidad del modelo de que el documento haya sido escrito por IA, y una etiqueta de confianza que describe lo fiable que es esa predicción en particular. La etiqueta importa más de lo que podría parecer. GPTZero vincula "altamente confiable" con una tasa de error inferior al 2 por ciento y "baja confianza" con una tasa de error del 14 por ciento o superior, un rango lo bastante amplio como para que el mismo porcentaje de titular pueda tener un peso muy diferente de un informe a otro.
Los escaneos de pago añaden resaltado a nivel de frase, y merece la pena leerlo correctamente. GPTZero describe las frases resaltadas como las que afectan de manera desproporcionada a la puntuación global, no como una lista de acusaciones contra líneas individuales. Una frase puede no aparecer resaltada y aun así haber dado forma al resultado, porque el clasificador lee el documento en su conjunto en lugar de votar frase por frase.
| Elemento del informe | Lo que le indica |
|---|---|
| Clasificación | Una única etiqueta: IA, humano o mixto |
| Puntuación de probabilidad de IA | Un porcentaje que refleja la probabilidad con la que el modelo juzga que el documento ha sido escrito por IA |
| Etiqueta de confianza | Va desde altamente confiable, con una tasa de error inferior al 2 por ciento, hasta baja confianza, 14 por ciento o superior |
| Resaltado de frases | Marca las frases que contribuyen más a la puntuación en Advanced Scan, no todas las frases vinculadas a ello |
Ninguno de estos elementos del informe existía en su forma actual cuando la explicación de perplexity y burstiness todavía era la descripción pública de sí mismo de GPTZero. La interfaz cambió junto con el método.
Humanice su propio trabajo
Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.
Por qué la descripción de la Perplexity y la Burstiness sigue circulando
El explicador original de GPTZero sigue en línea, sigue indexado y sigue siendo una de las descripciones generales más claras de cómo funcionan la perplexity y la burstiness como conceptos. Los motores de búsqueda y otros sitios siguen citándolo, y algunos señalan una reseña ampliamente compartida de 2026 que afirma que la herramienta todavía ejecuta en silencio una capa de perplexity y burstiness junto a su clasificador. Las páginas actuales de GPTZero, la página de tecnología y ambos artículos de soporte, dicen lo contrario: los términos fueron retirados, no solo ocultados entre bastidores. Una página que describe un concepto en abstracto no es lo mismo que una página que describe el método actual de esta herramienta, y tratar ambas como intercambiables es, en gran medida, la razón por la que la confusión ha durado tres años después de su fecha de caducidad.
Esto importa más allá de la anécdota. A un estudiante o a un colega, al que le indican reducir la perplexity o repartir la longitud de las oraciones específicamente para superar a GPTZero, se le está dando un consejo dirigido a una versión del producto que dejó de funcionar en 2023. Lo que mueve un clasificador de oraciones es una cuestión relacionada pero distinta, más cercana al relato más amplio de cómo funcionan realmente los detectores de IA que a cualquiera de las estadísticas por sí sola. GPTZero no ha dejado de medirlas, según su propio relato se sitúan entre siete indicadores que alimentan el modelo actual, pero dejaron de ser aquello que decide la respuesta.
Lo que GPTZero dice que no puede hacer
Los benchmarks publicados por GPTZero son, aproximadamente, igual de sólidos que lo que un proveedor probablemente publicaría sobre su propio producto. La empresa informa de "una tasa de precisión del 99% al detectar texto generado por IA frente a la escritura humana", afirma "que mantenemos la tasa de falsos positivos de GPTZero en no más de un 1% al evaluar texto de IA frente a texto humano", y registra "una tasa de precisión del 96,5%" en envíos que mezclan escritura de IA y humana, junto con un 1,1 por ciento en ensayos de TOEFL, un sustituto habitual para la escritura en inglés no nativo. Esos datos proceden de la evaluación propia de GPTZero, publicada en enero de 2025, sin que en la página que los informa se cite ninguna replicación independiente. La misma página también matiza la afirmación que la mayoría de los proveedores suele utilizar, al señalar que "no va a existir nunca una garantía del 100%" y que cualquiera que afirme lo contrario probablemente tiene una falla en sus datos o en su método de evaluación.
La página de limitaciones de GPTZero es más específica que las cifras de marketing. La empresa indica que la precisión mejora a medida que se envía más texto y disminuye a nivel de frase y de párrafo en comparación con el documento completo. Afirma que sus datos de entrenamiento consisten en su mayor parte en prosa adulta en inglés, por lo que el texto que se aparta de ese patrón es más difícil de clasificar de forma fiable. Señala que el clasificador no está entrenado para detectar texto de IA que haya sido modificado en gran medida después de la generación. Y afirma de manera directa que otra escritura generada por máquinas o altamente procedimental, no solo la salida de un chatbot, puede marcarse de la misma forma.
Ninguna de esas cuestiones es motivo para tratar la cifra de GPTZero como algo fuera de toda duda, y tampoco es el único detector que merece entenderse en sus propios términos. Los lectores que sientan curiosidad por saber a qué responde realmente un clasificador como este pueden ver una versión de ese patrón por sí mismos con un verificador de perplexity gratuito o con un verificador de burstiness gratuito, dos piezas de una colección gratuita de herramientas más amplia que cubre las otras capas estadísticas en las que se basa un informe como este.
Las dos estadísticas principales de GPTZero tienen páginas propias: lo que la perplexity mide en la detección de IA, y la aritmética de la probabilidad del token que produce ambos números.
Un instrumento dispuesto a nombrar sus propios puntos ciegos con tanta precisión merece más confianza que uno que afirma que no tiene ninguno, y el siguiente porcentaje sin explicación en un informe es un buen lugar para empezar a preguntar qué tipo de instrumento lo produjo.
Lo que encontró nuestra propia investigación
En el estudio de concordancia entre detectores de TextPulse Research, nueve detectores comerciales de IA calificaron los mismos 90 textos académicos. Uno era un texto híbrido de 455 palabras: una apertura y un cierre escritos por humanos alrededor de una parte central de 168 palabras generada por IA. GPTZero puntuó este texto con 41.2% de IA, mientras que los veredictos de las demás herramientas sobre las mismas palabras fueron de 0% a 95.7% de IA. El artículo completo, el corpus y la matriz de puntuaciones por herramienta están en acceso abierto en TextPulse Research.

Preguntas frecuentes
No. El centro de ayuda de GPTZero indica que la empresa dejó de usar perplexity y burstiness para la detección a partir del otoño de 2023, tras cambiar a un clasificador de aprendizaje profundo. Su página tecnológica actual describe un modelo de clasificación oración por oración y no menciona ninguno de los dos términos. La descripción sigue circulando porque el propio explicador de GPTZero de 2023 popularizó ambas palabras antes de que cambiara el método.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.