Reseña del detector de IA Pangram: la herramienta que los investigadores siguen validando
Pangram publica una tasa de falsos positivos de aproximadamente 1 en 10,000, y, a diferencia de la mayoría de los proveedores de detectores, ahora cuenta con investigación independiente reciente que apunta en la misma dirección. Un estudio revisado por pares de 2026 de la Vrije Universiteit Brussel concluyó que fue la única de cuatro herramientas que produjo resultados satisfactorios en trabajos de nivel de máster. Aquí se expone qué midieron los estudios, dónde la evidencia sigue siendo escasa y qué no puede probar ninguna puntuación de detector.
Pangram es el detector de IA que los investigadores independientes siguen destacando, lo que hace que merezca una revisión más atenta que la habitual tabla de puntuaciones de los proveedores. Su creador, Pangram Labs, publica una tasa de falsos positivos de aproximadamente 1 en 10,000 y una precisión principal del 99.98 percent. Esas son las cifras de la propia empresa, medidas en sus propios benchmarks. Lo que distingue a Pangram de la mayor parte del sector es que, por una vez, la investigación externa reciente apunta en la misma dirección general.
En el último año aparecieron dos evaluaciones independientes: un estudio revisado por pares de Vrije Universiteit Brussel, publicado por Springer en June 2026, y un working paper de la University of Chicago Booth School cubierto en Chicago Booth Review en December 2025. Ambos situaron a Pangram claramente por delante de rivales más conocidos, incluidos Turnitin, GPTZero y Copyleaks. Ninguno de los dos estudios convierte la puntuación de ningún detector en prueba de nada sobre un documento concreto, y ambos lo dicen explícitamente.
Lo que sigue es lo que Pangram afirma sobre sí mismo, lo que midieron realmente los dos estudios, dónde la evidencia sigue siendo escasa y qué dice el ascenso de esta herramienta sobre el resto del campo de la detección.
Qué es Pangram y quién lo usa
Pangram Labs es una empresa pequeña fundada en 2023 en Brooklyn por investigadores de IA que antes trabajaron en Tesla y Google. El producto analiza texto pegado o cargado y devuelve una estimación de cuánto de él ha sido generado por IA, con resaltado a nivel de oración, además de detección de imágenes y comprobación de plagio en los planes de pago.
Su base de usuarios se parece poco a la de Turnitin. Turnitin se vende a instituciones y funciona dentro de los learning management systems; Pangram puede ser utilizado por cualquiera con una cuenta gratuita, lo que significa que estudiantes, editores, personal de revistas y lectores de admisiones lo usan directamente. Es el recién llegado en este mercado, y cada vez más es la herramienta a la que recurren los investigadores de integridad académica cuando quieren un punto de comparación, precisamente porque sigue obteniendo buenos resultados en pruebas en las que los incumbentes no lo hacen.
Qué afirma el proveedor
Pangram anuncia en su página principal una precisión del 99.98 percent y afirma que su tasa de falsos positivos, la tasa a la que documentos humanos se señalan incorrectamente como AI, es actualmente de 1 en 10,000. Una entrada del blog de la empresa sobre falsos positivos, escrita por su CTO, desglosa esa cifra global por género: 0.004 percent en ensayos académicos, 0.001 percent en resúmenes científicos, con puntos débiles que la propia empresa divulga, como 0.05 percent en poesía y 0.23 percent en recetas. La empresa también afirma que su modelo sigue detectando texto AI después de haber sido procesado por las llamadas herramientas humanizer.
Todas estas son cifras autoinformadas a partir de los propios conjuntos de prueba del proveedor, y la misma entrada incluye las propias advertencias del proveedor: el modelo funciona mejor con texto más largo escrito en oraciones completas, y la empresa desaconseja examinar listas breves con viñetas o texto muy formulaico. Conviene tener presentes ambas partes de esto. Las afirmaciones son inusualmente específicas e inusualmente bajas, y siguen siendo afirmaciones hasta que alguien ajeno a la empresa las compruebe.

Qué muestra la evidencia independiente
La prueba más sólida hasta la fecha es un estudio revisado por pares de Van Vlasselaer, Van Droogenbroeck y Spruyt en la Vrije Universiteit Brussel, publicado en junio de 2026 en el International Journal for Educational Integrity. El equipo elaboró 160 trabajos académicos de nivel de máster de al menos 4,000 palabras cada uno: 40 escritos por estudiantes reales antes de 2019, 40 generados íntegramente con GPT-4o Deep Research, 40 híbridos y 40 generados por IA y luego humanizados deliberadamente. Pasaron todos ellos por Turnitin, GPTZero, Copyleaks y Pangram.
En los trabajos generados íntegramente por IA, el estudio informa que Turnitin, GPTZero y Copyleaks "completely failed to detect the AI-generated content." Turnitin asignó a cada uno de esos 40 trabajos entre 0 y 20 percent AI; las medianas de los tres sistemas establecidos se situaron todas por debajo de 20 percent en trabajos que eran 100 percent machine written. Pangram alcanzó una exactitud estricta de 65 percent y una exactitud inclusiva de 97.5 percent en el mismo conjunto, y clasificó erróneamente un trabajo. En el conjunto humanizado, Pangram identificó correctamente contenido de IA en 37 de 40 casos, con una exactitud estricta de 92.5 percent, mientras que GPTZero logró 2.5 percent, Copyleaks 22.5 percent y Turnitin 50 percent.
| Tool | Fully AI papers (strict accuracy) | Humanized AI papers (strict accuracy) | Human papers correctly cleared |
|---|---|---|---|
| Pangram | 65% | 92.5% | 100% |
| Turnitin | 0% | 50% | 100% |
| GPTZero | 0% | 2.5% | 100% |
| Copyleaks | 0% | 22.5% | 100% |
El segundo dato es un working paper de Brian Jabarian y Alex Imas en Chicago Booth, resumido en el Chicago Booth Review en diciembre de 2025. Al probar detectores en aproximadamente 2,000 pasajes escritos por humanos en seis medios, además de versiones de IA de cuatro modelos frontier, encontraron que la tasa de falsos positivos de Pangram fue esencialmente cero en la mayoría de los umbrales de decisión, con una precisión que nunca cayó por debajo del 99.8 percent en su corpus y falsos negativos entre el 2 y el 4 percent, según el modelo. Los investigadores proponen que las instituciones adopten un límite estricto de política, por ejemplo, no más del 0.5 percent de la escritura humana marcada, antes de confiar operativamente en cualquier detector. Nótese la diferencia de estatus, el artículo de Booth es un working paper, todavía no revisado por pares, y probó texto de IA sin modificar en lugar de trabajos académicos humanizados.
Falsos positivos y quién resulta perjudicado
Los falsos positivos son donde se concentra el daño de los detectores, y el patrón documentado en esta industria es que las marcas recaen de manera desproporcionada sobre escritores de inglés no nativos. El estudio de la VUB merece leerse precisamente por este punto, sus 40 trabajos humanos fueron escritos todos por hablantes no nativos de inglés, y las cuatro herramientas, Pangram incluida, aprobaron el 100 percent de ellos. Ese es un resultado genuinamente alentador, y también son 40 trabajos. Una muestra de ese tamaño no puede confirmar una tasa como 0.004 percent, solo las pruebas internas mucho más amplias del propio proveedor producen cifras tan precisas, y ninguna parte externa las ha replicado a esa escala.
La sección del estudio sobre el mundo real muestra por qué la cautela persiste incluso con buenos benchmarks. Cuando los investigadores ejecutaron Pangram sobre 1,163 tesis de máster reales de 2024 y 2025, marcó al 45.5 percent de ellas en algún nivel, con una mediana de proporción estimada de IA del 30 percent entre los casos marcados, y no existe ground truth para ninguna de esas tesis. Los autores son directos: las puntuaciones de detección son señales iniciales útiles y nunca deben ser la única evidencia en decisiones de alto riesgo. Un estudiante que se enfrenta a una acusación sigue necesitando formas basadas en el proceso para demostrar la autoría, sea cual sea el detector que haya producido el número.
Humanice su propio artículo
Transforme su texto asistido por IA y hágalo sonar humano, sin tocar palabras importantes ni citas.
Precios y acceso
El sitio de Pangram ofrece 20 comprobaciones gratuitas al día tras registrarse para obtener una cuenta, y las suscripciones de pago añaden volumen de créditos y funciones como la detección de plagio. Ese modelo de acceso importa tanto como las cifras de precisión: a diferencia de Turnitin, que un escritor solo encuentra cuando una institución lo ejecuta contra él, Pangram puede comprobarse directamente, de modo que un escritor puede ver la misma clase de señal que un revisor podría ver antes de que se presente nada.
Dónde encaja Pangram en el panorama de los detectores
El resumen de los autores de la VUB sobre el campo es tajante: "From the four AI detection tools studied here, at this moment only one produced satisfactory results." Esa frase dice tanto sobre los actores establecidos como sobre Pangram. Turnitin, la herramienta en la que realmente confían la mayoría de las instituciones, obtuvo cero en el conjunto totalmente generado por IA, y su registro de falsos positivos documentado por separado ya ha obligado a las universidades a tratar sus puntuaciones con cuidado. Todas estas herramientas miden propiedades estadísticas del texto, y la mecánica subyacente explica tanto por qué el enfoque de entrenamiento más reciente de Pangram puede adelantarse como por qué todas ellas siguen siendo probabilísticas.
El veredicto honesto: Pangram es actualmente el detector mejor respaldado en las pruebas independientes, con mucha diferencia, según la evidencia reciente. Esa evidencia también es limitada. Dos estudios, uno revisado por pares y otro no, ambos del último año, en su mayoría en inglés, en su mayoría texto académico y web de formato largo. La detección es una carrera armamentística contra modelos que cambian cada trimestre, y una herramienta que lidera en 2026 mantiene esa ventaja solo hasta la siguiente generación de texto. Una puntuación de Pangram es una estimación mejor calibrada que la que producen sus rivales. Sigue siendo una estimación, no una prueba de lo que hizo una persona concreta.
Ver la comparación completa
Pangram es una herramienta más en un campo saturado y desigual. Para ver cómo se compara con Turnitin, GPTZero, Copyleaks, ZeroGPT y el resto según los mismos criterios, consulte la guía completa AI detectors compared.
Lo que encontró nuestra propia investigación
En el estudio de concordancia entre detectores de TextPulse Research, nueve detectores comerciales de IA calificaron los mismos 90 textos académicos. Uno era un texto híbrido de 455 palabras: una apertura y un cierre escritos por humanos alrededor de una parte central de 168 palabras generada por IA. Pangram puntuó este texto con 34% de IA, mientras que los veredictos de las demás herramientas sobre las mismas palabras fueron de 0% a 95.7% de IA. El artículo completo, el corpus y la matriz de puntuaciones por herramienta están en acceso abierto en TextPulse Research.

Preguntas frecuentes
Las propias afirmaciones de Pangram son 99.98 percent de precisión y una tasa de falsos positivos de aproximadamente 1 en 10,000, medidas con puntos de referencia internos. De manera inusual para este sector, trabajos independientes recientes apuntan en la misma dirección: un estudio revisado por pares de junio de 2026 de la Vrije Universiteit Brussel concluyó que fue la única de cuatro herramientas capaz de detectar de forma fiable trabajos de nivel de máster totalmente generados por IA y humanizados, y un working paper de Chicago Booth encontró una tasa de falsos positivos cercana a cero en su corpus. La evidencia independiente es sólida, pero reciente y limitada en alcance.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.