Comment fonctionne GPTZero
GPTZero a rendu la perplexité et la burstiness célèbres, puis a discrètement abandonné les deux. Voici ce que son classifieur mesure désormais, ce qu’un rapport montre réellement, et où l’outil énonce lui-même ses limites.
Tapez "how gptzero works" dans une barre de recherche, et la plupart des résultats décrivent encore la perplexité et la burstiness, les deux statistiques que son fondateur a rendues célèbres dans les premières semaines après la sortie de ChatGPT. Cette description était exacte en janvier 2023. Elle ne l’est plus depuis l’automne de cette année-là, lorsque la propre documentation de GPTZero indique que l’entreprise a remplacé cette méthode par quelque chose de tout à fait différent. L’écart entre ce que l’outil faisait au lancement et ce qu’il fait maintenant est suffisamment grand pour que la plupart des explications encore en circulation aujourd’hui décrivent un produit qui n’existe plus.
Aujourd’hui, GPTZero exécute un classificateur phrase par phrase sur un vaste corpus mixte de textes produits par des humains et de textes produits par l’IA, plutôt qu’un calcul de perplexité. GPTZero fournit toujours un seul chiffre principal, mais le calcul est différent. La mise en évidence au niveau de la phrase sous ce chiffre principal a aussi une signification différente de celle qu’elle avait en 2023. Les deux versions de l’histoire méritent d’être connues, celle qui a rendu les termes célèbres, et celle qui fonctionne réellement aujourd’hui.
L’histoire, comment la perplexité et la burstiness ont rendu GPTZero célèbre
Le 2 janvier 2023, Edward Tian, alors étudiant à Princeton, a publié une démonstration publique de GPTZero, quelques semaines seulement après la sortie de ChatGPT. Sa page explicative d’origine décrit comment il a utilisé deux statistiques empruntées à la modélisation du langage pour détecter quand un modèle de langage a écrit quelque chose. La perplexité est un score qui mesure à quel point un modèle de référence a été surpris par les choix de mots dans le texte. La burstiness est le terme employé par GPTZero pour désigner l’ampleur des fluctuations de cette surprise au fil d’un document. Si ces pages explicatives ont permis à ces deux mots d’entrer dans la conversation courante sur l’écriture par IA, c’est bien pour cette raison. La plupart des personnes qui savent définir la perplexité ou la burstiness aujourd’hui ont appris ces termes grâce à GPTZero, et non dans un manuel.
Le mécanisme lui-même était simple à décrire. Faites passer un passage par un modèle de langage de référence, et la prose que le modèle juge très prévisible, à faible perplexité, apparaît comme typique d’une machine, puisque la génération tend à privilégier le mot suivant le plus probable plutôt que celui qui surprend. La propre documentation retirée de GPTZero a même publié une règle empirique, un score de perplexité supérieur à 85 était considéré comme plus probablement humain que machine. Ce seuil provenait d’un seul fournisseur, sur un seul modèle, à un moment donné, et GPTZero lui-même ne le défend plus.
Comment GPTZero fonctionne désormais, un classificateur au niveau de la phrase
Le centre d’assistance de GPTZero indique clairement que l’entreprise a cessé d’utiliser la perplexité et la burstiness pour la détection à partir de l’automne 2023, après être passée à une architecture d’apprentissage profond. Sa page technologique actuelle, consultée pour cet article, confirme que le changement est total, elle décrit une approche de deep learning de bout en bout, entraînée sur des textes du web, de l’éducation et sur une gamme de modèles de langage, exécutant un modèle de classification phrase par phrase qui produit une probabilité et un score de confiance. La perplexité et la burstiness n’apparaissent nulle part sur cette page.
Depuis lors, l’entreprise a aussi ajouté une couche de défense, un Paraphraser Shield, conçu pour repérer les textes d’IA qui ont été passés par un outil de reformulation afin d’échapper à la détection. Vous pouvez coller du texte, téléverser des documents Word, des PDF et des fichiers image, jusqu’à cinquante fichiers à la fois. Rien de cette infrastructure n’a quoi que ce soit à voir avec le comptage de la fréquence à laquelle un modèle de référence aurait deviné le même mot.
Humanisez votre propre article
Transformez votre texte assisté par IA et faites-le sonner humain, sans toucher aux mots importants ni aux citations.
Ce qu’un rapport GPTZero vous montre réellement
Un résultat GPTZero comporte trois éléments, une classification en IA, humain ou mixte, un pourcentage exprimant la probabilité, selon le modèle, que le document ait été rédigé par une IA, et une étiquette de confiance décrivant la fiabilité de cette prédiction particulière. L’étiquette compte davantage qu’il n’y paraît. GPTZero associe « très confiant » à un taux d’erreur inférieur à 2 percent et « faible confiance » à un taux d’erreur de 14 percent ou plus, une plage suffisamment large pour que le même pourcentage principal puisse avoir un poids très différent d’un rapport à l’autre.
Les analyses payantes ajoutent une mise en évidence au niveau de la phrase, et il convient de la lire correctement. GPTZero décrit les phrases mises en évidence comme celles qui influencent de manière disproportionnée le score global, et non comme une liste d’accusations contre des lignes individuelles. Une phrase peut ne pas être mise en évidence et avoir néanmoins façonné le résultat, car le classificateur lit le document dans son ensemble plutôt que de voter phrase par phrase.
| Report element | What it tells you |
|---|---|
| Classification | Une seule étiquette, AI, humain ou mixte |
| AI probability score | Un pourcentage reflétant la probabilité que le modèle juge le document rédigé par AI |
| Confidence label | S’étend d’une forte confiance, avec un taux d’erreur inférieur à 2 percent, à une faible confiance, 14 percent ou plus |
| Sentence highlighting | Marque les phrases qui contribuent le plus au score dans Advanced Scan, et non chaque phrase qui y est liée |
Aucun de ces éléments du rapport n’existait sous sa forme actuelle lorsque l’explication sur perplexity et burstiness était encore la description publique de GPTZero. L’interface a changé en même temps que la méthode.
Pourquoi la description de Perplexity et Burstiness circule encore
L’explication originale de GPTZero est toujours en ligne, toujours indexée, et reste l’une des descriptions générales les plus claires du fonctionnement de perplexity et burstiness en tant que concepts. Les moteurs de recherche et d’autres sites continuent de la citer, et certains renvoient à une revue largement diffusée de 2026 affirmant que l’outil exécute toujours discrètement une couche de perplexity et burstiness parallèlement à son classificateur. Les pages actuelles de GPTZero, la page technologique et les deux articles d’assistance, disent le contraire, les termes ont été retirés, et non simplement cachés en arrière-plan. Une page qui décrit un concept de manière abstraite n’est pas la même chose qu’une page qui décrit la méthode actuelle de cet outil, et traiter les deux comme interchangeables explique en grande partie pourquoi la confusion a persisté trois ans après sa date d’expiration.
Cela compte au-delà de l’anecdote. Dire à un étudiant ou à un collègue de réduire la perplexité ou d’étaler la longueur des phrases pour battre GPTZero revient à lui donner un conseil destiné à une version du produit qui a cessé de fonctionner en 2023. Ce qui fait bouger un classificateur de phrases est une question connexe mais différente, plus proche du compte rendu général de comment fonctionnent réellement les détecteurs d’IA que de l’une ou l’autre statistique prise isolément. GPTZero n’a pas cessé de les mesurer, selon sa propre présentation, ils figurent parmi sept indicateurs alimentant le modèle actuel, mais ils ont cessé d’être l’élément qui décide de la réponse.
Ce que GPTZero dit ne pas pouvoir faire
Les chiffres de précision annoncés par GPTZero sont à peu près aussi élevés qu’un fournisseur est susceptible de publier au sujet de son propre produit, 96.5 percent de précision sur des documents mixtes, un taux global de faux positifs que l’entreprise plafonne à 1 percent, et 1.1 percent spécifiquement sur les dissertations TOEFL, substitut courant pour l’écriture en anglais de locuteurs non natifs. Ces chiffres proviennent de l’évaluation propre à GPTZero, sans réplication indépendante citée sur la page qui les présente.
La page des limites de GPTZero est plus précise que les chiffres marketing. L’entreprise indique que la précision s’améliore lorsque davantage de texte est soumis et qu’elle diminue au niveau de la phrase et du paragraphe par rapport au document complet. Elle indique que ses données d’entraînement sont principalement constituées de prose en anglais d’adultes, de sorte que les textes qui s’écartent de ce modèle sont plus difficiles à classer de manière fiable. Elle indique que le classificateur n’est pas entraîné à détecter du texte généré par IA qui a été fortement modifié après sa génération. Et elle indique clairement que d’autres écrits générés par machine ou très procéduraux, et pas seulement les sorties de chatbot, peuvent être signalés de la même manière.
Rien de tout cela ne justifie de considérer le chiffre de GPTZero comme incontestable, et ce n’est pas non plus le seul détecteur qu’il vaille la peine de comprendre selon ses propres termes. Les lecteurs curieux de savoir à quoi répond réellement un classifieur de ce type peuvent voir par eux-mêmes une version de ce schéma avec un vérificateur de perplexité gratuit ou un vérificateur de burstiness gratuit, deux éléments d’une collection d’outils gratuits plus complète qui couvre les autres couches statistiques sur lesquelles s’appuie un rapport de ce type.
Les deux statistiques principales de GPTZero ont leurs propres pages : ce que mesure la perplexité dans la détection par IA, et l’arithmétique des probabilités de jetons qui produit ces deux chiffres.
Un outil qui accepte de nommer ses propres angles morts avec une telle précision mérite davantage de confiance qu’un outil qui prétend n’en avoir aucun, et le prochain pourcentage inexpliqué sur un rapport est un bon point de départ pour se demander quel type d’outil l’a produit.
Questions fréquentes
Non. Le centre d’assistance de GPTZero indique que l’entreprise a cessé d’utiliser la perplexité et la burstiness pour la détection à partir de l’automne 2023, après être passée à un classifieur d’apprentissage profond. Sa page technologique actuelle décrit un modèle de classification phrase par phrase et ne mentionne aucun de ces deux termes. Cette description circule encore parce que l’explicatif de GPTZero en 2023 a popularisé ces deux mots avant le changement de méthode.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.