AI Detection

Comment fonctionne GPTZero

GPTZero a rendu la perplexité et la burstiness célèbres, puis les a discrètement abandonnées. Voici ce que son classificateur mesure désormais, ce qu'un rapport montre réellement, et où l'outil énonce ses propres limites.

Mis à jour le 5 min
Diagram showing how GPTZero works today: a sentence-level AI classifier replacing its original perplexity and burstiness method

Entrez « how gptzero works » dans une barre de recherche, et la plupart des résultats renvoyés décrivent encore la perplexity et la burstiness, les deux statistiques que son propre fondateur a rendues célèbres dans les premières semaines suivant la sortie de ChatGPT. Cette description était exacte en janvier 2023. Elle ne l’a plus été depuis l’automne de cette même année, lorsque la documentation de GPTZero indique que l’entreprise a remplacé cette méthode par autre chose, entièrement. L’écart entre ce que l’outil faisait au lancement et ce qu’il fait aujourd’hui est suffisamment important pour que la plupart des explications encore en circulation décrivent un produit qui n’existe plus.

Aujourd’hui, GPTZero fait tourner un classificateur phrase par phrase sur un vaste corpus mixte de textes produits par des humains et de textes produits par une IA, plutôt qu’un calcul de perplexity. Aujourd’hui encore, GPTZero fournit un seul chiffre en tête de page, mais l’arithmétique est différente. Le surlignage au niveau des phrases sous le chiffre principal a également une signification différente de celle qu’il avait en 2023. Les deux versions de l’histoire valent la peine d’être connues, celle qui a rendu ces termes célèbres, et celle qui fonctionne réellement aujourd’hui.

GPTZero result screen highly confident a passage is AI generated: 100% AI probability with per-sentence highlighting and an AI vocabulary tab
GPTZero sur un paragraphe rédigé par une IA, un verdict au niveau du document, un surlignage phrase par phrase des phrases qui le motivent, et une liste de vocabulaire IA. Le billet passe en revue les trois niveaux.

L’histoire, comment la perplexity et la burstiness ont rendu GPTZero célèbre

Le 2 janvier 2023, l’ancien étudiant de Princeton Edward Tian a publié une démonstration publique de GPTZero, à peine quelques semaines après la sortie de ChatGPT. Sa page d’explication originale décrit comment il a utilisé deux statistiques empruntées à la modélisation du langage pour détecter quand un modèle de langage a rédigé quelque chose. La perplexité est un score qui mesure à quel point un modèle de référence a été surpris par les choix de mots dans le texte. La burstiness est le nom donné par GPTZero à la mesure dans laquelle cette surprise fluctue au fil d’un document. Ces pages d’explication sont la raison pour laquelle les deux mots sont entrés dans la conversation quotidienne au sujet de l’écriture par IA. La plupart des personnes capables de définir la perplexité ou la burstiness aujourd’hui ont appris ces termes grâce à GPTZero, et non à partir d’un manuel.

Le mécanisme lui-même était simple à décrire. Faites passer un extrait dans un modèle de langage de référence, et la prose que le modèle juge hautement prévisible, faible perplexité, se lit comme typique d’une machine, puisque la génération a tendance à privilégier le mot le plus probable suivant plutôt que le mot surprenant. La documentation propre de GPTZero, désormais retirée, a même publié une règle empirique, selon laquelle un score de perplexité supérieur à 85 indiquait qu’il était plus probable qu’il s’agisse d’un humain plutôt que d’une machine. Ce seuil provenait d’un seul fournisseur, sur un seul modèle, à un moment donné, et GPTZero lui-même ne s’y rallie plus.

Comment GPTZero Fonctionne Maintenant, Un Classificateur Au Niveau De La Phrase

Le centre d’assistance de GPTZero l’indique clairement, « Depuis l’automne 2023, GPTZero n’utilise plus la perplexité et la burstiness pour sa détection d’IA, car nous avons migré vers une architecture fondée sur l’apprentissage profond. » Sa page de technologie actuelle, confirme que le changement est total. Elle décrit « une approche d’apprentissage profond de bout en bout, entraînée sur des ensembles de données textuelles provenant du web, de l’éducation et de contenus générés par l’IA à partir d’une gamme de LLM », dans laquelle « un modèle de classification phrase par phrase détermine la probabilité et le niveau de confiance qu’un texte ait été créé par une IA ». La perplexité et la burstiness n’apparaissent nulle part sur cette page.

Depuis lors, une couche de défense supplémentaire a également été ajoutée, un Paraphraser Shield, conçu pour détecter du texte produit par l'IA qui a été passé par un outil de réécriture afin d'échapper à la détection. Vous pouvez coller du texte, téléverser des documents Word, des PDF et des fichiers image, jusqu'à cinquante fichiers à la fois. Cette infrastructure n'a toutefois rien à voir avec le comptage de la fréquence à laquelle un modèle de référence aurait deviné le même mot.

Ce qu'un rapport de GPTZero montre réellement

Un résultat de GPTZero comporte trois éléments, une classification de l'IA, humain ou mixte, un pourcentage exprimant la probabilité du modèle que le document ait été rédigé par une IA, et une étiquette de confiance décrivant la fiabilité de cette prédiction particulière. L'étiquette compte davantage qu'il n'y paraît. GPTZero associe « très confiant » à un taux d'erreur inférieur à 2 pour cent et « faible confiance » à un taux d'erreur de 14 pour cent ou plus, une plage suffisamment large pour que le même pourcentage de titre puisse avoir un poids très différent d'un rapport à l'autre.

Les analyses payantes ajoutent un surlignage au niveau des phrases, et il vaut la peine de le lire correctement. GPTZero décrit les phrases surlignées comme celles qui influencent de manière disproportionnée le score global, et non comme une liste d'accusations visant des lignes individuelles. Une phrase peut ne pas être surlignée tout en ayant contribué au résultat, parce que le classificateur lit le document dans son ensemble plutôt que de voter phrase par phrase.

Élément du rapportCe qu'il vous indique
ClassificationUne seule étiquette, IA, humain, ou mixte
Score de probabilité de l'IAUn pourcentage reflétant la probabilité que le modèle juge le document comme ayant été rédigé par une IA
Étiquette de confianceVa de très confiant, avec un taux d'erreur inférieur à 2 pour cent, à faible confiance, 14 pour cent ou plus
Surlignage des phrasesMarque les phrases contribuant le plus au score dans Advanced Scan, et non chaque phrase liée à celui-ci

Aucun de ces éléments de rapport n'existait sous sa forme actuelle lorsque l'explication perplexity-and-burstiness était encore la description publique de GPTZero de lui-même. L'interface a changé en même temps que la méthode.

Humanisez votre propre article

Transformez votre texte assisté par IA et faites-le sonner humain, sans toucher aux mots importants ni aux citations.

Commencer gratuitement

Pourquoi la description de la Perplexity et de la Burstiness continue de circuler

L'explication initiale de GPTZero est toujours en ligne, toujours indexée, et demeure l'une des descriptions générales les plus claires de la manière dont la perplexity et la burstiness fonctionnent comme des concepts. Les moteurs de recherche et d'autres sites continuent de la citer, et certains renvoient à une revue largement partagée de 2026 affirmant que l'outil continue de faire tourner discrètement une couche de perplexity et de burstiness en parallèle de son classificateur. Les pages actuelles de GPTZero, la page de la technologie et les deux articles d'assistance, disent l'inverse, les termes ont été retirés, et non simplement dissimulés en coulisses. Une page décrivant un concept de manière abstraite n'est pas la même chose qu'une page décrivant la méthode actuelle de cet outil, et traiter les deux comme interchangeables est très probablement la principale raison pour laquelle la confusion a duré trois ans après sa date d'expiration.

Cela compte au-delà des anecdotes. Un étudiant ou un collègue à qui l'on conseille de réduire la perplexity ou d'espacer la longueur des phrases, précisément pour contourner GPTZero, reçoit une recommandation visant une version du produit qui a cessé de fonctionner en 2023. Ce qui fait évoluer un classificateur de phrases est une question connexe mais différente, plus proche du récit plus général de comment les détecteurs d'IA fonctionnent réellement que de l'une ou l'autre statistique prise isolément. GPTZero n'a pas cessé de les mesurer, selon ses propres dires, elles figurent parmi sept indicateurs alimentant le modèle actuel, mais elles ont cessé d'être l'élément qui détermine la réponse.

Ce que GPTZero dit ne pas pouvoir faire

Les benchmarks publiés par GPTZero sont à peu près aussi solides qu'un fournisseur est susceptible de publier au sujet de son propre produit. La société indique un « taux de précision de 99 % lors de la détection de textes générés par IA par rapport à l'écriture humaine », affirme « que nous maintenons le taux de faux positifs de GPTZero à au plus 1 % lors de l'évaluation de textes d'IA par rapport à des textes humains », et consigne « un taux de précision de 96,5 % » sur des soumissions mêlant écriture d'IA et écriture humaine, ainsi que 1,1 pour cent sur des essais TOEFL, un substitut courant pour l'écriture en anglais non natif. Ces chiffres proviennent de l'évaluation propre à GPTZero, publiée en janvier 2025, sans réplication indépendante citée sur la page qui les rapporte. La même page infirme aussi la revendication que la plupart des fournisseurs avancent, en indiquant que « il n'y aura jamais de garantie à 100 % » et que toute personne affirmant le contraire a probablement un défaut dans ses données ou dans sa méthode d'évaluation.

La page des limites propres à GPTZero est plus précise que les chiffres de marketing. La société indique que la précision s'améliore à mesure que davantage de texte est soumis et qu'elle diminue au niveau de la phrase et du paragraphe par rapport au document complet. Elle indique que ses données d'entraînement sont principalement constituées de prose adulte en anglais, de sorte que les textes qui s'écartent de ce schéma sont plus difficiles à classifier de manière fiable. Elle indique que le classificateur n'est pas entraîné pour détecter des textes d'IA qui ont été fortement modifiés après la génération. Et elle indique clairement que d'autres écritures produites par machine ou très procédurales, pas seulement la sortie d'un chatbot, peuvent être signalées de la même manière.

Aucune de ces raisons ne justifie de considérer le chiffre de GPTZero comme hors de tout doute, et ce n'est pas le seul détecteur qu'il vaille la peine de comprendre en tant que tel. Les lecteurs qui souhaitent savoir à quoi répond effectivement un classificateur de ce type peuvent voir une version de ce schéma par eux-mêmes avec un vérificateur de perplexité gratuit ou un vérificateur de burstiness gratuit, deux éléments d'une collection d'outils gratuits plus complète, couvrant les autres couches statistiques sur lesquelles un rapport comme celui-ci s'appuie.

Les deux statistiques phares de GPTZero font l'objet de pages à part entière : ce que mesure la perplexité dans la détection par IA, et l'arithmétique de la probabilité du token qui produit les deux nombres.

Un outil qui accepte de nommer ses propres angles morts avec une telle précision mérite davantage de confiance qu'un outil qui prétend n'en avoir aucun, et le prochain pourcentage inexpliqué figurant dans un rapport est un bon point de départ pour commencer à se demander quel type d'outil l'a produit.

Ce que notre propre recherche a montré

Dans l'étude d'accord entre détecteurs de TextPulse Research, neuf détecteurs d'IA commerciaux ont noté les mêmes 90 textes académiques. L'un d'eux était un texte hybride de 455 mots : une ouverture et une conclusion écrites par un humain autour d'un passage central de 168 mots généré par IA. GPTZero a attribué à ce texte 41.2% d'IA, alors que les verdicts des autres outils sur les mêmes mots allaient de 0% à 95.7% d'IA. L'article complet, le corpus et la matrice des scores par outil sont en accès libre sur TextPulse Research.

GPTZero face au texte hybride du corpus de l'étude.
GPTZero face au texte hybride du corpus de l'étude.
XLinkedInFacebook

Questions fréquemment posées

Non. Le centre d'assistance de GPTZero indique que l'entreprise a cessé d'utiliser la perplexité et la burstiness pour la détection à partir de l'automne 2023, après être passée à un classificateur d'apprentissage profond. Sa page technologique actuelle décrit un modèle de classification phrase par phrase et ne mentionne aucun des deux termes. Cette description circule encore parce que l'explicatif 2023 de GPTZero a popularisé ces deux mots avant que la méthode ne change.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Restez informé sur l'humanisation par IA

Recevez dans votre boîte de réception des conseils sur la rédaction académique, la détection de l'IA et l'humanisation.

Pas de spam. Désabonnement à tout moment.