AI Detection

Comment fonctionnent les détecteurs d'IA ? Perplexité, burstiness et probabilité des jetons

Les détecteurs d'IA ne reconnaissent pas l'écriture machine comme le ferait un lecteur. Ils mesurent à quel point votre texte est prévisible, puis transforment cela en score. Une fois cela compris, la technologie et ses limites deviennent plus claires.

7 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

Votre université a commencé à faire passer les soumissions dans un détecteur d'IA, et un rapport est revenu avec un chiffre auquel vous ne vous attendiez pas. Avant d'essayer de le contester, il est utile de savoir ce que ce chiffre signifie. Comment fonctionnent les détecteurs d'IA ? Ils ne lisent pas l'écriture machine comme le fait une personne. Ils mesurent à quel point votre texte est prévisible pour un modèle de langage, puis transforment cette prévisibilité en score. Rien dans ce processus n'examine ce que vous voulez dire, votre argument, ni si vous avez réellement écrit le texte.

J'ai passé des années à construire des outils qui analysent le texte statistiquement, et la chose la plus utile à comprendre à propos de la détection est la suivante, il s'agit d'une mesure de la typicité, et non de l'origine. Une fois cela compris, la technologie et ses limites prennent beaucoup plus de sens.

Ce qu'un détecteur mesure réellement

Un détecteur ne sait pas qui a écrit quoi que ce soit. Ce qu'il possède, c'est un modèle de langage et une fonction de score. Le modèle lit votre texte de gauche à droite, et à chaque point il produit une distribution de probabilités sur le mot qui devrait venir ensuite. Donnez-lui les mots "the results of the" et il classera "study" au plus haut, "experiment" un peu plus bas, et "marmalade" quelque part près de zéro.

Le détecteur pose donc une seule question à votre document, à quelle fréquence ce texte a-t-il choisi le mot que le modèle attendait ? Une rédaction qui ne cesse d'aboutir à des mots à forte probabilité paraît produite par une machine, parce que c'est exactement ce qu'un générateur de texte fait. Le modèle échantillonne à partir du sommet de sa propre distribution, encore et encore, pour des milliers de jetons.

C'est pourquoi toute cette catégorie repose sur un terrain plus fragile que ne le suggère le marketing. Un détecteur ne trouve pas de filigrane ni d'empreinte. Il constate que votre prose est statistiquement peu surprenante, et une prose peu surprenante a de nombreuses causes autres qu'un chatbot.

Perplexité, à quel point le modèle est surpris

La mesure principale s’appelle la perplexité, et elle est plus simple qu’elle n’en a l’air. Prenez la probabilité que le modèle a attribuée à chaque mot qui est effectivement apparu, faites la moyenne des logarithmes de ces probabilités, puis élevez le résultat à la puissance exponentielle. On obtient un seul nombre qui décrit à quel point le modèle a été surpris par votre document. Vous pouvez vérifier la perplexité de votre propre brouillon plutôt que de la deviner.

Une faible perplexité signifie que le texte a suivi la direction attendue par le modèle. Une forte perplexité signifie qu’il a continué à prendre des tournants que le modèle n’attendait pas. L’écriture humaine tend à se situer plus haut, parce que les personnes vont chercher le nom commun spécifique inhabituel, la construction peu courante, la phrase qui commence de manière inattendue. Le texte généré tend à se situer plus bas, parce que le processus de décodage est conçu pour éviter précisément ces mouvements.

Comparez deux façons d’ouvrir une section de méthodes. "The results of the study were statistically significant" est une séquence que presque n’importe quel modèle prédirait avec une grande confiance, parce qu’elle ne contient aucune information inattendue. "Two of the three cohorts drifted before week six, which we had not planned for" est beaucoup moins prévisible, parce qu’elle contient une information précise et maladroite qui ne pouvait pas être devinée à partir du reste de l’article. La seconde impose au détecteur une véritable surprise, et c’est cette surprise qui est interprétée comme humaine.

La burstiness, la variance, pas la moyenne

La perplexité à elle seule ne suffit pas, parce qu’un document peut donner en moyenne un nombre parfaitement raisonnable tout en étant suspectement uniforme en profondeur. Ce qui compte, c’est la variation dans votre texte, et c’est ce que mesure la burstiness, à savoir l’ampleur des variations de la longueur des phrases et de la perplexité au niveau de la phrase au fil de l’écriture. Un vérificateur de burstiness vous montrera directement cette dispersion.

Nous accélérons quand nous sommes confiants et nous ralentissons quand nous nuançons, et ce rythme se retrouve dans la prose. Les gens écrivent par à-coups. Un paragraphe peut s’ouvrir sur une phrase déclarative courte de huit mots, enchaîner avec une phrase de trente-quatre mots qui comporte trois propositions et une parenthèse, puis revenir à quelque chose de vif.

La sortie du modèle ne fait pas cela de manière fiable. Les phrases se regroupent autour de la longueur moyenne. Les paragraphes arrivent en ensembles bien ordonnés. Chaque section commence par reformuler son propre titre. La lecture est fluide et le score est mauvais, car une faible variance entre les phrases est l’un des signaux les plus forts dont dispose un détecteur. Ce n’est pas une phrase isolée qui le trahit. C’est l’uniformité.

SignalCe qu’il mesurePourquoi le texte machine obtient un faible score
PerplexityÀ quel point le modèle est surpris par vos choix de mots, en moyenne sur l’ensemble du documentLe décodage échantillonne par conception des jetons à forte probabilité
BurstinessDans quelle mesure la longueur des phrases et la prévisibilité varient dans le texteLa sortie se regroupe autour de la moyenne au lieu d’osciller
Probabilité des jetonsLa vraisemblance par mot à partir de laquelle les deux autres sont calculéesDe longues séquences de choix pris individuellement sans particularité

Probabilité des jetons et origine du score

Ces deux nombres sont construits à partir d’un troisième, la log-vraisemblance par jeton, la matière première à partir de laquelle tout le reste est calculé. Certains outils vous la montrent directement, en mettant en évidence les passages où votre texte était le plus prévisible. Ces mises en évidence ne sont pas des accusations visant des phrases précises, quelle que soit l’implication de l’interface. Ce sont les parties qui ont le plus contribué à un nombre au niveau du document.

Les approches de recherche ont dépassé les simples seuils. DetectGPT et ses descendants examinent la courbure, ils perturbent légèrement votre texte et vérifient si la vraisemblance chute selon le schéma que le texte généré tend à présenter. D’autres comparent le même passage sous deux modèles différents et utilisent le désaccord comme signal.

Une conséquence importe pour toute personne évaluée. Comme les métriques sont calculées par rapport à un modèle de référence particulier, un score est toujours relatif à ce modèle. Deux détecteurs peuvent lire le même paragraphe et être totalement en désaccord, sans qu’aucun ne soit défaillant. Ils répondent à la même question avec des points de référence différents.

La deuxième conséquence est moins souvent signalée. Un modèle ne peut trouver un passage prévisible que si ce passage ressemble à ce sur quoi il a été entraîné, de sorte que la qualité de la détection se dégrade à mesure que l’écart se creuse entre le modèle de référence et ce qui a produit le texte. Les générateurs plus récents, les disciplines inhabituelles et les langues autres que l’anglais ouvrent tous cet écart. C’est en partie pourquoi une précision mesurée dans un benchmark contrôlé survit rarement au contact d’une véritable pile de soumissions.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Ce que les détecteurs commerciaux ajoutent en plus

Les outils que les institutions achètent réellement n’exécutent pas la perplexité des manuels. Turnitin, GPTZero, Originality et les autres entraînent des classificateurs supervisés sur de grands ensembles étiquetés de textes humains et de textes produits par machine, en utilisant des caractéristiques statistiques aux côtés de caractéristiques stylistiques. Ce que le classificateur apprend est simplement ce qui distingue ces deux ensembles dans ses données d’entraînement, ce qui est plus étroit et plus historique que l’"écriture IA" en général.

La dépendance à l’entraînement est le problème discret. Un classificateur entraîné principalement sur une génération de sorties de modèle doit généraliser à des modèles plus récents, à des disciplines peu familières et à des auteurs dont l’anglais ne ressemble pas à sa distribution d’entraînement. Les fournisseurs publient des chiffres de précision issus de leurs propres évaluations, et les benchmarks indépendants aboutissent régulièrement à des résultats bien inférieurs à ces chiffres sur les mêmes outils.

Lire un score sans le surinterpréter

Un rapport de détecteur arrive généralement sous forme de pourcentage, et ce pourcentage est régulièrement mal interprété. Il ne s’agit pas de la proportion de votre document rédigée par une machine. Selon l’outil, il s’agit d’un niveau de confiance du classificateur, ou de la part des phrases qui ont franchi un certain seuil interne, et les fournisseurs restent souvent vagues sur ce point. Deux rapports affichant tous deux soixante pour cent peuvent signifier des choses très différentes.

Il est également utile de savoir ce qui fait varier un score pour des raisons qui n’ont rien à voir avec l’auteur du texte. Les documents courts sont plus bruités, parce qu’il y a moins de texte pour stabiliser les moyennes, et un essai de cinq cents mots peut varier fortement sous l’effet de deux ou trois phrases inhabituelles. Le matériel cité compte aussi, sauf si l’outil le retire, de sorte qu’une revue de littérature remplie de citations en bloc hérite de la prévisibilité de ce qu’elle cite. Un passage technique chargé de terminologie standard se comporte de la même manière.

Si vous êtes la personne visée par un signalement, la réponse utile est une preuve plutôt qu’un argument sur la métrique. L’historique des versions, les brouillons, les notes et les enregistrements de recherche témoignent tous du processus, et c’est le processus qu’un comité de manquement à l’intégrité peut réellement évaluer. Il n’existe aucun seuil que l’on puisse citer et qui sépare un auteur soigneux d’un modèle.

Pourquoi les détecteurs signalent des textes qu’aucun modèle n’a produits

Les faux positifs ne sont pas un dysfonctionnement rare. Ils découlent directement de la mesure de la typicité. Tout texte qui est réellement prévisible obtiendra un score de prévisibilité, quel que soit son auteur.

Les auteurs dont l’anglais n’est pas la langue maternelle sont les plus touchés. Des chercheurs de Stanford ont constaté que les détecteurs classaient à tort une grande part des essais rédigés par des locuteurs non natifs comme générés par machine, tout en classant correctement les essais de locuteurs natifs. La raison est mécanique plutôt que malveillante, les auteurs qui travaillent dans une deuxième langue ont tendance à recourir à des constructions éprouvées et à un vocabulaire plus courant. C’est exactement le profil d’une faible perplexité, ce qui explique pourquoi les rédacteurs ESL sont signalés pour avoir écrit avec soin.

Les conventions académiques provoquent le même problème. Une section de méthodes est censée être formulée de manière stéréotypée. La rédaction juridique, la documentation technique et le compte rendu clinique valorisent toutes la formulation standard plutôt que la formulation inventive. Une révision lourde aggrave encore ce phénomène, puisque polir un brouillon signifie généralement supprimer les irrégularités qui portaient votre signature statistique.

Les institutions l’ont remarqué. Vanderbilt a désactivé la fonction de détection de l’IA de Turnitin plutôt que d’agir sur des scores qu’elle ne pouvait pas vérifier, et d’autres universités ont limité la manière dont les chiffres peuvent être utilisés dans les procédures de manquement. Il faut considérer le score d’un détecteur comme un élément de preuve faible, et non comme un verdict.

Ce que cela signifie pour votre propre écriture

Le conseil pratique qui découle de ces mécanismes n’a rien d’exotique, et rien de tout cela ne consiste à tricher avec quoi que ce soit. Variez délibérément la longueur de vos phrases, car c’est l’uniformité qui ressort. Conservez le détail précis, le chiffre réel, la limitation réelle, ce qui a mal tourné à la semaine 6. La compétence générique est ce qui obtient un score de texte produit par machine, et la précision est à la fois une meilleure écriture et un signal plus fort.

Conservez aussi votre propre idiome. Si vous avez une manière de formuler les choses, gardez-la. L’instinct qui consiste à lisser un brouillon jusqu’à ce qu’il ressemble à tous les autres articles du domaine est précisément l’instinct qui fait baisser votre perplexity.

Une chose à éviter, certains outils introduisent délibérément des erreurs grammaticales pour augmenter la perplexity. Cela fonctionne pour la métrique et c’est une très mauvaise idée pour tout texte noté ou évalué par les pairs, puisque vous échangez un soupçon contre une certitude. L’objectif est une écriture qui se lit comme la vôtre, et non une écriture qui a été endommagée volontairement. C’est toute la différence entre réécrire pour un lecteur humain et dégrader un texte pour tromper un score.

Si vous voulez voir ces chiffres pour votre propre brouillon plutôt que de prendre une boîte noire au mot, les mesures sous-jacentes ne sont pas secrètes. Les outils gratuits d’analyse de texte vous montreront où se situe votre prose, et vous pourrez décider vous-même si les passages plats constituent un problème stylistique qui mérite d’être corrigé.

Frequently Asked Questions

Oui, et de manière prévisible. Les détecteurs mesurent à quel point un texte est statistiquement prévisible, pas qui l'a écrit, donc tout texte réellement formulé de manière stéréotypée obtient un score de texte généré par machine. Des évaluations indépendantes signalent de façon constante une précision inférieure aux affirmations des éditeurs, et plusieurs universités ont restreint l'usage possible des scores.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Comment fonctionnent les détecteurs d'IA ? | TextPulse.ai