AI Detection

Pourquoi les détecteurs d'IA sont biaisés contre les rédacteurs non natifs de l'anglais

Une étude Stanford de 2023 a constaté que les détecteurs d'IA interprétaient à tort des écrits en anglais fluides de locuteurs non natifs comme générés par machine à un taux bien plus élevé que les écrits de locuteurs natifs. Voici le mécanisme derrière cet écart, et ce qui s'est passé lorsque les mêmes essais ont été réécrits avec un vocabulaire plus riche.

Mis à jour le 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

Les détecteurs d’IA biaisés contre les locuteurs non natifs ne relèvent pas d’une plainte subjective. Une étude de Stanford de 2023, évaluée par des pairs, l’a mesuré directement. Les chercheurs ont soumis sept détecteurs GPT largement utilisés à 91 véritables dissertations TOEFL rédigées par des locuteurs non natifs de l’anglais et à 88 dissertations rédigées par des élèves américains de huitième année, puis ont comparé les scores obtenus par chaque groupe.

Les détecteurs ont lu correctement les dissertations de huitième année presque à chaque fois. Pour les dissertations TOEFL, rédigées par des adultes qui avaient déjà réussi un examen de compétence en anglais de niveau universitaire, les mêmes sept outils ont produit un taux moyen de faux positifs de 61.22 percent. Quatre-vingt-neuf des quatre-vingt-onze dissertations, soit près de 98 percent, ont été signalées comme générées par l’IA par au moins un des sept outils.

L’aperçu de TextPulse sur les preuves plus larges concernant la précision des détecteurs d’IA présente cette conclusion principale et les actions en justice auxquelles elle a ensuite donné lieu. Ce qui est omis presque partout où l’étude est citée, c’est le mécanisme, pourquoi la prose d’un locuteur d’anglais de niveau universitaire est-elle d’abord lue comme produite par une machine, et qu’est-ce qui change lorsqu’elle cesse d’être lue ainsi.

Détecteurs d’IA biaisés contre les locuteurs non natifs, le mécanisme

Un détecteur ne lit jamais le sens. Il lit à quel point chaque mot est prévisible, compte tenu des mots qui le précèdent, et attribue un score faible à un passage lorsque le modèle aurait pu en deviner la majeure partie à l’avance. La diversité lexicale, c’est-à-dire l’ampleur du vocabulaire mobilisé par un auteur plutôt que la répétition d’un ensemble plus restreint de mots sûrs, et la prévisibilité syntaxique, c’est-à-dire la mesure dans laquelle la structure des phrases suit le schéma le plus courant de la langue plutôt que de varier, sont deux propriétés de la production langagière qui font baisser ce score.

La distinction compte parce que les deux apparaissent différemment sur la page. La diversité lexicale concerne les mots eux-mêmes, un auteur qui emploie « obtain », « acquire » et « secure » dans trois phrases différentes paraît plus varié qu’un auteur qui écrit « get » trois fois, même lorsque les phrases sont par ailleurs identiques. La prévisibilité syntaxique concerne la structure, sujet, verbe, objet, répétés encore et encore, plutôt qu’une phrase qui s’ouvre sur une proposition subordonnée ou se termine par un mot inattendu. Un auteur de langue seconde travaillant dans des conditions d’examen a tout intérêt à se rabattre sur la version la plus sûre de ces deux aspects.

L’écriture en langue seconde présente de manière fiable moins de ces deux aspects, et non comme une déficience. Un auteur qui travaille dans une langue supplémentaire s’appuie sur le vocabulaire et les schémas de phrases les plus susceptibles d’être corrects, parce qu’une mauvaise supposition coûte davantage lorsque la langue n’est pas encore entièrement automatisée. L’article de Stanford qui a documenté le biais du détecteur cite un ensemble de recherches en linguistique appliquée portant précisément sur ce schéma, établi bien avant l’existence des détecteurs d’IA, une richesse lexicale réduite, une diversité lexicale réduite et une structure de phrase plus simple sont des caractéristiques documentées et mesurables de l’écriture en langue seconde, plutôt qu’un signe de quoi que ce soit d’autre.

Cet écart entre l’écriture native et non native apparaît comme une différence de perplexité, la même mesure qu’un détecteur utilise pour décider si un passage a été généré par une machine. Une perplexité plus faible se lit comme plus proche d’un texte machine, quel qu’en soit l’auteur, et l’écriture en langue non native se situe plus bas sur cette échelle pour des raisons qui n’ont rien à voir avec un chatbot. La question de savoir si cet écart est réellement ce qui fait fonctionner les détecteurs, plutôt qu’une coïncidence, est une question testable. L’équipe de Stanford l’a testée directement.

Ce qui s’est passé lorsque les mêmes essais ont été réécrits avec un vocabulaire plus riche

Les chercheurs ont pris les mêmes 91 dissertations TOEFL qui avaient déclenché un taux moyen de faux positifs de 61.22 percent et ont demandé à ChatGPT de les réviser à l’aide d’une seule consigne: "Enhance the word choices to sound more like that of a native speaker." Rien dans le contenu, l’argumentation ou la grammaire ne devait être modifié. Après cette unique modification, le taux moyen de faux positifs sur les mêmes sept détecteurs est tombé à 11.77 percent, soit une baisse de près de cinquante points de pourcentage, et le nombre de dissertations que chaque détecteur signalait unanimement est passé de dix-huit à un.

Les chercheurs ont ensuite inversé l’expérience. Ils ont pris les 88 dissertations de huitième année rédigées par des locuteurs natifs, que les détecteurs avaient à l’origine correctement évaluées presque à chaque fois, et ont demandé à ChatGPT de simplifier leurs choix lexicaux comme si elles avaient été écrites par un locuteur non natif. Le taux moyen de faux positifs sur ces mêmes dissertations rédigées par des locuteurs natifs est passé de 5.19 percent à 56.65 percent. Les dissertations n’ont pas changé d’auteur. Seul le vocabulaire a changé, et les détecteurs ont suivi le vocabulaire.

La perplexité a évolué de concert avec le taux de mauvaise classification dans les deux sens: elle a augmenté fortement lorsque les dissertations TOEFL ont été enrichies, et elle a fortement diminué lorsque les dissertations de huitième année ont été simplifiées. Les auteurs en tirent une conclusion sans détour: ce à quoi les détecteurs répondaient réellement n’a jamais été l’auteur. C’était le choix des mots, une propriété que le vocabulaire de n’importe quel écrivain peut porter, quel que soit l’endroit où il a appris l’anglais.

Dans quelle mesure le biais est-il constant selon les différents détecteurs

Les sept détecteurs ne s’accordaient pas sur grand-chose, sauf sur le sens dans lequel l’erreur allait. Chacun d’entre eux signalait les dissertations TOEFL beaucoup plus souvent que les dissertations de huitième année, mais selon des écarts très différents.

DétecteurTaux de faux positifs, essais TOEFLTaux de faux positifs, essais natifs
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Il s'agit de chiffres de 2023, mesurés sur des outils tels qu'ils existaient alors. Plusieurs ont depuis complètement changé, OpenAI a fermé son propre détecteur en juillet 2023, quatre mois après ce test, après avoir constaté qu'il signalait correctement seulement 26 pour cent des textes réellement rédigés par l'IA tout en classant à tort 9 pour cent des écrits humains. Ce qui n'a pas changé, c'est le sens de l'écart. Un benchmark de biais plus large, construit spécifiquement pour tester les détecteurs selon des catégories démographiques et linguistiques, publié en décembre 2025 et appliqué à quatre outils open source plus récents, a encore signalé un rappel systématiquement plus faible pour les groupes de rédacteurs sous-représentés.

Humanisez votre propre article

Transformez votre texte assisté par IA et faites-le sonner humain, sans toucher aux mots importants ni aux citations.

Commencer gratuitement

Ce biais apparaît-il encore dans les détecteurs plus récents ?

L'étude de Stanford a maintenant plusieurs générations d'IA de retard, et ses propres auteurs ont eux-mêmes formulé la limite, un petit échantillon pilote, et des détecteurs construits principalement sur GPT-2, un modèle bien plus petit et plus ancien que celui qui alimente la détection aujourd'hui. Cela soulève une question légitime. Une meilleure technologie a-t-elle comblé l'écart ?

Le test dédié le plus récent dit que non, pas encore. Dans une étude de février 2026 menée à l’université Sultan Qaboos, des chercheurs ont testé deux détecteurs commerciaux actuels, Turnitin et Originality, sur 192 textes mêlant des écrits authentiques d’étudiants en EFL antérieurs à ChatGPT, des écrits humains professionnels, du texte généré par IA et du texte hybride humain-IA. Les résultats ont montré une exactitude globale de 69 percent et 61 percent pour les deux outils, l’exactitude dans la catégorie hybride, le type d’écriture qu’un passage de révision produit en réalité, tombant près de zéro. La même étude a également révélé un second biais qui se superpose au biais linguistique, l’exactitude sur l’écriture scientifique étant inférieure de 28 à 38 points de pourcentage à celle observée sur l’écriture en sciences humaines.

Aucune de ces deux constatations ne concerne un seul produit défectueux. Deux architectures de détecteurs différentes, testées à trois ans d’intervalle sur des corpus différents par des équipes de recherche différentes, aboutissent toujours au même résultat, les écrits façonnés par les conventions du genre ou par une seconde langue se situant plus près de ce que ces outils appellent une production machinique que les écrits qui ne le sont pas. Les outils gratuits de TextPulse permettent à un auteur de vérifier ce même profil statistique avant qu’il n’atteigne le détecteur d’une institution.

Des preuves indépendantes montrent que l’écart est réel, et non un artefact de test

Le premier problème des résultats du TOEFL est qu’on pourrait soutenir qu’ils ne s’appliquent qu’à une petite étude pilote de 2023. La même équipe de recherche a répondu à cette objection dans une autre étude utilisant des données qui n’ont rien à voir avec les détecteurs. Elle a examiné 1,574 articles acceptés à ICLR 2023, une grande conférence sur l’apprentissage automatique, en limitant l’échantillon aux résumés soumis et évalués avant l’existence de ChatGPT.

Les auteurs basés dans des pays où l’anglais n’est pas la langue principale ont rédigé des résumés avec une perplexité significativement plus faible que les auteurs basés dans des pays anglophones natifs, et cet écart persistait même après contrôle de la note attribuée à chaque article par les évaluateurs. Cet échantillon n’aurait pas pu être façonné par quelqu’un cherchant à paraître plus ou moins comme un chatbot. ChatGPT était à trois mois de sa sortie lorsque la période de soumission s’est terminée. L’écart de perplexité entre l’écriture académique native et non native en anglais n’est pas quelque chose que les détecteurs ont inventé. C’est quelque chose qu’ils ont hérité.

Une analyse statistique de 2026 de la détection de l’IA comme problème de test propose une version formelle de la même conclusion. Chaque fois qu’un groupe d’auteurs produit un langage qui se recoupe, dans l’ensemble, avec la sortie typique de l’IA, tout détecteur ayant une réelle capacité à repérer un texte rédigé par l’IA doit présenter pour ce groupe précis un taux plus élevé de faux positifs, une propriété mathématique de l’évaluation d’une population diversifiée plutôt qu’un défaut d’un outil particulier. Les auteurs non natifs de l’anglais constituent le cas documenté le plus clair de ce recoupement exact.

Ce que cela signifie pour les auteurs dans une seconde langue

Rien de tout cela n’est un argument en faveur d’une écriture moins fidèle à soi-même. C’est une raison de savoir ce qui est réellement mesuré avant qu’un score n’arrive. Un détecteur qui lit votre prose comme prévisible met en évidence une propriété statistique réelle de l’écriture en seconde langue, et non une preuve que vous avez utilisé un outil que vous n’avez pas utilisé.

Les chercheurs de Stanford qui ont mené l’étude originale notent une implication gênante de leur propre résultat, le même ajustement du vocabulaire qui réduit le risque de faux positifs est aussi le type de révision qu’un auteur pourrait souhaiter pour des raisons entièrement distinctes, une formulation plus claire, un mot plus précis, indépendamment de tout détecteur. La page de TextPulse pour les auteurs académiques ESL page for ESL academic writers couvre à quoi ressemble ce type de révision sur de vraies phrases, indépendamment de tout ce qui a trait à un score de détection.

Les détecteurs plus récents commencent à prendre explicitement en compte ce schéma. Pangram, l’un des entrants commerciaux les plus récents, indique dans sa propre documentation technique que son classifieur n’est pas biaisé contre les rédacteurs non natifs de l’anglais, bien que cette affirmation provienne du fournisseur et non de tests indépendants. Un vérificateur de perplexité gratuit montre la même mesure sous-jacente que l’un quelconque de ces outils calcule à partir d’un texte, sans envoyer d’abord le brouillon ailleurs.

Deux compagnons pratiques se situent dans le même ensemble, when to use a, an and the, qui est la source la plus fréquente de ce schéma, et how to sound natural in English academic writing plus généralement.

La recherche continue de s’accumuler dans la même direction deux ans plus tard, à travers différentes équipes, différents détecteurs et différents protocoles de test. Ce qui n’a pas suivi le rythme, c’est une réponse institutionnelle largement adoptée, à savoir auditer un détecteur sur un éventail de rédacteurs avant de lui faire confiance pour l’un d’entre eux, plutôt qu’après qu’un étudiant précis a déjà été accusé. Tant que cela ne deviendra pas une pratique courante, la charge de prouver qu’une fausse alerte est erronée retombera précisément sur les rédacteurs que cette recherche dit être les plus susceptibles d’en recevoir une.

XLinkedInFacebook

Questions fréquemment posées

Le fait que les détecteurs d'IA soient biaisés contre les non-natifs est un résultat évalué par les pairs, pas une spéculation. Une étude Stanford de 2023 a constaté que sept détecteurs GPT largement utilisés classaient à tort en moyenne 61.22 percent des véritables dissertations TOEFL comme générées par IA, tout en identifiant correctement presque à chaque fois les dissertations de locuteurs natifs.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Restez informé sur l'humanisation par IA

Recevez dans votre boîte de réception des conseils sur la rédaction académique, la détection de l'IA et l'humanisation.

Pas de spam. Désabonnement à tout moment.