AI Humanization

Modèles d'écriture IA, les mots, le rythme et la ponctuation qui la trahissent

La prose produite par machine a une signature, des mots prévisibles, un rythme de phrase uniforme, un tiret qui fait le travail d'une virgule, et une forme d'argument qui reformule son propre titre. Voici à quoi chaque niveau ressemble réellement, avec des exemples sourcés plutôt qu'une impression.

Mis à jour le 13 min
Table of AI writing patterns, overused words such as "delve" and "underscore", next to plainer human alternatives

Lisez cette phrase une fois et voyez si vous savez déjà d’où elle vient, les chercheurs continuent de mettre en avant l’interaction complexe entre la motivation et la réussite, et un corpus croissant de travaux souligne le rôle clé que joue l’autorégulation dans la réussite académique. Rien n’y est faux. Chaque proposition est grammaticale, chaque mot est un vrai mot, et un correcteur ne retirerait pas un seul point. Pourtant, cela donne toujours l’impression d’être sorti d’une machine, parce que c’est le cas. C’est de cela que traite cet article.

Les schémas d’écriture de l’IA sont les habitudes reproductibles, dans le choix des mots, le rythme des phrases, la ponctuation et la structure, qui rendent la prose rédigée par une machine reconnaissable au premier coup d’œil. Ils se regroupent à quatre niveaux, les mots vers lesquels un modèle se tourne, la forme de ses phrases, la ponctuation sur laquelle il s’appuie, et la manière dont il structure un argument dans son ensemble. Aucun d’entre eux, pris isolément, ne prouve quoi que ce soit. Ensemble, dans un seul paragraphe, ils sont difficiles à manquer.

La machine qui fait cela s’appelle un détecteur statistique. Elle évalue à quel point chaque mot est prévisible, selon ce qu’un modèle de langage attend. Un rapport contient les calculs de perplexité et de burstiness sous-jacents à ce score, expliqués plus en détail dans un autre article sur how AI detectors work. Le reste de cet article est un catalogue d’indices d’écriture de l’IA qu’un lecteur peut entendre, compter ou montrer du doigt sur la page. Cela peut avoir de l’importance, même si un détecteur se trompe, n’est pas disponible, ou passe à côté de la question. Ce qui suit ici ne nécessite ni modèle ni abonnement.

Pourquoi les schémas d’écriture de l’IA sonnent-ils de manière robotique ?

Un modèle de langage fait quelque chose de différent d’une personne au niveau de la phrase, il choisit le mot suivant statistiquement le plus probable, encore et encore, dans un système entraîné à paraître compétent plutôt que distinctif. Une compétence à cette échelle produit une prose fluide, correcte et vite oubliée, ce qui est à l’origine de la sensation de robotisation. Un lecteur ne peut souvent pas dire ce qui ne va pas dans un paragraphe de ce type, seulement qu’il paraît plat, et les quatre niveaux ci-dessous sont l’endroit où réside cette platitude.

Le choix des mots est le niveau que les lecteurs remarquent d’abord, des mots formels, théâtraux, apparaissant là où ils n’ont pas leur place. Le rythme des phrases est plus discret, un paragraphe où chaque phrase s’étend à peu près sur la même longueur. La ponctuation et la mise en forme portent leur propre signature, un tiret utilisé comme joint universel, une liste à puces fragmentant un texte qui n’était pas une liste dans l’esprit de l’auteur. La structure est la moins visible, une partie qui reformule son propre titre, couvre exactement trois points, puis se termine en se résumant elle-même.

Commencez par les mots, les plus faciles à repérer, et les mieux documentés.

Quels mots AI surexploite-t-elle ?

Vous voyez ces mots formels, légèrement théâtraux, revenir sans cesse, "delve", "underscore", "showcase" et "pivotal" comptent parmi les plus documentés. Dmitry Kobak et trois co-auteurs ont entrepris d’identifier ce langage. Ils ont analysé 15.1 million d’abstracts PubMed de 2010 à 2024 et ont identifié un groupe de mots dont la fréquence a fortement augmenté lorsque ChatGPT a été lancé. "delve" a connu la hausse la plus marquée, l’étude, publiée dans Science Advances en juillet 2025, estimant sa fréquence en 2024 à environ 28 fois celle d’avant 2023. Les suivants les plus proches étaient "underscore" et "showcase". Les auteurs estiment qu’au moins 13.5 percent des abstracts de 2024 portent des signes d’assistance par AI, ce chiffre dépassant 40 percent dans certains pays et chez certains éditeurs.

La raison pour laquelle les modèles convergent vers ces mots particuliers est moins établie que le motif lui-même. Une étude COLING 2025 a testé vingt et un mots surreprésentés par rapport à l’architecture du modèle, aux données d’entraînement et au retour humain utilisé pour affiner les chatbots, et a jugé l’étape du retour comme le contributeur le plus plausible, sans expliquer entièrement l’effet. L’interprétation fait aussi débat, un échange de 2026 dans la revue PNAS a contesté la manière dont un déplacement de fréquence des mots mesure directement l’usage de AI, ce qu’il faut garder à l’esprit avant de traiter ici un seul chiffre comme un fait établi.

Ce n’est pas vrai seulement pour les résumés d’articles de revue. Dans une étude comparant un demi-million de dissertations d’étudiants et de dissertations générées par IA, les chercheurs ont comparé la longueur des textes et le choix des mots, et ont constaté que les dissertations humaines étaient globalement plus longues et utilisaient un vocabulaire plus riche. Dans une étude des évaluations par les pairs soumises à quatre conférences sur l’apprentissage automatique, dont ICLR 2024 et NeurIPS 2023, les chercheurs ont utilisé la même technique pour estimer qu’entre six et quinze pour cent du texte des évaluations avait été substantiellement modifié par un LLM. Il était plus probable qu’il soit affecté par un LLM lorsqu’il était soumis près de la date limite.

Mot ou expression surutilisé par l’IACe qu’un rédacteur soigneux utilise à la place
delve (into)examiner, étudier
underscoremontrer, souligner
showcaseprésenter, démontrer
pivotalprincipal, décisif
robustsolide, fiable
intricatecomplexe, détaillé
meticuloussoigneux, approfondi
tapestrymélange, gamme
testamentsigne, preuve
boastsa, comprend
fosterencourager, soutenir
garnerobtenir, attirer
multifacetedà multiples facettes, complexe
holisticglobal, d’ensemble
nuancedsoigneux, précis
invaluableutile, précieux
realmdomaine, secteur
embark oncommencer, entamer
unlockouvrir, rendre possible
interplayrelation, lien

Aucun de ces mots n’est faux en soi. Une section de méthodes qui qualifie un résultat de robuste emploie correctement ce mot, et un historien qui décrit un argument juridique complexe n’avoue pas parler à un chatbot. Ce qui donne une impression de texte produit par une machine, c’est la densité, trois ou quatre de ces mots dans un seul paragraphe, sans fonction précise, empilés de la manière dont un modèle les empile parce que chacun était indépendamment le choix suivant le plus sûr. Un passage rapide avec TextPulse's free AI word cleaner signale directement cette densité.

Pourquoi les phrases de ChatGPT ont-elles toutes la même longueur ?

Un modèle construit chaque phrase de la même manière qu’il a construit la précédente, au lieu de condenser un point en six mots à un endroit et de le déployer sur trente ailleurs, de sorte que le texte tend à rester presque de la même longueur tout au long. Cette variation, ou son absence, est quelque chose que l’on peut entendre en lisant un paragraphe à voix haute, un exercice différent du score de burstiness qu’un détecteur calcule à partir de la même propriété sous-jacente.

Deux habitudes plus discrètes trahissent de près le rythme. Un modèle aime terminer une phrase par un participe présent suspendu qui suggère une importance sans ajouter d’information, une affirmation suivie d’une mise en avant de la nécessité de recherches supplémentaires ou d’une réflexion sur un changement plus large dans le domaine. Il recourt aussi à une structure appariée pour paraître équilibré, dans le genre la méthode n’est pas seulement efficace, elle est aussi évolutive. Dit une fois, ce tour n’a rien d’exceptionnel. Dit dans chaque paragraphe, il ressemble à un modèle dont on aurait remplacé les noms.

La règle de trois

Au niveau des groupes de mots aussi, les groupes de trois constituent le rythme par défaut du modèle, trois adjectifs avant un nom, trois exemples dans une liste, trois propositions construites de la même manière à la suite. Des groupes de trois occasionnels ont toujours fait partie de l’anglais. Un groupe de trois bien placé n’est le symptôme de rien. L’indice, c’est la fréquence. Trois n’est pas le problème. Le problème, c’est que trois apparaisse dans presque chaque paragraphe.

Le comptage suffit à repérer la plupart de ces éléments sans formation particulière. Lisez un paragraphe et notez la longueur de chaque phrase en mots. Si toutes vos notes se situent à quelques mots près de la précédente, le rythme est l’indice. Utilisez le vérificateur gratuit de burstiness de TextPulse pour automatiser le comptage et le représenter sous forme de graphique, ce qui est utile pour un passage trop long pour être évalué d’un seul coup d’œil, phrase par phrase.

Humanisez votre propre article

Transformez votre texte assisté par IA et faites-le sonner humain, sans toucher aux mots importants ni aux citations.

Commencer gratuitement

Le tiret cadratin et d’autres indices de ponctuation

Pourquoi ce signe est devenu la référence

Le tiret cadratin est probablement le signe de ponctuation le plus souvent incriminé dans les textes produits par machine. Vous le connaissez peut-être comme le long tiret qui remplace une virgule, un deux-points ou un point pour relier deux moitiés d’une phrase. Le tiret cadratin n’est pas nouveau et ce n’est pas quelque chose qu’AI a inventé. Depuis aussi longtemps que les guides de style existent, de Chicago à AP, ils vous ont permis de l’utiliser pour l’emphase et l’interruption. Et de nombreux rédacteurs professionnels l’utilisent intentionnellement.

La raison probable de sa fréquence dans les sorties de machine est banale, ce signe est courant dans la prose éditée et mise en page professionnellement sur laquelle les modèles de langage sont entraînés, et il permet à une phrase de continuer à avancer sans s’engager dans un point final. Un modèle conçu pour produire un texte fluide et lié recourt souvent à cette souplesse, plus souvent que la plupart des gens lorsqu’ils rédigent à la main.

La fréquence varie énormément selon le système qui a produit le texte. Un test comparatif réalisé à la mi-2025 a soumis la même consigne à six chatbots et a compté les occurrences du signe, trois systèmes l’ont renvoyé huit ou neuf fois en moins de six cents mots, un l’a utilisé deux fois dans près de mille mots, et deux ne l’ont pas utilisé du tout. La fréquence est une propriété du modèle qui a produit le paragraphe que vous avez sous les yeux, et non un trait fixe de l’écriture de AI. OpenAI a ajouté en novembre 2025 un réglage qui permet à un utilisateur de demander à ChatGPT de cesser d’utiliser le signe et de s’y conformer réellement, ce qui rend même cet indice en partie facultatif désormais.

Rien de tout cela ne fait du signe lui-même une preuve de quoi que ce soit. Beaucoup d’auteurs soigneux l’emploient délibérément, et beaucoup de dissertations d’étudiants qui n’ont jamais utilisé de chatbot l’emploient aussi, parfois parce qu’un enseignant leur a appris à le faire. Ce qui mérite d’être vérifié, c’est la densité, une page qui s’appuie sur ce signe à chaque deuxième phrase se lit différemment d’une page qui l’utilise deux fois à dessein. Le suppresseur gratuit d’em dash de TextPulse vérifie cette densité et propose la virgule, les deux-points, le point ou le trait d’union que chaque occurrence appelle.

Puces, texte en gras et en-têtes

Le même niveau couvre les choix de mise en forme en dessous de la phrase. Une liste à puces au milieu d’une prose qui n’a jamais été une liste dans l’esprit de l’auteur. Des en-têtes en casse de titre alors que le reste du document est en casse de phrase. Une expression en gras au début de chaque puce, comme un mini titre. Rien de tout cela n’est un signe de ponctuation, mais tout provient du même endroit, un modèle qui met en forme pour une fenêtre de chat, où la structure visuelle remplace les transitions que la prose porterait normalement.

Structure et forme de l’argumentation

Le dernier niveau se situe au-dessus de la phrase et il est le plus difficile à corriger par un simple remplacement de mots, parce qu’il s’agit de la forme même de l’argument. Une section rédigée par une machine commence souvent par reformuler son propre titre avec des mots légèrement différents, avance à travers deux ou trois points d’appui auxquels elle accorde à peu près le même poids, quelle que soit l’importance réelle de chacun, puis se termine en résumant ce qu’elle vient de dire plutôt qu’en ajoutant quoi que ce soit de nouveau.

Une habitude connexe apparaît constamment dans les textes plus longs, une section énumère ce qu’une chose fait bien, pivote sur un mot tel que however, énumère les difficultés dans le même trio ordonné, puis fait allusion à un avenir qui les résoudra vraisemblablement. Les arguments réels sont plus irréguliers que cela. Un auteur humain accorde généralement plus d’importance à un point qu’aux deux autres, lui donne davantage d’espace, et ne doit pas au lecteur une clôture symétrique.

C’est aussi le niveau où l’écriture académique stéréotypée peut sembler trompeusement similaire à l’écriture produite par une machine, puisqu’une section de méthodologie ou une revue de littérature est censée suivre une forme fixe. La différence se situe à l’intérieur de cette forme. Une revue de littérature rédigée par une machine énumère les points habituels d’un domaine dans l’ordre habituel. Une revue rédigée par un humain discute des points qui comptent et des raisons pour lesquelles ils comptent, même à l’intérieur d’un modèle rigide, parce qu’une position réelle est en train d’être défendue.

Évaluer un texte que vous n’avez pas écrit

Les quatre indices qui comptent le plus

L’écart de spécificité est l’indice le plus fort dont dispose un lecteur sans aucun outil. Une prose rédigée par une machine formule des affirmations valables à tous les niveaux de généralité et rattachées à aucun d’entre eux. Elle indique que la recherche a examiné la question sans nommer d’étude, que l’effet est significatif sans en donner l’ampleur, que la pratique est courante dans le secteur sans nommer d’entreprise ni d’année. Un auteur humain travaillant avec la même limite de mots tend à consacrer ces mots à une chose concrète, parce qu’il disposait d’une chose concrète et voulait l’y faire figurer.

Les citations qui ne peuvent pas être vérifiées sont le seul indice de la liste qui s’approche d’une preuve, et ce sont aussi les plus rares. Une référence formatée de manière impeccable, attribuée à une revue réelle, portant un identifiant qui ne renvoie aucun résultat, est très difficile à produire par accident. Vérifiez trois références avant de vérifier quoi que ce soit d’autre dans une soumission dont vous n’êtes pas sûr. Cela prend deux minutes et cela met soit fin à la question, soit retire le signal le plus fort de la table.

La densité lexicale est l’indice auquel la plupart des lecteurs pensent d’abord, et celui qui se trompe le plus souvent. Le signal est la densité plutôt qu’un mot particulier. Un seul verbe formel relève du registre académique ordinaire, tandis que cinq dans un même paragraphe, sans fonction précise, constituent un motif. Compter à la main dans une longue soumission est lent, et le nettoyeur de mots IA gratuit de TextPulse repère automatiquement les groupes, ce qui transforme une impression vague en quelque chose que vous pouvez montrer sur la page.

Le plus subtil des quatre est un registre qui ne se rompt jamais. Un auteur humain fait presque toujours quelque chose de légèrement décalé sur deux mille mots, une phrase courte après trois longues, une remarque entre parenthèses, un jugement qu’il n’avait pas besoin de formuler, un mot choisi parce qu’il lui plaisait. Une prose rédigée par une machine maintient un seul registre de la première ligne à la dernière. Il existe des genres qui interdisent toutes ces choses, si bien que cet indice vaut beaucoup moins dans une section de méthodes que dans une déclaration personnelle.

Les indices qui paraissent forts et ne le sont pas

Une grammaire irréprochable ne prouve rien. L’orthographe et la ponctuation sont automatisées depuis deux décennies, et tout auteur soigneux qui utilise un correcteur produit la même surface nette. Un registre formel ne prouve rien non plus, puisque la formalité est précisément ce que la plupart des genres académiques et professionnels exigent par règle. L’usage intensif des titres, du texte en gras et des listes à puces relève d’une habitude de mise en forme bien avant toute autre chose, et de nombreux auteurs y ont été formés des années avant qu’un chatbot ne le montre à qui que ce soit. Les habitudes de ponctuation ont le même faible poids, et le tiret cadratin, en particulier, s’est vu demander de porter bien davantage qu’un seul signe ne peut le faire.

Les scores des détecteurs appartiennent eux aussi à ce groupe, ce qui tend à surprendre les gens. Un score est un jugement statistique sur la prévisibilité du texte, et une prose prévisible est précisément ce que des humains soigneux produisent chaque jour, ce qui explique l’apparition de faux positifs. Le résultat d’un détecteur n’est qu’une donnée parmi d’autres dans une décision qu’une personne doit encore prendre, et l’explication de TextPulse sur le fonctionnement des détecteurs d’IA explique ce que le nombre mesure avant que quiconque ne le traite comme un verdict.

Que faire lorsqu’un texte déclenche plusieurs indices

Vérifiez d’abord ce qui peut l’être. Prélevez trois citations, un chiffre et un fait nommé, puis vérifiez chacun d’eux. Ce seul passage distingue un texte mince d’un texte fabriqué, et ces deux cas appellent des réponses très différentes. Ensuite, comparez la soumission à quelque chose que la même personne a écrit plus tôt sous supervision, car un changement soudain de registre chez un même auteur pèse davantage que toute lecture absolue d’un seul document. Puis posez une question à laquelle seul l’auteur pourrait répondre à propos de son propre texte, pourquoi cette source plutôt que l’alternative évidente, ce que la troisième section devait initialement soutenir, quel paragraphe lui a posé le plus de difficultés. Quelqu’un qui a écrit le texte répond immédiatement.

Suivez la politique qui existe plutôt que celle que vous auriez rédigée. La plupart des institutions précisent désormais qui peut soulever une inquiétude, quelles preuves sont recevables et ce que l’auteur est informé, et c’est le fait de sauter cette séquence qui transforme une question raisonnable en réclamation. Les auteurs de l’autre côté de ce problème, à qui l’on dit que leur propre travail semble rédigé par une machine, ont une tâche différente à accomplir, et TextPulse's AI humanizer indique un Human Score estimé calculé à partir du texte plutôt qu’un verdict de quelque détecteur que ce soit.

Appliquer le même test à vos propres brouillons est plus difficile, et whether your writing sounds like AI a sa propre page. Le vocabulaire lui-même est répertorié séparément, dans une liste de the words that give ChatGPT away.

Les neuf indices sont une raison de poser une question, et c’est toujours la même question, qu’est-ce que ce texte sait qu’une supposition fluide ne saurait pas ? Posez-la d’abord aux citations. C’est la seule partie de toute soumission qui répond d’elle-même, sans que personne ait besoin d’être accusé de quoi que ce soit.

Ces indices prouvent-ils qu’un texte est rédigé par AI ?

Aucun indice isolé ne prouve quoi que ce soit, et un ensemble complet d’indices n’en prouve pas davantage. Sous la pression d’un éditeur ou d’un professeur, un rédacteur universitaire soigneux peut produire des paragraphes présentant plusieurs de ces caractéristiques, comme l’absence de pronoms, sans l’aide d’un chatbot. Les rédacteurs non natifs de l’anglais peuvent aussi employer des mots sûrs qu’on leur a enseignés en classe, et les étudiants à qui l’on apprend à utiliser des connecteurs formels peuvent eux aussi présenter nombre de ces caractéristiques. Une liste de mots n’est pas une preuve de faute, c’est une erreur qui peut faire accuser à tort des rédacteurs soigneux. Il faut dénoncer cette erreur, et non la répéter discrètement.

Ce qu’un outil peut faire de manière responsable, c’est montrer le schéma, et non statuer sur le texte. Ce que nous avons à offrir avec le AI humanizer de TextPulse, c’est une estimation d’un Human Score fondée sur le texte qui lui est présenté. Il s’agit d’une lecture de la position d’un brouillon par rapport à ces schémas de surface, et non d’un verdict d’un détecteur quelconque, ni d’une promesse sur ce qu’un autre outil dira demain. C’est un nombre que l’on peut utiliser comme point de départ pour une décision, de la même manière qu’un correcteur orthographique signale un mot sans décider si la phrase qui l’entoure est bonne ou non.

Chacun des indices ci-dessus a sa propre page. Le vocabulaire lui-même est répertorié dans un article sur les mots qui trahissent ChatGPT, avec des traitements séparés de l’habitude du tiret cadratin et de la raison pour laquelle les modèles privilégient un verbe en particulier. Les catégories plus larges sont également abordées, ce que signifie AI slop, ce que signifie AI fluff, ainsi qu’un guide pratique pour déterminer si quelque chose a été écrit par AI. Si la préoccupation concerne vos propres brouillons plutôt que ceux de quelqu’un d’autre, il existe un article sur la suppression des mots AI de votre écriture.

La prochaine fois que vous relirez votre prose et que quelque chose vous semblera un peu étrange, ne vous contentez pas de trouver un synonyme pour le remplacer. Essayez plutôt de le lire à voix haute. Comptez le nombre de mots dans chaque phrase. Demandez-vous exactement ce que chaque mot fait là. C’est la même lecture qu’un éditeur attentif pratiquait bien avant que tout cela ait un nom.

XLinkedInFacebook

Questions fréquemment posées

Parce que plusieurs des motifs de surface qui donnent une impression de texte produit par machine, vocabulaire formel, longueur de phrase uniforme, structure nette en trois parties, apparaissent aussi dans une écriture humaine soignée faite sous pression de délai ou après une lourde révision. Ce sont des indices, pas une preuve d'origine. Un paragraphe peut les présenter tous et rester entièrement votre propre travail.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

Restez informé sur l'humanisation par IA

Recevez dans votre boîte de réception des conseils sur la rédaction académique, la détection de l'IA et l'humanisation.

Pas de spam. Désabonnement à tout moment.