AI Humanization

Turnitin peut-il détecter un texte d'IA humanisé ?

Turnitin dit que son indicateur de rédaction par IA couvre déjà le texte passé par un humaniseur. Ce que cette affirmation signifie et ne signifie pas, pourquoi un document humanisé obtient parfois encore un score élevé et parfois non, et ce que vaut le chiffre pour un étudiant dans les deux cas.

12 min
Turnitin AI writing report panel illustrating can turnitin detect humanized text, with per-sentence scores averaged into one document percentage

Turnitin répond à cette question sur son propre site d’assistance, et la réponse est plus précise que l’un ou l’autre des deux camps de l’argument habituel. Son indicateur de rédaction par IA, Turnitin says, inclut déjà la détection de contenu généré par IA qui a pu être humanisé ou être passé par un bypasser afin d’éviter la détection. Il s’agit d’un éditeur qui décrit son propre produit. C’est aussi le bon point de départ, car cela indique ce que le modèle prétend couvrir.

Alors, Turnitin peut-il détecter un texte humanisé ? La question prend une forme plus étroite et plus utile. Le modèle de Turnitin ne recherche pas l’empreinte d’un humanizer et ne conserve aucune liste d’outils. Il attribue à la prose un score phrase par phrase selon la proximité de l’écriture avec les schémas statistiques du texte généré par machine, puis il fait la moyenne de ces scores sur l’ensemble du document. Le fait qu’un passage humanisé obtienne encore un score élevé dépend de la part de ce schéma que la réécriture a modifiée, et de la part du document qui a effectivement été réécrite.

Turnitin peut-il détecter un texte humanisé ? Ce que Turnitin affirme

La position publiée par Turnitin est un oui sans ambiguïté. Répondant à la question de savoir s’il peut détecter du contenu passé par un humanizer, ses indications précisent : "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." La même page donne la même réponse pour les outils de paraphrase par IA.

Cette affirmation n’apparaît pas comme un second nombre quelque part dans le rapport. Turnitin l’intègre dans le seul pourcentage de rédaction par IA, et la définition publiée de ce pourcentage le dit explicitement : il couvre le texte que le modèle détermine comme ayant probablement été généré par IA, ou probablement généré puis modifié par un paraphraser ou un bypasser par IA. Il n’existe qu’un seul score, et il prend déjà en compte la réécriture dans la mesure où le modèle en est capable.

Lisez attentivement, il s’agit d’une affirmation sur la couverture plutôt que d’une affirmation sur l’exactitude. Turnitin indique que le texte humanisé entrait dans le champ d’application lorsque le modèle a été construit. Cela est loin d’affirmer que chaque document humanisé obtient un score élevé, et ses propres chiffres publiés, plus bas, décrivent un modèle qui traite les phrases individuelles comme incertaines.

Ce que l’indicateur de rédaction par IA évalue réellement

Ce n’est pas un pourcentage. C’est une fraction du texte, donc ce n’est pas un niveau de confiance. C’est une mesure de la quantité de texte dans votre document que notre modèle estime susceptible d’avoir été générée par IA. Nous appelons cela du texte qualifié, ce qui signifie des phrases en prose dans un format de rédaction longue. Cela n’inclut pas les listes à puces, le code, les tableaux ni les courts fragments. C’est pourquoi vous pouvez voir des nombres différents pour le même article selon la part de prose continue qu’il contient.

Le mécanisme sous-jacent est assez simple à imaginer. Turnitin découpe un document en segments qui se chevauchent, d’environ quelques centaines de mots, soit environ cinq à dix phrases chacun, avec un chevauchement de sorte que chaque phrase soit évaluée dans son contexte. Chaque phrase reçoit une valeur comprise entre 0 et 1. Les scores des segments sont ensuite moyennés sur l’ensemble du document pour produire le seul nombre que voit un enseignant. Un compte rendu étape par étape de comment Turnitin détecte l’IA examine chaque étape plus en détail.

Cette étape de moyennage compte plus que tout le reste du pipeline pour le texte humanisé, et c’est la partie que presque personne ne prend en compte. La valeur qu’un enseignant lit est une moyenne arithmétique des jugements au niveau des segments. Un document peut être réécrit à moitié et se situer quelque part au milieu pour des raisons qui ont peu à voir avec la qualité de la réécriture.

Pourquoi un texte humanisé obtient parfois malgré tout un score élevé

La raison la plus fréquente est la couverture. Un humanizer appliqué à une introduction et à une conclusion laisse la revue de littérature et la discussion intactes, et ces segments conservent leurs scores d’origine tels quels dans la moyenne. Dans un long chapitre, la réécriture des premières pages modifie quelques segments et laisse le reste exactement tel qu’il était, ce qui produit un déplacement plus faible que celui que l’auteur attend d’un travail qui paraissait substantiel.

La deuxième raison est la profondeur de la réécriture. Un passage qui remplace le vocabulaire tout en conservant les longueurs de phrases, l’ordre des propositions et les choix de transition en place laisse largement intacte la structure sur laquelle le classificateur a été entraîné. Le modèle évalue la forme de la prose, donc changer les mots qui remplissent cette forme produit moins d’effet que la plupart des gens ne le supposent. Un free perplexity checker montrera à quel point un passage reste prévisible après une réécriture, ce qui constitue un signal plus informatif qu’une comparaison mot à mot de l’avant et de l’après.

La troisième raison est qu’une réécriture peut installer sa propre régularité. Un logiciel qui applique la même transformation à chaque paragraphe produira un nouveau schéma qui est tout aussi régulier que l’ancien. Si chaque phrase comporte le même type de coupe conjointe, ou si chaque phrase reçoit le même type de proposition d’atténuation ajoutée au même endroit, ces phrases seront perçues de manière aussi uniforme par un classificateur qu’elles l’auraient été si elles avaient toutes eu la même longueur au départ.

SituationCe que fait le score IAPourquoi
Seule une partie du document a été réécriteDiminue moins que prévuLes segments intacts conservent leurs scores d'origine dans la moyenne
Le vocabulaire a changé, la structure des phrases a été conservéeVarie très peuLe classificateur attribue un score aux schémas au niveau de la phrase que l'échange a laissés en place
Les phrases ont été véritablement restructurées dans l'ensembleVarie davantageLe rythme uniforme que le modèle a été entraîné à reconnaître est rompu
Moins de 300 mots de prose soumisAucun score n'est généréTurnitin exige 300 mots de prose admissible avant d'indiquer un pourcentage
Le résultat se situe en dessous de 20 percentUn astérisque au lieu d'une valeur chiffréeTurnitin signale les résultats de cette plage comme moins fiables

Pourquoi la même réécriture produit parfois un score faible

Un document humanisé peut revenir avec un score faible pour des raisons qui n'ont rien à voir avec la réécriture. Turnitin a besoin d'au moins 300 mots de prose admissible avant de générer un pourcentage IA, un seuil qu'il a relevé par rapport à 150 mots à l'origine, au motif déclaré que la précision s'améliore avec un peu plus de texte. Un court texte réflexif ne produit aucun chiffre, et l'absence de score n'est pas la même chose qu'un score propre.

Turnitin marque une plage inférieure à 20 percent d'un astérisque plutôt que de donner un pourcentage exact, parce qu'il y a une incidence plus élevée de faux positifs dans cette plage. Au moment du lancement, les rapports sur l'éducation faisaient également référence à ce comportement, indiquant que les résultats déclarés comme étant inférieurs à 20 percent rédigés par l'IA présentaient une incidence plus élevée de faux positifs et que Turnitin avait donc ajouté des avertissements. Un document situé dans cette bande a été marqué comme une plage que Turnitin refuse de signaler précisément, ce qui est différent d'une validation.

Il existe aussi un filtre institutionnel au-dessus de tout cela. Turnitin ne traite une soumission pour la détection de rédaction par IA que si l’institution a activé la fonctionnalité, et les administrateurs peuvent la désactiver pour l’ensemble du compte. Vanderbilt University a fait exactement cela en août 2023, en invoquant le taux de faux positifs alors publié par Turnitin, de 1 percent, sur environ 75,000 soumissions annuelles, un biais à l’encontre des rédacteurs dont l’anglais n’est pas la langue maternelle, et un manque de transparence sur le fonctionnement du modèle. Un étudiant dans une institution où la fonctionnalité est désactivée n’a aucun score IA sur aucune soumission, qu’elle soit humanisée ou non.

Et lorsque la réécriture était réellement structurelle, le score peut baisser parce que le schéma mesuré a changé. Turnitin fournit une estimation calculée à partir de schémas d’écriture, donc un texte dont les schémas diffèrent obtient un score différent. Le mécanisme fonctionne dans les deux sens, et c’est la partie gênante, l’écriture humaine originale obtient parfois un score élevé pour exactement la même raison.

Humanisez votre propre article

Transformez votre texte assisté par IA et faites-le sonner humain, sans toucher aux mots importants ni aux citations.

Commencer gratuitement

Ce que chaque fournisseur d’humaniseur affirme, et ce qui est documenté

Une règle régit le tableau. La colonne du milieu reprend le langage marketing propre au fournisseur, tiré de son propre site chaque fois que ce site en fournit un. La colonne de droite consigne ce qui se trouve réellement derrière chaque affirmation, ce qui, dans la plupart des cas, n’est ni jeu de données, ni date, ni méthode. Il n’existe aucun test public comparatif direct pour ces marques.

MarqueCe que le fournisseur affirmeCe qui est documenté
Undetectable.aiPrésente le fait de passer les détecteurs d'IA comme une fonctionnalité du produit sans chiffre associé, et propose de rembourser le coût de l'humanisation si le contenu est signalé comme non humainLe remboursement est une condition commerciale, aucun jeu de données, aucune date ni aucun résultat détaillé détecteur par détecteur ne vient étayer cette affirmation
QuillBotNe formule aucune affirmation de détection ou de contournement pour la fonction humanizer sur ses propres pages. Son détecteur d'IA distinct est décrit uniquement comme détectant le contenu généré par IAQuillBot vend le humanizer dans une suite d'écriture générale et ne formule aucune affirmation spécifique à Turnitin à son sujet
WriteHumanClassé numéro un sur un Humanizer Leaderboard, et décrit comme le humanizer IA premium pour une écriture sérieuseLe leaderboard ne cite aucune méthodologie ni aucun échantillon, et WriteHuman n'associe aucun chiffre de précision à ce classement
Walter Writes AICommercialise une humanisation large dans plus de 80 langues sans affirmation spécifique à TurnitinAucune donnée de test dans un sens ou dans l'autre
HIX BypassCommercialise des pages de contournement détecteur par détecteur sans chiffre spécifique à TurnitinHIX Bypass et BypassGPT sont des produits distincts sur des domaines distincts, il faut donc vérifier lequel est visé par une affirmation
StealthGPTUne moyenne de 98% de texte humain sur Turnitin et de 95% sur GPTZero, chacune issue d'une série déclarée de 30 échantillons sans aucune détection, plus une garantie de remboursement si un abonné est détectéAuto-déclaré. Aucun jeu de données, aucune sélection d'échantillon, aucune date ni aucune méthode n'est publiée à côté des chiffres, et 30 documents constituent une série réduite pour une affirmation portant sur un modèle évaluant des millions de soumissions
PhraslySe présente comme un outil de suppression de la détection IA, ne publie aucune donnée de testAucune affirmation publique dans un sens ou dans l'autre. Les chiffres qui circulent dans les avis sont de seconde main et sont exclus ici par principe
GrammarlyNe commercialise pas du tout sa réécriture comme un contournement de la détection. Sa page de détecteur d'IA affirme une précision de détection de 99% et un classement numéro un sur le benchmark indépendant de RAIDLa même page Grammarly indique qu'aucun détecteur d'IA n'est précis à 100%. Sa fonction Authorship étiquette le texte comme saisi par un humain, créé avec IA, ou modifié avec Grammarly
TextPulseUn taux de réussite de 92.33% sur Turnitin AI, 89.12% sur Originality.ai et 87.91% sur GPTZero, mesuré sur un corpus académique de 2,000 documentsMesuré et publié par TextPulse, donc auto-déclaré comme tous les chiffres ci-dessus. La taille du corpus et les détecteurs sont nommés, aucun résultat de détecteur n'est promis pour un document individuel

Trois choses ressortent de ce tableau. La plupart de ces outils ne publient aucune affirmation de détection à vérifier. Quelques-uns associent un nombre à une taille d’échantillon, ce qui est plus que le reste de la catégorie ne parvient à faire. Et aucun d’entre eux ne publie de jeu de données que quiconque en dehors de l’entreprise puisse exécuter soi-même. Il faut toutefois rendre à chaque marque le crédit qu’elle mérite. Undetectable.ai assortit son affirmation d’un remboursement, ce qui constitue un engagement concret plutôt qu’un adjectif. WriteHuman publie des plafonds exacts de requêtes et de mots par niveau, de sorte qu’un acheteur sait ce qu’il obtient. Grammarly qualifie son propre chiffre de précision sur la même page qui le présente, ce qui est plus que ce que font la plupart des fournisseurs de détecteurs. Et le fait que QuillBot refuse de faire la moindre affirmation de contournement est la position la plus défendable de la liste.

Pourquoi personne en dehors du fournisseur ne peut vérifier ces chiffres

Un fournisseur de humanizer qui affirme un taux de passage à Turnitin décrit des exécutions effectuées via un compte qu’il contrôle, sur des documents qu’il a sélectionnés, à une date qu’il ne précise généralement pas, face à un classificateur que Turnitin révise à mesure que de nouveaux modèles de langage sont publiés. Cela vaut pour le chiffre de trente échantillons de StealthGPT et tout autant pour le chiffre de 2,000 documents publié par ce site. La taille du corpus modifie la quantité de bruit contenue dans un nombre. Elle ne transforme pas une auto-déclaration en audit.

L’autre moitié du problème est que la propre liste de modèles que Turnitin dit détecter est modifiée à mesure que de nouvelles versions arrivent. Ce taux de passage mesuré par rapport au classificateur du trimestre précédent décrit le classificateur du trimestre précédent et rien d’autre. La raison pour laquelle cela signifie que personne ne peut désigner un meilleur humanizer IA pour contourner Turnitin est exposée séparément. Chaque chiffre figurant sur chaque page d’accueil de humanizer, y compris celle de ce site, est un instantané portant une date que le fournisseur n’a peut-être jamais publiée.

Comment lire une affirmation de contournement avant de payer pour l’une d’elles

Quatre questions distinguent une affirmation qui mérite d’être examinée d’une affirmation qui mérite d’être ignorée, et elles s’appliquent à chaque ligne du tableau ci-dessus, y compris la dernière.

  • Combien de documents ont été testés, et qui les a choisis ? Un pourcentage sans taille d’échantillon derrière lui est un slogan portant un nombre.
  • À quelle date, et contre quelle version du détecteur ? Les modèles de détection sont révisés à mesure que de nouveaux modèles de langage sont publiés, et un taux de réussite sans date vieillit vite.
  • La garantie est-elle un remboursement ou un résultat ? Une promesse de remboursement transfère un faible risque financier et ne change absolument rien à un comité d’intégrité académique.
  • Que dit le fournisseur qu’il arrive à une citation, à un terme technique ou à une citation en bloc ? La plupart des pages de humanizer ne disent rien, ce qui est en soi une réponse.

Cette dernière question décide de plus que l’arithmétique du détecteur pour toute personne qui soumet un travail académique. Une réécriture qui obtient un bon score et généralise discrètement une phrase de méthode vous a coûté ce sur quoi vous étiez évalué. Le humanizer académique de TextPulse documente la préservation des citations dans APA, MLA, IEEE, Chicago, Harvard et Vancouver, les termes figés pour verrouiller le vocabulaire exact avant l’exécution d’un passage, et un entraînement sur des textes académiques évalués par les pairs avec une sortie maintenue au niveau Flesch-Kincaid de 13 à 18. Ce sont des affirmations sur ce qui arrive au texte, ce qui est un type d’affirmation différent d’un pourcentage concernant un détecteur, et un lecteur peut les vérifier dans la sortie en moins d’une minute.

Ce que le score signifie pour un étudiant dans tous les cas

Turnitin est clair lorsqu’il indique que l’indicateur d’écriture IA ne constitue pas une conclusion de manquement. La page produit de Turnitin indique explicitement que Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." Elle précise aussi que Turnitin fournit des informations pour permettre aux enseignants de prendre une décision éclairée fondée sur les politiques de leur institution. Cela est réitéré par l’avertissement selon lequel le modèle "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."

Les étudiants ne voient pas le score par défaut. Turnitin indique clairement que l’indicateur et le rapport de détection de l’écriture par IA ne sont pas visibles pour les étudiants, et que la seule façon d’y accéder est qu’un enseignant télécharge le rapport au format PDF et le leur remette. Un étudiant qui vérifie son propre brouillon consulte un outil différent, entraîné sur des données différentes, et les deux chiffres n’ont aucune obligation de coïncider.

Reste alors la partie qu’aucun score ne tranche. La question de savoir si l’usage de l’IA était autorisé ou non relève du cours et de l’établissement, et une politique d’utilisation de l’IA y répond d’une manière qu’un pourcentage ne peut jamais offrir. Un score élevé pour un usage autorisé et déclaré est une conversation étayée par des preuves. Un score faible pour un usage non déclaré que la politique interdit reste un usage non déclaré.

Pour un auteur qui révise son propre brouillon, la lecture pratique de tout cela est que le score suit l’écriture. Le modèle de Turnitin mesure les schémas au niveau de la phrase sur l’ensemble d’un document, de sorte que des réécritures partielles produisent des variations partielles et que des substitutions lexicales n’entraînent presque aucun changement. Le guide complet sur comment humaniser un texte IA examine les modifications structurelles qui changent le schéma, dans l’ordre qui le fait le plus évoluer.

Le humaniseur IA de TextPulse applique ces modifications structurelles à l’ensemble d’un document en une seule fois et fournit une estimation du Human Score calculée à partir du texte lui-même, jamais une prédiction de ce qu’un détecteur nommé quelconque dira. Aucun outil ne peut promettre un résultat dans Turnitin, parce qu’aucun outil ne peut voir à l’intérieur du modèle de Turnitin. Tout produit qui prétend le contraire décrit un résultat qu’il n’a aucun moyen d’observer.

La distinction entre un humaniseur et un paraphraseur est importante ici, tout comme la raison pour laquelle un texte paraphrasé est malgré tout signalé.

Le chiffre est la partie la moins intéressante de tout cela. Ce qui décide de l’issue, ce sont les vingt minutes qui suivent le moment où un correcteur l’examine, à savoir si le document peut montrer son raisonnement, un historique des brouillons, un ensemble de notes, des sources dont l’auteur peut parler sans les ouvrir. Cette preuve est accessible à toute personne qui a fait le travail, et elle survit à une note qu’une réécriture n’a pas réussi à faire bouger.

XLinkedInFacebook

Questions fréquentes

Les propres indications de Turnitin disent que son indicateur d'IA inclut la détection de contenu qui a pu être humanisé ou passé par un bypasser. Ce que le produit affiche réellement est un pourcentage de texte admissible, et non un verdict sur la paternité. La réponse pratique à la question de savoir si Turnitin peut détecter un texte humanisé est donc que le score reflète la part du schéma d'écriture machine qui a survécu à la réécriture.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

Restez informé sur l'humanisation par AI

Recevez dans votre boîte mail des conseils sur la rédaction académique, la détection AI et l'humanisation.

Pas de spam. Désabonnement possible à tout moment.