AI Detection

Winston AI Review: La revendication de 99.98% de précision face aux preuves

Winston AI annonce 99.98% de précision, le chiffre auto revendiqué le plus élevé dans le secteur des détecteurs, mesuré sur un jeu de test interne que l'entreprise n'a jamais publié. Le benchmark RAID évalué par les pairs a fixé sa précision globale à 71% avec un taux de faux positifs de 5% constant, ce qui le place encore au deuxième rang parmi les quatre détecteurs commerciaux testés. Voici ce que chaque chiffre mesure réellement, et à qui cet outil convient véritablement.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI annonce une exactitude de 99.98%, le chiffre auto revendiqué le plus élevé parmi les détecteurs d'IA grand public. Ce nombre figure sur la page d'accueil de l'entreprise, à côté des mots "The Most Trusted AI Detector", et il provient des propres tests internes de l'entreprise, et non d'un laboratoire externe. Aucune méthodologie, aucune taille d'ensemble de test, aucun ratio d'échantillons humains par rapport aux échantillons d'IA, ni aucun seuil de fonctionnement n'est publié avec ce chiffre. Cet écart entre l'affirmation et sa documentation est la première chose qu'un lecteur attentif doit savoir à propos de cet outil.

La deuxième chose est que Winston a effectivement été testé par des tiers, ce que certains détecteurs ne peuvent pas dire. Le benchmark RAID, une étude évaluée par les pairs présentée à ACL 2024, a soumis Winston à environ 6.2 millions de textes générés par machine et a mesuré une exactitude globale de 71.0% avec un taux de faux positifs fixé à 5%. C'est très loin de 99.98%. Cela a aussi placé Winston au deuxième rang des quatre détecteurs commerciaux testés, devant GPTZero et ZeroGPT. Ces deux faits comptent, et aucun n'annule l'autre.

Ce qui suit présente ce qu'est Winston et à qui il est destiné, ce que le fournisseur affirme, ce qu'un auto benchmark de 99.98% peut et ne peut pas signifier statistiquement, et ce que montrent réellement les chiffres indépendants.

Qu'est-ce que Winston AI et qui l'utilise ?

Winston AI est un détecteur payant, fondé sur un abonnement, destiné directement aux enseignants et aux éditeurs de contenu. Sa liste de fonctionnalités ressemble à un flux de travail d'enseignant, le site de l'entreprise décrit un OCR qui extrait le texte de documents numérisés, de photos et d'écritures manuscrites, une intégration Google Classroom figurant parmi ses plateformes prises en charge, un vérificateur de plagiat en plus de la détection d'IA, et une organisation des documents pour gérer des lots de soumissions. Le fournisseur indique qu'il détecte les productions de ChatGPT, Gemini, Claude, LLaMA "and much more".

La partie la plus distinctive de l’interface est la sortie phrase par phrase. Au lieu de renvoyer un seul pourcentage, Winston produit ce qu’il appelle une carte de prédiction IA, une évaluation codée par couleur, phrase par phrase, des parties d’un document qui semblent générées par une machine. Pour un enseignant, cette carte est plus utile qu’un simple score, car elle montre où se concentre le soupçon de l’outil. Elle est aussi facile à surinterpréter, point abordé ci-dessous.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
Le badge en question, 99.98% accurate, sur la page d’accueil, sans étude nommée à l’appui.

Que prétend l’entreprise ?

La principale affirmation sur la page d’accueil de Winston AI est « 99.98% Accurate. » À la date de rédaction, la page qui affiche ce chiffre ne publie pas la manière dont le corpus de test a été constitué, le nombre d’échantillons qu’il contenait, la proportion de texte humain et de texte IA qu’il utilisait, ni le seuil de décision auquel le détecteur était réglé lorsque le chiffre a été mesuré. Ce n’est pas inhabituel dans ce secteur, le même écart entre les affirmations de précision des fournisseurs et les preuves indépendantes se retrouve dans presque tous les détecteurs du marché. La version de Winston de cette affirmation est simplement le plus grand nombre qui y a été apposé.

Que peut réellement signifier un auto-benchmark de 99.98% ?

Prenons un instant l’arithmétique au sérieux. Un taux de précision de 99.98% signifie 2 erreurs pour 10,000 échantillons. Pour mesurer ce chiffre, une entreprise a besoin d’un ensemble de test annoté d’au moins des dizaines de milliers de documents, dans lequel l’origine réelle de chaque texte est connue avec certitude. Ensuite, le nombre ne décrit que la performance sur ce corpus, ces modèles IA, ces invites, ces genres, cette longueur de texte, à un seuil choisi.

Rien de tout cela n’exige de mauvaise foi. Un détecteur entraîné sur des essais générés par des modèles de chat populaires, puis testé sur un corpus d’essais générés par des modèles de chat populaires, obtiendra effectivement un score proche du plafond. Le problème est celui de la transférabilité. Dès que le texte entrant provient d’un modèle différent, d’une stratégie d’échantillonnage différente, ou d’un auteur dont le style naturel est exceptionnellement uniforme, le corpus sur lequel le benchmark a été mesuré ne décrit plus le texte jugé. Un benchmark interne est une expérience contrôlée menée par la partie qui a le plus grand intérêt dans son résultat, dans des conditions qu’elle choisit elle-même. C’est une preuve, mais de la forme la plus faible, et l’absence de méthodologie signifie que personne en dehors de l’entreprise ne peut même la vérifier.

Que montre le test indépendant ?

Le test public le plus rigoureux qui inclut Winston est RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, une étude évaluée par les pairs de Dugan et de ses collègues présentée à ACL 2024. RAID a évalué 12 détecteurs, dont quatre produits commerciaux, sur environ 6.2 millions de générations couvrant 11 modèles de langage, 8 domaines d’écriture, 4 stratégies de décodage et 11 attaques adversariales, chaque détecteur étant calibré au même taux de faux positifs de 5% afin que les scores soient comparables.

DétecteurExactitude globale dans RAID (FPR fixé à 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

Deux lectures de ce tableau sont honnêtes en même temps. Le 71.0% de Winston est loin de 99.98%, et Winston a tout de même battu deux de ses trois concurrents commerciaux sur le benchmark public le plus difficile disponible. Les moyennes masquent aussi une dispersion révélatrice. Dans les résultats par modèle de RAID, Winston a obtenu 99.6% sur la sortie de ChatGPT et 98.8% sur la sortie de GPT-4, soit un résultat proche de sa propre valeur annoncée, mais est tombé à 47.6% sur le texte de GPT-2 et à 24.8% sur le texte du modèle de base MPT-30B. Sur du texte machine paraphrasé, son exactitude est descendue à 52.6%.

Cette dispersion résume à elle seule l'affirmation de 99.98%. Sur un texte ressemblant à ce pour quoi le détecteur a vraisemblablement été réglé, des modèles de chat récents écrivant une prose simple, Winston se rapproche de ce que son marketing annonce. En dehors de cette distribution, les performances s'effondrent. Un benchmark interne construit à partir de texte de la distribution d'entraînement peut réellement produire un chiffre presque parfait tout en ne vous disant presque rien du mélange hétérogène de modèles, de modifications et de paraphrases qu'une boîte de réception réelle contient. Les signaux statistiques sur lesquels s'appuient les détecteurs sont examinés plus en détail dans notre explication sur comment fonctionnent les détecteurs d'IA.

Humanisez votre propre article

Transformez votre texte assisté par IA et faites-le sonner humain, sans toucher aux mots importants ni aux citations.

Commencer gratuitement

Faux positifs, qui en pâtit ?

La conception de RAID rend visible un compromis que le marketing des fournisseurs montre rarement, chaque score d'exactitude dans l'étude a été mesuré après fixation du taux de faux positifs à 5%. À cette calibration, 1 document humain authentique sur 20 est signalé. Un détecteur peut abaisser ce taux en relevant son seuil, mais seulement au prix d'une détection moindre du texte IA, les deux chiffres évoluent ensemble, et un fournisseur qui n'en cite qu'un seul ne cite qu'une moitié de résultat.

Le poids de ces erreurs n’est pas réparti de manière égale. Un texte formulé de façon stéréotypée, conventionnelle et à faible variance est lu comme étant de type machine par tout détecteur statistique, et cette description correspond aux sections de méthode, aux revues de littérature et à la prose soignée d’auteurs travaillant dans une deuxième langue. Le schéma des détecteurs d’IA signalant les locuteurs non natifs de l’anglais à des taux plus élevés est documenté dans l’ensemble du secteur, et rien dans la méthode de Winston n’y fait exception. La carte de prédiction phrase par phrase mérite la même prudence, une phrase mise en rouge est une observation statistique sur les schémas de mots, et non une preuve sur la paternité. Les étudiants confrontés à un signalement injustifié devraient partir de la documentation, et non de l’aveu, notre guide sur comment prouver que vous n’avez pas utilisé AI explique ce qui persuade réellement.

Tarification et accès

Winston est un produit payant avec un essai limité. Winston indique un essai gratuit de 14 jours avec 2.000 crédits, un forfait Essential à 18 $ par mois, ou 10 $ par mois facturés annuellement, avec 100.000 crédits mensuels, un forfait Advanced à 29 $ par mois, ou 16 $ par an, qui ajoute des sièges d’équipe et des analyses plus larges, et un niveau Elite au-dessus de cela. Pour un enseignant individuel qui examine un volume de travaux équivalent à une classe, cela place Winston dans la catégorie des achats impulsifs, moins cher que les contrats institutionnels, plus capable que la plupart des outils gratuits.

Où Winston se situe dans le paysage des détecteurs

Au vu des éléments indépendants, Winston est un détecteur commercial de milieu de gamme qui fonctionne mieux que le niveau gratuit du marché et moins bien que sa propre publicité. Il convient à un enseignant qui veut une visibilité phrase par phrase, une intégration Classroom et une vérification du plagiat dans un seul outil peu coûteux, et qui traite chaque résultat comme une invitation à la discussion plutôt que comme un verdict. Il ne convient pas à quiconque a besoin que le score fasse office de preuve, car le score d’aucun détecteur ne le fait.

La comparaison complète

Winston est un détecteur parmi d’autres dans un secteur très encombré, et l’écart entre 71 % et 99.98 % n’est qu’un exemple d’un schéma observé à l’échelle du secteur. Pour voir comment il se compare à Turnitin, GPTZero, Originality, ZeroGPT et aux autres selon les mêmes critères fondés sur les preuves, consultez notre guide complet sur les détecteurs d’IA comparés.

Ce que notre propre recherche a montré

Dans l'étude d'accord entre détecteurs de TextPulse Research, neuf détecteurs d'IA commerciaux ont noté les mêmes 90 textes académiques. L'un d'eux était un texte hybride de 455 mots : une ouverture et une conclusion écrites par un humain autour d'un passage central de 168 mots généré par IA. Winston AI a attribué à ce texte 7% d'IA, alors que les verdicts des autres outils sur les mêmes mots allaient de 0% à 95.7% d'IA. L'article complet, le corpus et la matrice des scores par outil sont en accès libre sur TextPulse Research.

Winston AI face au texte hybride du corpus de l'étude.
Winston AI face au texte hybride du corpus de l'étude.
XLinkedInFacebook

Questions fréquentes

Le chiffre de 99.98% est la propre revendication de Winston AI, mesurée sur un jeu de test interne que l'entreprise n'a pas publié. Dans le benchmark RAID évalué par les pairs présenté à ACL 2024, Winston a obtenu une précision globale de 71.0% avec un taux de faux positifs fixé à 5%, bien qu'il ait atteint 99.6% sur la sortie de ChatGPT en particulier. La revendication décrit un corpus choisi, et non des performances en conditions réelles.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Restez informé sur l'humanisation par AI

Recevez dans votre boîte mail des conseils sur la rédaction académique, la détection AI et l'humanisation.

Pas de spam. Désabonnement possible à tout moment.