AI Detection

Αξιολόγηση του Winston AI: ο ισχυρισμός ακρίβειας 99,98% έναντι των αποδείξεων

Το Winston AI διαφημίζει ακρίβεια 99,98%, το υψηλότερο αυτοαποδιδόμενο ποσοστό στον κλάδο των ανιχνευτών, μετρημένο σε ένα εσωτερικό σύνολο δοκιμών που η εταιρεία δεν έχει δημοσιεύσει ποτέ. Το αξιολογημένο από ομοτίμους RAID benchmark έθεσε τη συνολική ακρίβειά του στο 71% με σταθερό ποσοστό ψευδώς θετικών 5%, παραμένοντας πάντως δεύτερο ανάμεσα στους τέσσερις εμπορικούς ανιχνευτές που δοκιμάστηκαν. Να τι μετρά πραγματικά κάθε αριθμός, και σε ποιον ταιριάζει πραγματικά αυτό το εργαλείο.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Το Winston AI διαφημίζει ακρίβεια 99.98%, το υψηλότερο αυτοαποδιδόμενο ποσοστό από οποιονδήποτε ευρέως διαδεδομένο ανιχνευτή AI. Ο αριθμός εμφανίζεται στην αρχική σελίδα της εταιρείας δίπλα στις λέξεις "The Most Trusted AI Detector", και προέρχεται από τις εσωτερικές δοκιμές της ίδιας της εταιρείας, όχι από εξωτερικό εργαστήριο. Δεν δημοσιεύεται μαζί του καμία μεθοδολογία, μέγεθος συνόλου δοκιμών, αναλογία δειγμάτων ανθρώπινης προς AI προέλευσης ή κατώφλι λειτουργίας. Αυτό το κενό ανάμεσα στον ισχυρισμό και την τεκμηρίωσή του είναι το πρώτο πράγμα που πρέπει να γνωρίζει ένας προσεκτικός αναγνώστης για αυτό το εργαλείο.

Το δεύτερο είναι ότι το Winston έχει πράγματι δοκιμαστεί από τρίτους, κάτι που δεν μπορούν να πουν ορισμένοι ανιχνευτές. Το σημείο αναφοράς RAID, μια μελέτη με αξιολόγηση από ομοτίμους που παρουσιάστηκε στο ACL 2024, έθεσε το Winston απέναντι σε περίπου 6.2 εκατομμύρια κείμενα παραγόμενα από μηχανή και μέτρησε συνολική ακρίβεια 71.0% με το ποσοστό ψευδώς θετικών σταθερό στο 5%. Αυτό απέχει πολύ από το 99.98%. Τοποθέτησε επίσης το Winston δεύτερο από τους τέσσερις εμπορικούς ανιχνευτές που δοκιμάστηκαν, μπροστά από τα GPTZero και ZeroGPT. Και τα δύο στοιχεία έχουν σημασία, και κανένα δεν αναιρεί το άλλο.

Ακολουθεί τι είναι το Winston και για ποιον έχει σχεδιαστεί, τι ισχυρίζεται ο προμηθευτής, τι μπορεί και τι δεν μπορεί να σημαίνει στατιστικά ένα αυτο-σημείο αναφοράς 99.98%, και τι δείχνουν στην πραγματικότητα οι ανεξάρτητοι αριθμοί.

Τι Είναι το Winston AI και Ποιοι Το Χρησιμοποιούν;

Το Winston AI είναι ένας επί πληρωμή ανιχνευτής με συνδρομητικό μοντέλο, που απευθύνεται άμεσα σε εκπαιδευτικούς και εκδότες περιεχομένου. Ο κατάλογος λειτουργιών του μοιάζει με ροή εργασίας εκπαιδευτικού, ο ιστότοπος της εταιρείας περιγράφει OCR που εξάγει κείμενο από σαρωμένα έγγραφα, φωτογραφίες και χειρόγραφο, μια ενσωμάτωση με το Google Classroom που αναφέρεται μεταξύ των υποστηριζόμενων πλατφορμών του, έναν ελεγκτή λογοκλοπής μαζί με την ανίχνευση AI, και οργάνωση εγγράφων για τη διαχείριση παρτίδων υποβολών. Ο προμηθευτής δηλώνει ότι ανιχνεύει έξοδο από ChatGPT, Gemini, Claude, LLaMA "and much more".

Το πιο διακριτό μέρος της διεπαφής είναι η έξοδος ανά πρόταση. Αντί να επιστρέφει μόνο ένα ποσοστό, το Winston παράγει αυτό που αποκαλεί χάρτη πρόβλεψης AI, μια χρωματικά κωδικοποιημένη, πρόταση προς πρόταση αξιολόγηση του ποια μέρη ενός εγγράφου διαβάζονται ως παραγόμενα από μηχανή. Για έναν εκπαιδευτικό, αυτός ο χάρτης είναι πιο χρήσιμος από μια απλή βαθμολογία, επειδή δείχνει πού συγκεντρώνεται η υποψία του εργαλείου. Είναι επίσης εύκολο να υπερερμηνευθεί, σημείο που εξετάζεται παρακάτω.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
Το σήμα που τίθεται υπό εξέταση, 99.98% ακριβές, στην αρχική σελίδα, χωρίς κατονομαζόμενη μελέτη από πίσω του.

Τι Ισχυρίζεται η Εταιρεία;

Ο κεντρικός ισχυρισμός στην αρχική σελίδα του Winston AI είναι "99.98% Accurate." Κατά τη στιγμή που γράφεται αυτό, η σελίδα που φέρει αυτό το ποσοστό δεν δημοσιεύει πώς κατασκευάστηκε το δοκιμαστικό σώμα κειμένων, πόσα δείγματα περιείχε, ποιο μείγμα ανθρώπινου και AI κειμένου χρησιμοποιήθηκε, ή σε ποιο κατώφλι απόφασης είχε ρυθμιστεί ο ανιχνευτής όταν μετρήθηκε το ποσοστό. Αυτό δεν είναι ασυνήθιστο για τον κλάδο, το ίδιο κενό ανάμεσα στους ισχυρισμούς ακρίβειας των προμηθευτών και στα ανεξάρτητα τεκμήρια διατρέχει σχεδόν κάθε ανιχνευτή στην αγορά. Η εκδοχή του ισχυρισμού από το Winston είναι απλώς ο μεγαλύτερος αριθμός που έχει τεθεί πάνω του.

Τι Μπορεί Πραγματικά να Σημαίνει ένα 99.98% Self-Benchmark;

Ας πάρουμε για λίγο σοβαρά την αριθμητική. Ένα ποσοστό ακρίβειας 99.98% σημαίνει 2 σφάλματα σε κάθε 10,000 δείγματα. Για να μετρηθεί καθόλου αυτό το ποσοστό, μια εταιρεία χρειάζεται ένα επισημασμένο σύνολο δοκιμών με τουλάχιστον δεκάδες χιλιάδες έγγραφα, όπου η πραγματική προέλευση κάθε κειμένου είναι γνωστή με βεβαιότητα. Έπειτα, ο αριθμός περιγράφει μόνο την απόδοση σε εκείνο το σώμα κειμένων, εκείνα τα AI models, εκείνα τα prompts, εκείνα τα είδη κειμένου, εκείνο το μήκος κειμένου, σε ένα επιλεγμένο κατώφλι.

Τίποτε από αυτά δεν απαιτεί κακή πίστη. Ένας ανιχνευτής που εκπαιδεύτηκε σε δοκίμια παραγόμενα από δημοφιλή μοντέλα συνομιλίας, και στη συνέχεια δοκιμάστηκε σε ένα σώμα δοκιμίων παραγόμενων από δημοφιλή μοντέλα συνομιλίας, θα καταγράψει πράγματι βαθμολογία κοντά στο ανώτατο όριο. Το πρόβλημα είναι η μεταφερσιμότητα. Τη στιγμή που το εισερχόμενο κείμενο προέρχεται από διαφορετικό μοντέλο, διαφορετική στρατηγική δειγματοληψίας ή από συγγραφέα του οποίου το φυσικό ύφος είναι ασυνήθιστα ομοιόμορφο, το σώμα πάνω στο οποίο μετρήθηκε το benchmark δεν περιγράφει πλέον το κείμενο που αξιολογείται. Ένα εσωτερικό benchmark είναι ένα ελεγχόμενο πείραμα που διεξάγεται από το μέρος με το ισχυρότερο συμφέρον ως προς το αποτέλεσμά του, υπό συνθήκες της δικής του επιλογής. Είναι τεκμήριο, αλλά του ασθενέστερου είδους, και η ελλείπουσα μεθοδολογία σημαίνει ότι κανείς εκτός της εταιρείας δεν μπορεί καν να το ελέγξει.

Τι Δείχνει η Ανεξάρτητη Δοκιμή;

Η πιο αυστηρή δημόσια δοκιμή που περιλαμβάνει το Winston είναι το RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, μια αξιολογημένη από ομοτίμους μελέτη των Dugan και συνεργατών που παρουσιάστηκε στο ACL 2024. Το RAID αξιολόγησε 12 ανιχνευτές, συμπεριλαμβανομένων τεσσάρων εμπορικών προϊόντων, έναντι περίπου 6.2 million παραγωγών που κάλυπταν 11 γλωσσικά μοντέλα, 8 πεδία γραφής, 4 στρατηγικές αποκωδικοποίησης και 11 επιθέσεις αντιπαράθεσης, με κάθε ανιχνευτή να έχει βαθμονομηθεί στο ίδιο ποσοστό ψευδώς θετικών 5% ώστε οι βαθμολογίες να είναι συγκρίσιμες.

ΑνιχνευτήςΣυνολική ακρίβεια στο RAID (FPR σταθερό στο 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

Δύο αναγνώσεις αυτού του πίνακα είναι ταυτόχρονα ειλικρινείς. Το 71.0% του Winston απέχει πολύ από το 99.98%, και το Winston εξακολουθούσε να ξεπερνά δύο από τους τρεις εμπορικούς ανταγωνιστές του στο δυσκολότερο δημόσιο benchmark που είναι διαθέσιμο. Οι μέσοι όροι επίσης αποκρύπτουν μια αποκαλυπτική διασπορά. Στα αποτελέσματα ανά μοντέλο του RAID, το Winston σημείωσε 99.6% σε έξοδο ChatGPT και 98.8% σε έξοδο GPT-4, κοντά στη δική του διαφημιζόμενη τιμή, αλλά έπεσε στο 47.6% σε κείμενο GPT-2 και στο 24.8% σε κείμενο από το βασικό μοντέλο MPT-30B. Σε παραφρασμένο κείμενο μηχανής, η ακρίβειά του μειώθηκε στο 52.6%.

Αυτή η διασπορά είναι η ίδια η ιστορία του ισχυρισμού 99.98% σε μικρογραφία. Σε κείμενο που μοιάζει με αυτό για το οποίο υποτίθεται ότι ρυθμίστηκε ο ανιχνευτής, πρόσφατα chat models που γράφουν απλή πρόζα, το Winston αποδίδει κοντά στο επίπεδο που προβάλλει το μάρκετινγκ του. Έξω από αυτή την κατανομή, η απόδοση καταρρέει. Ένα εσωτερικό benchmark που κατασκευάζεται από κείμενο εντός της κατανομής μπορεί πράγματι να παράγει έναν σχεδόν τέλειο αριθμό, ενώ να σας λέει σχεδόν τίποτα για το ακατάστατο μείγμα μοντέλων, επιμέλειας και παραφράσεων που περιέχει ένα πραγματικό inbox. Τα στατιστικά σήματα στα οποία βασίζονται οι ανιχνευτές εξετάζονται πιο αναλυτικά στην επεξήγησή μας για το πώς λειτουργούν οι ανιχνευτές AI.

Ανθρωποποιήστε τη δική σας εργασία

Μετασχηματίστε το κείμενό σας με τη βοήθεια AI και κάντε το να ακούγεται ανθρώπινο, χωρίς να αγγίξετε σημαντικές λέξεις ή παραπομπές.

Ξεκινήστε δωρεάν

Ψευδώς θετικά, ποιοι ζημιώνονται;

Ο σχεδιασμός του RAID καθιστά ορατό έναν συμβιβασμό που το μάρκετινγκ των προμηθευτών σπάνια δείχνει: κάθε σκορ ακρίβειας στη μελέτη μετρήθηκε αφού το ποσοστό ψευδώς θετικών είχε σταθεροποιηθεί στο 5%. Σε αυτή τη βαθμονόμηση, 1 στα 20 γνήσια ανθρώπινα έγγραφα επισημαίνεται. Ένας ανιχνευτής μπορεί να μειώσει αυτό το ποσοστό αυξάνοντας το κατώφλι του, αλλά μόνο εντοπίζοντας λιγότερο κείμενο AI, οι δύο αριθμοί κινούνται μαζί, και ένας προμηθευτής που παραθέτει τον έναν χωρίς τον άλλον παραθέτει το μισό αποτέλεσμα.

Το βάρος αυτών των σφαλμάτων δεν κατανέμεται ομοιόμορφα. Η γραφή που είναι τυποποιημένη, συμβατική και χαμηλής διακύμανσης διαβάζεται ως μηχανική από κάθε στατιστικό ανιχνευτή, και αυτή η περιγραφή ταιριάζει στις ενότητες μεθοδολογίας, στις βιβλιογραφικές ανασκοπήσεις και στην προσεκτική πρόζα συγγραφέων που εργάζονται σε δεύτερη γλώσσα. Το μοτίβο των AI detectors που επισημαίνουν μη φυσικούς ομιλητές της αγγλικής σε αυξημένα ποσοστά τεκμηριώνεται σε όλο τον κλάδο, και τίποτα στη μέθοδο του Winston δεν το εξαιρεί. Ο χάρτης πρόβλεψης ανά πρόταση αξίζει την ίδια προσοχή, μια πρόταση με κόκκινη επισήμανση είναι μια στατιστική παρατήρηση σχετικά με τα μοτίβα λέξεων, όχι απόδειξη για τη συγγραφική ιδιότητα. Οι φοιτητές που αντιμετωπίζουν μια εσφαλμένη επισήμανση πρέπει να ξεκινούν από την τεκμηρίωση, όχι από την ομολογία, ο οδηγός μας για το πώς να αποδείξετε ότι δεν χρησιμοποιήσατε AI καλύπτει όσα πράγματι πείθουν.

Τιμολόγηση και Πρόσβαση

Το Winston είναι ένα επί πληρωμή προϊόν με περιορισμένη δοκιμή. Το Winston αναφέρει δωρεάν δοκιμή 14 ημερών με 2,000 credits, ένα Essential πλάνο στα $18 ανά μήνα, ή $10 ανά μήνα με ετήσια χρέωση, με 100,000 μηνιαία credits, ένα Advanced πλάνο στα $29 ανά μήνα, ή $16 ετησίως, που προσθέτει θέσεις ομάδας και μεγαλύτερες σαρώσεις, και ένα Elite επίπεδο πάνω από αυτό. Για έναν μεμονωμένο εκπαιδευτικό που ελέγχει υποβολές μιας ολόκληρης τάξης, αυτό τοποθετεί το Winston στην κατηγορία των παρορμητικών αγορών, φθηνότερο από τις θεσμικές συμβάσεις, πιο ικανό από τα περισσότερα δωρεάν εργαλεία.

Πού εντάσσεται το Winston στο τοπίο των ανιχνευτών

Με βάση τα ανεξάρτητα στοιχεία, το Winston είναι ένας εμπορικός ανιχνευτής μεσαίας τιμής που αποδίδει καλύτερα από τη δωρεάν βαθμίδα της αγοράς και χειρότερα από τη δική του διαφήμιση. Ταιριάζει σε έναν εκπαιδευτικό που θέλει ορατότητα ανά πρόταση, ενσωμάτωση με το Classroom και έλεγχο λογοκλοπής σε ένα οικονομικό εργαλείο, και που αντιμετωπίζει κάθε αποτέλεσμα ως αφορμή για συζήτηση και όχι ως ετυμηγορία. Δεν ταιριάζει σε κανέναν που χρειάζεται η βαθμολογία να λειτουργεί ως απόδειξη, επειδή καμία βαθμολογία ανιχνευτή δεν το κάνει.

Η πλήρης σύγκριση

Το Winston είναι ένας ανιχνευτής σε ένα πολυσύχναστο πεδίο, και το χάσμα του 71% έναντι 99.98% είναι μία περίπτωση ενός μοτίβου σε επίπεδο κλάδου. Για το πώς συγκρίνεται με το Turnitin, το GPTZero, το Originality, το ZeroGPT και τους υπόλοιπους με τους ίδιους όρους που δίνουν προτεραιότητα στα αποδεικτικά στοιχεία, δείτε τον πλήρη οδηγό μας για σύγκριση ανιχνευτών AI.

Τι έδειξε η δική μας έρευνα

Στη μελέτη συμφωνίας ανιχνευτών της TextPulse Research, εννέα εμπορικοί ανιχνευτές AI βαθμολόγησαν τα ίδια 90 ακαδημαϊκά κείμενα. Ένα από αυτά ήταν ένα υβριδικό κείμενο 455 λέξεων: ανθρώπινη αρχή και κατακλείδα γύρω από ένα μεσαίο τμήμα 168 λέξεων γραμμένο από AI. Το Winston AI βαθμολόγησε αυτό το κείμενο με 7% AI, ενώ οι ετυμηγορίες των υπόλοιπων εργαλείων για τις ίδιες λέξεις κυμάνθηκαν από 0% έως 95.7% AI. Η πλήρης εργασία, το σώμα κειμένων και ο πίνακας βαθμολογιών κάθε εργαλείου είναι ανοικτά διαθέσιμα στο TextPulse Research.

Το Winston AI στο υβριδικό κείμενο από το σώμα κειμένων της μελέτης.
Το Winston AI στο υβριδικό κείμενο από το σώμα κειμένων της μελέτης.
XLinkedInFacebook

Συχνές ερωτήσεις

Το ποσοστό 99,98% είναι ο ίδιος ο ισχυρισμός του Winston AI, μετρημένος σε ένα εσωτερικό σύνολο δοκιμών που η εταιρεία δεν έχει δημοσιεύσει. Στο αξιολογημένο από ομοτίμους RAID benchmark που παρουσιάστηκε στο ACL 2024, το Winston σημείωσε συνολική ακρίβεια 71,0% με το ποσοστό ψευδώς θετικών σταθερό στο 5%, αν και έφτασε το 99,6% ειδικά στην έξοδο του ChatGPT. Ο ισχυρισμός περιγράφει ένα επιλεγμένο corpus, όχι την απόδοση στον πραγματικό κόσμο.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Μείνετε ενημερωμένοι για την εξανθρωποποίηση AI

Λάβετε συμβουλές για ακαδημαϊκή γραφή, ανίχνευση AI και εξανθρωποποίηση, απευθείας στο email σας.

Χωρίς ανεπιθύμητα μηνύματα. Κατάργηση εγγραφής οποιαδήποτε στιγμή.