AI Detection

Winston AI समीक्षा: 99.98% सटीकता के दावे बनाम साक्ष्य

Winston AI 99.98% सटीकता का विज्ञापन करता है, जो detector उद्योग में सबसे ऊँचा स्व-घोषित आंकड़ा है, जिसे कंपनी के एक आंतरिक test set पर मापा गया था जिसे उसने कभी प्रकाशित नहीं किया। peer-reviewed RAID benchmark ने इसकी समग्र सटीकता 71% रखी, 5% false positive rate को स्थिर रखते हुए, फिर भी परीक्षण किए गए चार commercial detectors में यह दूसरे स्थान पर रहा। यहाँ बताया गया है कि प्रत्येक संख्या वास्तव में क्या मापती है, और यह उपकरण वास्तव में किसके लिए उपयुक्त है।

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI 99.98% सटीकता का विज्ञापन करता है, जो किसी भी मुख्यधारा AI detector द्वारा स्वयं दावा किया गया सबसे ऊँचा आँकड़ा है। यह संख्या कंपनी के homepage पर "The Most Trusted AI Detector" शब्दों के साथ दिखाई देती है, और यह कंपनी की अपनी आंतरिक testing से आती है, किसी बाहरी lab से नहीं। इसके साथ कोई methodology, test set size, human-to-AI sample ratio, या operating threshold प्रकाशित नहीं किया गया है। दावे और उसके documentation के बीच यह अंतर इस tool के बारे में एक सावधान पाठक को सबसे पहले जानना चाहिए।

दूसरी बात यह है कि Winston का वास्तव में बाहरी लोगों द्वारा परीक्षण किया गया है, जो कुछ detectors के बारे में नहीं कहा जा सकता। RAID benchmark, ACL 2024 में प्रस्तुत एक peer-reviewed study, ने Winston को लगभग 6.2 million machine-generated texts के विरुद्ध परखा और 5% पर fixed false positive rate के साथ 71.0% overall accuracy मापी। यह 99.98% से बहुत दूर है। इसने परीक्षण किए गए चार commercial detectors में Winston को दूसरे स्थान पर भी रखा, GPTZero और ZeroGPT से आगे। दोनों तथ्य महत्वपूर्ण हैं, और इनमें से कोई भी दूसरे को निरस्त नहीं करता।

आगे यह बताया गया है कि Winston क्या है और यह किन लोगों के लिए बनाया गया है, vendor क्या दावा करता है, 99.98% का self-benchmark सांख्यिकीय रूप से क्या अर्थ रख सकता है और क्या नहीं, तथा स्वतंत्र आँकड़े वास्तव में क्या दिखाते हैं।

Winston AI क्या है और इसका उपयोग कौन करता है?

Winston AI एक paid, subscription-based detector है, जो सीधे तौर पर educators और content publishers को लक्षित करता है। इसकी feature list एक teacher's workflow जैसी लगती है: कंपनी की site scanned documents, photos, और handwriting से text निकालने वाले OCR का वर्णन करती है, समर्थित platforms में सूचीबद्ध Google Classroom integration, AI detection के साथ एक plagiarism checker, और submissions के batches को manage करने के लिए document organization। vendor का कहना है कि यह ChatGPT, Gemini, Claude, LLaMA "और बहुत कुछ" का output detect करता है।

इंटरफ़ेस का सबसे विशिष्ट भाग प्रति-वाक्य आउटपुट है। केवल एक प्रतिशत लौटाने के बजाय, Winston जिसे वह AI prediction map कहता है, प्रस्तुत करता है, एक रंग-कोडित, वाक्य-दर-वाक्य आकलन कि दस्तावेज़ के कौन से भाग मशीन-जनित प्रतीत होते हैं। एक शिक्षक के लिए, वह मानचित्र एक साधारण स्कोर से अधिक उपयोगी है, क्योंकि यह दिखाता है कि उपकरण का संदेह कहाँ केंद्रित है। इसे आवश्यकता से अधिक पढ़ लेना भी आसान है, जैसा कि नीचे चर्चा की गई है।

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
वह बैज, जिसके बारे में बात हो रही है, 99.98% accurate, homepage पर, और उसके पीछे कोई नामित अध्ययन नहीं है।

कंपनी क्या दावा करती है?

Winston AI's homepage पर मुख्य दावा "99.98% Accurate." है। इस लेखन के समय तक, जिस पृष्ठ पर यह आंकड़ा दिया गया है, वह यह प्रकाशित नहीं करता कि परीक्षण corpus कैसे बनाया गया, उसमें कितने samples थे, उसमें human और AI text का कौन-सा मिश्रण था, या जब यह आंकड़ा मापा गया तब detector को किस decision threshold पर सेट किया गया था। यह इस उद्योग में असामान्य नहीं है, बाजार के लगभग हर detector में vendor accuracy claims और independent evidence के बीच वही अंतर मौजूद है। Winston का यह दावा बस सबसे बड़ा number है जो किसी ने उस पर लगाया है।

99.98% Self-Benchmark वास्तव में क्या अर्थ रख सकता है?

एक क्षण के लिए गणित को गंभीरता से लें। 99.98% accuracy rate का अर्थ है हर 10,000 samples में 2 errors। इस आंकड़े को मापने के लिए, किसी company के पास कम से कम दसियों हज़ार documents का एक labeled test set होना चाहिए, जहाँ हर text की वास्तविक उत्पत्ति निश्चित रूप से ज्ञात हो। तब यह संख्या केवल उसी corpus पर performance का वर्णन करती है, वे AI models, वे prompts, वे genres, वह text length, और एक चुने हुए threshold पर।

इनमें से किसी भी बात के लिए बुरी नीयत की आवश्यकता नहीं है। लोकप्रिय chat models द्वारा उत्पन्न निबंधों पर प्रशिक्षित एक detector, और फिर लोकप्रिय chat models द्वारा उत्पन्न निबंधों के corpus पर परीक्षण किया गया detector, वास्तव में ceiling के निकट score करेगा। समस्या transferability की है। जैसे ही आने वाला पाठ किसी भिन्न model, किसी भिन्न sampling strategy, या ऐसे लेखक से आता है जिसकी स्वाभाविक शैली असामान्य रूप से uniform है, जिस corpus पर benchmark मापा गया था, वह अब उस पाठ का वर्णन नहीं करता जिसे judge किया जा रहा है। एक internal benchmark एक controlled experiment है, जिसे परिणाम में सबसे अधिक हित रखने वाले पक्ष द्वारा, अपनी पसंद की परिस्थितियों में चलाया जाता है। यह evidence है, लेकिन सबसे कमजोर प्रकार का, और methodology के अभाव का अर्थ है कि company के बाहर कोई भी इसे जांच तक नहीं सकता।

स्वतंत्र परीक्षण क्या दिखाते हैं?

Winston को शामिल करने वाला सबसे rigorous public test RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors है, जो Dugan और colleagues का एक peer-reviewed study है, जिसे ACL 2024 में प्रस्तुत किया गया था। RAID ने 12 detectors का मूल्यांकन किया, जिनमें चार commercial products शामिल थे, लगभग 6.2 million generations के विरुद्ध, जो 11 language models, 8 writing domains, 4 decoding strategies, और 11 adversarial attacks में फैले हुए थे, और हर detector को समान 5% false positive rate पर calibrated किया गया था ताकि scores तुलनीय हों।

DetectorRAID में समग्र accuracy, 5% पर FPR fixed
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

उस तालिका की दो व्याख्याएँ एक साथ ईमानदार हैं। Winston का 71.0% किसी भी तरह 99.98% के करीब नहीं है, और फिर भी Winston ने उपलब्ध सबसे कठिन सार्वजनिक बेंचमार्क पर अपने तीन व्यावसायिक प्रतिद्वंद्वियों में से दो को पछाड़ दिया। औसत एक प्रकट करने वाले फैलाव को भी छिपाते हैं। RAID के प्रति-मॉडल परिणामों में, Winston ने ChatGPT आउटपुट पर 99.6% और GPT-4 आउटपुट पर 98.8% स्कोर किया, जो उसके अपने विज्ञापित आँकड़े के क़रीब है, लेकिन GPT-2 पाठ पर 47.6% और बेस MPT-30B मॉडल के पाठ पर 24.8% तक गिर गया। पैराफ़्रेज़ किए गए मशीन पाठ पर, इसकी सटीकता 52.6% तक घट गई।

यह फैलाव 99.98% दावे की पूरी कहानी का सूक्ष्म रूप है। उस पाठ पर, जो संभवतः उस चीज़ से मिलता-जुलता है जिसके लिए डिटेक्टर को ट्यून किया गया था, यानी हाल के चैट मॉडल जो साधारण गद्य लिखते हैं, Winston अपने विपणन के क़रीब प्रदर्शन करता है। उस वितरण से बाहर, प्रदर्शन बहुत तेज़ी से गिरता है। ऑन-डिस्ट्रिब्यूशन पाठ से बना एक आंतरिक बेंचमार्क सचमुच लगभग पूर्ण संख्या दे सकता है, जबकि वह आपको उन मॉडलों, संपादनों और पैराफ़्रेज़ों के गंदे मिश्रण के बारे में लगभग कुछ भी नहीं बताता जो एक वास्तविक इनबॉक्स में होता है। डिटेक्टर जिन सांख्यिकीय संकेतों पर निर्भर करते हैं, उनकी अधिक विस्तृत चर्चा हमारे AI डिटेक्टर कैसे काम करते हैं वाले व्याख्यात्मक लेख में है।

अपने पेपर को मानवीय बनाइए

अपने AI-सहायता प्राप्त पाठ को रूपांतरित करें और उसे मानवीय ध्वनि दें, महत्वपूर्ण शब्दों या उद्धरणों को छेड़े बिना।

मुफ़्त में शुरू करें

गलत सकारात्मक, किसे नुकसान होता है?

RAID का डिज़ाइन एक ऐसा समझौता स्पष्ट करता है जिसे विक्रेता का विपणन शायद ही कभी दिखाता है, अध्ययन में हर सटीकता स्कोर false positive rate को 5% पर स्थिर करने के बाद मापा गया था। उस कैलिब्रेशन पर, 20 में से 1 वास्तव में मानव दस्तावेज़ चिह्नित हो जाता है। एक डिटेक्टर इस दर को अपनी threshold बढ़ाकर कम कर सकता है, लेकिन केवल कम AI पाठ पकड़ने की कीमत पर, ये दोनों संख्याएँ साथ-साथ चलती हैं, और जो विक्रेता एक का उल्लेख दूसरे के बिना करता है, वह परिणाम का आधा हिस्सा उद्धृत कर रहा है।

उन त्रुटियों का भार समान रूप से वितरित नहीं होता। जो लेखन सूत्रबद्ध, परंपरागत, और कम-प्रसरण वाला होता है, वह हर सांख्यिकीय डिटेक्टर को मशीन-जैसा लगता है, और यह विवरण विधि अनुभागों, साहित्य समीक्षाओं, तथा दूसरी भाषा में काम करने वाले लेखकों की सावधानीपूर्ण गद्य-शैली पर लागू होता है। AI detectors द्वारा गैर-देशी अंग्रेज़ी वक्ताओं को अधिक दरों पर चिह्नित करने का पैटर्न उद्योग भर में प्रलेखित है, और Winston की विधि में ऐसा कुछ नहीं है जो उसे इससे मुक्त करे। प्रति-वाक्य पूर्वानुमान मानचित्र भी वही सावधानी मांगता है, लाल-चिह्नित वाक्य शब्द-प्रतिरूपों पर आधारित एक सांख्यिकीय अवलोकन है, न कि लेखकत्व के बारे में प्रमाण। जिन छात्रों पर गलत चिह्न लगाया गया हो, उन्हें स्वीकारोक्ति से नहीं, बल्कि प्रलेखन से शुरुआत करनी चाहिए, हमारा how to prove you did not use AI पर मार्गदर्शक बताता है कि वास्तव में क्या मनाता है।

मूल्य निर्धारण और पहुँच

Winston एक सशुल्क उत्पाद है, जिसमें सीमित परीक्षण उपलब्ध है। Winston 2,000 क्रेडिट के साथ 14-दिन का निःशुल्क परीक्षण, $18 प्रति माह पर Essential योजना, या वार्षिक बिलिंग पर $10 प्रति माह, जिसमें 100,000 मासिक क्रेडिट हैं, $29 प्रति माह पर Advanced योजना, या $16 वार्षिक, जो टीम सीटें और बड़े स्कैन जोड़ती है, तथा उससे ऊपर Elite स्तर सूचीबद्ध करता है। किसी एक शिक्षक के लिए, जो एक कक्षा-भर के प्रस्तुतिकरणों की जाँच कर रहा हो, यह Winston को तात्कालिक-खरीद की श्रेणी में रखता है, संस्थागत अनुबंधों से सस्ता, अधिकांश निःशुल्क उपकरणों से अधिक सक्षम।

डिटेक्टर परिदृश्य में Winston कहाँ फिट होता है

स्वतंत्र साक्ष्यों के आधार पर, Winston एक मध्यम-मूल्य वाला वाणिज्यिक डिटेक्टर है, जो बाज़ार के निःशुल्क स्तर से बेहतर और अपनी ही विज्ञापन-प्रचार से कमजोर प्रदर्शन करता है। यह ऐसे शिक्षक के लिए उपयुक्त है जो प्रति-वाक्य दृश्यता, Classroom एकीकरण, और एक ही सस्ते उपकरण में साहित्यिक चोरी जाँच चाहता है, और जो हर परिणाम को निर्णय के बजाय बातचीत के लिए एक संकेत मानता है। यह किसी ऐसे व्यक्ति के लिए उपयुक्त नहीं है जिसे स्कोर को प्रमाण की तरह काम करना चाहिए, क्योंकि किसी भी डिटेक्टर का स्कोर ऐसा नहीं करता।

पूर्ण तुलना

Winston एक भीड़-भाड़ वाले क्षेत्र में एक डिटेक्टर है, और इसका 71% बनाम 99.98% का अंतर उद्योग-व्यापी पैटर्न का एक उदाहरण है। Turnitin, GPTZero, Originality, ZeroGPT, और बाकी के साथ समान साक्ष्य-प्रथम मानकों पर यह कैसे तुलना करता है, इसके लिए हमारी AI detectors compared पर पूर्ण मार्गदर्शिका देखें।

हमारे अपने शोध ने क्या पाया

TextPulse Research के डिटेक्टर सहमति अध्ययन में नौ व्यावसायिक AI डिटेक्टरों ने वही 90 अकादमिक टेक्स्ट परखे। इनमें से एक 455 शब्दों का हाइब्रिड टेक्स्ट था: शुरुआत और अंत इंसान के लिखे हुए, बीच में 168 शब्दों का AI-लिखा हिस्सा। Winston AI ने इस टेक्स्ट को 7% AI स्कोर दिया, जबकि उन्हीं शब्दों पर बाकी टूल्स के फैसले 0% से 95.7% AI तक फैले थे। पूरा शोधपत्र, कॉर्पस और हर टूल की स्कोर मैट्रिक्स TextPulse Research पर खुले रूप से उपलब्ध है।

अध्ययन कॉर्पस के हाइब्रिड टेक्स्ट पर Winston AI।
अध्ययन कॉर्पस के हाइब्रिड टेक्स्ट पर Winston AI।
XLinkedInFacebook

अक्सर पूछे जाने वाले प्रश्न

99.98% का आंकड़ा Winston AI का अपना दावा है, जिसे कंपनी द्वारा प्रकाशित न किए गए एक आंतरिक test set पर मापा गया था। ACL 2024 में प्रस्तुत peer-reviewed RAID benchmark में, Winston ने 5% पर false positive rate स्थिर रखते हुए 71.0% समग्र सटीकता प्राप्त की, हालांकि उसने विशेष रूप से ChatGPT output पर 99.6% हासिल किया। यह दावा एक चुने हुए corpus का वर्णन करता है, वास्तविक-विश्व प्रदर्शन का नहीं।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI मानवीकरण पर अपडेट रहें

शैक्षणिक लेखन, AI पहचान, और मानवीकरण के सुझाव सीधे अपने इनबॉक्स में प्राप्त करें।

कोई स्पैम नहीं। कभी भी सदस्यता समाप्त करें।