GPTZero कैसे काम करता है
GPTZero ने perplexity और burstiness को प्रसिद्ध किया, फिर दोनों को चुपचाप हटा दिया। यहाँ बताया गया है कि इसका वर्गीकारक अब क्या मापता है, एक रिपोर्ट वास्तव में क्या दिखाती है, और उपकरण अपनी सीमाओं के बारे में क्या कहता है.
सर्च बार में "how gptzero works" टाइप करें, और जो अधिकांश सामग्री वापस आती है, वह अभी भी perplexity और burstiness का वर्णन करती है, ये दो सांख्यिकीय मान जिनको ChatGPT के जारी होने के बाद पहले कुछ हफ्तों में इसके संस्थापक ने प्रसिद्ध बनाया था। यह विवरण जनवरी 2023 में सही था। उसके बाद, उस वर्ष की शरद ऋतु से यह सही नहीं रहा, जब GPTZero के अपने दस्तावेज़ीकरण में कहा गया कि कंपनी ने उस विधि को पूरी तरह किसी और चीज़ से बदल दिया। लॉन्च के समय उपकरण जो करता था और अब जो करता है, उनके बीच का अंतर इतना बड़ा है कि आज भी प्रचलित अधिकांश व्याख्याएँ ऐसे उत्पाद का वर्णन करती हैं जो अब अस्तित्व में नहीं है।
आज, GPTZero perplexity गणना के बजाय मानव-निर्मित और AI-निर्मित पाठों के एक बड़े मिश्रित कॉर्पस पर वाक्य-दर-वाक्य वर्गीकारक चलाता है। आज का GPTZero अभी भी एक एकल मुख्य संख्या देता है, लेकिन उसका अंकगणित अलग है। मुख्य संख्या के नीचे वाक्य-स्तरीय हाइलाइटिंग का अर्थ भी 2023 की तुलना में अलग है। कहानी के दोनों संस्करण जानना उपयोगी है, वह जिसने इन शब्दों को प्रसिद्ध बनाया, और वह जो वास्तव में आज चलता है।
इतिहास: perplexity और burstiness ने GPTZero को कैसे प्रसिद्ध बनाया
2 जनवरी, 2023 को, तब के Princeton छात्र Edward Tian ने GPTZero का एक सार्वजनिक डेमो जारी किया, ChatGPT के आने के कुछ ही हफ्तों बाद। उनके मूल व्याख्यात्मक पृष्ठ में बताया गया है कि उन्होंने यह पता लगाने के लिए, जब कोई भाषा मॉडल कुछ लिखता है, भाषा मॉडलिंग से उधार लिए गए दो सांख्यिकीय मानों का उपयोग कैसे किया। perplexity एक ऐसा स्कोर है जो बताता है कि संदर्भ मॉडल पाठ में शब्द-चयन से कितना चकित था। burstiness GPTZero का वह नाम है जो बताता है कि वह चकित होना पूरे दस्तावेज़ में कितना बदलता रहता है। यही व्याख्यात्मक पृष्ठ इस बात का कारण हैं कि AI लेखन के बारे में रोज़मर्रा की बातचीत में दोनों शब्द आए। आज जो अधिकांश लोग perplexity या burstiness को परिभाषित कर सकते हैं, उन्होंने ये शब्द GPTZero से सीखे, किसी पाठ्यपुस्तक से नहीं।
इस तंत्र को स्वयं समझाना सीधा था। किसी संदर्भ भाषा मॉडल के माध्यम से एक अंश को प्रवाहित करें, और जो गद्य मॉडल को अत्यधिक पूर्वानुमेय, कम perplexity वाला लगता है, वह मशीन-विशिष्ट के रूप में पढ़ा जाता है, क्योंकि जनरेशन में आश्चर्यजनक शब्द की तुलना में संभावित अगले शब्द को प्राथमिकता देने की प्रवृत्ति होती है। GPTZero के अपने सेवानिवृत्त दस्तावेज़ीकरण ने भी एक सामान्य नियम प्रकाशित किया था, 85 से ऊपर का perplexity स्कोर मानव-लिखित होने की अधिक संभावना दर्शाता था, मशीन-लिखित होने की नहीं। वह सीमा एक विक्रेता से, एक मॉडल पर, एक समय-बिंदु पर आई थी, और GPTZero स्वयं अब उसका समर्थन नहीं करता।
GPTZero अब कैसे काम करता है: एक वाक्य-स्तरीय वर्गीकारक
GPTZero का सहायता केंद्र स्पष्ट रूप से कहता है कि कंपनी ने शरद 2023 से, एक deep-learning संरचना में स्थानांतरित होने के बाद, पहचान के लिए perplexity और burstiness का उपयोग बंद कर दिया। इस लेख के लिए जाँची गई उसकी वर्तमान प्रौद्योगिकी पृष्ठ इस परिवर्तन की पूर्ण पुष्टि करती है, यह वेब, शिक्षा, और भाषा मॉडलों की एक श्रेणी के पाठ पर प्रशिक्षित एक end-to-end deep learning दृष्टिकोण का वर्णन करती है, जो एक वाक्य-दर-वाक्य वर्गीकरण मॉडल चलाता है जो एक संभावना और एक confidence score देता है। उस पृष्ठ पर perplexity और burstiness कहीं नहीं आते।
तब से, इसने एक रक्षा परत, Paraphraser Shield, भी जोड़ी है, जिसे ऐसे AI पाठ को पकड़ने के लिए बनाया गया है जिसे पहचान से बचने के लिए पुनर्लेखन उपकरण से गुजारा गया हो। आप पाठ चिपका सकते हैं, Word दस्तावेज़, PDFs और छवि फ़ाइलें अपलोड कर सकते हैं, और एक बार में पचास तक फ़ाइलें भेज सकते हैं। इस अवसंरचना का संदर्भ मॉडल ने उसी शब्द का कितनी बार अनुमान लगाया होता, इसकी गिनती से कोई संबंध नहीं है।
अपने पेपर को मानवीय बनाइए
अपने AI-सहायता प्राप्त पाठ को रूपांतरित करें और उसे मानवीय ध्वनि दें, महत्वपूर्ण शब्दों या उद्धरणों को छेड़े बिना।
GPTZero रिपोर्ट वास्तव में आपको क्या दिखाती है
एक GPTZero परिणाम में तीन भाग होते हैं, AI, human या mixed का एक वर्गीकरण, एक प्रतिशत जो यह व्यक्त करता है कि मॉडल के अनुसार दस्तावेज़ AI-written था, और एक confidence label जो बताता है कि वह विशेष पूर्वानुमान कितना विश्वसनीय है। यह label जितना दिखता है, उससे अधिक महत्वपूर्ण है। GPTZero "highly confident" को 2 percent से कम की error rate से और "low confidence" को 14 percent या उससे अधिक की error rate से जोड़ता है, जो इतना व्यापक दायरा है कि वही headline percentage एक रिपोर्ट से दूसरी रिपोर्ट तक बहुत अलग महत्व रख सकता है।
Paid scans वाक्य-स्तर की highlighting जोड़ते हैं, और इसे सही ढंग से पढ़ना महत्वपूर्ण है। GPTZero highlighted sentences को उन वाक्यों के रूप में वर्णित करता है जो समग्र score को असंगत रूप से प्रभावित करते हैं, न कि individual lines के विरुद्ध आरोपों की सूची के रूप में। कोई वाक्य highlight न हुआ हो, तब भी उसने परिणाम को आकार दिया हो सकता है, क्योंकि classifier document को sentence by sentence vote करने के बजाय समग्र रूप से पढ़ता है।
| Report element | यह आपको क्या बताता है |
|---|---|
| Classification | एक एकल label: AI, human, या mixed |
| AI probability score | एक percentage जो यह दर्शाता है कि model document को AI-written मानने की कितनी संभावना आँकता है |
| Confidence label | उच्च confidence, 2 percent error rate से कम, से लेकर low confidence, 14 percent या अधिक तक की सीमा |
| Sentence highlighting | Advanced Scan पर score में सबसे अधिक योगदान देने वाले वाक्यों को चिह्नित करता है, न कि उससे जुड़े हर वाक्य को |
इन report elements में से कोई भी अपने वर्तमान रूप में तब मौजूद नहीं था, जब perplexity-and-burstiness explainer अभी भी GPTZero का अपने बारे में सार्वजनिक विवरण था। interface method के साथ-साथ बदला।
Perplexity और Burstiness का विवरण अभी भी क्यों प्रचलित है
GPTZero का मूल explainer अभी भी online है, अभी भी indexed है, और अभी भी यह बताने वाले अधिक स्पष्ट सामान्य विवरणों में से एक है कि अवधारणाओं के रूप में perplexity और burstiness कैसे काम करते हैं। search engines और अन्य sites इसे cite करते रहते हैं, और कुछ एक व्यापक रूप से साझा 2026 review की ओर संकेत करते हैं, जिसमें दावा किया गया है कि tool अभी भी classifier के साथ चुपचाप एक perplexity और burstiness layer चलाता है। GPTZero के अपने वर्तमान pages, technology page और दोनों support articles, इसके विपरीत कहते हैं, terms retired कर दिए गए थे, केवल पीछे के हिस्से में छिपाए नहीं गए थे। किसी अवधारणा का abstract रूप में वर्णन करने वाला page, इस tool की वर्तमान method का वर्णन करने वाले page के समान नहीं है, और दोनों को परस्पर विनिमेय मानना ही मुख्य कारण है कि यह भ्रम अपनी समाप्ति तिथि के 3 years बाद तक बना रहा है।
यह बात साधारण जिज्ञासा से आगे भी महत्वपूर्ण है। किसी छात्र या सहकर्मी को, GPTZero को हराने के लिए, perplexity कम करने या वाक्य लंबाई को फैलाने की सलाह देना, ऐसे उत्पाद के एक ऐसे संस्करण के लिए दी गई सलाह है जो 2023 में चलना बंद हो गया था। किसी वाक्य वर्गीकार को क्या प्रभावित करता है, यह इससे संबंधित लेकिन अलग प्रश्न है, जो अपने आप में किसी एक आँकड़े की तुलना में AI detectors वास्तव में कैसे काम करते हैं के व्यापक विवरण के अधिक निकट है। GPTZero ने उन्हें मापना बंद नहीं किया है, उसके अपने कथन के अनुसार वे वर्तमान मॉडल को इनपुट देने वाले सात संकेतकों में शामिल हैं, लेकिन वे अब वह चीज़ नहीं रहे जो उत्तर तय करती है।
GPTZero क्या कहता है कि वह क्या नहीं कर सकता
GPTZero के बताए गए सटीकता आँकड़े उतने ही मजबूत हैं जितने कोई विक्रेता अपने ही उत्पाद के बारे में प्रकाशित करने की संभावना रखता है, मिश्रित दस्तावेज़ों पर 96.5 percent सटीकता, कंपनी द्वारा 1 percent पर सीमित समग्र false-positive दर, और TOEFL निबंधों पर विशेष रूप से 1.1 percent, जो गैर-देशी English लेखन के लिए एक सामान्य प्रतिनिधि है। ये आँकड़े GPTZero के अपने मूल्यांकन से आते हैं, और उन्हें रिपोर्ट करने वाले पृष्ठ पर किसी स्वतंत्र पुनरुत्पादन का उल्लेख नहीं है।
GPTZero का अपना limitations पृष्ठ विपणन आँकड़ों की तुलना में अधिक विशिष्ट है। कंपनी कहती है कि अधिक पाठ जमा किए जाने पर सटीकता बेहतर होती है, और पूर्ण दस्तावेज़ की तुलना में वाक्य और अनुच्छेद स्तर पर घट जाती है। वह कहती है कि उसका प्रशिक्षण डेटा मुख्यतः वयस्क English गद्य है, इसलिए जो पाठ उस पैटर्न से अलग होता है, उसे विश्वसनीय रूप से वर्गीकृत करना अधिक कठिन है। वह कहती है कि वर्गीकार को ऐसे AI पाठ को पकड़ने के लिए प्रशिक्षित नहीं किया गया है जिसे निर्माण के बाद बहुत अधिक संशोधित किया गया हो। और वह स्पष्ट रूप से कहती है कि केवल chatbot आउटपुट ही नहीं, बल्कि अन्य machine-generated या अत्यधिक प्रक्रियात्मक लेखन भी उसी तरह चिह्नित हो सकता है।
इनमें से कोई भी बात GPTZero के आंकड़े को निर्विवाद मानने का कारण नहीं है, और यह अकेला ऐसा detector भी नहीं है जिसे अपने ही संदर्भ में समझना महत्वपूर्ण हो। जो पाठक यह जानना चाहते हैं कि ऐसा classifier वास्तव में किस पर प्रतिक्रिया करता है, वे इस पैटर्न का एक रूप स्वयं एक free perplexity checker या एक free burstiness checker के साथ देख सकते हैं, जो एक अधिक पूर्ण free tools collection के दो हिस्से हैं, और जो उस अन्य सांख्यिकीय परतों को भी शामिल करती है जिन पर ऐसा report आधारित होता है।
GPTZero के दो प्रमुख आंकड़ों के अपने अलग पृष्ठ हैं: AI detection में perplexity क्या मापता है, और token probability का वह अंकगणित जो दोनों संख्याएँ उत्पन्न करता है.
जो tool अपनी अंधी जगहों को इतनी स्पष्टता से नाम देने को तैयार है, वह उस tool की तुलना में अधिक भरोसे के योग्य है जो दावा करता है कि उसकी कोई अंधी जगह नहीं है, और report पर आने वाला अगला अस्पष्टीकृत प्रतिशत यह पूछना शुरू करने के लिए एक अच्छा स्थान है कि उसे किस प्रकार के tool ने उत्पन्न किया।
अक्सर पूछे जाने वाले प्रश्न
नहीं। GPTZero का support center बताता है कि कंपनी ने autumn 2023 तक detection के लिए perplexity और burstiness का उपयोग बंद कर दिया था, deep-learning classifier पर स्विच करने के बाद। इसका current technology page एक sentence-by-sentence classification model का वर्णन करता है और इनमें से किसी भी शब्द का उल्लेख नहीं करता। यह विवरण अभी भी इसलिए प्रचलित है क्योंकि GPTZero के अपने 2023 explainer ने विधि बदलने से पहले दोनों शब्दों को लोकप्रिय बनाया था.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.