AI Detection

बर्स्टिनेस क्या है? समान वाक्य क्यों चिह्नित होते हैं

बर्स्टिनेस यह मापता है कि किसी अनुच्छेद में वाक्य-लंबाइयाँ कितनी व्यापक रूप से बदलती हैं, न कि औसत वाक्य कितना लंबा चलता है। यह पोस्ट बताती है कि यह शब्द कहाँ से आया, प्रसार वास्तव में कैसे गणना किया जाता है, और क्यों किसी भाषा मॉडल का आउटपुट वाक्य-लंबाइयों की एक संकीर्ण सीमा में स्थिर हो जाता है।

6 min
What is burstiness? A chart comparing uniform AI-generated sentence lengths to varied human sentence lengths.

एक अनुच्छेद को ज़ोर से पढ़िए, और एक निश्चित प्रकार की समतलता नाम दिए जाने से पहले ही सुनाई देने लगती है, हर वाक्य लगभग समान संख्या में श्वासों पर समाप्त होता है, जैसे कोई मेट्रोनोम जिसे बंद करना कोई भूल गया हो। पाठक यह पैटर्न यह कह पाने से पहले ही पहचान लेते हैं कि इसमें क्या गलत है, और उत्पन्न पाठ को पकड़ने के लिए बनाए गए डिटेक्टर भी इसे पहचानने के लिए ही बनाए गए थे। इस पैटर्न का नाम burstiness है, एक ऐसा शब्द जो किसी भी AI detector से पुराना है।

तो burstiness क्या है, उस विशिष्ट अर्थ में जिसे एक detector अभिप्रेत करता है? यह इस बात का माप है कि किसी अंश में वाक्य लंबाइयाँ कितनी व्यापक रूप से बदलती हैं, जिसे किसी स्थिर संख्या के विरुद्ध नहीं, बल्कि उसी अंश के अपने औसत के सापेक्ष गणना किया जाता है। कोई अनुच्छेद bursty तब होता है जब छोटे, संक्षिप्त वाक्य लंबे, घुमावदार वाक्यों के साथ रखे हों। किसी अनुच्छेद में burstiness कम तब होती है जब हर वाक्य लगभग समान लंबाई के पास समाप्त होता है, चाहे वह लंबाई 6 शब्द हो या 26।

यह सांख्यिकीय मान एक छोटे अनुच्छेद पर हाथ से निकालने के लिए पर्याप्त सरल है, और एक बार यह दिखाई देने लगे, तो समतल पृष्ठ एक धुँधली छाप नहीं रहता, बल्कि एक ऐसी संख्या बन जाता है जिसकी ओर संकेत किया जा सकता है। इसका एक पुराने, असंबद्ध सांख्यिकीय मान से लगभग कोई संबंध भी नहीं है, जिसका नाम संयोग से यही है।

burstiness क्या है?

यदि किसी दस्तावेज़ में वाक्य लंबाई के भीतर परिवर्तनशीलता हो, तो AI detector को bursty कहा जाता है। AI detector जिस अर्थ में burstiness शब्द का प्रयोग करता है, वह किसी दस्तावेज़ में वाक्य लंबाइयों का प्रसार है, जिसे एक ही संख्या के रूप में व्यक्त किया जाता है, इन लंबाइयों का मानक विचलन उनके माध्य से विभाजित करके। एक बड़ी संख्या का अर्थ है कि वाक्य औसत के आसपास व्यापक रूप से भिन्न हैं। एक छोटी संख्या का अर्थ है कि वे उसके आसपास सघन रूप से समूहित हैं, चाहे वह औसत कुछ भी हो।

यह शब्द स्वयं एक बहुत पुराने सांख्यिकीय शब्दकोश से संबंधित है। शोधकर्ता burstiness का उपयोग भूकंपों, रोग प्रकोपों और नेटवर्क ट्रैफ़िक का वर्णन करने के लिए करते हैं, अर्थात किसी भी ऐसी चीज़ के लिए जो समय में समान रूप से फैलने के बजाय समूहों में प्रकट होती है, और इन क्षेत्रों में इसे मापने का एक सामान्य तरीका Fano factor है, जो किसी गणना के विचरण और उसके माध्य का अनुपात है।

प्राकृतिक भाषा प्रसंस्करण के भीतर भी इसका एक दूसरा, पुराना अर्थ है, जिसे इस पोस्ट में चर्चा किए गए वाक्य-लंबाई सांख्यिकीय मान से भ्रमित करना आसान है। 1990 के दशक में कॉर्पस भाषाविदों ने burstiness का उपयोग यह बताने के लिए किया कि अलग-अलग शब्द किस तरह समूहित होते हैं, जब कोई दस्तावेज़ किसी दुर्लभ शब्द का उल्लेख करता है, तो उसके फिर से उल्लेखित होने की संभावना पहली, स्वतंत्र उपस्थिति से अपेक्षित संभावना की तुलना में बहुत अधिक हो जाती है। Kenneth Church और William Gale ने 1995 में Poisson mixtures में इस पैटर्न का सांख्यिकीय उपचार दिया, और सूचना पुनर्प्राप्ति प्रणालियाँ आज भी इसका समायोजन करती हैं, जब वे यह भार निर्धारित करती हैं कि किसी दोहराए गए शब्द को कितना महत्व दिया जाना चाहिए। वह सांख्यिकीय मान एक शब्द की पुनरावृत्ति को ट्रैक करता है। इस पोस्ट में मापन किसी और चीज़ को ट्रैक करता है, पूरे वाक्यों का आकार, इस बात से स्वतंत्र कि उन्हें कौन से शब्द भरते हैं।

इस पोस्ट के शेष भाग में इस शब्द का उपयोग केवल उसी दूसरे अर्थ में किया गया है, वाक्य का आकार, शब्द की पुनरावृत्ति नहीं।

औसत से अधिक महत्वपूर्ण क्यों है फैलाव

दो दस्तावेज़ों का औसत वाक्य-लंबाई बिल्कुल समान हो सकता है और फिर भी वे एक-दूसरे से बिल्कुल अलग पढ़े जा सकते हैं। बारह शब्दों का औसत ऐसे अनुच्छेद से संबंधित हो सकता है जिसमें हर वाक्य लगभग बारह शब्दों का हो, या ऐसे अनुच्छेद से जिसमें छह-शब्द वाले वाक्य अठारह-शब्द वाले वाक्यों के साथ बारी-बारी से आते हों, और माध्य इन दोनों अनुच्छेदों में अंतर नहीं कर सकता। केवल माध्य के आसपास का फैलाव ही ऐसा कर सकता है।

सांख्यिकीविद् केवल माध्य के आधार पर तुलना करने को वितरण के प्रथम आघूर्ण से आगे न देखने की विफलता कहेंगे। एक डिटेक्टर, या एक सावधान पाठक, परोक्ष रूप से दूसरे आघूर्ण की भी जाँच कर रहा होता है, केंद्र के आसपास का आकार, जिसे केवल माध्य कभी प्रकट नहीं कर सकता।

एक ही परिणाम को रिपोर्ट करने के दो तरीकों पर विचार करें। 'हस्तक्षेप ने अधिकांश प्रतिभागियों में लक्षणों को कम किया। प्रभाव आयु समूहों में सुसंगत था। यह निष्कर्ष तंत्र में आगे की जाँच का समर्थन करता है।' तीन वाक्य, प्रत्येक आठ से नौ शब्दों के, एक ऐसी लय बनाते हैं जिसमें लगभग कोई फैलाव नहीं है। अब इसकी तुलना करें, 'अधिकांश प्रतिभागियों में लक्षण कम हो गए। यह तब भी सही रहा चाहे व्यक्ति बाईस वर्ष का हो या अड़सठ वर्ष का, जिसकी टीम में किसी ने शुरुआत में अपेक्षा नहीं की थी, और यही कारण है कि अगले अध्ययन को केवल परिणाम के बजाय तंत्र पर ध्यान देना होगा।' दावा समान है। उसे वह लय नहीं मिलती जो उसे वहन कर रही है।

माध्य दोनों अनुच्छेदों को समान मानता है। एक पाठक, और स्पष्टतः एक डिटेक्टर, ऐसा नहीं करता।

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

बर्स्टिनेस की गणना कैसे की जाती है

गणना संक्षिप्त है। हर वाक्य में शब्दों की संख्या गिनें, उस सूची का मानक विचलन लें, फिर उसे माध्य से भाग दें। उदाहरण के लिए, यदि आप ऐसे अंश को देखें जिसमें आठ, इकतीस, ग्यारह, चौबीस और नौ शब्दों वाले वाक्य हों, तो आपको माध्य के लगभग छप्पन प्रतिशत का प्रसार मिलता है, जो एक व्यापक बर्स्ट है। यदि आप ऐसे अंश को देखें जिसमें पंद्रह, सोलह, चौदह, सत्रह और पंद्रह शब्दों वाले वाक्य हों, तो आपको लगभग सात प्रतिशत का प्रसार मिलता है, भले ही दोनों अंशों की औसत लंबाई लगभग समान हो।

केवल कच्चा मानक विचलन वही काम नहीं करेगा। बारह शब्द प्रति वाक्य के औसत वाले अंश में आठ शब्दों का प्रसार, चालीस के औसत वाले अंश में आठ शब्दों के प्रसार से अलग अर्थ रखता है, इसलिए माध्य से भाग देना ही वह तरीका है जो इस संख्या को एक अंश से दूसरे अंश तक तुलनीय बनाता है।

यह सापेक्ष ढांचा ही कारण है कि यह सांख्यिकी एक संक्षिप्त समाचार शैली और एक सघन सैद्धांतिक शैली पर समान रूप से काम करती है। छोटे, एकसमान वाक्यों से बनी एक तकनीकी खंड और छोटे, एकसमान वाक्यों से बना एक अनौपचारिक अनुच्छेद, दोनों ही कम बर्स्टिनेस के रूप में दर्ज हो सकते हैं, क्योंकि यह मापन कभी यह नहीं पूछता कि कोई वाक्य निरपेक्ष अर्थों में कितना लंबा है, केवल यह देखता है कि प्रत्येक वाक्य अपने पड़ोसी वाक्यों के औसत से कितना दूर है।

यह वही समान गणना है जिसे इस साइट पर मौजूद free burstiness checker एक चिपकाए गए मसौदे पर लागू करता है, और पूरे अंश को एक ही आंकड़े में संकुचित करने के बजाय हर वाक्य को एक बिंदु के रूप में आलेखित करता है। उस पैमाने पर, लगभग बीस प्रतिशत से कम कुछ भी एक सघन, एकसमान प्रसार के रूप में पढ़ा जाता है, और लगभग पैंतालीस प्रतिशत से अधिक कुछ भी एक व्यापक प्रसार के रूप में पढ़ा जाता है, जबकि अधिकांश संपादित अकादमिक गद्य बीच के किसी स्तर पर आता है।

पृष्ठ पर कम विचरण वाला अनुच्छेद कैसा दिखता है

दोनों प्रतिरूपों को साथ रख दें, तो जब आपको यह पता हो कि क्या देखना है, वे आसानी से अलग पहचाने जा सकते हैं।

विशेषताकम-परिवर्तनशील अनुच्छेदअधिक-परिवर्तनशील अनुच्छेद
वाक्य लंबाई का पैटर्नलगभग हर वाक्य अनुच्छेद के औसत से कुछ ही शब्दों के भीतर रहता हैछोटे, संक्षिप्त वाक्य लंबे, बहु-उपवाक्यीय वाक्यों के साथ रखे होते हैं
इसे ज़ोर से पढ़नाएक स्थिर, समान गति, जिसमें ज़ोर देने के लिए रुकने का कोई स्वाभाविक स्थान नहीं होताएक ऐसी लय जो तेज़ भी होती है और धीमी भी, और इस बात का अनुसरण करती है कि ज़ोर वास्तव में कहाँ पड़ता है
सामान्य कारणएक मॉडल से बिना संपादन के निकला आउटपुट, जो एक समय में एक संभावित अगला वाक्य अनुमानित करता है, या ऐसा पहला मसौदा जिसे किसी ने ज़ोर से पढ़कर नहीं देखाप्रभाव के लिए किसी वाक्य को छोटा कर देना, या दो पतले वाक्यों को एक ऐसे वाक्य में मिला देना जो अपनी लंबाई को उचित ठहराता हो

दोनों स्तंभ अपने आप में अच्छे लेखन का संकेत नहीं हैं। पाँच चरणों को पाँच छोटे वाक्यों में सूचीबद्ध करने वाला एक विधि-खंड बाएँ स्तंभ जैसा दिखना चाहिए, और किसी क्रमांकित प्रक्रिया में डाला गया एक लंबा, घुमावदार वाक्य उसे बेहतर नहीं बनाएगा। यह पैटर्न तभी सूचनात्मक बनता है जब आपको पता हो कि किस प्रकार के अंश को देखा जा रहा है।

एकरूप वाक्यों को क्यों चिह्नित किया जाता है

डिटेक्टर एक समतल लय को संकेत मानते हैं, क्योंकि यह पाठ-उत्पादन के काम करने के तरीके से जुड़ा है, न कि इसलिए कि एकरूप वाक्य अपने आप में संदिग्ध होते हैं। AI detectors वास्तव में कैसे काम करते हैं की व्यापक यांत्रिकी अलग से समझाई गई है, संक्षिप्त रूप यह है कि एक मॉडल एक समय में एक टोकन का अनुमान लगाता है, जिसमें निहित रूप से यह भी शामिल है कि कोई वाक्य कब समाप्त होने की संभावना रखता है। अब तक के पाठ को देखते हुए, किसी भी क्षण कुछ वाक्य-लंबाई अन्य की तुलना में सांख्यिकीय रूप से अधिक संभावित होती है, और जो मॉडल सबसे संभावित निरंतरता चुनता रहता है, वह पूरे दस्तावेज़ में, वाक्य दर वाक्य, बार-बार उसी संभावित लंबाई के आसपास पहुँचता रहता है।

एक अकेला समतल अनुच्छेद अपने आप में कुछ सिद्ध नहीं करता, छोटे प्रक्रियात्मक खंड वैसे ही दिखने चाहिए। डिटेक्टर वास्तव में पूरे दस्तावेज़ में पैटर्न को तौल रहा होता है, यह कि किसी एक अनुच्छेद की समतलता स्थानीय, उद्देश्यपूर्ण चयन है, या पूरे लेख में हर अनुच्छेद की लय।

शब्द-दर-शब्द पूर्वानुमेयता एक संबंधित लेकिन अलग माप है, जिसे इस साइट पर अन्यत्र अपने संदर्भ में समझाया गया है, और यह वाक्य की संरचना के बजाय अलग-अलग शब्द-चयन को देखता है।

इनमें से कोई भी बात यह सिद्ध नहीं करती कि कोई दस्तावेज़ किसी मॉडल द्वारा उत्पन्न किया गया था, और एक समतल लय को अपने आप निर्णायक मानना वही गलती दोहराएगा जो एक अकेले perplexity अंक को निर्णायक मानने में होती है। कोई जल्दबाज़ी में तैयार किया गया पहला मसौदा, जिसे किसी ने ज़ोर से पढ़कर नहीं सुना है, उतनी ही आसानी से समतल हो सकता है जितना उत्पन्न पाठ हो सकता है। यही कारण है कि TextPulse का अपना अनुमानित Human Score वाक्य-स्तर के परिवर्तन को कई अन्य संकेतों के साथ जोड़ता है, और किसी एक संकेत पर निर्भर नहीं रहता, तथा इस साइट पर मौजूद निःशुल्क निदान उपकरण इस तरह बनाए गए हैं कि उन्हें अलग-अलग नहीं, बल्कि साथ पढ़ा जाए।

परिभाषा से अधिक महत्वपूर्ण दो अनुवर्ती प्रश्न हैं। क्या detectors अभी भी burstiness को उसी तरह महत्व देते हैं जैसा वे 2023 में देते थे, यह एक प्रश्न है, और अपनी स्वयं की ड्राफ्टों में इसे कैसे बढ़ाया जाए बिना गद्य को बिगाड़े, यह दूसरा है।

एक समतल अनुच्छेद तब रहस्य नहीं रहता जब उसके पीछे की प्रक्रिया दिखाई देने लगती है। यह वही होता है जो तब घटित होता है जब हर वाक्य उसी तरह बनाया जाता है जैसे एक अकेला अगला शब्द बनाया जाता है, यानी जो आगे आने वाला है उसे सबसे कम प्रतिरोध के साथ पकड़ने की कोशिश करके। यह दबाव जीतता है या नहीं, यह इस पर निर्भर करता है कि लेखक, या मॉडल, वाक्य-दर-वाक्य उसका प्रतिरोध करता है या नहीं।

Frequently Asked Questions

लेखन में बर्स्टिनेस क्या है? यह किसी अनुच्छेद में वाक्य-लंबाई के बदलने की मात्रा है, जिसे वाक्य-लंबाइयों के मानक विचलन को उनके माध्य से भाग देकर मापा जाता है। जिन अनुच्छेदों में छोटे और लंबे वाक्यों के बीच व्यापक उतार-चढ़ाव होता है, उनमें बर्स्टिनेस अधिक होती है। जिन अनुच्छेदों में हर वाक्य लगभग समान लंबाई का होता है, उनमें बर्स्टिनेस कम होती है, चाहे वह लंबाई छोटी हो या लंबी।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.