Turnitin समानता स्कोर बनाम AI स्कोर: दो अलग रिपोर्टें
एक समानता स्कोर और एक AI स्कोर अलग-अलग प्रश्नों के उत्तर देते हैं, इसलिए एक पेपर एक में कम और दूसरे में अधिक स्कोर कर सकता है, बिना किसी भी संख्या के गलत हुए। प्रत्येक क्या मापता है, क्या उसे ट्रिगर करता है, और उच्च संख्या क्या सिद्ध करती है और क्या नहीं करती।
एक रिपोर्ट में दो संख्याएँ आती हैं: 3 प्रतिशत का समानता स्कोर और 88 प्रतिशत का AI स्कोर। स्वाभाविक रूप से यह समझा जा सकता है कि ये दोनों एक ही चीज़ को माप रहे होंगे, इसलिए कम संख्या का अर्थ यह होना चाहिए कि ऊँची संख्या भी शायद गलत है। ऐसा नहीं होता। Turnitin similarity vs AI score दो अलग प्रणालियों के बीच तुलना है, जो दो अलग चीज़ों की जाँच करती हैं, और कोई सबमिशन एक में कम और दूसरे में अधिक स्कोर कर सकता है, बिना इस बात के कि दोनों में से कोई भी संख्या गलती हो।
यह AI वाले से पुराना है, और इसे ऐसे पाठ को पकड़ने के लिए बनाया गया था जो पहले से मौजूद किसी चीज़ से मेल खाता हो। यह नया है, और इसे उसी Similarity Report में एक स्वतंत्र माप के रूप में जोड़ा गया, ताकि यह अनुमान लगाया जा सके कि गद्य मशीन-जनित लगता है या नहीं, चाहे वह किसी भी चीज़ से मेल खाए या नहीं। Turnitin के अपने दस्तावेज़ों के अनुसार, ये पूरी तरह स्वतंत्र हैं और एक दूसरे को प्रभावित नहीं करते। इस लेख की बाकी बातें।
Turnitin Similarity vs AI Score: प्रत्येक संख्या क्या रिपोर्ट करती है
Turnitin इन दोनों को एक ही उत्पाद में समाहित अलग-अलग माप मानता है, न कि एक ही परिणाम के दो दृष्टिकोण। Similarity Report किसी सबमिशन की तुलना वेब सामग्री, शैक्षणिक प्रकाशनों, और पहले से जमा किए गए छात्र-पत्रों के डेटाबेस से करता है, और उस प्रतिशत को लौटाता है जितना सबमिशन का पाठ उस डेटाबेस में पहले से मौजूद किसी चीज़ से मेल खाता है। AI writing detection एक बिल्कुल अलग मॉडल चलाता है, जिसे उसी रिपोर्ट में एक स्वतंत्र स्कोर के रूप में जोड़ा गया है, और जिसे इस बात का आकलन करने के लिए प्रशिक्षित किया गया है कि किसी अंश का गद्य मशीन-जनित लेखन से कितना मिलता-जुलता है, बिना किसी बाहरी डेटाबेस का कोई संदर्भ लिए। Turnitin का AI classifier उस संख्या तक कैसे पहुँचता है इसकी अधिक विस्तृत कार्यप्रणाली अलग से बताई गई है, यहाँ महत्वपूर्ण यह है कि यह उसी रिपोर्ट के भीतर मौजूद similarity engine से अलग प्रश्न का उत्तर देता है।
Similarity Score वास्तव में क्या मापता है
समानता एक मिलान-आधारित अभ्यास है, कोई निर्णय नहीं। Turnitin के अपने मार्गदर्शन में स्पष्ट कहा गया है कि यह उपकरण साहित्यिक चोरी की जाँच नहीं करता। यह केवल ओवरलैप की जाँच करता है और व्याख्या रिपोर्ट पढ़ने वाले शिक्षक पर छोड़ देता है। सही ढंग से अलग किया गया उद्धरण, किसी विधि-खंड का ऐसा वाक्यांश जो पूरे उपक्षेत्र में साझा हो, किसी पत्रिका में हर लेख जिस तरह अपनी संदर्भ-सूची को स्वरूपित करता है उसी तरह स्वरूपित संदर्भ-सूची, यह सब मिलान के रूप में दर्ज हो सकता है, क्योंकि प्रणाली यह आँकती है कि पाठ की कौन सी स्ट्रिंगें एक-दूसरे से ओवरलैप करती हैं, न कि यह कि ओवरलैप वैध है या नहीं।
यही कारण है कि शून्य का समानता स्कोर जितना दिखता है, उससे कम सिद्ध करता है। इसका अर्थ है कि प्रस्तुतिकरण में पाठ का कोई लंबा, अविच्छिन्न अंश नहीं है जो Turnitin के अनुक्रमित स्रोतों में कहीं और पाया गया हो। यह इस बारे में कुछ नहीं कहता कि वहाँ मौजूद वाक्य कैसे बनाए गए थे, क्योंकि ऐसा वाक्य बनाना जो डेटाबेस में किसी चीज़ से मेल न खाए, उतनी ही कौशल-स्तर की बात नहीं है जितनी ऐसा वाक्य बनाना जिसे किसी भाषा मॉडल ने पूर्वानुमानित न किया होता।
अपने पेपर को मानवीय बनाइए
अपने AI-सहायता प्राप्त पाठ को रूपांतरित करें और उसे मानवीय ध्वनि दें, महत्वपूर्ण शब्दों या उद्धरणों को छेड़े बिना।
AI Score वास्तव में क्या मापता है
AI score के पास जाँचने के लिए कोई डेटाबेस नहीं होता। एक वर्गीकार प्रस्तुत गद्य को पढ़ता है और मानव तथा AI-generated लेखन के उदाहरणों में सीखे गए प्रतिरूपों के आधार पर यह अनुमान लगाता है कि वह गद्य किसी व्यक्ति की तुलना में किसी मॉडल से आया होने की कितनी संभावना रखता है। उस अनुमान का इस बात पर कोई निर्भरता नहीं होती कि वही सटीक वाक्य पहले कभी कहीं प्रकट हुआ है या नहीं। कोई वाक्य पूरी तरह अद्वितीय हो सकता है, इस प्रस्तुतिकरण तक किसी ने उसे कभी टाइप न किया हो, और फिर भी यदि उसके शब्द-चयन और लय उस प्रतिरूप का अनुसरण करते हैं जिसे कोई भाषा मॉडल सामान्यतः उत्पन्न करता है, तो वह सांख्यिकीय रूप से AI output का विशिष्ट उदाहरण माना जा सकता है।
यह वही सांख्यिकीय क्षेत्र है जिसे व्यापक विवरण में AI detectors वास्तव में कैसे काम करते हैं के रूप में पूरी तरह समझाया गया है: शब्द-स्तरीय पूर्वानुमेयता और वाक्य-स्तरीय लय, जो एक दस्तावेज़ स्कोर में समाहित हो जाती है। Turnitin का उस वर्गीकार का संस्करण स्वामित्वाधीन है, लेकिन मूल धारणा, कि generated text मानव लेखन की तुलना में सांख्यिकीय रूप से अधिक सामान्य प्रवृत्ति का होता है, वही है जो इस श्रेणी के हर उपकरण के पीछे काम करती है।
| समानता स्कोर | AI स्कोर | |
|---|---|---|
| यह क्या मापता है | सबमिशन के पाठ का कितना भाग अन्य अनुक्रमित दस्तावेज़ों से मेल खाता है | गद्य सांख्यिकीय रूप से सामान्य AI-जनित लेखन से कितनी निकटता से मिलता-जुलता है |
| उच्च संख्या किससे ट्रिगर होती है | लंबे उद्धरण, सामान्य क्षेत्र-विशिष्ट वाक्यांश, पुन: उपयोग की गई सामग्री, या किसी पूर्व सबमिशन से मेल | पूरे दस्तावेज़ में समान वाक्य-लय और लगातार पूर्वानुमेय शब्द-चयन |
| उच्च संख्या क्या सिद्ध नहीं करती | कि मेल खाया हुआ पाठ अनुचित रूप से उपयोग किया गया था। सही ढंग से उद्धृत सामग्री भी मेल के रूप में दर्ज हो सकती है। | कि कोई एकल वाक्य AI द्वारा जनित था। वर्गीकारक दस्तावेज़ के समग्र पैटर्न को पढ़ता है, किसी एक पंक्ति को अलग से नहीं। |
क्या किसी पेपर में 0 Percent समानता और 90 Percent AI स्कोर हो सकता है?
हाँ, और यह संयोजन कोई गड़बड़ी नहीं है। दोनों स्कोर अलग-अलग प्रश्नों का उत्तर देते हैं, इसलिए उच्च और निम्न के सभी चार संयोजन संभव हैं, और उनमें से प्रत्येक यह बताता है कि पाठ कैसे तैयार किया गया था।
- कम समानता, कम AI स्कोर: सामान्य मौलिक लेखन, जो मानवीय विविधता के साथ पढ़ा जाता है। अधिकांश वास्तविक छात्र-कार्य में यही सामान्य स्थिति होती है।
- कम समानता, उच्च AI स्कोर: मौलिक वाक्य, जो कहीं से नकल नहीं किए गए हैं, लेकिन सांख्यिकीय रूप से पूर्वानुमेय लगते हैं, जैसा कि जनित पाठ प्रायः लगता है। यह बिना संपादन के AI लेखन की पहचान है, जिसे किसी ने किसी मौजूदा स्रोत से paraphrase नहीं किया।
- उच्च समानता, कम AI स्कोर: ऐसा पाठ जो किसी मौजूदा मानव-लिखित स्रोत से निकटता से मेल खाता है, बिना उस सांख्यिकीय सपाटपन के जिसे वर्गीकारक जनन से जोड़ता है। नकल किया गया पाठ, जिसे नया उपकरण नहीं बल्कि पुराना उपकरण पकड़ लेता है।
- उच्च समानता, उच्च AI स्कोर: ऐसा पाठ जो किसी मौजूदा स्रोत से मेल खाता है, और वह स्रोत स्वयं AI-जनित था, उदाहरण के लिए पहले से सबमिट किया गया AI-लिखित पेपर या AI-उत्पादित पाठ का कोई पृष्ठ जो पहले से खुले वेब से अनुक्रमित है।
इन संयोजनों में से किसी के लिए भी सॉफ़्टवेयर पक्ष पर कुछ असामान्य आवश्यक नहीं है। वे इस तथ्य से निकलते हैं कि एक प्रणाली मिलान की जाँच करती है और दूसरी पैटर्न की, और पाठ का एक अंश इनमें से कोई भी गुण, दोनों, या कोई भी नहीं, धारण कर सकता है।
एक उच्च AI स्कोर क्या सिद्ध करता है, और क्या सिद्ध नहीं करता
एक उच्च AI स्कोर एक सांख्यिकीय अनुमान है, पाठ से निकाला गया स्वीकारोक्ति नहीं। यह कहता है कि वर्गीकारक के सामने रखा गद्य, अपने शब्द-चयन और लय में, उस प्रकार के लेखन से मिलता-जुलता है जिसे मॉडल को AI जनरेशन से जोड़ना सिखाया गया था। यह किसी विशिष्ट वाक्य को निश्चित रूप से मशीन-लिखित नहीं ठहराता, और यह दस्तावेज़ वास्तव में कैसे तैयार किया गया था, इसके बारे में कुछ नहीं जानता, केवल यह कि पूर्ण होने के बाद वह कैसा पढ़ता है। TextPulse अपने स्वयं के संख्याओं के बारे में वही स्थिति लेता है, वह जो रिपोर्ट करता है वह उसके सामने रखे पाठ से गणना किया गया एक अनुमानित Human Score है, न कि इस बारे में कोई निर्णय कि किस उपकरण ने, यदि किसी ने, दस्तावेज़ को छुआ था।
किसी भी संख्या, कम समानता स्कोर या उच्च AI स्कोर, पर व्यावहारिक प्रतिक्रिया एक ही है, इसे और करीब से देखने का कारण मानें, न कि ऐसी खोज जिसे पहली नज़र में स्वीकार या अस्वीकार कर दिया जाए। मसौदे, नोट्स, और संस्करण इतिहास इस बात के बारे में बताते हैं कि दस्तावेज़ वास्तव में कैसे लिखा गया था, जिस तरह कोई प्रतिशत कभी नहीं बता सकता, किसी भी रिपोर्ट पर। जो कोई यह जानना चाहता है कि एक वर्गीकारक वास्तव में अपने ही मसौदे में किस पर प्रतिक्रिया कर रहा है, वह किसी भी रिपोर्ट के बनने से बहुत पहले, free perplexity checker के साथ वही शब्द-स्तरीय पैटर्न स्वयं देख सकता है।
TextPulse का free tools collection उन अन्य सांख्यिकीय स्तरों को कवर करता है जिनकी जाँच करना उचित है, इससे पहले कि कोई मसौदा किसी प्रशिक्षक के पास जाए, न कि केवल यहाँ तुलना किए गए दो को।
एक बार जब दोनों संख्याएँ अलग कर दी जाती हैं, अगला प्रश्न यह है कि एक अच्छा Turnitin स्कोर क्या माना जाता है। दूसरे डिटेक्टर के लिए जिससे छात्र सबसे अधिक मिलते हैं, GPTZero कैसे काम करता है अपने अलग पृष्ठ पर समझाया गया है।
दोनों संख्याएँ एक ही रिपोर्ट में एक-दूसरे के पास ही बनी रहेंगी, और जल्दबाजी में पढ़ने वाले लोग उन्हें एक ही संख्या के रूप में पढ़ते रहेंगे। यह जानना कि इनमें से प्रत्येक वास्तव में किस प्रश्न का उत्तर दे रही है, एक उलझाने वाले प्रतिशत-युग्म को दो अलग, उपयोगी सूचनाओं में बदल देता है।
अक्सर पूछे जाने वाले प्रश्न
Turnitin समानता बनाम AI स्कोर इस बात पर निर्भर करता है कि प्रत्येक क्या जाँचता है। समानता स्कोर यह रिपोर्ट करता है कि किसी प्रस्तुति का कितना भाग Turnitin के वेब पृष्ठों, प्रकाशनों, और पिछले छात्र पत्रों के डेटाबेस में पहले से मौजूद पाठ से मेल खाता है। AI स्कोर एक अलग, स्वतंत्र माप है, जो यह अनुमान लगाता है कि गद्य मशीन-जनित कितना प्रतीत होता है, और इसका किसी भी डेटाबेस से कोई संदर्भ नहीं होता। Turnitin के अपने दस्तावेज़ कहते हैं कि ये दोनों आँकड़े एक-दूसरे को प्रभावित नहीं करते।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.