AI Detection

Turnitin स्कोर अच्छा क्या है?

Turnitin कोई स्वीकार्य समानता प्रतिशत प्रकाशित नहीं करता, और संस्थान इसके बजाय अपना मार्गदर्शन स्वयं तय करते हैं। यह पोस्ट बताती है कि वास्तव में उच्च या निम्न स्कोर को क्या संचालित करता है, उद्धृत सामग्री और संदर्भ सूचियाँ बिना किसी त्रुटि के भी इसे क्यों बढ़ा देती हैं, और संख्या के बजाय संख्या के पीछे के मिलान विभाजन को कैसे पढ़ा जाए।

अद्यतन दिनांक 6 min
What is a good Turnitin score? A similarity report broken into matched sources rather than one number.

एक छात्र को एक पर्यवेक्षक द्वारा बताया जाता है कि पंद्रह प्रतिशत से कम कुछ भी ठीक है। उसी विभाग में एक अन्य छात्र का पेपर बारह प्रतिशत पर गलियारे में चिह्नित कर दिया जाता है, क्योंकि उन अंकों में से तीन एक ही अविच्छिन्न अनुच्छेद के भीतर आते हैं, और उसके पास कोई उद्धरण चिह्न नहीं हैं। दोनों ने Turnitin के similarity score को सही ढंग से पढ़ा। यह उपकरण शुरू से ही एकल पास या फेल संख्या देने के लिए बनाया ही नहीं गया था।

तो एक अच्छा Turnitin score क्या है? ऐसी कोई संख्या नहीं है। Turnitin कोई स्वीकार्य प्रतिशत प्रकाशित नहीं करता, किसी प्रस्तुति को अंक नहीं देता, और स्पष्ट रूप से कहता है कि यह आंकड़ा अपने आप में plagiarism का माप नहीं है। प्रत्येक संस्था अपनी स्वयं की मार्गदर्शिका तय करती है, और अक्सर उसके भीतर प्रत्येक पर्यवेक्षक भी ऐसा ही करता है, इसलिए वही रिपोर्ट एक कार्यालय में साधारण और अगले में चिंताजनक दिख सकती है। सीखने योग्य संख्या यह है कि उसके पीछे क्या है, उसे कैसे पढ़ा जाए।

Turnitin similarity report showing 12% overall similarity with match groups for uncited matches and missing quotations, and top sources split across internet, publications and student papers
12% similarity report, match groups में विभाजित: महत्वपूर्ण headline number नहीं, बल्कि यह है कि उसका कितना भाग बिना उद्धरण वाला matching text है, और कितना quoted तथा referenced material है।

एक अच्छा Turnitin score क्या है?

Turnitin ने कभी कोई ऐसी संख्या प्रकाशित नहीं की है जिसे अच्छा, सुरक्षित या स्वीकार्य माना जाए, और इसका एक विशिष्ट कारण है: similarity score यह मापता है कि किसी प्रस्तुति का कितना पाठ पहले से Turnitin के databases में मौजूद पाठ से मेल खाता है, यह नहीं कि उस overlap का उपयोग अनुचित रूप से किया गया था या नहीं। एक उच्च score पूरी तरह उस सामग्री से भी आ सकता है जो सही ढंग से quoted और cited है। एक निम्न score उस paper से ऊपर भी हो सकता है जो एक source का इतनी निकटता से paraphrase करता है कि examiner को चिंता हो जाए, और फिर भी matching engine को बिल्कुल सक्रिय न करे। संख्या को grade की तरह पढ़ना tool को उल्टा समझना है।

दस से बीस प्रतिशत जैसा एक आंकड़ा अनौपचारिक नियम के रूप में व्यापक रूप से प्रचलित है, जिसे मंचों और अध्ययन मार्गदर्शिकाओं में बार बार दोहराया जाता है, जब तक कि वह आधिकारिक लगने न लगे। यह आधिकारिक नहीं है। Turnitin ऐसा कोई आंकड़ा निर्धारित नहीं करता, और ऐसा नियम जो दस्तावेज़ की लंबाई, उद्धरण घनत्व और क्षेत्रीय परंपरा को अनदेखा करता है, वास्तविक शोधपत्र से सामना होते ही विफल हो जाता है। तीस उचित रूप से उद्धृत स्रोतों से बनी एक साहित्य समीक्षा केवल उद्धरणों के आधार पर 20 प्रतिशत से ऊपर जा सकती है। बिना उद्धरण चिह्नों के एक अकेला, निकटता से पुनर्परिभाषित अनुच्छेद 5 प्रतिशत से नीचे रह सकता है और फिर भी अधिक गंभीर समस्या हो सकता है।

समानता स्कोर वास्तव में क्या मापता है

Turnitin अपने उपकरण का वर्णन लगभग इन्हीं शब्दों में करता है। Boise State University से प्राप्त मार्गदर्शन, जो Turnitin की अपनी भाषा पर आधारित है, स्पष्ट करता है कि समानता स्कोर किसी शोधपत्र की सामग्री का वह प्रतिशत है जो Turnitin के डेटाबेस में पहले से मौजूद सामग्री से मेल खाता है, और यह प्रतिशत स्वयं इस बात का आकलन नहीं है कि शोधपत्र में साहित्यिक चोरी की गई सामग्री है या नहीं। यह भेद वास्तव में महत्वपूर्ण है, मेल खाना एक यांत्रिक प्रक्रिया है, शब्दों की एक शृंखला का कहीं और शब्दों की एक शृंखला से संरेखित होना, और यह तय करना कि वह ओवरलैप उचित रूप से श्रेयित था या नहीं, किसी व्यक्ति का काम है, किसी एल्गोरिदम का नहीं।

मेल के पीछे मौजूद डेटाबेस जानबूझकर व्यापक हैं, वर्तमान और संग्रहीत छात्र प्रस्तुतियाँ, खुला वेब, और शैक्षणिक प्रकाशनों का एक बड़ा संग्रह। उस सामग्री को अर्थ के लिए नहीं पढ़ा जाता। प्रणाली शब्दों की ओवरलैपिंग शृंखलाएँ खोजती है और रिपोर्ट करती है कि वे किसी प्रस्तुति के कितने हिस्से को कवर करती हैं, इसी कारण उद्धृत वाक्य और चुपचाप कॉपी किया गया वाक्य एक समान मेल उत्पन्न कर सकते हैं। केवल रिपोर्ट का विस्तृत दृश्य ही दिखाता है कि कौन सा कौन है।

उच्च स्कोर पूरी तरह वैध क्यों हो सकता है

शैक्षणिक लेखन की दो सामान्य विशेषताएँ इसका अधिकांश भाग समझाती हैं। उद्धृत अंश डिज़ाइन के अनुसार मेल खाते हैं, क्योंकि शब्द जानबूझकर कॉपी किए जाते हैं और पृष्ठ पर किसी और के रूप में चिह्नित होते हैं। संदर्भ सूचियाँ भी उतनी ही विश्वसनीयता से मेल खाती हैं, क्योंकि लेखक के नाम, जर्नल शीर्षक और उद्धरण प्रारूप समान स्रोतों का हवाला देने वाले हजारों अन्य शोधपत्रों में दोहराए जाते हैं। दोनों वही हैं जैसा सही शैक्षणिक लेखन को दिखना चाहिए।

साथ-साथ रखने पर, एक बढ़ा-चढ़ा स्कोर और एक वास्तविक समस्या पहली नज़र में अलग दिखते हैं।

क्या मेल खायाऐसा क्यों हुआक्या इसे और ध्यान से देखना चाहिए?
उद्धरण चिह्नों और एक संदर्भ के साथ एक उद्धृत अंशशब्द जानबूझकर कॉपी किए गए थे और पृष्ठ पर श्रेय दिया गया थानहीं, सही उद्धरण ऐसा ही दिखता है
एक संदर्भ सूची या ग्रंथसूचीलेखक के नाम, पत्रिका शीर्षक और उद्धरण प्रारूप कई अन्य शोधपत्रों में दोहराए जाते हैंनहीं, जब तक कि बहिष्करण सेटिंग लागू नहीं की गई थी
मानक विधियाँ या प्रक्रियात्मक वाक्यांशकिसी क्षेत्र की साझा शब्दावली कई शोधपत्रों में एक ही प्रक्रिया का वर्णन एक ही तरह से करती हैकभी-कभार, जब तक कि पूरा खंड नए सिरे से लिखने के बजाय उठा न लिया गया हो
एक लंबा, बिना टूटे अनुच्छेद, जिसमें कोई उद्धरण चिह्न नहीं हैं, और जो एक ही स्रोत से मेल खाता हैशब्दावली किसी अन्य लेखक के वाक्य के इतनी निकटता से अनुसरण करती है कि मिलान इंजन उसे पकड़ लेता हैहाँ, यही वह पैटर्न है जिसके लिए स्रोत खोलकर जाँच करनी चाहिए

अपने पेपर को मानवीय बनाइए

अपने AI-सहायता प्राप्त पाठ को रूपांतरित करें और उसे मानवीय ध्वनि दें, महत्वपूर्ण शब्दों या उद्धरणों को छेड़े बिना।

मुफ़्त में शुरू करें

कम स्कोर फिर भी समस्या को कैसे छिपा सकता है

एक कम संख्या उससे अधिक संकीर्ण प्रश्न का उत्तर देती है जितना वह प्रतीत होती है, यह कि क्या थोड़ा-सा पाठ Turnitin के डेटाबेस के साथ शब्दशः मेल खाता है, इससे अधिक कुछ नहीं। एक ऐसा पुनर्प्रस्तुतीकरण जो किसी अन्य लेखक की संरचना और तर्क को जस का तस रखते हुए शब्दावली को पर्याप्त बदल देता है, शून्य के करीब स्कोर कर सकता है और फिर भी गंभीर अकादमिक अखंडता की समस्या हो सकता है, क्योंकि इंजन उधार लिए गए विचारों पर नहीं, बल्कि शब्दों की शृंखलाओं पर काम करता है। अनूदित सामग्री, या Turnitin के अनुक्रमित डेटाबेस के बाहर की सामग्री, भी इसी तरह व्यवहार करती है, मेल खाने के लिए कुछ नहीं, चिह्नित करने के लिए कुछ नहीं।

गढ़े गए स्रोत एक अलग दिशा से वही अंधा क्षेत्र उत्पन्न करते हैं। जो संदर्भ अस्तित्व में ही नहीं है, वह किसी भी चीज़ से मेल नहीं खा सकता, क्योंकि उसके लिए कहीं भी तुलना करने को कुछ नहीं है, और समानता स्कोर के पास ऐसे उद्धरण को चिह्नित करने का कोई तरीका नहीं होता जो शुरू से कभी वास्तविक था ही नहीं। TextPulse का मुफ़्त AI citation checker ठीक इसी अंतराल के लिए मौजूद है: यह संदर्भ सूची की प्रत्येक प्रविष्टि को उन वास्तविक रजिस्ट्रियों के विरुद्ध मिलाता है जिनमें उन स्रोतों का होना अपेक्षित है, इससे पहले कि पाठक को उस अंतर को कठिन तरीके से स्वयं खोजना पड़े।

संख्या को पूरी तरह छोड़ने से पहले एक और भेद करना उचित है। कम समानता स्कोर वाली प्रस्तुति में फिर भी Turnitin का अलग AI लेखन संकेतक हो सकता है, जो एक भिन्न माप है और एक भिन्न प्रकार की समस्या को पकड़ने के लिए बनाया गया है, जिसका उल्लेख इस साइट की इस मार्गदर्शिका में है कि क्या Turnitin वास्तव में ChatGPT का पता लगा सकता है। ये दोनों प्रतिशत एक ही तरीके से नहीं निकाले जाते, और यह लेख केवल समानता स्कोर पर केंद्रित है।

संख्या के बजाय रिपोर्ट को कैसे पढ़ें

मिलान विवरण खोलने से पहले कुल परिणाम पर प्रतिक्रिया न दें। Turnitin व्यक्ति स्रोतों को, जो एक स्कोर बनाते हैं, उसमें उनके योगदान के क्रम में रैंक करेगा। 22 प्रतिशत का कुल, जो 11 स्रोतों से बना हो और जिनमें से प्रत्येक 2 प्रतिशत योगदान दे, उस कुल की तरह नहीं पढ़ा जाता जो एक ही स्रोत से बना हो। पहला पैटर्न सामान्य वाक्यांशों में व्यापक ओवरलैप को अधिक दर्शाता है। दूसरा उस स्रोत ने वास्तव में क्या कहा है, इस पर सीधे ध्यान देने योग्य है।

Turnitin उसी प्रतिशत को एक रंग-श्रेणी में भी वर्गीकृत करता है, जैसा कि Loughborough College के छात्रों के लिए अपने स्वयं के मार्गदर्शन में पुनरुत्पादित है: बिना मिलते पाठ के लिए नीला, 1 शब्द से 24 प्रतिशत तक के लिए हरा, 25 से 49 तक पीला, 50 से 74 तक नारंगी, 75 और उससे ऊपर के लिए लाल। कॉलेज का अपना मार्गदर्शन इस बारे में स्पष्ट है कि रंग क्या नहीं दर्शाते: समानता जाँच का अर्थ यह नहीं है कि किसी प्रस्तुति में साहित्यिक चोरी की गई सामग्री है। रंग एक रिपोर्ट को ध्यान के लिए व्यवस्थित करता है, निर्णय के लिए नहीं।

यह जाँचने योग्य भी है कि क्या किसी संस्थान की अपनी सेटिंग्स उद्धरणों और ग्रंथसूची को गणना से बाहर करती हैं, क्योंकि एक ही सबमिशन उस टॉगल के सेट होने के तरीके के आधार पर दो अलग-अलग संख्याएँ दे सकता है। यह सब एक बार दिखाई देने पर जटिल नहीं रहता। यह केवल तब अदृश्य होता है जब कोई भी रिपोर्ट को उसके पहले पृष्ठ से आगे नहीं खोलता।

यदि आपका स्कोर आपको चौंकाए तो क्या करें

संयुक्त कुल पर प्रतिक्रिया देने के बजाय प्रत्येक चिह्नित स्रोत को अलग-अलग फिर से खोलें। यह पुष्टि करें कि जिस संस्करण का मूल्यांकन किया जा रहा है, उसमें उद्धरण और ग्रंथसूची को बाहर रखा गया है या नहीं, क्योंकि छात्र को मसौदा तैयार करते समय जो संख्या दिखती है, वह हमेशा उसी तरह विन्यस्त नहीं होती जिस तरह सबमिशन के समय प्रशिक्षक को दिखने वाली संख्या होती है। जहाँ कोई वास्तविक बिना श्रेय का मेल मिलता है, वहाँ वाक्यों को पुनः शब्दबद्ध करके matching engine से बचने की कोशिश करने के बजाय उद्धरण को सीधे ठीक करें, क्योंकि ऐसा करने से केवल लक्षण का उपचार होता है और समस्या बनी रहती है।

यदि संख्या अभी भी किसी पर्यवेक्षक की अपेक्षा से मेल नहीं खाती, तो सीधे पूछें कि उस विभाग की अपनी परंपरा क्या है। ऊपर के खंड पहले ही दिखा चुके हैं कि कोई एक निश्चित सीमा नहीं है, इसलिए उत्तर उस व्यक्ति के पास है जिसके पास असाइनमेंट पर स्थानीय अधिकार है, न कि किसी ऐसे प्रतिशत के पास जिसे कोई पहले से देख सकता था। TextPulse की free tools collection उन उद्धरण और मसौदा जाँचों को कवर करती है जिन्हें रिपोर्ट किसी और के inbox तक पहुँचने से पहले चलाना उचित है।

विभिन्न tools के स्कोर परस्पर विनिमेय नहीं होते, और GPTZero कैसे काम करता है अपने अलग पृष्ठ पर समझाया गया है, साथ ही वह perplexity सांख्यिकी भी, जो दोनों के नीचे स्थित है

स्कोर जिस तरह व्यवहार करता है, वह उसके नीचे चलने वाले matching के तरीके के कारण है, और उसी report में उसके बगल में अब दिखाई देने वाली नई संख्या एक अलग mechanism पर काम करती है, वह जिसे इस site की AI detectors वास्तव में कैसे काम करते हैं, इस पर guide पूरी तरह से स्पष्ट करती है। किसी भी संख्या को verdict के रूप में पढ़ना report के उस एकमात्र हिस्से को छोड़ देना है जिसे पढ़ना वास्तव में सार्थक है।

XLinkedInFacebook

अक्सर पूछे जाने वाले प्रश्न

Turnitin स्कोर अच्छा क्या है? ऐसी कोई संख्या नहीं है। Turnitin कोई स्वीकार्य प्रतिशत प्रकाशित नहीं करता, और समानता स्कोर यह मापता है कि उसका डेटाबेस के साथ कितना पाठ मेल खाता है, यह नहीं कि कितना साहित्यिक चोरी किया गया था। उचित रूप से उद्धृत साहित्य समीक्षा केवल उद्धरणों के कारण बीस प्रतिशत से अधिक हो सकती है, जबकि एक अकेला बिना श्रेय दिया गया पुनर्प्रस्तुतीकरण पाँच से कम रह सकता है। शीर्षक आंकड़े के बजाय मेल खाने वाले स्रोतों को पढ़ें।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI मानवीकरण पर अपडेट रहें

शैक्षणिक लेखन, AI पहचान, और मानवीकरण के सुझाव सीधे अपने इनबॉक्स में प्राप्त करें।

कोई स्पैम नहीं। कभी भी सदस्यता समाप्त करें।