Turnitin गलत-सकारात्मक दर: संख्याएँ क्या कहती हैं
Turnitin दो गलत-सकारात्मक आँकड़े प्रकाशित करता है, एक नहीं, और इनमें से कोई भी उस कागज़ का वर्णन नहीं करता जो किसी विशेष प्रोफेसर के सामने रखा है। यहाँ दस्तावेज़-स्तर बनाम वाक्य-स्तर का विभाजन, 20% से कम वाला तारांकन चिह्न, और वह गणना है जो प्रतिशत के एक अंश को छात्रों की वास्तविक संख्या में बदल देती है।
Turnitin की false positive दर एक ही संख्या नहीं है। कंपनी दो संख्याएँ प्रकाशित करती है, दस्तावेज़ स्तर पर 1 प्रतिशत से कम का आँकड़ा, और वाक्य स्तर पर लगभग 4 प्रतिशत का आँकड़ा। दोनों वास्तविक हैं, दोनों प्रकाशित हैं, और इनमें से कोई भी अकेले अपने सामने रखे गए किसी विशिष्ट प्रोफेसर के सामने पड़े किसी विशिष्ट शोधपत्र के बारे में बहुत कुछ नहीं बताता।
इन दो आँकड़ों के बीच का अंतर, और जब इनमें से किसी एक को किसी एकल दस्तावेज़ के बजाय वास्तविक कक्षा पर लागू किया जाता है तो क्या होता है, यही इस लेख में समझाया गया है, Turnitin स्वयं क्या कहता है, ये दो संख्याएँ वास्तव में क्या कवर करती हैं, और वह गणना जो प्रतिशत के एक अंश को छात्रों की वास्तविक संख्या में बदल देती है।
Turnitin के अनुसार, Turnitin की false positive दर क्या है?
दस्तावेज़ स्तर पर, कंपनी के अपने शब्दों में: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." यह शर्त संख्या जितनी ही महत्वपूर्ण है। 1 प्रतिशत से कम का आँकड़ा हर उस शोधपत्र के बारे में दावा नहीं है जिसे Turnitin स्कोर करता है। यह केवल उन शोधपत्रों के उपसमूह का वर्णन करता है जो मॉडल के अपने अनुमान में पहले ही 20 प्रतिशत AI-written सीमा पार कर चुके हैं।
वाक्य स्तर पर, जहाँ एक interface पूरे दस्तावेज़ के बजाय अलग-अलग पंक्तियों को highlight करता है, Turnitin का अपना आँकड़ा लगभग चार गुना अधिक है। "Our sentence-level false positive rate is around 4%," कंपनी कहती है। "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin जोड़ता है कि ये गलत वाक्य यादृच्छिक रूप से नहीं बिखरते: 54 प्रतिशत बार, गलत रूप से flagged किया गया वाक्य तुरंत वास्तविक AI writing के बगल में होता है, जिसे कंपनी पूरे दस्तावेज़ के score के किसी एक highlighted line की तुलना में बेहतर टिके रहने के कारण के हिस्से के रूप में प्रस्तुत करती है।
दस्तावेज़-स्तर और वाक्य-स्तर एक ही दावा नहीं हैं
यह दो-स्तरीय विभाजन संशोधित संदेश है, Turnitin की मूल स्थिति नहीं। अप्रैल 2023 में लॉन्च के समय, कंपनी ने दस्तावेज़ और वाक्य के बीच किसी भी भेद के बिना 1 प्रतिशत से कम का एकल आंकड़ा प्रकाशित किया था। संस्थानों ने जब उस संख्या का हवाला देना शुरू किया और शिक्षा प्रेस ने अपेक्षा से अधिक वास्तविक-विश्व झूठे सकारात्मक परिणामों की रिपोर्ट की, तब Turnitin के मुख्य उत्पाद अधिकारी ने ऊपर उपयोग किए गए विभाजन को प्रकाशित किया, साथ ही प्रतिक्रिया में किए गए दो उत्पाद परिवर्तनों के साथ, न्यूनतम अंकनीय दस्तावेज़ लंबाई को 150 से बढ़ाकर 300 शब्द करना, और दस्तावेज़ में आरंभिक तथा अंतिम वाक्यों के अंकन के तरीके को बदलना।
300-शब्द की न्यूनतम सीमा एक संबंधित कारण से मौजूद है। Turnitin ने इसे मूल 150-शब्द न्यूनतम से बढ़ाया, जब कंपनी के अपने शब्दों में, उसने पाया कि अधिक पाठ के साथ सटीकता बढ़ती है। एक छोटा सबमिशन, एक-पृष्ठीय चिंतन, एक आंशिक मसौदा, एक चर्चा पोस्ट, मॉडल को काम करने के लिए कम संकेत देता है, जितने के विरुद्ध ऊपर दिए गए झूठे सकारात्मक आंकड़े मापे गए थे, और यही कारण है कि उस न्यूनतम सीमा से नीचे की किसी भी चीज़ को बिल्कुल भी AI स्कोर नहीं मिलता, न कि एक अविश्वसनीय स्कोर।
| स्तर | Turnitin की बताई गई दर | यह वास्तव में क्या कवर करती है |
|---|---|---|
| दस्तावेज़-स्तर | 1% से कम | केवल वे दस्तावेज़ जो पहले से 20% या अधिक AI-लिखित के रूप में चिह्नित हैं, पूरे सबमिशन के लिए समग्र प्रतिशत |
| वाक्य-स्तर | लगभग 4% | AI लेखन रिपोर्ट के भीतर हाइलाइट किया गया कोई भी व्यक्तिगत वाक्य, दस्तावेज़ के समग्र स्कोर की परवाह किए बिना |
| 20% दस्तावेज़ सीमा से नीचे | कोई संख्या नहीं दिखाई जाती | Turnitin प्रतिशत के बजाय एक तारांकन चिह्न प्रदर्शित करता है, जो उस सीमा पर परिणाम को कम विश्वसनीय के रूप में चिह्नित करता है |
अपने पेपर को मानवीय बनाइए
अपने AI-सहायता प्राप्त पाठ को रूपांतरित करें और उसे मानवीय ध्वनि दें, महत्वपूर्ण शब्दों या उद्धरणों को छेड़े बिना।
गणना, एक प्रतिशत के अंश का वास्तविक समूह के लिए क्या अर्थ है
गणना सार्वजनिक रूप से तब की गई थी जब Vanderbilt University ने अगस्त 2023 में Turnitin की AI पहचान से संबद्ध त्रुटि दरों की गणना की। यह गणना कैसे की जाए, इसका सबसे अच्छा उदाहरण Vanderbilt की अपनी संख्याओं की व्याख्या है। Turnitin के AI detector को बंद करने के अपने निर्णय पर एक ब्लॉग पोस्ट में, उन्होंने लिखा, "[i]n 2022 हमने लगभग 75,000 papers Turnitin को जमा किए, जिसका अर्थ है कि Turnitin की घोषित 1 percent false positive rate का मतलब है कि लगभग 750 student papers को गलती से ऐसा लेबल दिया जा सकता था कि उनका कुछ भाग AI द्वारा लिखा गया है।"
यह आंकड़ा Vanderbilt की अपनी मात्रा पर लागू vendor के प्रकाशित number से की गई अपनी ही extrapolation है, न कि अलग से मापा गया परिणाम। इस गणना का स्वरूप एक university की headcount से आगे भी सामान्यीकृत होता है। कुछ सौ papers पर लागू sub-1-percent rate कुछ गलत रूप से चिह्नित students उत्पन्न करता है, जिन्हें आसानी से अनदेखा किया जा सकता है। वही rate जब tens of thousands of papers पर लागू होता है, जो वास्तविक university हर वर्ष जमा करती है, तो कुछ के बजाय hundreds उत्पन्न करता है, क्योंकि एक छोटा percentage और एक बड़ी population को अलग-अलग विचार करने के बजाय एक साथ गुणा किया जा रहा है।
इनमें से कोई भी बात यह सिद्ध नहीं करती कि वास्तविक दुनिया की rate प्रयोगशाला के figure से बिल्कुल मेल खाती है। Turnitin के chief product officer ने स्वयं सार्वजनिक रूप से स्वीकार किया है कि वास्तविक दुनिया के परिणाम lab testing से भिन्न होते हैं, और यही कारणों में से एक है कि कंपनी ने सबसे पहले अपना messaging संशोधित किया। ऊपर की गणना Turnitin के अपने stated number को एक ऐसे input के रूप में लेती है जिसे गंभीरता से लेना चाहिए, न कि उस पर एक ceiling के रूप में जो वास्तव में तब होता है जब कोई tool submissions को score कर रहा होता है जो किसी curated benchmark जैसे बिल्कुल नहीं दिखते।
दर क्या शामिल नहीं करती
20 प्रतिशत की सीमा से नीचे आने वाले परिणाम के साथ कोई छोटा प्रतिशत नहीं जोड़ा जाता। उसके स्थान पर एक संख्या के बजाय एक तारांकन चिह्न दिया जाता है, यह Turnitin का लिया हुआ निर्णय है क्योंकि वह सीमा वह क्षेत्र है जहाँ उपकरण दोनों दिशाओं में सबसे कम विश्वसनीय होता है, और स्वतंत्र शिक्षा-प्रेस रिपोर्टिंग तथा उस सीमा पर कंपनी की अपनी कम-विश्वास वाली प्रस्तुति, दोनों से इसकी पुष्टि होती है। एक हल्का संपादन, जिसमें एक अनुच्छेद सहायता से संशोधित किया गया हो और शेष बिना सहायता के लिखा गया हो, बिल्कुल कोई दृश्य स्कोर भी नहीं दे सकता, न कि एक छोटा स्कोर, और यह जानना उपयोगी है, इससे पहले कि किसी अनुपस्थित संख्या को या तो आरोप या पूर्णतः स्वस्थ होने का प्रमाण मान लिया जाए। TextPulse की एक अच्छा Turnitin स्कोर क्या माना जाता है, इस पर मार्गदर्शिका रिपोर्ट के पाठक-पक्ष से उसी सीमा को समझाती है।
तो प्रकाशित false positive rate को कैसे पढ़ा जाना चाहिए?
इसे विक्रेता के उस आंकड़े के रूप में पढ़ा जाना चाहिए जो उस अपेक्षाकृत संकीर्ण स्थिति के बारे में है, जितना वह पहली नज़र में बताता हुआ प्रतीत होता है, न कि उस शोध-पत्र के बारे में जो किसी विशेष प्रोफेसर के सामने रखा है। Turnitin अपने आउटपुट को भी इसी तरह प्रस्तुत करता है: कंपनी स्पष्ट रूप से कहती है कि उसकी AI writing detection technology "a determination of misconduct" नहीं देती, केवल "data for educators to make an informed decision." क्या AI detectors वास्तव में accurate हैं पर व्यापक साक्ष्य भी इसी व्याख्या का समर्थन करते हैं: प्रकाशित rate एक benchmark का वर्णन करता है, न कि उस दस्तावेज़ का जो वर्तमान में मूल्यांकित किया जा रहा है।
जो लेखक यह जानना चाहते हैं कि उनका अपना draft उसी प्रकार के सांख्यिकीय मापन पर कहाँ स्थित है, अनुमान लगाने के बजाय, वे किसी institution के detector तक पहुँचने से पहले ही इसे सीधे एक free perplexity checker से जाँच सकते हैं। यह technology का एक अलग उपयोग है, उस स्थिति से अलग जिसमें बाद में किसी score पर बहस की जाए, और यही वह एक स्थान है जहाँ लेखक, administrator के बजाय, संख्या पहले देख सकता है।
जिनके institution में इसके बजाय यह उपयोग होता है, उनके लिए ZeroGPT की accuracy का अलग से परीक्षण किया गया है। जिन पर ये errors सबसे अधिक पड़ते हैं, वे non-native English writers हैं, और यह विषय अपने अलग पृष्ठ पर है।
इस गणना के लिए सबसे अधिक उजागर जनसंख्या भी समान रूप से वितरित नहीं है। गैर-देशी अंग्रेज़ी लेखक किसी भी इन प्रतिशतों के गलत पक्ष में आने के सबसे बड़े प्रलेखित जोखिम को वहन करते हैं, और यही वह पाठकवर्ग है जिसके लिए TextPulse का ESL शैक्षणिक लेखकों के लिए पृष्ठ बनाया गया है। Turnitin अपने मॉडल को पुनः प्रशिक्षित करते समय इन आँकड़ों को संशोधित करता रहेगा। जो नहीं बदलेगा, वह स्वयं गणना है, इतनी छोटी दर को लुप्त होने के लिए इतनी बड़ी जनसंख्या की आवश्यकता होती है, और अधिकांश वास्तविक प्रस्तुतियाँ इतनी भाग्यशाली नहीं होतीं।
अक्सर पूछे जाने वाले प्रश्न
Turnitin की गलत-सकारात्मक दर, कंपनी के अपने प्रकाशित आँकड़ों के अनुसार, एक एकल संख्या नहीं है। दस्तावेज़-स्तर पर, Turnitin 1 प्रतिशत से कम की दर बताता है, लेकिन केवल उन दस्तावेज़ों के लिए जिन्हें पहले ही 20 प्रतिशत या अधिक AI-written के रूप में चिह्नित किया गया हो। वाक्य-स्तर पर, जहाँ अलग-अलग पंक्तियाँ हाइलाइट की जाती हैं, कंपनी का अपना आँकड़ा लगभग 4 प्रतिशत है।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.