Academic Writing

AI-लिखित एनोटेशन उन शोधपत्रों का वर्णन क्यों करते हैं जो अस्तित्व में नहीं हैं

एक गढ़ा हुआ संदर्भ तब तक बिल्कुल वास्तविक जैसा दिख सकता है, जब तक कोई उसे खोज न ले। उसके नीचे का एनोटेशन नकली बनाना अधिक कठिन है: एक प्रवाहपूर्ण अनुच्छेद, जो किसी ऐसे शोधपत्र की विधि और निष्कर्षों का विस्तार से वर्णन करता है, जिसे किसी ने लिखा ही नहीं.

5 min
Table showing how ai hallucinated citations in bibliographies differ from genuine ones

एक पर्यवेक्षक एक ही वाक्य-रूप को लगातार 10 बार पढ़ता है, एक एनोटेटेड बिब्लियोग्राफी खोलते हुए, उसे ज़ोर से पढ़ते हुए, एक पृष्ठ के बाद दूसरा पृष्ठ: यह अध्ययन X और Y के बीच संबंध की जांच करता है, प्रतिभागियों के एक नमूने का उपयोग करके Z का अन्वेषण करता है, और पाता है कि आगे शोध की आवश्यकता है। सभी प्रविष्टियाँ धाराप्रवाह पढ़ी जाती हैं। शीर्षक से खोजे गए 12 स्रोतों में से 2 मौजूद नहीं हैं।

बिब्लियोग्राफियों में AI द्वारा गढ़े गए उद्धरण प्रायः संदर्भ पंक्ति में स्वयं को प्रकट नहीं करते। एक गढ़ा हुआ लेखक-नाम और एक गढ़ी हुई पत्रिका तब तक बिल्कुल वास्तविक जैसी दिख सकती हैं, जब तक कोई उन्हें खोज न ले। यह गढ़ंत को सबसे पहले, लगभग हर बार, जो उजागर करता है, वह है उसके नीचे मौजूद एनोटेशन, एक ऐसा अनुच्छेद जो किसी ऐसे शोधपत्र की विधि और निष्कर्षों का विस्तार से वर्णन करने के लिए पर्याप्त आत्मविश्वास रखता है, जो कभी लिखा ही नहीं गया था।

बिब्लियोग्राफियों में AI द्वारा गढ़े गए उद्धरणों को कैसे पहचाना जाए

एनोटेशन को संदर्भ पंक्ति से पहले पढ़ें। केवल एक उद्धरण, एक लेखक, एक वर्ष, एक पत्रिका, एक DOI, ये सभी छोटे संरचित पैटर्न हैं जिन्हें एक भाषा मॉडल ने हजारों बार देखा है, और वे संयोग से या स्मरण के कारण सही लग सकते हैं, भले ही उनके पीछे कुछ वास्तविक न हो। दूसरी ओर, एक एनोटेशन को उस विशिष्ट शोधपत्र ने वास्तव में क्या किया, इसके बारे में कुछ कहना चाहिए, इतनी विस्तार से कि आप यह पता लगा सकें कि वह सही था या गलत। यदि कोई मॉडल स्रोत को पुनः प्राप्त या पढ़ता नहीं है, तो वह यह विश्वसनीय रूप से नहीं कर पाएगा, और परिणाम सामान्यता के रूप में DOI की जांच तक पहुँचने से बहुत पहले ही सामने आ जाएगा।

एनोटेशन उद्धरण की तुलना में अधिक कैसे उजागर करता है

एक गढ़ा हुआ उद्धरण एक संदर्भ के रूप में सजा हुआ अनुमान है, एक संभावित लेखक, एक संभावित पत्रिका, सही अंकों की संख्या के साथ DOI जैसी एक स्ट्रिंग। एक गढ़ा हुआ एनोटेशन समझ के रूप में सजा हुआ अनुमान है, और पूरे अनुच्छेद में समझ को विश्वसनीय ढंग से नकली बनाना कहीं अधिक कठिन है। मॉडल को एक नमूने, एक विधि और निष्कर्ष की दिशा के बारे में निश्चित होना पड़ता है, और इन विवरणों में से प्रत्येक एक ऐसा स्थान है जहाँ एक वास्तविक शोधपत्र उसका खंडन कर सकता है।

यही कारण भी है कि एक annotation, एक bare citation की तुलना में, पाठक के लिए जाँचना आसान होता है। एक reference को उसी तरह स्वरूपित किया जाता है, चाहे स्रोत वास्तविक हो या नहीं, इसलिए उसका रूप अकेले कोई जानकारी नहीं देता। एक annotation किसी विशिष्ट सामग्री के बारे में एक विशिष्ट दावा करता है, इसलिए वह या तो वास्तविक paper द्वारा समर्थित होता है या नहीं, और वास्तविक abstract के साथ कुछ मिनट यह तय कर देते हैं कि कौन सा है।

अपने पेपर को मानवीय बनाइए

अपने AI-सहायता प्राप्त पाठ को रूपांतरित करें और उसे मानवीय ध्वनि दें, महत्वपूर्ण शब्दों या उद्धरणों को छेड़े बिना।

मुफ़्त में शुरू करें

जब एक मॉडल तब क्या लिखता है जब उसने paper को वास्तव में कभी पढ़ा ही नहीं होता

किसी language model से ऐसे स्रोत पर annotation लिखने को कहिए, जिसके लिए उसके पास केवल एक title और एक मोटा विषय हो, और वह न तो मना करेगा, न ही सावधानी बरतेगा। वह उस paragraph की भविष्यवाणी करता है, जिसे उस title वाला paper संभवतः शामिल करेगा, training में देखे गए हजारों समान abstracts से निर्मित, और उसे उसी आत्मविश्वासी register में वापस दे देता है, जिसका उपयोग वह ऐसे paper के लिए करता, जिसे वह पंक्ति दर पंक्ति उद्धृत कर सकता हो।

यह उस विषय के आसपास कभी लिखी गई हर चीज़ के औसत जैसा पढ़ता है। नींद और स्मृति पर किसी study का ईमानदार summary आपको वास्तविक study participants का नाम, उपयोग किए गए वास्तविक test और रिपोर्ट किया गया वास्तविक effect size देगा। एक मनगढ़ंत summary कहेगी कि study ने देखा कि लोग कितनी अच्छी तरह सोए और उनकी memory कैसी थी, और पाया कि दोनों के बीच एक मजबूत link था। यह इतना सामान्य है कि किसी अलग, असंबंधित title के नीचे भी सहजता से बैठ सकता है।

क्या जाँचना हैएक प्रामाणिक एनोटेशन में सामान्यतः यह होता हैएक गढ़े हुए में सामान्यतः इसके बजाय यह होता है
संख्याएँवास्तविक सार के अनुरूप एक विशिष्ट नमूना आकार, प्रभाव आकार या प्रतिशतकोई संख्या नहीं, या एक गोल, अप्रमाण्य आँकड़ा जो वास्तविक स्रोत में कहीं दिखाई नहीं देता
विधिवास्तव में नामित विधि, एक विशिष्ट परीक्षण, डिज़ाइन या डेटासेट"एक अध्ययन" या "एक विश्लेषण" की एक अस्पष्ट ओर इशारा, जिसमें कोई विधि नामित नहीं है
सीमाएँएक सीमा जिसे लेखकों ने स्वयं उठाया था, जो उनके डिज़ाइन के लिए विशिष्ट थीएक सामान्य सीमा जो क्षेत्र के लगभग किसी भी पेपर पर लागू हो सकती है
संदर्भ मिलानउद्धरण एक वास्तविक रिकॉर्ड तक पहुँचता है जिसका शीर्षक एनोटेशन से मेल खाता हैसंदर्भ नहीं खुलता, या किसी भिन्न, असंबंधित पेपर तक खुलता है

इनमें से किसी भी जाँच के लिए पूरे पेपर को पढ़ना आवश्यक नहीं है। इसके लिए उसे एक बार खोलना पड़ता है, इतनी देर तक कि यह देखा जा सके कि क्या एनोटेशन में किए गए विशिष्ट दावे वास्तव में सार में दिखाई देते हैं।

क्यों एक गढ़ने की दर के लिए मॉडल संस्करण और एक तिथि की आवश्यकता होती है

समस्या का पैमाना मापा गया है, यद्यपि माप एक-दूसरे से सहमत नहीं हैं, क्योंकि वे कभी एक ही चीज़ को माप ही नहीं रहे थे। 2023 में एक ही दिन समान 42 शैक्षणिक विषयों पर ChatGPT-3.5 और ChatGPT-4 का परीक्षण करते हुए, शोधकर्ताओं ने पाया कि GPT-3.5 के 55 प्रतिशत उद्धरण पूरी तरह गढ़े हुए थे, जबकि GPT-4 के लिए यह 18 प्रतिशत था। समान प्रॉम्प्ट, समान शोधकर्ता, समान दिन, केवल मॉडल बदला, और दर दो-तिहाई घट गई।

एक अलग अध्ययन, जिसमें ग्रंथसूची उद्धरणों के बजाय भ्रमित किए गए मामले के तथ्यों का परीक्षण किया गया, ने पाया कि ChatGPT-4 वास्तविक संघीय न्यायालय मामलों के बारे में सत्यापनीय प्रश्नों पर 58 प्रतिशत समय गलत था, और Llama 2 88 प्रतिशत समय गलत था, यह शोध 2024 में प्रकाशित हुआ। वह आंकड़ा अलग मॉडलों पर एक अलग कार्य का वर्णन करता है और ऊपर दिए गए उद्धरण-गठन के संख्याओं के साथ मिलाकर एक ही मुख्य दर नहीं बनाया जाना चाहिए। दोनों अध्ययनों में जिस बात पर सहमति है, वह समस्या का स्वरूप है, मॉडल संस्करण और तिथि के बिना दिया गया प्रतिशत कुछ विशिष्ट नहीं बताता। 2023 से 2026 तक फैले ऐसे छह अध्ययनों में व्यापक पैटर्न अपने आप में एक विषय है, क्या ChatGPT संदर्भ गढ़ता है इसे पूरी तरह कवर करता है। विशेष रूप से ग्रंथसूची के लिए जो महत्वपूर्ण है, वह अधिक संकीर्ण रहता है, क्या एनोटेशन DOI की जाँच से पहले ही गढ़ंत को उजागर कर देता है।

AI-निर्मित एनोटेटेड ग्रंथसूची में प्रत्येक प्रविष्टि की जाँच कैसे करें

संदर्भ पंक्ति से शुरू करें, सटीक शीर्षक को Google Scholar या जर्नल की अपनी साइट पर खोजें, और DOI को तब तक अपुष्ट मानें जब तक वह वास्तव में उस शीर्षक तक न पहुँच जाए, क्योंकि गढ़ा हुआ उद्धरण ऐसा DOI रख सकता है जो किसी और के वास्तविक, असंबद्ध लेख तक ले जाता है। एक AI citation checker जो प्रत्येक प्रविष्टि को वास्तविक विद्वतापूर्ण डेटाबेस के विरुद्ध हल करता है यह खोज स्वचालित करता है, बजाय इसके कि हर एक स्रोत के लिए मैन्युअल खोज पर छोड़ दिया जाए।

फिर एनोटेशन की तुलना स्रोत से स्वयं करें, न कि इस बात से कि वह कितना विश्वसनीय लगता है। वास्तविक abstract खोलें और पुष्टि करें कि एनोटेशन जिस नमूने, विधि और निष्कर्ष का दावा करता है, वे वास्तव में उसमें मौजूद हैं। एक निःशुल्क annotated bibliography generator जो हर सारांश को लेख के अपने abstract में आधारित करता है, बजाय इसके कि उसे स्मृति से रचा जाए, दिखाता है कि वास्तव में स्रोत-आधारित एनोटेशन कैसा दिखता है, उसके बगल में जो ऐसा नहीं था।

जो प्रविष्टियाँ ऑडिट में बच जाती हैं, उनके लिए APA में ChatGPT का उद्धरण देना और MLA में ChatGPT का उद्धरण देना प्रत्येक को चरण दर चरण समझाया गया है।

इसमें से कुछ भी इस बात को नहीं बदलता कि एक प्रविष्टि को आप कैसे स्वरूपित करते हैं, जब आप यह पुष्टि कर चुके हों कि वह वास्तविक है। ChatGPT को स्वयं कैसे उद्धृत करें एक अलग प्रश्न है, जिसे APA, MLA, Chicago और IEEE के लिए पूरी तरह से कवर किया गया है, और एक citation generator साधारण संदर्भ को शैली की परवाह किए बिना उसी तरह स्वरूपित करता है. इनमें से कोई भी उस टिप्पणी को नहीं पकड़ता जो ऐसे पेपर का वर्णन करती है जिसे किसी ने लिखा ही नहीं, इतनी प्रवाहपूर्ण कि किसी ने जाँचने के बारे में सोचा ही नहीं।

XLinkedInFacebook

अक्सर पूछे जाने वाले प्रश्न

क्योंकि एक उद्धरण को केवल सही दिखना होता है: एक संभावित लेखक, पत्रिका और DOI, एक सरसरी नज़र से पास होने के लिए पर्याप्त हैं। एनोटेशन को सही होना पड़ता है, क्योंकि वह किसी शोधपत्र की विधि और निष्कर्षों के बारे में एक विशिष्ट दावा करता है, जो या तो वास्तविक स्रोत से मेल खाता है या नहीं। एक मॉडल जिसने शोधपत्र कभी पढ़ा ही नहीं, वह संदर्भ के रूप को उसकी सामग्री की तुलना में कहीं अधिक आसानी से नकली बना सकता है।

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.