Academic Writing

क्या ChatGPT संदर्भ गढ़ता है? निर्माण संबंधी अध्ययनों ने क्या पाया

6 अध्ययन, 4 क्षेत्र, 3 वर्ष। ChatGPT द्वारा संदर्भ गढ़ने की दर एकल अंकों से लेकर आधे से भी अधिक तक जाती है, और मॉडल संस्करण तथा उससे जुड़ी तिथि के बिना यह संख्या अर्थहीन है.

6 min
Does ChatGPT make up references: a table of studies by model version and year

जून 2025 में, Deakin University के शोधकर्ताओं ने GPT-4o से मानसिक स्वास्थ्य विषयों पर छह साहित्य समीक्षाएँ लिखने को कहा। इसके द्वारा उत्पन्न 176 संदर्भों में से 35 का अस्तित्व बिल्कुल नहीं था। अन्य 64 वास्तविक शोध-पत्रों की ओर संकेत करते थे, लेकिन उनके साथ गलत विवरण जुड़े हुए थे। यानी पाँच में से एक संदर्भ पूरी तरह से गढ़ा हुआ था, और यह उस मॉडल से आया था जिसे ChatGPT की संदर्भ समस्या को पहली बार मुद्रित रूप में मापे जाने के एक वर्ष से अधिक समय बाद जारी किया गया था।

क्या ChatGPT संदर्भ गढ़ता है? हाँ, और यह 2026 में भी ऐसा करता है, वर्तमान मॉडलों पर, केवल उस संस्करण पर नहीं जिसने 2023 में सुर्खियाँ बनाई थीं। खुला प्रश्न कभी यह नहीं था कि क्या यह होता है। प्रश्न यह है कि यह कितनी बार होता है, और वह संख्या मॉडल, संस्करण, क्षेत्र और परीक्षण चलाए जाने की तिथि के साथ बदलती रहती है।

क्या ChatGPT संदर्भ गढ़ता है?

हाँ। एक भाषा मॉडल अपने से पहले की हर चीज़ को देखते हुए अगले संभावित शब्द की भविष्यवाणी करता है। जब तक आप अपने उत्पाद में पुनर्प्राप्ति या खोज का चरण नहीं जोड़ते, यह कुछ भी खोजता नहीं है। यदि उसे यह अनुमान लगाने के लिए छोड़ दिया जाए कि कोई संदर्भ कैसा दिखता है, तो वह ऐसा संदर्भ बनाएगा जो सही दिखे, लेखक का नाम, वर्ष, पत्रिका का शीर्षक, खंड संख्या, DOI, बिना यह सत्यापित किए कि इनमें से कोई भी चीज़ किसी वास्तविक प्रकाशन से मेल खाती है या नहीं। इनमें से कुछ संयोग से या रटकर याद किए जाने के कारण सही होंगे। कुछ पूरी तरह से गढ़े हुए होंगे और बिल्कुल वैसे ही दिखेंगे।

किसी गढ़ंत दर के लिए मॉडल संस्करण और तिथि की आवश्यकता क्यों होती है

क्योंकि यह दर एक ही संख्या नहीं है। इस विषय पर सबसे अधिक उद्धृत अध्ययन में, ChatGPT-3.5 ने संक्षिप्त साहित्य समीक्षाओं के एक सेट में 55 प्रतिशत संदर्भ गढ़े, और उसी शोधकर्ताओं द्वारा, उन्हीं 42 विषयों पर, उसी तरह परीक्षण किए गए ChatGPT-4 ने 18 प्रतिशत संदर्भ गढ़े। वही अध्ययन, वही संकेत, परीक्षण का वही दिन। केवल मॉडल बदला था, और दर दो-तिहाई घट गई।

तारीख का महत्व मॉडल के नाम जितना ही है। उस अध्ययन में GPT-4 का अर्थ था जो भी OpenAI मध्य-2023 में उपलब्ध करा रहा था। 2026 के एक अध्ययन में, जिसमें दस वर्तमान मॉडल और शोध एजेंट शामिल थे, और कुल मिलाकर 220,000 से अधिक citation links की जाँच की गई, fabrication rates 3 percent से 13 percent तक पाए गए, और सटीक आँकड़ा विशिष्ट मॉडल तथा इस बात पर निर्भर था कि उत्पाद ने search grounding का उपयोग किया या deep research mode का। दोनों में से कोई भी आँकड़ा गलत नहीं है। वे लगभग तीन वर्ष के अंतर से मापी गई अलग-अलग चीज़ों का वर्णन करते हैं।

क्षेत्र भी महत्वपूर्ण है, मॉडल से स्वतंत्र। हमने यह भी देखा है कि economics research, जिसे उसी GPT-3.5 और GPT-4 pairing से चलाया गया था, में GPT-3.5 citations के 30 percent से अधिक invented पाए गए और GPT-4 के लिए दर अभी भी 20 percent से ऊपर थी, जो multidisciplinary study के निष्कर्ष के क़रीब है, जबकि medical-systematic-review study, जिसने विशेष रूप से GPT-4 के March 2023 build के रूप में लेबल किए गए संस्करण का परीक्षण किया, ने 28.6 percent मापा, एक बिल्कुल अलग कार्य पर, existing systematic reviews के लिए references निकालने का, न कि scratch से नए literature summaries लिखने का।

प्रकाशित अध्ययनों ने क्या पाया

2023 और 2026 के बीच, medicine, law, economics और general academic writing में किए गए छह अध्ययन, उसी निष्कर्ष पर पहुँचते हैं, जिसे छह अलग-अलग तरीकों से कहा गया है, हर reference की जाँच करें जो कोई AI tool आपको देता है, चाहे उसे किसी भी model ने बनाया हो या वह किसी भी समय दिया गया हो।

अध्ययन और क्षेत्रमॉडल और संस्करणपरीक्षण की तिथिनमूनागढ़ंत दर
Walters and Wilder, Scientific Reports (बहुविषयक)ChatGPT-3.5 and ChatGPT-42023636 उद्धरण, 42 विषय55% (3.5) बनाम 18% (4)
Buchanan, Hill and Shapoval, The American Economist (अर्थशास्त्र)GPT-3.5 and GPT-42023Journal of Economic Literature विषयों से संकेत30% से अधिक (3.5), 20% से अधिक (4)
Chelli et al, JMIR (चिकित्सीय व्यवस्थित समीक्षाएँ)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Queried July 2023471 संदर्भ, 11 समीक्षाएँ39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (कानून)ChatGPT-4 and Llama 22024यादृच्छिक संघीय न्यायालय मामले के प्रश्न58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (मानसिक स्वास्थ्य समीक्षाएँ)GPT-4oTested June 2025176 उद्धरण, 6 समीक्षाएँ19.9% पूरी तरह गढ़े गए, 56% गढ़े गए या त्रुटिपूर्ण
Rao, Wong and Callison-Burch, arXiv preprint (बहु-डोमेन, गहन शोध एजेंट)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026220,000 से अधिक उद्धरण URLमॉडल के अनुसार 3% से 13% तक

कानूनी अध्ययन एक ऐसा विवरण जोड़ता है जिसे कच्चा प्रतिशत नहीं पकड़ता, उसी शोध में पाया गया कि मॉडल अपनी ही भ्रांतियों का अनुमान लगाने में संघर्ष करते हैं और किसी मामले के बारे में उपयोगकर्ता की गलत पूर्वधारणा को सुधारने के बजाय उसे स्वीकार करने की प्रवृत्ति रखते हैं। एक गढ़ा हुआ उद्धरण एक विफलता-रूप है। जो मॉडल अपनी अनिश्चितता को भी चिह्नित नहीं कर सकता, वह एक अधिक कठिन समस्या है, और यह सबसे अधिक ठीक उसी क्षेत्र में दिखाई देती है जहाँ गलत उद्धरण की लागत सबसे अधिक होती है।

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

क्या ChatGPT 2023 के बाद बेहतर हो गया है?

कुछ हद तक, और असमान रूप से। सबसे स्पष्ट एकल पहले और बाद का अंतर Walters and Wilder अध्ययन में ही है: GPT-3.5 से GPT-4, उसी दिन, गढ़े गए अंश 55 प्रतिशत से घटकर 18 प्रतिशत हो गए। 2025 के मध्य में GPT-4o पर आगे बढ़ें, और Linardon की टीम द्वारा मापी गई दर 19.9 प्रतिशत थी, एक अधिक कठिन और संकीर्ण कार्य पर, एक ही शोध क्षेत्र में 6 साहित्य समीक्षाएँ, न कि 42 असंबंधित विषयों में फैले छोटे सारांश। 2026 की शुरुआत में search या deep-research सुविधाएँ चालू किए गए मॉडलों पर फिर आगे बढ़ें, और अधिकांश के लिए यह सीमा एकल अंकों तक गिर जाती है, 3 से 9 प्रतिशत, हालांकि एक deep-research mode अभी भी 13.3 प्रतिशत तक पहुँचा।

इनमें से कुछ भी सीधी नीचे जाती हुई रेखा नहीं है। Linardon का आँकड़ा 2023 के GPT-4 आंकड़े और 2023 के GPT-3.5 आंकड़े के बीच आता है, ऐसे मॉडल पर जो दोनों के एक वर्ष से अधिक बाद जारी हुआ था, क्योंकि उसका परीक्षण एक अधिक कठिन कार्य पर किया गया था, किसी ऐसे क्षेत्र में वास्तविक साहित्य समीक्षा निर्माण, जहाँ स्रोत सामग्री का बड़ा हिस्सा स्वयं खोजना कठिन है। गढ़े गए अंशों की दर किसी मॉडल को किसी कार्य पर किसी तिथि पर वर्णित करती है। इन तीन में से किसी एक को बदल दीजिए, और संख्या बदल जाती है, कभी-कभी काफी अधिक।

मॉडल परिवार ही आज भी संख्या को बदलने वाला एकमात्र चर नहीं है। 2025 के एक अध्ययन में, जिसमें आठ free chatbots, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat और Perplexity का मूल्यांकन 5 शैक्षणिक क्षेत्रों में 400 संदर्भों पर किया गया, पाया गया कि उत्पन्न सभी संदर्भों में से केवल 26.5 प्रतिशत पूरी तरह सही थे। उस परीक्षण में Grok और DeepSeek ने शून्य गढ़े गए संदर्भ उत्पन्न किए। Claude, Copilot और Perplexity सबसे खराब प्रदर्शन करने वालों में थे। तुलनीय अंतर्निहित तकनीक पर बने दो उत्पाद, जिन्हें उसी महीने, उन्हीं prompts पर, परखा गया, सीमा के विपरीत सिरों पर पहुँचे, और यही ऊपर दी गई model-and-date तालिका का वही पाठ है, जिसे संस्करण के बजाय उत्पाद पर लागू किया गया है।

गढ़े गए उद्धरण वास्तविक क्यों दिखते हैं

एक गढ़ा हुआ उद्धरण कोई स्पष्ट स्थानधारक नहीं होता। Walters और Wilder ने पाया कि उनकी गढ़ी गई प्रविष्टियों में वास्तविक लेखक नाम थे, ऐसे लेखक जो वास्तविक क्षेत्र में प्रकाशन करते हैं, और वे ऐसे जर्नल शीर्षकों से जुड़े थे जो वास्तव में मौजूद हैं, तथा उनका प्रारूप इतना अच्छा था कि वे एक त्वरित दृश्य जांच में पास हो जाएँ। Linardon की टीम ने इससे भी अधिक स्पष्ट बात पाई: GPT-4o द्वारा उत्पन्न 35 गढ़े हुए उद्धरणों में से 33 के साथ एक DOI संलग्न था, और उन DOI में से 64 प्रतिशत एक वास्तविक, प्रकाशित लेख तक ले गए, जो पूरी तरह असंबंधित विषय पर था, न कि किसी मृत लिंक या त्रुटि पृष्ठ पर, अर्थात किसी और का वास्तविक शोध एक ऐसे स्रोत के स्थान पर खड़ा था जो अस्तित्व में ही नहीं था।

कैसे जांचें कि कोई ChatGPT उद्धरण वास्तविक है या नहीं

केवल DOI पर भरोसा करने के बजाय Google Scholar या जर्नल की अपनी साइट पर सटीक शीर्षक खोजें, क्योंकि एक कार्यशील DOI भी पूरी तरह गलत लेख की ओर संकेत कर सकता है। लेखक सूची, वर्ष और जर्नल का मिलान वास्तव में जो सामने आता है उससे करें, केवल यह नहीं कि कुछ सामने आता है। यह हर उस संदर्भ के लिए करें जो कोई chatbot देता है, न कि केवल उनके लिए जो अपरिचित लगते हैं, क्योंकि इन अध्ययनों में गढ़ी गई प्रविष्टियाँ विशेष रूप से साधारण दिखने के लिए बनाई गई थीं।

किसी अपरिचित या संकीर्ण विषय को मुख्यधारा के विषय की तुलना में अधिक जोखिम वाला मानें। Linardon की टीम ने एक अच्छी तरह अध्ययन की गई स्थिति, major depressive disorder, के लिए लगभग 6 प्रतिशत और उसी समीक्षाओं के सेट में दो कम-अध्ययनित स्थितियों के लिए लगभग 30 प्रतिशत गढ़न पाई। यह पैटर्न मानसिक स्वास्थ्य के बाहर भी लागू होता है: किसी मॉडल के पास भीड़भाड़ वाले क्षेत्र में पैटर्न निकालने के लिए अधिक वास्तविक पाठ होता है, और पतले क्षेत्र में विश्वसनीय ढंग से गढ़ने के लिए अधिक स्थान होता है।

एक AI citation checker जो प्रत्येक प्रविष्टि को एक वास्तविक शैक्षणिक डेटाबेस के विरुद्ध चलाता है इस खोज को स्वचालित कर देता है, बजाय इसके कि हर एक संदर्भ के लिए मैनुअल खोज पर छोड़ दिया जाए, जिसे समयसीमा के दबाव में अधिकांश लोग छोड़ देते हैं, और यही वह सटीक स्थिति है जिसमें एक गढ़ा हुआ उद्धरण अंतिम मसौदे तक पहुँचने की सबसे अधिक संभावना रखता है।

उन्हें एक पूर्ण bibliography में खोजना अपनी अलग प्रक्रिया है और उसका अपना पृष्ठ है। जो उद्धरण वास्तविक हैं, उनके लिए APA में ChatGPT का उद्धरण देना चरण-दर-चरण बताया गया है।

इसमें से कोई भी बात इस बात को नहीं बदलती कि आप एक उद्धरण को कैसे स्वरूपित करते हैं, एक बार जब आपने यह पुष्टि कर ली हो कि वह वास्तविक है। यह एक अलग प्रश्न है: How to cite ChatGPT APA, MLA, Chicago और IEEE को उस आदान-प्रदान के लिए कवर करता है, और एक citation generator सामान्य संदर्भ को संभालता है उसी तरह, चाहे आप किसी भी शैली में लिख रहे हों। कोई भी उद्धरण प्रारूप उस संदर्भ को ठीक नहीं कर सकता जो ऐसी चीज़ की ओर इशारा करता है जो कभी प्रकाशित ही नहीं हुई। यह जाँच स्वरूपण से पहले होती है, हर संदर्भ पर, चाहे आपका मसौदा किसी भी मॉडल ने लिखा हो या उसके लेबल में किसी भी संस्करण का दावा किया गया हो।

Frequently Asked Questions

क्या ChatGPT संदर्भ गढ़ता है? हाँ, अब तक परीक्षण किए गए हर मॉडल पर, और 2023 से 2026 तक के हर प्रकाशित अध्ययन में। यह दर मॉडल संस्करण, क्षेत्र और तिथि के अनुसार बहुत बदलती है, सबसे हाल के ग्राउंडेड मॉडलों पर लगभग 3 प्रतिशत से लेकर 2023 में GPT-3.5 पर आधे से भी अधिक तक, इसलिए एक अकेली संख्या कभी पूरा उत्तर नहीं होती.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

क्या ChatGPT संदर्भ गढ़ता है? अध्ययनों की तुलना | TextPulse.ai