क्या ChatGPT संदर्भ गढ़ता है? निर्माण संबंधी अध्ययनों ने क्या पाया
6 अध्ययन, 4 क्षेत्र, 3 वर्ष। ChatGPT द्वारा संदर्भ गढ़ने की दर एकल अंकों से लेकर आधे से भी अधिक तक जाती है, और मॉडल संस्करण तथा उससे जुड़ी तिथि के बिना यह संख्या अर्थहीन है.
जून 2025 में, Deakin University के शोधकर्ताओं ने GPT-4o से मानसिक स्वास्थ्य विषयों पर छह साहित्य समीक्षाएँ लिखने को कहा। इसके द्वारा उत्पन्न 176 संदर्भों में से 35 का अस्तित्व बिल्कुल नहीं था। अन्य 64 वास्तविक शोध-पत्रों की ओर संकेत करते थे, लेकिन उनके साथ गलत विवरण जुड़े हुए थे। यानी पाँच में से एक संदर्भ पूरी तरह से गढ़ा हुआ था, और यह उस मॉडल से आया था जिसे ChatGPT की संदर्भ समस्या को पहली बार मुद्रित रूप में मापे जाने के एक वर्ष से अधिक समय बाद जारी किया गया था।
क्या ChatGPT संदर्भ गढ़ता है? हाँ, और यह 2026 में भी ऐसा करता है, वर्तमान मॉडलों पर, केवल उस संस्करण पर नहीं जिसने 2023 में सुर्खियाँ बनाई थीं। खुला प्रश्न कभी यह नहीं था कि क्या यह होता है। प्रश्न यह है कि यह कितनी बार होता है, और वह संख्या मॉडल, संस्करण, क्षेत्र और परीक्षण चलाए जाने की तिथि के साथ बदलती रहती है।
क्या ChatGPT संदर्भ गढ़ता है?
हाँ। एक भाषा मॉडल अपने से पहले की हर चीज़ को देखते हुए अगले संभावित शब्द की भविष्यवाणी करता है। जब तक आप अपने उत्पाद में पुनर्प्राप्ति या खोज का चरण नहीं जोड़ते, यह कुछ भी खोजता नहीं है। यदि उसे यह अनुमान लगाने के लिए छोड़ दिया जाए कि कोई संदर्भ कैसा दिखता है, तो वह ऐसा संदर्भ बनाएगा जो सही दिखे, लेखक का नाम, वर्ष, पत्रिका का शीर्षक, खंड संख्या, DOI, बिना यह सत्यापित किए कि इनमें से कोई भी चीज़ किसी वास्तविक प्रकाशन से मेल खाती है या नहीं। इनमें से कुछ संयोग से या रटकर याद किए जाने के कारण सही होंगे। कुछ पूरी तरह से गढ़े हुए होंगे और बिल्कुल वैसे ही दिखेंगे।
किसी गढ़ंत दर के लिए मॉडल संस्करण और तिथि की आवश्यकता क्यों होती है
क्योंकि यह दर एक ही संख्या नहीं है। इस विषय पर सबसे अधिक उद्धृत अध्ययन में, ChatGPT-3.5 ने संक्षिप्त साहित्य समीक्षाओं के एक सेट में 55 प्रतिशत संदर्भ गढ़े, और उसी शोधकर्ताओं द्वारा, उन्हीं 42 विषयों पर, उसी तरह परीक्षण किए गए ChatGPT-4 ने 18 प्रतिशत संदर्भ गढ़े। वही अध्ययन, वही संकेत, परीक्षण का वही दिन। केवल मॉडल बदला था, और दर दो-तिहाई घट गई।
तारीख का महत्व मॉडल के नाम जितना ही है। उस अध्ययन में GPT-4 का अर्थ था जो भी OpenAI मध्य-2023 में उपलब्ध करा रहा था। 2026 के एक अध्ययन में, जिसमें दस वर्तमान मॉडल और शोध एजेंट शामिल थे, और कुल मिलाकर 220,000 से अधिक citation links की जाँच की गई, fabrication rates 3 percent से 13 percent तक पाए गए, और सटीक आँकड़ा विशिष्ट मॉडल तथा इस बात पर निर्भर था कि उत्पाद ने search grounding का उपयोग किया या deep research mode का। दोनों में से कोई भी आँकड़ा गलत नहीं है। वे लगभग तीन वर्ष के अंतर से मापी गई अलग-अलग चीज़ों का वर्णन करते हैं।
क्षेत्र भी महत्वपूर्ण है, मॉडल से स्वतंत्र। हमने यह भी देखा है कि economics research, जिसे उसी GPT-3.5 और GPT-4 pairing से चलाया गया था, में GPT-3.5 citations के 30 percent से अधिक invented पाए गए और GPT-4 के लिए दर अभी भी 20 percent से ऊपर थी, जो multidisciplinary study के निष्कर्ष के क़रीब है, जबकि medical-systematic-review study, जिसने विशेष रूप से GPT-4 के March 2023 build के रूप में लेबल किए गए संस्करण का परीक्षण किया, ने 28.6 percent मापा, एक बिल्कुल अलग कार्य पर, existing systematic reviews के लिए references निकालने का, न कि scratch से नए literature summaries लिखने का।
प्रकाशित अध्ययनों ने क्या पाया
2023 और 2026 के बीच, medicine, law, economics और general academic writing में किए गए छह अध्ययन, उसी निष्कर्ष पर पहुँचते हैं, जिसे छह अलग-अलग तरीकों से कहा गया है, हर reference की जाँच करें जो कोई AI tool आपको देता है, चाहे उसे किसी भी model ने बनाया हो या वह किसी भी समय दिया गया हो।
| अध्ययन और क्षेत्र | मॉडल और संस्करण | परीक्षण की तिथि | नमूना | गढ़ंत दर |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (बहुविषयक) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 उद्धरण, 42 विषय | 55% (3.5) बनाम 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (अर्थशास्त्र) | GPT-3.5 and GPT-4 | 2023 | Journal of Economic Literature विषयों से संकेत | 30% से अधिक (3.5), 20% से अधिक (4) |
| Chelli et al, JMIR (चिकित्सीय व्यवस्थित समीक्षाएँ) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 संदर्भ, 11 समीक्षाएँ | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (कानून) | ChatGPT-4 and Llama 2 | 2024 | यादृच्छिक संघीय न्यायालय मामले के प्रश्न | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (मानसिक स्वास्थ्य समीक्षाएँ) | GPT-4o | Tested June 2025 | 176 उद्धरण, 6 समीक्षाएँ | 19.9% पूरी तरह गढ़े गए, 56% गढ़े गए या त्रुटिपूर्ण |
| Rao, Wong and Callison-Burch, arXiv preprint (बहु-डोमेन, गहन शोध एजेंट) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | 220,000 से अधिक उद्धरण URL | मॉडल के अनुसार 3% से 13% तक |
कानूनी अध्ययन एक ऐसा विवरण जोड़ता है जिसे कच्चा प्रतिशत नहीं पकड़ता, उसी शोध में पाया गया कि मॉडल अपनी ही भ्रांतियों का अनुमान लगाने में संघर्ष करते हैं और किसी मामले के बारे में उपयोगकर्ता की गलत पूर्वधारणा को सुधारने के बजाय उसे स्वीकार करने की प्रवृत्ति रखते हैं। एक गढ़ा हुआ उद्धरण एक विफलता-रूप है। जो मॉडल अपनी अनिश्चितता को भी चिह्नित नहीं कर सकता, वह एक अधिक कठिन समस्या है, और यह सबसे अधिक ठीक उसी क्षेत्र में दिखाई देती है जहाँ गलत उद्धरण की लागत सबसे अधिक होती है।
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
क्या ChatGPT 2023 के बाद बेहतर हो गया है?
कुछ हद तक, और असमान रूप से। सबसे स्पष्ट एकल पहले और बाद का अंतर Walters and Wilder अध्ययन में ही है: GPT-3.5 से GPT-4, उसी दिन, गढ़े गए अंश 55 प्रतिशत से घटकर 18 प्रतिशत हो गए। 2025 के मध्य में GPT-4o पर आगे बढ़ें, और Linardon की टीम द्वारा मापी गई दर 19.9 प्रतिशत थी, एक अधिक कठिन और संकीर्ण कार्य पर, एक ही शोध क्षेत्र में 6 साहित्य समीक्षाएँ, न कि 42 असंबंधित विषयों में फैले छोटे सारांश। 2026 की शुरुआत में search या deep-research सुविधाएँ चालू किए गए मॉडलों पर फिर आगे बढ़ें, और अधिकांश के लिए यह सीमा एकल अंकों तक गिर जाती है, 3 से 9 प्रतिशत, हालांकि एक deep-research mode अभी भी 13.3 प्रतिशत तक पहुँचा।
इनमें से कुछ भी सीधी नीचे जाती हुई रेखा नहीं है। Linardon का आँकड़ा 2023 के GPT-4 आंकड़े और 2023 के GPT-3.5 आंकड़े के बीच आता है, ऐसे मॉडल पर जो दोनों के एक वर्ष से अधिक बाद जारी हुआ था, क्योंकि उसका परीक्षण एक अधिक कठिन कार्य पर किया गया था, किसी ऐसे क्षेत्र में वास्तविक साहित्य समीक्षा निर्माण, जहाँ स्रोत सामग्री का बड़ा हिस्सा स्वयं खोजना कठिन है। गढ़े गए अंशों की दर किसी मॉडल को किसी कार्य पर किसी तिथि पर वर्णित करती है। इन तीन में से किसी एक को बदल दीजिए, और संख्या बदल जाती है, कभी-कभी काफी अधिक।
मॉडल परिवार ही आज भी संख्या को बदलने वाला एकमात्र चर नहीं है। 2025 के एक अध्ययन में, जिसमें आठ free chatbots, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat और Perplexity का मूल्यांकन 5 शैक्षणिक क्षेत्रों में 400 संदर्भों पर किया गया, पाया गया कि उत्पन्न सभी संदर्भों में से केवल 26.5 प्रतिशत पूरी तरह सही थे। उस परीक्षण में Grok और DeepSeek ने शून्य गढ़े गए संदर्भ उत्पन्न किए। Claude, Copilot और Perplexity सबसे खराब प्रदर्शन करने वालों में थे। तुलनीय अंतर्निहित तकनीक पर बने दो उत्पाद, जिन्हें उसी महीने, उन्हीं prompts पर, परखा गया, सीमा के विपरीत सिरों पर पहुँचे, और यही ऊपर दी गई model-and-date तालिका का वही पाठ है, जिसे संस्करण के बजाय उत्पाद पर लागू किया गया है।
गढ़े गए उद्धरण वास्तविक क्यों दिखते हैं
एक गढ़ा हुआ उद्धरण कोई स्पष्ट स्थानधारक नहीं होता। Walters और Wilder ने पाया कि उनकी गढ़ी गई प्रविष्टियों में वास्तविक लेखक नाम थे, ऐसे लेखक जो वास्तविक क्षेत्र में प्रकाशन करते हैं, और वे ऐसे जर्नल शीर्षकों से जुड़े थे जो वास्तव में मौजूद हैं, तथा उनका प्रारूप इतना अच्छा था कि वे एक त्वरित दृश्य जांच में पास हो जाएँ। Linardon की टीम ने इससे भी अधिक स्पष्ट बात पाई: GPT-4o द्वारा उत्पन्न 35 गढ़े हुए उद्धरणों में से 33 के साथ एक DOI संलग्न था, और उन DOI में से 64 प्रतिशत एक वास्तविक, प्रकाशित लेख तक ले गए, जो पूरी तरह असंबंधित विषय पर था, न कि किसी मृत लिंक या त्रुटि पृष्ठ पर, अर्थात किसी और का वास्तविक शोध एक ऐसे स्रोत के स्थान पर खड़ा था जो अस्तित्व में ही नहीं था।
कैसे जांचें कि कोई ChatGPT उद्धरण वास्तविक है या नहीं
केवल DOI पर भरोसा करने के बजाय Google Scholar या जर्नल की अपनी साइट पर सटीक शीर्षक खोजें, क्योंकि एक कार्यशील DOI भी पूरी तरह गलत लेख की ओर संकेत कर सकता है। लेखक सूची, वर्ष और जर्नल का मिलान वास्तव में जो सामने आता है उससे करें, केवल यह नहीं कि कुछ सामने आता है। यह हर उस संदर्भ के लिए करें जो कोई chatbot देता है, न कि केवल उनके लिए जो अपरिचित लगते हैं, क्योंकि इन अध्ययनों में गढ़ी गई प्रविष्टियाँ विशेष रूप से साधारण दिखने के लिए बनाई गई थीं।
किसी अपरिचित या संकीर्ण विषय को मुख्यधारा के विषय की तुलना में अधिक जोखिम वाला मानें। Linardon की टीम ने एक अच्छी तरह अध्ययन की गई स्थिति, major depressive disorder, के लिए लगभग 6 प्रतिशत और उसी समीक्षाओं के सेट में दो कम-अध्ययनित स्थितियों के लिए लगभग 30 प्रतिशत गढ़न पाई। यह पैटर्न मानसिक स्वास्थ्य के बाहर भी लागू होता है: किसी मॉडल के पास भीड़भाड़ वाले क्षेत्र में पैटर्न निकालने के लिए अधिक वास्तविक पाठ होता है, और पतले क्षेत्र में विश्वसनीय ढंग से गढ़ने के लिए अधिक स्थान होता है।
एक AI citation checker जो प्रत्येक प्रविष्टि को एक वास्तविक शैक्षणिक डेटाबेस के विरुद्ध चलाता है इस खोज को स्वचालित कर देता है, बजाय इसके कि हर एक संदर्भ के लिए मैनुअल खोज पर छोड़ दिया जाए, जिसे समयसीमा के दबाव में अधिकांश लोग छोड़ देते हैं, और यही वह सटीक स्थिति है जिसमें एक गढ़ा हुआ उद्धरण अंतिम मसौदे तक पहुँचने की सबसे अधिक संभावना रखता है।
उन्हें एक पूर्ण bibliography में खोजना अपनी अलग प्रक्रिया है और उसका अपना पृष्ठ है। जो उद्धरण वास्तविक हैं, उनके लिए APA में ChatGPT का उद्धरण देना चरण-दर-चरण बताया गया है।
इसमें से कोई भी बात इस बात को नहीं बदलती कि आप एक उद्धरण को कैसे स्वरूपित करते हैं, एक बार जब आपने यह पुष्टि कर ली हो कि वह वास्तविक है। यह एक अलग प्रश्न है: How to cite ChatGPT APA, MLA, Chicago और IEEE को उस आदान-प्रदान के लिए कवर करता है, और एक citation generator सामान्य संदर्भ को संभालता है उसी तरह, चाहे आप किसी भी शैली में लिख रहे हों। कोई भी उद्धरण प्रारूप उस संदर्भ को ठीक नहीं कर सकता जो ऐसी चीज़ की ओर इशारा करता है जो कभी प्रकाशित ही नहीं हुई। यह जाँच स्वरूपण से पहले होती है, हर संदर्भ पर, चाहे आपका मसौदा किसी भी मॉडल ने लिखा हो या उसके लेबल में किसी भी संस्करण का दावा किया गया हो।
Frequently Asked Questions
क्या ChatGPT संदर्भ गढ़ता है? हाँ, अब तक परीक्षण किए गए हर मॉडल पर, और 2023 से 2026 तक के हर प्रकाशित अध्ययन में। यह दर मॉडल संस्करण, क्षेत्र और तिथि के अनुसार बहुत बदलती है, सबसे हाल के ग्राउंडेड मॉडलों पर लगभग 3 प्रतिशत से लेकर 2023 में GPT-3.5 पर आधे से भी अधिक तक, इसलिए एक अकेली संख्या कभी पूरा उत्तर नहीं होती.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.