ChatGPT কি রেফারেন্স বানিয়ে দেয়? Fabrication Studies কী পেয়েছে
6টি study, 4টি field, 3টি year. ChatGPT যে হারে একটি reference invent করে, তা single digit থেকে well over half পর্যন্ত যায়, এবং model version ও তারিখ ছাড়া এই সংখ্যা অর্থহীন.
2025 সালের জুনে, Deakin University-এর গবেষকেরা GPT-4o-কে মানসিক স্বাস্থ্য বিষয়ক ছয়টি সাহিত্য পর্যালোচনা লিখতে বলেন। এটি যে 176টি উদ্ধৃতি তৈরি করেছিল, তার মধ্যে 35টি একেবারেই অস্তিত্বহীন ছিল। আরও 64টি বাস্তব প্রবন্ধের দিকে ইঙ্গিত করেছিল, কিন্তু সেগুলোর সঙ্গে ভুল বিবরণ যুক্ত ছিল। অর্থাৎ, প্রতি পাঁচটির মধ্যে একটি সূত্র সম্পূর্ণভাবে বানানো হয়েছিল, এমন একটি মডেল থেকে যা ChatGPT-এর উদ্ধৃতি-সংক্রান্ত সমস্যা প্রথম মুদ্রণে পরিমাপ করার এক বছরেরও বেশি পরে প্রকাশিত হয়েছিল।
ChatGPT কি সূত্র বানায়? হ্যাঁ, এবং এটি 2026 সালেও করে, বর্তমান মডেলগুলোতে, শুধু 2023 সালে শিরোনাম হওয়া সংস্করণে নয়। খোলা প্রশ্নটি কখনোই ছিল না যে এটি ঘটে কি না। প্রশ্নটি হলো, কত ঘন ঘন ঘটে, এবং সেই সংখ্যা মডেল, সংস্করণ, ক্ষেত্র এবং পরীক্ষা চালানোর তারিখের সঙ্গে বদলায়।
ChatGPT কি সূত্র বানায়?
হ্যাঁ। একটি ভাষা মডেল তার আগের সবকিছু বিবেচনা করে পরবর্তী সম্ভাব্য শব্দ অনুমান করে। আপনার পণ্যে যদি আপনি কোনো retrieval বা search ধাপ যোগ না করেন, তবে এটি কিছুই খোঁজে না। যদি তাকে একটি উদ্ধৃতি কেমন দেখায় তা অনুমান করতে দেওয়া হয়, তবে এটি এমন একটি উদ্ধৃতি বানাবে যা সঠিক বলে মনে হয়, লেখকের নাম, বছর, জার্নালের শিরোনাম, ভলিউম নম্বর, DOI, কিন্তু এইগুলোর কোনোটি বাস্তব প্রকাশনার সঙ্গে মেলে কি না তা যাচাই না করেই। এর কিছু অংশ কাকতালীয়ভাবে বা মুখস্থের কারণে সঠিক হতে পারে। এর কিছু অংশ একেবারে নতুন করে বানানো হবে এবং দেখতে ঠিক একই রকম হবে।
কেন একটি বানিয়ে ফেলার হারকে মডেলের সংস্করণ এবং তারিখের প্রয়োজন হয়
কারণ এই হার একটিমাত্র সংখ্যা নয়। এ বিষয়ে সবচেয়ে বেশি উদ্ধৃত এক গবেষণায়, ChatGPT-3.5 সংক্ষিপ্ত সাহিত্য পর্যালোচনার একটি সেটে থাকা 55 শতাংশ উদ্ধৃতি বানিয়েছিল, এবং একই গবেষকেরা একই 42টি বিষয়ের ওপর পরীক্ষা করা ChatGPT-4-এ 18 শতাংশ উদ্ধৃতি বানানো পেয়েছিলেন। একই গবেষণা, একই প্রম্পট, পরীক্ষার একই দিন। কেবল যে জিনিসটি বদলেছিল তা হলো মডেল, এবং হার দুই-তৃতীয়াংশ কমে গিয়েছিল।
তারিখ মডেলের নামের মতোই গুরুত্বপূর্ণ। ওই গবেষণায় GPT-4 বলতে 2023 সালের মাঝামাঝি সময়ে OpenAI যা সরবরাহ করছিল, সেটিকেই বোঝানো হয়েছিল। 2026 সালের একটি গবেষণায় দশটি বর্তমান মডেল এবং গবেষণা এজেন্ট পরীক্ষা করে, মোট 220,000-এর বেশি উদ্ধৃতি-লিংক যাচাই করে, 3 শতাংশ থেকে 13 শতাংশ পর্যন্ত জালিয়াতির হার পাওয়া যায়, যেখানে সুনির্দিষ্ট হারটি নির্ভর করেছিল নির্দিষ্ট মডেলের ওপর এবং পণ্যটি search grounding ব্যবহার করেছিল কি না বা deep research mode ব্যবহার করেছিল কি না তার ওপর। কোনো হারই ভুল নয়। তারা প্রায় তিন বছর ব্যবধানে মাপা ভিন্ন জিনিস বর্ণনা করে।
ক্ষেত্রও গুরুত্বপূর্ণ, মডেল থেকে স্বাধীনভাবে। অর্থনীতির গবেষণায়ও একই GPT-3.5 এবং GPT-4 যুগল ব্যবহার করে দেখা গেছে GPT-3.5 উদ্ধৃতির 30 শতাংশের বেশি উদ্ভাবিত, আর GPT-4-এর হারও 20 শতাংশের ওপরে, যা বহুবিষয়ক গবেষণায় পাওয়া ফলের কাছাকাছি। অন্যদিকে, চিকিৎসা-সিস্টেম্যাটিক-রিভিউ গবেষণায়, বিশেষভাবে GPT-4-এর March 2023 build হিসেবে চিহ্নিত সংস্করণটি পরীক্ষা করে, 28.6 শতাংশ মাপা হয়েছিল একেবারে ভিন্ন একটি কাজে, বিদ্যমান systematic reviews-এর জন্য রেফারেন্স সংগ্রহ করা, নতুন সাহিত্য-সারসংক্ষেপ শুরু থেকে লেখা নয়।
প্রকাশিত গবেষণাগুলি কী পেয়েছে
2023 থেকে 2026 সালের মধ্যে, চিকিৎসাবিজ্ঞান, আইন, অর্থনীতি এবং সাধারণ একাডেমিক লেখালেখি জুড়ে পরিচালিত ছয়টি গবেষণা একই সিদ্ধান্তে পৌঁছায়, যা ছয়ভাবে বলা হয়েছে, AI টুল যে রেফারেন্সই দিক না কেন, সেটি যাচাই করুন, তা যে মডেলই তৈরি করুক বা যখনই তৈরি করুক।
| অধ্যয়ন ও ক্ষেত্র | মডেল ও সংস্করণ | পরীক্ষার তারিখ | নমুনা | জালিয়াতির হার |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (বহুবিষয়ক) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636টি উদ্ধৃতি, 42টি বিষয় | 55% (3.5) বনাম 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (অর্থনীতি) | GPT-3.5 and GPT-4 | 2023 | Journal of Economic Literature-এর বিষয়বস্তুর প্রম্পট | 30%-এর বেশি (3.5), 20%-এর বেশি (4) |
| Chelli et al, JMIR (চিকিৎসাবিষয়ক পদ্ধতিগত পর্যালোচনা) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | জুলাই 2023-এ অনুসন্ধান করা হয়েছে | 471টি রেফারেন্স, 11টি পর্যালোচনা | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (আইন) | ChatGPT-4 and Llama 2 | 2024 | ফেডারেল আদালতের মামলার এলোমেলো প্রশ্ন | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (মানসিক স্বাস্থ্য পর্যালোচনা) | GPT-4o | জুন 2025-এ পরীক্ষা করা হয়েছে | 176টি উদ্ধৃতি, 6টি পর্যালোচনা | 19.9% সম্পূর্ণভাবে জাল, 56% জাল বা ত্রুটিপূর্ণ |
| Rao, Wong and Callison-Burch, arXiv preprint (বহু-ডোমেইন, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | 220,000-এর বেশি উদ্ধৃতি URL | মডেলের ওপর নির্ভর করে 3% থেকে 13% |
আইনসংক্রান্ত গবেষণাটি একটি এমন বিশদ যোগ করে, যা কাঁচা শতাংশে ধরা পড়ে না: একই গবেষণায় দেখা গেছে যে মডেলগুলো নিজেদের hallucinations পূর্বাভাস দিতে হিমশিম খায় এবং কোনো মামলার বিষয়ে ব্যবহারকারীর ভুল ধারণা সংশোধন করার বদলে তা মেনে নিতে প্রবণ। একটি জাল উদ্ধৃতি একটি ব্যর্থতার ধরন। যে মডেল নিজের অনিশ্চয়তাও চিহ্নিত করতে পারে না, তা আরও কঠিন সমস্যা, এবং এটি সবচেয়ে বেশি দেখা যায় ঠিক সেই ক্ষেত্রেই, যেখানে ভুল উদ্ধৃতির মূল্য সবচেয়ে বেশি।
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
2023 সালের পর থেকে ChatGPT কি আরও ভালো হয়েছে?
কিছুটা, এবং অসমভাবে। সবচেয়ে স্পষ্ট একক আগে-পরের তুলনা Walters and Wilder গবেষণাতেই দেখা যায়: GPT-3.5 থেকে GPT-4, একই দিনে, কল্পিত তথ্যের হার 55 শতাংশ থেকে 18 শতাংশে নেমে আসে। 2025 সালের মাঝামাঝি GPT-4o-তে এগোলে, এবং Linardon-এর দলের মাপা হারে, তা ছিল 19.9 শতাংশ, তবে এটি ছিল আরও কঠিন এবং সংকীর্ণ একটি কাজে, একক গবেষণা ক্ষেত্রে 6টি সাহিত্য পর্যালোচনা, 42টি সম্পর্কহীন বিষয়ের মধ্যে ছড়িয়ে থাকা সংক্ষিপ্ত সারাংশের বদলে। আবার এগোলে, 2026 সালের শুরুতে পরীক্ষা করা search বা deep-research বৈশিষ্ট্য চালু থাকা মডেলগুলিতে, অধিকাংশের ক্ষেত্রে হার এক অঙ্কে নেমে আসে, 3 থেকে 9 শতাংশ, যদিও একটি deep-research মোড এখনও 13.3 শতাংশে পৌঁছেছিল।
এর কোনোটিই সরলরেখায় নিচের দিকে নামা নয়। Linardon-এর সংখ্যা 2023 সালের GPT-4-এর মান এবং 2023 সালের GPT-3.5-এর মানের মাঝামাঝি অবস্থানে আছে, এমন একটি মডেলে যা উভয়েরও এক বছরের বেশি পরে প্রকাশিত হয়েছিল, কারণ এটি আরও কঠিন একটি কাজে পরীক্ষা করা হয়েছিল: এমন একটি ক্ষেত্রে বাস্তব সাহিত্য পর্যালোচনা তৈরি, যেখানে উৎস উপাদানের বড় অংশই খুঁজে পাওয়া কঠিন। কল্পিত তথ্যের হার একটি নির্দিষ্ট তারিখে একটি নির্দিষ্ট কাজে একটি মডেলকে বর্ণনা করে। এই তিনটির যেকোনো একটিতে পরিবর্তন আনলে সংখ্যাটিও বদলায়, কখনও অনেকটাই।
আজও সংখ্যাটিকে যে একমাত্র চলক বদলায় তা মডেল পরিবার নয়। 2025 সালের একটি গবেষণায় পাঁচটি একাডেমিক ক্ষেত্রে 400টি রেফারেন্সের ওপর আটটি বিনামূল্যের চ্যাটবট, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat এবং Perplexity, মূল্যায়ন করে দেখা যায় যে উৎপন্ন সব রেফারেন্সের মাত্র 26.5 শতাংশ সম্পূর্ণ সঠিক ছিল। সেই পরীক্ষায় Grok এবং DeepSeek শূন্য কল্পিত রেফারেন্স তৈরি করেছিল। Claude, Copilot এবং Perplexity ছিল সবচেয়ে দুর্বল কর্মদক্ষতার মধ্যে। তুলনীয় অন্তর্নিহিত প্রযুক্তির ওপর নির্মিত দুটি পণ্য, একই মাসে, একই প্রম্পটে পরীক্ষা করা হলে, পরিসরের বিপরীত প্রান্তে অবস্থান করেছিল, এবং এটি উপরের model-and-date সারণিরই একই শিক্ষা, তবে version-এর বদলে product-এর ক্ষেত্রে প্রয়োগ করা।
কল্পিত উদ্ধৃতিগুলি কেন বাস্তব দেখায়
একটি fabricated citation কোনো স্পষ্ট placeholder নয়। Walters এবং Wilder দেখেছেন, তাদের উদ্ভাবিত entries-এ বাস্তব author names ছিল, এমন authors যারা প্রকৃত ক্ষেত্রটিতে publish করেন, journal titles-এর সঙ্গে যুক্ত, যেগুলো সত্যিই exist করে, এবং এমনভাবে formatted যে দ্রুত visual check-এ pass করতে পারে। Linardon's team আরও তীক্ষ্ণ একটি বিষয় খুঁজে পায়: GPT-4o যে 35টি fabricated citations তৈরি করেছিল, তার মধ্যে 33টির সঙ্গে একটি DOI attached ছিল, এবং সেই DOIগুলোর 64 percent একটি real, published paper-এ নিয়ে গিয়েছিল, যা সম্পূর্ণ unrelated topic-এর ওপর ছিল, dead linkও নয়, error pageও নয়, বরং অন্য কারও actual research, যা এমন একটি source-এর জায়গা নিয়েছিল যা exist করে না।
একটি ChatGPT Citation বাস্তব কি না, কীভাবে যাচাই করবেন
শুধু DOI-এর ওপর ভরসা না করে Google Scholar বা journal-এর নিজস্ব site-এ exact title খুঁজুন, কারণ একটি working DOI সম্পূর্ণ ভিন্ন paper-এর দিকেও নির্দেশ করতে পারে। author list, year এবং journal যা সত্যিই উঠে আসে তার সঙ্গে মেলে কি না নিশ্চিত করুন, শুধু কিছু একটা উঠে আসে কি না তা নয়। chatbot আপনাকে যে প্রতিটি reference দেয়, তার জন্যই এটি করুন, কেবল unfamiliar দেখায় এমনগুলোর জন্য নয়, কারণ এই studies-এ fabricated entries বিশেষভাবে ordinary দেখানোর জন্য তৈরি করা হয়েছিল।
অপরিচিত বা সংকীর্ণ topic-কে mainstream topic-এর তুলনায় বেশি risk হিসেবে বিবেচনা করুন। Linardon's team একটি well-studied condition, major depressive disorder, এর ক্ষেত্রে fabrication প্রায় 6 percent পেয়েছে, এবং একই set of reviews-এ আরও কম studied দুটি condition-এর ক্ষেত্রে প্রায় 30 percent পেয়েছে। এই pattern mental health-এর বাইরেও বজায় থাকে: crowded field-এ একটি model-এর কাছে pattern আঁকার জন্য বেশি real text থাকে, আর thin field-এ plausibly invent করার জন্য বেশি জায়গা থাকে।
একটি AI citation checker যা প্রতিটি entry-কে real scholarly database-এর বিরুদ্ধে চালায় এই search-কে automate করে, প্রতিটি reference-এর জন্য manual lookup-এর ওপর ছেড়ে দেয় না, আর deadline pressure-এর মধ্যে অধিকাংশ মানুষ যে অংশটি skip করে, সেটিই হলো সেই exact condition, যার অধীনে একটি fabricated citation final draft-এ টিকে যাওয়ার সবচেয়ে বেশি সম্ভাবনা রাখে।
একটি finished bibliography-তে সেগুলো খুঁজে বের করা নিজস্ব একটি procedure, এবং এর জন্য আলাদা page আছে। যে citations বাস্তব, সেগুলোর জন্য APA-তে ChatGPT উদ্ধৃত করা ধাপে ধাপে ব্যাখ্যা করা হয়েছে।
আপনি একবার নিশ্চিত হয়ে গেলে যে এটি বাস্তব, তখন উদ্ধৃতি কীভাবে বিন্যাস করবেন, তার ওপর এর কোনোটিই প্রভাব ফেলে না। এটি একটি পৃথক প্রশ্ন: How to cite ChatGPT APA, MLA, Chicago এবং IEEE কভার করে বিনিময়টির জন্য, এবং একটি citation generator সাধারণ রেফারেন্সটি পরিচালনা করে একইভাবে, আপনি যে শৈলীতেই লিখুন না কেন। কোনো citation format যা ঠিক করতে পারে না, তা হলো এমন কিছুর প্রতি রেফারেন্স, যা কখনোই প্রকাশিত হয়নি। সেই যাচাইটি বিন্যাসের আগে ঘটে, প্রতিটি রেফারেন্সে, আপনার খসড়া কোন model লিখেছে বা তার label কোন version দাবি করছে, তা নির্বিশেষে।
Frequently Asked Questions
ChatGPT কি রেফারেন্স বানিয়ে দেয়? হ্যাঁ, এখন পর্যন্ত tested প্রতিটি model-এ, এবং 2023 থেকে 2026 পর্যন্ত প্রতিটি published study-তে। এই হার model version, field এবং date অনুযায়ী অত্যন্ত ভিন্ন, সবচেয়ে recent grounded model-এ প্রায় 3 percent থেকে শুরু করে 2023-এর GPT-3.5-এ well over half পর্যন্ত, তাই একটি single number কখনও পূর্ণ উত্তর নয়.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.