Academic Writing

ChatGPT কি রেফারেন্স বানিয়ে দেয়? Fabrication Studies কী পেয়েছে

6টি study, 4টি field, 3টি year. ChatGPT যে হারে একটি reference invent করে, তা single digit থেকে well over half পর্যন্ত যায়, এবং model version ও তারিখ ছাড়া এই সংখ্যা অর্থহীন.

6 min
Does ChatGPT make up references: a table of studies by model version and year

2025 সালের জুনে, Deakin University-এর গবেষকেরা GPT-4o-কে মানসিক স্বাস্থ্য বিষয়ক ছয়টি সাহিত্য পর্যালোচনা লিখতে বলেন। এটি যে 176টি উদ্ধৃতি তৈরি করেছিল, তার মধ্যে 35টি একেবারেই অস্তিত্বহীন ছিল। আরও 64টি বাস্তব প্রবন্ধের দিকে ইঙ্গিত করেছিল, কিন্তু সেগুলোর সঙ্গে ভুল বিবরণ যুক্ত ছিল। অর্থাৎ, প্রতি পাঁচটির মধ্যে একটি সূত্র সম্পূর্ণভাবে বানানো হয়েছিল, এমন একটি মডেল থেকে যা ChatGPT-এর উদ্ধৃতি-সংক্রান্ত সমস্যা প্রথম মুদ্রণে পরিমাপ করার এক বছরেরও বেশি পরে প্রকাশিত হয়েছিল।

ChatGPT কি সূত্র বানায়? হ্যাঁ, এবং এটি 2026 সালেও করে, বর্তমান মডেলগুলোতে, শুধু 2023 সালে শিরোনাম হওয়া সংস্করণে নয়। খোলা প্রশ্নটি কখনোই ছিল না যে এটি ঘটে কি না। প্রশ্নটি হলো, কত ঘন ঘন ঘটে, এবং সেই সংখ্যা মডেল, সংস্করণ, ক্ষেত্র এবং পরীক্ষা চালানোর তারিখের সঙ্গে বদলায়।

ChatGPT কি সূত্র বানায়?

হ্যাঁ। একটি ভাষা মডেল তার আগের সবকিছু বিবেচনা করে পরবর্তী সম্ভাব্য শব্দ অনুমান করে। আপনার পণ্যে যদি আপনি কোনো retrieval বা search ধাপ যোগ না করেন, তবে এটি কিছুই খোঁজে না। যদি তাকে একটি উদ্ধৃতি কেমন দেখায় তা অনুমান করতে দেওয়া হয়, তবে এটি এমন একটি উদ্ধৃতি বানাবে যা সঠিক বলে মনে হয়, লেখকের নাম, বছর, জার্নালের শিরোনাম, ভলিউম নম্বর, DOI, কিন্তু এইগুলোর কোনোটি বাস্তব প্রকাশনার সঙ্গে মেলে কি না তা যাচাই না করেই। এর কিছু অংশ কাকতালীয়ভাবে বা মুখস্থের কারণে সঠিক হতে পারে। এর কিছু অংশ একেবারে নতুন করে বানানো হবে এবং দেখতে ঠিক একই রকম হবে।

কেন একটি বানিয়ে ফেলার হারকে মডেলের সংস্করণ এবং তারিখের প্রয়োজন হয়

কারণ এই হার একটিমাত্র সংখ্যা নয়। এ বিষয়ে সবচেয়ে বেশি উদ্ধৃত এক গবেষণায়, ChatGPT-3.5 সংক্ষিপ্ত সাহিত্য পর্যালোচনার একটি সেটে থাকা 55 শতাংশ উদ্ধৃতি বানিয়েছিল, এবং একই গবেষকেরা একই 42টি বিষয়ের ওপর পরীক্ষা করা ChatGPT-4-এ 18 শতাংশ উদ্ধৃতি বানানো পেয়েছিলেন। একই গবেষণা, একই প্রম্পট, পরীক্ষার একই দিন। কেবল যে জিনিসটি বদলেছিল তা হলো মডেল, এবং হার দুই-তৃতীয়াংশ কমে গিয়েছিল।

তারিখ মডেলের নামের মতোই গুরুত্বপূর্ণ। ওই গবেষণায় GPT-4 বলতে 2023 সালের মাঝামাঝি সময়ে OpenAI যা সরবরাহ করছিল, সেটিকেই বোঝানো হয়েছিল। 2026 সালের একটি গবেষণায় দশটি বর্তমান মডেল এবং গবেষণা এজেন্ট পরীক্ষা করে, মোট 220,000-এর বেশি উদ্ধৃতি-লিংক যাচাই করে, 3 শতাংশ থেকে 13 শতাংশ পর্যন্ত জালিয়াতির হার পাওয়া যায়, যেখানে সুনির্দিষ্ট হারটি নির্ভর করেছিল নির্দিষ্ট মডেলের ওপর এবং পণ্যটি search grounding ব্যবহার করেছিল কি না বা deep research mode ব্যবহার করেছিল কি না তার ওপর। কোনো হারই ভুল নয়। তারা প্রায় তিন বছর ব্যবধানে মাপা ভিন্ন জিনিস বর্ণনা করে।

ক্ষেত্রও গুরুত্বপূর্ণ, মডেল থেকে স্বাধীনভাবে। অর্থনীতির গবেষণায়ও একই GPT-3.5 এবং GPT-4 যুগল ব্যবহার করে দেখা গেছে GPT-3.5 উদ্ধৃতির 30 শতাংশের বেশি উদ্ভাবিত, আর GPT-4-এর হারও 20 শতাংশের ওপরে, যা বহুবিষয়ক গবেষণায় পাওয়া ফলের কাছাকাছি। অন্যদিকে, চিকিৎসা-সিস্টেম্যাটিক-রিভিউ গবেষণায়, বিশেষভাবে GPT-4-এর March 2023 build হিসেবে চিহ্নিত সংস্করণটি পরীক্ষা করে, 28.6 শতাংশ মাপা হয়েছিল একেবারে ভিন্ন একটি কাজে, বিদ্যমান systematic reviews-এর জন্য রেফারেন্স সংগ্রহ করা, নতুন সাহিত্য-সারসংক্ষেপ শুরু থেকে লেখা নয়।

প্রকাশিত গবেষণাগুলি কী পেয়েছে

2023 থেকে 2026 সালের মধ্যে, চিকিৎসাবিজ্ঞান, আইন, অর্থনীতি এবং সাধারণ একাডেমিক লেখালেখি জুড়ে পরিচালিত ছয়টি গবেষণা একই সিদ্ধান্তে পৌঁছায়, যা ছয়ভাবে বলা হয়েছে, AI টুল যে রেফারেন্সই দিক না কেন, সেটি যাচাই করুন, তা যে মডেলই তৈরি করুক বা যখনই তৈরি করুক।

অধ্যয়ন ও ক্ষেত্রমডেল ও সংস্করণপরীক্ষার তারিখনমুনাজালিয়াতির হার
Walters and Wilder, Scientific Reports (বহুবিষয়ক)ChatGPT-3.5 and ChatGPT-42023636টি উদ্ধৃতি, 42টি বিষয়55% (3.5) বনাম 18% (4)
Buchanan, Hill and Shapoval, The American Economist (অর্থনীতি)GPT-3.5 and GPT-42023Journal of Economic Literature-এর বিষয়বস্তুর প্রম্পট30%-এর বেশি (3.5), 20%-এর বেশি (4)
Chelli et al, JMIR (চিকিৎসাবিষয়ক পদ্ধতিগত পর্যালোচনা)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)জুলাই 2023-এ অনুসন্ধান করা হয়েছে471টি রেফারেন্স, 11টি পর্যালোচনা39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (আইন)ChatGPT-4 and Llama 22024ফেডারেল আদালতের মামলার এলোমেলো প্রশ্ন58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (মানসিক স্বাস্থ্য পর্যালোচনা)GPT-4oজুন 2025-এ পরীক্ষা করা হয়েছে176টি উদ্ধৃতি, 6টি পর্যালোচনা19.9% সম্পূর্ণভাবে জাল, 56% জাল বা ত্রুটিপূর্ণ
Rao, Wong and Callison-Burch, arXiv preprint (বহু-ডোমেইন, deep research agents)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026220,000-এর বেশি উদ্ধৃতি URLমডেলের ওপর নির্ভর করে 3% থেকে 13%

আইনসংক্রান্ত গবেষণাটি একটি এমন বিশদ যোগ করে, যা কাঁচা শতাংশে ধরা পড়ে না: একই গবেষণায় দেখা গেছে যে মডেলগুলো নিজেদের hallucinations পূর্বাভাস দিতে হিমশিম খায় এবং কোনো মামলার বিষয়ে ব্যবহারকারীর ভুল ধারণা সংশোধন করার বদলে তা মেনে নিতে প্রবণ। একটি জাল উদ্ধৃতি একটি ব্যর্থতার ধরন। যে মডেল নিজের অনিশ্চয়তাও চিহ্নিত করতে পারে না, তা আরও কঠিন সমস্যা, এবং এটি সবচেয়ে বেশি দেখা যায় ঠিক সেই ক্ষেত্রেই, যেখানে ভুল উদ্ধৃতির মূল্য সবচেয়ে বেশি।

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

2023 সালের পর থেকে ChatGPT কি আরও ভালো হয়েছে?

কিছুটা, এবং অসমভাবে। সবচেয়ে স্পষ্ট একক আগে-পরের তুলনা Walters and Wilder গবেষণাতেই দেখা যায়: GPT-3.5 থেকে GPT-4, একই দিনে, কল্পিত তথ্যের হার 55 শতাংশ থেকে 18 শতাংশে নেমে আসে। 2025 সালের মাঝামাঝি GPT-4o-তে এগোলে, এবং Linardon-এর দলের মাপা হারে, তা ছিল 19.9 শতাংশ, তবে এটি ছিল আরও কঠিন এবং সংকীর্ণ একটি কাজে, একক গবেষণা ক্ষেত্রে 6টি সাহিত্য পর্যালোচনা, 42টি সম্পর্কহীন বিষয়ের মধ্যে ছড়িয়ে থাকা সংক্ষিপ্ত সারাংশের বদলে। আবার এগোলে, 2026 সালের শুরুতে পরীক্ষা করা search বা deep-research বৈশিষ্ট্য চালু থাকা মডেলগুলিতে, অধিকাংশের ক্ষেত্রে হার এক অঙ্কে নেমে আসে, 3 থেকে 9 শতাংশ, যদিও একটি deep-research মোড এখনও 13.3 শতাংশে পৌঁছেছিল।

এর কোনোটিই সরলরেখায় নিচের দিকে নামা নয়। Linardon-এর সংখ্যা 2023 সালের GPT-4-এর মান এবং 2023 সালের GPT-3.5-এর মানের মাঝামাঝি অবস্থানে আছে, এমন একটি মডেলে যা উভয়েরও এক বছরের বেশি পরে প্রকাশিত হয়েছিল, কারণ এটি আরও কঠিন একটি কাজে পরীক্ষা করা হয়েছিল: এমন একটি ক্ষেত্রে বাস্তব সাহিত্য পর্যালোচনা তৈরি, যেখানে উৎস উপাদানের বড় অংশই খুঁজে পাওয়া কঠিন। কল্পিত তথ্যের হার একটি নির্দিষ্ট তারিখে একটি নির্দিষ্ট কাজে একটি মডেলকে বর্ণনা করে। এই তিনটির যেকোনো একটিতে পরিবর্তন আনলে সংখ্যাটিও বদলায়, কখনও অনেকটাই।

আজও সংখ্যাটিকে যে একমাত্র চলক বদলায় তা মডেল পরিবার নয়। 2025 সালের একটি গবেষণায় পাঁচটি একাডেমিক ক্ষেত্রে 400টি রেফারেন্সের ওপর আটটি বিনামূল্যের চ্যাটবট, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat এবং Perplexity, মূল্যায়ন করে দেখা যায় যে উৎপন্ন সব রেফারেন্সের মাত্র 26.5 শতাংশ সম্পূর্ণ সঠিক ছিল। সেই পরীক্ষায় Grok এবং DeepSeek শূন্য কল্পিত রেফারেন্স তৈরি করেছিল। Claude, Copilot এবং Perplexity ছিল সবচেয়ে দুর্বল কর্মদক্ষতার মধ্যে। তুলনীয় অন্তর্নিহিত প্রযুক্তির ওপর নির্মিত দুটি পণ্য, একই মাসে, একই প্রম্পটে পরীক্ষা করা হলে, পরিসরের বিপরীত প্রান্তে অবস্থান করেছিল, এবং এটি উপরের model-and-date সারণিরই একই শিক্ষা, তবে version-এর বদলে product-এর ক্ষেত্রে প্রয়োগ করা।

কল্পিত উদ্ধৃতিগুলি কেন বাস্তব দেখায়

একটি fabricated citation কোনো স্পষ্ট placeholder নয়। Walters এবং Wilder দেখেছেন, তাদের উদ্ভাবিত entries-এ বাস্তব author names ছিল, এমন authors যারা প্রকৃত ক্ষেত্রটিতে publish করেন, journal titles-এর সঙ্গে যুক্ত, যেগুলো সত্যিই exist করে, এবং এমনভাবে formatted যে দ্রুত visual check-এ pass করতে পারে। Linardon's team আরও তীক্ষ্ণ একটি বিষয় খুঁজে পায়: GPT-4o যে 35টি fabricated citations তৈরি করেছিল, তার মধ্যে 33টির সঙ্গে একটি DOI attached ছিল, এবং সেই DOIগুলোর 64 percent একটি real, published paper-এ নিয়ে গিয়েছিল, যা সম্পূর্ণ unrelated topic-এর ওপর ছিল, dead linkও নয়, error pageও নয়, বরং অন্য কারও actual research, যা এমন একটি source-এর জায়গা নিয়েছিল যা exist করে না।

একটি ChatGPT Citation বাস্তব কি না, কীভাবে যাচাই করবেন

শুধু DOI-এর ওপর ভরসা না করে Google Scholar বা journal-এর নিজস্ব site-এ exact title খুঁজুন, কারণ একটি working DOI সম্পূর্ণ ভিন্ন paper-এর দিকেও নির্দেশ করতে পারে। author list, year এবং journal যা সত্যিই উঠে আসে তার সঙ্গে মেলে কি না নিশ্চিত করুন, শুধু কিছু একটা উঠে আসে কি না তা নয়। chatbot আপনাকে যে প্রতিটি reference দেয়, তার জন্যই এটি করুন, কেবল unfamiliar দেখায় এমনগুলোর জন্য নয়, কারণ এই studies-এ fabricated entries বিশেষভাবে ordinary দেখানোর জন্য তৈরি করা হয়েছিল।

অপরিচিত বা সংকীর্ণ topic-কে mainstream topic-এর তুলনায় বেশি risk হিসেবে বিবেচনা করুন। Linardon's team একটি well-studied condition, major depressive disorder, এর ক্ষেত্রে fabrication প্রায় 6 percent পেয়েছে, এবং একই set of reviews-এ আরও কম studied দুটি condition-এর ক্ষেত্রে প্রায় 30 percent পেয়েছে। এই pattern mental health-এর বাইরেও বজায় থাকে: crowded field-এ একটি model-এর কাছে pattern আঁকার জন্য বেশি real text থাকে, আর thin field-এ plausibly invent করার জন্য বেশি জায়গা থাকে।

একটি AI citation checker যা প্রতিটি entry-কে real scholarly database-এর বিরুদ্ধে চালায় এই search-কে automate করে, প্রতিটি reference-এর জন্য manual lookup-এর ওপর ছেড়ে দেয় না, আর deadline pressure-এর মধ্যে অধিকাংশ মানুষ যে অংশটি skip করে, সেটিই হলো সেই exact condition, যার অধীনে একটি fabricated citation final draft-এ টিকে যাওয়ার সবচেয়ে বেশি সম্ভাবনা রাখে।

একটি finished bibliography-তে সেগুলো খুঁজে বের করা নিজস্ব একটি procedure, এবং এর জন্য আলাদা page আছে। যে citations বাস্তব, সেগুলোর জন্য APA-তে ChatGPT উদ্ধৃত করা ধাপে ধাপে ব্যাখ্যা করা হয়েছে।

আপনি একবার নিশ্চিত হয়ে গেলে যে এটি বাস্তব, তখন উদ্ধৃতি কীভাবে বিন্যাস করবেন, তার ওপর এর কোনোটিই প্রভাব ফেলে না। এটি একটি পৃথক প্রশ্ন: How to cite ChatGPT APA, MLA, Chicago এবং IEEE কভার করে বিনিময়টির জন্য, এবং একটি citation generator সাধারণ রেফারেন্সটি পরিচালনা করে একইভাবে, আপনি যে শৈলীতেই লিখুন না কেন। কোনো citation format যা ঠিক করতে পারে না, তা হলো এমন কিছুর প্রতি রেফারেন্স, যা কখনোই প্রকাশিত হয়নি। সেই যাচাইটি বিন্যাসের আগে ঘটে, প্রতিটি রেফারেন্সে, আপনার খসড়া কোন model লিখেছে বা তার label কোন version দাবি করছে, তা নির্বিশেষে।

Frequently Asked Questions

ChatGPT কি রেফারেন্স বানিয়ে দেয়? হ্যাঁ, এখন পর্যন্ত tested প্রতিটি model-এ, এবং 2023 থেকে 2026 পর্যন্ত প্রতিটি published study-তে। এই হার model version, field এবং date অনুযায়ী অত্যন্ত ভিন্ন, সবচেয়ে recent grounded model-এ প্রায় 3 percent থেকে শুরু করে 2023-এর GPT-3.5-এ well over half পর্যন্ত, তাই একটি single number কখনও পূর্ণ উত্তর নয়.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

ChatGPT কি রেফারেন্স বানিয়ে দেয়? Studies তুলনা | TextPulse.ai