Academic Writing

آیا ChatGPT مراجع را جعل می‌کند؟ آنچه مطالعات جعل نشان دادند

شش مطالعه، چهار حوزه، سه سال. نرخی که ChatGPT با آن یک مرجع را اختراع می‌کند از ارقام تک‌رقمی تا بیش از نیمی از موارد متغیر است، و این عدد بدون نسخه مدل و تاریخ همراه آن هیچ معنایی ندارد.

6 min
Does ChatGPT make up references: a table of studies by model version and year

در ژوئن 2025، پژوهشگران دانشگاه Deakin از GPT-4o خواستند شش مرور ادبیات درباره موضوعات سلامت روان بنویسد. از میان 176 استنادی که تولید کرد، 35 مورد اصلا وجود نداشتند. 64 مورد دیگر به مقالات واقعی اشاره می‌کردند، اما جزئیات نادرستی به آن‌ها نسبت داده شده بود. یعنی از هر پنج مرجع، یکی کاملا ساختگی بود، آن هم از مدلی که بیش از یک سال پس از آن‌که مشکل استنادات ChatGPT برای نخستین بار در چاپ اندازه‌گیری شد، منتشر شده بود.

آیا ChatGPT مراجع را می‌سازد؟ بله، و این کار را هنوز هم در 2026، روی مدل‌های فعلی، انجام می‌دهد، نه فقط روی نسخه‌ای که در 2023 خبرساز شد. پرسش باز هرگز این نبود که آیا این اتفاق می‌افتد یا نه. پرسش این است که با چه بسامدی، و این عدد با مدل، نسخه، حوزه و تاریخی که آزمون در آن اجرا شده است تغییر می‌کند.

آیا ChatGPT مراجع را می‌سازد؟

بله. یک مدل زبانی، با توجه به همه چیزهایی که پیش از آن آمده‌اند، محتمل‌ترین واژه بعدی را پیش‌بینی می‌کند. مگر آن‌که در محصول خود یک گام بازیابی یا جست‌وجو اضافه کنید، چیزی را جست‌وجو نمی‌کند. اگر رها شود تا پیش‌بینی کند یک استناد چه شکلی دارد، چیزی می‌سازد که درست به نظر می‌رسد: نام نویسنده، سال، عنوان مجله، شماره جلد، DOI، بی‌آن‌که هیچ‌یک از این موارد را با یک انتشار واقعی تطبیق دهد. بخشی از آن ممکن است به‌طور تصادفی یا بر اثر حفظ طوطی‌وار درست باشد. بخشی دیگر از ابتدا ساخته می‌شود و دقیقا همان‌قدر واقعی به نظر می‌رسد.

چرا نرخ جعل به نسخه مدل و تاریخ نیاز دارد

زیرا این نرخ یک عدد واحد نیست. در تنها مطالعه‌ای که بیشترین ارجاع را به خود گرفته است، ChatGPT-3.5، 55 درصد از استنادات را در مجموعه‌ای از مرورهای کوتاه ادبیات جعل کرد، و ChatGPT-4، که همان پژوهشگران روی همان 42 موضوع آزمودند، 18 درصد را جعل کرد. همان مطالعه، همان دستورها، همان روز آزمون. تنها چیزی که تغییر کرد مدل بود، و نرخ به دو سوم کاهش یافت.

تاریخ به همان اندازه که نام مدل اهمیت دارد، مهم است. GPT-4 در آن مطالعه به هر چیزی اشاره داشت که OpenAI در میانه 2023 ارائه می‌کرد. یک مطالعه 2026 درباره ده مدل و عامل پژوهشیِ فعلی، که در مجموع بیش از 220,000 پیوند استنادی را بررسی کرد، نرخ‌های جعل را از 3 درصد تا 13 درصد یافت، و رقم دقیق به مدل مشخص و این‌که آیا محصول از grounding جستجو یا حالت deep research استفاده می‌کرد یا نه، بستگی داشت. هیچ‌یک از این دو رقم نادرست نیست. آن‌ها چیزهای متفاوتی را توصیف می‌کنند که با فاصله‌ای نزدیک به سه سال اندازه‌گیری شده‌اند.

حوزه نیز مستقل از مدل اهمیت دارد. ما همچنین پژوهشی در اقتصاد داشته‌ایم که با همان جفت GPT-3.5 و GPT-4 انجام شد و بیش از 30 درصد از استنادهای GPT-3.5 را ساختگی و برای GPT-4 نیز نرخی همچنان بالاتر از 20 درصد یافت، که به نتیجه مطالعه میان‌رشته‌ای نزدیک است، در حالی که مطالعه مرور نظام‌مند پزشکی، که به‌طور مشخص آنچه را نسخه March 2023 از GPT-4 برچسب‌گذاری شده بود آزمود، 28.6 درصد را در تکلیفی کاملاً متفاوت اندازه‌گیری کرد: بازیابی منابع برای مرورهای نظام‌مند موجود، نه نوشتن خلاصه‌های جدید ادبیات از صفر.

آنچه مطالعات منتشرشده یافتند

شش مطالعه، که میان 2023 و 2026 و در حوزه‌های پزشکی، حقوق، اقتصاد و نگارش دانشگاهی عمومی انجام شدند، به یک نتیجه واحد می‌رسند که به شش شیوه متفاوت بیان شده است: هر منبعی را که یک ابزار AI به شما می‌دهد بررسی کنید، صرف‌نظر از این‌که کدام مدل آن را تولید کرده یا چه زمانی تولید شده است.

مطالعه و حوزهمدل و نسخهتاریخ آزموننمونهنرخ جعل
Walters and Wilder, Scientific Reports (چندرشته‌ای)ChatGPT-3.5 and ChatGPT-42023636 استناد، 42 موضوع55% (3.5) در برابر 18% (4)
Buchanan, Hill and Shapoval, The American Economist (اقتصاد)GPT-3.5 and GPT-42023پرامپت‌ها از موضوعات Journal of Economic Literatureبیش از 30% (3.5), بیش از 20% (4)
Chelli et al, JMIR (مرورهای نظام‌مند پزشکی)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Queried July 2023471 مرجع، 11 مرور39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (حقوق)ChatGPT-4 and Llama 22024پرسش‌های تصادفی پرونده‌های دادگاه فدرال58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (مرورهای سلامت روان)GPT-4oTested June 2025176 استناد، 6 مرور19.9% کاملاً ساختگی, 56% ساختگی یا معیوب
Rao, Wong and Callison-Burch, arXiv preprint (چنددامنه‌ای، عامل‌های پژوهش عمیق)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026بیش از 220,000 نشانی اینترنتی استناد3% تا 13% بسته به مدل

مطالعه حقوقی جزئیاتی را اضافه می‌کند که درصد خام آن را نشان نمی‌دهد: همان پژوهش نشان داد که مدل‌ها در پیش‌بینی توهمات خود دچار مشکل می‌شوند و معمولاً به‌جای اصلاح، پیش‌فرض نادرست کاربر درباره یک پرونده را می‌پذیرند. یک استناد ساختگی یکی از حالت‌های خطاست. مدلی که نتواند عدم‌قطعیت خود را نیز علامت‌گذاری کند، مسئله‌ای دشوارتر است، و این مشکل دقیقاً در همان حوزه‌ای آشکار می‌شود که یک استناد نادرست بیشترین هزینه را دارد.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

آیا ChatGPT از 2023 بهتر شده است؟

تا حدی، و به‌صورت نابرابر. روشن‌ترین مقایسه پیش و پس در خودِ مطالعه Walters و Wilder دیده می‌شود: GPT-3.5 به GPT-4، در همان روز، جعل از 55 درصد به 18 درصد کاهش یافت. اگر به GPT-4o در میانه 2025 برویم، نرخ اندازه‌گیری‌شده توسط تیم Linardon 19.9 درصد بود، آن هم در تکلیفی دشوارتر و محدودتر، یعنی 6 مرور ادبیات در یک حوزه پژوهشی واحد، نه خلاصه‌های کوتاه پراکنده در 42 موضوع نامرتبط. اگر دوباره پیش برویم و مدل‌هایی را در نظر بگیریم که قابلیت جست‌وجو یا deep-research در آن‌ها فعال شده بود و در اوایل 2026 آزمون شدند، دامنه برای بیشتر آن‌ها به ارقام یک‌رقمی کاهش می‌یابد، 3 تا 9 درصد، هرچند یک حالت deep-research هنوز به 13.3 درصد رسید.

هیچ‌یک از این‌ها روندی مستقیم و نزولی نیست. عدد Linardon میان رقم GPT-4 در 2023 و رقم GPT-3.5 در 2023 قرار می‌گیرد، با وجود آنکه این مدل بیش از یک سال پس از هر دو منتشر شده بود، زیرا بر تکلیفی دشوارتر آزمون شد: تولید واقعی مرور ادبیات در حوزه‌ای که بخش زیادی از مواد منبع خودِ آن نیز به‌سختی یافت می‌شود. نرخ جعل، یک مدل را در یک تکلیف و در یک تاریخ توصیف می‌کند. هر یک از این سه را تغییر دهید، عدد جابه‌جا می‌شود، گاهی به‌طور چشمگیر.

خانواده مدل تنها متغیری نیست که امروز نیز عدد را جابه‌جا می‌کند. یک مطالعه در 2025 که هشت چت‌بات رایگان، ChatGPT، Claude، Copilot، DeepSeek، Gemini، Grok، Le Chat و Perplexity را بر 400 ارجاع در پنج حوزه دانشگاهی ارزیابی کرد، نشان داد که فقط 26.5 درصد از همه ارجاعات تولیدشده کاملا درست بودند. Grok و DeepSeek در آن آزمون هیچ ارجاع جعلی تولید نکردند. Claude، Copilot و Perplexity از ضعیف‌ترین عملکردها بودند. دو محصول که بر فناوری زیربنایی قابل‌مقایسه‌ای ساخته شده بودند، در همان ماه، بر همان دستورها، در دو سرِ دامنه قرار گرفتند، و این همان درس جدول مدل و تاریخ در بالا است، با این تفاوت که اینجا به‌جای نسخه، بر محصول اعمال شده است.

چرا ارجاعات جعلی واقعی به نظر می‌رسند

یک استناد ساختگی یک جای‌نگهدارِ آشکار نیست. Walters و Wilder دریافتند که مدخل‌های ساختگیِ آنان نام‌های واقعیِ نویسندگان را داشتند، نویسندگانی که در حوزه واقعی منتشر می‌کنند، و به عنوان‌های مجلاتی پیوند می‌خوردند که واقعاً وجود دارند، و به اندازه‌ای خوب قالب‌بندی شده بودند که از یک بررسی بصریِ سریع عبور کنند. تیم Linardon چیزی دقیق‌تر یافت: از 35 استناد ساختگی‌ای که GPT-4o تولید کرد، 33 مورد DOI پیوست‌شده داشتند، و 64 درصد از آن DOIها به یک مقاله واقعی و منتشرشده درباره موضوعی کاملاً نامرتبط می‌رسیدند، نه به یک پیوند مرده و نه به یک صفحه خطا، یعنی پژوهش واقعیِ شخص دیگری به جای منبعی که وجود ندارد.

چگونه بررسی کنیم که آیا یک استناد ChatGPT واقعی است

عنوان دقیق را در Google Scholar یا در وب‌سایت خودِ مجله جست‌وجو کنید، نه این که فقط به DOI اعتماد کنید، زیرا یک DOI کارا می‌تواند به‌کلی به مقاله نادرست اشاره کند. فهرست نویسندگان، سال و مجله را با آنچه واقعاً ظاهر می‌شود تطبیق دهید، نه صرفاً این که چیزی ظاهر می‌شود. این کار را برای هر منبعی که یک چت‌بات می‌دهد انجام دهید، نه فقط آن‌هایی که ناآشنا به نظر می‌رسند، زیرا مدخل‌های ساختگی در این مطالعات دقیقاً طوری ساخته شده بودند که عادی به نظر برسند.

یک موضوع ناآشنا یا محدود را نسبت به یک موضوع جریان اصلی پرخطرتر در نظر بگیرید. تیم Linardon میزان جعل را برای یک وضعیت به‌خوبی مطالعه‌شده، یعنی major depressive disorder، نزدیک به 6 درصد و برای دو مورد کم‌مطالعه‌تر در همان مجموعه مرورها نزدیک به 30 درصد یافت. این الگو بیرون از سلامت روان نیز برقرار است: یک مدل در یک حوزه شلوغ متن واقعی بیشتری برای استخراج الگوها دارد، و در یک حوزه کم‌حجم فضای بیشتری برای ابداعِ محتمل‌نما دارد.

یک بررسی‌کننده استنادِ AI که هر مدخل را در برابر یک پایگاه داده علمی واقعی اجرا می‌کند این جست‌وجو را خودکار می‌کند، به جای آن که آن را به جست‌وجوی دستی برای هر منبعِ منفرد واگذارد، و این همان بخشی است که بیشتر افراد زیر فشارِ ضرب‌الاجل از آن می‌گذرند، یعنی دقیقاً همان شرایطی که در آن یک استناد ساختگی بیشترین احتمال را دارد که تا پیش‌نویس نهایی دوام بیاورد.

پیدا کردن آن‌ها در یک کتابنامه نهایی‌شده رویه خاص خود را دارد و صفحه مخصوص خود را نیز دارد. برای استنادهایی که واقعی هستند، استناد دادن به ChatGPT در APA به‌صورت گام‌به‌گام توضیح داده شده است.

هیچ‌یک از این‌ها نحوه قالب‌بندی یک ارجاع را پس از آنکه واقعی بودن آن را تأیید کرده‌اید، تغییر نمی‌دهد. این پرسشی جداگانه است: How to cite ChatGPT APA, MLA, Chicago و IEEE را برای خودِ تبادل پوشش می‌دهد، و یک citation generator ارجاع معمولی را به همان شیوه، صرف‌نظر از این‌که در کدام سبک می‌نویسید، مدیریت می‌کند. آنچه هیچ قالب ارجاعی نمی‌تواند اصلاح کند، ارجاع به چیزی است که هرگز منتشر نشده است. این بررسی پیش از قالب‌بندی، درباره هر ارجاع، و صرف‌نظر از این‌که کدام model پیش‌نویس شما را نوشته باشد یا برچسب آن کدام version را ادعا کند، انجام می‌شود.

Frequently Asked Questions

آیا ChatGPT مراجع را جعل می‌کند؟ بله، در هر مدلی که تاکنون آزموده شده است، در هر مطالعه منتشرشده از 2023 تا 2026. این نرخ به‌طور چشمگیری بر حسب نسخه مدل، حوزه و تاریخ تغییر می‌کند، از حدود 3 درصد در جدیدترین مدل‌های grounded تا بیش از نیمی از موارد در GPT-3.5 در 2023، بنابراین یک عدد واحد هرگز پاسخ کامل نیست.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

آیا ChatGPT مراجع را جعل می‌کند؟ مطالعات مقایسه شدند | TextPulse.ai