آیا ChatGPT مراجع را جعل میکند؟ آنچه مطالعات جعل نشان دادند
شش مطالعه، چهار حوزه، سه سال. نرخی که ChatGPT با آن یک مرجع را اختراع میکند از ارقام تکرقمی تا بیش از نیمی از موارد متغیر است، و این عدد بدون نسخه مدل و تاریخ همراه آن هیچ معنایی ندارد.
در ژوئن 2025، پژوهشگران دانشگاه Deakin از GPT-4o خواستند شش مرور ادبیات درباره موضوعات سلامت روان بنویسد. از میان 176 استنادی که تولید کرد، 35 مورد اصلا وجود نداشتند. 64 مورد دیگر به مقالات واقعی اشاره میکردند، اما جزئیات نادرستی به آنها نسبت داده شده بود. یعنی از هر پنج مرجع، یکی کاملا ساختگی بود، آن هم از مدلی که بیش از یک سال پس از آنکه مشکل استنادات ChatGPT برای نخستین بار در چاپ اندازهگیری شد، منتشر شده بود.
آیا ChatGPT مراجع را میسازد؟ بله، و این کار را هنوز هم در 2026، روی مدلهای فعلی، انجام میدهد، نه فقط روی نسخهای که در 2023 خبرساز شد. پرسش باز هرگز این نبود که آیا این اتفاق میافتد یا نه. پرسش این است که با چه بسامدی، و این عدد با مدل، نسخه، حوزه و تاریخی که آزمون در آن اجرا شده است تغییر میکند.
آیا ChatGPT مراجع را میسازد؟
بله. یک مدل زبانی، با توجه به همه چیزهایی که پیش از آن آمدهاند، محتملترین واژه بعدی را پیشبینی میکند. مگر آنکه در محصول خود یک گام بازیابی یا جستوجو اضافه کنید، چیزی را جستوجو نمیکند. اگر رها شود تا پیشبینی کند یک استناد چه شکلی دارد، چیزی میسازد که درست به نظر میرسد: نام نویسنده، سال، عنوان مجله، شماره جلد، DOI، بیآنکه هیچیک از این موارد را با یک انتشار واقعی تطبیق دهد. بخشی از آن ممکن است بهطور تصادفی یا بر اثر حفظ طوطیوار درست باشد. بخشی دیگر از ابتدا ساخته میشود و دقیقا همانقدر واقعی به نظر میرسد.
چرا نرخ جعل به نسخه مدل و تاریخ نیاز دارد
زیرا این نرخ یک عدد واحد نیست. در تنها مطالعهای که بیشترین ارجاع را به خود گرفته است، ChatGPT-3.5، 55 درصد از استنادات را در مجموعهای از مرورهای کوتاه ادبیات جعل کرد، و ChatGPT-4، که همان پژوهشگران روی همان 42 موضوع آزمودند، 18 درصد را جعل کرد. همان مطالعه، همان دستورها، همان روز آزمون. تنها چیزی که تغییر کرد مدل بود، و نرخ به دو سوم کاهش یافت.
تاریخ به همان اندازه که نام مدل اهمیت دارد، مهم است. GPT-4 در آن مطالعه به هر چیزی اشاره داشت که OpenAI در میانه 2023 ارائه میکرد. یک مطالعه 2026 درباره ده مدل و عامل پژوهشیِ فعلی، که در مجموع بیش از 220,000 پیوند استنادی را بررسی کرد، نرخهای جعل را از 3 درصد تا 13 درصد یافت، و رقم دقیق به مدل مشخص و اینکه آیا محصول از grounding جستجو یا حالت deep research استفاده میکرد یا نه، بستگی داشت. هیچیک از این دو رقم نادرست نیست. آنها چیزهای متفاوتی را توصیف میکنند که با فاصلهای نزدیک به سه سال اندازهگیری شدهاند.
حوزه نیز مستقل از مدل اهمیت دارد. ما همچنین پژوهشی در اقتصاد داشتهایم که با همان جفت GPT-3.5 و GPT-4 انجام شد و بیش از 30 درصد از استنادهای GPT-3.5 را ساختگی و برای GPT-4 نیز نرخی همچنان بالاتر از 20 درصد یافت، که به نتیجه مطالعه میانرشتهای نزدیک است، در حالی که مطالعه مرور نظاممند پزشکی، که بهطور مشخص آنچه را نسخه March 2023 از GPT-4 برچسبگذاری شده بود آزمود، 28.6 درصد را در تکلیفی کاملاً متفاوت اندازهگیری کرد: بازیابی منابع برای مرورهای نظاممند موجود، نه نوشتن خلاصههای جدید ادبیات از صفر.
آنچه مطالعات منتشرشده یافتند
شش مطالعه، که میان 2023 و 2026 و در حوزههای پزشکی، حقوق، اقتصاد و نگارش دانشگاهی عمومی انجام شدند، به یک نتیجه واحد میرسند که به شش شیوه متفاوت بیان شده است: هر منبعی را که یک ابزار AI به شما میدهد بررسی کنید، صرفنظر از اینکه کدام مدل آن را تولید کرده یا چه زمانی تولید شده است.
| مطالعه و حوزه | مدل و نسخه | تاریخ آزمون | نمونه | نرخ جعل |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (چندرشتهای) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 استناد، 42 موضوع | 55% (3.5) در برابر 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (اقتصاد) | GPT-3.5 and GPT-4 | 2023 | پرامپتها از موضوعات Journal of Economic Literature | بیش از 30% (3.5), بیش از 20% (4) |
| Chelli et al, JMIR (مرورهای نظاممند پزشکی) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 مرجع، 11 مرور | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (حقوق) | ChatGPT-4 and Llama 2 | 2024 | پرسشهای تصادفی پروندههای دادگاه فدرال | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (مرورهای سلامت روان) | GPT-4o | Tested June 2025 | 176 استناد، 6 مرور | 19.9% کاملاً ساختگی, 56% ساختگی یا معیوب |
| Rao, Wong and Callison-Burch, arXiv preprint (چنددامنهای، عاملهای پژوهش عمیق) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | بیش از 220,000 نشانی اینترنتی استناد | 3% تا 13% بسته به مدل |
مطالعه حقوقی جزئیاتی را اضافه میکند که درصد خام آن را نشان نمیدهد: همان پژوهش نشان داد که مدلها در پیشبینی توهمات خود دچار مشکل میشوند و معمولاً بهجای اصلاح، پیشفرض نادرست کاربر درباره یک پرونده را میپذیرند. یک استناد ساختگی یکی از حالتهای خطاست. مدلی که نتواند عدمقطعیت خود را نیز علامتگذاری کند، مسئلهای دشوارتر است، و این مشکل دقیقاً در همان حوزهای آشکار میشود که یک استناد نادرست بیشترین هزینه را دارد.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
آیا ChatGPT از 2023 بهتر شده است؟
تا حدی، و بهصورت نابرابر. روشنترین مقایسه پیش و پس در خودِ مطالعه Walters و Wilder دیده میشود: GPT-3.5 به GPT-4، در همان روز، جعل از 55 درصد به 18 درصد کاهش یافت. اگر به GPT-4o در میانه 2025 برویم، نرخ اندازهگیریشده توسط تیم Linardon 19.9 درصد بود، آن هم در تکلیفی دشوارتر و محدودتر، یعنی 6 مرور ادبیات در یک حوزه پژوهشی واحد، نه خلاصههای کوتاه پراکنده در 42 موضوع نامرتبط. اگر دوباره پیش برویم و مدلهایی را در نظر بگیریم که قابلیت جستوجو یا deep-research در آنها فعال شده بود و در اوایل 2026 آزمون شدند، دامنه برای بیشتر آنها به ارقام یکرقمی کاهش مییابد، 3 تا 9 درصد، هرچند یک حالت deep-research هنوز به 13.3 درصد رسید.
هیچیک از اینها روندی مستقیم و نزولی نیست. عدد Linardon میان رقم GPT-4 در 2023 و رقم GPT-3.5 در 2023 قرار میگیرد، با وجود آنکه این مدل بیش از یک سال پس از هر دو منتشر شده بود، زیرا بر تکلیفی دشوارتر آزمون شد: تولید واقعی مرور ادبیات در حوزهای که بخش زیادی از مواد منبع خودِ آن نیز بهسختی یافت میشود. نرخ جعل، یک مدل را در یک تکلیف و در یک تاریخ توصیف میکند. هر یک از این سه را تغییر دهید، عدد جابهجا میشود، گاهی بهطور چشمگیر.
خانواده مدل تنها متغیری نیست که امروز نیز عدد را جابهجا میکند. یک مطالعه در 2025 که هشت چتبات رایگان، ChatGPT، Claude، Copilot، DeepSeek، Gemini، Grok، Le Chat و Perplexity را بر 400 ارجاع در پنج حوزه دانشگاهی ارزیابی کرد، نشان داد که فقط 26.5 درصد از همه ارجاعات تولیدشده کاملا درست بودند. Grok و DeepSeek در آن آزمون هیچ ارجاع جعلی تولید نکردند. Claude، Copilot و Perplexity از ضعیفترین عملکردها بودند. دو محصول که بر فناوری زیربنایی قابلمقایسهای ساخته شده بودند، در همان ماه، بر همان دستورها، در دو سرِ دامنه قرار گرفتند، و این همان درس جدول مدل و تاریخ در بالا است، با این تفاوت که اینجا بهجای نسخه، بر محصول اعمال شده است.
چرا ارجاعات جعلی واقعی به نظر میرسند
یک استناد ساختگی یک جاینگهدارِ آشکار نیست. Walters و Wilder دریافتند که مدخلهای ساختگیِ آنان نامهای واقعیِ نویسندگان را داشتند، نویسندگانی که در حوزه واقعی منتشر میکنند، و به عنوانهای مجلاتی پیوند میخوردند که واقعاً وجود دارند، و به اندازهای خوب قالببندی شده بودند که از یک بررسی بصریِ سریع عبور کنند. تیم Linardon چیزی دقیقتر یافت: از 35 استناد ساختگیای که GPT-4o تولید کرد، 33 مورد DOI پیوستشده داشتند، و 64 درصد از آن DOIها به یک مقاله واقعی و منتشرشده درباره موضوعی کاملاً نامرتبط میرسیدند، نه به یک پیوند مرده و نه به یک صفحه خطا، یعنی پژوهش واقعیِ شخص دیگری به جای منبعی که وجود ندارد.
چگونه بررسی کنیم که آیا یک استناد ChatGPT واقعی است
عنوان دقیق را در Google Scholar یا در وبسایت خودِ مجله جستوجو کنید، نه این که فقط به DOI اعتماد کنید، زیرا یک DOI کارا میتواند بهکلی به مقاله نادرست اشاره کند. فهرست نویسندگان، سال و مجله را با آنچه واقعاً ظاهر میشود تطبیق دهید، نه صرفاً این که چیزی ظاهر میشود. این کار را برای هر منبعی که یک چتبات میدهد انجام دهید، نه فقط آنهایی که ناآشنا به نظر میرسند، زیرا مدخلهای ساختگی در این مطالعات دقیقاً طوری ساخته شده بودند که عادی به نظر برسند.
یک موضوع ناآشنا یا محدود را نسبت به یک موضوع جریان اصلی پرخطرتر در نظر بگیرید. تیم Linardon میزان جعل را برای یک وضعیت بهخوبی مطالعهشده، یعنی major depressive disorder، نزدیک به 6 درصد و برای دو مورد کممطالعهتر در همان مجموعه مرورها نزدیک به 30 درصد یافت. این الگو بیرون از سلامت روان نیز برقرار است: یک مدل در یک حوزه شلوغ متن واقعی بیشتری برای استخراج الگوها دارد، و در یک حوزه کمحجم فضای بیشتری برای ابداعِ محتملنما دارد.
یک بررسیکننده استنادِ AI که هر مدخل را در برابر یک پایگاه داده علمی واقعی اجرا میکند این جستوجو را خودکار میکند، به جای آن که آن را به جستوجوی دستی برای هر منبعِ منفرد واگذارد، و این همان بخشی است که بیشتر افراد زیر فشارِ ضربالاجل از آن میگذرند، یعنی دقیقاً همان شرایطی که در آن یک استناد ساختگی بیشترین احتمال را دارد که تا پیشنویس نهایی دوام بیاورد.
پیدا کردن آنها در یک کتابنامه نهاییشده رویه خاص خود را دارد و صفحه مخصوص خود را نیز دارد. برای استنادهایی که واقعی هستند، استناد دادن به ChatGPT در APA بهصورت گامبهگام توضیح داده شده است.
هیچیک از اینها نحوه قالببندی یک ارجاع را پس از آنکه واقعی بودن آن را تأیید کردهاید، تغییر نمیدهد. این پرسشی جداگانه است: How to cite ChatGPT APA, MLA, Chicago و IEEE را برای خودِ تبادل پوشش میدهد، و یک citation generator ارجاع معمولی را به همان شیوه، صرفنظر از اینکه در کدام سبک مینویسید، مدیریت میکند. آنچه هیچ قالب ارجاعی نمیتواند اصلاح کند، ارجاع به چیزی است که هرگز منتشر نشده است. این بررسی پیش از قالببندی، درباره هر ارجاع، و صرفنظر از اینکه کدام model پیشنویس شما را نوشته باشد یا برچسب آن کدام version را ادعا کند، انجام میشود.
Frequently Asked Questions
آیا ChatGPT مراجع را جعل میکند؟ بله، در هر مدلی که تاکنون آزموده شده است، در هر مطالعه منتشرشده از 2023 تا 2026. این نرخ بهطور چشمگیری بر حسب نسخه مدل، حوزه و تاریخ تغییر میکند، از حدود 3 درصد در جدیدترین مدلهای grounded تا بیش از نیمی از موارد در GPT-3.5 در 2023، بنابراین یک عدد واحد هرگز پاسخ کامل نیست.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.