هل ChatGPT يختلق المراجع؟ ما الذي وجدته دراسات الاختلاق
ست دراسات، أربعة مجالات، ثلاث سنوات. يتراوح المعدل الذي يختلق به ChatGPT مرجعًا من أرقام أحادية إلى أكثر من النصف بكثير، ولا يعني الرقم شيئًا من دون إصدار النموذج والتاريخ المرفقين به.
في يونيو 2025، طلب باحثون في Deakin University من GPT-4o أن يكتب ستة مراجعات أدبية عن موضوعات الصحة النفسية. ومن بين 176 إحالة أنتجها، لم يكن 35 منها موجودًا إطلاقًا. وأشارت 64 إحالة أخرى إلى أوراق حقيقية لكن مع تفاصيل خاطئة مرفقة بها. أي إن إحالة واحدة من كل خمس كانت مختلقة بالكامل، وذلك من نموذج صدر بعد أكثر من عام على قياس مشكلة الإحالات في ChatGPT لأول مرة في منشور مطبوع.
هل يختلق ChatGPT المراجع؟ نعم، وهو لا يزال يفعل ذلك في 2026، على النماذج الحالية، وليس فقط على النسخة التي تصدرت العناوين في 2023. ولم يكن السؤال المفتوح قط ما إذا كان هذا يحدث. بل كان كم مرة يحدث، وهذا الرقم يتغير بحسب النموذج، والإصدار، والمجال، والتاريخ الذي أُجري فيه الاختبار.
هل يختلق ChatGPT المراجع؟
نعم. يتنبأ نموذج اللغة بالكلمة التالية المحتملة اعتمادًا على كل ما يسبقه. وهو لا يبحث في أي شيء إلا إذا أضفت خطوة استرجاع أو بحث في منتجك. وإذا تُرك ليتنبأ بشكل الإحالة، فسوف يصنع إحالة تبدو صحيحة: اسم المؤلف، السنة، عنوان المجلة، رقم المجلد، DOI، من دون التحقق من أن أيًا من ذلك يطابق منشورًا حقيقيًا. قد يكون بعض ذلك صحيحًا بالمصادفة أو بالحفظ الآلي. وقد يكون بعضه مختلقًا من الصفر ويبدو مطابقًا تمامًا.
لماذا يحتاج معدل الاختلاق إلى إصدار نموذج وتاريخ
لأن المعدل ليس رقمًا واحدًا. ففي الدراسة الأكثر استشهادًا في هذا الشأن، اختلق ChatGPT-3.5 نسبة 55 percent من الإحالات في مجموعة من المراجعات الأدبية القصيرة، بينما اختلق ChatGPT-4، الذي اختبره الباحثون أنفسهم على الموضوعات نفسها وعددها 42، نسبة 18 percent. الدراسة نفسها، والطلبات نفسها، ويوم الاختبار نفسه. الشيء الوحيد الذي تغير كان النموذج، وانخفض المعدل بمقدار الثلثين.
التاريخ لا يقل أهمية عن اسم النموذج. كان GPT-4 في تلك الدراسة يعني أي شيء كانت OpenAI تتيحه في منتصف 2023. ووجدت دراسة أجريت في 2026 على عشرة نماذج حالية ووكلاء بحث، مع فحص أكثر من 220,000 رابط استشهاد في المجموع، معدلات تلفيق تراوحت من 3 percent إلى 13 percent، مع اعتماد الرقم الدقيق على النموذج المحدد وعلى ما إذا كان المنتج يستخدم grounding للبحث أو وضع research عميق. ولا يعد أي من الرقمين خطأ. فهما يصفان أشياء مختلفة قيسَت بفاصل يقارب ثلاث سنوات.
ويهم المجال أيضا، بمعزل عن النموذج. وقد وجدنا أيضا أن بحثا في economics أُجري عبر الاقتران نفسه بين GPT-3.5 وGPT-4 كشف أن أكثر من 30 percent من استشهادات GPT-3.5 مختلقة، وأن المعدل ما يزال فوق 20 percent بالنسبة إلى GPT-4، وهو قريب مما وجدته الدراسة متعددة التخصصات، بينما قاست دراسة المراجعة المنهجية الطبية، التي اختبرت ما وُصف بأنه إصدار March 2023 من GPT-4 تحديدا، نسبة 28.6 percent في مهمة مختلفة تماما: استخراج المراجع للمراجعات المنهجية القائمة بدلا من كتابة ملخصات أدبية جديدة من الصفر.
ما الذي وجدته الدراسات المنشورة
ست دراسات، أُجريت بين 2023 و2026، عبر الطب والقانون وeconomics والكتابة الأكاديمية العامة، تتقارب على النتيجة نفسها المصاغة بست طرق مختلفة: تحقّق من كل مرجع يقدمه لك أداة AI، بغض النظر عن النموذج الذي أنتجه أو عن وقت إنتاجه.
| الدراسة والمجال | النموذج والإصدار | تاريخ الاختبار | العينة | معدل الاختلاق |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (متعدد التخصصات) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 استشهادًا، 42 موضوعًا | 55% (3.5) مقابل 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (الاقتصاد) | GPT-3.5 and GPT-4 | 2023 | مطالبات من موضوعات Journal of Economic Literature | أكثر من 30% (3.5)، وأكثر من 20% (4) |
| Chelli et al, JMIR (المراجعات المنهجية الطبية) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | تم الاستعلام في يوليو 2023 | 471 مرجعًا، 11 مراجعة | 39.6% (3.5)، 28.6% (4)، 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (القانون) | ChatGPT-4 and Llama 2 | 2024 | أسئلة عشوائية عن قضايا المحاكم الفيدرالية | 58% (ChatGPT-4)، 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (مراجعات الصحة النفسية) | GPT-4o | تم الاختبار في يونيو 2025 | 176 استشهادًا، 6 مراجعات | 19.9% مختلق بالكامل، 56% مختلق أو معيب |
| Rao, Wong and Callison-Burch, arXiv preprint (متعدد المجالات، وكلاء البحث العميق) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | أكثر من 220,000 عنوان URL للاستشهادات | 3% إلى 13% بحسب النموذج |
تضيف الدراسة القانونية تفصيلًا لا تلتقطه النسبة المئوية الخام: فقد وجدت الدراسة نفسها أن النماذج تواجه صعوبة في التنبؤ بهلوساتها الخاصة وتميل إلى قبول المقدمة الخاطئة التي يطرحها المستخدم عن قضية ما بدلًا من تصحيحها. الاستشهاد المختلق أحد أنماط الفشل. أما النموذج الذي لا يستطيع أيضًا الإشارة إلى عدم يقينه الخاص، فهذه مشكلة أصعب، وتظهر بأوضح صورة في المجال نفسه الذي تكون فيه كلفة الاستشهاد الخاطئ هي الأعلى.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
هل أصبح ChatGPT أفضل منذ 2023؟
إلى حد ما، وبصورة غير متساوية. أوضح مقارنة منفردة قبل وبعد تظهر في دراسة Walters وWilder نفسها: من GPT-3.5 إلى GPT-4، وفي اليوم نفسه، انخفض التوليد المختلق من 55 percent إلى 18 percent. وإذا انتقلنا إلى GPT-4o في منتصف 2025، فإن المعدل الذي قاسه فريق Linardon كان 19.9 percent، وذلك في مهمة أصعب وأضيق، وهي 6 مراجعات أدبية في مجال بحثي واحد بدلًا من ملخصات قصيرة موزعة على 42 موضوعًا غير مرتبط. وإذا انتقلنا مرة أخرى إلى النماذج التي فُعِّلت فيها ميزات البحث أو deep-research، والمختبرة في أوائل 2026، فإن النطاق يهبط إلى أرقام أحادية لدى معظمها، من 3 إلى 9 percent، رغم أن أحد أوضاع deep-research بلغ 13.3 percent.
ولا شيء من ذلك خط مستقيم هابط. تقع قيمة Linardon بين رقم GPT-4 لعام 2023 ورقم GPT-3.5 لعام 2023، على نموذج أُطلق بعد أكثر من عام من كليهما، لأنه اختُبر على مهمة أصعب: توليد مراجعة أدبية حقيقية في مجال يصعب العثور على كثير من مادته المصدرية أصلًا. إن معدل التوليد المختلق يصف نموذجًا في مهمة وفي تاريخ محددين. غيّر أي واحد من هذه الثلاثة، ويتحرك الرقم، وأحيانًا بدرجة كبيرة.
إن عائلة النموذج ليست المتغير الوحيد الذي لا يزال يغيّر الرقم اليوم. فقد وجدت دراسة نُشرت في 2025 قيّمت 8 روبوتات محادثة مجانية، ChatGPT وClaude وCopilot وDeepSeek وGemini وGrok وLe Chat وPerplexity، على 400 مرجع عبر 5 مجالات أكاديمية، أن 26.5 percent فقط من جميع المراجع المولدة كانت صحيحة بالكامل. وقد أنتج Grok وDeepSeek صفرًا من المراجع المختلقة في ذلك الاختبار. وكان Claude وCopilot وPerplexity من بين الأسوأ أداءً. إن منتجين مبنيين على تقنية أساسية متقاربة، اختُبرا في الشهر نفسه، وعلى المطالبات نفسها، وصلا إلى طرفين متقابلين من النطاق، وهذه هي العبرة نفسها التي يوضحها الجدول أعلاه الخاص بالنموذج والتاريخ، ولكن مطبقة على المنتج بدلًا من الإصدار.
لماذا تبدو الاستشهادات المختلقة حقيقية
الاستشهاد المفبرك ليس مجرد عنصر نائب واضح. وجد Walters و Wilder أن المداخل التي اختلقاها كانت تحمل أسماء مؤلفين حقيقيين، لأشخاص ينشرون في المجال الفعلي، ومرفقة بعناوين مجلات موجودة بالفعل، ومصاغة على نحو يكفي لتمرير فحص بصري سريع. ووجد فريق Linardon شيئًا أكثر دقة: من بين 35 استشهادًا مفبركًا أنتجها GPT-4o، جاء 33 منها مع DOI مرفق، وأدت 64 percent من تلك المعرفات الرقمية إلى ورقة حقيقية منشورة عن موضوع لا صلة له تمامًا، لا رابطًا معطلاً ولا صفحة خطأ، بل بحثًا حقيقيًا لشخص آخر يحل محل مصدر غير موجود.
كيفية التحقق مما إذا كان استشهاد ChatGPT حقيقيًا
ابحث عن العنوان الدقيق في Google Scholar أو في موقع المجلة نفسه بدلًا من الوثوق بـ DOI وحده، لأن DOI العامل قد يشير إلى الورقة الخطأ بالكامل. تأكد من أن قائمة المؤلفين، والسنة، والمجلة تطابق ما يظهر فعليًا، لا مجرد أن شيئًا ما يظهر. افعل ذلك مع كل مرجع يقدمه روبوت محادثة، وليس فقط المراجع التي تبدو غير مألوفة، لأن المداخل المفبركة في هذه الدراسات صُممت تحديدًا لتبدو عادية.
عامل الموضوع غير المألوف أو الضيق على أنه أعلى خطرًا من الموضوع السائد. وجد فريق Linardon أن نسبة التزوير كانت نحو 6 percent في حالة مرض مدروس جيدًا، وهو الاضطراب الاكتئابي الكبير، ونحو 30 percent في حالتين أقل دراسة ضمن المجموعة نفسها من المراجعات. وينطبق النمط خارج الصحة النفسية أيضًا، فالنموذج لديه نصوص حقيقية أكثر يستخلص منها الأنماط في مجال مزدحم، ومساحة أكبر للاختلاق على نحو يبدو معقولًا في مجال فقير.
أداة التحقق من الاستشهادات بالذكاء الاصطناعي التي تفحص كل مدخل مقابل قاعدة بيانات علمية حقيقية تؤتمت هذا البحث بدلًا من تركه لعملية تحقق يدوية لكل مرجع على حدة، وهي الخطوة التي يتجاوزها معظم الناس تحت ضغط الموعد النهائي، وهي بالضبط الحالة التي يكون فيها الاستشهاد المفبرك أكثر احتمالًا لأن ينجو إلى المسودة النهائية.
العثور عليها في قائمة مراجع مكتملة له إجراء خاص به وله صفحته الخاصة. أما بالنسبة إلى الاستشهادات الحقيقية، فإن الاستشهاد بـ ChatGPT وفق APA معروض خطوة بخطوة.
لا يغيّر أيٌّ من هذا كيفية تنسيق الاستشهاد بعد أن تتأكد من أنه حقيقي. ذلك سؤال منفصل: How to cite ChatGPT يغطي APA وMLA وChicago وIEEE للمحادثة نفسها، ومولد الاستشهادات يتولى المرجع العادي بالطريقة نفسها بغض النظر عن النمط الذي تكتب به. ما لا يستطيع أي تنسيق استشهاد إصلاحه هو الإحالة إلى شيء لم يُنشر قط. يحدث هذا التحقق قبل التنسيق، على كل مرجع، بغض النظر عن النموذج الذي كتب مسودتك أو الإصدار الذي يدعيه ملصقه.
Frequently Asked Questions
هل ChatGPT يختلق المراجع؟ نعم، في كل نموذج جرى اختباره حتى الآن، وفي كل دراسة منشورة من 2023 إلى 2026. يتباين المعدل تباينًا كبيرًا بحسب إصدار النموذج، وبحسب المجال، وبحسب التاريخ، من نحو 3 percent في أحدث النماذج المعتمدة على الاستناد إلى المصادر إلى أكثر من النصف بكثير في GPT-3.5 في 2023، لذلك فإن رقمًا واحدًا لا يقدم أبدًا الجواب الكامل.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.