Adakah ChatGPT Mereka-reka Rujukan? Apa yang Ditemui Kajian Fabrikasi
Enam kajian, empat bidang, tiga tahun. Kadar ChatGPT mencipta rujukan berkisar daripada angka satu digit hingga jauh melebihi separuh, dan angka itu tidak bermakna tanpa versi model dan tarikh yang dilampirkan padanya.
Pada Jun 2025, penyelidik di Deakin University meminta GPT-4o menulis enam ulasan literatur tentang topik kesihatan mental. Daripada 176 sitasi yang dihasilkannya, 35 langsung tidak wujud. Satu lagi 64 merujuk kepada makalah sebenar tetapi dengan butiran yang salah dilampirkan. Itu bermakna satu rujukan dalam lima direka sepenuhnya, daripada model yang dikeluarkan lebih daripada setahun selepas masalah sitasi ChatGPT mula diukur dalam bentuk cetak.
Adakah ChatGPT mereka-reka rujukan? Ya, dan ia masih berbuat demikian pada 2026, pada model semasa, bukan hanya pada versi yang menjadi tajuk utama pada 2023. Soalan terbuka itu bukan pernah sama ada perkara ini berlaku. Soalannya ialah berapa kerap, dan angka itu berubah mengikut model, versi, bidang dan tarikh ujian dijalankan.
Adakah ChatGPT Mereka-reka Rujukan?
Ya. Model bahasa meramalkan perkataan seterusnya yang munasabah berdasarkan segala yang mendahuluinya. Ia tidak mencari apa-apa kecuali anda menambah langkah pengambilan semula atau carian dalam produk anda. Jika dibiarkan meramalkan rupa sesuatu sitasi, ia akan menghasilkan satu yang kelihatan betul, nama pengarang, tahun, tajuk jurnal, nombor jilid, DOI, tanpa mengesahkan bahawa mana-mana perkara itu sepadan dengan penerbitan sebenar. Sebahagiannya akan tepat secara kebetulan atau melalui hafalan. Sebahagiannya akan direka dari awal dan kelihatan sama sahaja.
Mengapa Kadar Pemalsuan Memerlukan Versi Model dan Tarikh
Kerana kadar itu bukan satu angka. Dalam kajian yang paling kerap dipetik tentang perkara ini, ChatGPT-3.5 memalsukan 55 peratus sitasi dalam satu set ulasan literatur pendek, dan ChatGPT-4, yang diuji oleh penyelidik yang sama pada 42 topik yang sama, memalsukan 18 peratus. Kajian yang sama, prompt yang sama, hari ujian yang sama. Satu-satunya perkara yang berubah ialah model, dan kadar itu menurun sebanyak dua pertiga.
Tarikh sama pentingnya dengan nama model. GPT-4 dalam kajian itu merujuk kepada apa sahaja yang disediakan oleh OpenAI pada pertengahan 2023. Satu kajian 2026 terhadap sepuluh model semasa dan agen penyelidikan, yang memeriksa lebih daripada 220,000 pautan sitasi secara keseluruhan, mendapati kadar pemalsuan antara 3 peratus hingga 13 peratus, dengan angka tepat bergantung pada model tertentu dan pada sama ada produk itu menggunakan grounding carian atau mod penyelidikan mendalam. Kedua-dua angka itu tidak salah. Ia menerangkan perkara yang berbeza yang diukur hampir tiga tahun apart.
Bidang juga penting, secara bebas daripada model. Kami juga mempunyai penyelidikan ekonomi yang dijalankan melalui pasangan GPT-3.5 dan GPT-4 yang sama mendapati lebih 30 peratus sitasi GPT-3.5 direka dan kadar yang masih melebihi 20 peratus bagi GPT-4, hampir dengan apa yang ditemui oleh kajian multidisiplin itu, manakala kajian semakan sistematik perubatan, yang menguji apa yang dilabel sebagai binaan GPT-4 Mac 2023 secara khusus, mengukur 28.6 peratus pada tugas yang sama sekali berbeza: mengambil rujukan untuk semakan sistematik yang sedia ada, bukannya menulis ringkasan literatur baharu dari awal.
Apa yang Ditemui oleh Kajian yang Diterbitkan
Enam kajian, dijalankan antara 2023 dan 2026, merentasi perubatan, undang-undang, ekonomi dan penulisan akademik umum, bertemu pada penemuan yang sama yang dinyatakan dengan enam cara berbeza: semak setiap rujukan yang diberikan oleh alat AI kepada anda, tanpa mengira model mana yang menghasilkannya atau bila.
| Kajian dan bidang | Model dan versi | Tarikh diuji | Sampel | Kadar pemalsuan |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (pelbagai disiplin) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (ekonomi) | GPT-3.5 and GPT-4 | 2023 | Prompts from Journal of Economic Literature topics | Over 30% (3.5), over 20% (4) |
| Chelli et al, JMIR (medical systematic reviews) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 references, 11 reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (undang-undang) | ChatGPT-4 and Llama 2 | 2024 | Random federal court case questions | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (ulasan kesihatan mental) | GPT-4o | Tested June 2025 | 176 citations, 6 reviews | 19.9% fully fabricated, 56% fabricated or flawed |
| Rao, Wong and Callison-Burch, arXiv preprint (pelbagai domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Over 220,000 citation URLs | 3% to 13% depending on model |
Kajian undang-undang itu menambah satu perincian yang tidak ditangkap oleh peratusan mentah: penyelidikan yang sama mendapati bahawa model sukar meramalkan halusinasi mereka sendiri dan cenderung menerima premis salah pengguna tentang sesuatu kes daripada membetulkannya. Satu sitasi yang dipalsukan ialah satu mod kegagalan. Model yang juga tidak dapat menandakan ketidakpastian sendiri ialah masalah yang lebih sukar, dan hal ini paling ketara dalam bidang yang sama, iaitu bidang apabila sitasi yang salah membawa kos paling tinggi.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Adakah ChatGPT Menjadi Lebih Baik Sejak 2023?
Agak, dan tidak sekata. Perbandingan sebelum dan selepas yang paling jelas ialah dalam kajian Walters dan Wilder itu sendiri: GPT-3.5 ke GPT-4, pada hari yang sama, fabrikasi menurun daripada 55 peratus kepada 18 peratus. Beralih ke GPT-4o pada pertengahan 2025 dan kadar yang diukur oleh pasukan Linardon ialah 19.9 percent, pada tugas yang lebih sukar dan lebih sempit, enam ulasan literatur dalam satu bidang penyelidikan sahaja, bukannya ringkasan pendek yang tersebar merentasi 42 topik yang tidak berkaitan. Beralih lagi kepada model dengan ciri carian atau deep-research dihidupkan, yang diuji pada awal 2026, dan julatnya turun ke satu digit bagi kebanyakannya, 3 hingga 9 peratus, walaupun satu mod deep-research masih mencapai 13.3 percent.
Tiada satu pun daripada itu merupakan garis lurus menurun. Angka Linardon terletak antara angka GPT-4 2023 dan angka GPT-3.5 2023, pada model yang dikeluarkan lebih daripada setahun selepas kedua-duanya, kerana ia diuji pada tugas yang lebih sukar: penjanaan ulasan literatur sebenar dalam bidang yang banyak bahan sumbernya sendiri sukar ditemui. Kadar fabrikasi menerangkan satu model pada satu tugas pada satu tarikh. Ubah mana-mana satu daripada tiga unsur itu dan angka tersebut berubah, kadangkala dengan banyak.
Keluarga model bukan satu-satunya pemboleh ubah yang masih mengubah angka itu hari ini. Satu kajian 2025 yang menilai lapan chatbot percuma, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat dan Perplexity, pada 400 rujukan merentasi lima bidang akademik mendapati bahawa hanya 26.5 percent daripada semua rujukan yang dijana adalah betul sepenuhnya. Grok dan DeepSeek menghasilkan sifar rujukan yang direka dalam ujian itu. Claude, Copilot dan Perplexity antara yang menunjukkan prestasi paling lemah. Dua produk yang dibina atas teknologi asas yang setara, diuji pada bulan yang sama, pada prompt yang sama, berada pada hujung julat yang bertentangan, yang merupakan pengajaran yang sama seperti jadual model dan tarikh di atas, diterapkan kepada produk dan bukannya kepada versi.
Mengapa Sitasi yang Direka Kelihatan Sebenar
Satu sitasi yang direka bukanlah pengisi tempat yang jelas. Walters dan Wilder mendapati bahawa entri ciptaan mereka membawa nama pengarang yang sebenar, iaitu pengarang yang menerbitkan dalam bidang sebenar, dilampirkan pada tajuk jurnal yang benar-benar wujud, dan diformat dengan cukup baik untuk melepasi semakan visual ringkas. Pasukan Linardon menemui sesuatu yang lebih tajam: daripada 35 sitasi yang direka yang dihasilkan oleh GPT-4o, 33 datang dengan DOI yang dilampirkan, dan 64 peratus daripada DOI tersebut membawa kepada makalah yang benar dan diterbitkan tentang topik yang sama sekali tidak berkaitan, bukan pautan rosak dan bukan halaman ralat, iaitu penyelidikan sebenar orang lain yang menggantikan sumber yang tidak wujud.
Cara Menyemak Sama Ada Sitasi ChatGPT Itu Benar
Cari tajuk yang tepat dalam Google Scholar atau di laman sendiri jurnal itu, bukannya mempercayai DOI semata-mata, kerana DOI yang berfungsi boleh merujuk kepada makalah yang salah sepenuhnya. Sahkan bahawa senarai pengarang, tahun dan jurnal sepadan dengan apa yang benar-benar muncul, bukan sekadar bahawa sesuatu muncul. Lakukan ini untuk setiap rujukan yang diberikan oleh chatbot, bukan hanya yang kelihatan asing, kerana entri yang direka dalam kajian ini dibina khusus untuk kelihatan biasa.
Anggap topik yang tidak biasa atau sempit sebagai lebih berisiko daripada topik arus perdana. Pasukan Linardon mendapati kadar pemalsuan hampir 6 peratus bagi satu keadaan yang banyak dikaji, major depressive disorder, dan hampir 30 peratus bagi dua keadaan yang kurang dikaji dalam set ulasan yang sama. Corak ini juga berlaku di luar kesihatan mental: model mempunyai lebih banyak teks sebenar untuk dijadikan asas corak dalam bidang yang padat, dan lebih banyak ruang untuk mereka-reka secara munasabah dalam bidang yang nipis.
Pemeriksa sitasi AI yang menjalankan setiap entri terhadap pangkalan data ilmiah sebenar mengautomasikan carian itu, bukannya menyerahkannya kepada semakan manual bagi setiap rujukan, yang merupakan bahagian yang paling kerap diabaikan apabila tekanan tarikh akhir meningkat, iaitu keadaan tepat apabila sitasi yang direka paling mungkin bertahan hingga draf akhir.
Menemukannya dalam bibliografi yang telah siap ialah prosedurnya sendiri dan mempunyai halamannya sendiri. Bagi sitasi yang benar, cara memetik ChatGPT dalam APA dihuraikan langkah demi langkah.
Tiada satu pun daripada ini mengubah cara anda memformat sitasi setelah anda mengesahkan bahawa ia benar. Itu ialah soalan yang berasingan: Cara menyitasi ChatGPT merangkumi APA, MLA, Chicago dan IEEE untuk pertukaran itu sendiri, dan penjana sitasi mengendalikan rujukan biasa dengan cara yang sama tanpa mengira gaya penulisan yang anda gunakan. Apa yang tidak dapat diperbaiki oleh mana-mana format sitasi ialah rujukan kepada sesuatu yang tidak pernah diterbitkan. Semakan itu berlaku sebelum pemformatan, pada setiap rujukan, tanpa mengira model mana yang menulis draf anda atau versi mana yang didakwa oleh labelnya.
Frequently Asked Questions
Adakah ChatGPT mereka-reka rujukan? Ya, pada setiap model yang telah diuji setakat ini, dalam setiap kajian yang diterbitkan dari 2023 hingga 2026. Kadarnya berbeza dengan sangat besar mengikut versi model, bidang dan tarikh, daripada kira-kira 3 peratus pada model berasaskan sumber yang paling terkini hingga jauh melebihi separuh pada GPT-3.5 pada 2023, jadi satu angka sahaja tidak pernah menjadi jawapan penuh.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.