Apakah ChatGPT Mengarang Referensi? Temuan Studi tentang Fabrikasi
Enam studi, empat bidang, tiga tahun. Tingkat ChatGPT mengarang referensi berkisar dari satu digit hingga jauh di atas setengah, dan angka itu tidak berarti tanpa versi model dan tanggal yang menyertainya.
Pada Juni 2025, para peneliti di Deakin University meminta GPT-4o menulis enam tinjauan pustaka tentang topik kesehatan mental. Dari 176 sitasi yang dihasilkannya, 35 sama sekali tidak ada. Sebanyak 64 lainnya merujuk pada makalah yang benar tetapi dengan rincian yang keliru. Itu berarti satu dari lima referensi dibuat-buat secara langsung, dari sebuah model yang dirilis lebih dari setahun setelah masalah sitasi ChatGPT pertama kali diukur dalam bentuk cetak.
Apakah ChatGPT mengarang referensi? Ya, dan hal itu masih terjadi pada 2026, pada model-model terkini, bukan hanya pada versi yang menjadi berita utama pada 2023. Pertanyaan terbuka itu sejak awal bukanlah apakah hal ini terjadi. Yang menjadi pertanyaan adalah seberapa sering, dan angka itu berubah mengikuti model, versi, bidang, dan tanggal pengujian dilakukan.
Apakah ChatGPT Mengarang Referensi?
Ya. Sebuah model bahasa memprediksi kata berikutnya yang paling mungkin berdasarkan segala sesuatu yang mendahuluinya. Model itu tidak mencari informasi apa pun kecuali Anda menambahkan langkah pengambilan atau pencarian dalam produk Anda. Jika dibiarkan memprediksi seperti apa sebuah sitasi, model itu akan membuat sesuatu yang tampak benar, nama penulis, tahun, judul jurnal, nomor volume, DOI, tanpa memverifikasi apakah semua itu cocok dengan publikasi yang nyata. Sebagiannya akan akurat secara kebetulan atau karena hafalan. Sebagiannya lagi akan dibuat dari nol dan tampak persis sama.
Mengapa Tingkat Rekayasa Memerlukan Versi Model dan Tanggal
Karena tingkatnya bukan satu angka. Dalam studi yang paling sering dikutip tentang hal ini, ChatGPT-3.5 merekayasa 55 persen sitasi dalam kumpulan tinjauan pustaka singkat, dan ChatGPT-4, yang diuji oleh peneliti yang sama pada 42 topik yang sama, merekayasa 18 persen. Studi yang sama, prompt yang sama, hari pengujian yang sama. Satu-satunya hal yang berubah adalah modelnya, dan tingkatnya turun dua pertiga.
Tanggal sama pentingnya dengan nama model. GPT-4 dalam studi itu berarti apa pun yang disediakan OpenAI pada pertengahan 2023. Sebuah studi 2026 terhadap sepuluh model dan agen riset saat ini, yang memeriksa lebih dari 220,000 tautan sitasi secara total, menemukan tingkat fabrikasi dari 3 persen hingga 13 persen, dengan angka yang tepat bergantung pada model tertentu dan pada apakah produk tersebut menggunakan grounding pencarian atau mode riset mendalam. Tidak ada satu pun angka yang keliru. Keduanya menggambarkan hal yang berbeda yang diukur dengan selang hampir tiga tahun.
Bidang juga penting, terlepas dari modelnya. Kami juga memiliki penelitian ekonomi yang dijalankan melalui pasangan GPT-3.5 dan GPT-4 yang sama, yang menemukan lebih dari 30 persen sitasi GPT-3.5 dibuat-buat dan tingkat yang masih di atas 20 persen untuk GPT-4, mendekati apa yang ditemukan studi multidisipliner, sementara studi tinjauan sistematis medis, yang secara khusus menguji apa yang diberi label sebagai build GPT-4 Maret 2023, mengukur 28.6 persen pada tugas yang sama sekali berbeda, yaitu mengambil referensi untuk tinjauan sistematis yang sudah ada, bukan menulis ringkasan literatur baru dari awal.
Apa yang Ditemukan Studi yang Dipublikasikan
Enam studi, yang dijalankan antara 2023 dan 2026, di bidang kedokteran, hukum, ekonomi, dan penulisan akademik umum, bertemu pada temuan yang sama yang dinyatakan dengan enam cara berbeda, periksa setiap referensi yang diberikan alat AI kepada Anda, terlepas dari model mana yang menghasilkannya atau kapan.
| Study and field | Model and version | Date tested | Sample | Fabrication rate |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisciplinary) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 sitasi, 42 topik | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (ekonomi) | GPT-3.5 and GPT-4 | 2023 | Prompt dari topik Journal of Economic Literature | Lebih dari 30% (3.5), lebih dari 20% (4) |
| Chelli et al, JMIR (tinjauan sistematis medis) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 referensi, 11 tinjauan | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (hukum) | ChatGPT-4 and Llama 2 | 2024 | Pertanyaan acak tentang perkara pengadilan federal | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (tinjauan kesehatan mental) | GPT-4o | Tested June 2025 | 176 sitasi, 6 tinjauan | 19.9% sepenuhnya direkayasa, 56% direkayasa atau cacat |
| Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Lebih dari 220,000 URL sitasi | 3% to 13% depending on model |
Studi hukum menambahkan rincian yang tidak ditangkap oleh persentase mentah: penelitian yang sama menemukan bahwa model kesulitan memprediksi halusinasi mereka sendiri dan cenderung menerima premis keliru dari pengguna tentang suatu perkara alih-alih memperbaikinya. Sitasi yang direkayasa adalah salah satu mode kegagalan. Model yang juga tidak dapat menandai ketidakpastian dirinya sendiri merupakan masalah yang lebih sulit, dan hal ini paling tampak justru dalam bidang yang sitasi yang salah memiliki biaya tertinggi.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Apakah ChatGPT Menjadi Lebih Baik Sejak 2023?
Agak, dan tidak merata. Perbandingan sebelum dan sesudah yang paling jelas terdapat dalam studi Walters dan Wilder itu sendiri: GPT-3.5 ke GPT-4, pada hari yang sama, fabrikasi turun dari 55 persen menjadi 18 persen. Beralih ke GPT-4o pada pertengahan 2025 dan tingkat yang diukur oleh tim Linardon adalah 19.9 persen, pada tugas yang lebih sulit dan lebih sempit, enam tinjauan pustaka dalam satu bidang penelitian, bukan ringkasan singkat yang tersebar di 42 topik yang tidak berkaitan. Beralih lagi ke model dengan fitur pencarian atau deep-research yang diaktifkan, diuji pada awal 2026, dan rentangnya turun ke satu digit untuk sebagian besar model, 3 hingga 9 persen, meskipun satu mode deep-research masih mencapai 13.3 persen.
Tidak ada dari itu yang merupakan garis lurus menurun. Angka Linardon berada di antara angka GPT-4 tahun 2023 dan angka GPT-3.5 tahun 2023, pada model yang dirilis lebih dari setahun setelah keduanya, karena model itu diuji pada tugas yang lebih sulit: pembuatan tinjauan pustaka yang nyata dalam bidang yang banyak bahan sumbernya sendiri sulit ditemukan. Tingkat fabrikasi menggambarkan sebuah model pada suatu tugas pada suatu tanggal. Ubah salah satu dari ketiganya, dan angkanya berubah, kadang-kadang cukup besar.
Keluarga model bukan satu-satunya variabel yang masih mengubah angka itu hari ini. Sebuah studi 2025 yang mengevaluasi delapan chatbot gratis, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat dan Perplexity, pada 400 referensi di lima bidang akademik menemukan bahwa hanya 26.5 persen dari seluruh referensi yang dihasilkan benar sepenuhnya. Grok dan DeepSeek menghasilkan nol referensi fabrikasi dalam pengujian itu. Claude, Copilot dan Perplexity termasuk di antara yang berkinerja terburuk. Dua produk yang dibangun di atas teknologi dasar yang sebanding, diuji pada bulan yang sama, pada prompt yang sama, berada di dua ujung rentang yang berlawanan, yang merupakan pelajaran yang sama seperti tabel model dan tanggal di atas, diterapkan pada produk, bukan pada versi.
Mengapa Sitasi Fabrikasi Tampak Nyata
Sebuah sitasi yang dibuat-buat bukanlah penanda tempat yang jelas. Walters dan Wilder menemukan bahwa entri yang mereka ciptakan memuat nama penulis yang nyata, yaitu orang-orang yang menerbitkan karya di bidang yang sesungguhnya, ditempelkan pada judul jurnal yang benar-benar ada, dan diformat cukup baik untuk lolos dari pemeriksaan visual singkat. Tim Linardon menemukan sesuatu yang lebih tajam, dari 35 sitasi yang dibuat-buat yang dihasilkan GPT-4o, 33 disertai DOI, dan 64 persen dari DOI tersebut mengarah ke makalah yang nyata dan telah diterbitkan tentang topik yang sama sekali tidak terkait, bukan tautan mati dan bukan halaman galat, melainkan penelitian nyata milik orang lain yang menggantikan sumber yang tidak ada.
Cara Memeriksa Apakah Sitasi ChatGPT Itu Asli
Cari judul persisnya di Google Scholar atau di situs jurnal itu sendiri, alih-alih hanya mempercayai DOI, karena DOI yang berfungsi tetap dapat mengarah ke makalah yang sama sekali salah. Pastikan daftar penulis, tahun, dan jurnalnya cocok dengan yang benar-benar muncul, bukan sekadar bahwa sesuatu muncul. Lakukan ini untuk setiap referensi yang diberikan chatbot, bukan hanya yang tampak asing, karena entri yang dibuat-buat dalam studi ini sengaja dibangun agar tampak biasa.
Anggap topik yang tidak familiar atau sempit sebagai berisiko lebih tinggi daripada topik arus utama. Tim Linardon menemukan tingkat fabrikasi mendekati 6 persen untuk suatu kondisi yang banyak diteliti, major depressive disorder, dan mendekati 30 persen untuk dua kondisi lain yang kurang diteliti dalam kumpulan ulasan yang sama. Pola ini juga berlaku di luar kesehatan mental, sebuah model memiliki lebih banyak teks nyata untuk dijadikan dasar pola di bidang yang padat, dan lebih banyak ruang untuk mengarang secara masuk akal di bidang yang tipis.
Pemeriksa sitasi AI yang menjalankan setiap entri terhadap basis data ilmiah yang nyata mengotomatiskan pencarian itu alih-alih menyerahkannya pada pencarian manual untuk setiap referensi, yang merupakan bagian yang paling sering dilewati di bawah tekanan tenggat waktu, yaitu kondisi yang tepat ketika sitasi yang dibuat-buat paling mungkin lolos ke draf akhir.
Menemukannya dalam bibliografi yang sudah selesai memiliki prosedurnya sendiri dan halamannya sendiri. Untuk sitasi yang memang nyata, cara mengutip ChatGPT dalam APA dijelaskan langkah demi langkah.
Tidak satu pun dari hal ini mengubah cara Anda memformat sitasi setelah Anda memastikan bahwa sitasi itu benar-benar ada. Itu adalah pertanyaan yang terpisah: Cara mengutip ChatGPT mencakup APA, MLA, Chicago, dan IEEE untuk pertukaran itu sendiri, dan generator sitasi menangani referensi biasa dengan cara yang sama, terlepas dari gaya penulisan yang Anda gunakan. Yang tidak dapat diperbaiki oleh format sitasi apa pun adalah rujukan pada sesuatu yang tidak pernah diterbitkan. Pemeriksaan itu terjadi sebelum pemformatan, pada setiap referensi, terlepas dari model mana yang menulis draf Anda atau versi mana yang diklaim oleh labelnya.
Frequently Asked Questions
Apakah ChatGPT mengarang referensi? Ya, pada setiap model yang telah diuji sejauh ini, dalam setiap studi terbitan dari 2023 hingga 2026. Tingkatnya sangat bervariasi menurut versi model, bidang, dan tanggal, dari sekitar 3 persen pada model berlandaskan yang paling baru hingga jauh di atas setengah pada GPT-3.5 pada 2023, sehingga satu angka tidak pernah menjadi jawaban lengkap.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.