ChatGPT Referansları Uydurur mu? Uydurma Çalışmalarının Bulguları
Altı çalışma, dört alan, üç yıl. ChatGPT'nin bir referansı uydurma oranı tek haneli yüzdelerden yarıdan fazlasına kadar değişir ve bu sayı, model sürümü ve ona ekli tarih olmadan hiçbir şey ifade etmez.
Haziran 2025'te, Deakin Üniversitesi'ndeki araştırmacılar GPT-4o'dan ruh sağlığı konularında altı literatür taraması yazmasını istedi. Ürettiği 176 atıfın 35'i bütünüyle mevcut değildi. Bir başka 64'ü ise gerçek makalelere işaret ediyor, ancak yanlış ayrıntılar içeriyordu. Bu, beş atıftan birinin tamamen uydurulduğu anlamına gelir, üstelik bu durum, ChatGPT'nin atıf sorununun ilk kez basılı olarak ölçülmesinden bir yıldan fazla sonra yayımlanan bir modelde görülmüştür.
ChatGPT referans uydurur mu? Evet, ve bunu 2026'da da yapmaya devam eder, üstelik yalnızca 2023'te manşet olan sürümde değil, güncel modellerde de. Açık soru hiçbir zaman bunun olup olmadığı değildi. Soru, bunun ne sıklıkla gerçekleştiği ve bu sayının modele, sürüme, alana ve testin yapıldığı tarihe göre nasıl değiştiğidir.
ChatGPT Referans Uydurur mu?
Evet. Bir dil modeli, öncesindeki her şeyi dikkate alarak bir sonraki makul kelimeyi tahmin eder. Ürününüzde bir geri getirme ya da arama adımı eklemediğiniz sürece hiçbir şeyi aramaz. Bir atfın nasıl göründüğünü tahmin etmeye bırakılırsa, doğru görünen bir atıf üretir: yazar adı, yıl, dergi başlığı, cilt numarası, DOI, bunların hiçbirinin gerçek bir yayına uyup uymadığını doğrulamadan. Bunların bir kısmı tesadüfen ya da ezberlenmiş olduğu için doğru olabilir. Bir kısmı ise sıfırdan uydurulmuş olur ve tamamen aynı görünür.
Bir Uydurma Oranının Neden Bir Model Sürümüne ve Bir Tarihe İhtiyacı Vardır
Çünkü oran tek bir sayı değildir. Bu konuda en çok atıf alan tek çalışmada, ChatGPT-3.5 kısa literatür taramalarından oluşan bir kümedeki atıfların yüzde 55'ini uydurmuştur, aynı araştırmacılar tarafından aynı 42 konuda test edilen ChatGPT-4 ise yüzde 18'ini uydurmuştur. Aynı çalışma, aynı istemler, aynı test günü. Değişen tek şey modeldi ve oran üçte iki azaldı.
Tarih, model adı kadar önemlidir. O çalışmada GPT-4, OpenAI'nin 2023 ortalarında sunduğu neyse onu ifade ediyordu. 2026 tarihli, on güncel model ve araştırma aracını inceleyen, toplamda 220,000'den fazla atıf bağlantısını kontrol eden bir çalışma, uydurma oranlarının 3 percent ile 13 percent arasında değiştiğini buldu, kesin oran ise belirli modele ve ürünün arama temelli dayanak mı yoksa derin araştırma modu mu kullandığına bağlıydı. Her iki oran da yanlış değildir. Bunlar, neredeyse üç yıl arayla ölçülmüş farklı şeyleri tanımlar.
Alan da modelden bağımsız olarak önemlidir. Ekonomi araştırmalarında da aynı GPT-3.5 ve GPT-4 eşleştirmesiyle yürütülen bir çalışmada, GPT-3.5 atıflarının 30 percent'ten fazlasının uydurma olduğu ve GPT-4 için oranın hâlâ 20 percent'in üzerinde kaldığı bulunmuştur, bu da çok disiplinli çalışmanın bulgusuna yakındır. Buna karşılık, tıbbi sistematik derleme çalışması, özellikle GPT-4'ün March 2023 sürümü olarak etiketlenen yapıyı test ederek, tamamen farklı bir görevde 28.6 percent ölçmüştür, yani yeni literatür özetlerini sıfırdan yazmak yerine mevcut sistematik derlemeler için kaynakça çekmekte.
Yayınlanmış Çalışmaların Buldukları
2023 ile 2026 arasında tıp, hukuk, ekonomi ve genel akademik yazım alanlarında yürütülen altı çalışma, aynı bulguda altı farklı biçimde birleşmektedir: Hangi modelin ürettiğine ya da ne zaman üretildiğine bakılmaksızın, bir AI aracının size verdiği her kaynağı kontrol edin.
| Study and field | Model and version | Date tested | Sample | Fabrication rate |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisciplinary) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | %55 (3.5) ile %18 (4) |
| Buchanan, Hill and Shapoval, The American Economist (economics) | GPT-3.5 and GPT-4 | 2023 | Journal of Economic Literature konularından alınan istemler | %30'un üzerinde (3.5), %20'nin üzerinde (4) |
| Chelli et al, JMIR (medical systematic reviews) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Temmuz 2023'te sorgulandı | 471 referans, 11 inceleme | %39.6 (3.5), %28.6 (4), %91.4 (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law) | ChatGPT-4 and Llama 2 | 2024 | Rastgele federal mahkeme davası soruları | %58 (ChatGPT-4), %88 (Llama 2) |
| Linardon et al, JMIR Mental Health (mental health reviews) | GPT-4o | Haziran 2025'te test edildi | 176 atıf, 6 inceleme | %19.9 tamamen uydurulmuş, %56 uydurulmuş veya kusurlu |
| Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | 220,000'den fazla atıf URL'si | Modele bağlı olarak %3 ile %13 arasında |
Hukuk çalışması, ham yüzde oranının yakalayamadığı bir ayrıntı ekler: aynı araştırma, modellerin kendi halüsinasyonlarını öngörmekte zorlandığını ve bir kullanıcının bir dava hakkındaki yanlış öncülünü düzeltmek yerine kabul etme eğiliminde olduğunu da bulmuştur. Uydurulmuş bir atıf, başarısızlık kiplerinden biridir. Kendi belirsizliğini de işaretleyemeyen bir model ise daha zor bir sorundur ve bu durum, yanlış bir atfın en yüksek maliyete sahip olduğu tam da bu alanda en belirgin biçimde ortaya çıkar.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
ChatGPT 2023'ten Bu Yana Daha İyi Hale Geldi mi?
Bir ölçüde ve düzensiz biçimde. En açık tek önce ve sonra karşılaştırması, Walters ve Wilder çalışmasının kendisinde görülür, GPT-3.5’ten GPT-4’e, aynı gün, uydurma oranı yüzde 55’ten yüzde 18’e düştü. 2025 ortasında GPT-4o’ya geçildiğinde ve Linardon’un ekibinin ölçtüğü oran yüzde 19.9 olduğunda, bu daha zor ve daha dar bir görevdeydi, 42 ilgisiz konuya yayılmış kısa özetler yerine tek bir araştırma alanında altı literatür taraması. 2026 başında arama veya deep-research özellikleri açık modellerde yeniden ileri gidildiğinde, çoğu için oran tek haneli sayılara iner, yüzde 3 ile 9 arasına, ancak bir deep-research modu yine de yüzde 13.3’e ulaştı.
Bunların hiçbiri doğrusal bir düşüş değildir. Linardon sayısı, 2023 GPT-4 değeri ile 2023 GPT-3.5 değeri arasında yer alır, her ikisinden de bir yıldan uzun süre sonra yayımlanmış bir modelde, çünkü daha zor bir görevde test edilmiştir, kaynak materyalin önemli bir kısmının bulunmasının da zor olduğu bir alanda gerçek literatür taraması üretimi. Bir uydurma oranı, bir modeli belirli bir tarihteki belirli bir görev üzerinde tanımlar. Bu üç unsurdan herhangi biri değiştiğinde sayı da değişir, bazen oldukça fazla.
Bugün sayıyı hâlâ değiştiren tek değişken model ailesi değildir. 2025 tarihli bir çalışma, beş akademik alanda 400 kaynakça üzerinde sekiz ücretsiz sohbet botunu, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat ve Perplexity, değerlendirdi ve üretilen tüm kaynakçaların yalnızca yüzde 26.5’inin bütünüyle doğru olduğunu buldu. Grok ve DeepSeek bu testte sıfır uydurma kaynakça üretti. Claude, Copilot ve Perplexity en zayıf performans gösterenler arasındaydı. Benzer temel teknoloji üzerine kurulu, aynı ayda, aynı istemlerle test edilen iki ürün, aralığın zıt uçlarında yer aldı, bu da yukarıdaki model ve tarih tablosuyla aynı derstir, sürüm yerine ürüne uygulanmış hâlidir.
Uydurma Atıflar Neden Gerçek Görünür
Uydurulmuş bir atıf, açık bir yer tutucu değildir. Walters ve Wilder, uydurdukları girdilerin gerçek yazar adları taşıdığını, bu yazarların fiilen var olan alanda yayımladığını, gerçekten mevcut dergi başlıklarına bağlandığını ve hızlı bir görsel denetimden geçecek kadar düzgün biçimlendirildiğini buldu. Linardon'un ekibi daha keskin bir şey buldu, GPT-4o'nun ürettiği 35 uydurulmuş atfın 33'ünde bir DOI vardı ve bu DOI'lerin yüzde 64'ü, ölü bir bağlantıya ya da hata sayfasına değil, tamamen ilgisiz bir konuya ait gerçek, yayımlanmış bir makaleye götürüyordu, var olmayan bir kaynağın yerine başkasının gerçek araştırması geçiyordu.
Bir ChatGPT Atfının Gerçek Olup Olmadığı Nasıl Kontrol Edilir
Yalnızca DOI'ye güvenmek yerine, tam başlığı Google Scholar'da ya da derginin kendi sitesinde arayın, çünkü çalışan bir DOI bütünüyle yanlış makaleye işaret edebilir. Yalnızca bir şeyin çıkıp çıkmadığını değil, yazar listesinin, yılın ve derginin gerçekten ortaya çıkan bilgilerle eşleştiğini doğrulayın. Bunu, bir sohbet robotunun verdiği her kaynak için yapın, yalnızca tanıdık gelmeyenler için değil, çünkü bu çalışmalardaki uydurulmuş girdiler özellikle sıradan görünmek üzere tasarlanmıştı.
Tanıdık olmayan ya da dar bir konuyu, ana akım bir konuya göre daha yüksek riskli kabul edin. Linardon'un ekibi, iyi çalışılmış bir durum olan major depressive disorder için yaklaşık yüzde 6, aynı derleme kümesindeki daha az çalışılmış iki durum için ise yaklaşık yüzde 30 oranında uydurma buldu. Bu örüntü ruh sağlığı alanının dışında da geçerlidir, bir modelin kalabalık bir alanda örüntü çıkarmak için başvurabileceği daha fazla gerçek metin vardır ve ince bir alanda inandırıcı biçimde uydurma yapması için daha fazla alan bulunur.
Her girdiyi gerçek bir akademik veritabanına karşı denetleyen bir AI atıf denetleyicisi, bu aramayı her bir kaynak için manuel olarak yapmaya bırakmak yerine otomatikleştirir, çünkü son teslim baskısı altında çoğu kişinin atladığı kısım budur ve uydurulmuş bir atfın nihai taslağa sızıp kalma olasılığının en yüksek olduğu tam koşul da budur.
Bunları tamamlanmış bir kaynakçada bulmak kendi prosedürüne sahiptir ve bunun için ayrı bir sayfa vardır. Gerçek olan atıflar için, ChatGPT'yi APA ile atıf verme adım adım açıklanmıştır.
Bunların hiçbiri, bir alıntının gerçek olduğunu doğruladıktan sonra onu nasıl biçimlendirdiğinizi değiştirmez. Bu ayrı bir sorudur: How to cite ChatGPT, değiş tokuşun kendisi için APA, MLA, Chicago ve IEEE kapsamını ele alır, ve bir alıntı oluşturucu, sıradan kaynağı hangi stilde yazıyor olursanız olun aynı şekilde işler. Hiçbir alıntı biçiminin düzeltemeyeceği şey, hiçbir zaman yayımlanmamış bir şeye yapılan atıftır. Bu denetim, hangi modelin taslağınızı yazdığına ya da etiketinin hangi sürümü iddia ettiğine bakılmaksızın, her kaynak için biçimlendirmeden önce gerçekleşir.
Frequently Asked Questions
ChatGPT referansları uydurur mu? Evet, şimdiye kadar test edilen her modelde ve 2023 ile 2026 arasındaki yayımlanmış her çalışmada. Oran, model sürümüne, alana ve tarihe göre büyük ölçüde değişir, en güncel temellendirilmiş modellerde yaklaşık yüzde 3'ten 2023'te GPT-3.5'te yarıdan fazlasına kadar çıkar, bu yüzden tek bir sayı hiçbir zaman tam yanıt değildir.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.