AI Dedektörleri Ne Kadar Doğru? Yanlış Pozitifler ve Önyargı
Sağlayıcılar yüzde 1'in altında yanlış pozitif oranları yayımlar. Aynı dedektörleri ana dili İngilizce olmayan yazılar üzerinde test eden bağımsız araştırmacılar, oranların yüzde 60'ın üzerine çıktığını buldu. Kanıtların gösterdiği budur.
Turnitin, yanlış pozitif oranlarının %1’den düşük olduğunu iddia etmektedir. Bağımsız araştırmacılardan oluşan bir grup, ana dili İngilizce olmayan konuşurlardan alınan daha geniş bir yazı örnekleri yelpazesi üzerinde birden fazla dedektörü test etti. Aynı tür yazıda ortalama yanlış pozitif oranının %60’ın üzerinde olduğunu buldular. Bu iki sayı da gerçektir, ikisi de yayımlanmıştır ve ikisi de aynı pazara satış yapan dedektörlerle ilgilidir. AI dedektörleri doğru mudur? Bu, hangi popülasyonu test ettiğinize, hangi dedektörü kullandığınıza ve sağlayıcınızın bunu baştan nasıl tanımladığına bağlıdır.
Bu yazı, bir dedektörün bu puanı nasıl hesapladığını yeniden açıklamayacaktır. Mekanizma, perplexity, token olasılığı, sınıflandırıcının nasıl eğitildiği, başka bir yerde ayrıntılı olarak ele alınmıştır, ve eğer henüz okumadıysanız önce buna bakmaya değerdir. Burada önemli olan, puan ortaya çıktıktan sonra ne olduğudur, ne sıklıkla yanlış olduğu, kimin yazısı hakkında en sık yanlış olduğu ve haksız bir suçlamanın aslında hiçbir yanlış yapmamış biri için neye mal olduğudur.
AI dedektörleri doğru mudur?
İstikrarlı biçimde değil, ve pazarlama iddiaları ile bağımsız testler arasındaki fark iyi belgelenmiştir. Debora Weber-Wulff liderliğindeki bir araştırmacı grubu, 2023 yılında insan ve ChatGPT metninin bir karışımına karşı test edilen 14 tespit aracına ilişkin bulgularını yayımladı, bunların 12’si ücretsiz ve ikisi ticariydi. Bu araçların hiçbirinin doğru ya da güvenilir olmadığını, makine metnini insan olarak etiketleme yönünde yerleşik bir yanlılık taşıdığını buldular, tersinin değil. Bu teste dahil edilen ticari araçlardan ikisi Turnitin ve PlagiarismCheck idi. Bu testteki tüm araçlar, metin paraphrase edildiğinde daha kötü performans gösterdi.
Ancak iki yıl sonra, durum durağan değil. Chicago Üniversitesi Booth School’dan Brian Jabarian ve Alex Imas tarafından hazırlanan bir çalışma kâğıdı, üç yeni aracı, Pangram, GPTZero ve Originality.ai, ayrıca bir açık kaynak rakibini, bloglar, haberler, incelemeler ve kurgu metinlerinden alınmış yaklaşık 2.000 insan yazımı parça üzerinde sınadı. Kontrollü test koşullarında, bu grubun içindeki en iyi araç hiçbir zaman yüzde 99.8 doğruluğun altına düşmedi ve yanlış pozitif oranını düşük bir düzeyde tuttu. Açık kaynak model, rastgele tahmin yapan biri kadar iyi performans gösterdi. İşler gerçekten de daha iyi hale geldi. Bir bakıma. Biraz.
Ancak mesele, kontrollü sözcüğündedir. Karşılaştırma metinleri temizdir, eksiksizdir ve bilinen koşullar altında üretilmiştir. Teslim edilen bir deneme bunların hiçbirine güvenilir biçimde uymaz. Turnitin'in kendi baş ürün sorumlusu bunu kamuya açık biçimde söylemiş olsa da, gerçek dünya sonuçları laboratuvar sonuçlarıyla aynı olmayabilir, bu da bir satıcıdan gelen nadir ve yararlı bir kabul niteliğindedir. Bir sonraki bölüm, satıcı rakamlarını bağımsız rakamların yanına koyar, böylece fark ileri sürülmek yerine görünür olur.
Satıcı iddiaları ile bağımsız testler
Aşağıdaki tablo, dört dedektörün kendileri için ileri sürdüklerini, araştırmacıların araçları doğrudan test ettiklerinde ölçtükleri sonuçlarla yan yana koyar. İki orta sütunu birlikte okuyun, yalnızca satıcı sütununu değil.
| Dedektör | Satıcının iddia ettiği doğruluk | Bağımsız olarak gözlemlenen | Satıcının yanlış pozitifler hakkında söyledikleri |
|---|---|---|---|
| Turnitin | İşaretlemeden önce %98 güven eşiği, belge düzeyinde %1’in altında yanlış pozitif | Yaklaşık %80 doğruluk, 2023 karşılaştırmasında 12 aracın en iyisi, aracın daha eski bir sürümünde | %20 AI-written eşiğinin üzerinde belge düzeyinde %1’in altında, cümle düzeyinde yaklaşık %4 |
| GPTZero | Bağımsız RAID ölçütünde %1 yanlış pozitif oranıyla %95.7 AI metni tespiti | Kısa pasajlarda %96 doğruluk, 2025 University of Chicago Booth çalışmasında %1’in altında yanlış pozitif oranı | RAID ölçütünde %1 yanlış pozitif oranı bildirmektedir |
| Originality.ai | %99 doğruluk, %0.5 yanlış pozitif oranı, Lite modeli, %1.5, Turbo modeli | Yanlış pozitif oranı %1’in altında, ancak aynı Booth çalışmasında AI-written metnin %10 ila %40’ını kaçırdı | Model kademesine göre ayrı yanlış pozitif rakamları yayımlar |
| Pangram | Rakip araçlardan 38 kattan fazla daha düşük olduğunu söylediği hata oranları, ana dili İngilizce olmayan yazarlara karşı önyargı olmadığını belirtir | Booth çalışmasında doğruluk hiçbir zaman %99.8’in altına düşmedi, yanlış pozitif oranı sıfıra yakın | 10 metin alanı ve 8 dil modeli genelinde sıfıra yakın yanlış pozitif oranları olduğunu belirtir |
İki nokta öne çıkıyor. Birincisi, tüm satıcı rakamları satıcı tarafından kontrol edilen bir laboratuvardan geliyor ve Booth rakamları ise satacak hiçbir şeyi olmayan araştırmacılardan geliyor. İkincisi, Turnitin o orta sütunda hiç yer almıyor, çünkü 2025 çalışması onu test etmedi. Tabloda, bağımsız rakamı daha önceki 2023 karşılaştırmasına dayanıyor, ancak aracın daha eski bir sürümünde yapılmıştı, bu yüzden tabloya bire bir karşılaştırma olarak bakarken bunu hatırlayın.
Turnitin'in AI tespiti ne kadar doğrudur?
Turnitin tek bir doğruluk oranı yayımlamaz. Bunun yerine bir eşik ve bir ödünleşim yayımlar. Şirket, yalnızca işaretlenen kısmın AI tarafından yazıldığına yüzde 98 güven duyduğunda bir belgeyi işaretlediğini ve belge düzeyindeki yanlış pozitif oranını yüzde 1’in altında tutan şeyin bu eşik olduğunu söylemiştir. Turnitin, AI yardımıyla yazılmış metinlerin yaklaşık yüzde 85’ini yakaladığını, yanlış bir suçlama riskine girmemek için geri kalanını ise bilerek kaçırdığını tahmin etmiştir.
Turnitin’in cümle düzeyinde döndürdüğü gerçek yanlış pozitif yüzdesi, yani bir arayüzün tüm bir belge yerine belirli satırları vurguladığı durumda, aslında yüzde 4’e daha yakındır. Bir profesörün tüm belge puanı yerine tek bir işaretlenmiş paragrafın ekran görüntüsünü alması durumunda bilinmesi gereken sayı budur, çünkü vurgulanan bir cümle, yanındaki belge puanına kıyasla anlamlı biçimde daha yüksek bir yanlış olma olasılığı taşır.
Turnitin’in bu farkı doğrudan kabul etmiş olması da ayrıca önemlidir. İlk gerçek dünya sonuçlarının, özellikle daha kısa belgelerde, laboratuvar testlerine dayanarak beklenenden daha yüksek yanlış pozitif oranlarına sahip olduğunu tespit ettiler. Bu nedenle, puanlanacak asgari belge uzunluğunu 150 kelimeden 300 kelimeye çıkardılar. Bu, yayımlanan sayının laboratuvar dışında geçerli olmadığını gösterdiği için, kendi ürününü ayarlayan bir satıcıdır, bu da herhangi bir bağımsız çalışma kadar çok şey söyler.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Yanlış pozitifin bir öğrenciye gerçek maliyeti nedir
Bu durum Yale's School of Management'ta bir executive MBA öğrencisinin başına geldi. Öğrenci, mümkün olan en kelimesi kelimesine anlamda, bir ihlalle suçlandı. Kullanılan algılayıcı GPTZero idi. Öğrencinin bir finans dersindeki final sınavı, yazının uzun ve ayrıntılı olduğu, noktalama ve dilbilgisinin neredeyse kusursuz göründüğü düşünen bir öğretim asistanı tarafından işaretlenmişti. Ve bu belirli profesör, yanıtları AI tarafından üretilmiş olma olasılığıyla puanlayan GPTZero üzerinden geçiriyordu.
Dersi geçemedi ve bir yıl uzaklaştırıldı. Şubat 2025'te federal mahkemede açılan davasında, Yale'in kendi politikasının tam da bu nedenle GPTZero gibi araçların kullanımını kısıtladığı, bunun ana dili İngilizce olmayan konuşurlara karşı belgelenmiş yanlış pozitif oranı olduğu ve onun da bu politikaya aykırı biçimde bunu kullandığı ileri sürülmektedir. Dilekçesinde ayrıca, GPTZero'nun Yale'in eski üniversite rektörünün ve işletme fakültesi dekanının akademik yazılarına yüzde 100 AI tarafından üretilmiş puanı verdiği de belirtilmektedir.
Yargıç, Mayıs 2025'te erken ihtiyati tedbir kararı vermeyi reddetti. Dava henüz sonuçlanmış değildir, bunu yazdığım sırada. Davacı, Fransız vatandaşıdır, aynı bilinen önyargının ana dili İngilizce olmayan konuşurlara karşı onun yazısının bu şekilde performans göstermesine yol açtığını ileri sürmektedir. Bir sonraki bölümde buna bakıyoruz. Tartışmaya açık olmayan şey bedeldir, bir derece programından kaybedilen bir yıl, başarısız not, hukuki giderler ve bir derece kazanmak yerine bir puan üzerinde aylarca süren mücadele. Yüzde 1'lik yanlış pozitif oranı, büyük bir nüfus onu belirli bir kişiye dönüştürene kadar küçük görünür.
AI dedektörleri ana dili İngilizce olmayan konuşurları neden yanlış sınıflandırır?
Kötü biçimde ve büyük bir farkla. Bunu ilk kez sayısallaştıran çalışmanın vardığı sonuç budur. Stanford araştırmacıları, yaygın olarak kullanılan yedi GPT dedektörünü, ana dili İngilizce olmayan konuşurlar tarafından yazılmış 91 TOEFL denemesi ve ABD'li sekizinci sınıf öğrencileri tarafından yazılmış 88 deneme üzerinde test etti. Dedektörler, sekizinci sınıf denemelerini neredeyse her zaman doğru okudu. Sıra, yetişkinler tarafından yazılmış ve lisansüstü düzeyde bir İngilizce sınavına girecek kadar akıcı olan TOEFL denemelerine geldiğinde, dedektörlerin ortalama yanlış pozitif oranı yüzde 61.3 oldu. 91 denemenin 89'u, yedi dedektörden en az biri tarafından GPT tarafından üretilmiş olarak işaretlendi, bu denemelerin 18'i ise yedi dedektörün tamamı tarafından işaretlendi.
Tespit mekanizması, geri kalan tüm tespiti yöneten mekanizmanın aynısıdır: öngörülebilir sözcük dağarcığı ve daha basit cümle kuruluşu düşük perplexity olarak okunur, düşük perplexity de kalemi kimin tuttuğundan bağımsız olarak makine üretimi olarak okunur. İkinci bir dilde çalışan yazarlar, yerleşik ifadelere yaslanır, çünkü ek bir dilde akıcılığın gerçekte nasıl göründüğü budur ve bir detectorün işaretlemek üzere tasarlandığı profil tam olarak budur.
Bu konumdaki yazarlar için yalnızca daha doğal yazmaları yönündeki tavsiye pek yararlı değildir, çünkü doğal olan zaten işaretlenmiştir. TextPulse's ESL akademik yazarlar için sayfası, bu riskin arkasındaki ifade kalıplarını daha ayrıntılı biçimde ele alır, cümlenin anlamını değiştirmeden bunları neyin değiştirdiğini de açıklar.
Bu, tekil bir vaka değildi. Aralık 2025'te, bu detectorlerdeki yanlılığı değerlendirmek üzere açıkça tasarlanmış yeni bir benchmark yayımlandı. Bu benchmark, birden fazla demografik grup ve dil boyunca 200,000'den fazla örnek içeriyordu. Stanford'un ilk çalışmasından iki yıl sonra yayımlanmış olmasına ve aynı detectorlerin birçok farklı model sürümünü içermesine rağmen, bu benchmark İngilizce öğrenenlere yönelik yanlılığın hâlâ mevcut olduğunu ortaya koydu.
Bu durum tüm vendorlar için geçerli değildir. Pangram'ın kendi teknik dokümantasyonu, sınıflandırıcısının ana dili İngilizce olmayan konuşurlara karşı yanlı olmadığını belirtir. Chicago Booth araştırmacıları bu iddiayı bağımsız olarak test etmedi, ancak bu durum, detectorlerin daha yeni kuşağının sorunu görmezden gelmek yerine onu dikkate alarak geliştirildiğini göstermektedir.
Kendi yazınızın başkası puanlamadan önce nerede durduğunu görmek istiyorsanız, bir ücretsiz perplexity checker, herhangi bir şeyi önce bir kuruma göndermeden, bir detectorün hesaplayacağı aynı temel sayıyı size verir.
Başka kimler işaretlenir, ve neden
İngilizceyi ana dili olarak konuşmayanlar belgelenmiş en büyük riski taşır, ancak aynı istatistiksel mantık başka yazıları da yakalar. Weber-Wulff'un ekibi, test ettikleri 14 aracın tamamının, araçları yeniden ifade edilmiş metinler üzerinde çalıştırdıklarında daha az doğru olduğunu buldu, bu da bir denetleyici, bir editör ya da bir danışmanın kırmızı kaleminden geçmiş ve ardından biri üzerinde bir dedektör çalıştırmadan önce akademik yazının anlamlı bir bölümünü tanımlar.
Bunun hiçbiri sayının anlamsız olduğu anlamına gelmez, yalnızca belirli bir kişi hakkında bir şey ifade etmeden önce doğrulanması gerektiği anlamına gelir. Eğer elinizde tekdüze okunan, benzer cümle uzunluklarına ve metin boyunca benzer bir ritme sahip bir metin varsa, onu kimin yazdığından ya da neden yazdığından bağımsız olarak daha makine benzeri puan alır. Bu durum, tahmin etmek yerine doğrudan ücretsiz burstiness checker kullanılarak denetlenebilir.
Savunulabilir bir AI tespit politikasının görünümü
Yale'in zaten, bu makalenin ortaya koyduğu nedenlere oldukça yakın gerekçelerle GPTZero gibi araçları kısıtladığı bildirilen bir politikası vardı, belgelenmiş bir yanlış pozitif oranı ve İngilizceyi ana dili olarak konuşmayan yazarlara karşı belgelenmiş bir yanlılık. Dolayısıyla bu, talihsiz bir öğrencinin hikayesinden çok, mevcut bir kuralın uygulanmaması hikayesidir. Bir politika gerçekten bir puan ile bir hüküm arasındaki farkı uygularsa, puan bir hüküm değil, girdilerden biri haline gelir.
- Puanı, bir suistimal tespitinin tek temeli değil, yalnızca girdilerden biri olarak ele alın
- Aracı kullanmadan önce, yayımlanmış yanlış pozitif oranını öğrencilere açıklayın
- Kısa teslimlere ve İngilizceyi ana dili olarak konuşmayanların yazılarına, belgelenmiş iki zayıf noktaya, ek dikkat uygulayın
- Bir istatistiği çürütmeyi gerektirmeyen bir itiraz yolunu güvence altına alın
Bunların hiçbiri sıra dışı değildir. Bu, başka herhangi bir yerde tek bir adli kanıt parçasının nasıl ele alınması gerektiğine daha yakındır, yararlı, denetlenebilir ve tek başına asla yeterli değildir.
Bireysel bir yazar için de aynı ilke, bir puan ortaya çıktıktan sonra değil, ortaya çıkmadan önce geçerlidir. Herhangi bir araçtan gelen tek bir sayı, bir hüküm değil bir tahmindir ve onu her iki yönde de kesinlik olarak ele almak, güvenli ya da yakalanmış, sayının destekleyebileceğinden fazlasını ondan istemektir.
TextPulse'un kendi AI humanizer aracı, aynı mantık üzerinden bir Human Score bildirir: bu, bir detector'ın onun hakkında verdiği hüküm değil, kendi metninizden hesaplanan bir tahmindir, bir taslağın şu anda nasıl okunduğuna dair bir gösterge olarak yararlıdır, ancak belirli bir detector'ın ne söyleyeceğine ilişkin bir vaat değildir.
Doğruluk sorusu, her biri kendi sayfasına sahip olan daha dar sorulara ayrılır. Detector'ların insan yazısını işaretleme oranı ayrı olarak ele alınır, Turnitin'in yanlış pozitif oranına ve ZeroGPT'nin doğruluğuna ilişkin özel kanıtlar da öyledir. Bir skor zaten size karşı kullanıldıysa, AI kullandığınızla suçlandığınızda ne yapmanız gerektiği üzerine pratik yazılar, AI kullanmadığınızı kanıtlamak için bir araya getirebileceğiniz kanıtlar ve skora kendi koşulları içinde yanıt veren bir itiraz mektubu yazma üzerine içerikler vardır.
Herhangi bir rapordaki sayı, sağlayıcılar modellerini yeniden eğittikçe ve araştırmacılar bunları daha zor vakalara karşı test etmeye devam ettikçe değişmeye devam edecektir. Ancak değişmemesi gereken şey, bunun altındaki alışkanlıktır: bir skoru birkaç ölçümden yalnızca biri olarak okumak, hangi popülasyon üzerinde doğrulandığını sormak ve sağlayıcının hâlâ yanlış yaptığı vakalar hakkında ne söylemediğini sormak.
Frequently Asked Questions
Evet. Weber-Wulff ve meslektaşları, 2023 tarihli bir karşılaştırmada AI tespit araçlarının 'ne doğru ne de güvenilir' olduğunu buldu ve ana dili İngilizce olmayan yazarlar en yüksek belgelenmiş riskle karşı karşıyadır, bir çalışma TOEFL denemelerinde ortalama yanlış pozitif oranının yüzde 60'ın üzerinde olduğunu bulmuştur. Tek bir puan tek başına hiçbir şeyin kanıtı değildir, bu yüzden bir suçlama için asla tek kanıt olmamalıdır.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.