AI Detection

AI Dedektörleri Neden Ana Dili İngilizce Olmayan Yazarlar Aleyhine Yanlıdır

2023 Stanford çalışması, akıcı ana dili İngilizce olmayan yazının AI dedektörleri tarafından makine üretimi olarak, ana dili İngilizce olan yazıya kıyasla çok daha yüksek oranda yanlış okunduğunu buldu. Bu farkın arkasındaki mekanizma ve aynı denemeler daha zengin sözcük dağarcığıyla yeniden yazıldığında ne olduğu burada açıklanmaktadır.

Güncellendiği tarih 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

AI dedektörlerinin ana dili İngilizce olmayan konuşurlara karşı önyargılı olması öznel bir şikayet değildir. Hakemli bir 2023 Stanford çalışması bunu doğrudan ölçtü. Araştırmacılar, yaygın olarak kullanılan yedi GPT dedektörünü, ana dili İngilizce olmayan konuşurlar tarafından yazılmış 91 gerçek TOEFL denemesi ve Amerikalı sekizinci sınıf öğrencileri tarafından yazılmış 88 deneme üzerinde çalıştırdı, ardından her grubun nasıl puanlandığını karşılaştırdı.

Dedektörler sekizinci sınıf denemelerini neredeyse her seferinde doğru okudu. Zaten lisansüstü düzeyde bir İngilizce yeterlilik sınavını geçmiş yetişkinler tarafından yazılmış TOEFL denemelerinde, aynı yedi araç ortalama 61.22 percent yanlış pozitif oranı verdi. Doksan bir denemenin seksen dokuzu, neredeyse 98 percent, yedi araçtan en az biri tarafından AI tarafından üretilmiş olarak işaretlendi.

TextPulse'un AI dedektörü doğruluğuna ilişkin daha geniş kanıtlara dair genel değerlendirmesi, bu manşet bulguyu ve bunun ardından yol açtığı davaları ele alır. Çalışmanın atıf aldığı neredeyse her yerde atlanan şey mekanizmadır, yani lisansüstü düzeyde İngilizce konuşan birinin düzyazısı neden baştan makine tarafından üretilmiş gibi okunur ve bu okuma biçimi değiştiğinde ne olur.

ana dili İngilizce olmayan konuşurlara karşı önyargılı AI dedektörleri, mekanizma

Bir dedektör hiçbir zaman anlam için okumaz. Ondan önce gelen sözcükler verildiğinde her bir sözcüğün ne kadar öngörülebilir olduğuna bakar ve modelin metnin çoğunu önceden tahmin edebilmiş olması durumunda bir pasajı düşük puanlar. Sözcük çeşitliliği, yani bir yazarın daha küçük bir güvenli sözcük kümesini tekrar etmek yerine ne kadar geniş bir sözcük dağarcığı kullandığı, ve sözdizimsel öngörülebilirlik, yani cümle yapısının dildeki en yaygın örüntüyü ne kadar yakından izlediği, bu puanı düşüren dil üretimi özelliklerinden ikisidir.

Bu ayrım önemlidir, çünkü ikisi sayfada farklı biçimlerde görünür. Sözcüksel çeşitlilik, sözcüklerin kendileriyle ilgilidir: üç farklı cümlede 'obtain,' 'acquire,' ve 'secure' sözcüklerine yönelen bir yazar, 'get' sözcüğünü üç kez kullanan birine göre, cümleler başka açılardan özdeş olsa bile, daha çeşitli okunur. Sözdizimsel öngörülebilirlik ise yapıyla ilgilidir: özne, fiil, nesne, tekrar tekrar yinelenen bir düzen, bir yan cümleyle açılan ya da beklenmedik bir sözcükle biten bir cümleye karşılık. Sınav koşulları altında çalışan ikinci dil yazarı, her iki durumda da daha güvenli olan biçime yönelmek için her nedene sahiptir.

İkinci dilde yazı, her iki özelliği de güvenilir biçimde daha az gösterir ve bu bir eksiklik olarak değil. Ek bir dilde çalışan bir yazar, doğru olma olasılığı en yüksek sözcük dağarcığına ve cümle kalıplarına yaslanır, çünkü dil henüz tam otomatik olmadığında yanlış tahmin etmenin bedeli daha yüksektir. Dedektör yanlılığını belgeleyen Stanford makalesi, AI dedektörleri ortaya çıkmadan çok önce yerleşmiş olan tam bu örüntü üzerine uygulanmış dilbilim araştırmalarından oluşan bir literatüre atıf yapar: azalmış sözcüksel zenginlik, azalmış sözcüksel çeşitlilik ve daha basit cümle yapısı, ikinci dil yazısının başka bir şeyin işareti değil, belgelenmiş ve ölçülebilir özellikleridir.

Anadil ve anadil olmayan yazı arasındaki bu fark, bir dedektörün bir pasajın makine tarafından üretilip üretilmediğine karar vermek için kullandığı aynı ölçüm olan perplexity farkı olarak ortaya çıkar. Daha düşük perplexity, onu kimin ürettiğinden bağımsız olarak daha makine benzeri okunur ve ikinci dil yazısı, bir chatbot ile hiçbir ilgisi olmayan nedenlerle bu ölçekte daha aşağıda yer alır. Bu farkın, bir rastlantıdan ziyade, gerçekten dedektörleri yönlendiren şey olup olmadığı test edilebilir bir sorudur. Stanford ekibi bunu doğrudan test etti.

Aynı Denemeler Daha Zengin Sözcük Dağarcığıyla Yeniden Yazıldığında Ne Oldu

Araştırmacılar, %61.22 ortalama yanlış pozitif oranını tetiklemiş olan aynı 91 TOEFL denemesini aldılar ve ChatGPT’den bunları tek bir yönergeyle gözden geçirmesini istediler: "Kelime seçimlerini ana dili konuşan birine daha çok benzeyecek şekilde geliştir." İçerik, argüman ya da dilbilgisi açısından hiçbir değişiklik yapılması istenmedi. Bu tek düzenlemeden sonra, aynı yedi dedektör üzerindeki ortalama yanlış pozitif oranı %11.77’ye düştü, bu da neredeyse elli yüzde puanlık bir azalma demekti, ve her dedektörün oybirliğiyle işaretlediği deneme sayısı on sekizden bire indi.

Araştırmacılar ardından deneyi ters yönde yürüttüler. Dedektörlerin başlangıçta neredeyse her seferinde doğru biçimde puanladığı, ana dili konuşanlara ait 88 sekizinci sınıf denemesini aldılar ve ChatGPT’den, sanki ana dili İngilizce olmayan biri tarafından yazılmış gibi, kelime seçimlerini sadeleştirmesini istediler. Aynı ana dili konuşanlarca yazılmış denemelerde ortalama yanlış pozitif oranı %5.19’dan %56.65’e sıçradı. Denemelerin yazarlığı değişmedi. Yalnızca kelime dağarcığı değişti ve dedektörler kelime dağarcığını izledi.

Perplexity, her iki yönde de yanlış sınıflandırma oranıyla aynı doğrultuda hareket etti, TOEFL denemeleri zenginleştirildiğinde keskin biçimde yükseldi ve sekizinci sınıf denemeleri sadeleştirildiğinde keskin biçimde düştü. Yazarlar bundan açık bir sonuç çıkarıyorlar: dedektörlerin gerçekte yanıt verdiği şey hiçbir zaman yazarlık değildi. Bu, herhangi bir yazarın kelime dağarcığının, İngilizceyi nerede öğrendiğinden bağımsız olarak taşıyabileceği bir özellik olan kelime seçimi idi.

Bu Yanlılık Farklı Dedektörler Arasında Ne Kadar Tutarlıdır

Yedi dedektör, hatanın hangi yönde ilerlediği dışında pek çok konuda anlaşmadı. Her biri TOEFL denemelerini sekizinci sınıf denemelerinden çok daha sık işaretledi, ancak bunu çok farklı oranlarda yaptı.

DedektörYanlış pozitif oranı, TOEFL denemeleriYanlış pozitif oranı, ana dili İngilizce olanların denemeleri
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Bunlar 2023 verileridir, o dönemde mevcut oldukları hâliyle araçlar üzerinde ölçülmüştür. O zamandan beri birkaçının durumu tamamen değişmiştir: OpenAI, bu testten dört ay sonra, Temmuz 2023'te kendi dedektörünü kapattı, çünkü gerçek AI tarafından yazılmış metnin yalnızca yüzde 26'sını doğru biçimde işaretlediğini, buna karşın insan yazısının yüzde 9'unu hâlâ yanlış etiketlediğini buldu. Değişmeyen şey, farkın yönüdür. Demografik ve dilsel kategoriler boyunca dedektörleri test etmek için özel olarak oluşturulmuş, daha geniş bir yanlılık ölçütü, Aralık 2025'te yayımlandı ve dört daha yeni açık kaynak araç üzerinde uygulandı, yine de yeterince temsil edilmeyen yazar grupları için tutarlı biçimde daha düşük recall bildirdi.

Kendi makalenizi insanlaştırın

AI destekli metninizi dönüştürün ve önemli kelimelere ya da atıflara dokunmadan, insan tarafından yazılmış gibi duyulmasını sağlayın.

Ücretsiz başlayın

Bu Yanlılık Daha Yeni Dedektörlerde Hâlâ Ortaya Çıkıyor mu?

Stanford çalışması artık birkaç AI nesli eskidir ve yazarları sınırlamayı kendileri de belirtmiştir: küçük bir pilot örneklem ve çoğunlukla GPT-2 üzerine kurulu dedektörler, bugün tespiti destekleyen modelden çok daha küçük ve daha eski bir model. Bu, makul bir soru ortaya çıkarır. Daha iyi teknoloji farkı kapattı mı?

En son yapılan özel test, henüz değil diyor. Sultan Qaboos University’den Şubat 2026 tarihli bir çalışmada araştırmacılar, iki güncel ticari dedektörü, Turnitin ve Originality, 192 metin üzerinde test etti. Bu metinler, ChatGPT öncesi özgün EFL öğrenci yazısı, profesyonel insan yazısı, AI tarafından üretilmiş metin ve hibrit insan AI metnini karıştırıyordu. Sonuçlar, iki araç için genel doğruluğun sırasıyla yüzde 69 ve yüzde 61 olduğunu gösterdi, hibrit kategorideki doğruluk ise, bir düzenleme aşamasının gerçekte ürettiği yazı türünde, sıfıra yaklaştı. Aynı çalışma, dil kaynaklı önyargıyla birlikte işleyen ikinci bir önyargıyı da ortaya koydu, bilimsel yazıda doğruluk, beşeri bilimler yazısına kıyasla 28 ila 38 yüzde puanı daha düşüktü.

Bu bulgulardan hiçbiri tek bir kusurlu ürüne ilişkin değildir. Üç yıl arayla, farklı araştırma ekipleri tarafından farklı derlemeler üzerinde test edilen iki ayrı dedektör mimarisi, aynı sonuca ulaşmaya devam ediyor, tür konvansiyonu tarafından biçimlendirilen ya da ikinci bir dilin etkisini taşıyan yazı, bu araçların makine yapımı dediği şeye, ne biri ne de diğeri olan yazıdan daha yakın duruyor. TextPulse's free tools, bir yazarın herhangi bir metin kuruma ait bir dedektöre ulaşmadan önce aynı istatistiksel profili kontrol etmesini sağlar.

Farkın Gerçek Olduğuna, Bir Test Artefaktı Olmadığına Dair Bağımsız Kanıt

TOEFL sonuçlarıyla ilgili ilk sorun, bunların yalnızca 2023 tarihli küçük bir pilot çalışmaya uygulanıyor olabileceği ileri sürülebilmesidir. Buna, aynı araştırma ekibi tarafından dedektörlerle hiçbir ilgisi olmayan veriler kullanılarak yapılan başka bir çalışmada yanıt verildi. ChatGPT var olmadan önce gönderilmiş ve değerlendirilmiş özetlerle örneklemi sınırlayarak, büyük bir makine öğrenmesi konferansı olan ICLR 2023’e kabul edilen 1.574 makaleyi incelediler.

İngilizcenin birincil dil olmadığı ülkelerde bulunan yazarlar, ana dili İngilizce olan ülkelerde bulunan yazarlara kıyasla anlamlı biçimde daha düşük perplexity ile özetler yazdılar ve bu fark, her bir makalenin değerlendiriciler tarafından ne kadar yüksek puanlandığı kontrol edildikten sonra bile devam etti. Bu örneklem, birinin bir chatbot gibi daha çok ya da daha az görünmeye çalışmasıyla şekillendirilmiş olamazdı. ChatGPT, gönderim süresi sona erdiğinde yayıma üç ay uzaktaydı. Ana dili İngilizce olan ve olmayan akademik yazı arasındaki perplexity farkı, detektörlerin uydurduğu bir şey değildir. Onların devraldığı bir şeydir.

AI tespitinin bir test problemi olarak ele alındığı 2026 tarihli istatistiksel bir analiz, aynı sonucun biçimsel bir versiyonunu sunar. Bir yazar grubunun ürettiği dil, toplu olarak, tipik AI çıktısıyla örtüştüğünde, AI tarafından yazılmış metni gerçekten yakalama gücüne sahip herhangi bir detektör, özellikle o grup için daha yüksek bir yanlış pozitif oranı taşımak zorundadır, bu, herhangi bir tek aracın kusuru değil, farklı bir nüfusu test etmenin matematiksel bir özelliğidir. Ana dili İngilizce olmayan yazarlar, tam olarak bu örtüşmenin en açık belgelenmiş örneğidir.

Bu, İkinci Bir Dilde Yazı Yazanlar İçin Ne Anlama Gelir

Bütün bunlar, kendinizden daha azına benzer şekilde yazmanız için bir gerekçe değildir. Bu, bir puan gelmeden önce gerçekte neyin ölçüldüğünü bilmek için bir nedendir. Metninizi öngörülebilir olarak okuyan bir detektör, ikinci dilde yazının gerçek bir istatistiksel özelliğini yakalıyordur, kullanmadığınız bir aracı kullandığınıza dair kanıtı değil.

İlk çalışmayı yürüten Stanford araştırmacıları, kendi bulgularının rahatsız edici bir sonucuna dikkat çeker: yanlış pozitif riskini azaltan aynı kelime dağarcığı ayarlaması, bir yazarın tamamen ayrı nedenlerle, daha açık bir ifade, daha kesin bir sözcük, herhangi bir detektörden bağımsız olarak, isteyebileceği türden bir revizyondur. TextPulse'un ESL akademik yazarlar için sayfası, bu tür bir revizyonun gerçek cümlelerde nasıl göründüğünü, tespit puanıyla ilgili her şeyden ayrı olarak ele alır.

Yeni nesil dedektörler bu örüntüyü açıkça hesaba katmaya başlıyor. Pangram, daha yeni ticari girişimlerden biri olarak, kendi teknik dokümantasyonunda sınıflandırıcısının ana dili İngilizce olmayan yazarlara karşı önyargılı olmadığını belirtir, ancak bu iddia bağımsız testlerden değil, satıcıdan gelmektedir. Bir ücretsiz perplexity checker, herhangi bir aracın bir yazı parçasından hesapladığı aynı temel ölçümü, taslağı önce herhangi bir yere göndermeden gösterir.

Aynı kümede iki pratik yardımcı yer alır: a, an ve the ne zaman kullanılır, bu örüntünün tek en yaygın kaynağıdır, ve daha genel olarak İngilizce akademik yazıda doğal nasıl duyulunur.

Araştırma, iki yıl sonra da farklı ekipler, farklı dedektörler ve farklı test tasarımları boyunca aynı yönde birikmeye devam etmektedir. Buna ayak uyduramayan şey, yaygın biçimde benimsenmiş kurumsal bir yanıttır, herhangi birine güvenmeden önce bir dedektörü farklı yazarlar yelpazesine karşı denetlemek, bunu belirli bir öğrenci zaten suçlandıktan sonra yapmak yerine. Bu rutin hâline gelene kadar, yanlış bir işaretlemenin hatalı olduğunu kanıtlama yükü, tam da bu araştırmanın en olası alıcılar olduğunu söylediği yazarlara düşmektedir.

XLinkedInFacebook

Sıkça Sorulan Sorular

AI dedektörleri ana dili İngilizce olmayanlara yanlıdır ifadesi, spekülasyon değil, hakemli bir bulgudur. 2023 Stanford çalışması, yaygın kullanılan yedi GPT dedektörünün gerçek TOEFL denemelerinin ortalama yüzde 61.22'sini AI tarafından üretilmiş olarak yanlış sınıflandırdığını, buna karşılık ana dili İngilizce olanların denemelerini neredeyse her zaman doğru okuduğunu buldu.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI insanlaştırma hakkında güncel kalın

Akademik yazım, AI tespiti ve insanlaştırma hakkında ipuçlarını gelen kutunuza alın.

Spam yok. İstediğiniz zaman abonelikten çıkabilirsiniz.