AI Detection

Turnitin Yanlış Pozitif Oranı: Sayılar Ne Söylüyor

Turnitin iki yanlış pozitif oranı yayımlar, bir tane değil, ve bunların hiçbiri, belirli bir profesörün önünde duran makaleyi tanımlamaz. İşte belge düzeyi ile cümle düzeyi ayrımı, %20'nin altındaki yıldız işareti ve bir kesirlik yüzdeyi öğrencilerin gerçek sayısına dönüştüren aritmetik.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

Turnitin yanlış pozitif oranı tek bir sayı değildir. Şirket iki sayı yayımlar: belge düzeyinde yüzde 1’in altında bir oran ve cümle düzeyinde yüzde 4’e daha yakın bir oran. Her ikisi de gerçektir, her ikisi de yayımlanmıştır ve bunlardan hiçbiri tek başına, belirli bir profesörün önünde duran belirli bir makale hakkında fazla bir şey söylemez.

Bu iki sayı arasındaki fark ve bunlardan biri tek bir belge yerine gerçek bir sınıfa uygulandığında ne olduğu, bu metnin ele aldığı konudur: Turnitin’in bizzat ne söylediği, iki sayının gerçekte neyi kapsadığı ve bir yüzde kesrini öğrencilerin gerçek sayısına dönüştüren aritmetik.

Turnitin’e Göre Turnitin Yanlış Pozitif Oranı Nedir?

Belge düzeyinde, şirketin kendi ifadeleriyle: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Bu koşul, sayı kadar önemlidir. Yüzde 1’in altındaki oran, Turnitin’in puanladığı her makale hakkında bir iddia değildir. Yalnızca modelin kendi tahmininde yüzde 20 AI-written eşiğini zaten aşmış makalelerin alt kümesini tanımlar.

Cümle düzeyinde, bir arayüzün tüm belge yerine tek tek satırları vurguladığı yerde, Turnitin’in kendi oranı yaklaşık dört kat daha yüksektir. "Our sentence-level false positive rate is around 4%," diye belirtir şirket. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin, bu yanlış cümlelerin rastgele dağılmadığını da ekler: vakaların yüzde 54’ünde, yanlışlıkla işaretlenen bir cümle gerçek AI writing’in hemen yanında yer alır, şirket bunu da tüm belge puanının neden tek bir vurgulanmış satırdan daha iyi dayandığının bir parçası olarak sunar.

Belge Düzeyi ve Cümle Düzeyi Aynı İddia Değildir

Bu iki kademeli ayrım, Turnitin'in özgün konumu değil, revize edilmiş bir mesajdır. Nisan 2023'teki lansmanda şirket, belge ile cümle arasında hiçbir ayrım yapmadan, yüzde 1'in altında tek bir değer yayımladı. Kurumlar bu sayıyı atıf yapmaya başladıktan ve eğitim basını, gerçek dünyada beklenenden daha yüksek yanlış pozitif oranlarını bildirdikten sonra, Turnitin'in baş ürün sorumlusu, yukarıda kullanılan dökümü, buna yanıt olarak yapılan iki ürün değişikliğiyle birlikte yayımladı, bunlar, bir belgenin puanlanabilir asgari uzunluğunu 150 kelimeden 300 kelimeye çıkarmak ve bir belgedeki baştaki ve sondaki cümlelerin nasıl puanlandığını değiştirmekti.

300 kelimelik alt sınır, ilgili bir nedenle vardır. Turnitin, şirketin kendi ifadesiyle, doğruluğun daha fazla metinle arttığını gördükten sonra bunu başlangıçtaki 150 kelimelik asgari düzeyden yükseltti. Kısa bir gönderim, tek sayfalık bir yansıtma yazısı, eksik bir taslak, bir tartışma gönderisi, modele çalışabileceği daha az sinyal verir, yukarıdaki yanlış pozitif oranlarının ölçüldüğü durumdan daha az, bu da bu alt sınırın altındaki herhangi bir şeyin neden hiç AI puanı almadığını, güvenilmez bir puan almak yerine, kısmen açıklar.

DüzeyTurnitin'in belirttiği oranGerçekte neyi kapsar
Belge düzeyiYüzde 1'in altındaYalnızca zaten yüzde 20 veya daha fazla AI tarafından yazılmış olarak işaretlenmiş belgeler, tüm gönderimin genel yüzdesi
Cümle düzeyiYaklaşık yüzde 4AI yazım raporu içinde vurgulanan herhangi bir tekil cümle, belgenin genel puanından bağımsız olarak
Yüzde 20 belge eşiğinin altındaHiçbir sayı gösterilmezTurnitin, bu aralıkta sonucun daha az güvenilir olduğunu işaretleyerek, yüzde yerine bir yıldız işareti gösterir

Kendi makalenizi insanlaştırın

AI destekli metninizi dönüştürün ve önemli kelimelere ya da atıflara dokunmadan, insan tarafından yazılmış gibi duyulmasını sağlayın.

Ücretsiz başlayın

Aritmetik: Bir Yüzde Kesirinin Gerçek Bir Kohort İçin Anlamı

Matematik, Vanderbilt University'nin Ağustos 2023'te Turnitin'in yapay zeka tespitine ilişkin hata oranlarını hesapladığında kamuya açık biçimde yapılmıştı. Bu matematiğin nasıl yapılacağına dair en iyi örnek, Vanderbilt'in sayıların kendi hesabıdır. Turnitin'in yapay zeka dedektörünü kapatma kararlarına ilişkin bir blog yazısında, "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI." notunu düştüler.

Bu rakam, Vanderbilt'in kendi hacmine uygulanan, satıcının yayımladığı sayının Vanderbilt'in kendi çıkarımıdır, ayrı olarak ölçülmüş bir sonuç değildir. Aritmetiğin yapısı, tek bir üniversitenin öğrenci sayısının ötesine genellenir. Birkaç yüz makaleye uygulanan yüzde 1'in altındaki bir oran, yanlışlıkla işaretlenen birkaç öğrenciyi üretir, bu da gözden kaçırılması kolaydır. Aynı oran, gerçek bir üniversitenin her yıl gönderdiği ölçek olan on binlerce makaleye uygulandığında, tek başına ele alındığında değil, küçük bir yüzde ile büyük bir nüfus birlikte çarpıldığı için, birkaç yerine yüzlerce sonuç üretir.

Bunların hiçbiri, gerçek dünyadaki oranın laboratuvar figürüyle tam olarak örtüştüğünü kanıtlamaz. Turnitin'in kendi baş ürün sorumlusu, gerçek dünya sonuçlarının laboratuvar testlerinden farklı olduğunu kamuya açık biçimde kabul etmiştir, şirketin mesajlarını ilk etapta revize etmesinin nedenlerinden biri de budur. Yukarıdaki aritmetik, Turnitin'in kendi beyan ettiği sayıyı ciddiye alınması gereken bir girdi olarak ele alır, bir aracın, özenle seçilmiş bir ölçütle hiçbir benzerlik göstermeyen gönderimleri puanladığında gerçekte ne olduğuna dair bir üst sınır olarak değil.

Oranın Kapsamadığı Şeyler

20 yüzde eşiğinin altındaki bir sonuç, ona eklenmiş küçük bir yüzde almaz. Bunun yerine bir sayı değil, bir yıldız işareti alır. Turnitin bunu, bu aralığın aracın her iki yönde de en az güvenilir olduğu yer olması nedeniyle seçmiştir. Bu durum, şirketin aynı aralık için kullandığı düşük güven çerçevesinin yanı sıra bağımsız eğitim basını haberleriyle de doğrulanmaktadır. Hafif bir düzenleme, bir paragrafın yardım alınarak gözden geçirilmesi ve geri kalanının yardımsız yazılması, hiç görünür bir puan üretmeyebilir, küçük bir puan yerine. Bu, eksik bir sayının ya bir suçlama ya da temiz bir sağlık raporu olarak okunmasından önce bilinmesi gereken bir durumdur. TextPulse's iyi bir Turnitin puanı sayılan şeylere ilişkin rehberi, raporun okuyucu tarafında aynı eşiği ele alır.

Yayınlanmış Bir Yanlış Pozitif Oranı Nasıl Okunmalıdır?

Bir satıcının, ilk bakışta tanımladığından daha dar bir koşul hakkındaki rakamı olarak, belirli bir profesörün önünde duran makale hakkında bir ifade olarak değil. Turnitin kendi çıktısını da aynı şekilde çerçeveler, şirket açıkça AI writing detection teknolojisinin "a determination of misconduct" sağlamadığını, yalnızca "data for educators to make an informed decision" sunduğunu belirtir. AI detectors gerçekten doğru mu sorusuna ilişkin daha geniş kanıtlar da aynı okumayı destekler, yayınlanmış bir oran bir ölçütü tanımlar, şu anda değerlendirilen belgeyi değil.

Kendi taslaklarının aynı tür istatistiksel ölçümde nerede durduğunu bilmek isteyen yazarlar, tahmin etmek yerine, herhangi biri bir kurumun dedektörüne ulaşmadan önce bunu doğrudan bir ücretsiz perplexity checker ile kontrol edebilir. Bu, teknolojiyi sonradan bir puanla tartışmaya çalışmaktan farklı bir kullanımdır ve bir yazarın, bir yöneticiden ziyade, sayıyı ilk gören olduğu tek yerdir.

ZeroGPT'nin doğruluğu ayrıca incelenir, eğer bir kurum bunun yerine onu kullanıyorsa. Bu hataların en ağır biçimde etkilediği grup, ana dili İngilizce olmayan yazarlar, kendi sayfasının konusudur.

Bu aritmetiğe en fazla maruz kalan nüfus da eşit biçimde dağılmamıştır. Ana dili İngilizce olmayan yazarlar, bu yüzdelerin herhangi birinin yanlış tarafında kalma konusunda belgelenmiş en yüksek riski taşır, tam da TextPulse'un ESL akademik yazarlar için sayfasının etrafında kurulduğu kitle budur. Turnitin, modelini yeniden eğittikçe bu rakamları revize etmeyi sürdürecektir. Değişmeyecek olan şey aritmetiğin kendisidir, bu kadar küçük bir oran, içine kaybolabilmek için hâlâ bu kadar büyük bir nüfus gerektirir ve gerçek gönderimlerin çoğu bu kadar şanslı değildir.

XLinkedInFacebook

Sıkça Sorulan Sorular

Turnitin yanlış pozitif oranı, şirketin kendi yayımladığı verilere göre, tek bir sayı değildir. Belge düzeyinde Turnitin, %20 veya daha fazla yapay zekâ tarafından yazılmış olarak işaretlenmiş belgeler için geçerli olmak üzere, %1'in altında bir oran belirtir. Tek tek satırların vurgulandığı cümle düzeyinde ise şirketin kendi verdiği oran yaklaşık %4'tür.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI insanlaştırma hakkında güncel kalın

Akademik yazım, AI tespiti ve insanlaştırma hakkında ipuçlarını gelen kutunuza alın.

Spam yok. İstediğiniz zaman abonelikten çıkabilirsiniz.