AI Detection

Winston AI İncelemesi: %99.98 Doğruluk İddiası ve Kanıtlar

Winston AI, dedektör sektöründeki en yüksek kendi beyanı olan %99.98 doğruluğu, şirketin hiçbir zaman yayımlamadığı dahili bir test kümesinde ölçtüğünü iddia ediyor. Hakemli RAID ölçütü, sabit %5 yanlış pozitif oranında genel doğruluğunu %71 olarak belirledi, yine de test edilen dört ticari dedektör arasında ikinci sırada yer aldı. İşte her sayının gerçekte neyi ölçtüğü ve bu aracın gerçekten kimler için uygun olduğu.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI, ana akım AI dedektörleri arasında kendi iddiasına göre en yüksek oran olan 99.98% doğruluk sunduğunu belirtmektedir. Bu sayı, şirketin ana sayfasında "The Most Trusted AI Detector" ifadesinin yanında yer alır ve dış bir laboratuvardan değil, şirketin kendi iç testlerinden gelmektedir. Bununla birlikte, metodoloji, test kümesi büyüklüğü, insan üretimi ile AI üretimi örneklerinin oranı ya da çalışma eşiği bu sayıyla birlikte yayımlanmamıştır. İddia ile belgelendirme arasındaki bu boşluk, dikkatli bir okurun bu araç hakkında bilmesi gereken ilk şeydir.

İkinci nokta, Winston'ın gerçekten dışarıdan test edilmiş olmasıdır, bu da bazı dedektörlerin söyleyebileceğinden fazladır. ACL 2024'te sunulan ve hakemli bir çalışma olan RAID ölçütü, Winston'ı yaklaşık 6.2 million makine üretimi metin üzerinde test etmiş ve yanlış pozitif oranı 5% olarak sabitlenmişken 71.0% genel doğruluk ölçmüştür. Bu, 99.98%'den oldukça uzaktır. Ayrıca Winston'ı test edilen dört ticari dedektör arasında ikinci sıraya yerleştirmiş, GPTZero ve ZeroGPT'nin önüne koymuştur. Bu iki olgu da önemlidir ve biri diğerini geçersiz kılmaz.

Devamında, Winston'ın ne olduğu ve kimin için tasarlandığı, sağlayıcının ne iddia ettiği, 99.98%'lik bir kendi kendine ölçümün istatistiksel olarak ne anlama gelebileceği ve ne anlama gelemeyeceği, ayrıca bağımsız sayıların gerçekte ne gösterdiği ele alınmaktadır.

Winston AI Nedir ve Kimler Kullanır?

Winston AI, doğrudan eğitimcileri ve içerik yayıncılarını hedefleyen, ücretli ve abonelik temelli bir dedektördür. Özellik listesi bir öğretmenin iş akışı gibi görünür, şirketin sitesi taranmış belgelerden, fotoğraflardan ve el yazısından metin çıkaran OCR'ı, desteklenen platformları arasında listelenen bir Google Classroom entegrasyonunu, AI tespitiyle birlikte bir intihal denetleyicisini ve toplu gönderimleri yönetmek için belge düzenlemeyi tanımlar. Sağlayıcı, ChatGPT, Gemini, Claude, LLaMA "and much more" çıktısını tespit ettiğini belirtmektedir.

Arayüzün en ayırt edici kısmı, cümle düzeyindeki çıktıdır. Yalnızca tek bir yüzde döndürmek yerine Winston, AI tahmin haritası adını verdiği bir çıktı üretir, bu, bir belgenin hangi bölümlerinin makine tarafından üretilmiş gibi okunduğunu cümle cümle, renk kodlu olarak değerlendiren bir haritadır. Bir eğitimci için bu harita, yalın bir puandan daha kullanışlıdır, çünkü aracın şüphesinin nerede yoğunlaştığını gösterir. Ancak bunu aşırı yorumlamak da kolaydır, bu nokta aşağıda ele alınmaktadır.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
Söz konusu rozet, ana sayfada yer alan, arkasında adı belirtilmiş bir çalışma bulunmayan, 99.98% accurate ifadesidir.

Şirket Ne İddia Ediyor?

Winston AI'nin ana sayfasındaki manşet iddia "99.98% Accurate." ifadesidir. Bu yazı itibarıyla, bu değeri taşıyan sayfa, test korpusunun nasıl oluşturulduğunu, kaç örnek içerdiğini, hangi insan ve AI metni karışımını kullandığını veya bu değer ölçülürken dedektörün hangi karar eşiğine ayarlandığını yayımlamaktadır. Bu sektör için bu durum alışılmadık değildir, satıcıların doğruluk iddiaları ile bağımsız kanıtlar arasındaki aynı boşluk piyasadaki neredeyse her dedektörde görülür. Winston'ın bu iddiaya verdiği biçim, yalnızca kimsenin ona koyduğu en büyük sayıdır.

99.98%’lik Bir Öz Ölçüt Gerçekte Ne Anlama Gelebilir?

Bir an için aritmetiği ciddiye alın. 99.98% doğruluk oranı, her 10,000 örnekte 2 hata anlamına gelir. Bu değeri ölçebilmek için, bir şirketin her metnin gerçek kökeninin kesin olarak bilindiği, en az on binlerce belgeden oluşan etiketli bir test kümesine ihtiyacı vardır. Sonra bu sayı yalnızca o korpus üzerindeki performansı tanımlar, yani şu AI modellerini, şu istemleri, şu türleri, şu metin uzunluğunu ve seçilmiş tek bir eşik değerini.

Bunların hiçbiri kötü niyet gerektirmez. Popüler sohbet modelleri tarafından üretilen denemeler üzerinde eğitilmiş, ardından yine popüler sohbet modelleri tarafından üretilen denemelerden oluşan bir derlem üzerinde test edilmiş bir dedektör, gerçekten de neredeyse tavan düzeyinde puan alacaktır. Sorun aktarılabilirliktir. Girdi metin farklı bir modelden, farklı bir örnekleme stratejisinden ya da doğal üslubu alışılmadık derecede tekdüze olan bir yazardan gelir gelmez, ölçütün değerlendirildiği derlem artık yargılanan metni tanımlamaz. Dahili bir ölçüt, sonucunda en güçlü çıkarı olan tarafça, kendi seçtiği koşullarda yürütülen kontrollü bir deneydir. Bu bir kanıttır, ancak en zayıf türüdür ve eksik yöntem bilgisi, şirket dışındaki hiç kimsenin bunu denetleyememesi anlamına gelir.

Bağımsız Testler Ne Gösteriyor?

Winston'i içeren en titiz kamu testi, ACL 2024'te sunulan, Dugan ve meslektaşlarının hakemli çalışması RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors'dır. RAID, 11 dil modeli, 8 yazı alanı, 4 kod çözme stratejisi ve 11 düşmanca saldırı boyunca yaklaşık 6.2 milyon üretim üzerinde, dört ticari ürün dahil 12 dedektörü değerlendirdi, ve puanların karşılaştırılabilir olması için her dedektör aynı %5 yanlış pozitif oranına göre kalibre edildi.

DedektörRAID'de genel doğruluk, FPR %5'e sabitlenmiş
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

O tablonun iki okuması aynı anda dürüsttür. Winston'ın %71.0 değeri %99.98'e hiç yakın değildir ve Winston yine de mevcut en zor kamuya açık ölçütte üç ticari rakibinden ikisini geride bırakmıştır. Ortalamalar ayrıca açıklayıcı bir dağılımı da gizler. RAID'in model bazındaki sonuçlarında Winston, ChatGPT çıktısında %99.6 ve GPT-4 çıktısında %98.8 elde etmiş, bu da kendi ilan ettiği değere yakın kalmıştır, ancak GPT-2 metninde %47.6'ya ve temel MPT-30B modelinden gelen metinde %24.8'e düşmüştür. Parafraz edilmiş makine metninde ise doğruluğu %52.6'ya gerilemiştir.

Bu dağılım, %99.98 iddiasının küçük ölçekte bütün hikayesidir. Algılayıcının muhtemelen buna göre ayarlandığı metne, yani son dönem sohbet modellerinin sade düzyazı olarak yazdığı metne benzeyen içerikte Winston, pazarlama iddiasına yakın performans gösterir. Bu dağılımın dışına çıkıldığında performans hızla düşer. Dağılım içi metinden oluşturulmuş bir iç ölçüt, size gerçek bir gelen kutusunun içerdiği modeller, düzenlemeler ve parafrazların karmaşık karışımı hakkında neredeyse hiçbir şey söylemeden gerçekten kusursuza yakın bir sayı üretebilir. Algılayıcıların dayandığı istatistiksel sinyaller, AI algılayıcıları nasıl çalışır başlıklı açıklayıcımızda daha ayrıntılı olarak ele alınmaktadır.

Kendi makalenizi insanlaştırın

AI destekli metninizi dönüştürün ve önemli kelimelere ya da atıflara dokunmadan, insan tarafından yazılmış gibi duyulmasını sağlayın.

Ücretsiz başlayın

Yanlış Pozitifler, Kimler Zarar Görür?

RAID'in tasarımı, satıcı pazarlamasının nadiren görünür kıldığı bir ödünleşimi görünür kılar, çalışmadaki her doğruluk puanı, yanlış pozitif oranı %5'te sabitlenerek ölçülmüştür. Bu kalibrasyonda, gerçekten insan tarafından yazılmış 20 belgeden 1'i işaretlenir. Bir algılayıcı bu oranı eşiğini yükselterek düşürebilir, ancak bunu yalnızca daha az AI metni yakalayarak yapabilir, iki sayı birlikte hareket eder ve bir satıcı bunlardan yalnızca birini veriyorsa sonucun yarısını veriyor demektir.

Bu hataların yükü eşit biçimde dağılmaz. Formüle dayalı, geleneksel ve düşük varyanslı yazı, her istatistiksel algılayıcıya makine benzeri görünür ve bu tanım, yöntem bölümlerine, literatür taramalarına ve ikinci bir dilde çalışan yazarların dikkatli nesrine uyar. AI algılayıcılarının ana dili İngilizce olmayan konuşurları daha yüksek oranlarda işaretlemesi örüntüsü sektör genelinde belgelenmiştir ve Winston'ın yönteminde bunu muaf kılan hiçbir şey yoktur. Cümle düzeyindeki tahmin haritası da aynı ihtiyatı hak eder, kırmızıyla vurgulanan bir cümle, yazarlık hakkında kanıt değil, sözcük örüntülerine ilişkin istatistiksel bir gözlemdir. Haksız bir işaretlemeyle karşılaşan öğrenciler, itirafla değil, belgelendirmeyle başlamalıdır, AI kullanmadığınızı nasıl kanıtlarsınız başlıklı rehberimiz, gerçekte neyin ikna edici olduğunu ele alır.

Fiyatlandırma ve Erişim

Winston, sınırlı bir deneme sürümü olan ücretli bir üründür. Winston, 2,000 krediyle 14 günlük ücretsiz deneme, ayda $18 olan Essential planı, ya da yıllık faturalandırıldığında ayda $10, 100,000 aylık krediyle, ayda $29 olan, ya da yıllık $16, ekip koltukları ve daha büyük taramalar ekleyen Advanced planı ve bunun üzerinde bir Elite kademesi listeler. Bir sınıf dolusu teslimatı tarayan bireysel bir eğitimci için bu, Winston'ı dürtüsel satın alma alanına yerleştirir, kurumsal sözleşmelerden daha ucuzdur, çoğu ücretsiz araçtan daha yetkindir.

Winston'ın Algılayıcılar Manzarasındaki Yeri

Bağımsız kanıtlara göre Winston, piyasanın ücretsiz katmanından daha iyi, kendi reklamından daha kötü performans gösteren orta fiyatlı bir ticari algılayıcıdır. Cümle düzeyinde görünürlük, Classroom entegrasyonu ve intihal denetimini tek bir ucuz araçta isteyen ve her sonucu bir hükümden ziyade bir konuşma için başlangıç noktası olarak gören bir eğitimciye uygundur. Puanın kanıt işlevi görmesini gerektiren hiç kimseye uygun değildir, çünkü hiçbir algılayıcının puanı bunu yapmaz.

Tam Karşılaştırma

Winston, kalabalık bir alandaki dedektörlerden biridir ve %71 ile %99.98 arasındaki fark, sektör genelindeki bir örüntünün bir örneğidir. Turnitin, GPTZero, Originality, ZeroGPT ve diğerleriyle aynı kanıta öncelikli ölçütler üzerinden nasıl karşılaştırıldığını görmek için, AI dedektörlerinin karşılaştırılması konulu tam rehberimize bakın.

Kendi Araştırmamız Ne Buldu

TextPulse Research'ün dedektör uyum çalışmasında dokuz ticari yapay zeka dedektörü aynı 90 akademik metni puanladı. Bunlardan biri 455 kelimelik bir hibrit metindi: insan yazımı bir giriş ve kapanış, ortada 168 kelimelik yapay zeka üretimi bir bölüm. Winston AI bu metne 7% yapay zeka puanı verdi; diğer araçların aynı kelimeler için verdikleri kararlar ise 0% ile 95.7% arasında dağıldı. Makalenin tamamı, derlem ve araç bazlı puan matrisi TextPulse Research adresinde açık erişimde.

Çalışma derlemindeki hibrit metinde Winston AI.
Çalışma derlemindeki hibrit metinde Winston AI.
XLinkedInFacebook

Sıkça Sorulan Sorular

%99.98 rakamı Winston AI'nin kendi iddiasıdır, şirketin yayımlamadığı dahili bir test kümesinde ölçülmüştür. ACL 2024'te sunulan hakemli RAID ölçütünde Winston, yanlış pozitif oranı %5'e sabitlenmişken genel doğrulukta %71.0 aldı, ancak özellikle ChatGPT çıktısında %99.6'ya ulaştı. Bu iddia, gerçek dünya performansını değil, seçilmiş bir korpusu tanımlar.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI insanlaştırma hakkında güncel kalın

Akademik yazım, AI tespiti ve insanlaştırma hakkında ipuçlarını gelen kutunuza alın.

Spam yok. İstediğiniz zaman abonelikten çıkabilirsiniz.