AI Detection

Yapay Zeka Metni Neden Tespit Edilir? Gerçek Nedenler

Yapay zeka yazımının arkasındaki çözümleme süreci, her adımda olası sözcükleri ve olası cümle biçimlerini kayırır, bu yüzden yapay zeka metni akıcı okunsa bile tespit edilir. Bu yazı, sözcük dağarcığındaki düzlüğü, sözdizimsel tekdüzeliği ve yalnızca insan yazarların eğilim gösterdiği belirli seçimleri, alttaki matematiğe girmeden ele alır.

5 min
Why does ai text get detected: illustration of AI-generated writing sitting in a narrow band of a language model's probability distribution

Bir dil modelinden "The weather today is," cümlesini tamamlamasını isterseniz, "cerulean" ya da "apocalyptic" gibi bir renk seçmeye çalışmaz. Bunun yerine, "sunny," "cloudy," ya da "nice," demeye çalışır, çünkü eğitildiği her neyse onun içinde bu ifadenin ardından en sık gelen sözcükler bunlardı. Bir cümlede bir sonraki sözcüğü seçen yazılım, tam da bu tür bir yanıtı tercih edecek şekilde tasarlanmıştır.

AI metni neden tespit edilir? Çünkü "sunny"yi "cerulean"e tercih eden aynı eğilim, bir belgenin tamamına, sözcükten sözcüğe yayılır ve ortaya çıkan sonuç, bir insanın gerçekte bulunduğu yazı alanından daha dar bir olası yazı bandında yer alır. Bir dedektörün bir yalanı yakalaması gerekmez. Yalnızca bir pasajın sürekli olarak bu dar banda düştüğünü fark etmesi yeterlidir.

Aşağıda gelecek hiçbir şey bir formül gerektirmez. Mekanizma, üç farklı ölçekte yinelenen tek bir fikirde yaşar, sözcük seçimi, cümle biçimi ve bir yazarın düşünmeden yöneldiği belirli ayrıntı. Bu ölçeklerin her biri, AI dedektörlerinin gerçekte nasıl çalıştığı sorusunun daha geniş çerçevesine katkıda bulunur ve kök neden adlandırıldığında her biri daha kolay görülür.

AI Metni Neden Tespit Edilir? Kısa Yanıt

AI metni, bir modelin tahminlerini tamamlanmış cümlelere dönüştüren çözümleme süreci, her adımda olası sözcükleri tercih edecek biçimde kurulduğu için tespit edilir ve bunu binlerce sözcük boyunca tutarlı biçimde yapmak, insanın tipik olarak kullandığından daha dar bir dil kesitini işgal eden bir yazı üretir. İstatistiksel bir araç, her cümle dilbilgisel olarak kusursuz ve olgusal olarak doğru olsa bile bu darlığı bulabilir.

Bu tek nedenden üç belirti doğar. Sözcük dağarcığı en güvenli, yaygın sözcüğe doğru daralır. Cümle yapısı, tercih edilen birkaç biçime doğru daralır. Ve bir insanın neredeyse içgüdüsel olarak yaptığı o belirli, biraz düşük olasılıklı seçim, tuhaf sözcük, ara söz, eklenmesi hiçbir şey, tahmin edilmesi ise her şey olan ayrıntı, çoğu zaman hiç görünmez.

Bir Dil Modeli Bir Sonraki Sözcüğünü Nasıl Seçer

Bir dil modeli kendi haline bırakıldığında, yalnızca olası sonraki sözcüklerin tam sıralı listesini bildirir ve seçimi başka bir şeye bırakırdı. Uygulamada ise bir çözümleme stratejisi bu seçimi sözcük sözcük otomatik olarak yapar ve hangi stratejinin çalıştığı, temel model hiç değişmese bile çıktının nasıl göründüğünü değiştirir.

Greedy decoding her zaman tek en olası sözcüğü seçer. Nucleus sampling'i bir çözüm olarak tanıtan makalede, Ari Holtzman ve ortak yazarlar bu stratejiyi izlemenin, kendi ifadeleriyle, 'sönük ve tuhaf biçimde tekrar eden' bir metne yol açtığını gözlemledi. Birden çok olası devamı aynı anda izleyip sonra birinde karar kılan beam search de benzer bir sorunun başka bir biçimine takılır.

Sampling stratejileri bir miktar rastlantısallığı yeniden devreye sokar, ancak bunu kontrollü bir biçimde yapar. Temperature, bir sözcük seçilmeden önce modelin kendi en üst tercihlerini ne kadar keskin biçimde kayırdığını ayarlar. Bazen top-p olarak da adlandırılan nucleus sampling, dağılımı birleşik olasılığı bir eşik değeri aşan en küçük sözcük kümesine indirger ve yalnızca bu kümeden örnekleme yapar, özgün makalede güvenilmez kuyruğu yerine dağılımın dinamik bir çekirdeğinden örnekleme yapmak olarak tanımlanır.

Bu ayarların en az deterministik olanı bile, yine de modelin zaten olası gördüğü şeyler etrafında oluşturulmuş bir kısa listeden örnek çeker. İnsan yazısı hiçbir zaman bir sözlüğü sıralayıp en üsttekilerden örnekleme yapılarak üretilmedi, bu yüzden o kısa listenin ötesine sürekli uzanır. Anlam bazen listede hiç yer almamış olan sözcükte yaşar.

Kendi makalenizi insanlaştırın

AI destekli metninizi dönüştürün ve önemli kelimelere ya da atıflara dokunmadan, insan tarafından yazılmış gibi duyulmasını sağlayın.

Ücretsiz başlayın

Sözlük Düzlüğü: Daha Az, Daha Güvenli Sözcük

Sözlük düzlüğü, aynı alışkanlığın sözcük düzeyindeki biçimidir. Bir cümlenin her noktasında, onu mantıken sürdürebilecek onlarca sözcük olabilir, ancak bir avuç sözcük modelin sıralamasında geri kalanların çok üstünde yer alır ve decoding sürekli olarak bu avuç sözcüğe düşer. Bu seçimi bir belgedeki her cümle için çoğalttığınızda, fiilen kullanılan sözcüklerin aralığı, benzer uzunluktaki insan yazısına kıyasla ölçülebilir biçimde daralır.

Etkisi sabit kalmak yerine katlanarak artar. Bir model, birinci cümlede en üst sıralı sözcüğe yöneldiğinde, ikinci cümledeki en üst sıralı sözcüğün de yaygın olduğu bir bağlam kurma olasılığı daha yüksektir, çünkü yaygın sözcükler yaygın sözcükleri izleme eğilimindedir. İnsan yazar bu sürüklenmeyi sürekli keser, belirli teknik terime, biraz alışılmadık fiile, güvenli bir yaklaşık ifade yerine gerçek şeyi adlandıran sözcüğe yönelir. Bu fark, üretilen sürümde ölçülebilir biçimde daha küçük bir çalışma söz varlığı olarak ortaya çıkar, her iki sürüm de aynı temel olguları anlatsa bile.

Bu, tek bir sözcük seçiminin değil, tüm pasajın bir özelliğidir. Tek bir güvenli sözcük hiçbir şey kanıtlamaz. Böyle sözcüklerden oluşan bir sayfa, cümle üstüne cümle aynı yaygın söz varlığı sırasına yöneliyorsa, bir dedektörün sözcük düzeyindeki sinyalinin gerçekten fark etmek üzere kurulduğu şey budur.

Sözdizimsel Tekdüzelik: Aynı Biçimler, Tekrarlanmış

Sözdizimsel tekdüzelik, cümle düzeyindeki karşılıktır. Bu, bir cümlenin ne kadar uzun sürdüğüyle ilgili değildir. Bir pasajın kaç farklı dilbilgisel biçim kullandığıyla ilgilidir: cümlelerin nasıl açıldığı, yan cümleciklerin birbirine nasıl bağlandığı, bir geçiş sözcüğünün bir düşünceden diğerine bağ kurma işini ne sıklıkla üstlendiği. İstatistiksel olarak olası bir sonraki yapıyı tahmin etmeyi sürdüren bir model, az sayıda biçimden oluşan bir döngüye yerleşir ve bunu tekrar eder.

Bir paragraf, cümle uzunluklarını çeşitlendirebilir ve yine de her cümle aynı özne-fiil-tümleç biçimini izliyorsa, aynı tür geçişle açılıyorsa ya da aynı şekilde sonuçlanıyorsa sözdizimsel olarak düz okunabilir. Öngörülebilirlik, sözcük sayısında değil, örüntüde yaşar, bu ayrım burstiness tam olarak neyi ölçer kılavuzunda daha ayrıntılı olarak ele alınmaktadır.

Ne daraltırÇözümleme için optimize edilmiş metnin eğilimiİnsan yazısının eğilimi
Kelime seçimiHer adımda en olası yaygın kelimeyi seçerGerçek şeyi adlandıran daha özgül ya da daha az yaygın kelimeye yönelir
Cümle başlangıcıGüvenli geçiş başlangıçlarının küçük bir döngüsünü tekrarlarBir cümlenin nasıl başladığını çeşitlendirir, modelin daha az olası diye sıralayacağı başlangıçlar da buna dahildir
Yan cümle yapısıBir pasaj boyunca bir ya da iki tercih edilen dilbilgisel kalıbı tekrarlarBir cümlenin neye ihtiyaç duyduğuna bağlı olarak basit ve karmaşık yapıları karıştırır

Yalnızca Bir İnsanın Yapma Eğiliminde Olduğu Seçimler

Dar bir bandın öteki yüzü, onun dışında kalanlardır. Gerçek olayları anlatan bir kişi, yuvarlak bir sayı yerine tam sayıyı seçer, işe yaramayan kısmı kabul eder, bir cümleyi düşünce akışı içinde düzeltmek için yarıda keser ya da tipik olandan ziyade doğru olan kelimeyi seçer. Bu seçimlerin her biri, bir dil modeli açısından, düşük olasılıklı bir belirteçtir, tam da çözümlemenin kaçınmak üzere tasarlandığı türden bir şeydir.

Bunun hiçbiri, özgül ya da alışılmadık yazının her türlü işaretten güvenli olduğu ya da akıcı, doğru yazının varsayılan olarak şüpheli olduğu anlamına gelmez. Bir yöntemler bölümü, bir hukuki madde ya da yoğun biçimde düzenlenmiş bir son taslak, bir modelle hiçbir ilgisi olmayan nedenlerle dar bir banda düşebilir, bu yüzden tek bir puan, kimin yazdığına dair bir hüküm değil, bir örüntünün betimlemesidir.

Kendi taslağınızın o bantta nerede durduğunu görmek, tahminde bulunmaktan daha yararlıdır. TextPulse'ın ücretsiz perplexity denetleyicisi ve burstiness denetleyicisi, sözcük düzeyindeki öngörülebilirliği ve cümleden cümleye ritmi ayrı ayrı ölçer, böylece düz bir kelime dağarcığı ve yinelenen bir cümle yapısı, tek bir birleşik sayı yerine iki farklı sinyal olarak görünür.

Bundan iki daha dar sayfa ortaya çıkar. Turnitin’in AI’yi tam olarak nasıl tespit ettiği bunlardan biridir ve benzerlik skoru ile AI skoru arasındaki fark diğeridir, çünkü bu ikisi düzenli olarak birbirine karıştırılır.

İkisi de daha geniş ücretsiz araçlar koleksiyonu içinde yer alır, böylece tek bir sayıya körü körüne güvenmek yerine örüntüyü kendisi görmek isteyen herkes için.

XLinkedInFacebook

Sıkça Sorulan Sorular

Yapay zeka metni neden tespit edilir? Çünkü onu üreten çözümleme süreci, her adımda olası sözcükleri ve olası cümle yapıları kayırır, bu da dilin tipik insan yazımına göre daha dar bir bandında kalan bir yazı üretir. Bir dedektör, anlamı okumak yerine bu darlığı ölçer, bu yüzden örüntü akıcı, doğru düzyazıda bile ortaya çıkabilir.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI insanlaştırma hakkında güncel kalın

Akademik yazım, AI tespiti ve insanlaştırma hakkında ipuçlarını gelen kutunuza alın.

Spam yok. İstediğiniz zaman abonelikten çıkabilirsiniz.