AI Detection

Burstiness Nedir? Neden Tekdüze Cümleler İşaretlenir

Burstiness, ortalama cümlenin ne kadar uzun olduğundan ziyade, bir pasaj boyunca cümle uzunluklarının ne ölçüde değiştiğini ölçer. Bu yazı, terimin nereden geldiğini, yayılımın gerçekte nasıl hesaplandığını ve bir language model çıktısının neden dar bir uzunluk aralığında toplanma eğiliminde olduğunu açıklar.

6 min
What is burstiness? A chart comparing uniform AI-generated sentence lengths to varied human sentence lengths.

Bir paragrafı yüksek sesle okuyun, belirli bir tür tekdüzelik, adlandırılabilir olmadan önce işitilir hale gelir: her cümle yaklaşık olarak aynı sayıda nefeste sona erer, sanki kimsenin kapatmayı hatırlamadığı bir metronom gibi. Okuyucular, sorunun ne olduğunu söyleyemeden önce bu örüntüyü fark eder ve üretilmiş metni yakalamak için tasarlanan dedektörler de bunu fark etmek üzere tasarlanmıştır. Bu örüntünün adı burstiness, herhangi bir AI dedektöründen daha eski bir sözcüktür.

Peki burstiness, bir dedektörün kastettiği özel anlamda nedir? Bu, bir pasaj boyunca cümle uzunluklarının ne ölçüde değiştiğinin, herhangi bir sabit sayıya göre değil, o pasajın kendi ortalamasına göre hesaplanan bir ölçüsüdür. Kısa, kesik cümleler uzun, dolambaçlı cümlelerin yanında yer aldığında bir paragraf bursty olur. Her cümle, ister bu uzunluk altı sözcük ister yirmi altı sözcük olsun, birbirine yakın bir uzunlukta sona erdiğinde bir paragrafın burstiness değeri düşüktür.

Bu istatistik, kısa bir paragraf üzerinde elle hesaplanacak kadar basittir ve bir kez görünür hale geldiğinde, düz bir sayfa belirsiz bir izlenim olmaktan çıkar ve işaret edilebilecek bir sayıya dönüşür. Ayrıca, adını paylaşan daha eski ve ilgisiz bir istatistikle neredeyse hiçbir ilgisi yoktur.

Burstiness nedir?

Bir AI dedektörü, bir belge boyunca cümle uzunluğunda değişkenlik varsa bursty olarak adlandırılır. AI dedektörünün bu sözcüğü kullandığı anlamda burstiness, bir belgedeki cümle uzunluklarının yayılımıdır ve tek bir sayı olarak ifade edilir: bu uzunlukların standart sapmasının ortalamalarına bölünmesi. Yüksek bir sayı, cümlelerin ortalama etrafında geniş ölçüde değiştiği anlamına gelir. Düşük bir sayı ise, bu ortalama ne olursa olsun, cümlelerin onun etrafında sıkı biçimde kümelendiği anlamına gelir.

Sözcüğün kendisi çok daha eski bir istatistiksel söz varlığına aittir. Araştırmacılar burstiness sözcüğünü depremleri, hastalık salgınlarını ve ağ trafiğini, zaman içinde eşit biçimde dağılmak yerine kümelenen her şeyi tanımlamak için kullanır ve bu alanlarda bunu ölçmenin yaygın bir yolu, bir sayımın varyansının ortalamasına oranı olan Fano factor'dür.

Doğal dil işlemenin kendi içinde de ikinci, daha eski bir anlam vardır, bu anlam bu yazının ele aldığı cümle uzunluğu istatistiğiyle kolayca karıştırılabilir. 1990'larda derlem dilbilimcileri, tek tek sözcüklerin nasıl kümelendiğini tanımlamak için burstiness terimini kullandı: bir belge nadir bir sözcükten söz ettiğinde, o sözcüğün yeniden geçme olasılığı, ilk ve bağımsız bir görünümün düşündüreceğinden çok daha yüksek olur. Kenneth Church ve William Gale, 1995'te Poisson karışımları içinde bu örüntüye istatistiksel bir çerçeve kazandırdı ve bilgi erişim sistemleri, tekrar eden bir sözcüğün ne kadar sayılması gerektiğini ağırlıklandırırken hâlâ bunu dikkate alır. Bu istatistik tek bir sözcüğün tekrarını izler. Bu yazıdaki ölçüm ise başka bir şeyi izler, onları dolduran sözcüklerden bağımsız olarak tüm cümlelerin biçimini.

Bu yazının geri kalanı burstiness sözcüğünü yalnızca bu ikinci anlamda kullanır, sözcük tekrarını değil cümle biçimini ifade eder.

Yayılım neden ortalamadan daha önemlidir

İki belge tam olarak aynı ortalama cümle uzunluğunu paylaşabilir ve buna rağmen birbirine hiç benzemeyebilir. On iki sözcüklük bir ortalama, her cümlesi yaklaşık on iki sözcük olan bir paragrafa da ait olabilir, altı sözcüklük cümlelerin on sekiz sözcüklük cümlelerle dönüşümlü geldiği bir paragrafa da, ve ortalama bu iki paragrafı birbirinden ayıramaz. Bunu yalnızca ortalama etrafındaki yayılım yapabilir.

İstatistikçiler, yalnızca ortalamaya bakarak yapılan bu karşılaştırmayı, bir dağılımın ilk momentinin ötesine bakmamak olarak adlandırırdı. Bir algılayıcı, ya da dikkatli bir okur, örtük olarak ikinci momenti de denetler, yani merkezin etrafındaki biçimi, ki ortalama tek başına bunu asla ortaya çıkaramaz.

Aynı sonucu bildirmenin iki yolunu düşünün. 'Müdahale, katılımcıların çoğunda belirtileri azalttı. Etki, yaş grupları arasında tutarlıydı. Bulgular, mekanizmanın daha fazla araştırılmasını destekliyor.' Üç cümle, her biri sekiz ila dokuz sözcük, neredeyse hiç yayılım göstermeyen bir ritimdir. Şimdi şunu karşılaştırın: 'Belirtiler katılımcıların çoğunda azaldı. Bu durum, kişinin yirmi iki ya da altmış sekiz yaşında olmasına bakılmaksızın geçerliydi, ekipte kimse bunu baştan beklemiyordu ve sonraki çalışmanın yalnızca sonuca değil, mekanizmaya bakması gerektiğinin nedeni de budur.' İddia aynıdır. Onu taşıyan ritim aynı değildir.

Ortalama, her iki paragrafı da özdeş kabul eder. Bir okuyucu, ve görünüşe göre bir dedektör, etmez.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

burstiness nasıl hesaplanır

Hesap basittir. Her cümledeki sözcükleri sayın, bu listenin standart sapmasını alın, sonra ortalamaya bölün. Örneğin, sekiz, otuz bir, on bir, yirmi dört ve dokuz sözcük uzunluğunda cümleleri olan bir parçaya bakarsanız, ortalamanın yaklaşık yüzde elli altısı kadar bir yayılım elde edersiniz, bu da geniş bir burstiness demektir. On beş, on altı, on dört, on yedi ve on beş sözcük uzunluğunda cümleleri olan bir parçaya bakarsanız, iki parçanın ortalama uzunluğu neredeyse aynı olsa bile, yaklaşık yüzde yedi kadar bir yayılım elde edersiniz.

Tek başına ham bir standart sapma aynı işi görmezdi. Sekiz sözcük yayılım, cümle başına ortalama on iki sözcük olan bir parçada, ortalama kırk sözcük olan bir parçadakinden farklı bir şey ifade eder, bu yüzden sayıyı bir parçadan diğerine karşılaştırılabilir kılan şey ortalamaya bölmektir.

Bu göreli çerçeveleme, istatistiğin kesik bir haber üslubu ile yoğun kuramsal bir üslup için aynı şekilde işlemesinin nedenidir. Kısa, tekdüze cümlelerden oluşan teknik bir bölüm ile kısa, tekdüze cümlelerden oluşan gündelik bir paragraf, her ikisi de düşük burstiness olarak kaydedilebilir, çünkü ölçüm hiçbir zaman bir cümlenin mutlak olarak ne kadar uzun olduğunu sormaz, yalnızca her birinin komşularının ortalamasından ne kadar uzakta durduğunu sorar.

Bu, bu sitedeki ücretsiz burstiness denetleyicisinin yapıştırılmış bir taslağa uyguladığı özdeş hesaplamadır, tüm parçayı tek bir sayıya sıkıştırmak yerine her cümleyi bir nokta olarak grafikler. Bu ölçekte, yaklaşık yüzde yirminin altındaki her şey sıkı, tekdüze bir yayılım olarak okunur, yaklaşık yüzde kırk beşin üzerindeki her şey ise geniş bir yayılım olarak okunur, düzenlenmiş akademik düzyazının çoğu da bunların arasında bir yere düşer.

düşük varyanslı bir paragraf sayfada nasıl görünür

İki örüntüyü yan yana koyun, neye bakmanız gerektiğini bildiğiniz anda onları ayırt etmek kolaydır.

ÖzellikDüşük varyanslı paragrafYüksek varyanslı paragraf
Cümle uzunluğu örüntüsüNeredeyse her cümle, paragrafın ortalamasından yalnızca birkaç kelime saparKısa, kesik cümleler, uzun ve çok yan tümceli cümlelerin yanında yer alır
Sesli okunduğundaVurgu için doğal bir duraklama yeri olmayan, sabit ve eşit bir tempoVurgunun gerçekten düştüğü yerlere göre hızlanıp yavaşlayan bir ritim
Tipik nedenBir modelin her seferinde bir sonraki olası cümleyi tahmin ederek ürettiği, düzenlenmemiş çıktı ya da kimsenin sesli olarak geri okumadığı bir ilk taslakBir yazarın etki için bir cümleyi kısa kesmesi ya da iki ince cümleyi uzunluğunu hak eden tek bir cümlede birleştirmesi

Her iki sütun da özünde iyi yazı değildir. Beş adımı beş kısa cümlede listeleyen bir yöntemler bölümü, sol sütuna benzemelidir ve numaralandırılmış bir prosedüre eklenen uzun, dolambaçlı bir cümle onu iyileştirmez. Örüntü ancak hangi tür bir pasajın incelendiği bilindiğinde anlamlı hale gelir.

Tekdüze cümleler neden işaretlenir

Algılayıcılar, tekdüze cümleleri bir sinyal olarak ele alır, çünkü bunun nedeni metin üretiminin nasıl çalıştığıdır, tekdüze cümlelerin kendi başlarına doğası gereği şüpheli olması değildir. AI algılayıcılarının gerçekte nasıl çalıştığı konusunun daha geniş mekanikleri ayrı olarak ele alınmıştır, kısa versiyon şudur: bir model, örtük olarak bir cümlenin ne zaman sona ermesinin muhtemel olduğunu da içerecek biçimde, her seferinde bir token tahmin eder. Şu ana kadarki metin verildiğinde, herhangi bir anda bazı cümle uzunlukları diğerlerinden istatistiksel olarak daha olasıdır ve en olası devamı seçmeyi sürdüren bir model, tüm bir belge boyunca cümle üstüne cümle, aynı olası uzunluğa yakın bir yerde kalmaya devam eder.

Tek bir düz paragraf tek başına hiçbir şey kanıtlamaz, kısa prosedürel bölümlerin böyle görünmesi beklenir. Bir algılayıcının aslında tarttığı şey, tüm belge boyunca uzanan örüntüdür, yani bir paragraftaki düzlüğün yerel ve amaçlı bir seçim mi olduğu, yoksa metnin her paragrafının ritmi mi olduğu.

Kelime kelime öngörülebilirlik, bununla ilişkili ancak ayrı bir ölçümdür, bu sitede başka bir yerde kendi başına ele alınır ve cümle biçiminden ziyade tek tek kelime seçimlerine bakar.

Bunların hiçbiri bir belgenin bir model tarafından üretildiğini kanıtlamaz ve düz bir ritmi tek başına belirleyici saymak, tek bir perplexity sayısını belirleyici saymakla aynı hatayı tekrar eder. Kimsenin yüksek sesle okumadığı aceleye getirilmiş bir ilk taslak da, üretilmiş metin kadar kolay biçimde düzleşebilir. TextPulse'un kendi tahmini Human Score'unun cümle düzeyindeki değişkenliği birkaç başka sinyalle birleştirmesinin nedeni kısmen budur, bunlardan herhangi birine dayanmaz, ayrıca bu sitedeki ücretsiz tanılama araçlarının tek başlarına değil birlikte okunacak şekilde tasarlanmasının da nedeni budur.

Tanımdan daha önemli olan iki takip sorusu vardır. Algılayıcıların burstiness'i hâlâ 2023'teki gibi ağırlıklandırıp ağırlıklandırmadığı bunlardan biridir, kendi taslaklarınızda bunu nasıl artıracağınız ise, düzyazıyı bozmadan, diğeridir.

Düz bir paragraf, arkasındaki mekanizma görünür hâle geldiğinde artık bir gizem değildir. Bu, her cümlenin tek bir sonraki kelimenin kurulduğu gibi aynı şekilde kurulması, yani en az dirençle sıradaki şeye uzanmasıyla ortaya çıkan şeydir. Bu baskının üstün gelip gelmemesi, yazarın ya da modelin, cümle cümle buna karşı koymasına bağlıdır.

Frequently Asked Questions

Yazıda burstiness nedir? Bir pasaj boyunca cümle uzunluğunun değişme miktarıdır, cümle uzunluklarının standart sapmasının ortalamalarına bölünmesiyle ölçülür. Kısa ve uzun cümleler arasında geniş dalgalanmalar olan bir pasaj yüksek burstiness gösterir. Her cümlenin yaklaşık aynı uzunlukta olduğu bir pasaj, bu uzunluk kısa da olsa uzun da olsa, düşük burstiness gösterir.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.