Yapay Zeka İnsanlaştırıcıları Gerçekten İşe Yarar mı?
Bu soruda sıralanan sayfaların neredeyse tamamı, satmak için bir insanlaştırıcıya sahip olan bir şirket tarafından satılmaktadır. Bunun yerine mekanizma şudur, bu araçların gerçekte neyi değiştirdiği, bunun neden bazen bir dedektörün puanını hareket ettirdiği ve bazen ettirmediği, ayrıca agresif bir yeniden yazımın anlam ve atıflar açısından neyi riske attığı.
"do ai humanizers work" ifadesini bir arama çubuğuna yazdığınızda, yanıt veren hemen her sayfa bir tane satıyor. Bu bir komplo değil, yalnızca açık bir teşvik: yeniden yazma aracı geliştiren bir şirket, başarısız olduğu durumlarla söze başlamaz. Gerçekte olan, bunun ortasında yer alır ve "çalışmak" ile ne kastedildiğine bağlıdır. Bir AI humanizer aracı, bir paragrafın belirli, ölçülebilir özelliklerini değiştirir. Bu değişikliklerin bir kısmı bir dedektörün puanını etkiler. Diğerleri etkilemez. Birkaçı ise paragrafın gerçekte ne söylediği açısından gerçek bir maliyet doğurur.
Bir AI humanizer, AI tarafından üretilmiş metni yeniden yazarak istatistiksel parmak izini değiştirir, sözcük seçimi, cümle uzunluğu, noktalama alışkanlıkları, bir dedektörün gerçekten ölçtüğü özellikler. Belirli bir humanizer'ın not verilen bir ödevde kullanmanın güvenli olup olmadığı ya da düz bir paraphrasing tool ile nasıl karşılaştırıldığı, kendi yanıtları olan ayrı sorulardır. Bu soru daha dardır: yeniden yazma mekanik olarak ne yapar ve bu mekanizmanın hangi kısımları gerçekten bir puanı değiştirir.
Bu bir test sonucu değildir. TextPulse, humanizer araçları arasında kontrollü bir karşılaştırma yapmadı, ve yapsaydık bile, anekdot niteliğindeki bir kazanım çok az şey ifade ederdi. Ancak mekanikleri, bir paragrafı değiştirmek için bir şeyler yaptığınızda ne olduğunu, bunların bazılarının neden bir puanı değiştirdiğini ve bazılarının neden değiştirmediğini, ayrıca daha düşük bir sayı uğruna hangi riski üstlendiğinizi anlamak yararlı olacaktır. Aşağıdakiler, dedektörlerin nasıl atlatıldığına ilişkin yayımlanmış araştırmalara ve diğer mecraların kendi yayımlanmış testlerine dayanır, mekanizmayı açıklamak için: bir paragrafta ne değişir, bunun bir kısmı neden bir puanı değiştirir ve bir kısmı neden değiştirmez, ve ağır bir yeniden yazım daha düşük bir sayı karşılığında neyi riske atar.
Bir AI humanizer gerçekte neyi değiştirir
Piyasadaki her humanizer, üç şeyin bir kombinasyonunu yapar: tek tek kelimeleri daha az öngörülebilir eşanlamlılarla değiştirir, tekdüze uzunluğu bozmak için cümleleri yeniden sıralar ya da birleştirir ve ara sıra bir pasajı ayarlamak yerine bütünüyle yeniden yazar. Birincisi biçimsel düzeltmeye yakındır. İkincisi en önemli olandır, çünkü cümle uzunluğu değişkenliği, burstiness, dedektörlerin bir puan üretmeden önce hesapladığı iki ölçümden biridir, diğeri ise kelime seçimlerinin anlık olarak ne kadar öngörülebilir olduğudur.
Bu fark tek bir cümlede görülebilir. "The study employed a robust methodology" ifadesi kelime kelime değiştirildiğinde "The study used a strong approach," olur, bu da biraz daha iyi okunur ve cümlenin biçimini neredeyse hiç değiştirmez. Yeniden yapılandırıldığında ise "Because the sample skewed young, the researchers ran a mixed-methods design rather than a single survey." olur. Bu, farklı bir uzunluk, farklı bir yan cümle yapısı ve bir modelin sırada ne geleceğini tahmin etmeye çalışırken karşılaştığı farklı bir sürpriz miktarıdır. Yalnızca ikinci sürüm, bir dedektörün ölçmek üzere tasarlandığı sinyale dokunur.
Bu ayrım kuramsal değildir. Bir dedektör anlam için okumaz. Bir dil modelinin üreteceği örüntüye bir pasajın ne kadar yakın olduğunu puanlar, ki bu tam da AI metnini nasıl humanize edeceğinize dair rehberimizin, bunu elle, bir seferde bir cümle olacak şekilde nasıl bozacağınızı öğrettiği örüntüdür. Bir humanizer aracı ise aynı tür işi çok daha büyük ölçekte, tek bir geçişte yapar.
Bu değişikliklerden hangileri gerçekten bir puanı değiştirir
En açık kanıt, bu tür bir saldırıyı test etmek için özel olarak DIPPER adlı bir yeniden ifade etme modeli geliştiren araştırmacılardan gelir. İyi incelenmiş bir tespit yöntemi olan DetectGPT üzerinde çalıştırıldığında, DIPPER'ın yeniden ifadeleri, sabit yüzde 1 yanlış pozitif oranında tespit doğruluğunu yüzde 70.3'ten yüzde 4.6'ya düşürdü ve araştırmacılar yeniden yazımların kaynak metnin anlamını kayda değer biçimde değiştirmediğini bildirdi. Bu, ölçülmüş bir etkidir, pazarlama iddiası değil, bir pasajı cümle düzeyinde yeniden yapılandırmak bir puanı geniş bir marjla değiştirebilir.
Bu, o sonuç ile ticari bir humanizer’ın pazarlama sayfası arasındaki farktır. Sonuçların araçlar arasında ve onları inceleyen kişiler arasında bu kadar geniş değişmesinin başlıca nedeni budur. DIPPER bir araştırma modelidir. Belirli, kamuya açık biçimde belgelenmiş tek bir dedektöre karşı değerlendirme yapmak üzere, kontrollü koşullar altında geliştirilmiş ve test edilmiştir. Tüm durumlar için aynı yeniden yazma gücü kullanılmıştır. Bir tarayıcıda çalışan bir araç, aynı türde bir düzenleme, sözcük değiştirme ve cümle yeniden yapılandırması yapmaktadır. Ancak, bir araştırma makalesinin, diğer uçtaki dedektör üzerinde ya da yeniden yazmanın kalitesi üzerinde sahip olduğu denetim türüne sahip değildir.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Bir dedektördeki daha düşük bir puanın başka bir dedektöre neden taşınmadığı
Dedektörler aynı şeyi aynı referans noktasından ölçmemektedir. AI dedektörlerinin nasıl çalıştığı üzerine bir tamamlayıcı yazı, mekaniği ayrıntılı biçimde ele almaktadır, ancak burada ilgili nokta basittir: her dedektör kendi referans modeline göre puanlanır, bu nedenle birine öngörülemez görünen bir düzenleme, başka birine hâlâ sıradan görünebilir.
Çeşitli ticari ve açık dedektörleri düzenleme, yeniden ifade etme, istem verme ve birleşik saldırılara karşı stres testine tabi tutan araştırmacılar, performansın ortalama olarak 35 percent düştüğünü, ancak bunun eşit olmadığını bulmuştur. Sonuçları, neredeyse hiçbir dedektörün her saldırı türü boyunca sağlam kalmadığını ve her birinin ortak bir zayıflık yerine farklı, belirli açıklar taşıdığını göstermiştir. Tek bir humanizer’ın gerçek dünya testi de aynı örüntüyü göstermiştir: aynı yeniden yazılmış paragraf, iki ayrı dedektörde 100 percent AI puanı almış, üçüncü bir dedektörde 100 percent olarak kalmış ve dördüncü bir dedektörde 88 percent’e düşmüştür, hepsi de tek bir araçtan tek bir geçiş sonucunda.
Agresif yeniden yazmanın maliyeti
Kategorinin pazarlaması, ağır bir yeniden yazımın öte tarafındaki başarısızlık kipinden nadiren söz eder: bir cümleyi puanı değiştirecek kadar dönüştüren bir araç, onu anlamı yitirecek kadar da değiştirebilir. Bir yayın organı, aynı AI tarafından üretilmiş paragrafı on farklı humanizer aracından geçirdi ve sonuçları kaynak metinle karşılaştırdı. Birkaç araç, artık İngilizce olarak çözümlenemeyen cümleler üretti. Biri "Tap your Apple ID" yönergesini "Faucet your Apple ID" olarak yeniden yazdı. Bir diğeri "Understanding LinkedIn Premium" ifadesini "Grasping LinkedIn Premium" haline getirdi, ve incelemeciler bunun "aynı anlamı hiç iletmediğini" belirtti. Genel sonuçları, araçların "makalenin bir bütün olarak anlamına dair herhangi bir duygusu varmış gibi görünmediği" yönündeydi.
Akademik yazı, bu başarısızlığa bir ürün blog yazısından daha az hoşgörülüdür. Daha zayıf bir ifade yerine daha güçlü bir iddia konması, "may indicate" ifadesinin "shows" olarak yeniden yazılması, bir atfın gerçekte neyi desteklemek için kullanıldığını değiştirir ve bir alıntı etrafında yeniden sıralanan bir cümle, atfı başlangıçta yanında yer aldığı iddiadan ayırabilir. Bir in-text citation fixer, kaydığı cümleden uzaklaşmış bir atfı, kaynak metnin hiç desteklemediği bir ayrıntı uydurmadan yeniden konumlandırabilir, ancak iddianın kendisinin hâlâ o kaynağın söylediği şeyle örtüşüp örtüşmediğini size söyleyemez. Atıf yoğunluğu yüksek bir bölüm, her iki durumda da elle kontrol edilmeye değerdir.
| Düzenleme türü | Bir dedektör puanı üzerindeki tipik etki | Ne yanlış gidebilir |
|---|---|---|
| Tek tek kelimeleri eşanlamlılarıyla değiştirmek | Küçük, çoğu zaman dedektörün normal gürültüsünün içinde | Bir çekingenlik ifadesi, kaynağın desteklediğinden daha güçlü bir iddiaya dönüşebilir |
| Cümleleri yeniden sıralamak veya birleştirmek | En büyük, en tutarlı etki, burstiness bunu ölçer | Bir atıf, başlangıçta yanında bulunduğu iddiadan kopmuş hâlde kalabilir |
| Bir pasajı bütünüyle yeniden yazmak | Aletin üzerinde ayarlandığı dedektörde büyük, başka yerlerde öngörülemez | Çıktının artık hiç cümle olarak çözümlenememesi yönünde en yüksek risk |
| Dağınık yazım hataları veya ara sözler gibi dolgu eklemek | Asgari düzeyde ya da hiç, bu kozmetiktir, yapısal değildir | Alttaki örüntüyü düzeltmeden bir insan okuyucuya yapay görünür |
Öyleyse, AI humanizers işe yarar mı?
Yukarıdaki kanıtın gerçekte gösterdiği şey şudur: humanizers, bir dedektörün ölçtüğü istatistiksel özellikleri güvenilir biçimde değiştirir, bu gerçek, mekanik bir etkidir ve pazarlama değildir. Ancak herhangi bir belirli dedektörde güvenilir biçimde geçiş garantisi vermezler, çünkü dedektörler tasarımları gereği birbirleriyle uyuşmaz ve bir araç bu garantiyi kovalamak için ne kadar agresif biçimde yeniden yazarsa, anlam açısından bir şeyler kaybetme olasılığı da o kadar artar.
"Do humanizers work" aslında tek bir cümle kılığına girmiş üç sorudur: araç örüntüyü değiştiriyor mu, bu değişim önem verdiğiniz belirli dedektörde de sürüyor mu, ve cümle hâlâ kastettiğiniz şeyi söylüyor mu. Birinci sorunun yanıtı, yukarıdaki kanıta göre, genellikle evettir. Diğer ikisi ise araca, dedektöre ve geçişin ne kadar agresif biçimde yapıldığına bağlıdır.
TextPulse'un AI humanizer aracı, bir vaatten ziyade bu ödünleşim etrafında tasarlanmıştır. Bir belgeyi yeniden yazar ve dedektörlerin kullandığı aynı sinyallerden, bunlar arasında cümle ritmi ve sözcük öngörülebilirliği de bulunan, hesaplanan tahmini bir Human Score bildirir, herhangi bir adı verilmiş dedektörün bunu geçeceği iddiasını değil. Ücretsiz bir planın bulunmasının nedeni tam da budur, böylece üstteki tabloda yer alan ödünleşimin tam bir belge için buna değip değmediğine karar vermeden önce, bir geçişin gerçekte neyi değiştirdiğini satır satır görebilirsiniz.
Çalışıyor olmak ile güvenli biçimde kullanılabilir olmak ayrı testlerdir ve güvenlik sorusu için ayrı bir sayfa vardır. Bunun daha keskin biçimi için de durum aynıdır, Turnitin'in humanized text ile karşılaştığında ne yaptığı.
Güvenmeye değer araçlar, size neyin değiştiğini gösteren ve bunu denetlemenize izin veren araçlardır, açılış sayfasında bir yüzdeye güvenmenizi isteyenler değil. Herhangi bir şey göndermeden önce yeniden yazılmış paragrafı orijinaliyle karşılaştırın, bir araştırma asistanının ilk taslağını kontrol eder gibi, çünkü bir humanizer işlevsel olarak tam olarak budur.
Frequently Asked Questions
Yapay Zeka insanlaştırıcıları bir geçişi vaat edecek kadar güvenilir biçimde işe yarar mı? Hiçbir araç bunu kesin olarak söyleyemez. İnsanlaştırıcılar cümle yapısını ve sözcük öngörülebilirliğini değiştirir, dedektörlerin ölçtüğü sinyaller de bunlardır, bu yüzden puanlar çoğu zaman düşer, ancak dedektörler tasarım gereği birbirleriyle uyuşmaz. Değişikliğin ilgilendiğiniz belirli dedektörde kalıcı olup olmaması, hiç değişip değişmediğinden ayrı ve daha az öngörülebilir bir sorudur.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.