AI Humanization

AI insanlaştırıcılar gerçekten işe yarar mı?

Bu soruda sıralanan sayfaların neredeyse tamamı, satmak için bir insanlaştırıcıya sahip olan bir şirket tarafından satılır. Bunun yerine mekanizma şudur: bu araçların gerçekte neyi değiştirdiği, bunun neden bazen bir dedektörün puanını hareket ettirdiği ve bazen ettirmediği, ayrıca agresif bir yeniden yazımın anlam ve atıflar açısından neyi riske attığı.

Güncellendiği tarih 6 min
Do AI humanizers work: original and humanized AI text compared side by side

"do ai humanizers work" ifadesini bir arama çubuğuna yazdığınızda, yanıt veren hemen her sayfa bir tane satıyor. Bu bir komplo değil, yalnızca açık bir teşvik: yeniden yazma aracı geliştiren bir şirket, başarısız olduğu durumlarla söze başlamaz. Gerçekte olan, bunun ortasında yer alır ve "çalışmak" ile ne kastedildiğine bağlıdır. Bir AI humanizer aracı, bir paragrafın belirli, ölçülebilir özelliklerini değiştirir. Bu değişikliklerin bir kısmı bir dedektörün puanını etkiler. Diğerleri etkilemez. Birkaçı ise paragrafın gerçekten ne söylediği açısından gerçek bir bedel taşır.

Bir AI humanizer, AI tarafından üretilmiş metni yeniden yazarak onun istatistiksel parmak izini değiştirir, sözcük seçimi, cümle uzunluğu, noktalama alışkanlıkları, bir dedektörün gerçekten ölçtüğü özellikler. Belirli bir humanizer'ın notlandırılan bir ödevde kullanmanın güvenli olup olmadığı ya da düz bir paraphrasing tool ile nasıl karşılaştırıldığı, kendi yanıtları olan ayrı sorulardır. Buradaki soru daha dardır: yeniden yazma mekanik olarak ne yapar ve bu mekanizmanın hangi kısımları gerçekten bir puanı değiştirir.

Bu bir test sonucu değildir. TextPulse, humanizer araçları arasında kontrollü bir karşılaştırma yapmadı, ayrıca yapsaydık bile, anekdot niteliğindeki bir kazanım çok az şey ifade ederdi. Ancak mekanikleri, bir paragrafı değiştirmek için bir şeyler yaptığınızda ne olduğunu, bunların bazılarının neden bir puanı değiştirdiğini ve bazılarının değiştirmediğini, ayrıca daha düşük bir sayı karşılığında hangi riski üstlendiğinizi anlamak yararlı olacaktır. Aşağıda yer alan açıklama, dedektörlerin nasıl atlatıldığına ilişkin yayımlanmış araştırmalara ve diğer mecraların kendi yayımlanmış testlerine dayanır, amacı mekanizmayı açıklamaktır: bir paragrafta ne değişir, bunun neden bir kısmı bir puanı değiştirir ve bir kısmı değiştirmez, ve ağır bir yeniden yazım daha düşük bir sayı karşılığında neyi riske atar.

Bir AI humanizer gerçekte neyi değiştirir

Piyasadaki her humanizer, üç şeyin bir kombinasyonunu yapar: tek tek kelimeleri daha az öngörülebilir eşanlamlılarla değiştirir, cümleleri yeniden sıralar ya da birleştirerek tekdüze uzunluğu bozar ve bazen bir pasajı ayarlamak yerine bütünüyle yeniden yazar. Birincisi neredeyse kozmetiktir. İkincisi en önemlisidir, çünkü cümle uzunluğu değişkenliği, burstiness, dedektörlerin bir puan üretmeden önce hesapladığı iki ölçümden biridir, diğeri ise kelime seçimlerinin anlık olarak ne kadar öngörülebilir olduğudur.

Fark tek bir cümlede görülebilir. "The study employed a robust methodology" ifadesi kelime kelime değiştirildiğinde "The study used a strong approach," olur, bu da biraz daha iyi okunur ve cümlenin biçimini neredeyse hiç değiştirmez. Yeniden yapılandırıldığında ise "Because the sample skewed young, the researchers ran a mixed-methods design rather than a single survey." olur. Bu, farklı bir uzunluk, farklı bir yan cümle yapısı ve bir modelin sırada ne geleceğini tahmin etmeye çalışırken karşılaştığı farklı bir sürpriz miktarıdır. Yalnızca ikinci sürüm, bir dedektörün ölçmek üzere kurulduğu sinyale dokunur.

Bu ayrım kuramsal değildir. Bir dedektör anlamı okumaz. Bir pasajın, bir dil modelinin üreteceği örüntüyle ne kadar yakından eşleştiğini puanlar, ki bu tam da AI metnini nasıl humanize edeceğinize dair rehberimizin, bunu elle, bir seferde bir cümle olacak şekilde bozmayı size öğrettiği örüntüdür. Bir humanizer aracı, aynı tür işi tek bir geçişte çok daha büyük ölçekte yapmaktadır.

Bu değişikliklerden hangileri gerçekten bir puanı değiştirir

En açık kanıt, bu tür bir saldırıyı test etmek için özel olarak DIPPER adlı bir yeniden ifade etme modeli geliştiren araştırmacılardan gelir. DetectGPT üzerinde, iyi incelenmiş bir tespit yöntemi olan DetectGPT üzerinde çalıştırıldığında, DIPPER'in yeniden ifadeleri, sabit yüzde 1 yanlış pozitif oranında tespit doğruluğunu yüzde 70.3'ten yüzde 4.6'ya düşürdü ve araştırmacılar, yeniden yazımların kaynak metnin anlamını kayda değer ölçüde değiştirmediğini bildirdi. Bu, ölçülmüş bir etkidir, pazarlama iddiası değil, bir pasajı cümle düzeyinde yeniden yapılandırmak bir puanı geniş bir aralıkta değiştirebilir.

Bu, o sonuç ile ticari bir humanizer'ın pazarlama sayfası arasındaki farktır. Sonuçların araçlar arasında ve onları inceleyen kişiler arasında bu kadar geniş ölçüde değişmesinin başlıca nedeni budur. DIPPER bir araştırma modelidir. Belirli, kamuya açık biçimde belgelenmiş tek bir dedektöre karşı değerlendirme yapmak üzere, kontrollü koşullar altında geliştirilmiş ve test edilmiştir. Tüm durumlar için aynı yeniden yazma gücü kullanılmıştır. Bir tarayıcı içinde çalışan bir araç, aynı türden bir düzenleme, sözcük değiştirme ve cümle yeniden yapılandırması yapmaktadır. Ancak, diğer uçtaki dedektör üzerinde ya da yeniden yazmanın kalitesi üzerinde bir araştırma makalesinin sahip olduğu türden bir denetime sahip değildir.

Kendi makalenizi insanlaştırın

AI destekli metninizi dönüştürün ve önemli kelimelere ya da atıflara dokunmadan, insan tarafından yazılmış gibi duyulmasını sağlayın.

Ücretsiz başlayın

Bir dedektörde daha düşük bir puanın başka bir dedektöre taşınmamasının nedeni

Dedektörler aynı şeyi aynı referans noktasından ölçmemektedir. AI dedektörlerinin nasıl çalıştığı üzerine tamamlayıcı bir yazı, mekanikleri bütünüyle ele almaktadır, ancak burada ilgili nokta basittir: her dedektör kendi referans modeline göre puanlanır, bu nedenle bir dedektöre göre öngörülemez görünen bir düzenleme, başka bir dedektöre göre yine de sıradan görünebilir.

Araştırmacılar, bir dizi ticari ve açık dedektörü düzenleme, yeniden ifade etme, istem verme ve birleşik saldırılara karşı stres testine tabi tuttuklarında, performansın ortalama yüzde 35 düştüğünü, ancak bunun eşit olmadığını buldu. Sonuçları, neredeyse hiçbir dedektörün her saldırı türü karşısında sağlam kalmadığını ve her birinin ortak bir zayıflıktan ziyade farklı, özgül açıklar taşıdığını gösterdi. Tek bir humanizer üzerinde yapılan gerçek dünya testi aynı örüntüyü ortaya koydu, aynı yeniden yazılmış paragraf iki ayrı dedektörde yüzde 100 AI puanı aldı, üçüncü birinde yüzde 100 olarak kaldı ve dördüncü birinde yüzde 88'e düştü, bunların hepsi tek bir araçtan tek bir geçişin sonucuydu.

Agresif yeniden yazmanın maliyeti

Bu kategorinin pazarlaması, ağır bir yeniden yazmanın öteki tarafındaki başarısızlık kipinden nadiren söz eder, bir puanı değiştirecek kadar bir cümleyi dönüştüren bir araç, aynı zamanda o cümlenin anlamını yitirecek kadarını da değiştirebilir. Bir yayın organı, aynı AI tarafından üretilmiş paragrafı on farklı humanizer aracından geçirdi ve sonuçları kaynak metinle karşılaştırdı. Birkaçının ürettiği cümleler artık İngilizce olarak çözümlenemiyordu. Biri "Tap your Apple ID" yönergesini "Faucet your Apple ID" olarak yeniden yazdı. Bir başkası "Understanding LinkedIn Premium" ifadesini "Grasping LinkedIn Premium" haline getirdi, ve incelemeciler bunun "aynı anlamı hiç taşımadığını" belirtti. Genel sonuçları, araçların "makalenin bir bütün olarak anlamına dair herhangi bir duyguya sahip görünmediği" yönündeydi.

Akademik yazım, bu tür bir başarısızlığa bir ürün blog yazısından daha az tolerans gösterir. Bir ihtiyat ifadesinin daha güçlü bir iddiayla değiştirilmesi, "may indicate" ifadesinin "shows" olarak yeniden yazılması, bir alıntının aslında hangi iddiayı desteklemek için kullanıldığını değiştirir ve bir cümlenin bir alıntı etrafında yeniden sıralanması, atfı başlangıçta yanında yer aldığı iddiadan ayırabilir. Bir in-text citation fixer, kaydığı cümleden uzaklaşmış bir atfı, kaynak metnin hiç desteklemediği bir ayrıntıyı uydurmadan yeniden konumlandırabilir, ancak iddianın kendisinin hâlâ o kaynağın söyledikleriyle örtüşüp örtüşmediğini size söyleyemez. Atıf yoğun bir bölüm, her iki durumda da elle kontrol edilmeye değerdir.

Düzenleme türüBir dedektör puanı üzerindeki tipik etkiNe ters gidebilir
Tek tek sözcükleri eş anlamlılarıyla değiştirmeKüçük, çoğu zaman dedektörün normal gürültüsünün içindeBir çekingenlik sözcüğü, kaynağın desteklediğinden daha güçlü bir iddiaya dönüşebilir
Cümleleri yeniden sıralama veya birleştirmeEn büyük, en tutarlı etki, burstiness bunu ölçerBir atıf, başlangıçta yanında bulunduğu iddiadan kopmuş halde kalabilir
Bir pasajı bütünüyle yeniden yazmaAletin üzerinde ayarlandığı dedektörde büyük, başka yerlerde öngörülemezÇıktının artık hiç cümle olarak çözümlenememesi yönünde en yüksek risk
Dağınık yazım hataları veya ara sözler gibi dolgu eklemeAsgari düzeyde ya da hiç, bu kozmetiktir, yapısal değildirAltındaki örüntüyü düzeltmeden bir insan okuyucuya yapay görünür

Peki, AI humanizers işe yarar mı?

Yukarıdaki kanıtın gerçekte gösterdiği şey şudur, humanizers bir dedektörün ölçtüğü istatistiksel özellikleri güvenilir biçimde değiştirir, bu gerçek, mekanik bir etkidir ve pazarlama değildir. Ancak herhangi bir belirli dedektörden güvenilir biçimde geçiş garantisi vermezler, çünkü dedektörler tasarım gereği birbirleriyle uyuşmaz ve bir araç bu garantiyi kovalamak için ne kadar agresif biçimde yeniden yazarsa, anlam açısından bir şeyler kaybetme olasılığı da o kadar artar.

"Do humanizers work" aslında tek bir cümle kılığına girmiş üç sorudur, araç örüntüyü değiştiriyor mu, bu değişim önem verdiğiniz belirli dedektörde de sürüyor mu, ve cümle hâlâ kastettiğiniz şeyi söylüyor mu. Birinci sorunun yanıtı, yukarıdaki kanıta göre, genellikle evettir. Diğer ikisi ise araca, dedektöre ve geçişin ne kadar agresif yürütüldüğüne bağlıdır.

TextPulse'un AI humanizer aracı, bir vaatten ziyade bu ödünleşim etrafında tasarlanmıştır. Bir belgeyi yeniden yazar ve dedektörlerin kullandığı aynı sinyallerden, bunlar arasında cümle ritmi ve sözcük öngörülebilirliği de yer alır, hesaplanan tahmini bir Human Score bildirir, herhangi bir adı geçen dedektörün bunu geçeceği iddiasını değil. Ücretsiz bir plan tam da bu nedenle vardır, böylece yukarıdaki tabloda yer alan ödünleşimin tam bir belge için buna değip değmediğine karar vermeden önce, bir geçişin gerçekte neyi değiştirdiğini satır satır görebilirsiniz.

İşlevsel olmak ile güvenle kullanılabilir olmak ayrı testlerdir ve güvenlik sorusunun kendine ait bir sayfası vardır. Bunun daha keskin biçimi de öyledir: Turnitin'in humanize edilmiş metinle karşılaştığında ne yaptığı.

Güvenilmeye değer araçlar, size neyin değiştiğini gösteren ve bunu denetlemenize izin veren araçlardır, bir açılış sayfasında bir yüzdeye güvenmenizi isteyenler değil. Herhangi bir şey göndermeden önce yeniden yazılmış paragrafı orijinaliyle karşılaştırın, tıpkı bir araştırma asistanının ilk taslağını kontrol edeceğiniz gibi, çünkü işlevsel olarak bir humanizer tam olarak budur.

XLinkedInFacebook

Sıkça Sorulan Sorular

AI insanlaştırıcılar bir geçişi vaat edecek kadar güvenilir biçimde işe yarar mı? Tek bir araç bunu kesinlikle söyleyemez. İnsanlaştırıcılar cümle yapısını ve sözcük öngörülebilirliğini değiştirir, dedektörlerin ölçtüğü sinyaller de bunlardır, bu yüzden puanlar çoğu zaman düşer, ancak dedektörler tasarım gereği birbirleriyle uyuşmaz. Değişikliğin, ilgilendiğiniz belirli dedektörde geçerli olup olmaması, hiç değişip değişmediğinden daha ayrı ve daha az öngörülebilir bir sorudur.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

AI insanlaştırma hakkında güncel kalın

Akademik yazım, AI tespiti ve insanlaştırma hakkında ipuçlarını gelen kutunuza alın.

Spam yok. İstediğiniz zaman abonelikten çıkabilirsiniz.