Mengapa Teks AI Dikesan? Sebab Sebenar
Proses penyahkodan di sebalik penulisan AI memihak kepada perkataan yang berkemungkinan dan bentuk ayat yang berkemungkinan pada setiap langkah, sebab itulah teks AI dikesan walaupun ia dibaca dengan lancar. Catatan ini membincangkan kerataan kosa kata, keseragaman sintaksis, dan pilihan khusus yang lazimnya hanya dibuat oleh penulis manusia, tanpa matematik asasnya.
Jika anda meminta model bahasa untuk melengkapkan ayat "The weather today is," ia tidak akan cuba memilih warna seperti "cerulean" atau "apocalyptic." Sebaliknya, ia akan cuba mengatakan "sunny," "cloudy," atau "nice," kerana itulah perkataan yang paling kerap muncul selepas frasa itu dalam apa jua bahan yang digunakan untuk melatihnya. Perisian yang memilih perkataan seterusnya dalam ayat telah direka bentuk untuk mengutamakan jawapan seperti ini.
Mengapa teks AI dikesan? Kerana keutamaan yang sama yang memilih 'sunny' berbanding 'cerulean' merentasi keseluruhan dokumen, perkataan demi perkataan, dan hasilnya berada dalam jalur kemungkinan penulisan yang lebih sempit daripada yang biasanya dihasilkan oleh manusia. Pengesan tidak perlu menangkap pembohongan. Ia hanya perlu menyedari bahawa sesuatu petikan terus jatuh dalam jalur sempit itu.
Tiada apa yang berikut memerlukan formula. Mekanismenya terletak pada satu idea, yang diulang pada tiga skala berbeza, iaitu pemilihan perkataan, bentuk ayat, dan butiran khusus yang dipilih oleh penulis tanpa berfikir panjang. Setiap skala ini menyumbang kepada persoalan yang lebih luas tentang bagaimana pengesan AI sebenarnya berfungsi, dan setiap satunya lebih mudah dilihat apabila punca asasnya dinamakan.
Mengapa Teks AI Dikesan? Jawapan Ringkas
Teks AI dikesan kerana proses penyahkodan yang menukar ramalan model kepada ayat yang lengkap dibina untuk mengutamakan perkataan yang berkemungkinan pada setiap langkah, dan melakukan hal itu secara konsisten, untuk beribu-ribu perkataan berturut-turut, menghasilkan penulisan yang menduduki bahagian bahasa yang lebih sempit daripada yang biasanya digunakan oleh manusia. Alat statistik boleh mengesan kesempitan ini walaupun setiap ayat sempurna dari segi tatabahasa dan tepat dari segi fakta.
Tiga gejala timbul daripada satu punca itu. Perbendaharaan kata mengecil ke arah perkataan umum yang paling selamat. Struktur ayat mengecil ke arah beberapa bentuk yang digemari. Dan pilihan khusus yang sedikit tidak mungkin dibuat oleh seseorang hampir secara refleks, perkataan yang ganjil, sisipan sampingan, butiran yang tidak memerlukan kos untuk dimasukkan tetapi sukar untuk diramalkan, cenderung tidak muncul langsung.
Bagaimana Model Bahasa Memilih Perkataan Seterusnya
Jika dibiarkan sendiri, sebuah model bahasa hanya akan melaporkan senarai penuh perkataan seterusnya yang mungkin mengikut kedudukan dan membiarkan sesuatu yang lain membuat pilihan. Dalam amalan, strategi penyahkodan membuat pilihan itu secara automatik, perkataan demi perkataan, dan strategi yang sedang berjalan mengubah rupa output walaupun model asas tidak pernah berubah.
Penyahkodan greedy sentiasa memilih satu perkataan yang paling berkemungkinan. Dalam makalah yang memperkenalkan pensampelan nukleus sebagai penyelesaian, Ari Holtzman dan pengarang bersama memerhatikan bahawa mengikuti strategi ini menghasilkan teks yang, dalam kata-kata mereka sendiri, 'membosankan dan anehnya berulang.' Beam search, yang menjejak beberapa kesinambungan yang berkemungkinan serentak sebelum menetap pada satu, menghadapi versi masalah yang serupa.
Strategi pensampelan memperkenalkan semula sedikit keacakan, tetapi secara terkawal. Temperature melaraskan sejauh mana model memihak kepada pilihan utamanya sebelum sesuatu perkataan diambil sampelnya. Pensampelan nukleus, kadangkala dipanggil top-p, memotong taburan kepada set perkataan paling kecil yang kebarangkalian gabungannya melepasi ambang dan mengambil sampel hanya daripada set itu, yang dalam makalah asal digambarkan sebagai pensampelan daripada nukleus dinamik taburan dan bukannya ekor yang tidak boleh dipercayai.
Walaupun tetapan yang paling tidak deterministik ini masih mengambil sampel daripada senarai pendek yang dibina berdasarkan apa yang model sudah anggap berkemungkinan. Penulisan manusia tidak pernah dijana dengan menyusun kedudukan kosa kata dan mengambil sampel daripada bahagian teratasnya, jadi ia sentiasa melangkaui senarai pendek itu. Makna kadangkala terletak pada perkataan yang tidak pernah berada dalam senarai.
Humanisasikan kertas anda sendiri
Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.
Kerataan Kosa Kata: Lebih Sedikit, Perkataan yang Lebih Selamat
Kerataan kosa kata ialah versi pada tahap perkataan bagi tabiat yang sama. Pada setiap titik dalam ayat, berpuluh-puluh perkataan boleh meneruskannya secara munasabah, tetapi segelintir berada jauh di atas yang lain dalam kedudukan model, dan penyahkodan terus mendarat pada segelintir itu. Gandakan pilihan itu bagi setiap ayat dalam sesuatu dokumen dan julat perkataan yang sebenarnya digunakan menyempit dengan ketara berbanding penulisan manusia yang panjangnya serupa.
Kesan itu bertambah secara kumulatif, bukannya kekal tetap. Sesuatu model yang mencapai kata berperingkat tertinggi dalam ayat pertama lebih cenderung membentuk konteks di mana kata berperingkat tertinggi dalam ayat kedua juga lazim, kerana kata lazim cenderung mengikuti kata lazim. Seorang penulis manusia sentiasa memutuskan aliran itu, dengan memilih istilah teknikal yang khusus, kata kerja yang sedikit luar biasa, kata yang menamakan benda sebenar itu dan bukannya anggaran selamat mengenainya. Perbezaan itu muncul sebagai kosa kata kerja yang dapat diukur lebih kecil dalam versi yang dijana, walaupun kedua-dua versi menerangkan fakta asas yang sama.
Ini ialah sifat keseluruhan petikan, bukan sifat mana-mana pilihan kata tunggal. Satu kata yang selamat tidak membuktikan apa-apa. Satu halaman penuh kata seperti itu, ayat demi ayat mencapai tahap kosa kata lazim yang sama, ialah apa yang sebenarnya dibina oleh isyarat peringkat kata bagi pengesan untuk dikesan.
Keseragaman Sintaksis: Bentuk yang Sama, Diulang
Keseragaman sintaksis ialah versi pada peringkat ayat. Ia bukan tentang panjang sesuatu ayat. Ia tentang berapa banyak bentuk tatabahasa yang berbeza digunakan oleh sesuatu petikan, bagaimana ayat dibuka, bagaimana klausa disambungkan antara satu sama lain, dan berapa kerap kata peralihan melakukan tugas menghubungkan satu idea dengan idea yang seterusnya. Sesuatu model yang terus meramalkan struktur seterusnya yang berkemungkinan secara statistik akan menetap pada putaran bentuk yang kecil dan mengulanginya.
Sesuatu perenggan boleh memvariasikan panjang ayatnya dan masih dibaca sebagai rata dari segi sintaksis jika setiap ayat mengikuti bentuk subjek kata kerja pelengkap yang sama, dibuka dengan jenis peralihan yang sama, atau diselesaikan dengan cara yang sama. Kebolehramalan itu terletak pada pola, bukan pada bilangan kata, satu perbezaan yang dibincangkan dengan lebih mendalam dalam panduan tentang apa yang sebenarnya diukur oleh burstiness.
| Apa yang menyempitkan | Apa yang cenderung dilakukan oleh teks yang dioptimumkan untuk penyahkodan | Apa yang cenderung dilakukan oleh penulisan manusia |
|---|---|---|
| Pilihan kata | Memilih kata umum yang paling berkemungkinan pada setiap langkah | Mencari kata khusus atau yang kurang lazim yang menamakan perkara sebenar |
| Pembukaan ayat | Mengulangi putaran kecil pembukaan peralihan yang selamat | Mengubah cara ayat bermula, termasuk pembukaan yang akan dinilai oleh model sebagai kurang berkemungkinan |
| Struktur klausa | Mengulangi satu atau dua bentuk tatabahasa yang digemari merentasi sesuatu petikan | Menggabungkan struktur ringkas dan kompleks bergantung pada keperluan ayat |
Pilihan yang Hanya Cenderung Dibuat oleh Manusia
Sebaliknya bagi jalur yang sempit ialah apa yang berada di luar jalur itu. Seseorang yang menerangkan peristiwa sebenar akan memilih angka yang tepat dan bukannya angka bulat, mengakui bahagian yang tidak menjadi, menyampuk ayat untuk membetulkannya di tengah-tengah pemikiran, atau memilih kata yang tepat dan bukannya kata yang lazim. Setiap pilihan itu, dari sudut pandang model bahasa, ialah token berkemungkinan rendah, iaitu jenis yang cuba dielakkan oleh penyahkodan.
Semua ini tidak bermaksud bahawa penulisan yang khusus atau luar biasa selamat daripada setiap penanda, atau bahawa penulisan yang lancar dan betul semestinya mencurigakan. Bahagian kaedah, klausa undang-undang, atau draf akhir yang banyak disunting boleh jatuh dalam jalur yang sempit atas sebab yang tiada kaitan dengan model, sebab itulah satu skor sahaja ialah huraian tentang suatu pola, bukan keputusan muktamad tentang siapa yang menaipnya.
Melihat tempat draf anda sendiri dalam jalur itu lebih berguna daripada meneka. Pemeriksa perplexity percuma dan pemeriksa burstiness TextPulse mengukur kebolehramalan pada tahap kata dan ritma ayat demi ayat secara berasingan, jadi kosa kata yang rata dan bentuk ayat yang berulang muncul sebagai dua isyarat yang berbeza, bukannya satu nombor gabungan.
Dua halaman yang lebih khusus terhasil daripada ini. Bagaimana Turnitin mengesan AI secara khusus ialah satu, dan perbezaan antara skor kesamaan dan skor AI-nya ialah yang lain, kerana kedua-duanya lazimnya disalah anggap sebagai satu sama lain.
Kedua-duanya berada dalam koleksi alat percuma yang lebih luas, untuk sesiapa yang mahu melihat corak itu sendiri dan bukannya mempercayai satu nombor secara membuta tuli.
Soalan Lazim
Mengapa teks AI dikesan? Kerana proses penyahkodan yang menjananya memihak kepada perkataan yang berkemungkinan dan struktur ayat yang berkemungkinan pada setiap langkah, yang menghasilkan penulisan yang berada dalam julat bahasa yang lebih sempit daripada penulisan manusia biasa. Pengesan mengukur kesempitan itu, bukannya membaca makna, jadi corak itu boleh muncul walaupun dalam prosa yang lancar dan tepat.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.