AI Detection

Kebarangkalian Token dan Log-Likelihood dalam Pengesanan AI

Perplexity mendapat perhatian, tetapi aritmetik di bawahnya ialah kebarangkalian token: apa yang sebenarnya terkandung dalam taburan model terhadap perkataan seterusnya, mengapa matematik pengesanan berjalan dalam ruang log dan bukannya kebarangkalian mentah, dan bagaimana rentetan skor per token menjadi satu nombor.

Dikemas kini pada 6 min
Diagram illustrating token probability ai detection: a language model's next-token distribution turning into a log-likelihood score

Jika anda bertanya kepada pengesan bagaimana ia menghasilkan skor itu, kebanyakan antara muka penggunanya akan memberikan respons yang sama: satu perenggan dengan beberapa perkataan yang diwarnakan lebih gelap daripada yang lain. Pewarnaan itu bukan tekaan. Ia datang daripada satu nombor yang dilampirkan pada setiap token dalam petikan itu, dikira sebelum pengesan itu menyentuh perplexity, burstiness, atau peratusan akhir.

Ia ialah kebarangkalian token, dan setiap pengesanan ai kebarangkalian token berasaskan hal itu, dari asasnya. Sebarang bilangan metrik yang akan dilaporkan oleh pengesan, termasuk dua yang kami bincangkan di tempat lain di laman ini, hanyalah aritmetik yang dilakukan pada siri nombor ini. Lapisan di bawah lapisan yang biasanya menjadi titik berhenti kebanyakan penjelasan ialah tempat anda perlu memikirkan apa sebenarnya token itu, apa makna taburan model ke atasnya, dan mengapa aritmetik itu berjalan dalam ruang log dan bukannya kebarangkalian mentah. Kebanyakan penjelasan berhenti di situ.

Tiada satu pun daripadanya perlu kekal kabur. Token, taburan kebarangkalian dan logaritma ialah alat biasa, bukan rahsia proprietari, dan tiga idea yang sama menerangkan bagaimana pengesan AI sebenarnya berfungsi, daripada teks mentah kepada satu nombor pada laporan.

Pengesanan AI Kebarangkalian Token: Daripada Taburan kepada Skor

Pengesanan ai kebarangkalian token berfungsi dalam tiga peringkat. Model bahasa memberikan kebarangkalian kepada setiap token seterusnya yang mungkin, berdasarkan apa yang datang sebelumnya. Kebarangkalian bagi setiap token itu ditukar kepada logaritma dan dijumlahkan merentasi petikan, yang mengelakkan masalah berangka yang akan dihadapi oleh pendaraban mentah hampir serta-merta. Jumlah yang terhasil, selepas dipuratakan dan diskalakan semula, ialah apa yang akhirnya muncul sebagai angka perplexity atau menjadi input kepada keputusan pengelas. Setiap peringkat ialah bahagian aritmetik yang khusus dan boleh disemak, bukan kotak hitam.

Apa Sebenarnya Token Itu

Satu token bukanlah satu perkataan. Model bahasa moden membahagikan teks kepada bahagian subperkataan dengan algoritma seperti byte-pair encoding, jadi perkataan biasa seperti 'the' biasanya satu token, perkataan yang kurang biasa seperti 'perplexity' terbahagi kepada dua atau tiga bahagian, dan nama yang tidak dikenali boleh berpecah menjadi aksara individu. Satu petikan bahasa Inggeris biasa boleh ditokenkan dengan pasti kepada lebih banyak bahagian daripada jumlah perkataannya, dan ini wajar diketahui sebelum mempercayai apa-apa kiraan perkataan yang dilaporkan semula oleh sesuatu alat kepada anda.

Model itu tidak pernah melihat perkataan seperti yang dilihat oleh pembaca. Ia melihat urutan integer, setiap satu ialah indeks kepada kosa kata tetap yang digunakan untuk melatih model itu. Segala yang dilakukan oleh token probability ai detection dari titik ini seterusnya beroperasi pada urutan integer itu, bukan pada rentetan huruf asal, yang sebahagiannya menerangkan mengapa kerja dalaman sesuatu pengesan boleh terasa terpisah daripada cara seseorang benar-benar membaca ayat.

Taburan Model terhadap Token Seterusnya

Pada setiap kedudukan dalam sesuatu urutan, model bahasa autoregresif tidak mengeluarkan satu ramalan. Ia mengeluarkan satu taburan kebarangkalian penuh merentasi keseluruhan kosa katanya, puluhan ribu nombor yang jumlahnya bersamaan satu, dengan menyusun setiap token seterusnya yang mungkin daripada yang paling mungkin kepada yang paling kurang mungkin berdasarkan segala yang telah mendahuluinya. Jika anda memberi model frasa 'the results of the', ia mengagihkan sebahagian besar jisim kebarangkalian itu kepada beberapa kata nama yang munasabah, 'study,' 'experiment,' 'analysis,' sambil memberikan bahagian yang amat kecil kepada sesuatu seperti 'marmalade.'

Token yang benar-benar muncul seterusnya dalam dokumen sebenar berada di suatu tempat dalam susunan itu, dan kebarangkalian yang diperuntukkan kepadanya ialah bahan mentah bagi segala yang lain dibina. Model yang menghasilkan teksnya sendiri boleh bergantung pada taburan ini secara langsung, dengan berulang kali memilih daripada bahagian hampir di atas. Pengesan yang membaca teks siap orang lain hanya boleh bertanya, selepas fakta, berapa banyak kebarangkalian yang akan diperuntukkan oleh model kepada pilihan yang sebenarnya dibuat.

Kebarangkalian bagi satu urutan keseluruhan ialah hasil darab kebarangkalian setiap token yang diberi semua yang sebelumnya, jika kita merantaikan soalan per token itu merentasi keseluruhan dokumen menggunakan peraturan standard bagi kebarangkalian bersama, hasil akhirnya ialah satu nombor yang menerangkan sejauh mana keseluruhan petikan itu dijangka. Hasil darab ini ialah tempat aritmetik mula gagal, dan itulah sebab bahagian seterusnya wujud.

Humanisasikan kertas anda sendiri

Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.

Mula secara percuma

Mengapa Log-Likelihood Menggantikan Kebarangkalian Mentah

Mendarab kebarangkalian bersama adalah betul dari segi matematik dan tidak berguna secara praktikal selepas beberapa dozen token. Setiap kebarangkalian individu ialah pecahan kurang daripada satu, jadi hasil darab yang berjalan akan mengecil setiap kali satu token lagi didarab masuk, dan ia mengecil dengan cepat. Selepas beberapa ratus token, hasil darab mentah boleh jatuh begitu jauh di bawah nombor terkecil yang boleh diwakili oleh komputer sehingga ia dibundarkan turun kepada sifar tepat, satu mod kegagalan yang dipanggil underflow.

Apabila itu berlaku, nombor tersebut tidak membawa sebarang maklumat langsung. Satu dokumen yang sekadar tidak mungkin dan satu dokumen yang sangat, secara kacau-bilau tidak mungkin kedua-duanya runtuh kepada sifar yang sama, tanpa cara untuk membezakan antara keduanya selepas itu. Logaritma menyelesaikan masalah ini kerana logaritma bagi hasil darab sama dengan jumlah logaritma, satu identiti daripada algebra asas. Menjumlahkan rentetan nombor negatif biasa tidak mengalami underflow seperti mendarab rentetan pecahan kecil, dan selain itu ia lebih murah untuk dikira.

Panjang petikan (ilustratif)Kebarangkalian mentah, hasil darab yang berjalanJumlah kebarangkalian log
12 token pada 0.1 ilustratif setiap satu1 x 10 to the power of -12, masih boleh diwakilikira-kira -27.6
350 token pada 0.1 ilustratif setiap satu1 x 10 to the power of -350, underflows kepada tepat 0kira-kira -805.9

Ini ialah ilustrasi yang dipermudahkan. Kebarangkalian per token sebenar berbeza dengan sangat besar, bukannya berada pada 0.1 yang rata, tetapi arah masalahnya memang tepat. Apabila hasil darab mentah menjadi underflow hingga sifar, perbandingan yang sebenarnya diperlukan oleh pengesan, sama ada dokumen ini lebih atau kurang dijangka berbanding dokumen itu, menjadi mustahil. Jumlah kebarangkalian log tidak gagal dengan cara itu. Ia kekal sebagai nombor yang tepat, biasa, dan boleh dibandingkan, tidak kira sepanjang mana petikan itu berjalan, yang merupakan sebab sebenar kebolehdeteksian diukur dalam ruang log dan bukannya dalam ruang kebarangkalian mentah.

Daripada Skor Per Token kepada Skor Pengesanan

Menjumlahkan kebarangkalian log merentasi sesuatu petikan menghasilkan jumlah kebarangkalian log dokumen di bawah model rujukan. Membahagikan dengan bilangan token menghapuskan kesan panjang dan meninggalkan kebarangkalian log purata per token, iaitu nombor yang akhirnya boleh dibandingkan antara esei lima ratus patah perkataan dan bab tesis lima ribu patah perkataan. Negatifkan purata itu dan lakukan eksponen padanya, dan hasilnya ialah skor perplexity, suatu metrik yang dihuraikan sepenuhnya oleh kelompok ini dalam ulasan berasingan tentang apa yang sebenarnya diukur oleh perplexity.

Angka per ayat yang sama, yang dijejaki untuk variasi merentasi sesuatu dokumen dan bukannya diratakan menjadi satu purata, ialah asas kepada burstiness, iaitu isyarat yang berkaitan tetapi berasingan daripada perplexity. Kedua-duanya bermula daripada nombor per token yang sama seperti yang dihuraikan di atas. Cuma aritmetik yang dilakukan ke atasnya berbeza.

Purata yang ringkas bukanlah satu-satunya cara untuk menggunakan bahan mentah ini, dan penyelidikan telah bergerak jauh melampauinya. DetectGPT, yang diterbitkan di ICML 2023 oleh Mitchell, Lee, Khazatsky, Manning dan Finn, berfungsi daripada sifat yang berbeza bagi fungsi kebarangkalian yang sama: teks yang disampel daripada model bahasa cenderung berada dalam kawasan yang pengungkapan semula kecil menyebabkan kebarangkalian log menurun dan bukannya meningkat, suatu corak yang disebut oleh kertas itu sebagai kelengkungan negatif.

Daripada melatih pengelas atau menggunakan tera air, kaedah ini mengganggu suatu petikan, menghasilkan sedikit variasi dalam cara ia diparafrasa, dan kemudian menilai semula setiap variasi dengan model yang sama. Kertas ini membandingkannya dengan penanda aras zero-shot terbaik dan mendapati bahawa, pada teks yang dijana oleh model 20-billion-parameter, kaedah ini mencapai 0.95 AUROC manakala penanda aras zero-shot terbaik mencapai 0.81 AUROC.

Taburan yang Sama, Digunakan untuk Menanda Air dan Bukannya Mengesan

Setakat ini, semuanya telah memperlakukan taburan kebarangkalian sebagai sesuatu yang dibaca selepas fakta. Ia juga boleh disentuh pada saat penjanaan, yang membalikkan masalah itu sepenuhnya. Kaedah 2023 daripada Kirchenbauer, Geiping, Wen, Katz, Miers dan Goldstein memilih senarai pendek token yang dibenarkan secara rawak sebelum setiap perkataan dihasilkan, berdasarkan hash bagi apa yang datang sebelumnya, dan secara lembut mengarahkan pensampelan ke arah senarai pendek itu. Bias tersebut tidak kelihatan kepada pembaca dan kemudian boleh dipulihkan dengan ujian statistik pada rentang teks yang pendek, tanpa memerlukan akses kepada model asal.

SynthID daripada Google DeepMind meletakkan versi idea ini ke dalam pengeluaran: ia melaraskan skor kebarangkalian token seterusnya pada masa penjanaan dan kini tersedia dalam aplikasi Gemini dan pengalaman web. OpenAI membina sistem yang setara dan belum melancarkannya. Pelaporan mengaitkan keputusan itu sebahagiannya kepada satu tinjauan yang menunjukkan hampir 30 percent pengguna ChatGPT berkata penandaan air akan membuat mereka kurang menggunakan produk itu, di samping kebimbangan tentang sejauh mana tera air akan bertahan terhadap parafrasa.

Laporan pengesan menunjukkan perkataan yang diwarnakan atau satu peratusan dan berhenti di situ, tanpa sekali pun menunjukkan taburan yang daripadanya semuanya datang. penyemak perplexity percuma TextPulse menjalankan versi ringkas bagi penilaian per-token yang sama terhadap draf anda sendiri, yang merupakan cara yang lebih langsung untuk melihat kedudukan sesuatu petikan berbanding membaca keputusan secara tidak langsung.

Dua halaman bersebelahan mengambil perkara ini. Sama ada pengesan masih bergantung pada burstiness telah berubah sejak 2023, dan bagaimana GPTZero menukar kebarangkalian yang sama ini menjadi skor dihuraikan pada halamannya sendiri.

Ia terletak bersama selebihnya alat percuma TextPulse, jadi draf yang sama boleh diperiksa dari segi ritma dan struktur serta kebolehramalan pada tahap perkataan, tanpa membuka sedozen tab berasingan untuk melakukannya.

XLinkedInFacebook

Soalan Lazim

Token probability ai detection ialah lapisan di bawah setiap metrik pengesanan yang lain. Model bahasa memberikan kebarangkalian kepada setiap token dalam satu urutan, satu word-piece pada satu masa, berdasarkan segala yang datang sebelumnya. Perplexity, skor pengelas dan peratusan pada laporan semuanya ialah aritmetik yang dilakukan pada urutan nombor itu selepas itu, bukan ukuran yang berasingan dan bebas.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Kekal dikemas kini tentang pemanusiaan AI

Dapatkan petua tentang penulisan akademik, pengesanan AI, dan pemanusiaan dihantar ke peti masuk anda.

Tiada spam. Boleh berhenti melanggan pada bila-bila masa.