Probabilitas Token dan Log-Likelihood dalam Deteksi AI
Perplexity mendapat perhatian, tetapi aritmetika di baliknya adalah probabilitas token: apa yang sebenarnya terkandung dalam distribusi model atas kata berikutnya, mengapa matematika deteksi berjalan dalam ruang log alih-alih probabilitas mentah, dan bagaimana rangkaian skor per token menjadi satu angka.
Jika Anda bertanya kepada sebuah detektor bagaimana ia menghasilkan skor itu, sebagian besar antarmuka penggunanya akan memberi Anda respons yang sama: sebuah paragraf dengan beberapa kata yang diarsir lebih gelap daripada yang lain. Arsirannya bukan tebakan. Itu berasal dari sebuah angka yang melekat pada setiap token dalam bagian teks tersebut, dihitung sebelum detektor itu menyentuh perplexity, burstiness, atau persentase akhir.
Itu adalah probabilitas token, dan setiap deteksi ai probabilitas token didasarkan pada hal itu, dari dasar. Setiap angka metrik yang akan dilaporkan oleh sebuah detektor, termasuk dua yang kami bahas di tempat lain di situs ini, hanyalah aritmetika yang diterapkan pada rangkaian angka ini. Lapisan di bawah lapisan yang biasanya menjadi batas penjelasan adalah tempat Anda harus memikirkan apa sebenarnya token itu, apa arti distribusi model atas token tersebut, dan mengapa aritmetika berjalan dalam ruang log, bukan probabilitas mentah. Kebanyakan penjelasan berhenti di situ.
Tidak ada yang perlu tetap buram. Token, distribusi probabilitas, dan logaritma adalah alat biasa, bukan rahasia milik sendiri, dan tiga gagasan yang sama menjelaskan bagaimana AI detectors sebenarnya bekerja, dari teks mentah hingga satu angka pada laporan.
Deteksi ai Probabilitas Token: Dari Distribusi ke Skor
Deteksi ai probabilitas token bekerja dalam tiga tahap. Sebuah model bahasa memberikan probabilitas kepada setiap token berikutnya yang mungkin, berdasarkan apa yang mendahuluinya. Probabilitas per token itu diubah menjadi logaritma dan dijumlahkan di seluruh bagian teks, yang menghindari masalah numerik yang segera dihadapi oleh perkalian mentah. Jumlah yang dihasilkan, setelah dirata-ratakan dan diskalakan ulang, adalah yang akhirnya muncul sebagai angka perplexity atau menjadi masukan bagi keputusan sebuah classifier. Setiap tahap adalah bagian aritmetika yang spesifik dan dapat diperiksa, bukan kotak hitam.
Apa Sebenarnya Token Itu
Sebuah token bukanlah sebuah kata. Model bahasa modern memecah teks menjadi bagian subkata dengan algoritma seperti byte-pair encoding, sehingga kata umum seperti 'the' biasanya menjadi satu token, kata yang kurang umum seperti 'perplexity' terpecah menjadi dua atau tiga bagian, dan nama yang tidak dikenal dapat terfragmentasi menjadi karakter individual. Sebuah bagian teks bahasa Inggris biasa secara andal ditokenisasi menjadi lebih banyak bagian daripada jumlah katanya, dan hal ini patut diketahui sebelum mempercayai jumlah kata apa pun yang dilaporkan kembali oleh suatu alat kepada Anda.
Model tidak pernah melihat kata seperti yang dilihat pembaca. Model melihat urutan bilangan bulat, masing-masing merupakan indeks ke dalam kosakata tetap yang digunakan saat model dilatih. Segala sesuatu yang dilakukan token probability ai detection sejak titik ini beroperasi pada urutan bilangan bulat itu, bukan pada string huruf asli, yang menjadi salah satu alasan mengapa cara kerja internal sebuah detector dapat terasa terputus dari cara seseorang benar-benar membaca sebuah kalimat.
Distribusi Model atas Token Berikutnya
Pada setiap posisi dalam suatu urutan, model bahasa autoregresif tidak menghasilkan satu prediksi. Model menghasilkan distribusi probabilitas penuh di seluruh kosakatanya, puluhan ribu angka yang jumlahnya menjadi satu, yang memberi peringkat pada setiap token berikutnya yang mungkin dari yang paling hingga yang paling tidak mungkin berdasarkan segala sesuatu yang telah muncul sebelumnya. Jika Anda memberi model frasa 'the results of the', model mendistribusikan sebagian besar massa probabilitas itu ke sejumlah kecil nomina yang masuk akal, 'study,' 'experiment,' 'analysis,' sambil memberikan bagian yang sangat kecil kepada sesuatu seperti 'marmalade.'
Token yang benar-benar muncul berikutnya dalam dokumen nyata berada di suatu tempat dalam peringkat itu, dan probabilitas yang diberikan kepadanya adalah bahan mentah yang menjadi dasar segala sesuatu yang lain. Model yang menghasilkan teksnya sendiri dapat bergantung langsung pada distribusi ini, dengan berulang kali memilih dari bagian teratas. Detector yang membaca teks jadi milik orang lain hanya dapat bertanya, setelah peristiwa itu, seberapa besar probabilitas yang akan diberikan model kepada pilihan yang benar-benar dibuat.
Probabilitas suatu urutan utuh adalah hasil kali probabilitas setiap token, dengan syarat semua yang mendahuluinya diketahui; jika pertanyaan per token itu dirangkai melintasi seluruh dokumen menggunakan aturan standar untuk probabilitas gabungan, hasil akhirnya adalah satu angka yang menggambarkan seberapa diharapkan seluruh bagian tersebut. Hasil kali inilah yang mulai membuat aritmetika gagal, dan itulah alasan bagian berikut ada.
Humanisasi makalah Anda sendiri
Ubah teks berbantuan AI Anda dan buat terdengar manusiawi, tanpa menyentuh kata penting atau sitasi.
Mengapa Log-Likelihood Menggantikan Probabilitas Mentah
Mengalikan probabilitas satu sama lain memang benar secara matematis, tetapi secara praktis tidak berguna setelah beberapa lusin token. Setiap probabilitas individual adalah pecahan yang lebih kecil dari satu, sehingga hasil kali yang terus diperbarui akan menyusut setiap kali token lain dikalikan, dan penyusutannya cepat. Setelah beberapa ratus token, hasil kali mentah dapat turun jauh di bawah bilangan terkecil yang dapat direpresentasikan komputer sehingga nilainya dibulatkan menjadi nol tepat, suatu mode kegagalan yang disebut underflow.
Setelah itu terjadi, angka tersebut sama sekali tidak membawa informasi. Sebuah dokumen yang hanya tidak mungkin dan sebuah dokumen yang sangat, secara kacau, tidak mungkin sama-sama runtuh menjadi nol yang identik, tanpa cara untuk membedakannya sesudahnya. Logaritma memperbaiki hal ini karena logaritma dari suatu hasil kali sama dengan jumlah logaritma, suatu identitas dari aljabar dasar. Menjumlahkan deretan bilangan negatif biasa tidak mengalami underflow seperti mengalikan deretan pecahan kecil, dan selain itu lebih murah untuk dihitung.
| Panjang bagian (ilustratif) | Probabilitas mentah, hasil kali yang terus diperbarui | Jumlah log-probabilitas |
|---|---|---|
| 12 token pada ilustratif 0.1 masing-masing | 1 x 10 to the power of -12, masih dapat direpresentasikan | sekitar -27.6 |
| 350 token pada ilustratif 0.1 masing-masing | 1 x 10 to the power of -350, underflows menjadi tepat 0 | sekitar -805.9 |
Ini adalah ilustrasi yang disederhanakan. Probabilitas per token yang sesungguhnya sangat bervariasi, bukan berada pada 0.1 yang datar, tetapi arah masalahnya memang tepat. Begitu hasil kali mentah mengalami underflow menjadi nol, perbandingan yang sebenarnya dibutuhkan oleh detektor, apakah dokumen ini lebih atau kurang diharapkan daripada dokumen itu, menjadi mustahil. Jumlah log-probabilitas tidak pernah gagal dengan cara seperti itu. Nilainya tetap presisi, biasa, dan dapat dibandingkan, tidak peduli sepanjang apa bagian teks tersebut, yang merupakan alasan sebenarnya keterdeteksian diukur dalam ruang log, bukan dalam ruang probabilitas mentah.
Dari Skor Per Token ke Skor Deteksi
Menjumlahkan log-probabilitas di seluruh bagian teks menghasilkan log-likelihood total dokumen di bawah model acuan. Membaginya dengan jumlah token menghilangkan pengaruh panjang dan menyisakan rata-rata log-likelihood per token, sebuah angka yang akhirnya dapat dibandingkan antara esai lima ratus kata dan bab tesis lima ribu kata. Jika rata-rata itu dinegasikan lalu dieksponensialkan, hasilnya adalah skor perplexity, sebuah metrik yang dibahas secara lengkap oleh klaster ini dalam ulasan terpisah tentang apa yang sebenarnya diukur oleh perplexity.
Angka per kalimat yang sama, yang dilacak untuk variasi di seluruh dokumen alih-alih diratakan menjadi satu rata-rata, adalah bahan pembentuk burstiness, sebuah sinyal yang terkait tetapi terpisah dari perplexity. Keduanya berangkat dari angka per token yang identik seperti dijelaskan di atas. Keduanya hanya melakukan aritmetika yang berbeda di atasnya.
Rata-rata sederhana bukan satu-satunya cara untuk menggunakan bahan mentah ini, dan penelitian telah bergerak jauh melampauinya. DetectGPT, yang diterbitkan di ICML 2023 oleh Mitchell, Lee, Khazatsky, Manning dan Finn, bekerja dari sifat yang berbeda dari fungsi probabilitas yang sama: teks yang disampel dari model bahasa cenderung berada di wilayah tempat parafrasa kecil membuat log-probabilitas turun, bukan naik, suatu pola yang oleh makalah tersebut disebut kelengkungan negatif.
Alih-alih melatih sebuah pengklasifikasi atau menggunakan watermark, metode ini mengganggu sebuah bagian teks, menghasilkan sedikit variasi dalam cara bagian itu diparafrasekan, lalu memberi skor ulang pada setiap variasi dengan model yang sama. Makalah ini membandingkannya dengan baseline zero-shot terbaik dan menemukan bahwa, pada teks yang dihasilkan oleh model 20-billion-parameter, metode ini mencapai 0.95 AUROC sementara baseline zero-shot terbaik mencapai 0.81 AUROC.
Distribusi yang Sama, Digunakan untuk Memberi Watermark alih-alih Mendeteksi
Selama ini, probabilitas distribusi diperlakukan sebagai sesuatu yang dibaca setelah peristiwa. Ia juga dapat disentuh pada saat generasi, yang sepenuhnya membalik masalahnya. Sebuah metode 2023 dari Kirchenbauer, Geiping, Wen, Katz, Miers dan Goldstein memilih daftar pendek acak dari token yang diizinkan sebelum setiap kata dihasilkan, berdasarkan hash dari apa yang mendahuluinya, lalu secara halus mengarahkan pengambilan sampel ke daftar pendek itu. Bias tersebut tidak terlihat oleh pembaca dan kemudian dapat dipulihkan dengan uji statistik pada rentang teks yang pendek, tanpa memerlukan akses ke model asli.
SynthID milik Google DeepMind menerapkan versi gagasan ini dalam produksi, ia menyesuaikan skor probabilitas token berikutnya pada saat generasi dan saat ini aktif di aplikasi Gemini dan pengalaman web. OpenAI membangun sistem yang sebanding dan belum meluncurkannya. Pelaporan mengaitkan keputusan itu sebagian dengan sebuah survei yang menunjukkan bahwa hampir 30 percent pengguna ChatGPT mengatakan watermarking akan membuat mereka lebih jarang menggunakan produk tersebut, di samping kekhawatiran tentang seberapa baik sebuah watermark akan bertahan terhadap parafrase.
Laporan sebuah detektor menampilkan sebuah kata yang diarsir atau satu persentase dan berhenti di situ, tanpa pernah menunjukkan distribusi asalnya. pemeriksa perplexity gratis TextPulse menjalankan versi yang disederhanakan dari penilaian per-token yang sama terhadap draf Anda sendiri, yang merupakan cara yang lebih langsung untuk melihat posisi sebuah bagian teks daripada membaca putusan secara tidak langsung.
Dua halaman yang berdekatan membahas ini. Apakah detektor masih bergantung pada burstiness telah berubah sejak 2023, dan bagaimana GPTZero mengubah probabilitas yang sama ini menjadi skor dijelaskan pada halamannya sendiri.
Hal ini berada bersama dengan alat gratis lain dari TextPulse, sehingga draf yang sama dapat diperiksa untuk ritme dan struktur, serta keterprediksian pada tingkat kata, tanpa membuka selusin tab terpisah untuk melakukannya.
Pertanyaan yang Sering Diajukan
Probabilitas token ai detection adalah lapisan di bawah setiap metrik deteksi lainnya. Sebuah model bahasa menetapkan probabilitas untuk setiap token dalam suatu urutan, satu word-piece pada satu waktu, berdasarkan segala sesuatu yang mendahuluinya. Perplexity, skor pengklasifikasi, dan persentase pada laporan semuanya adalah aritmetika yang diterapkan pada rangkaian angka itu sesudahnya, bukan pengukuran yang terpisah dan independen.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.