AI Detection

Bagaimana Pengesan AI Berfungsi? Perplexity, Burstiness dan Kebarangkalian Token

Pengesan AI tidak mengenali tulisan mesin seperti pembaca. Mereka mengukur sejauh mana teks anda boleh diramal, kemudian menukarnya kepada skor. Apabila itu difahami, teknologi dan kegagalannya menjadi lebih masuk akal.

7 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

Universiti anda telah mula menjalankan penyerahan melalui pengesan AI, dan satu laporan telah kembali dengan nombor yang anda tidak jangkakan. Sebelum anda cuba mempertikaikannya, adalah berguna untuk mengetahui maksud nombor itu. Bagaimanakah pengesan AI berfungsi? Ia tidak membaca tulisan mesin seperti manusia. Ia mengukur sejauh mana teks anda dapat diramalkan oleh model bahasa, kemudian menukar kebolehramalan itu menjadi skor. Tiada apa dalam proses itu yang menilai maksud anda, hujah anda, atau sama ada anda benar-benar menulisnya.

Saya telah menghabiskan bertahun-tahun membina alat yang memecahkan teks secara statistik, dan perkara paling berguna untuk difahami tentang pengesanan ialah ini, ia merupakan ukuran keumuman, bukan asal usul. Apabila perkara itu difahami, teknologi itu dan kegagalannya menjadi jauh lebih masuk akal.

Apa yang sebenarnya diukur oleh pengesan

Pengesan tidak tahu siapa yang menulis apa-apa. Apa yang dimilikinya ialah model bahasa dan fungsi pemarkahan. Model itu membaca teks anda dari kiri ke kanan, dan pada setiap titik ia menghasilkan taburan kebarangkalian bagi perkataan yang sepatutnya datang seterusnya. Berikan kepadanya perkataan "the results of the" dan ia akan meletakkan "study" paling tinggi, "experiment" sedikit lebih rendah, dan "marmalade" hampir sifar.

Jadi pengesan menanyakan satu soalan tentang dokumen anda: berapa kerap teks ini memilih perkataan yang dijangkakan oleh model? Penulisan yang terus memilih perkataan berkemungkinan tinggi kelihatan seperti dibuat oleh mesin, kerana itulah tepatnya yang dilakukan oleh penjana teks. Model itu mengambil sampel daripada bahagian atas taburannya sendiri, berulang kali, untuk beribu-ribu token.

Inilah sebabnya keseluruhan kategori ini berdiri di atas asas yang lebih goyah daripada yang digambarkan oleh pemasaran. Pengesan bukan mencari tera air atau cap jari. Ia hanya menyedari bahawa prosa anda secara statistik tidak mengejutkan, dan prosa yang tidak mengejutkan mempunyai banyak punca selain chatbot.

Perplexity: sejauh mana model itu terkejut

Ukuran utama ini dipanggil perplexity, yang lebih mudah daripada bunyinya. Ambil kebarangkalian yang diperuntukkan oleh model kepada setiap perkataan yang benar-benar muncul, puratakan logaritma kebarangkalian tersebut, dan eksponenkan hasilnya. Apa yang terhasil ialah satu nombor yang menerangkan sejauh mana model terkejut oleh dokumen anda. Anda boleh menyemak perplexity draf anda sendiri daripada meneka mengenainya.

Perplexity yang rendah bermaksud teks bergerak seperti yang dijangkakan oleh model. Perplexity yang tinggi bermaksud teks itu terus mengambil selekoh yang tidak dijangkakan oleh model. Penulisan manusia cenderung berada lebih tinggi, kerana orang mencapai kata nama khusus yang ganjil, binaan yang luar biasa, ayat yang bermula dari tempat yang tidak dijangka. Teks yang dijana cenderung berada lebih rendah, kerana proses penyahkodan dibina untuk mengelakkan tepat gerakan-gerakan itu.

Bandingkan dua cara memulakan bahagian kaedah. "The results of the study were statistically significant" ialah urutan yang hampir mana-mana model akan ramalkan dengan keyakinan tinggi, kerana ia tidak membawa maklumat yang tidak dijangka. "Two of the three cohorts drifted before week six, which we had not planned for" jauh kurang dapat diramalkan, kerana ia membawa maklumat khusus dan janggal yang tidak dapat diteka daripada seluruh kertas itu. Yang kedua menelan kejutan sebenar bagi pengesan, dan kejutan itulah yang direkodkan sebagai manusia.

Burstiness: varians, bukan purata

Perplexity sahaja tidak mencukupi, kerana sesuatu dokumen boleh menghasilkan purata yang sangat munasabah sambil menjadi seragam secara mencurigakan di bawahnya. Yang penting ialah variasi merentasi teks anda, dan itulah yang diukur oleh burstiness: sejauh mana panjang ayat dan perplexity pada peringkat ayat berubah-ubah ketika penulisan bergerak ke hadapan. Sebuah burstiness checker akan menunjukkan taburan itu secara langsung kepada anda.

Kita mempercepat apabila kita yakin dan memperlahankan apabila kita berhati-hati, dan ritma itu kekal dalam prosa. Orang menulis dalam ledakan. Satu perenggan mungkin bermula dengan ayat deklaratif pendek sebanyak lapan perkataan, kemudian beralih kepada ayat tiga puluh empat perkataan yang mengandungi tiga klausa dan satu frasa sisipan, lalu turun semula kepada sesuatu yang ringkas.

Output model tidak melakukan ini dengan boleh dipercayai. Ayat-ayat berkumpul berhampiran panjang purata. Perenggan datang dalam kelompok yang kemas. Setiap bahagian bermula dengan menyatakan semula tajuknya sendiri. Ia dibaca dengan lancar dan mendapat skor yang buruk, kerana varians rendah merentasi ayat ialah salah satu isyarat paling kuat yang dimiliki oleh pengesan. Bukan mana-mana ayat tunggal yang membongkarnya. Ia ialah keseragaman.

IsyaratApa yang diukurnyaMengapa teks mesin mendapat skor rendah
PerplexitySejauh mana model terkejut oleh pilihan kata anda, dipuratakan merentasi dokumenNyahkod secara reka bentuk mengambil sampel daripada token berkemungkinan tinggi
BurstinessSejauh mana panjang ayat dan kebolehramalan berbeza merentasi teksOutput berkumpul berhampiran purata dan bukannya berayun
Token probabilityKebarangkalian setiap perkataan yang digunakan untuk mengira dua yang lainRentetan panjang pilihan yang secara individu tidak menonjol

Token probability dan dari mana skor itu datang

Kedua-dua nombor itu dibina daripada nombor ketiga, iaitu log-kebarangkalian per token, bahan mentah yang digunakan untuk mengira segala yang lain. Sesetengah alat menunjukkannya secara langsung kepada anda, menyorot bahagian yang paling dapat diramalkan dalam teks anda. Sorotan itu bukan tuduhan tentang ayat tertentu, walau apa pun yang disiratkan oleh antara muka. Ia ialah bahagian yang paling banyak menyumbang kepada nombor peringkat dokumen.

Pendekatan penyelidikan telah bergerak melampaui ambang mudah. DetectGPT dan keturunannya melihat kelengkungan, mereka mengganggu teks anda sedikit dan memeriksa sama ada kebarangkalian menurun mengikut pola yang cenderung ditunjukkan oleh teks yang dijana. Yang lain membandingkan petikan yang sama di bawah dua model berbeza dan menggunakan ketidaksetujuan itu sebagai isyarat.

Satu akibat penting bagi sesiapa yang dinilai. Oleh sebab metrik dikira terhadap model rujukan tertentu, skor sentiasa relatif kepada model itu. Dua pengesan boleh membaca perenggan yang sama dan tidak bersetuju sepenuhnya, dan kedua-duanya tidak mengalami kerosakan. Mereka menjawab soalan yang sama dengan titik rujukan yang berbeza.

Kesan kedua kurang kerap diperhatikan. Sesebuah model hanya boleh menemui petikan yang dapat diramalkan jika petikan itu menyerupai bahan yang digunakan untuk melatihnya, jadi kualiti pengesanan merosot apabila jurang antara model rujukan dan apa sahaja yang menghasilkan teks itu semakin melebar. Penjana yang lebih baharu, disiplin yang tidak lazim, dan bahasa selain bahasa Inggeris semuanya membuka jurang itu. Inilah sebahagian sebab mengapa ketepatan yang diukur dalam penanda aras terkawal jarang kekal apabila berhadapan dengan timbunan penyerahan sebenar.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Apa yang ditambah oleh pengesan komersial di atasnya

Alat yang benar-benar dibeli oleh institusi tidak menjalankan perplexity buku teks. Turnitin, GPTZero, Originality dan yang lain melatih pengelas terselia pada set berlabel besar bagi teks manusia dan mesin, dengan menggunakan ciri statistik bersama ciri gaya. Apa yang dipelajari oleh pengelas ialah apa sahaja yang membezakan dua timbunan itu dalam data latihannya, yang merupakan sesuatu yang lebih sempit dan lebih berasaskan sejarah daripada "AI writing" secara umum.

Kebergantungan pada latihan ialah masalah yang senyap. Pengelas yang dilatih terutamanya pada satu generasi output model perlu digeneralisasikan kepada model yang lebih baharu, kepada disiplin yang tidak dikenali, dan kepada penulis yang bahasa Inggerisnya tidak menyerupai taburan latihannya. Vendor menerbitkan angka ketepatan daripada penilaian mereka sendiri, dan penanda aras bebas lazimnya mencatatkan angka yang jauh lebih rendah daripada nombor itu pada alat yang sama.

Membaca skor tanpa membacanya secara berlebihan

Laporan pengesan biasanya tiba sebagai peratusan, dan peratusan itu kerap disalah tafsir. Ia bukanlah bahagian dokumen anda yang ditulis oleh mesin. Bergantung pada alat, ia ialah keyakinan pengelas, atau bahagian ayat yang melepasi suatu ambang dalaman, dan vendor sering tidak jelas tentang yang mana satu. Dua laporan yang kedua-duanya menunjukkan enam puluh peratus boleh membawa maksud yang sangat berbeza.

Adalah juga wajar untuk mengetahui apa yang menggerakkan skor atas sebab yang tiada kaitan dengan siapa yang menulisnya. Dokumen yang pendek lebih bising, kerana terdapat kurang teks untuk purata menjadi stabil, dan esei lima ratus patah perkataan boleh berubah dengan banyak hanya kerana dua atau tiga ayat yang luar biasa. Bahan yang dipetik juga dikira kecuali alat itu menyingkirkannya, jadi ulasan literatur yang dipenuhi petikan blok mewarisi kebolehramalan daripada apa sahaja yang dipetiknya. Petikan teknikal yang sarat dengan istilah standard berkelakuan dengan cara yang sama.

Jika anda menerima tanda amaran, respons yang berguna ialah bukti, bukan hujah tentang metrik. Sejarah versi, draf, nota dan rekod carian semuanya menunjukkan proses, dan proses ialah perkara yang sebenarnya boleh dinilai oleh panel salah laku. Tiada ambang yang boleh ditunjukkan oleh sesiapa yang membezakan penulis yang berhati-hati daripada model.

Mengapa pengesan menandakan tulisan yang tidak dihasilkan oleh mana-mana model

Positif palsu bukanlah kerosakan yang jarang berlaku. Ia timbul secara langsung daripada pengukuran keumuman. Mana-mana tulisan yang benar-benar boleh diramal akan mendapat skor sebagai boleh diramal, tanpa mengira siapa yang menghasilkannya.

Penulis bahasa Inggeris bukan penutur asli paling terkesan. Penyelidik Stanford mendapati bahawa pengesan salah mengelaskan sebahagian besar esei oleh penutur bukan asli sebagai dijana mesin, sambil mengelaskan esei penutur asli dengan betul. Sebabnya bersifat mekanikal, bukan berniat jahat, penulis yang bekerja dalam bahasa kedua cenderung bergantung pada binaan yang sudah biasa digunakan dan kosa kata yang lebih lazim. Itulah tepatnya profil perplexity rendah, sebab itulah penulis ESL ditandakan kerana menulis dengan berhati-hati.

Konvensyen akademik menyebabkan masalah yang sama. Bahagian kaedah sepatutnya bersifat formulaik. Penulisan undang-undang, dokumentasi teknikal dan pelaporan klinikal semuanya memberi ganjaran kepada frasa standard berbanding frasa yang inventif. Penyuntingan yang berat memburukkan lagi keadaan, kerana memurnikan draf biasanya bermaksud membuang ketakteraturan yang membawa tandatangan statistik anda.

Institusi telah menyedarinya. Vanderbilt telah menyahaktifkan ciri pengesanan AI Turnitin daripada bertindak berdasarkan skor yang tidak dapat mereka sahkan, dan universiti lain telah mengehadkan cara nombor itu boleh digunakan dalam prosiding salah laku. Anggaplah skor pengesan sebagai satu bukti yang lemah, bukan sebagai keputusan muktamad.

Apa maksudnya untuk penulisan anda sendiri

Nasihat praktikal yang terhasil daripada mekanisme ini tidaklah luar biasa, dan tiada satu pun daripadanya melibatkan penipuan. Variasikan panjang ayat anda dengan sengaja, kerana keseragaman ialah perkara yang dikesan. Kekalkan butiran khusus, angka sebenar, had sebenar, perkara yang tidak kena pada minggu keenam. Kecekapan yang umum ialah perkara yang dinilai sebagai hasil mesin, dan kekhususan ialah penulisan yang lebih baik serta isyarat yang lebih kuat.

Kekalkan juga idiom anda sendiri. Jika anda mempunyai cara tersendiri untuk menyatakan sesuatu, kekalkanlah. Dorongan untuk menghaluskan draf sehingga ia kedengaran seperti setiap kertas lain dalam bidang itu ialah dorongan yang menurunkan perplexity anda.

Satu perkara yang perlu dielakkan, sesetengah alat sengaja memperkenalkan kesalahan tatabahasa untuk menaikkan perplexity. Ia berkesan pada metrik itu dan merupakan idea yang sangat buruk untuk apa-apa yang dinilai atau melalui semakan rakan sebaya, kerana anda menukar satu syak wasangka dengan satu kepastian. Matlamatnya ialah penulisan yang dibaca sebagai tulisan anda, bukan penulisan yang sengaja dirosakkan. Itulah keseluruhan perbezaan antara menulis semula untuk pembaca manusia dan merosakkan teks untuk memperdaya penilai.

Jika anda mahu melihat nombor ini untuk draf anda sendiri, bukannya menerima kata-kata kotak hitam itu bulat-bulat, ukuran asasnya bukanlah rahsia. alat analisis teks percuma akan menunjukkan kedudukan prosa anda, dan anda boleh memutuskan sendiri sama ada bahagian yang mendatar itu merupakan masalah gaya yang wajar diperbaiki.

Frequently Asked Questions

Ya, dan memang begitu. Pengesan mengukur sejauh mana teks boleh diramal secara statistik, bukan siapa yang menulisnya, jadi apa-apa penulisan yang benar-benar formulaik akan mendapat skor seperti hasil mesin. Penanda aras bebas secara konsisten melaporkan ketepatan di bawah dakwaan vendor, dan beberapa universiti telah mengehadkan cara skor itu boleh digunakan.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.