AI Detection

Apakah Perplexity dalam Pengesanan AI?

Perplexity ialah nombor yang dihasilkan oleh model bahasa untuk menggambarkan betapa terkejutnya model itu terhadap pilihan kata anda. Catatan ini menelusuri metrik ini kepada asal usulnya pada 1977, menghuraikan formulanya, dan menjelaskan mengapa petikan yang sama boleh mendapat skor yang berbeza bergantung pada model mana yang membacanya.

6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

Cari perplexity dan pengesanan AI bersama-sama, dan beberapa hasil teratas ternyata berkaitan dengan produk yang tidak berkaitan: enjin carian berkuasa AI yang kebetulan juga dinamakan Perplexity. Metrik yang sebenarnya dilaporkan oleh pengesan tidak mempunyai kaitan dengan syarikat itu selain perkataan tersebut. Ia berasal daripada penyelidikan pengecaman pertuturan yang berdekad-dekad lebih lama daripada GPTZero atau enjin carian itu, dan ia mengukur sesuatu yang lebih sempit daripada kedua-duanya: sejauh mana model bahasa terkejut oleh perkataan yang sudah ada pada halaman.

Jadi, apakah itu perplexity dalam pengesanan AI? Perplexity ialah skor yang menerangkan sejauh mana baiknya model bahasa meramalkan perkataan tepat dalam sesuatu petikan, dihasilkan dengan merata-ratakan kebarangkalian model itu sendiri dan menukarkan hasilnya kepada satu nombor. Skor yang rendah bermaksud model terus meneka dengan betul. Skor yang tinggi bermaksud model terus terkejut.

Idea ini lebih lama daripada mana-mana pengesan AI di pasaran, dan dengan sendirinya ia tidak mengatakan apa-apa tentang siapa yang menulis sesuatu dokumen. Setelah aritmetik di sebalik nombor itu kelihatan, skor pada sesuatu laporan berhenti kelihatan seperti keputusan muktamad dan mula kelihatan seperti apa sebenarnya, iaitu, huraian tentang pemilihan kata.

Apakah itu perplexity dalam pengesanan AI?

Perplexity ialah ukuran yang dipinjam daripada pemodelan bahasa. Ia menilai sejauh mana baiknya sesuatu model meramalkan perkataan khusus yang muncul dalam sesuatu petikan dan melaporkan skor itu sebagai satu nombor. Pengesan menggunakan ukuran yang sama pada dokumen yang dihantar, nombor yang rendah, yang bermaksud tekaan model sepadan rapat dengan perkataan sebenar, dibaca sebagai tanda kepengarangan mesin, dan nombor yang tinggi dibaca sebagai tanda kepengarangan manusia. Tiada apa-apa dalam pengiraan itu yang membaca hujah dokumen, sitasinya, atau bidang subjeknya. Ia hanya membaca sejauh mana jangkaan setiap perkataan, satu demi satu.

Pengesan tidak mencipta ukuran ini. Mereka meminjam alat yang telah digunakan oleh sistem pengecaman pertuturan dan terjemahan mesin selama berdekad-dekad untuk menilai sejauh mana baiknya sesuatu model meramalkan bahasa biasa, dan menggunakannya semula sebagai proksi bagi kepengarangan, iaitu tugas yang pada asalnya tidak pernah dibina untuknya.

Tiada satu pun daripada ini ada kaitan dengan enjin carian yang tidak berkaitan yang disebut tadi. Perplexity yang dilaporkan oleh pengesan tidak pernah merupakan syarikat dan tidak pernah ditulis dengan huruf besar: ia ialah sifat statistik biasa bagi suatu urutan kata, dikira semula daripada mana-mana teks yang diberikan kepadanya.

Bagaimana perplexity sebenarnya dikira

Pengiraan ini berakar lebih awal daripada mana-mana produk AI. Frederick Jelinek, Robert Mercer, Lalit Bahl dan James Baker memperkenalkan perplexity pada 1977 untuk mengukur betapa sukarnya suatu tugas pengecaman pertuturan bagi sebuah model statistik, beberapa dekad sebelum sesiapa pun menggunakan istilah itu pada esei atau laporan makmal. Takrifnya tidak berubah sejak itu.

Pada setiap kedudukan dalam dokumen, model mengeluarkan kebarangkalian bagi kata yang benar-benar muncul seterusnya, sesuatu seperti 0.72 bagi peralihan yang lazim atau 0.03 bagi yang luar biasa. Perplexity merata-ratakan logaritma kebarangkalian itu merentasi keseluruhan petikan, kemudian membalikkan purata tersebut dengan suatu eksponen.

Eksponen dalam frasa itu melakukan lebih daripada yang kelihatan. Merata-ratakan kebarangkalian logaritma ialah tepat apa yang kita lakukan apabila kita mengira entropi silang, iaitu cara teori maklumat untuk menyatakan berapa banyak bit yang anda perlukan untuk mengekod suatu urutan berdasarkan ramalan yang dibuat oleh sebuah model. Tetapi perplexity menterjemahkan kiraan bit itu kembali kepada sesuatu yang lebih mudah difahami: bilangan pilihan yang berkesan, bukannya kiraan bit yang abstrak.

Apa yang kekal selepas aritmetik itu mempunyai tafsiran yang jelas, hampir fizikal. Sebuah model yang benar-benar pasti setiap kali menghasilkan perplexity 1, iaitu had bawah skala. Sebuah model yang menganggap setiap kedudukan sebagai undian seimbang antara lapan puluh kata yang sama kebarangkaliannya menghasilkan perplexity 80.

Kebanyakan dokumen sebenar berada di suatu tempat di antara dua ekstrem itu, dan kedudukan tepatnya bergantung pada penulis, subjek, dan model mana yang melakukan pembacaan.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Mengapa penulisan manusia cenderung mendapat skor yang berbeza

Jangkaan sesuatu model dibina sepenuhnya daripada apa yang datang sebelumnya, satu perkataan pada satu masa. Selepas frasa 'the treatment group showed a statistically', majoriti besar sambungan yang terbentuk dengan baik ialah 'significant', dan model yang dilatih pada jumlah besar penulisan saintifik memberikan perkataan itu kebarangkalian yang tinggi tanpa ragu-ragu. Seorang penulis manusia yang sampai pada frasa yang sama mungkin juga memilih 'significant', kerana frasa itu sendiri merupakan ciri tetap genre tersebut. Jurang itu muncul di tempat lain, dalam kata nama yang dipilih dua ayat kemudian, sisipan yang ditambah dalam kurungan, nombor yang dilaporkan hingga tempat perpuluhan yang ganjil dan bukannya nombor bulat.

Tiada satu pun daripada itu helah. Apabila seseorang yang menulis tentang data sebenar cuba mendapatkan nombor yang tepat, pengubah suai yang tepat, perkataan yang sedikit lebih khusus, mereka sedang mencapai perkara yang benar tentang kerja itu dan bukannya benar tentang genre itu. Dan setiap satu daripada pilihan itu menambah sedikit lagi kejutan kepada model. Kejutan ialah apa yang skor itu dibina untuk dijumlahkan.

Inferens itu sedang melakukan lebih banyak kerja daripada yang boleh disokong oleh pengukuran tersebut. Perplexity mengukur kebolehramalan secara langsung. Ia menyimpulkan kepengarangan hanya dengan mengandaikan bahawa penulisan yang boleh diramal jarang berlaku dalam kalangan manusia dan lazim dalam kalangan model, satu andaian yang biasanya munasabah dan kadangkala salah dengan cara yang khusus dan boleh dikenal pasti, kerana kebolehramalan ialah sifat yang boleh dimiliki oleh teks atas sebab yang tiada kaitan dengan siapa yang menaipnya.

Mengapa petikan yang sama boleh mendapat skor yang berbeza

Skor itu juga kurang mudah dialihkan daripada yang kelihatan, kerana ia tidak pernah diukur dalam keadaan vakum. Perplexity sentiasa dikira terhadap latihan satu model rujukan yang khusus, dan kebergantungan itu mewujudkan masalah yang tidak dapat ditunjukkan oleh satu definisi sahaja.

FaktorApa yang berubahMengapa ia berlaku
Model mana yang melakukan pembacaanPerenggan yang sama boleh mendapat skor rendah pada satu model dan tinggi pada model yang lainPerplexity hanya pernah diukur terhadap data latihan satu model, dan model yang berbeza dilatih pada teks yang berbeza
Sama ada petikan itu merupakan teks yang banyak direproduksiDokumen sejarah yang terkenal atau definisi buku teks boleh mendapat skor perplexity rendah walaupun seseorang menaip setiap perkataannya ke dalam pengesanPangram Labs merujuk Deklarasi Kemerdekaan sebagai contoh, ia sering dipetik dalam data latihan sehingga model mendapati setiap ayatnya tidak mengejutkan
Sama ada pengesan boleh melihat kebarangkalian token sama sekaliModel komersial tertutup seperti ChatGPT, Gemini dan Claude tidak mendedahkan kebarangkalian per kata yang diperlukan oleh perplexityPengesan menganggarkan skor dengan model terbuka pengganti dan bukannya mengira perplexity terhadap model yang sebenarnya menghasilkan teks itu

Semua ini tidak menjadikan nombor itu tidak bermakna, hanya lebih berisiko untuk dipercayai sebagai keputusan yang berdiri sendiri. Dokumentasi rasmi GPTZero sendiri pernah menerbitkan peraturan anggaran, iaitu perplexity melebihi 85 dibaca sebagai lebih berkemungkinan manusia, tetapi ambang satu vendor pada satu model tidak boleh dipindahkan kepada alat lain yang diukur terhadap model yang berbeza. Pengesan yang melaporkan satu skor sedang memampatkan semua faktor di atas menjadi satu angka tanpa menyatakan yang mana satu yang menyumbang.

Apa yang sebenarnya diberitahu oleh skor perplexity kepada anda

Pengesan komersial menggabungkan perplexity dengan pola pada peringkat ayat, latihan pengelas dan beberapa isyarat lain sebelum mereka mencetak satu nombor dalam laporan. Gambaran yang lebih lengkap tentang bagaimana pengesan AI sebenarnya berfungsi dibincangkan secara berasingan, dan ia menerangkan dari mana datangnya baki nombor itu.

Irama ayat ke ayat ialah isyarat yang berkaitan tetapi berasingan, dibincangkan mengikut terma tersendiri oleh burstiness checker, dan ia melihat sejauh mana variasi yang wujud merentasi sesuatu petikan, bukannya pada mana-mana satu perkataan.

Tiada satu pun daripada nombor ini boleh membuktikan siapa yang menulis sesuatu dokumen, termasuk Human Score anggaran yang dikira oleh TextPulse daripada draf yang dihantar, yang menerangkan teks itu dan bukannya memberikan keputusan mengenainya. Versi ringkas bagi idea yang sama, iaitu kepelbagaian kosa kata dan bukannya kebarangkalian model penuh, menjadi asas kepada free perplexity checker di laman ini, yang wajar dicuba terhadap perenggan yang asal usulnya sudah diketahui sebelum mempercayai apa yang dikatakan sesuatu laporan tentang milik orang lain.

Perplexity checker terletak bersama-sama free tools TextPulse yang lain, jadi satu semakan penuh terhadap draf, kosa kata, irama dan segala yang lain, tidak memerlukan sedozen tab berasingan dibuka serentak.

Perplexity ialah salah satu daripada dua statistik yang menjadi sandaran sistem ini. Yang satu lagi ialah burstiness, variasi dalam panjang dan struktur ayat merentasi sesuatu petikan, dan di bawah kedua-duanya terletak aritmetik kebarangkalian token yang menghasilkan skor itu pada asalnya.

Satu nombor pada laporan ialah pengakhiran kepada rantaian aritmetik yang panjang, bukannya permulaan kepada hujah tentang siapa yang menulis sesuatu. Soalan yang lebih menarik, setelah aritmetik itu tidak lagi misteri, ialah apa yang secara khusus menjadikan sesuatu dokumen mengejutkan atau boleh diramal pada asalnya, dan itu ialah soalan tentang penulisan itu sendiri.

Frequently Asked Questions

Tidak. Perplexity dalam pengesanan AI ialah ukuran statistik lama dari pemodelan bahasa, yang menerangkan sejauh mana petikan teks dapat diramalkan oleh model. Perplexity AI ialah syarikat yang tidak berkaitan yang menghasilkan produk carian berkuasa AI. Kedua-duanya berkongsi nama dan tiada yang lain, dan mengelirukan kedua-duanya tidak akan membantu anda memahami laporan pengesan.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Apakah Perplexity dalam Pengesanan AI? | TextPulse.ai