Adakah Pengesan AI Masih Bergantung pada Perplexity dan Burstiness?
GPTZero menjadikan perplexity dan burstiness terkenal, kemudian secara senyap menghentikan kedua-duanya pada musim luruh 2023 demi pengelas pembelajaran mendalam. Catatan ini menelusuri apa yang berubah, apa yang sebenarnya didokumentasikan oleh GPTZero dan Turnitin hari ini, dan mengapa dua statistik itu masih menjelaskan mengapa teks mesin dapat dikesan walaupun tiada satu pun vendor mengiranya secara langsung lagi.
Cari bagaimana GPTZero mengesan penulisan AI hari ini dan kebanyakan hasil carian masih tertumpu pada dua statistik, perplexity dan burstiness, iaitu pasangan yang menjadikan alat itu terkenal dalam beberapa minggu selepas pelancarannya pada Januari 2023. Dokumentasi sokongan GPTZero sendiri kini menyatakan sesuatu yang berbeza: ia berhenti menggunakan kedua-duanya pada musim luruh tahun yang sama.
Jadi, adakah burstiness masih digunakan oleh pengesan AI? Bukan oleh alat yang menjadikan istilah itu sebutan umum dalam kalangan akademik. Pusat sokongan GPTZero menyatakan dengan jelas bahawa ia აღარ lagi menggunakan perplexity atau burstiness, sebaliknya telah beralih kepada seni bina pembelajaran mendalam. Turnitin, alat yang sebenarnya ditemui oleh kebanyakan pelajar, tidak pernah menerbitkan kedua-dua istilah itu sebagai sebahagian daripada kaedahnya sejak awal lagi. Konsep-konsep ini tidak hilang daripada perbincangan. Ia hilang daripada produk yang benar-benar menjalankan pengesanan.
Adakah Burstiness Masih Digunakan oleh Pengesan AI?
Tidak, bukan oleh GPTZero, dan bukan dengan nama itu. Dokumentasi sokongan GPTZero sendiri menyatakannya secara langsung: "As of autumn 2023, GPTZero no longer uses perplexity and burstiness for its AI detection because we migrated to a deep-learning based architecture." Panduan Turnitin sendiri menghuraikan kaedah yang berbeza pula, dibina sekitar pemberian skor kepada bahagian-bahagian sesuatu penyerahan dengan pengelas yang telah dilatih, dan kedua-dua istilah itu juga tidak muncul di mana-mana dalam dokumentasi tersebut. Dua statistik yang mentakrifkan gelombang pertama pengesanan AI bukanlah apa yang kini dijalankan oleh alat-alat utama. Itu lebih sempit daripada mengatakan bahawa ia dibuang: penjelasan GPTZero sendiri masih mengira kedua-duanya sebagai antara tujuh penunjuk yang memberi suapan kepada modelnya. Ia berhenti menjadi kaedah tanpa berhenti menjadi ukuran, dan perbezaan antara dua dakwaan itu sebahagian besarnya ialah inti persoalan ini.
Apa yang Berubah pada Musim Luruh 2023
Kedua-dua istilah ini tidak pernah kabur. Penjelasan awal GPTZero sendiri mentakrifkan perplexity sebagai "ukuran kebarangkalian bahawa model AI akan memilih set perkataan yang sama persis seperti yang terdapat dalam dokumen," dan burstiness sebagai "ukuran sejauh mana corak penulisan dan perplexity teks berbeza sepanjang keseluruhan dokumen," iaitu statistik pada peringkat dokumen, bukan kiraan panjang ayat yang mudah. Kedua-dua takrif ini masih diterbitkan di laman GPTZero. Yang berubah ialah yang mana satu sebenarnya dijalankan oleh pengesan itu.
"Migrated to a deep-learning based architecture" ialah dakwaan yang khusus, bukan frasa pemasaran, dan ia menggambarkan perubahan sebenar dari segi jenis. Skor perplexity dikira secara langsung daripada formula, jalankan teks melalui model bahasa rujukan, ambil purata kebarangkalian log, kemudian eksponenkan hasilnya. Sebaliknya, pengelas deep-learning dilatih, ditunjukkan sejumlah besar contoh tulisan manusia dan AI sehingga ia mempelajari sendiri apa sahaja gabungan ciri yang membezakan dua kelompok dalam data latihan itu. Tiada siapa yang menulis peraturan itu secara manual dalam pendekatan kedua. Model yang menemuinya.
Kedua-dua istilah yang telah dihentikan ini mendapat penjelasan penuh di tempat lain di laman ini: apa yang sebenarnya diukur oleh perplexity dan apa yang sebenarnya diukur oleh burstiness masing-masing menghuraikan mekanisme mereka secara mendalam, termasuk formula di sebaliknya. Bahagian ini kekal terhad kepada persoalan sama ada mana-mana satu daripadanya masih merupakan apa yang dijalankan oleh pengesan hari ini.
Apa yang GPTZero dan Turnitin Sebenarnya Dokumentasikan Hari Ini
Halaman teknologi GPTZero semasa, yang menerangkan apa yang dihantar dalam produk, menyatakan bahawa pengesan mereka ialah "end-to-end deep learning approach", dengan "sentence-by-sentence classification model" yang menghasilkan output kebarangkalian dengan skor keyakinan. Perplexity dan burstiness tidak muncul di mana-mana pada halaman itu, bukan sebagai komponen, bukan sebagai ciri warisan, bukan dalam nota kaki.
Dokumentasi Turnitin tidak pernah dibina berasaskan kedua-dua istilah itu sejak awal. Panduannya menerangkan penyerahan yang dibahagikan kepada beberapa bahagian yang masing-masing terdiri daripada beberapa ratus perkataan, setiap bahagian diberi skor oleh model terlatih, dan skor bahagian itu dipuratakan menjadi satu peratusan yang dipaparkan oleh laporan. Itu ialah pengelas terselia yang beroperasi pada segmen teks, iaitu keluarga kaedah yang sama seperti yang telah digunakan oleh GPTZero, bukan pengiraan perplexity dan bukan pengiraan burstiness dengan nama yang berbeza.
Peralihan ini paling mudah dilihat secara bersebelahan.
| Apa yang dihuraikan oleh penerangan awal (2023) | Apa yang dihuraikan oleh dokumentasi semasa | |
|---|---|---|
| GPTZero | Perplexity dan burstiness, diberi skor terhadap model rujukan | Pengelas pembelajaran mendalam ayat demi ayat yang mengeluarkan kebarangkalian dan skor keyakinan |
| Turnitin | Tidak pernah diterbitkan, istilah itu tidak muncul dalam bahan Turnitin sendiri pada bila-bila masa | Bahagian yang terdiri daripada beberapa ratus perkataan diberi skor oleh pengelas terlatih, kemudian dipuratakan menjadi satu peratusan |
Humanisasikan kertas anda sendiri
Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.
Mengapa Konsep Ini Masih Menjelaskan Kebolehdikesanan
Semua ini tidak menjadikan perplexity dan burstiness salah, hanya sudah lapuk sebagai huraian tentang mekanisme semasa. Kedua-dua konsep ini sejak awal lagi hanya menghuraikan sesuatu yang nyata: Teks yang dijana dengan pensampelan ke arah sambungan berkemungkinan tertinggi model sendiri cenderung lebih dapat diramal, perkataan demi perkataan, berbanding teks yang ditulis oleh seseorang dari awal; teks itu juga cenderung kurang berubah dari satu ayat ke ayat yang seterusnya. Keteraturan asas itu tidak berubah hanya kerana vendor menukar seni bina pengesannya. Yang berubah ialah cara pengesan itu mencari keteraturan tersebut.
Pengelas terlatih tidak secara eksplisit diminta untuk mencari perplexity atau burstiness. Sebaliknya, ia dilatih berdasarkan perbezaan asas yang sama antara teks manusia dan teks mesin yang cuba ditangkap oleh dua statistik itu. Dan nampaknya sangat tidak mungkin bahawa pengelas yang dilatih untuk membezakan dua kelompok itu tidak akan menumpukan perhatian tepat pada keteraturan tersebut, salah satu perbezaan yang paling boleh dipercayai antara kedua-duanya, juga. Ini ialah inferens tentang sebab pengelas itu mungkin berfungsi, bukan dakwaan tentang senarai ciri yang diterbitkan, dan kedua-duanya harus kekal berasingan.
Penyelidikan bebas menyokong idea bahawa statistik asas itu masih berkesan, walaupun di luar produk mana-mana vendor tunggal. DetectGPT, kaedah zero-shot akademik yang diterbitkan pada 2023, meneliti saudara rapat kepada perplexity, iaitu betapa tajam fungsi kebarangkalian log sesuatu model melengkung di sekitar suatu petikan, dan mencapai 0.95 AUROC pada satu penanda aras berbanding 0.81 untuk garis dasar zero-shot terdahulu yang terbaik, tanpa melatih pengelas pada contoh berlabel sama sekali. Idea terasnya, bahawa teks yang dijana mesin berada dalam kawasan yang berbeza secara statistik dalam ruang kebarangkalian model itu sendiri, masih merupakan penyelidikan aktif. Cuma itulah bukan apa yang GPTZero sediakan kepada pengguna.
Mengapa Begitu Banyak Bahagian Internet Masih Salah Memahaminya
Kebanyakan penjelasan yang diterbitkan tentang cara pengesanan AI berfungsi ditulis semasa atau sejurus selepas pelancaran GPTZero pada Januari 2023, apabila perplexity dan burstiness ialah satu-satunya kerangka awam yang ditawarkan oleh syarikat itu sendiri. Halaman penjelasan asal itu masih tersedia hari ini. Notis persaraan pada musim luruh 2023 terletak pada halaman sokongan yang berasingan dan bukannya digabungkan ke dalamnya, jadi seorang penulis yang membaca halaman pertama dan berhenti membuat penyelidikan tidak akan mempunyai sebab untuk mengetahui bahawa kaedah itu berubah kurang daripada setahun kemudian.
Ulasan pengesan pihak ketiga yang beredar pada 2026 mendakwa GPTZero masih menjalankan perplexity dan burstiness sebagai satu lapisan antara beberapa lapisan dalam sistem yang lebih besar. Dakwaan itu bercanggah secara langsung dengan halaman teknologi semasa GPTZero sendiri dan dokumentasi sokongannya sendiri, dan tiada apa-apa pada laman GPTZero sendiri yang mengesahkannya. Syarikat yang menerangkan produk yang telah dilancarkannya sendiri masih mengatasi dakwaan pihak ketiga yang tidak disokong tentang produk yang sama, walaupun dokumentasi vendor juga boleh tersilap. Bahagian ini mengikuti halaman GPTZero sendiri, bukan ulasan yang mengulangi cerita lama itu.
Apa Maksud Ini untuk Cara Anda Menulis
Panduan praktikal yang dibina sekitar burstiness tidak menjadi tidak berguna hanya kerana perkataan itu hilang daripada bahan GPTZero sendiri. Mengubah panjang ayat secara sengaja masih, dari segi mekanik, merupakan hujah tentang mengelakkan keseragaman statistik yang sama yang sangat mungkin dilatih untuk dikesan oleh pengelas, apa pun nama yang diberikannya kepada isyarat itu secara dalaman. Nasihat asas itu kekal walaupun seni bina vendor berubah, walaupun kosa kata yang menerangkannya tidak berubah.
Tiada satu pun daripada ini memerlukan anda menerima kata-kata sesiapa, termasuk catatan ini. Pemeriksa perplexity percuma TextPulse dan koleksi alat percuma yang lebih luas membolehkan anda melihat kedudukan draf anda sebelum pengesan, daripada mana-mana generasi sekalipun, melakukannya.
Jika jawapannya membawa anda kembali kepada penulisan anda sendiri, tindakan susulan yang praktikal ialah meningkatkan burstiness secara sengaja dan mengubah panjang ayat merentasi perenggan akademik, yang merupakan tugas yang sama yang dihuraikan tanpa metrik itu.
Mekanisme yang dijalankan oleh pengesan akan terus berubah, GPTZero sudah pun mengubahnya sekali. Apa yang kekal tetap ialah soalan sebenar, yang dibincangkan sepenuhnya dalam panduan laman ini tentang cara pengesan AI benar-benar berfungsi: sama ada penulisan yang boleh diramal ialah perkara yang sama dengan penulisan yang ditulis oleh mesin, tanpa mengira formula mana yang kebetulan menjadi popular pada tahun tertentu.
Soalan Lazim
Adakah burstiness masih digunakan oleh pengesan AI? Bukan oleh GPTZero, dan bukan di bawah nama itu. Dokumentasi sokongan GPTZero sendiri menyatakan bahawa ia berhenti menggunakan perplexity dan burstiness untuk pengesanan mulai musim luruh 2023, selepas beralih kepada seni bina berasaskan pembelajaran mendalam. Turnitin tidak pernah menerbitkan mana-mana istilah itu sebagai sebahagian daripada kaedahnya, dan kedua-dua syarikat kini menerangkan pengelas terlatih.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.