Adakah ZeroGPT Tepat?
FAQ sendiri ZeroGPT mendakwa kadar yang menghampiri 98 peratus pada ujian dalaman, dan secara berasingan mengakui bahawa penulisan berformula boleh dibaca sebagai AI tanpa mengira siapa yang menulisnya. Berikut ialah apa yang dinyatakan syarikat tentang kaedahnya, apa yang ditemui oleh ujian bebas terhadap produk ini, dan untuk apa skor percuma itu sebenarnya berguna.
Ketepatan ZeroGPT, menurut dakwaan semasa syarikat itu sendiri, ialah kadar yang "mendekati >98% pada penilaian dalaman," satu angka yang diakui oleh syarikat itu datang daripada ujian yang dijalankannya ke atas dirinya sendiri, bukan daripada makmal luar. Kelayakan tunggal itu, dalaman, sudah cukup bagi kebanyakan pembaca sebelum menganggap mana-mana peratusan pengesan percuma sebagai fakta yang muktamad.
ZeroGPT ialah salah satu pengesan AI percuma yang paling banyak digunakan, sebahagian besarnya kerana ia tidak memerlukan kos dan memberikan jawapan dalam beberapa saat. Jurang yang sama antara dakwaan vendor dan ujian bebas yang muncul merentasi pengesan AI secara umum juga muncul di sini. Apa yang berikut ialah apa yang syarikat itu nyatakan pada masa ini tentang ketepatan dan kaedahnya sendiri, apa yang kaedah itu nampaknya sebenarnya ukur, dan mengapa alat seperti ini cenderung tersasar dengan cara tertentu yang boleh dijangka pada jenis penulisan yang dihantar oleh pembaca akademik.

Apakah Ketepatan ZeroGPT, Menurut Syarikat Itu?
Soalan lazim ZeroGPT sendiri menyatakan bahawa syarikat itu "memberikan ketepatan terkemuka dalam industri dan terus ditambah baik untuk mengekalkan prestasi terbaik dalam kelasnya, mendekati >98% pada penilaian dalaman." Itu ialah dakwaan vendor tentang produknya sendiri, diuji oleh syarikat itu sendiri, dengan frasa yang mengandungi pengelakan yang nyata dalam kata-katanya: "mendekati" sesuatu angka bukanlah pernyataan yang sama dengan mencapai dan mengekalkannya, dan "penilaian dalaman" bermaksud tiada pihak luar telah menerbitkan angka yang sepadan. Tiada apa-apa pada halaman itu menyatakan betapa besar set ujian dalaman itu, apa kandungannya, atau siapa di luar syarikat yang menyemak metodologinya.
Syarikat itu mengesyorkan sekurang-kurangnya 150 hingga 200 patah perkataan teks untuk hasil yang stabil, dengan 500 hingga 1,000 patah perkataan atau lebih meningkatkan kebolehpercayaan lagi, dan menyatakan secara langsung bahawa petikan yang sangat pendek atau banyak disunting "membawa lebih sedikit isyarat." Pendedahan tunggal itu lebih penting daripada peratusan pada tajuk utama. Ia merupakan pengakuan sendiri oleh vendor bahawa skor itu hanya setepat kebolehpercayaan input yang panjang dan tidak disentuh, suatu syarat yang tidak selalu dipenuhi oleh penyerahan sebenar.
Kaedah Apakah yang Sebenarnya Digunakan oleh ZeroGPT?
ZeroGPT menamakan sistem asasnya DeepAnalyse, yang diterangkan di laman webnya sendiri sebagai "metodologi berbilang peringkat yang direka untuk mengoptimumkan ketepatan sambil meminimumkan positif palsu dan negatif palsu" yang membaca teks "daripada tahap makro kepada tahap mikro." Soalan Lazimnya menerangkan sesuatu yang lebih khusus di bawah penjenamaan itu: analisis "corak token, burstiness, entropi, dan ciri pengelas ensembel yang dilatih pada set data bercampur."
Burstiness dan entropi bukan unik kepada ZeroGPT. Ia ialah sifat statistik yang sama, iaitu sejauh mana panjang dan ritma ayat berbeza, dan sejauh mana boleh diramalkan setiap perkataan seterusnya, yang diterangkan oleh penjelasan TextPulse sendiri tentang cara pengesan AI berfungsi sebagai mekanisme umum di sebalik keseluruhan kategori alat ini. Pemeriksa perplexity percuma menunjukkan nombor asas yang sama itu secara langsung, tanpa meminta penulis mempercayai terlebih dahulu peratusan mana-mana vendor tunggal.
Humanisasikan kertas anda sendiri
Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.
Mengapa Penulisan Akademik Menyebabkan Pengesan Ini Tersalah?
Soalan Lazim ZeroGPT menyatakannya begini: "penulisan yang sangat digilap, berformula, atau berentropi rendah boleh menyerupai AI." Prosa akademik direka untuk penulisan yang sangat digilap, berformula, berentropi rendah. Bahagian kaedah, ulasan literatur dan surat iringan rasmi semuanya memberi ganjaran kepada frasa konvensional berbanding frasa yang inventif, kerana konvensi itulah yang menjadikan dokumen itu boleh digunakan oleh pembacanya pada asalnya, dan konvensi itu tepat merupakan corak berentropi rendah yang disebut oleh pendedahan vendor sendiri sebagai risiko.
Pengujian bebas dan disemak oleh rakan sebaya menunjukkan mengapa mod kegagalan ini memberi kesan yang lebih berat kepada sesetengah penulis berbanding yang lain. Satu kajian Stanford 2023 menjalankan tujuh pengesan yang digunakan secara meluas, termasuk ZeroGPT, terhadap 91 esei TOEFL sebenar yang ditulis oleh penutur bahasa Inggeris bukan asli dan 88 esei yang ditulis oleh pelajar darjah lapan di AS. ZeroGPT menandakan 48 peratus esei TOEFL sebagai dijana AI, berbanding 0 peratus bagi esei darjah lapan, arah ralat yang sama yang ditunjukkan oleh setiap pengesan dalam kajian itu, cuma pada skala yang berbeza.
Tiada apa-apa tentang jurang itu yang unik kepada ZeroGPT, dan tiada apa-apa tentangnya yang merupakan maklumat baharu. Ia ialah pola bias penulis bukan asli yang sama yang didokumenkan merentasi industri pengesan, dan dibincangkan dengan lebih mendalam pada halaman sendiri TextPulse tentang mengapa pengesan AI berat sebelah terhadap penutur bukan asli. Apa yang ditunjukkan oleh jurang itu secara khusus tentang alat pengguna percuma ialah bahawa had yang didedahkan oleh vendor sendiri, penulisan berentropi rendah dibaca sebagai buatan mesin, bukanlah hipotesis. Satu ujian yang disemak oleh rakan sebaya menangkap perkara itu berlaku pada produk ini dengan tepat beberapa tahun sebelum FAQ semasa syarikat itu menamakan mekanisme tersebut dengan kata-katanya sendiri.
Adakah Skor Pengesan Percuma Boleh Membuktikan Apa-apa Tentang Satu Dokumen?
Bukan dengan sendirinya. Peratusan ZeroGPT bukan bukti apa-apa tentang dokumen tertentu, dalam kedua-dua arah. Ia hanyalah anggaran satu model, dibina atas ujian dalaman yang syarikat itu belum menerbitkannya dalam bentuk yang boleh disemak oleh sesiapa di luar syarikat, dan diaplikasikan kepada penulisan yang panjangnya, sejarah penyuntingannya dan genre semuanya mengubah bacaan dengan cara yang sudah diakui oleh FAQ vendor itu sendiri. Menganggap satu skor percuma sebagai keputusan muktamad menuntut lebih daripada skor itu berbanding apa yang didakwa oleh syarikat yang mengeluarkannya.
Apa yang benar-benar berguna bagi sesuatu skor adalah lebih sempit dan lebih biasa: bacaan pantas tanpa kos tentang kedudukan semasa sesuatu draf pada jenis pengukuran statistik yang sama seperti yang turut dijalankan oleh alat institusi berbayar, sebelum orang lain melihatnya. Alat percuma TextPulse meliputi bidang yang sama secara langsung, tanpa meminta penulis meneka skor pengesan percuma yang mana antara beberapa pilihan patut dipercayai terlebih dahulu.
Angka ketepatan menyembunyikan siapa yang menerima kesilapan dan apa yang mencetuskannya. Mengetahui bila hendak menggunakan a, an dan the menghapuskan salah satu pola yang mencetuskan tanda, dan apa sebenarnya maksud positif palsu dihuraikan secara berasingan.
Semua ini tidak menjadikan nombor ZeroGPT tidak bermakna, dan semua ini juga tidak menjadikan nombor itu mencukupi dengan sendirinya. Skor ialah anggaran permulaan, dihasilkan oleh kaedah yang dihuraikan oleh syarikat itu hanya secara garis besar dan belum dibuka untuk ujian luar, pada penulisan yang genrenya sahaja boleh mengubah keputusan sebelum sesiapa yang terlibat melakukan apa-apa kesalahan. Dua perkataan yang membawa paling banyak maklumat pada halaman FAQ itu bukanlah peratusan. Dua perkataan itu ialah kata pengehad yang terletak betul-betul di sebelahnya: dalaman, dan cenderung ke arah. Skor percuma ialah titik permulaan untuk perbualan tentang sesuatu draf, bukan hujah penutup dalam perbualan itu.
Apa Yang Ditemui Penyelidikan Kami
Dalam kajian persetujuan pengesan TextPulse Research, sembilan pengesan AI komersial menilai 90 teks akademik yang sama. Salah satunya ialah teks hibrid 455 patah perkataan: pembukaan dan penutup tulisan manusia mengapit bahagian tengah 168 patah perkataan janaan AI. ZeroGPT memberi teks ini skor 7.6% AI, manakala keputusan alat lain terhadap perkataan yang sama berjulat dari 0% hingga 95.7% AI. Kertas penuh, korpus dan matriks skor setiap alat tersedia terbuka di TextPulse Research.

Soalan Lazim
Ketepatan ZeroGPT, menurut dakwaan semasa syarikat itu sendiri, mencapai kadar "mendekati >98% pada penilaian dalaman." Angka itu datang daripada ujian yang dijalankan syarikat pada produknya sendiri, bukan daripada makmal luar, dan FAQ vendor itu sendiri secara berasingan menyatakan bahawa penulisan yang sangat digilap atau berformula boleh dibaca sebagai dijana AI tanpa mengira siapa yang menulisnya.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.