Ulasan Winston AI: Tuntutan Ketepatan 99.98% berbanding Bukti
Winston AI mendakwa ketepatan 99.98%, angka tuntutan kendiri tertinggi dalam industri pengesan, diukur pada set ujian dalaman yang tidak pernah diterbitkan oleh syarikat itu. Penanda aras RAID yang disemak rakan sebaya meletakkan ketepatan keseluruhannya pada 71% pada kadar positif palsu tetap 5%, masih kedua antara empat pengesan komersial yang diuji. Inilah maksud sebenar setiap angka, dan siapa yang benar-benar sesuai menggunakan alat ini.
Winston AI mengiklankan ketepatan 99.98%, angka tuntutan kendiri tertinggi bagi mana-mana pengesan AI arus perdana. Angka itu tertera pada laman utama syarikat di sebelah perkataan "The Most Trusted AI Detector," dan ia datang daripada ujian dalaman syarikat sendiri, bukan daripada makmal luar. Tiada metodologi, saiz set ujian, nisbah sampel manusia kepada AI, atau ambang operasi diterbitkan bersamanya. Jurang antara dakwaan dan dokumentasinya ialah perkara pertama yang perlu diketahui oleh pembaca yang teliti tentang alat ini.
Perkara kedua ialah Winston sebenarnya telah diuji oleh pihak luar, dan itu lebih daripada yang boleh dikatakan oleh sesetengah pengesan. Penanda aras RAID, satu kajian yang disemak rakan sebaya dan dibentangkan di ACL 2024, menguji Winston terhadap kira-kira 6.2 juta teks yang dijana mesin dan mengukur ketepatan keseluruhan 71.0% dengan kadar positif palsu ditetapkan pada 5%. Itu jauh daripada 99.98%. Ia juga meletakkan Winston di tempat kedua daripada empat pengesan komersial yang diuji, mendahului GPTZero dan ZeroGPT. Kedua-dua fakta itu penting, dan tiada satu pun yang menafikan yang lain.
Perkara yang berikut ialah apa itu Winston dan untuk siapa ia dibina, apa yang didakwa oleh vendor, apa yang boleh dan tidak boleh dimaksudkan secara statistik oleh penanda aras kendiri 99.98%, dan apa yang sebenarnya ditunjukkan oleh angka bebas.
Apa Itu Winston AI dan Siapa Yang Menggunakannya?
Winston AI ialah pengesan berasaskan langganan berbayar yang disasarkan secara langsung kepada pendidik dan penerbit kandungan. Senarai cirinya menyerupai aliran kerja guru: laman syarikat menerangkan OCR yang mengekstrak teks daripada dokumen imbasan, foto, dan tulisan tangan, integrasi Google Classroom yang disenaraikan antara platform yang disokongnya, penyemak plagiarisme bersama pengesanan AI, dan pengorganisasian dokumen untuk mengurus kelompok penyerahan. Vendor menyatakan ia mengesan output daripada ChatGPT, Gemini, Claude, LLaMA "and much more."
Bahagian paling tersendiri bagi antara muka ini ialah output per ayat. Daripada mengembalikan hanya satu peratusan, Winston menghasilkan apa yang disebutnya sebagai peta ramalan AI, iaitu penilaian berkod warna, ayat demi ayat, tentang bahagian mana dalam sesuatu dokumen yang dibaca sebagai dijana mesin. Bagi pendidik, peta itu lebih berguna daripada skor kosong, kerana ia menunjukkan di mana kecurigaan alat itu tertumpu. Namun, ia juga mudah ditafsir secara berlebihan, satu perkara yang dibincangkan di bawah.

Apakah Dakwaan Syarikat?
Dakwaan utama pada halaman utama Winston AI ialah "99.98% Accurate." Setakat penulisan ini, halaman yang memaparkan angka itu tidak menerbitkan bagaimana korpus ujian dibina, berapa banyak sampel yang terkandung di dalamnya, gabungan teks manusia dan AI yang digunakan, atau ambang keputusan yang ditetapkan pada pengesan itu ketika angka tersebut diukur. Hal ini bukan sesuatu yang luar biasa bagi industri ini, jurang yang sama antara dakwaan ketepatan vendor dan bukti bebas berlaku merentasi hampir setiap pengesan di pasaran. Versi dakwaan Winston hanyalah angka terbesar yang diletakkan padanya oleh sesiapa pun.
Apakah Maksud Sebenar Penanda Aras Kendiri 99.98%?
Anggaplah aritmetik itu dengan serius seketika. Kadar ketepatan 99.98% bermaksud 2 kesilapan bagi setiap 10,000 sampel. Untuk mengukur angka itu sama sekali, sebuah syarikat memerlukan set ujian berlabel yang sekurang-kurangnya terdiri daripada puluhan ribu dokumen, dengan asal usul sebenar setiap teks diketahui dengan pasti. Kemudian, angka itu hanya menerangkan prestasi pada korpus tersebut, model AI itu, gesaan itu, genre itu, panjang teks itu, pada ambang yang dipilih itu.
Tiada satu pun daripada itu memerlukan niat jahat. Pengesan yang dilatih pada esei yang dijana oleh model sembang popular, kemudian diuji pada korpus esei yang dijana oleh model sembang popular, memang akan memperoleh skor yang hampir maksimum. Masalahnya ialah kebolehpindahan. Pada saat teks yang masuk datang daripada model yang berbeza, strategi pensampelan yang berbeza, atau penulis yang gaya semula jadinya luar biasa seragam, korpus yang digunakan untuk mengukur penanda aras itu tidak lagi menerangkan teks yang sedang dinilai. Penanda aras dalaman ialah eksperimen terkawal yang dijalankan oleh pihak yang mempunyai kepentingan paling besar terhadap hasilnya, dalam keadaan yang dipilihnya sendiri. Ia ialah bukti, tetapi jenis yang paling lemah, dan metodologi yang tiada bermakna tiada sesiapa di luar syarikat itu pun dapat menyemaknya.
Apakah yang Ditunjukkan oleh Ujian Bebas?
Ujian awam yang paling ketat yang menyertakan Winston ialah RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, satu kajian yang disemak rakan sebaya oleh Dugan dan rakan-rakan yang dibentangkan di ACL 2024. RAID menilai 12 pengesan, termasuk empat produk komersial, terhadap kira-kira 6.2 juta penjanaan yang merangkumi 11 model bahasa, 8 domain penulisan, 4 strategi penyahkodan, dan 11 serangan adversarial, dengan setiap pengesan ditentukur kepada kadar positif palsu 5% yang sama supaya skor dapat dibandingkan.
| Pengesan | Ketepatan keseluruhan dalam RAID (FPR ditetapkan pada 5%) |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
Dua bacaan terhadap jadual itu adalah jujur pada masa yang sama. 71.0% Winston jauh sekali daripada 99.98%, dan Winston masih mengatasi dua daripada tiga pesaing komersialnya pada penanda aras awam paling sukar yang tersedia. Purata juga menyembunyikan taburan yang mendedahkan. Dalam keputusan per model RAID, Winston memperoleh 99.6% pada output ChatGPT dan 98.8% pada output GPT-4, hampir dengan angka yang diiklankan sendiri, tetapi jatuh kepada 47.6% pada teks GPT-2 dan 24.8% pada teks daripada model asas MPT-30B. Pada teks mesin yang diparaprasakan, ketepatannya menurun kepada 52.6%.
Taburan itu ialah keseluruhan cerita bagi dakwaan 99.98% dalam bentuk ringkas. Pada teks yang menyerupai apa yang mungkin telah ditala oleh pengesan itu, iaitu model sembang terkini yang menulis prosa biasa, Winston berprestasi hampir seperti yang dipasarkan. Di luar taburan itu, prestasi merosot dengan mendadak. Penanda aras dalaman yang dibina daripada teks dalam taburan boleh benar-benar menghasilkan angka yang hampir sempurna sambil memberitahu anda hampir tiada apa-apa tentang campuran model, suntingan, dan parafrasa yang tidak teratur dalam peti masuk sebenar. Isyarat statistik yang menjadi sandaran pengesan dibincangkan dengan lebih mendalam dalam penjelasan kami tentang bagaimana pengesan AI berfungsi.
Humanisasikan kertas anda sendiri
Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.
Positif Palsu: Siapa yang Terjejas?
Reka bentuk RAID menjadikan satu pertukaran yang jarang ditunjukkan oleh pemasaran vendor menjadi jelas, iaitu setiap skor ketepatan dalam kajian itu diukur selepas menetapkan kadar positif palsu pada 5%. Pada penentukuran itu, 1 daripada 20 dokumen yang benar-benar ditulis oleh manusia akan ditandakan. Pengesan boleh menurunkan kadar itu dengan menaikkan ambangnya, tetapi hanya dengan menangkap kurang teks AI, kedua-dua nombor bergerak bersama, dan vendor yang memetik satu tanpa yang lain sedang memetik separuh daripada hasil.
Beban kesilapan itu tidak tersebar secara sama rata. Penulisan yang formulaik, konvensional, dan bervarians rendah dibaca sebagai seperti mesin oleh setiap pengesan statistik, dan huraian itu sesuai dengan bahagian kaedah, ulasan literatur, dan prosa cermat penulis yang bekerja dalam bahasa kedua. Corak AI detectors yang menandakan penutur bahasa Inggeris bukan penutur asli pada kadar yang lebih tinggi didokumenkan merentas industri, dan tiada apa-apa dalam kaedah Winston yang mengecualikannya. Peta ramalan bagi setiap ayat wajar menerima kewaspadaan yang sama, ayat yang diserlahkan merah ialah pemerhatian statistik tentang pola kata, bukan bukti tentang kepengarangan. Pelajar yang berdepan tanda yang salah harus bermula dengan dokumentasi, bukan pengakuan, panduan kami tentang cara membuktikan anda tidak menggunakan AI menghuraikan perkara yang benar-benar meyakinkan.
Harga dan Akses
Winston ialah produk berbayar dengan percubaan terhad. Winston menyenaraikan percubaan percuma 14 hari dengan 2,000 kredit, pelan Essential pada $18 sebulan, atau $10 sebulan jika dibilkan setiap tahun, dengan 100,000 kredit bulanan, pelan Advanced pada $29 sebulan, atau $16 setahun, yang menambah tempat duduk pasukan dan imbasan yang lebih besar, serta tahap Elite di atasnya. Bagi seorang pendidik individu yang menapis jumlah penyerahan bersamaan satu kelas, itu meletakkan Winston dalam wilayah pembelian impuls, lebih murah daripada kontrak institusi, lebih berkebolehan daripada kebanyakan alat percuma.
Tempat Winston dalam Landskap Pengesan
Berdasarkan bukti bebas, Winston ialah pengesan komersial berharga sederhana yang berprestasi lebih baik daripada tahap percuma pasaran dan lebih buruk daripada iklannya sendiri. Ia sesuai untuk pendidik yang mahukan keterlihatan bagi setiap ayat, integrasi Classroom, dan semakan plagiarisme dalam satu alat yang murah, serta yang menganggap setiap hasil sebagai pencetus untuk perbualan, bukannya keputusan muktamad. Ia tidak sesuai untuk sesiapa yang memerlukan skor itu berfungsi sebagai bukti, kerana skor tiada pengesan pun tidak berfungsi demikian.
Perbandingan Penuh
Winston ialah satu pengesan dalam medan yang sesak, dan jurang 71% berbanding 99.98% ialah satu contoh bagi corak seluruh industri. Untuk melihat bagaimana ia dibandingkan dengan Turnitin, GPTZero, Originality, ZeroGPT, dan yang lain berdasarkan terma berasaskan bukti yang sama, lihat panduan penuh kami tentang pengesan AI dibandingkan.
Apa Yang Ditemui Penyelidikan Kami
Dalam kajian persetujuan pengesan TextPulse Research, sembilan pengesan AI komersial menilai 90 teks akademik yang sama. Salah satunya ialah teks hibrid 455 patah perkataan: pembukaan dan penutup tulisan manusia mengapit bahagian tengah 168 patah perkataan janaan AI. Winston AI memberi teks ini skor 7% AI, manakala keputusan alat lain terhadap perkataan yang sama berjulat dari 0% hingga 95.7% AI. Kertas penuh, korpus dan matriks skor setiap alat tersedia terbuka di TextPulse Research.

Soalan Lazim
Angka 99.98% ialah tuntutan Winston AI sendiri, diukur pada set ujian dalaman yang tidak diterbitkan oleh syarikat itu. Dalam penanda aras RAID yang disemak rakan sebaya dan dibentangkan di ACL 2024, Winston memperoleh ketepatan keseluruhan 71.0% dengan kadar positif palsu ditetapkan pada 5%, walaupun ia mencapai 99.6% khusus pada output ChatGPT. Tuntutan itu menerangkan korpus yang dipilih, bukan prestasi dunia sebenar.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.