Adakah Pengesan AI Tepat? Positif Palsu dan Bias
Vendor menerbitkan kadar positif palsu di bawah 1 peratus. Penyelidik bebas yang menguji pengesan yang sama pada penulisan bahasa Inggeris bukan penutur asli mendapati kadar melebihi 60 peratus. Berikut ialah bukti yang ditunjukkan.
Turnitin mendakwa bahawa kadar positif palsu mereka adalah kurang daripada 1%. Sekumpulan penyelidik bebas menguji pelbagai pengesan pada julat sampel penulisan yang lebih luas daripada penutur bahasa Inggeris bukan asli. Mereka mendapati kadar positif palsu purata adalah melebihi 60% bagi jenis penulisan yang sama. Kedua-dua angka ini adalah nyata, kedua-duanya telah diterbitkan, dan kedua-duanya berkaitan dengan pengesan yang dijual kepada pasaran yang sama. Adakah pengesan AI tepat? Ia bergantung pada populasi yang anda uji, pengesan yang anda gunakan, dan bagaimana vendor anda mentakrifkannya pada asalnya.
Catatan ini tidak akan menerangkan semula bagaimana sesuatu pengesan mengira skor itu. Mekanisme, perplexity, kebarangkalian token, cara pengelas dilatih, adalah dibincangkan secara terperinci di tempat lain, dan elok dibaca terlebih dahulu jika anda belum melakukannya. Yang penting di sini ialah apa yang berlaku setelah skor itu wujud: berapa kerap ia salah, terhadap penulisan siapa ia paling kerap salah, dan apakah kos sebenar bagi tuduhan palsu kepada seseorang yang tidak melakukan apa-apa kesalahan.
Adakah pengesan AI tepat?
Tidak secara konsisten, dan jurang antara dakwaan pemasaran dan ujian bebas telah didokumentasikan dengan baik. Sekumpulan penyelidik yang diketuai oleh Debora Weber-Wulff menerbitkan dapatan mereka tentang 14 alat pengesanan, termasuk 12 percuma dan dua komersial, yang diuji terhadap gabungan teks manusia dan ChatGPT pada tahun 2023. Mereka mendapati bahawa tiada satu pun daripada alat ini tepat atau boleh dipercayai, dengan bias terbina dalam untuk melabel teks mesin sebagai manusia, bukannya sebaliknya. Dua daripada alat komersial yang termasuk dalam ujian ini ialah Turnitin dan PlagiarismCheck. Semua alat dalam ujian ini menunjukkan prestasi yang lebih buruk apabila teks itu diparafrasa.
Namun dua tahun kemudian, keadaan tidak statik. Satu kertas kerja dari Booth School, University of Chicago, oleh Brian Jabarian dan Alex Imas, menguji tiga pendatang baharu, Pangram, GPTZero dan Originality.ai, serta satu pesaing sumber terbuka dengan hampir 2,000 karya tulisan manusia daripada blog, berita, ulasan dan fiksyen. Dalam keadaan ujian yang dikawal, alat terbaik dalam kumpulan itu tidak pernah jatuh di bawah ketepatan 99.8 percent dan mengekalkan kadar positif palsunya pada tahap rendah. Model sumber terbuka itu berprestasi sebaik peneka rawak. Keadaan memang telah menjadi lebih baik. Semacam. Sedikit sahaja.
Namun, masalahnya ialah perkataan dikawal. Petikan penanda aras adalah bersih, lengkap dan dihasilkan di bawah keadaan yang diketahui. Esei yang dihantar bukanlah mana-mana daripada perkara itu secara konsisten. Hasil dunia sebenar mungkin tidak sama dengan hasil makmal, seperti yang telah dinyatakan secara terbuka oleh ketua pegawai produk Turnitin sendiri, walaupun itu merupakan pengakuan yang jarang dan berguna daripada seorang vendor. Bahagian seterusnya meletakkan angka vendor di sebelah angka bebas supaya jurangnya kelihatan, bukannya sekadar didakwa.
Tuntutan vendor berbanding ujian bebas
Jadual di bawah menyelaraskan apa yang didakwa oleh empat pengesan tentang diri mereka sendiri dengan apa yang diukur oleh penyelidik bebas apabila mereka menguji alat itu secara langsung. Baca dua lajur tengah bersama-sama, bukan lajur vendor sahaja.
| Detector | Ketepatan yang didakwa oleh vendor | Diperhatikan secara bebas | Apa yang dikatakan vendor tentang positif palsu |
|---|---|---|---|
| Turnitin | Ambang keyakinan 98% sebelum ditandakan, kurang daripada 1% positif palsu pada tahap dokumen | Kira-kira 80% ketepatan, yang terbaik antara 12 alat dalam perbandingan 2023, pada versi alat yang lebih awal | Kurang daripada 1% pada tahap dokumen melebihi ambang 20% ditulis oleh AI, kira-kira 4% pada tahap ayat |
| GPTZero | 95.7% pengesanan teks AI pada kadar positif palsu 1% pada penanda aras RAID yang bebas | 96% ketepatan pada petikan pendek, kadar positif palsu di bawah 1% dalam kajian University of Chicago Booth 2025 | Melaporkan kadar positif palsu 1% pada penanda aras RAID |
| Originality.ai | 99% ketepatan, kadar positif palsu 0.5% model Lite, 1.5% model Turbo | Kadar positif palsu di bawah 1%, tetapi terlepas 10% hingga 40% teks yang ditulis oleh AI dalam kajian Booth yang sama | Menerbitkan angka positif palsu yang berasingan mengikut tahap model |
| Pangram | Kadar ralat yang dikatakannya lebih daripada 38 kali lebih rendah daripada alat pesaing, menyatakan tiada bias terhadap penulis bahasa Inggeris bukan penutur asli | Ketepatan tidak pernah di bawah 99.8%, kadar positif palsu hampir sifar, dalam kajian Booth | Menyatakan kadar positif palsu hampir sifar merentasi 10 domain teks dan 8 model bahasa |
Dua perkara menonjol. Pertama, semua angka vendor datang daripada makmal yang dikawal oleh vendor dan angka Booth datang daripada penyelidik yang tidak mempunyai apa-apa untuk dijual. Kedua, Turnitin langsung tidak muncul dalam lajur tengah itu kerana kajian 2025 tidak mengujinya. Dalam jadual, angka bebasnya berdasarkan perbandingan 2023 yang lebih awal tetapi dilakukan pada versi alat yang lebih lama, jadi ingat perkara ini apabila melihat jadual itu sebagai perbandingan yang setara.
Sejauh manakah tepat pengesanan AI oleh Turnitin?
Turnitin tidak menerbitkan satu angka ketepatan. Sebaliknya, ia menerbitkan satu ambang dan satu pertukaran. Syarikat itu telah menyatakan bahawa ia hanya menandakan sesuatu dokumen apabila ia 98 peratus yakin bahawa bahagian yang ditandakan itu ditulis oleh AI, dan bahawa ambang ini ialah apa yang mengekalkan kadar positif palsu pada peringkat dokumen di bawah 1 peratus. Turnitin telah menganggarkan bahawa ia mengesan kira-kira 85 peratus penulisan yang dibantu AI, sambil membiarkan selebihnya melepasi secara sengaja daripada mengambil risiko tuduhan yang salah.
Peratus sebenar positif palsu yang dikembalikan oleh Turnitin pada peringkat ayat, iaitu apabila antara muka menyerlahkan baris tertentu dan bukannya keseluruhan dokumen, sebenarnya lebih hampir kepada 4 peratus. Inilah angka yang wajar diketahui jika seorang profesor mengambil tangkap layar satu perenggan yang ditandakan dan bukannya skor keseluruhan dokumen, kerana ayat yang diserlahkan membawa kebarangkalian yang bermakna lebih tinggi untuk menjadi salah berbanding skor dokumen di sebelahnya.
Perlu juga diperhatikan bahawa Turnitin telah mengakui jurang ini secara langsung. Mereka mendapati bahawa keputusan dunia sebenar yang pertama, khususnya bagi dokumen yang lebih pendek, mempunyai kadar positif palsu yang lebih tinggi daripada yang dijangka berdasarkan ujian makmal mereka. Jadi mereka melaraskan panjang minimum dokumen untuk dinilai daripada 150 kepada 300 patah perkataan. Itu ialah vendor yang melaraskan produknya sendiri kerana angka yang diterbitkan tidak bertahan di luar makmal, dan hal itu mengatakan banyak perkara seperti juga mana-mana kajian bebas.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Apa yang sebenarnya dibebankan oleh positif palsu kepada seorang pelajar
Ini berlaku kepada seorang pelajar MBA eksekutif di Yale's School of Management. Pelajar itu didakwa atas satu pelanggaran, dalam erti kata yang paling literal. Pengesan yang terlibat ialah GPTZero. Peperiksaan akhir pelajar itu dalam satu kursus kewangan telah ditandakan oleh seorang pembantu pengajar yang berpendapat bahawa penulisannya panjang dan terperinci dengan tanda baca dan tatabahasa yang hampir sempurna. Dan profesor tertentu ini menjalankannya melalui GPTZero, yang menilai jawapan itu sebagai berkemungkinan dijana oleh AI.
Dia gagal kursus itu dan digantung pengajiannya selama setahun. Tuntutan mahkamahnya, yang difailkan di mahkamah persekutuan pada Februari 2025, mendakwa bahawa dasar Yale sendiri mengehadkan penggunaan alat seperti GPTZero atas sebab inilah, iaitu kadar positif palsu yang didokumenkan terhadap penutur bahasa Inggeris bukan asli, dan bahawa dia menggunakannya bertentangan dengan dasar itu. Pemfailannya juga memetik bahawa GPTZero memberikan skor 100 peratus dijana AI pada penulisan akademik oleh bekas presiden universiti Yale sendiri dan dekan sekolah perniagaan itu.
Hakim enggan mengeluarkan injunksi awal pada Mei 2025. Kes itu masih belum diselesaikan, setakat saya menulis ini. Plaintif, seorang warga Perancis, mendakwa bahawa bias yang sama yang diketahui terhadap penutur bahasa Inggeris bukan asli menyebabkan penulisannya berprestasi seperti itu. Itulah yang kami teliti dalam bahagian seterusnya. Yang tidak dipertikaikan ialah harganya, setahun hilang daripada program ijazah, gred gagal, perbelanjaan guaman, dan beberapa bulan bergelut tentang satu skor dan bukannya memperoleh ijazah. Kadar positif palsu 1 peratus kedengaran kecil sehingga populasi yang besar menjadikannya sesuatu yang khusus kepada seseorang.
Mengapa pengesan AI salah mengklasifikasikan penutur bahasa Inggeris bukan asli?
Dengan teruk, dan dengan jurang yang besar. Itulah kesimpulan kajian yang mula-mula meletakkan angka padanya. Penyelidik Stanford menjalankan tujuh pengesan GPT yang digunakan secara meluas terhadap 91 esei TOEFL oleh penutur bahasa Inggeris bukan asli dan 88 esei oleh murid darjah lapan di AS. Pengesan itu membaca esei darjah lapan dengan betul hampir setiap kali. Apabila tiba pada esei TOEFL, yang ditulis oleh orang dewasa yang cukup fasih untuk mengambil ujian bahasa Inggeris peringkat siswazah, pengesan itu mencatat purata kadar positif palsu sebanyak 61.3 peratus. Lapan puluh sembilan daripada 91 esei itu ditandakan sebagai dijana oleh GPT oleh sekurang-kurangnya satu daripada tujuh pengesan itu, 18 daripada esei tersebut ditandakan oleh kesemua tujuh pengesan.
Mekanisme ini sama seperti yang mengawal seluruh pengesanan, perbendaharaan kata yang dapat diramal dan pembinaan ayat yang lebih ringkas dibaca sebagai perplexity yang rendah, dan perplexity yang rendah dibaca sebagai hasil mesin, tanpa mengira siapa yang memegang pena. Penulis yang bekerja dalam bahasa kedua bergantung pada frasa yang telah mantap kerana itulah rupa sebenar kefasihan dalam bahasa tambahan, dan itulah tepatnya profil yang dibina oleh pengesan untuk ditandai.
Penulis dalam kedudukan itu tidak banyak dibantu oleh nasihat untuk sekadar menulis dengan lebih semula jadi, kerana semula jadi itulah yang ditandai. Halaman TextPulse untuk penulis akademik ESL menghuraikan dengan lebih terperinci pola frasa di sebalik risiko itu, termasuk apa yang mengubahnya tanpa mengubah makna ayat.
Ini bukan kes terpencil. Pada Disember 2025, satu penanda aras baharu dikeluarkan, yang secara eksplisit direka untuk menilai bias dalam pengesan ini. Ia merangkumi lebih 200,000 sampel merentas pelbagai demografi dan bahasa. Walaupun diterbitkan dua tahun selepas kajian pertama Stanford dan melibatkan banyak versi model yang berbeza bagi pengesan yang sama, penanda aras ini mendedahkan bahawa bias terhadap pelajar bahasa Inggeris masih wujud.
Keadaan ini tidak berlaku bagi semua vendor. Dokumentasi teknikal Pangram sendiri menyatakan bahawa pengelasnya tidak berat sebelah terhadap penutur bahasa Inggeris bukan natif. Para penyelidik Chicago Booth tidak menguji dakwaan ini secara bebas, tetapi ia menunjukkan bahawa generasi pengesan yang lebih baharu sedang dibina dengan mengambil kira masalah ini, bukannya mengabaikannya.
Jika anda mahu melihat kedudukan penulisan anda sendiri sebelum orang lain menilainya, pemeriksa perplexity percuma memberikan anda nombor asas yang sama seperti yang akan dikira oleh pengesan, tanpa menghantar apa-apa terlebih dahulu kepada institusi.
Siapa lagi yang ditandai, dan mengapa
Pertutur bahasa Inggeris bukan penutur asli menanggung risiko terdokumentasi yang paling besar, tetapi logik statistik yang sama turut menangkap penulisan lain. Pasukan Weber-Wulff mendapati bahawa semua 14 alat yang mereka uji menjadi kurang tepat apabila mereka menjalankannya pada teks yang diparafrasa, ini menggambarkan sebahagian yang bermakna daripada penulisan akademik yang telah melalui pembaca pruf, penyunting, atau pembetulan merah pensyarah sebelum sesiapa menjalankan pengesan ke atasnya.
Tiada satu pun daripada ini bermaksud nombor itu tidak bermakna, hanya bahawa ia memerlukan pengesahan sebelum ia bermakna apa-apa tentang seseorang yang tertentu. Jika anda mempunyai teks yang dibaca sebagai seragam, panjang ayat yang serupa, irama yang serupa sepanjang teks, ia akan mendapat skor sebagai lebih mirip mesin tanpa mengira siapa yang menulisnya atau mengapa. Ini boleh diperiksa secara langsung menggunakan free burstiness checker dan bukannya diteka.
Apakah rupa dasar pengesanan AI yang boleh dipertahankan
Yale sudah mempunyai dasar yang dilaporkan mengehadkan alat seperti GPTZero, atas sebab yang hampir sama dengan yang dihuraikan dalam artikel ini, iaitu kadar positif palsu yang terdokumentasi dan bias yang terdokumentasi terhadap penulis bahasa Inggeris bukan penutur asli. Jadi ini bukanlah begitu banyak kisah tentang seorang pelajar yang malang, sebaliknya tentang peraturan sedia ada yang tidak dipatuhi. Apabila sesuatu dasar benar-benar menguatkuasakan perbezaan antara skor dan keputusan, maka skor menjadi satu input dan bukannya keputusan.
- Anggap skor sebagai satu input, bukan sekali-kali asas tunggal bagi penemuan salah laku
- Dedahkan kadar positif palsu yang diterbitkan oleh alat itu kepada pelajar sebelum menggunakannya terhadap mereka
- Terapkan lebih berhati-hati pada penyerahan yang pendek dan penulisan bahasa Inggeris bukan penutur asli, kedua-duanya titik lemah yang terdokumentasi
- Jamin laluan rayuan yang tidak memerlukan penyangkalan statistik
Tiada satu pun daripada ini luar biasa. Ia lebih hampir kepada cara mana-mana satu bukti forensik sepatutnya diperlakukan di tempat lain, berguna, boleh disemak, dan tidak pernah mencukupi dengan sendirinya.
Bagi seorang penulis individu, prinsip yang sama terpakai sebelum skor wujud, bukannya selepasnya. Satu nombor, daripada mana-mana alat, ialah anggaran dan bukannya keputusan, dan memperlakukannya sebagai kepastian dalam mana-mana arah, selamat atau tertangkap, menuntut lebih daripada nombor itu daripada yang mampu disokongnya.
Alat AI humanizer milik TextPulse sendiri melaporkan Skor Manusia berdasarkan logik yang sama, iaitu anggaran yang dikira daripada teks anda sendiri, bukan keputusan pengesan terhadapnya, berguna sebagai isyarat tentang bagaimana draf itu dibaca pada masa ini dan bukannya janji tentang apa yang akan dikatakan oleh mana-mana pengesan tertentu.
Soalan tentang ketepatan terbahagi kepada soalan yang lebih sempit, setiap satunya mempunyai halamannya sendiri. Kadar pengesan menandakan tulisan manusia dibincangkan secara berasingan, begitu juga bukti khusus tentang kadar positif palsu Turnitin dan tentang ketepatan ZeroGPT. Jika sesuatu skor telah pun digunakan terhadap anda, terdapat bahan praktikal tentang apa yang perlu dilakukan apabila anda dituduh menggunakan AI, tentang bukti yang boleh anda kumpulkan untuk membuktikan bahawa anda tidak menggunakan AI, dan tentang menulis surat rayuan yang menjawab skor itu mengikut syaratnya sendiri.
Nombor pada mana-mana laporan akan terus berubah apabila vendor melatih semula model mereka dan penyelidik terus mengujinya terhadap kes yang lebih sukar. Tetapi apa yang tidak sepatutnya berubah ialah kebiasaan di bawahnya, baca skor sebagai satu ukuran antara beberapa ukuran, tanyakan pada populasi mana ia telah disahkan, dan tanyakan apa yang tidak dikatakan oleh vendor tentang kes yang masih tersalah dinilainya.
Frequently Asked Questions
Ya. Weber-Wulff dan rakan sekerja mendapati alat pengesanan AI 'tidak tepat mahupun boleh dipercayai' dalam perbandingan 2023, dan penulis bahasa Inggeris bukan penutur asli menghadapi risiko terdokumentasi tertinggi, dengan satu kajian mendapati kadar positif palsu purata melebihi 60 peratus pada esei TOEFL. Satu skor sahaja bukan bukti apa-apa dengan sendirinya, sebab itu ia tidak sepatutnya menjadi satu-satunya bukti di sebalik tuduhan.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.