AI Detection

Mengapa Pengesan AI Berat Sebelah terhadap Penulis Bahasa Inggeris Bukan Penutur Asli

Kajian Stanford 2023 mendapati pengesan AI tersalah membaca penulisan Bahasa Inggeris bukan penutur asli yang fasih sebagai dijana mesin pada kadar yang jauh lebih tinggi berbanding penulisan penutur asli. Berikut ialah mekanisme di sebalik jurang itu, dan apa yang berlaku apabila esei yang sama ditulis semula dengan kosa kata yang lebih kaya.

7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

Pengesan AI yang berat sebelah terhadap penutur bukan asli bukanlah aduan yang bersifat subjektif. Satu kajian Stanford 2023 yang ditelaah rakan sebaya mengukurnya secara langsung. Para penyelidik menjalankan tujuh pengesan GPT yang digunakan secara meluas terhadap 91 esei TOEFL sebenar yang ditulis oleh penutur bahasa Inggeris bukan asli dan 88 esei yang ditulis oleh murid darjah lapan di Amerika, kemudian membandingkan bagaimana setiap kumpulan mendapat skor.

Pengesan itu membaca esei darjah lapan dengan betul hampir setiap kali. Pada esei TOEFL, yang ditulis oleh orang dewasa yang telah pun lulus peperiksaan kecekapan bahasa Inggeris peringkat siswazah, tujuh alat yang sama menghasilkan kadar positif palsu purata sebanyak 61.22 percent. Lapan puluh sembilan daripada sembilan puluh satu esei, hampir 98 percent, ditandakan sebagai dijana oleh AI oleh sekurang-kurangnya satu daripada tujuh alat itu.

Gambaran keseluruhan TextPulse tentang bukti yang lebih luas mengenai ketepatan pengesan AI merangkumi dapatan utama itu dan tindakan undang-undang yang kemudiannya berpunca daripadanya. Apa yang hampir di mana-mana sahaja digugurkan apabila kajian itu dipetik ialah mekanismenya, mengapa prosa seorang penutur bahasa Inggeris peringkat siswazah pada mulanya dibaca seolah-olah dibuat oleh mesin, dan apa yang berubah apabila ia berhenti dibaca begitu.

Pengesan AI Berat Sebelah Terhadap Penutur Bukan Asli, Mekanismenya

Sebuah pengesan tidak pernah membaca makna. Ia membaca sejauh mana setiap perkataan dapat diramalkan, berdasarkan perkataan yang mendahuluinya, dan memberikan skor rendah kepada sesuatu petikan apabila model itu boleh meneka sebahagian besar daripadanya lebih awal. Kepelbagaian leksikal, iaitu sejauh mana luasnya kosa kata yang digunakan oleh penulis berbanding mengulang set perkataan yang lebih kecil dan selamat, dan kebolehramalan sintaksis, iaitu sejauh mana struktur ayat mengikut pola paling lazim bagi bahasa itu dan bukannya mempelbagaikannya, ialah dua sifat penghasilan bahasa yang menurunkan skor itu.

Perbezaan ini penting kerana kedua-duanya muncul secara berbeza pada halaman. Kepelbagaian leksikal merujuk kepada kata-kata itu sendiri: seorang penulis yang menggunakan 'obtain,' 'acquire,' dan 'secure' dalam tiga ayat yang berbeza kelihatan lebih pelbagai daripada seorang yang menulis 'get' tiga kali, walaupun ayat-ayat itu selainnya sama. Kebolehramalan sintaksis merujuk kepada struktur: subjek, kata kerja, objek, diulang berulang kali, bukannya ayat yang bermula dengan klausa subordinat atau berakhir dengan kata yang tidak dijangka. Seorang penulis bahasa kedua yang bekerja dalam keadaan peperiksaan mempunyai segala sebab untuk menggunakan versi yang lebih selamat bagi kedua-duanya.

Penulisan bahasa kedua secara konsisten menunjukkan kurang bagi kedua-duanya, dan bukan sebagai kekurangan. Seorang penulis yang beroperasi dalam bahasa tambahan bergantung pada kosa kata dan pola ayat yang paling mungkin betul, kerana tersalah meneka membawa kos yang lebih besar apabila bahasa itu belum sepenuhnya automatik. Kertas Stanford yang mendokumentasikan bias pengesan memetik satu badan penyelidikan linguistik gunaan tentang pola yang tepat ini, yang telah ditetapkan lama sebelum pengesan AI wujud: kekayaan leksikal yang berkurang, kepelbagaian leksikal yang berkurang, dan struktur ayat yang lebih ringkas didokumentasikan, boleh diukur sebagai ciri penulisan bahasa kedua, bukannya tanda sesuatu yang lain.

Jurang antara penulisan penutur asli dan bukan penutur asli ini muncul sebagai perbezaan perplexity, ukuran yang sama yang dijalankan oleh pengesan untuk menentukan sama ada sesuatu petikan dijana oleh mesin. Perplexity yang lebih rendah dibaca sebagai lebih mirip mesin tanpa mengira siapa yang menghasilkannya, dan penulisan bukan penutur asli berada lebih rendah pada skala itu atas sebab yang tiada kaitan dengan chatbot. Sama ada jurang itu benar-benar yang mendorong pengesan, bukannya suatu kebetulan, ialah soalan yang boleh diuji. Pasukan Stanford mengujinya secara langsung.

Apa yang Berlaku Apabila Esei yang Sama Ditulis Semula dengan Kosa Kata yang Lebih Kaya

Penyelidik mengambil 91 esei TOEFL yang sama yang telah mencetuskan kadar positif palsu purata 61.22 percent dan meminta ChatGPT menyemaknya semula menggunakan satu arahan: "Enhance the word choices to sound more like that of a native speaker." Tiada apa-apa tentang kandungan, hujah, atau tatabahasa diarahkan untuk diubah. Selepas satu suntingan itu, kadar positif palsu purata merentas tujuh pengesan yang sama jatuh kepada 11.77 percent, penurunan hampir lima puluh mata peratusan, dan bilangan esei yang ditandakan sebulat suara oleh setiap pengesan jatuh daripada lapan belas kepada satu.

Kemudian penyelidik menjalankan eksperimen itu secara terbalik. Mereka mengambil 88 esei darjah lapan penutur asli, yang pada asalnya dinilai dengan betul oleh pengesan hampir setiap kali, dan meminta ChatGPT memudahkan pilihan kata mereka seolah-olah ditulis oleh penutur bukan asli. Kadar positif palsu purata pada esei penulis asli yang sama itu melonjak daripada 5.19 percent kepada 56.65 percent. Esei tersebut tidak berubah dari segi kepengarangan. Hanya kosa kata yang berubah, dan pengesan mengikut kosa kata itu.

Perplexity bergerak seiring dengan kadar salah klasifikasi dalam kedua-dua arah: ia meningkat dengan ketara apabila esei TOEFL diperkaya, dan menurun dengan ketara apabila esei darjah lapan dipermudahkan. Penulis membuat kesimpulan yang tegas daripada ini: apa yang sebenarnya ditanggapi oleh pengesan bukanlah kepengarangan. Ia ialah pilihan kata, satu sifat yang boleh dibawa oleh kosa kata mana-mana penulis tanpa mengira di mana mereka belajar bahasa Inggeris.

Sejauh Mana Bias Ini Konsisten Merentas Pengesan yang Berbeza

Ketujuh-tujuh pengesan itu tidak banyak bersetuju, kecuali tentang arah ralat itu berlaku. Setiap satu daripadanya menandakan esei TOEFL jauh lebih kerap berbanding esei darjah lapan, tetapi dengan jurang yang sangat berbeza.

PengesanKadar positif palsu, esei TOEFLKadar positif palsu, esei penutur asli
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
Pengesan OpenAI58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Ini ialah angka 2023, diukur pada alat sebagaimana ia wujud ketika itu. Beberapa daripadanya sejak itu telah berubah sepenuhnya: OpenAI menutup pengesan miliknya sendiri pada Julai 2023, empat bulan selepas ujian ini, selepas mendapati ia hanya menandakan dengan betul 26 peratus teks sebenar yang ditulis AI sambil masih salah melabel 9 peratus penulisan manusia. Apa yang tidak berubah ialah arah jurangnya. Satu penanda aras bias yang lebih luas, dibina khusus untuk menguji pengesan merentas kategori demografi dan linguistik, diterbitkan pada Disember 2025 dan dijalankan terhadap empat alat sumber terbuka yang lebih baharu, masih melaporkan recall yang secara konsisten lebih rendah bagi kumpulan penulis yang kurang diwakili.

Humanisasikan kertas anda sendiri

Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.

Mula secara percuma

Adakah Bias Ini Masih Muncul dalam Pengesan yang Lebih Baharu?

Kajian Stanford kini sudah beberapa generasi AI lamanya, dan penulisnya sendiri menyatakan had tersebut: sampel perintis yang kecil, dan pengesan yang dibina kebanyakannya berdasarkan GPT-2, model yang jauh lebih kecil dan lebih lama daripada yang menggerakkan pengesanan hari ini. Itu menimbulkan satu soalan yang wajar. Adakah teknologi yang lebih baik telah menutup jurang itu?

Ujian khusus yang paling terkini mengatakan belum. Dalam satu kajian Februari 2026 dari Sultan Qaboos University, penyelidik menguji dua pengesan komersial semasa, Turnitin dan Originality, terhadap 192 teks yang menggabungkan penulisan pelajar EFL tulen sebelum ChatGPT, penulisan manusia profesional, teks yang dijana AI, dan teks hibrid manusia-AI. Keputusan menunjukkan ketepatan keseluruhan sebanyak 69 percent dan 61 percent bagi dua alat itu, dengan ketepatan pada kategori hibrid, iaitu jenis penulisan yang sebenarnya dihasilkan oleh satu proses penyuntingan, jatuh hampir kepada sifar. Kajian yang sama juga mendedahkan satu bias kedua yang bergerak seiring dengan bias bahasa, iaitu ketepatan pada penulisan saintifik adalah 28 to 38 percentage points lebih rendah berbanding pada penulisan bidang kemanusiaan.

Tiada satu pun dapatan ini berkaitan dengan satu produk yang cacat. Dua seni bina pengesan yang berbeza, diuji tiga tahun apart pada korpus yang berbeza oleh pasukan penyelidik yang berbeza, terus menghasilkan keputusan yang sama: penulisan yang dibentuk oleh konvensyen genre atau oleh bahasa kedua berada lebih dekat dengan apa yang alat ini panggil buatan mesin berbanding penulisan yang bukan begitu. alat percuma TextPulse membolehkan penulis menyemak profil statistik yang sama sebelum mana-mana daripadanya sampai ke pengesan institusi.

Bukti Bebas bahawa Jurang Itu Benar, Bukan Artifak Ujian

Masalah pertama dengan keputusan TOEFL ialah boleh dihujahkan bahawa ia hanya terpakai pada satu kajian perintis kecil tahun 2023. Perkara ini dijawab oleh pasukan penyelidik yang sama dalam satu lagi kajian menggunakan data yang langsung tiada kaitan dengan pengesan. Mereka meneliti 1,574 kertas yang diterima ke ICLR 2023, sebuah persidangan pembelajaran mesin utama, dengan mengehadkan sampel kepada abstrak yang dihantar dan disemak sebelum ChatGPT wujud.

Penulis yang berpangkalan di negara-negara yang bahasa Inggeris bukan bahasa utama menulis abstrak dengan perplexity yang jauh lebih rendah berbanding penulis yang berpangkalan di negara-negara penutur asli bahasa Inggeris, dan perbezaan itu kekal walaupun selepas mengawal sejauh mana setiap kertas dinilai tinggi oleh penilai. Sampel ini tidak mungkin telah dibentuk oleh sesiapa yang cuba berbunyi lebih atau kurang seperti chatbot. ChatGPT tinggal tiga bulan lagi sebelum pelancaran apabila tempoh penghantaran ditutup. Jurang perplexity antara penulisan akademik penutur asli dan bukan penutur asli bukanlah sesuatu yang dicipta oleh pengesan. Ia adalah sesuatu yang mereka warisi.

Satu analisis statistik 2026 tentang pengesanan AI sebagai masalah ujian menawarkan versi formal bagi kesimpulan yang sama. Setiap kali sekumpulan penulis menghasilkan bahasa yang bertindih, secara agregat, dengan output AI yang tipikal, mana-mana pengesan yang benar-benar berkuasa untuk mengesan teks yang ditulis AI mesti membawa kadar positif palsu yang lebih tinggi khusus untuk kumpulan itu, satu sifat matematik bagi pengujian populasi yang pelbagai dan bukannya kecacatan dalam mana-mana satu alat. Penulis bahasa Inggeris bukan penutur asli ialah kes yang paling jelas didokumentasikan bagi pertindihan yang tepat seperti itu.

Apa Maknanya Ini untuk Penulis dalam Bahasa Kedua

Semua ini bukan hujah untuk menulis kurang seperti diri sendiri. Ini ialah sebab untuk mengetahui apa yang sebenarnya diukur sebelum skor tiba. Pengesan yang membaca prosa anda sebagai boleh diramal sedang menangkap sifat statistik sebenar penulisan bahasa kedua, bukan bukti bahawa anda menggunakan alat yang tidak anda gunakan.

Penyelidik Stanford yang menjalankan kajian asal menyatakan implikasi yang tidak selesa daripada dapatan mereka sendiri: pelarasan kosa kata yang sama yang menurunkan risiko positif palsu juga merupakan jenis semakan yang mungkin diingini oleh penulis atas sebab yang sama sekali berasingan, frasa yang lebih jelas, kata yang lebih tepat, tanpa mengira sebarang pengesan. Halaman TextPulse untuk penulis akademik ESL menerangkan rupa semakan seperti itu pada ayat sebenar, berasingan daripada apa-apa yang berkaitan dengan skor pengesanan.

Pengesan yang lebih baharu mula mengambil kira corak ini secara eksplisit. Pangram, salah satu peserta komersial yang lebih terkini, menyatakan dalam dokumentasi teknikalnya sendiri bahawa pengelasnya tidak berat sebelah terhadap penulis bahasa Inggeris bukan penutur asli, walaupun dakwaan itu datang daripada vendor dan bukannya daripada ujian bebas. penyemak perplexity percuma menunjukkan ukuran asas yang sama yang dikira oleh mana-mana alat ini daripada sesuatu tulisan, tanpa menghantar draf itu ke mana-mana terlebih dahulu.

Dua pendamping praktikal berada dalam kelompok yang sama: bila hendak menggunakan a, an dan the, yang merupakan sumber tunggal paling lazim bagi corak ini, dan cara kedengaran semula jadi dalam penulisan akademik bahasa Inggeris secara lebih umum.

Penyelidikan terus terkumpul ke arah yang sama dua tahun kemudian, merentas pasukan yang berbeza, pengesan yang berbeza, dan reka bentuk ujian yang berbeza. Apa yang tidak bergerak seiring ialah tindak balas institusi yang diterima secara meluas, iaitu mengaudit sesuatu pengesan terhadap pelbagai penulis sebelum mempercayakannya kepada mana-mana seorang daripada mereka, bukannya selepas seorang pelajar tertentu sudah pun dituduh. Sehingga perkara itu menjadi rutin, beban untuk membuktikan bahawa satu isyarat palsu adalah salah jatuh tepat pada penulis yang penyelidikan ini katakan paling berkemungkinan menerimanya.

XLinkedInFacebook

Soalan Lazim

Pengesan AI berat sebelah terhadap penutur bukan asli ialah dapatan yang telah disemak rakan sebaya, bukan spekulasi. Kajian Stanford 2023 mendapati tujuh pengesan GPT yang digunakan secara meluas salah mengelaskan purata 61.22 peratus esei TOEFL sebenar sebagai dijana AI, manakala membaca esei penutur asli dengan betul hampir setiap kali.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Pengesan AI Berat Sebelah terhadap Penutur Bukan Asli | TextPulse.ai