AI Detection

Mengapa Pengesan AI Berat Sebelah Terhadap Penulis Bahasa Inggeris Bukan Penutur Asli

Kajian Stanford 2023 mendapati pengesan AI tersalah membaca penulisan Bahasa Inggeris bukan penutur asli yang fasih sebagai dijana mesin pada kadar yang jauh lebih tinggi berbanding penulisan penutur asli. Berikut ialah mekanisme di sebalik jurang itu, dan apa yang berlaku apabila esei yang sama ditulis semula dengan kosa kata yang lebih kaya.

Dikemas kini pada 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

Pengesan AI yang berat sebelah terhadap penutur bukan asli bukanlah aduan yang subjektif. Satu kajian Stanford 2023 yang telah melalui semakan rakan sebaya mengukurnya secara langsung. Para penyelidik menjalankan tujuh pengesan GPT yang digunakan secara meluas terhadap 91 esei TOEFL sebenar yang ditulis oleh penutur bahasa Inggeris bukan asli dan 88 esei yang ditulis oleh murid darjah lapan di Amerika, kemudian membandingkan skor bagi setiap kumpulan.

Pengesan itu membaca esei darjah lapan dengan betul hampir setiap kali. Pada esei TOEFL, yang ditulis oleh orang dewasa yang telah pun lulus peperiksaan kecekapan bahasa Inggeris peringkat siswazah, tujuh alat yang sama menghasilkan kadar positif palsu purata sebanyak 61.22 percent. Lapan puluh sembilan daripada sembilan puluh satu esei, hampir 98 percent, ditandai sebagai dijana AI oleh sekurang-kurangnya satu daripada tujuh alat itu.

Gambaran keseluruhan TextPulse tentang bukti yang lebih luas mengenai ketepatan pengesan AI merangkumi dapatan utama itu dan tindakan undang-undang yang kemudiannya berpunca daripadanya. Perkara yang hampir diabaikan di kebanyakan tempat apabila kajian itu dirujuk ialah mekanismenya, mengapa prosa penutur bahasa Inggeris peringkat siswazah pada asalnya dibaca sebagai hasil mesin, dan apa yang berubah apabila ia berhenti dibaca begitu.

Pengesan AI yang Berat Sebelah terhadap Penutur Bukan Asli: Mekanismenya

Seorang pengesan tidak pernah membaca makna. Ia membaca sejauh mana boleh diramalkan setiap perkataan, berdasarkan perkataan yang datang sebelumnya, dan memberikan skor rendah kepada sesuatu petikan apabila model itu boleh meneka sebahagian besar daripadanya lebih awal. Kepelbagaian leksikal, iaitu sejauh mana luasnya kosa kata yang digunakan oleh penulis berbanding mengulangi set perkataan yang lebih kecil dan selamat, dan kebolehramalan sintaksis, iaitu sejauh mana struktur ayat mengikut pola paling lazim bagi bahasa itu berbanding mempelbagaikannya, ialah dua sifat penghasilan bahasa yang menurunkan skor itu.

Perbezaan ini penting kerana kedua-duanya muncul secara berbeza pada halaman. Kepelbagaian leksikal merujuk kepada kata-kata itu sendiri: seorang penulis yang menggunakan 'obtain,' 'acquire,' dan 'secure' dalam tiga ayat yang berbeza kelihatan lebih pelbagai daripada seorang yang menulis 'get' tiga kali, walaupun ayat-ayat itu selainnya sama. Kebolehramalan sintaksis merujuk kepada struktur: subjek, kata kerja, objek, diulang berulang kali, bukannya ayat yang bermula dengan klausa subordinat atau berakhir dengan perkataan yang tidak dijangka. Seorang penulis bahasa kedua yang bekerja dalam keadaan peperiksaan mempunyai segala sebab untuk menggunakan versi yang lebih selamat bagi kedua-duanya.

Penulisan bahasa kedua secara konsisten menunjukkan kurang bagi kedua-duanya, dan bukan sebagai kekurangan. Seorang penulis yang beroperasi dalam bahasa tambahan bergantung pada kosa kata dan pola ayat yang paling mungkin betul, kerana tersalah meneka membawa kos yang lebih besar apabila bahasa itu belum sepenuhnya automatik. Kertas Stanford yang mendokumentasikan bias pengesan memetik satu badan penyelidikan linguistik gunaan tentang pola yang tepat ini, yang telah ditetapkan lama sebelum pengesan AI wujud: kekayaan leksikal yang berkurang, kepelbagaian leksikal yang berkurang, dan struktur ayat yang lebih ringkas didokumenkan, boleh diukur sebagai ciri penulisan bahasa kedua, bukannya petanda perkara lain.

Jurang antara penulisan penutur asli dan bukan penutur asli ini muncul sebagai perbezaan perplexity, ukuran yang sama yang dijalankan oleh pengesan untuk menentukan sama ada sesuatu petikan dijana oleh mesin. Perplexity yang lebih rendah dibaca sebagai lebih mirip mesin tanpa mengira siapa yang menghasilkannya, dan penulisan bukan penutur asli berada lebih rendah pada skala itu atas sebab yang tiada kaitan dengan chatbot. Sama ada jurang itu benar-benar yang mendorong pengesan, bukannya kebetulan, ialah soalan yang boleh diuji. Pasukan Stanford mengujinya secara langsung.

Apa yang Berlaku Apabila Esei yang Sama Ditulis Semula Dengan Kosa Kata yang Lebih Kaya

Penyelidik mengambil 91 esei TOEFL yang sama yang telah mencetuskan kadar positif palsu purata 61.22 percent dan meminta ChatGPT menyemaknya semula menggunakan satu arahan: "Enhance the word choices to sound more like that of a native speaker." Tiada apa-apa tentang kandungan, hujah, atau tatabahasa diarahkan untuk diubah. Selepas satu suntingan itu, kadar positif palsu purata merentasi tujuh pengesan yang sama jatuh kepada 11.77 percent, penurunan hampir lima puluh mata peratusan, dan bilangan esei yang ditandakan sebulat suara oleh setiap pengesan jatuh daripada lapan belas kepada satu.

Kemudian penyelidik menjalankan eksperimen itu secara terbalik. Mereka mengambil 88 esei darjah lapan penutur asli, yang pada asalnya dinilai dengan betul oleh pengesan hampir setiap kali, dan meminta ChatGPT memudahkan pilihan kata mereka seolah-olah ditulis oleh penutur bukan asli. Kadar positif palsu purata pada esei penulis asli yang sama itu melonjak daripada 5.19 percent kepada 56.65 percent. Esei tersebut tidak berubah dari segi pengarang. Hanya kosa kata yang berubah, dan pengesan mengikut kosa kata itu.

Perplexity bergerak seiring dengan kadar salah klasifikasi dalam kedua-dua arah: ia meningkat dengan ketara apabila esei TOEFL diperkaya, dan menurun dengan ketara apabila esei darjah lapan dipermudahkan. Penulis membuat kesimpulan yang tegas daripada ini: apa yang sebenarnya ditanggapi oleh pengesan itu bukanlah pengarang. Ia ialah pilihan kata, satu ciri yang boleh dibawa oleh kosa kata mana-mana penulis tanpa mengira di mana mereka belajar bahasa Inggeris.

Sejauh Mana Bias Ini Konsisten Merentasi Pengesan yang Berbeza

Ketujuh-tujuh pengesan itu tidak banyak bersetuju, kecuali tentang arah kesilapan itu berlaku. Setiap satu daripadanya menandakan esei TOEFL jauh lebih kerap berbanding esei darjah lapan, tetapi dengan jurang yang sangat berbeza.

PengesanKadar positif palsu, esei TOEFLKadar positif palsu, esei penutur asli
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Ini ialah angka 2023, diukur pada alat sebagaimana ia wujud ketika itu. Beberapa daripadanya sejak itu telah berubah sepenuhnya: OpenAI menutup pengesan miliknya sendiri pada Julai 2023, empat bulan selepas ujian ini, selepas mendapati ia hanya menandakan dengan betul 26 peratus teks sebenar yang ditulis AI sambil masih salah melabel 9 peratus tulisan manusia. Apa yang tidak berubah ialah arah jurangnya. Satu penanda aras bias yang lebih luas, dibina khusus untuk menguji pengesan merentas kategori demografi dan linguistik, diterbitkan pada Disember 2025 dan dijalankan terhadap empat alat sumber terbuka yang lebih baharu, masih melaporkan recall yang secara konsisten lebih rendah bagi kumpulan penulis yang kurang diwakili.

Humanisasikan kertas anda sendiri

Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.

Mula secara percuma

Adakah Bias Ini Masih Muncul dalam Pengesan yang Lebih Baharu?

Kajian Stanford kini sudah beberapa generasi AI lamanya, dan penulisnya sendiri menyatakan had tersebut: sampel perintis yang kecil, dan pengesan yang dibina kebanyakannya berdasarkan GPT-2, model yang jauh lebih kecil dan lebih lama daripada yang menggerakkan pengesanan hari ini. Ini menimbulkan soalan yang wajar. Adakah teknologi yang lebih baik telah menutup jurang itu?

Ujian khusus yang paling terkini mengatakan belum lagi. Dalam satu kajian Februari 2026 dari Sultan Qaboos University, penyelidik menguji dua pengesan komersial semasa, Turnitin dan Originality, terhadap 192 teks yang menggabungkan penulisan pelajar EFL tulen sebelum ChatGPT, penulisan manusia profesional, teks yang dijana AI, dan teks hibrid manusia-AI. Hasil menunjukkan ketepatan keseluruhan pada 69 peratus dan 61 peratus bagi dua alat itu, dengan ketepatan pada kategori hibrid, iaitu jenis penulisan yang sebenarnya dihasilkan oleh satu pusingan penyuntingan, jatuh hampir kepada sifar. Kajian yang sama juga mendedahkan satu bias kedua yang bergerak seiring dengan bias bahasa, iaitu ketepatan pada penulisan saintifik adalah 28 hingga 38 mata peratusan lebih rendah berbanding pada penulisan bidang kemanusiaan.

Tiada satu pun dapatan ini berkaitan dengan satu produk yang cacat. Dua seni bina pengesan yang berbeza, diuji tiga tahun apart pada korpus yang berbeza oleh pasukan penyelidik yang berbeza, terus menghasilkan keputusan yang sama, iaitu penulisan yang dibentuk oleh konvensyen genre atau oleh bahasa kedua berada lebih dekat dengan apa yang alat ini sebut sebagai buatan mesin berbanding penulisan yang bukan demikian. alat percuma TextPulse membolehkan penulis menyemak profil statistik yang sama sebelum apa-apa daripadanya sampai ke pengesan institusi.

Bukti Bebas bahawa Jurang Itu Sebenar, Bukan Artifak Ujian

Masalah pertama dengan keputusan TOEFL ialah boleh dihujahkan bahawa ia hanya terpakai pada satu kajian rintis kecil 2023. Perkara ini dijawab oleh pasukan penyelidik yang sama dalam satu kajian lain menggunakan data yang langsung tiada kaitan dengan pengesan. Mereka meneliti 1,574 kertas yang diterima ke ICLR 2023, sebuah persidangan pembelajaran mesin utama, dengan mengehadkan sampel kepada abstrak yang dihantar dan disemak sebelum ChatGPT wujud.

Pengarang yang berpangkalan di negara-negara yang bahasa Inggeris bukan bahasa utama menulis abstrak dengan perplexity yang jauh lebih rendah berbanding pengarang yang berpangkalan di negara-negara penutur asli bahasa Inggeris, dan perbezaan itu kekal walaupun selepas mengawal sejauh mana setiap kertas dinilai tinggi oleh penilai. Sampel ini tidak mungkin dibentuk oleh sesiapa yang cuba berbunyi lebih atau kurang seperti chatbot. ChatGPT masih tiga bulan sebelum pelancaran apabila tempoh penghantaran ditutup. Jurang perplexity antara penulisan akademik penutur asli dan bukan penutur asli bukanlah sesuatu yang dicipta oleh pengesan. Ia ialah sesuatu yang mereka warisi.

Satu analisis statistik 2026 tentang pengesanan AI sebagai masalah ujian menawarkan versi formal bagi kesimpulan yang sama. Setiap kali sekumpulan penulis menghasilkan bahasa yang, secara agregat, bertindih dengan output AI tipikal, mana-mana pengesan yang benar-benar berupaya menangkap teks yang ditulis AI mesti membawa kadar positif palsu yang lebih tinggi khusus untuk kumpulan itu, satu sifat matematik bagi pengujian populasi yang pelbagai, bukannya kecacatan pada mana-mana alat tertentu. Penulis bahasa Inggeris bukan penutur asli ialah kes yang paling jelas didokumentasikan bagi pertindihan yang tepat seperti itu.

Apa Maknanya bagi Penulis dalam Bahasa Kedua

Semua ini bukan hujah untuk menulis kurang seperti diri sendiri. Ia ialah sebab untuk mengetahui apa yang sebenarnya diukur sebelum sesuatu skor tiba. Pengesan yang membaca prosa anda sebagai boleh diramal sedang menangkap sifat statistik sebenar penulisan bahasa kedua, bukan bukti bahawa anda menggunakan alat yang tidak anda gunakan.

Penyelidik Stanford yang menjalankan kajian asal menyatakan implikasi yang tidak selesa daripada dapatan mereka sendiri, pelarasan kosa kata yang sama yang menurunkan risiko positif palsu juga merupakan jenis semakan yang mungkin diingini oleh seorang penulis atas sebab yang sama sekali berasingan, frasa yang lebih jelas, kata yang lebih tepat, tanpa mengira apa-apa pengesan. Halaman TextPulse untuk penulis akademik ESL menerangkan rupa semakan seperti itu pada ayat sebenar, terpisah daripada apa-apa yang berkaitan dengan skor pengesanan.

Pengesan yang lebih baharu mula mengambil kira corak ini secara eksplisit. Pangram, salah satu peserta komersial yang lebih terkini, menyatakan dalam dokumentasi teknikalnya sendiri bahawa pengelasnya tidak berat sebelah terhadap penulis bahasa Inggeris bukan penutur asli, walaupun dakwaan itu datang daripada vendor dan bukannya daripada ujian bebas. Sebuah penyemak perplexity percuma menunjukkan ukuran asas yang sama yang dikira oleh mana-mana alat ini daripada sesuatu tulisan, tanpa menghantar draf itu ke mana-mana terlebih dahulu.

Dua pendamping praktikal berada dalam kelompok yang sama, bila hendak menggunakan a, an dan the, yang merupakan sumber tunggal paling lazim bagi corak ini, dan cara kedengaran semula jadi dalam penulisan akademik bahasa Inggeris secara lebih umum.

Penyelidikan terus terkumpul ke arah yang sama dua tahun kemudian, merentasi pasukan yang berbeza, pengesan yang berbeza, dan reka bentuk ujian yang berbeza. Apa yang belum bergerak seiring ialah tindak balas institusi yang diterima secara meluas, iaitu mengaudit sesuatu pengesan terhadap pelbagai penulis sebelum mempercayainya untuk mana-mana seorang daripada mereka, bukannya selepas seorang pelajar tertentu sudah pun dituduh. Sehingga perkara itu menjadi rutin, beban untuk membuktikan bahawa satu isyarat palsu itu salah jatuh tepat pada penulis yang penyelidikan ini katakan paling berkemungkinan menerimanya.

XLinkedInFacebook

Soalan Lazim

Pengesan AI berat sebelah terhadap bukan penutur asli ialah dapatan yang disemak rakan sebaya, bukan spekulasi. Kajian Stanford 2023 mendapati tujuh pengesan GPT yang digunakan secara meluas salah mengelaskan purata 61.22 peratus esei TOEFL sebenar sebagai dijana AI, manakala membaca esei penutur asli dengan betul hampir setiap kali.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Kekal dikemas kini tentang pemanusiaan AI

Dapatkan petua tentang penulisan akademik, pengesanan AI, dan pemanusiaan dihantar ke peti masuk anda.

Tiada spam. Boleh berhenti melanggan pada bila-bila masa.