AI Detection

Adakah Pengesan AI Tepat? Positif Palsu dan Bias

Vendor menerbitkan kadar positif palsu di bawah 1 peratus. Penyelidik bebas yang menguji pengesan yang sama pada penulisan bahasa Inggeris bukan penutur asli mendapati kadar melebihi 60 peratus. Berikut ialah bukti yang ditunjukkan.

Dikemas kini pada 13 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin mendakwa bahawa kadar positif palsu mereka kurang daripada 1%. Sekumpulan penyelidik bebas menguji pelbagai pengesan pada julat sampel penulisan yang lebih luas daripada penutur bahasa Inggeris bukan penutur asli. Mereka mendapati kadar positif palsu purata melebihi 60% bagi jenis penulisan yang sama itu. Kedua-dua angka ini adalah nyata, kedua-duanya diterbitkan, dan kedua-duanya berkaitan dengan pengesan yang dijual kepada pasaran yang sama. Adakah pengesan AI tepat? Ia bergantung pada populasi yang anda uji, pengesan yang anda gunakan, dan bagaimana vendor anda mentakrifkannya pada asalnya.

Catatan ini tidak akan menerangkan semula bagaimana sesuatu pengesan mengira skor itu. Mekanisme, perplexity, kebarangkalian token, cara pengelas dilatih, telah dihuraikan secara terperinci di tempat lain, dan elok dibaca dahulu jika anda belum melakukannya. Yang penting di sini ialah apa yang berlaku setelah skor itu wujud, kekerapan ia tersalah, penulisan siapa yang paling kerap tersalah dituduh, dan apa sebenarnya kos bagi tuduhan palsu kepada seseorang yang tidak melakukan apa-apa kesalahan.

Adakah pengesan AI tepat?

Tidak secara konsisten, dan jurang antara dakwaan pemasaran dan ujian bebas telah didokumentasikan dengan baik. Sekumpulan penyelidik yang diketuai oleh Debora Weber-Wulff menerbitkan dapatan mereka tentang 14 alat pengesanan, termasuk 12 percuma dan dua komersial, yang diuji terhadap gabungan teks manusia dan ChatGPT pada tahun 2023. Mereka mendapati bahawa tiada satu pun daripada alat ini tepat atau boleh dipercayai, dengan bias terbina dalam untuk melabel teks mesin sebagai manusia dan bukannya sebaliknya. Dua daripada alat komersial yang termasuk dalam ujian ini ialah Turnitin dan PlagiarismCheck. Semua alat dalam ujian ini menunjukkan prestasi yang lebih buruk apabila teks itu diparafrasa.

Tetapi dua tahun kemudian, keadaan tidak statik. Satu kertas kerja daripada Booth School, University of Chicago, oleh Brian Jabarian dan Alex Imas, menguji tiga pendatang baharu, Pangram, GPTZero dan Originality.ai, serta satu pesaing sumber terbuka, dengan hampir 2,000 karya tulisan manusia daripada blog, berita, ulasan dan fiksyen. Dalam keadaan ujian yang dikawal, alat terbaik dalam kumpulan itu tidak pernah jatuh di bawah ketepatan 99.8 peratus dan mengekalkan kadar positif palsunya pada tahap yang rendah. Model sumber terbuka itu berprestasi sebaik peneka rawak. Keadaan memang telah menjadi lebih baik. Semacam. Sedikit sahaja.

Tetapi masalahnya ialah perkataan dikawal. Petikan penanda aras adalah bersih, lengkap dan dihasilkan di bawah keadaan yang diketahui. Esei yang dihantar bukanlah mana-mana daripada perkara itu secara konsisten. Hasil dunia sebenar mungkin tidak sama dengan hasil makmal, seperti yang telah dinyatakan secara terbuka oleh ketua pegawai produk Turnitin sendiri, walaupun itu merupakan pengakuan yang jarang dan berguna daripada seorang vendor. Bahagian seterusnya meletakkan angka vendor bersebelahan dengan angka bebas supaya jurang itu kelihatan, bukannya sekadar didakwa.

Tuntutan vendor berbanding ujian bebas

Jadual di bawah menyelaraskan apa yang didakwa oleh empat pengesan tentang diri mereka dengan apa yang diukur oleh penyelidik bebas apabila mereka menguji alat itu secara langsung. Baca dua lajur tengah bersama-sama, bukan lajur vendor sahaja.

PengesanKetepatan yang didakwa oleh vendorDiperhatikan secara bebasApa yang dikatakan vendor tentang positif palsu
TurnitinAmbang keyakinan 98% sebelum ditandakan, kurang daripada 1% positif palsu pada tahap dokumenKira-kira 80% ketepatan, yang terbaik daripada 12 alat dalam perbandingan 2023, pada versi awal alat tersebutKurang daripada 1% pada tahap dokumen melebihi ambang 20% ditulis oleh AI, kira-kira 4% pada tahap ayat
GPTZero95.7% pengesanan teks AI pada kadar positif palsu 1% dalam penanda aras RAID yang bebas96% ketepatan pada petikan pendek, kadar positif palsu di bawah 1% dalam kajian University of Chicago Booth 2025Melaporkan kadar positif palsu 1% pada penanda aras RAID
Originality.ai99% ketepatan, kadar positif palsu 0.5% (model Lite), 1.5% (model Turbo)Kadar positif palsu di bawah 1%, tetapi terlepas 10% hingga 40% teks yang ditulis oleh AI dalam kajian Booth yang samaMenerbitkan angka positif palsu yang berasingan mengikut tahap model
PangramKadar ralat yang dikatakannya lebih daripada 38 kali lebih rendah daripada alat pesaing, menyatakan tiada bias terhadap penulis bahasa Inggeris bukan penutur asliKetepatan tidak pernah di bawah 99.8%, kadar positif palsu hampir sifar, dalam kajian BoothMenyatakan kadar positif palsu hampir sifar merentasi 10 domain teks dan 8 model bahasa

Dua perkara menonjol. Pertama, semua angka vendor berasal daripada makmal yang dikawal oleh vendor dan angka Booth berasal daripada penyelidik yang tidak mempunyai apa-apa untuk dijual. Kedua, Turnitin langsung tidak muncul dalam lajur tengah itu kerana kajian 2025 tidak mengujinya. Dalam jadual, angka bebasnya berdasarkan perbandingan 2023 yang lebih awal tetapi dilakukan pada versi alat yang lebih lama, jadi ingat perkara ini apabila melihat jadual itu sebagai perbandingan yang setara.

Sejauh manakah ketepatan pengesanan AI Turnitin?

Turnitin tidak menerbitkan satu angka ketepatan. Sebaliknya, ia menerbitkan satu ambang dan satu pertukaran. Syarikat itu telah menyatakan bahawa ia hanya menandakan sesuatu dokumen apabila ia 98 peratus yakin bahawa bahagian yang ditandakan itu ditulis oleh AI, dan bahawa ambang ini ialah apa yang mengekalkan kadar positif palsu pada peringkat dokumen di bawah 1 peratus. Turnitin telah menganggarkan bahawa ia mengesan kira-kira 85 peratus penulisan yang dibantu AI, sambil membiarkan selebihnya melepasi secara sengaja daripada mengambil risiko tuduhan yang salah.

Peratus sebenar positif palsu yang dikembalikan oleh Turnitin pada peringkat ayat, iaitu apabila antara muka menyerlahkan baris tertentu dan bukannya keseluruhan dokumen, sebenarnya lebih hampir kepada 4 peratus. Ini ialah angka yang wajar diketahui jika seorang profesor mengambil tangkap layar satu perenggan yang ditandakan dan bukannya skor keseluruhan dokumen, kerana ayat yang diserlahkan membawa kebarangkalian yang bermakna lebih tinggi untuk menjadi salah berbanding skor dokumen di sebelahnya.

Perlu juga diperhatikan bahawa Turnitin telah mengakui jurang ini secara langsung. Mereka mendapati bahawa keputusan dunia sebenar yang pertama, khususnya bagi dokumen yang lebih pendek, mempunyai kadar positif palsu yang lebih tinggi daripada yang dijangka berdasarkan ujian makmal mereka. Jadi mereka melaraskan panjang minimum dokumen untuk dinilai daripada 150 kepada 300 patah perkataan. Itu ialah vendor yang melaraskan produknya sendiri kerana angka yang diterbitkan tidak bertahan di luar makmal, yang mengatakan banyak perkara seperti mana-mana kajian bebas.

Apa yang sebenarnya dibayar oleh positif palsu kepada seorang pelajar

Ini berlaku kepada seorang pelajar MBA eksekutif di School of Management Yale. Pelajar itu didakwa dengan satu pelanggaran, dalam erti kata yang paling literal. Pengesan yang terlibat ialah GPTZero. Peperiksaan akhir pelajar itu dalam kursus kewangan telah ditandakan oleh seorang pembantu pengajar yang berpendapat bahawa penulisannya panjang dan terperinci dengan tanda baca dan tatabahasa yang hampir sempurna. Dan profesor tertentu ini menjalankannya melalui GPTZero, yang menilai jawapan itu sebagai berkemungkinan dijana AI.

Beliau gagal kursus itu dan digantung pengajiannya selama setahun. Tuntutan mahkamahnya, yang difailkan di mahkamah persekutuan pada Februari 2025, mendakwa bahawa dasar Yale sendiri mengehadkan penggunaan alat seperti GPTZero atas sebab inilah, iaitu kadar positif palsu yang didokumenkan terhadap penutur bahasa Inggeris bukan penutur asli, dan bahawa beliau menggunakannya bertentangan dengan dasar itu. Pemfailannya juga memetik bahawa GPTZero memberikan skor 100 peratus dijana AI pada penulisan akademik oleh bekas presiden universiti Yale sendiri dan dekan sekolah perniagaan.

Hakim enggan mengeluarkan injunksi awal pada Mei 2025. Kes itu masih belum diselesaikan, setakat saya menulis ini. Plaintif, seorang warganegara Perancis, mendakwa bahawa bias yang sama yang diketahui terhadap penutur bahasa Inggeris bukan penutur asli menyebabkan penulisannya berprestasi seperti itu. Itulah yang kami lihat dalam bahagian seterusnya. Apa yang tidak dipertikaikan ialah kosnya, setahun hilang daripada program ijazah, gred gagal, perbelanjaan guaman, dan beberapa bulan bergelut tentang skor dan bukannya memperoleh ijazah. Kadar positif palsu 1 peratus kedengaran kecil sehingga populasi yang besar menjadikannya sesuatu yang khusus kepada seseorang.

Humanisasikan kertas anda sendiri

Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.

Mula secara percuma

Ciri Penulisan Mana yang Menyebabkan Teks Manusia Kelihatan Seperti Dijana Mesin

Empat jenis penulisan biasa membawa risiko paling tinggi, dan tiada satu pun melibatkan seseorang melakukan apa-apa yang salah. Dokumen pendek, penulisan yang sangat berformula, bahan yang dipetik atau berasaskan templat, dan penulisan yang telah disunting dengan teliti semuanya cenderung mendapat skor sebagai lebih dapat diramal daripada prosa yang digubah secara bebas, iaitu satu-satunya sifat yang sebenarnya diukur oleh setiap pengesan. penyemak burstiness percuma mengukur variasi yang sama itu secara langsung, yang merupakan cara lebih cepat untuk melihat coraknya daripada membaca huraian mengenainya.

Sesetengah genre bersifat formulaik secara reka bentuk. Bahagian kaedah, laporan makmal, surat iringan standard dan ulasan literatur semuanya memberi ganjaran kepada frasa konvensional berbanding frasa yang inventif, kerana konvensi itulah yang menjadikan dokumen itu boleh digunakan oleh pembacanya. Penyelidik menguji perkara ini secara langsung pada penulisan sebenar: mereka menjalankan 14,400 abstrak jurnal yang diterbitkan antara 1980 dan 2023, tahun-tahun sebelum sebarang model bahasa besar wujud, melalui pengesan yang tersedia secara umum. Sehingga 8 peratus ditandai sebagai dijana AI tanpa mengira tahun penerbitan, dan abstrak New England Journal of Medicine ditandai pada 10.24 peratus, kadar positif palsu tertinggi daripada lima jurnal yang diuji.

Ujian itu tidak mungkin mengesan apa-apa tentang ChatGPT, kerana ChatGPT tidak wujud untuk kebanyakan tahun yang disampelkannya. Ia mengesan genre. Secara lebih formal, seperti yang akan dinyatakan oleh analisis statistik 2026 terhadap masalah pengesanan, tiada cara untuk membina pengesan yang akan membezakan antara ayat yang boleh diramal kerana ayat itu ditulis oleh perisian dan ayat yang boleh diramal kerana itulah jenis ayat yang anda tulis dalam gennya. Kedua-duanya kelihatan sama sepenuhnya dari luar.

Penyuntingan yang berat mendorong ke arah yang serupa. Draf pertama membawa ketidakteraturan khusus penulis, susunan kata yang ganjil, ayat yang menjadi panjang kerana pemikiran itu juga panjang. Satu pusingan semakan pruf yang menyeluruh, khususnya yang dijalankan melalui alat lain, cenderung melicinkan tepat ketidakteraturan itu. Perbandingan bebas terbesar setakat ini terhadap alat pengesanan menguji 14 daripadanya dan mendapati bahawa ketepatan merosot lebih jauh, bagi setiap alat, setelah teks sampel diparafrasa atau diterjemahkan secara mesin.

Ciri penulisanMengapa ia menurunkan ketidakbolehramalan yang kelihatan pada sesuatu dokumenApakah yang ditunjukkan oleh bukti
Penyerahan pendekTeks yang lebih sedikit meninggalkan ruang yang lebih kecil untuk variasi semula jadi yang membezakan ritma manusia daripada ritma mesinSkor pada dokumen pendek berubah lebih banyak bergantung pada kekuatan beberapa ayat yang luar biasa
Penulisan formulaik atau khusus disiplinKonvensyen genre memberi ganjaran kepada frasa yang dijangka berbanding yang inventif14,400 abstrak jurnal sebelum ChatGPT (1980 hingga 2023) masih mencetuskan sehingga 8% positif palsu; abstrak satu jurnal mencapai 10.24%
Draf yang banyak disunting atau diparafrasaProses pengemasan menghaluskan ketidakteraturan individu yang dibaca oleh pengesan sebagai ciri manusiaPerbandingan bebas terhadap 14 alat mendapati ketepatan menurun lagi selepas parafrasa atau terjemahan mesin
Bahan yang dipetik atau berasaskan templatPetikan yang dipetik membawa tandatangan statistik sumbernya, bukan penulis yang memetiknyaPengesan yang tidak mengecualikan petikan menilai dokumen sekeliling berdasarkan teks yang dipinjam

Mengapa pengesan AI salah mengelaskan penutur bahasa Inggeris bukan penutur asli?

Dengan teruk, dan pada kadar yang sangat besar. Itulah kesimpulan kajian yang mula-mula memberikan angka mengenainya. Penyelidik Stanford menjalankan tujuh pengesan GPT yang digunakan secara meluas terhadap 91 esei TOEFL oleh penutur bahasa Inggeris bukan penutur asli dan 88 esei oleh murid tingkatan lapan di US. Pengesan tersebut membaca esei tingkatan lapan dengan betul hampir setiap kali. Apabila melibatkan esei TOEFL, yang ditulis oleh orang dewasa yang cukup fasih untuk mengambil ujian bahasa Inggeris peringkat siswazah, pengesan tersebut mencatat kadar positif palsu purata sebanyak 61.3 peratus. Lapan puluh sembilan daripada 91 esei itu ditandai sebagai dijana oleh GPT oleh sekurang-kurangnya satu daripada tujuh pengesan; 18 daripada esei itu ditandai oleh kesemua tujuh pengesan.

Mekanisme ini sama seperti yang mengawal selebihnya pengesanan, perbendaharaan kata yang boleh diramal dan pembinaan ayat yang lebih ringkas dibaca sebagai perplexity yang rendah, dan perplexity yang rendah dibaca sebagai hasil mesin, tanpa mengira siapa yang memegang pena. Penulis yang bekerja dalam bahasa kedua bergantung pada frasa yang sudah mantap kerana itulah rupa sebenar kefasihan dalam bahasa tambahan, dan itulah tepatnya profil yang dibina oleh pengesan untuk dikesan.

Penulis dalam kedudukan itu tidak banyak dibantu oleh nasihat untuk sekadar menulis dengan lebih semula jadi, kerana semula jadi itulah yang telah ditandai. Halaman TextPulse untuk penulis akademik ESL menghuraikan dengan lebih mendalam pola frasa di sebalik risiko itu, termasuk apa yang mengubahnya tanpa mengubah makna ayat.

Ini bukan kes terpencil. Pada Disember 2025, satu penanda aras baharu dikeluarkan, yang secara eksplisit direka untuk menilai bias dalam pengesan ini. Ia merangkumi lebih 200,000 sampel merentasi pelbagai demografi dan bahasa. Walaupun diterbitkan dua tahun selepas kajian pertama Stanford dan melibatkan banyak versi model yang berbeza bagi pengesan yang sama, penanda aras ini mendedahkan bahawa bias terhadap English language learner masih wujud.

Keadaan ini tidak berlaku bagi semua vendor. Dokumentasi teknikal Pangram sendiri menyatakan bahawa pengelasnya tidak berat sebelah terhadap penutur bahasa Inggeris bukan natif. Para penyelidik Chicago Booth tidak menguji dakwaan ini secara bebas, tetapi ia menunjukkan bahawa generasi pengesan yang lebih baharu sedang dibina dengan mengambil kira masalah ini, bukannya mengabaikannya.

Jika anda mahu melihat kedudukan penulisan anda sendiri sebelum orang lain menilainya, penyemak perplexity percuma memberikan anda nombor asas yang sama seperti yang akan dikira oleh pengesan, tanpa menghantar apa-apa terlebih dahulu kepada institusi.

Siapa lagi yang ditandai, dan mengapa

Pertutur bahasa Inggeris bukan penutur asli menanggung risiko terdokumentasi yang paling besar, tetapi logik statistik yang sama turut menangkap penulisan lain. Pasukan Weber-Wulff mendapati bahawa kesemua 14 alat yang mereka uji menjadi kurang tepat apabila mereka menjalankannya pada teks yang telah diparafrasa, ini menggambarkan sebahagian yang bermakna daripada penulisan akademik yang telah melalui pembaca pruf, penyunting, atau tanda merah pensyarah sebelum sesiapa menjalankan pengesan ke atasnya.

Tiada satu pun daripada ini bermaksud bahawa nombor itu tidak bermakna, hanya bahawa ia memerlukan pengesahan sebelum ia bermakna apa-apa tentang seseorang yang tertentu. Jika anda mempunyai teks yang dibaca sebagai seragam, panjang ayat yang serupa, ritma yang serupa sepanjang teks, ia akan mendapat skor sebagai lebih mirip mesin tanpa mengira siapa yang menulisnya atau mengapa. Ini boleh diperiksa secara langsung menggunakan free burstiness checker dan bukannya diteka.

Satu kumpulan kedua yang kurang dibincangkan menghadapi masalah yang berkaitan. Para penyelidik membandingkan kira-kira 60,000 catatan Reddit, dibahagikan antara subset yang dikenal pasti sebagai kemungkinan ditulis oleh pengarang autistik dan sampel umum, dan menjalankan kedua-duanya melalui pengesan berasaskan GPT-2. Kedua-dua kumpulan kekal di bawah 2 percent secara keseluruhan yang dibenderakan, tetapi subset yang kemungkinan autistik dibenderakan pada kadar yang jauh lebih tinggi daripada sampel umum. Penulisan yang cenderung kepada frasa yang literal, berulang, dan berpola ketat, iaitu ciri yang terdokumentasi bagi beberapa gaya komunikasi autistik, menghasilkan tepat teks bervariasi rendah yang dibina untuk dikesan oleh pengesan.

Mengapa Skor yang Yakin Bukan Tuduhan yang Yakin

Kadar positif palsu kedengaran seolah-olah ia merujuk kepada kebarangkalian seorang pelajar yang dibenderakan sebagai masalah itu sebenarnya tidak bersalah. Tetapi tidak. Ia menerangkan bagaimana sesuatu ujian berfungsi untuk semua orang yang mengambilnya. Dan itu ialah soalan yang berbeza dengan jawapan yang berbeza, sama seperti mana-mana ujian saringan dalam perubatan atau keselamatan.

Analisis statistik Mac 2026 daripada seorang penyelidik Universiti Griffith menjelaskan matematik asas dengan terang. Anggap pengesanan AI sebagai ujian yang dikenakan ke atas populasi penulis pelajar, bukannya pada satu dokumen yang terasing, dan satu pertukaran timbul: setiap kali sebahagian daripada populasi itu menulis dengan cara yang secara semula jadi bertindih dengan output AI yang lazim, hampir dengan konvensi genre, hampir dengan julat pelajar bahasa kedua, mana-mana pengesan yang benar-benar berkuasa untuk menangkap karya yang ditulis oleh AI mesti tersilap pada sebahagian daripada bahagian yang bertindih itu. Ini bukan dakwaan bahawa pengesan tertentu dibina dengan buruk. Ini ialah sifat menguji populasi yang pelbagai dengan satu dokumen dan tanpa bukti lain.

Contoh ilustratif dalam kertas itu sendiri menunjukkan skala yang terlibat. Anggap 10 peratus daripada populasi pelajar menulis cukup hampir dengan output AI yang lazim, dan sebuah pengesan ditala untuk menangkap 80 peratus karya sebenar yang ditulis oleh AI. Matematik kemudian memerlukan kadar positif palsu purata sekurang-kurangnya 7.5 peratus merentasi populasi itu. Itu bukan kecacatan dalam kejuruteraan pengesan: itu ialah akibat langsung daripada sejauh mana penulisan kumpulan itu bertindih secara statistik dengan perkara yang dikesan.

Apabila diskalakan kepada sebuah universiti dengan 10,000 pelajar, had bawah itu sahaja membayangkan kira-kira 750 isyarat palsu merentasi populasi, satu akibat matematik daripada menguji populasi yang pelbagai terhadap satu dokumen tanpa bukti lain untuk ditimbang. Penulis kertas itu menjelaskan bahawa angka-angka khusus ini bersifat ilustratif, bukan diukur di institusi sebenar. Contoh itu menunjukkan bentuk masalah tersebut, bukannya ramalan khusus untuk mana-mana kampus tertentu.

Rupa dasar pengesanan AI yang boleh dipertahankan

Yale sudah mempunyai dasar yang dilaporkan mengehadkan alat seperti GPTZero, atas sebab yang hampir sama dengan yang dihuraikan dalam artikel ini: kadar positif palsu yang didokumenkan dan bias yang didokumenkan terhadap penulis bahasa Inggeris bukan penutur asli. Jadi ini bukanlah kisah tentang seorang pelajar yang malang, tetapi tentang satu peraturan sedia ada yang tidak dipatuhi. Apabila sesuatu dasar benar-benar menguatkuasakan perbezaan antara skor dan keputusan, maka skor menjadi satu input, bukannya keputusan.

  • Anggap skor sebagai satu input, bukan sekali-kali sebagai asas tunggal untuk penemuan salah laku
  • Dedahkan kadar positif palsu yang diterbitkan oleh alat itu kepada pelajar sebelum menggunakannya terhadap mereka
  • Gunakan lebih berhati-hati terhadap penyerahan yang pendek dan penulisan Bahasa Inggeris oleh penutur bukan asli, kedua-duanya merupakan titik lemah yang didokumentasikan
  • Jamin laluan untuk rayuan yang tidak memerlukan penafian statistik

Tiada satu pun daripada ini luar biasa. Ia lebih hampir kepada cara mana-mana satu bukti forensik sepatutnya diperlakukan di tempat lain, berguna, boleh disemak, dan tidak pernah mencukupi dengan sendirinya.

Bagi seorang penulis individu, prinsip yang sama terpakai sebelum skor wujud, bukannya selepas. Satu nombor, daripada mana-mana alat, ialah anggaran dan bukannya keputusan muktamad, dan memperlakukannya sebagai kepastian dalam mana-mana arah, selamat atau tertangkap, menuntut lebih daripada nombor itu daripada yang mampu disokongnya.

Alat AI humanizer tool milik TextPulse sendiri melaporkan Human Score berdasarkan logik yang sama, iaitu anggaran yang dikira daripada teks anda sendiri, bukan keputusan muktamad pengesan ke atasnya, berguna sebagai isyarat tentang bagaimana draf itu kini dibaca dan bukannya janji tentang apa yang akan dikatakan oleh mana-mana pengesan tertentu.

Soalan tentang ketepatan terbahagi kepada soalan yang lebih sempit, masing-masing dengan halamannya sendiri. Bukti khusus tentang kadar positif palsu Turnitin dan tentang ketepatan ZeroGPT dibincangkan secara berasingan. Jika skor telah pun digunakan terhadap anda, terdapat bahagian praktikal tentang apa yang perlu dilakukan apabila anda dituduh menggunakan AI, tentang bukti yang boleh anda kumpulkan untuk membuktikan bahawa anda tidak menggunakan AI, dan tentang menulis surat rayuan yang menjawab skor itu berdasarkan terma sendiri.

Nombor pada mana-mana laporan akan terus berubah apabila vendor melatih semula model mereka dan penyelidik terus mengujinya terhadap kes yang lebih sukar. Tetapi apa yang tidak sepatutnya berubah ialah kebiasaan di bawahnya, baca skor sebagai satu ukuran antara beberapa ukuran, tanya populasi mana yang digunakan untuk mengesahkannya, dan tanya apa yang tidak dikatakan oleh vendor tentang kes yang masih tersalah dikesannya.

XLinkedInFacebook

Soalan Lazim

Ya. Weber-Wulff dan rakan sekerja mendapati alat pengesanan AI 'tidak tepat mahupun boleh dipercayai' dalam perbandingan 2023, dan penulis bahasa Inggeris bukan penutur asli menghadapi risiko tertinggi yang didokumenkan, dengan satu kajian mendapati kadar positif palsu purata melebihi 60 peratus pada esei TOEFL. Satu skor sahaja bukan bukti apa-apa dengan sendirinya, sebab itu ia tidak boleh menjadi satu-satunya bukti di sebalik tuduhan.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Kekal dikemas kini tentang pemanusiaan AI

Dapatkan petua tentang penulisan akademik, pengesanan AI, dan pemanusiaan dihantar ke peti masuk anda.

Tiada spam. Boleh berhenti melanggan pada bila-bila masa.