Kadar Positif Palsu Turnitin: Apa yang Ditunjukkan oleh Angka
Turnitin menerbitkan dua angka positif palsu, bukan satu, dan kedua-duanya tidak menggambarkan kertas yang berada di hadapan seorang profesor tertentu. Berikut ialah pemisahan peringkat dokumen berbanding peringkat ayat, asterisk di bawah 20 peratus, dan pengiraan yang menukar pecahan peratus kepada bilangan pelajar yang sebenar.
Kadar positif palsu Turnitin bukan satu nombor. Syarikat itu menerbitkan dua angka: satu angka di bawah 1 peratus pada tahap dokumen, dan satu lagi yang lebih hampir kepada 4 peratus pada tahap ayat. Kedua-duanya benar, kedua-duanya diterbitkan, dan tiada satu pun secara sendirinya banyak mengatakan tentang kertas tertentu yang berada di hadapan seorang profesor tertentu.
Jurang antara dua angka ini, dan apa yang berlaku apabila salah satu daripadanya digunakan pada satu kelas sebenar dan bukannya satu dokumen tunggal, ialah perkara yang dihuraikan dalam bahagian ini: apa yang dinyatakan oleh Turnitin sendiri, apa yang sebenarnya diliputi oleh dua nombor itu, dan pengiraan yang menukar pecahan peratus kepada bilangan pelajar yang sebenar.
Apakah Kadar Positif Palsu Turnitin, Menurut Turnitin?
Pada tahap dokumen, menurut kata-kata syarikat itu sendiri: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Syarat itu sama pentingnya dengan nombor tersebut. Angka di bawah 1 peratus itu bukan dakwaan tentang setiap kertas yang dinilai oleh Turnitin. Ia hanya menerangkan subset kertas yang sudah melepasi ambang 20 peratus penulisan AI dalam anggaran model itu sendiri.
Pada tahap ayat, apabila antara muka menyerlahkan baris-baris individu dan bukannya keseluruhan dokumen, angka Turnitin sendiri adalah kira-kira empat kali lebih tinggi. "Our sentence-level false positive rate is around 4%," kata syarikat itu. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin menambah bahawa ayat-ayat yang tersalah ini tidak bertaburan secara rawak: 54 peratus daripada masa, ayat yang tersalah ditandakan terletak betul-betul bersebelahan dengan penulisan AI yang sebenar, yang dikemukakan oleh syarikat itu sebagai sebahagian daripada sebab skor keseluruhan dokumen cenderung lebih kukuh daripada mana-mana satu baris yang diserlahkan.
Tahap Dokumen dan Tahap Ayat Bukan Dakwaan yang Sama
Pembahagian dua peringkat ini ialah pemesejan yang disemak semula, bukan pendirian asal Turnitin. Semasa pelancaran pada April 2023, syarikat itu menerbitkan satu angka tunggal di bawah 1 peratus tanpa sebarang perbezaan antara dokumen dan ayat. Selepas institusi mula memetik angka itu dan selepas akhbar pendidikan melaporkan positif palsu dunia sebenar yang lebih tinggi daripada jangkaan, ketua pegawai produk Turnitin menerbitkan pecahan yang digunakan di atas, bersama dua perubahan produk yang dibuat sebagai tindak balas, iaitu menaikkan panjang minimum dokumen yang boleh diberi skor daripada 150 kepada 300 patah perkataan, dan mengubah cara ayat awal dan ayat akhir dalam sesuatu dokumen diberi skor.
Had 300 patah perkataan wujud atas sebab yang berkaitan. Turnitin menaikkannya daripada minimum asal 150 patah perkataan selepas mendapati, menurut kata-kata syarikat itu sendiri, bahawa ketepatan meningkat dengan lebih banyak teks. Penyerahan yang pendek, renungan satu halaman, draf separa, catatan perbincangan, memberikan model kurang isyarat untuk digunakan berbanding angka positif palsu di atas yang diukur, dan ini sebahagiannya menjelaskan mengapa apa-apa yang berada di bawah had itu tidak menerima sebarang skor AI sama sekali, bukannya skor yang tidak boleh dipercayai.
| Tahap | Kadar yang dinyatakan Turnitin | Skop sebenar yang diliputi |
|---|---|---|
| Tahap dokumen | Di bawah 1% | Hanya dokumen yang sudah ditandakan pada 20% atau lebih sebagai ditulis AI, peratusan keseluruhan bagi seluruh penyerahan |
| Tahap ayat | Sekitar 4% | Mana-mana ayat individu yang diserlahkan dalam laporan penulisan AI, tanpa mengira skor keseluruhan dokumen |
| Di bawah ambang dokumen 20% | Tiada nombor dipaparkan | Turnitin memaparkan asterisk dan bukannya peratusan, menandakan hasil itu sebagai kurang boleh dipercayai pada julat tersebut |
Humanisasikan kertas anda sendiri
Ubah teks anda yang dibantu AI dan jadikannya kedengaran seperti ditulis manusia, tanpa menyentuh perkataan penting atau sitasi.
Aritmetik: Apa Maksud Pecahan Peratus bagi Satu Kohort Sebenar
Pengiraan matematik itu dibuat secara terbuka apabila Vanderbilt University mengira kadar ralat yang dikaitkan dengan pengesanan AI Turnitin pada Ogos 2023. Contoh terbaik tentang cara melakukan pengiraan ini ialah pengiraan angka oleh Vanderbilt sendiri. Dalam satu catatan blog tentang keputusan mereka untuk mematikan pengesan AI Turnitin, mereka menyatakan, "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
Angka itu ialah ekstrapolasi Vanderbilt sendiri daripada nombor yang diterbitkan oleh vendor, yang diaplikasikan pada jumlah Vanderbilt sendiri, bukan hasil yang diukur secara berasingan. Bentuk aritmetik ini boleh digeneralisasikan melangkaui bilangan warga sebuah universiti. Kadar di bawah 1 peratus yang diaplikasikan pada beberapa ratus kertas menghasilkan beberapa pelajar yang tersalah ditandai, dan mudah terlepas pandang. Kadar yang sama yang diaplikasikan pada puluhan ribu kertas, iaitu skala yang dihantar oleh universiti sebenar setiap tahun, menghasilkan ratusan dan bukannya beberapa orang, kerana peratusan kecil dan populasi yang besar didarabkan bersama, bukannya dipertimbangkan secara berasingan.
Tiada satu pun daripada ini membuktikan bahawa kadar dunia sebenar sepadan dengan angka makmal secara tepat. Ketua pegawai produk Turnitin sendiri telah mengakui secara terbuka bahawa hasil dunia sebenar berbeza daripada ujian makmal, sebahagiannya sebab syarikat itu menyemak semula mesejnya pada asalnya. Pengiraan di atas menganggap nombor yang dinyatakan oleh Turnitin sendiri sebagai input yang wajar diambil serius, bukan sebagai had maksimum terhadap apa yang sebenarnya berlaku apabila sesuatu alat menilai penyerahan yang langsung tidak menyerupai penanda aras yang dipilih dengan teliti.
Apa yang Tidak Diliputi oleh Kadar Itu
Keputusan di bawah ambang 20 peratus tidak diberikan peratusan kecil. Sebaliknya, ia diberikan asterisk dan bukannya nombor, satu pilihan yang dibuat oleh Turnitin kerana julat itu ialah julat apabila alat tersebut paling tidak boleh dipercayai dalam kedua-dua arah, disokong oleh laporan bebas media pendidikan bersama dengan kerangka keyakinan rendah syarikat itu sendiri pada julat tersebut. Suntingan ringan, satu perenggan disemak dengan bantuan dan selebihnya ditulis tanpa bantuan, boleh menghasilkan tiada skor yang kelihatan langsung dan bukannya skor kecil, sesuatu yang wajar diketahui sebelum nombor yang tiada dibaca sebagai sama ada tuduhan atau pengesahan bersih. Panduan TextPulse tentang apa yang dikira sebagai skor Turnitin yang baik membincangkan ambang yang sama dari sudut pembaca laporan itu.
Jadi, Bagaimana Patut Kadar Positif Palsu yang Diterbitkan Dibaca?
Sebagai angka daripada vendor tentang keadaan yang lebih sempit daripada yang pada mulanya kelihatan dihuraikan, bukan sebagai pernyataan tentang kertas yang berada di hadapan seorang profesor tertentu. Turnitin merangka outputnya sendiri dengan cara yang sama, syarikat itu menyatakan dengan jelas bahawa teknologi pengesanan penulisan AI mereka tidak memberikan "a determination of misconduct," hanya "data for educators to make an informed decision." Bukti yang lebih luas tentang sama ada pengesan AI benar-benar tepat menyokong bacaan yang sama, kadar yang diterbitkan menghuraikan penanda aras, bukan dokumen yang sedang dinilai.
Penulis yang ingin mengetahui kedudukan draf mereka sendiri pada jenis ukuran statistik yang sama, bukannya meneka, boleh menyemaknya secara langsung dengan free perplexity checker sebelum apa-apa pun sampai ke pengesan institusi. Itu ialah penggunaan teknologi yang berbeza daripada cuba mempertikaikan skor selepas fakta, dan itulah satu-satunya keadaan apabila penulis, bukannya pentadbir, dapat melihat nombor itu terlebih dahulu.
Ketepatan ZeroGPT diteliti secara berasingan bagi sesiapa yang institusinya menggunakan itu. Kumpulan yang paling terkesan oleh ralat ini, penulis bahasa Inggeris bukan penutur asli, ialah subjek halaman tersendiri.
Populasi yang paling terdedah kepada pengiraan ini juga tidak tersebar secara sekata. Penulis bahasa Inggeris bukan penutur asli menanggung risiko terdokumentasi terbesar untuk berada di pihak yang salah bagi mana-mana peratusan ini, yang sememangnya merupakan audiens yang dibina di sekitar halaman TextPulse untuk penulis akademik ESL. Turnitin akan terus menyemak semula angka ini apabila ia melatih semula modelnya. Apa yang tidak akan berubah ialah pengiraan itu sendiri, kadar yang sekecil ini masih memerlukan populasi yang sebesar ini untuk hilang ke dalamnya, dan kebanyakan penyerahan sebenar tidak begitu bernasib baik.
Soalan Lazim
Kadar positif palsu Turnitin, menurut angka yang diterbitkan oleh syarikat itu sendiri, bukanlah satu nombor tunggal. Pada peringkat dokumen, Turnitin menyatakan kadar di bawah 1 peratus, tetapi hanya untuk dokumen yang sudah ditandai pada 20 peratus atau lebih ditulis oleh AI. Pada peringkat ayat, apabila baris individu disorot, angka syarikat itu sendiri adalah sekitar 4 peratus.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.