Tingkat Positif Palsu Turnitin: Apa yang Ditunjukkan Angka
Turnitin menerbitkan dua angka positif palsu, bukan satu, dan keduanya tidak menggambarkan makalah yang berada di hadapan seorang profesor tertentu. Berikut pemisahan tingkat dokumen versus tingkat kalimat, tanda bintang di bawah 20 persen, dan aritmetika yang mengubah sepersekian persen menjadi jumlah mahasiswa yang nyata.
Tingkat false positive Turnitin bukan satu angka. Perusahaan ini menerbitkan dua angka: satu angka di bawah 1 persen pada tingkat dokumen, dan satu angka yang lebih dekat ke 4 persen pada tingkat kalimat. Keduanya nyata, keduanya dipublikasikan, dan masing-masing, jika berdiri sendiri, tidak banyak menjelaskan makalah tertentu yang berada di hadapan seorang dosen tertentu.
Kesenjangan antara kedua angka itu, dan apa yang terjadi setelah salah satunya diterapkan pada sebuah kelas yang nyata, bukan pada satu dokumen saja, adalah hal yang dibahas dalam tulisan ini: apa yang dinyatakan Turnitin sendiri, apa yang sebenarnya dicakup oleh kedua angka itu, dan aritmetika yang mengubah pecahan persen menjadi jumlah mahasiswa yang nyata.
Apa Itu Tingkat False Positive Turnitin, Menurut Turnitin?
Pada tingkat dokumen, menurut kata-kata perusahaan sendiri: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Kondisi itu sama pentingnya dengan angkanya. Angka di bawah 1 persen bukanlah klaim tentang setiap makalah yang dinilai Turnitin. Angka itu hanya menggambarkan subset makalah yang, menurut estimasi model itu sendiri, sudah melewati ambang 20 persen tulisan AI.
Pada tingkat kalimat, ketika antarmuka menyorot baris-baris individual alih-alih seluruh dokumen, angka Turnitin sendiri kira-kira empat kali lebih tinggi. "Our sentence-level false positive rate is around 4%," kata perusahaan itu. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin menambahkan bahwa kalimat-kalimat yang salah ini tidak tersebar secara acak: dalam 54 persen kasus, sebuah kalimat yang salah ditandai berada tepat di sebelah tulisan AI yang benar, yang oleh perusahaan diajukan sebagai bagian dari alasan mengapa skor pada tingkat seluruh dokumen cenderung lebih dapat diandalkan daripada satu baris yang disorot saja.
Tingkat Dokumen dan Tingkat Kalimat Bukan Klaim yang Sama
Pembagian dua tingkat ini merupakan pesan yang direvisi, bukan posisi asli Turnitin. Saat peluncuran pada April 2023, perusahaan menerbitkan satu angka di bawah 1 persen tanpa pembedaan apa pun antara dokumen dan kalimat. Setelah institusi mulai mengutip angka itu dan setelah pers pendidikan melaporkan positif palsu di dunia nyata yang lebih tinggi dari yang diharapkan, chief product officer Turnitin menerbitkan rincian yang digunakan di atas, bersama dua perubahan produk yang dibuat sebagai tanggapan, yaitu menaikkan panjang minimum dokumen yang dapat diberi skor dari 150 menjadi 300 kata, dan mengubah cara kalimat pembuka dan penutup dalam sebuah dokumen diberi skor.
Batas 300 kata ada karena alasan yang terkait. Turnitin menaikkannya dari minimum awal 150 kata setelah menemukan, menurut kata-kata perusahaan sendiri, bahwa akurasi meningkat dengan lebih banyak teks. Pengajuan yang singkat, refleksi satu halaman, draf parsial, unggahan diskusi, memberi model lebih sedikit sinyal untuk digunakan dibandingkan dengan angka positif palsu di atas yang diukur, yang merupakan salah satu alasan mengapa apa pun di bawah batas itu sama sekali tidak mendapat skor AI, bukan skor yang tidak andal.
| Tingkat | Tingkat yang dinyatakan Turnitin | Apa yang sebenarnya dicakupnya |
|---|---|---|
| Tingkat dokumen | Di bawah 1% | Hanya dokumen yang sudah ditandai sebagai 20% atau lebih ditulis oleh AI, persentase keseluruhan untuk seluruh pengajuan |
| Tingkat kalimat | Sekitar 4% | Setiap kalimat individual yang disorot di dalam laporan penulisan AI, terlepas dari skor keseluruhan dokumen |
| Di bawah ambang 20% dokumen | Tidak ada angka yang ditampilkan | Turnitin menampilkan tanda bintang вместо persentase, menandai hasil tersebut sebagai kurang andal pada rentang itu |
Humanisasi makalah Anda sendiri
Ubah teks berbantuan AI Anda dan buat terdengar manusiawi, tanpa menyentuh kata penting atau sitasi.
Aritmetika: Apa Arti Sebagian Kecil dari Satu Persen bagi Sebuah Kohort Nyata
Perhitungan ini dilakukan secara terbuka ketika Vanderbilt University menghitung tingkat kesalahan yang terkait dengan deteksi AI Turnitin pada Agustus 2023. Contoh terbaik tentang cara melakukan perhitungan ini adalah penghitungan angka oleh Vanderbilt sendiri. Dalam sebuah tulisan blog tentang keputusan mereka untuk mematikan detektor AI Turnitin, mereka mencatat, "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
Angka itu adalah ekstrapolasi Vanderbilt sendiri dari angka yang dipublikasikan oleh vendor yang diterapkan pada volume Vanderbilt sendiri, bukan hasil yang diukur secara terpisah. Bentuk aritmetika ini berlaku lebih luas daripada jumlah mahasiswa satu universitas. Tingkat di bawah 1 persen yang diterapkan pada beberapa ratus makalah menghasilkan sejumlah kecil mahasiswa yang salah ditandai, yang mudah terlewatkan. Tingkat yang sama yang diterapkan pada puluhan ribu makalah, skala yang benar-benar diajukan universitas setiap tahun, menghasilkan ratusan, bukan sejumlah kecil, karena persentase kecil dan populasi besar dikalikan bersama, bukan dipertimbangkan secara terpisah.
Tidak ada dari ini yang membuktikan bahwa tingkat di dunia nyata persis sama dengan angka laboratorium. Kepala produk Turnitin sendiri telah mengakui secara publik bahwa hasil di dunia nyata berbeda dari pengujian laboratorium, yang sebagian menjadi alasan perusahaan merevisi pesannya sejak awal. Aritmetika di atas memperlakukan angka yang dinyatakan Turnitin sendiri sebagai masukan yang layak dipertimbangkan dengan serius, bukan sebagai batas atas atas apa yang sebenarnya terjadi ketika sebuah alat memberi skor pada pengajuan yang sama sekali tidak mirip dengan tolok ukur yang dikurasi.
Apa yang Tidak Dicakup oleh Tingkat Ini
Hasil di bawah ambang 20 percent tidak diberi persentase kecil yang menyertainya. Sebagai gantinya, hasil itu diberi tanda asterisk, bukan angka, sebuah pilihan yang dibuat Turnitin karena rentang itu adalah saat alat tersebut paling tidak andal ke dua arah, dan hal ini didukung oleh pelaporan independen media pendidikan serta penjelasan perusahaan sendiri tentang rendahnya tingkat keyakinan pada rentang itu. Suntingan ringan, satu paragraf direvisi dengan bantuan dan sisanya ditulis tanpa bantuan, dapat menghasilkan tidak adanya skor yang terlihat sama sekali, bukan skor kecil, sesuatu yang patut diketahui sebelum angka yang hilang dibaca sebagai tuduhan atau sebagai bukti bersih. Panduan TextPulse tentang apa yang dihitung sebagai skor Turnitin yang baik membahas ambang yang sama dari sisi pembaca laporan.
Jadi, Bagaimana Seharusnya Tingkat False Positive yang Dipublikasikan Dibaca?
Sebagai angka dari vendor tentang kondisi yang lebih sempit daripada yang pada awalnya tampak dijelaskan, bukan sebagai pernyataan tentang naskah yang sedang berada di depan seorang profesor tertentu. Turnitin membingkai keluarannya sendiri dengan cara yang sama, perusahaan menyatakan dengan jelas bahwa teknologi deteksi penulisan AI-nya tidak menghasilkan "a determination of misconduct," hanya "data for educators to make an informed decision." Bukti yang lebih luas tentang apakah AI detectors benar-benar akurat mendukung pembacaan yang sama, tingkat yang dipublikasikan menggambarkan sebuah tolok ukur, bukan dokumen yang sedang dinilai saat ini.
Penulis yang ingin mengetahui posisi draf mereka sendiri pada jenis pengukuran statistik yang sama, alih-alih menebak, dapat memeriksanya secara langsung dengan free perplexity checker sebelum apa pun sampai ke detector milik institusi. Itu adalah penggunaan teknologi yang berbeda dari mencoba membantah skor setelah fakta, dan di situlah penulis, bukan administrator, dapat melihat angkanya terlebih dahulu.
Akurasi ZeroGPT dibahas secara terpisah bagi siapa pun yang institusinya menggunakan itu. Kelompok yang paling terdampak oleh kesalahan ini, penulis bahasa Inggris non-native, dibahas pada halamannya sendiri.
Populasi yang paling terpapar pada perhitungan ini juga tidak tersebar secara merata. Penulis bahasa Inggris non-asli menanggung risiko terdokumentasi terbesar untuk berada di sisi yang salah dari salah satu persentase ini, yang persis merupakan audiens yang menjadi dasar halaman TextPulse untuk penulis akademik ESL. Turnitin akan terus merevisi angka-angka ini seiring pelatihan ulang modelnya. Yang tidak akan berubah adalah perhitungannya sendiri: tingkat sekecil ini tetap memerlukan populasi sebesar ini agar dapat tersamarkan, dan sebagian besar pengajuan yang nyata tidak seberuntung itu.
Pertanyaan yang Sering Diajukan
Tingkat positif palsu Turnitin, menurut angka yang dipublikasikan perusahaan sendiri, bukanlah satu angka tunggal. Pada tingkat dokumen, Turnitin menyatakan tingkat di bawah 1 persen, tetapi hanya untuk dokumen yang sudah ditandai 20 persen atau lebih ditulis oleh AI. Pada tingkat kalimat, ketika baris-baris individual disorot, angka perusahaan sendiri sekitar 4 persen.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.