Turnitin false positive rate: що кажуть цифри
Turnitin публікує дві цифри false positive, а не одну, і жодна з них не описує роботу, що лежить перед конкретним професором. Ось поділ на рівень документа і рівень речення, позначка для значень нижче 20%, і арифметика, яка перетворює частку відсотка на реальну кількість студентів.
Рівень хибнопозитивних спрацьовувань Turnitin не є одним числом. Компанія публікує два: показник нижче 1 відсотка на рівні документа і показник, ближчий до 4 відсотків, на рівні речення. Обидва є реальними, обидва опубліковані, і жоден із них сам по собі мало що говорить про конкретну роботу, що лежить перед конкретним викладачем.
Саме цю різницю між двома показниками, а також те, що відбувається, коли будь-який із них застосовують до реальної групи, а не до одного документа, і розглядає цей текст: що саме стверджує Turnitin, що насправді охоплюють ці два числа, і арифметику, яка перетворює частку відсотка на реальну кількість студентів.
Що таке рівень хибнопозитивних спрацьовувань Turnitin, за даними Turnitin?
На рівні документа, за власними словами компанії: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Ця умова має не менше значення, ніж саме число. Показник нижче 1 відсотка не є твердженням про кожну роботу, яку оцінює Turnitin. Він описує лише ту підмножину робіт, які вже перевищили поріг у 20 відсотків AI-written у власній оцінці моделі.
На рівні речення, де інтерфейс виділяє окремі рядки, а не весь документ, власний показник Turnitin приблизно у чотири рази вищий. "Our sentence-level false positive rate is around 4%," зазначає компанія. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin додає, що ці помилково позначені речення не розподіляються випадково: у 54 percent випадків хибно позначене речення безпосередньо стоїть поруч із справжнім AI writing, і компанія подає це як частину пояснення того, чому оцінка на рівні всього документа зазвичай є надійнішою, ніж будь-який окремий виділений рядок.
Рівень документа і рівень речення не є одним і тим самим твердженням
Цей поділ на два рівні є переглянутим формулюванням, а не початковою позицією Turnitin. На момент запуску у квітні 2023 року компанія оприлюднила одну цифру, меншу за 1%, без будь-якого розрізнення між документом і реченням. Після того як заклади почали посилатися на цю цифру, а освітня преса повідомила про вищу, ніж очікувалося, частоту хибнопозитивних результатів у реальних умовах, головний директор з продукту Turnitin оприлюднив наведений вище розподіл, разом із двома змінами продукту, внесеними у відповідь: підвищенням мінімальної довжини документа, що підлягає оцінюванню, з 150 до 300 слів, і зміною того, як оцінюються початкові та кінцеві речення в документі.
Поріг у 300 слів існує з пов'язаної причини. Turnitin підвищила його з початкового мінімуму в 150 слів після того, як виявила, за власними словами компанії, що точність зростає зі збільшенням обсягу тексту. Коротке подання, односторінкова рефлексія, частковий чернетковий варіант, допис у дискусії, дає моделі менше сигналів для роботи, ніж ті, щодо яких вимірювали наведені вище показники хибнопозитивних результатів, і саме тому все, що нижче цього порогу, взагалі не отримує AI-оцінки, а не ненадійної оцінки.
| Рівень | Заявлений Turnitin показник | Що він фактично охоплює |
|---|---|---|
| На рівні документа | Менше 1% | Лише документи, які вже позначено як такі, що на 20% або більше написані AI; загальний відсоток для всього подання |
| На рівні речення | Близько 4% | Будь-яке окреме речення, виділене в звіті про AI writing, незалежно від загального бала документа |
| Нижче порога документа 20% | Число не показано | Turnitin відображає замість відсотка зірочку, позначаючи результат як менш надійний у цьому діапазоні |
Гуманізуйте свою власну статтю
Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.
Арифметика: що означає частка відсотка для реальної когорти
Математику було виконано публічно, коли Vanderbilt University у серпні 2023 року обчислив рівні помилок, пов’язані з виявленням AI у Turnitin. Найкращий приклад того, як виконати цю математику, це власний розрахунок Vanderbilt University. У дописі в блозі про своє рішення вимкнути детектор AI у Turnitin вони зазначили: "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
Ця цифра є власною екстраполяцією Vanderbilt University з опублікованого показника постачальника, застосованого до власного обсягу Vanderbilt University, а не окремо виміряним результатом. Логіка цього обчислення узагальнюється за межі чисельності одного університету. Рівень нижче 1 percent, застосований до кількох сотень робіт, дає жменьку хибно позначених студентів, яку легко не помітити. Той самий рівень, застосований до десятків тисяч робіт, тобто масштабу, який реальний університет подає щороку, дає сотні, а не жменьку, тому що невеликий відсоток і велика сукупність множаться разом, а не розглядаються ізольовано.
Усе це не доводить, що реальний рівень точно збігається з лабораторною цифрою. Власний chief product officer Turnitin публічно визнав, що реальні результати відрізняються від лабораторного тестування, і саме тому компанія спочатку переглянула свої формулювання. Наведене вище обчислення розглядає власний заявлений показник Turnitin як вхідні дані, до яких варто поставитися серйозно, а не як верхню межу того, що насправді відбувається, коли інструмент оцінює подання, які зовсім не схожі на відібрану еталонну вибірку.
Що не охоплює цей рівень
Результат нижче порога 20 percent не отримує до нього малий відсоток. Замість числа він отримує зірочку, і Turnitin зробив саме такий вибір, тому що в цьому діапазоні інструмент є найменш надійним в обох напрямках, що підтверджується незалежними публікаціями освітньої преси поряд із власним формулюванням компанії про низьку впевненість у цьому діапазоні. Легке редагування, один абзац, виправлений за допомогою, а решта написана без сторонньої допомоги, може взагалі не дати видимого бала, а не малого, і це варто знати, перш ніж відсутнє число буде прочитано або як звинувачення, або як чистий стан справ. Посібник TextPulse про те, що вважається хорошим балом Turnitin охоплює той самий поріг з боку читача звіту.
Тож як слід читати опубліковану частоту хибнопозитивних результатів?
Як показник постачальника щодо вужчого стану, ніж здається на перший погляд, а не як твердження про текст, що лежить перед конкретним професором. Turnitin формулює власний результат так само, компанія прямо заявляє, що її технологія виявлення AI writing detection technology не дає "a determination of misconduct," лише "data for educators to make an informed decision." Ширші докази щодо whether AI detectors are accurate at all підтверджують те саме прочитання: опублікована частота описує еталон, а не документ, який наразі оцінюють.
Автори, які хочуть знати, де їхній власний чернетковий текст перебуває на такому самому типі статистичного вимірювання, а не здогадуватися, можуть перевірити це безпосередньо за допомогою free perplexity checker ще до того, як щось із цього потрапить до детектора установи. Це інше використання технології, ніж спроба сперечатися з балом постфактум, і саме в цьому випадку автор, а не адміністратор, отримує змогу побачити число першим.
Точність ZeroGPT розглядається окремо для тих, чия установа використовує саме його. Група, на яку ці помилки найсильніше впливають, non-native English writers, є предметом окремої сторінки.
Населення, найбільш піддане цій арифметиці, також розподілене нерівномірно. Автори, для яких англійська не є рідною несуть найбільший задокументований ризик опинитися по неправильний бік будь-якого з цих відсотків, і саме на цю аудиторію орієнтована сторінка TextPulse для академічних авторів ESL. Turnitin і надалі переглядатиме ці цифри, коли пере навчить свою модель. Те, що не зміниться, це сама арифметика: такий малий показник усе ще потребує настільки великої сукупності, щоб у ній зникнути, і більшість реальних подань не мають такої удачі.
Часті запитання
Turnitin false positive rate, за власними опублікованими даними компанії, не є одним числом. На рівні документа Turnitin вказує показник нижче 1%, але лише для документів, які вже позначено як такі, що на 20% або більше написані AI. На рівні речення, де виділяють окремі рядки, власний показник компанії становить близько 4%.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.