Turnitin: что говорят числа о доле ложноположительных срабатываний
Turnitin публикует две цифры ложноположительных срабатываний, а не одну, и ни одна из них не описывает работу, лежащую перед конкретным профессором. Вот разделение на уровень документа и уровень предложения, пометка для диапазона ниже 20%, а также арифметика, которая превращает долю процента в реальное число студентов.
Частота ложноположительных результатов Turnitin не сводится к одному числу. Компания публикует два: показатель ниже 1 процента на уровне документа и показатель, который ближе к 4 процентам на уровне предложения. Оба показателя реальны, оба опубликованы, и ни один из них сам по себе не говорит многого о конкретной работе, лежащей перед конкретным преподавателем.
Именно этот разрыв между двумя показателями, а также то, что происходит, когда любой из них применяется к реальной группе, а не к одному документу, и рассматривается в этом материале: что именно заявляет сам Turnitin, что на самом деле охватывают эти два числа и какая арифметика превращает долю процента в реальное число студентов.
Какова частота ложноположительных результатов Turnitin, согласно Turnitin?
На уровне документа, по собственным словам компании: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Это условие не менее важно, чем само число. Показатель ниже 1 процента не является утверждением о каждой работе, которую оценивает Turnitin. Он описывает только ту часть работ, которая уже прошла порог в 20 процентов AI-written в собственной оценке модели.
На уровне предложения, где интерфейс выделяет отдельные строки, а не весь документ, собственный показатель Turnitin примерно в четыре раза выше. "Our sentence-level false positive rate is around 4%," states the company. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin добавляет, что эти ошибочно отмеченные предложения не распределяются случайным образом: в 54 percent случаев предложение, ошибочно помеченное как AI-written, находится непосредственно рядом с подлинным AI writing, и компания приводит это как часть объяснения того, почему показатель на уровне всего документа обычно оказывается более устойчивым, чем любая отдельная выделенная строка.
Уровень документа и уровень предложения, это не одно и то же утверждение
Это двухуровневое разделение представляет собой пересмотренную формулировку, а не исходную позицию Turnitin. При запуске в апреле 2023 года компания опубликовала единую цифру менее 1 процента без какого-либо различия между документом и предложением. После того как учреждения начали ссылаться на это число, а профильная образовательная пресса сообщила о более высоком, чем ожидалось, числе ложноположительных результатов в реальных условиях, главный директор по продукту Turnitin опубликовал приведённую выше разбивку, а также два изменения продукта, внесённые в ответ: повышение минимальной длины документа, подлежащего оценке, с 150 до 300 слов и изменение того, как оцениваются начальные и конечные предложения в документе.
Порог в 300 слов существует по связанной причине. Turnitin повысила его с первоначального минимума в 150 слов после того, как установила, по собственным словам компании, что точность возрастает с увеличением объёма текста. Короткая работа, одностраничное рефлексивное эссе, неполный черновик, сообщение на форуме, дают модели меньше сигнала для анализа, чем тот объём, относительно которого были измерены приведённые выше показатели ложноположительных результатов, и именно поэтому всё, что ниже этого порога, вообще не получает оценки AI, а не ненадёжную оценку.
| Уровень | Заявленный Turnitin показатель | Что он фактически охватывает |
|---|---|---|
| На уровне документа | Менее 1% | Только документы, уже отмеченные как содержащие 20% или более текста, написанного AI, общий процент для всей работы |
| На уровне предложения | Около 4% | Любое отдельное предложение, выделенное в отчёте о написании AI, независимо от общего балла документа |
| Ниже порога в 20% для документа | Число не показывается | Turnitin отображает звёздочку вместо процента, обозначая результат как менее надёжный в этом диапазоне |
Очеловечить свою работу
Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.
Арифметика: что означает доля процента для реальной выборки
Математика была проделана публично, когда Vanderbilt University в августе 2023 года рассчитала показатели ошибок, связанные с обнаружением ИИ в Turnitin. Лучший пример того, как выполнять эти вычисления, это собственный расчет Vanderbilt University. В записи блога о своем решении отключить детектор ИИ Turnitin они отметили: "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
Эта цифра является собственной экстраполяцией Vanderbilt University из опубликованного компанией значения, примененного к собственному объему Vanderbilt University, а не отдельно измеренным результатом. Логика этих вычислений распространяется дальше, чем численность одного университета. Показатель ниже 1 процента, примененный к нескольким сотням работ, дает лишь несколько ошибочно отмеченных студентов, что легко не заметить. Тот же показатель, примененный к десяткам тысяч работ, то есть к масштабу, который реальный университет подает каждый год, дает сотни, а не несколько случаев, потому что небольшой процент и большая совокупность перемножаются, а не рассматриваются изолированно.
Все это не доказывает, что реальный показатель в точности совпадает с лабораторной цифрой. Собственный главный директор по продукту Turnitin публично признал, что результаты в реальных условиях отличаются от лабораторного тестирования, и именно поэтому компания изначально пересмотрела свои формулировки. Приведенные выше вычисления рассматривают собственное заявленное Turnitin значение как входной параметр, к которому следует отнестись серьезно, а не как верхний предел того, что на самом деле происходит, когда инструмент оценивает работы, совсем не похожие на отобранный эталонный набор.
Что не охватывает этот показатель
Результат ниже порога в 20 percent не получает рядом с собой маленький процент. Вместо числа он получает звёздочку, и Turnitin сделал такой выбор потому, что именно в этом диапазоне инструмент наименее надёжен в обе стороны, что подтверждается независимыми публикациями в образовательной прессе наряду с собственной формулировкой компании о низкой уверенности в этом диапазоне. Небольшая правка, один абзац, переработанный с помощью, а остальное написанное без посторонней помощи, может дать вообще никакого видимого балла, а не маленький, и это стоит знать до того, как отсутствующее число начнут читать либо как обвинение, либо как чистую справку о благополучии. Руководство TextPulse о том, что считается хорошим баллом Turnitin рассматривает тот же порог с точки зрения читателя отчёта.
Так как следует читать опубликованную частоту ложноположительных результатов?
Как показатель вендора о более узком условии, чем кажется на первый взгляд, а не как утверждение о работе, лежащей перед конкретным профессором. Turnitin формулирует свой собственный результат так же, компания прямо заявляет, что её технология обнаружения AI writing detection не даёт "a determination of misconduct," а лишь "data for educators to make an informed decision." Более широкие данные о том, насколько вообще точны AI detectors, подтверждают то же прочтение: опубликованная частота описывает ориентир, а не документ, который в данный момент оценивается.
Авторы, которые хотят узнать, где находится их собственный черновик по тому же типу статистического измерения, а не гадать, могут проверить это напрямую с помощью free perplexity checker до того, как что-либо попадёт в detector учреждения. Это иное использование технологии, чем попытка спорить с баллом задним числом, и именно в этом случае автор, а не администратор, видит число первым.
Точность ZeroGPT рассматривается отдельно для тех, чьё учреждение использует именно его. Группа, на которую эти ошибки ложатся тяжелее всего, non-native English writers, является темой отдельной страницы.
Наиболее подверженная этому арифметическому расчёту группа населения тоже распределена неравномерно. Авторы, для которых английский не является родным несут наибольший документально подтверждённый риск оказаться по неправильную сторону любого из этих процентов, и именно вокруг этой аудитории построена страница TextPulse для академических авторов, изучающих английский как второй язык. Turnitin будет продолжать пересматривать эти цифры по мере переобучения своей модели. Не изменится сама арифметика: такой малый показатель всё равно требует настолько большой совокупности, в которой он может раствориться, а большинству реальных работ так не везёт.
Часто задаваемые вопросы
Доля ложноположительных срабатываний Turnitin, по опубликованным самой компанией данным, не является одним числом. На уровне документа Turnitin указывает показатель ниже 1%, но только для документов, уже отмеченных как на 20% или более написанные AI. На уровне предложения, где выделяются отдельные строки, собственная цифра компании составляет около 4%.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.