AI Detection

Что такое хороший результат Turnitin?

Turnitin не публикует приемлемый процент сходства, и учреждения сами устанавливают свои ориентиры. В этой статье объясняется, что на самом деле повышает или понижает результат, почему цитаты и списки литературы завышают его без каких-либо нарушений, и как читать разбивку совпадений за числом, а не само число.

Обновлено 6 min
What is a good Turnitin score? A similarity report broken into matched sources rather than one number.

Один студент слышит от научного руководителя, что всё, что ниже пятнадцати процентов, допустимо. У другого студента, тоже в том же факультете, работу отмечают в коридоре как проблемную при двенадцати процентах, потому что три из этих пунктов приходятся на один непрерывный абзац без кавычек рядом с ним. Оба правильно понимают показатель сходства Turnitin. Этот инструмент изначально не был создан для того, чтобы выдавать единственное число, означающее сдано или не сдано.

Так что же такое хороший результат Turnitin? Такого числа не существует. Turnitin не публикует допустимый процент, не выставляет оценку за работу и прямо говорит, что этот показатель сам по себе не является мерой плагиата. Каждое учебное заведение устанавливает собственные рекомендации, и нередко то же делает каждый научный руководитель внутри него, поэтому один и тот же отчёт может выглядеть ничем не примечательным в одном кабинете и вызывать беспокойство в следующем. Число, которое стоит понять, это то, как читать то, что стоит за ним.

Turnitin similarity report showing 12% overall similarity with match groups for uncited matches and missing quotations, and top sources split across internet, publications and student papers
Отчёт о сходстве на 12%, разбитый на группы совпадений: важно не заглавное число, а то, какая часть из него приходится на совпадающий текст без ссылок, а какая на цитированный и снабжённый ссылками материал.

Что такое хороший результат Turnitin?

Turnitin никогда не публиковал число, которое считалось бы хорошим, безопасным или допустимым, и на то есть конкретная причина: показатель сходства измеряет, какая часть текста в работе совпадает с текстом, уже находящимся в базах данных Turnitin, а не то, было ли это совпадение использовано ненадлежащим образом. Высокий показатель может целиком состоять из материала, который процитирован и корректно оформлен со ссылками. Низкий показатель может оказаться выше у работы, которая пересказывает один источник достаточно близко, чтобы вызвать вопросы у проверяющего, при этом вообще не задействуя механизм сопоставления. Читать число как оценку значит понимать этот инструмент наоборот.

Показатель вроде десяти или двадцати процентов широко циркулирует как неформальное правило, его повторяют на форумах и в учебных пособиях, пока он не начинает звучать как официальный. Он не является официальным. Turnitin не устанавливает такого показателя, а правило, которое игнорирует длину документа, плотность цитирования и отраслевую конвенцию, перестает работать в тот момент, когда сталкивается с реальной работой. Обзор литературы, составленный из тридцати корректно процитированных источников, может набрать более двадцати процентов только за счет цитат. Один близко перефразированный абзац без кавычек может оставаться ниже пяти процентов и при этом быть более серьезной проблемой.

Что на самом деле измеряет показатель сходства

Turnitin описывает свой инструмент почти в тех же выражениях. Руководство Boise State University, опирающееся на собственную формулировку Turnitin, объясняет, что показатель сходства представляет собой процент содержания работы, совпадающий с материалом, уже имеющимся в базах данных Turnitin, и что сам этот процент не является оценкой того, содержит ли работа плагиат. Это различие имеет реальное значение: совпадение носит механический характер, это сопоставление строки слов с другой строкой слов где-то еще, а оценка того, было ли это совпадение надлежащим образом атрибутировано, требует человека, а не алгоритма.

Базы данных, на которых основано сопоставление, намеренно широки: текущие и архивные студенческие работы, открытая сеть и большой массив академических публикаций. Никакой из этого контент не читается на предмет смысла. Система находит совпадающие последовательности слов и сообщает, какую часть работы они охватывают, поэтому процитированное предложение и тихо скопированное предложение могут дать идентичное совпадение. Только детальный вид отчета показывает, что есть что.

Почему высокий показатель может быть полностью допустимым

Большую часть этого объясняют две обычные особенности академического письма. Цитируемые фрагменты совпадают по замыслу, поскольку слова намеренно копируются и на странице обозначаются как принадлежащие другому автору. Списки литературы совпадают столь же надежно, потому что имена авторов, названия журналов и форматы ссылок повторяются в тысячах других работ, ссылающихся на те же источники. И то и другое соответствует тому, как должна выглядеть корректная академическая работа.

Если поставить их рядом, завышенный балл и реальная проблема на первый взгляд выглядят по-разному.

Что совпалоПочему это произошлоСтоит ли рассматривать внимательнее?
Цитируемый фрагмент с кавычками и ссылкойСлова были намеренно воспроизведены и указаны на страницеНет, именно так выглядит корректное цитирование
Список литературы или библиографияИмена авторов, названия журналов и форматы ссылок повторяются во многих других работахНет, если только не было применено исключение
Стандартные формулировки методов или процедурОбщий для данной области словарь описывает один и тот же процесс одинаково в разных работахРедко, если только весь раздел не был заимствован, а не написан заново
Один длинный, непрерывный абзац без кавычек, совпадающий с одним источникомФормулировка достаточно близко следует предложению другого автора, чтобы механизм сопоставления это обнаружилДа, это тот случай, который стоит открыть в источнике и проверить

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Почему низкий балл все же может скрывать проблему

Низкое число отвечает на более узкий вопрос, чем кажется, а именно, совпадает ли небольшой фрагмент текста слово в слово с базами данных Turnitin, и не более того. Парафраз, который достаточно меняет формулировку, сохраняя при этом структуру и аргументацию другого автора, может получить почти нулевой балл и все же оставаться серьезной проблемой академической добросовестности, поскольку механизм работает со строками слов, а не с заимствованными идеями. Переведенный контент или материал из баз данных, не индексируемых Turnitin, ведет себя так же, ничего не совпадает, ничего не помечается.

Сфабрикованные источники создают ту же слепую зону, но с другой стороны. Ссылка, которой не существует, не может совпасть ни с чем, потому что нигде нет ничего, с чем она могла бы совпасть, и показатель сходства не способен отметить цитату, которая изначально никогда не была реальной. Бесплатный AI citation checker от TextPulse существует именно для этого пробела: он сопоставляет каждую запись в списке литературы с фактическими реестрами, в которых эти источники должны появляться, прежде чем читателю придется обнаруживать этот пробел трудным путем.

Еще одно различие стоит провести, прежде чем полностью перейти от числа. Работа, имеющая низкий показатель сходства, все же может содержать отдельный индикатор AI writing от Turnitin, это иная метрика, созданная для выявления иного рода проблемы, о которой говорится в руководстве на этом сайте о том, может ли Turnitin на самом деле обнаруживать ChatGPT. Эти два процента рассчитываются не одинаково, и в этой статье речь идет только о показателе сходства.

Как читать отчет, а не число

Не реагируйте на общий результат, прежде чем откроете разбивку совпадений. Turnitin ранжирует источники, которые формируют показатель, по величине их вклада в него. Общий результат в двадцать два процента, составленный из одиннадцати источников, каждый из которых дает по два процента, читается не так, как общий результат, составленный из одного источника. Первый вариант обычно отражает совпадения во множестве распространенных фраз. Второй заслуживает прямого рассмотрения того, что именно этот источник на самом деле говорит.

Turnitin также распределяет тот же процент по цветовой шкале, воспроизведенной в собственном руководстве Loughborough College для студентов: синий, если совпадающего текста нет, зеленый от одного слова до двадцати четырех процентов, желтый от двадцати пяти до сорока девяти, оранжевый от пятидесяти до семидесяти четырех, красный от семидесяти пяти и выше. Собственное руководство колледжа прямо говорит о том, чем цвета не являются: проверки сходства не означают, что в работе содержится плагиат. Цветовая шкала сортирует отчет для привлечения внимания, а не для вынесения вердикта.

Стоит также проверить, исключают ли собственные настройки учреждения цитаты и библиографию из подсчёта, поскольку одна и та же подача может дать два разных числа в зависимости от того, как установлен этот переключатель. Всё это несложно, когда видно. Это становится невидимым только если никто не открывает отчёт дальше его первой страницы.

Что делать, если ваш результат вас удивляет

Открывайте каждый отмеченный источник по отдельности, а не реагируйте на общий итог. Подтвердите, исключаются ли в проверяемой версии цитаты и библиография, поскольку число, которое студент видит во время подготовки, не всегда настроено так же, как число, которое преподаватель видит при сдаче. Если обнаруживается подлинное совпадение без указания источника, исправьте цитирование напрямую, а не перефразируйте предложения, чтобы проскользнуть мимо механизма сопоставления, который устраняет симптом и оставляет проблему на месте.

Если число по-прежнему кажется несоответствующим тому, что ожидает руководитель, прямо спросите, какова собственная конвенция этого подразделения. Приведённые выше разделы уже показывают, что единого порога нет, поэтому ответ находится у того, кто обладает локальными полномочиями в отношении задания, а не у какого-либо процента, который можно было бы заранее посмотреть. Набор бесплатных инструментов TextPulse охватывает проверки цитирования и черновика, которые стоит выполнить до того, как отчёт попадёт в чужой почтовый ящик.

Результаты разных инструментов не взаимозаменяемы, а как работает GPTZero изложено на отдельной странице, вместе с статистикой perplexity, лежащей в основе обоих.

Результат ведёт себя так, как он ведёт, из-за того, как выполняется сопоставление под ним, а более новое число, которое теперь стоит рядом с ним в том же отчёте, работает на другом механизме, который полностью изложен в руководстве этого сайта о том, как на самом деле работают AI detectors. Чтение любого из этих чисел как вердикта пропускает единственную часть отчёта, которую стоит читать.

XLinkedInFacebook

Часто задаваемые вопросы

Что такое хороший результат Turnitin? Такого числа не существует. Turnitin не публикует приемлемый процент, а показатель сходства измеряет, какая часть текста совпадает с его базами данных, а не то, сколько было заимствовано без указания источника. Грамотно оформленный обзор литературы может набрать более двадцати процентов только за счет цитат, тогда как один неатрибутированный пересказ может оставаться ниже пяти. Смотрите на совпавшие источники, а не на заголовочную цифру.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.