Что такое хороший результат Turnitin?
Turnitin не публикует допустимый процент сходства, и учреждения сами устанавливают свои рекомендации. Этот пост объясняет, что именно повышает или понижает результат, почему цитируемый материал и списки литературы завышают его, хотя в этом нет ничего неправильного, и как читать разбивку совпадений за числом, а не само число.
Одному студенту научный руководитель говорит, что всё, что ниже пятнадцати процентов, допустимо. У другого студента, тоже в том же факультете, работу отмечают в коридоре при двенадцати процентах, потому что три из этих пунктов приходятся на один непрерывный абзац без кавычек рядом с ним. Оба правильно понимают показатель сходства Turnitin. Изначально этот инструмент не был создан для того, чтобы выдавать единственное число, означающее сдано или не сдано.
Так какой же показатель Turnitin считается хорошим? Такого числа не существует. Turnitin не публикует допустимый процент, не выставляет оценку за работу и прямо говорит, что сама по себе эта цифра не является мерой плагиата. Каждое учреждение устанавливает собственные рекомендации, и нередко то же делает каждый научный руководитель внутри него, поэтому один и тот же отчёт в одном кабинете может выглядеть ничем не примечательным, а в следующем вызывать тревогу. Стоит научиться читать то, что стоит за числом.
Что такое хороший показатель Turnitin?
Turnitin никогда не публиковал число, которое считалось бы хорошим, безопасным или допустимым, и на то есть конкретная причина: показатель сходства измеряет, какая часть текста в работе совпадает с текстом, уже находящимся в базах данных Turnitin, а не то, было ли это совпадение использовано ненадлежащим образом. Высокий показатель может целиком объясняться материалом, который процитирован и оформлен со ссылками правильно. Низкий показатель может оказаться выше, чем у работы, которая близко пересказывает один источник и тем самым вызывает вопросы у проверяющего, при этом вовсе не срабатывая на механизме сопоставления. Читать это число как оценку значит понимать инструмент наоборот.
Такая величина, как от десяти до двадцати процентов, широко циркулирует как неформальное правило, повторяемое на форумах и в учебных пособиях, пока не начинает звучать как официальное. Оно не является официальным. Turnitin не устанавливает такого показателя, а правило, которое не учитывает длину документа, плотность цитирования и нормы конкретной дисциплины, перестаёт работать, как только сталкивается с реальной работой. Обзор литературы, составленный из тридцати правильно процитированных источников, может набрать более двадцати процентов только за счёт цитат. Один близко пересказанный абзац без кавычек может оставаться ниже пяти процентов и при этом быть куда более серьёзной проблемой.
Что на самом деле измеряет показатель сходства
Turnitin описывает свой инструмент почти в тех же выражениях. Руководство Boise State University, опирающееся на собственную формулировку Turnitin, объясняет, что показатель сходства представляет собой процент содержания работы, совпадающий с материалом, уже имеющимся в базах данных Turnitin, и что сам этот процент не является оценкой того, содержит ли работа плагиат. Это различие имеет реальное значение: совпадение носит механический характер, это последовательность слов, выстраивающаяся в ряд с последовательностью слов где-то ещё, а оценить, было ли это совпадение должным образом указано, может человек, а не алгоритм.
Базы данных, на которых основано сопоставление, намеренно широки: текущие и архивные студенческие работы, открытая сеть и большой массив академических публикаций. Ничто из этого содержания не читается по смыслу. Система находит совпадающие последовательности слов и сообщает, какую часть работы они охватывают, поэтому цитированное предложение и тихо скопированное предложение могут дать идентичное совпадение. Только подробный вид отчёта показывает, что есть что.
Почему высокий показатель может быть полностью допустимым
Большую часть этого объясняют две обычные особенности академического письма. Цитированные фрагменты совпадают по замыслу, поскольку слова намеренно копируются и на странице помечаются как принадлежащие другому автору. Списки литературы совпадают столь же надёжно, потому что имена авторов, названия журналов и форматы ссылок повторяются в тысячах других работ, ссылающихся на те же источники. И то и другое, это именно то, как должна выглядеть корректная академическая работа.
Если поставить их рядом, завышенный показатель и реальная проблема на первый взгляд выглядят по-разному.
| Что совпало | Почему это произошло | Стоит ли рассмотреть внимательнее? |
|---|---|---|
| Цитируемый фрагмент с кавычками и ссылкой | Слова были намеренно скопированы и указаны на странице | Нет, именно так выглядит корректное цитирование |
| Список литературы или библиография | Имена авторов, названия журналов и форматы ссылок повторяются во многих других работах | Нет, если только не было применено исключение |
| Стандартные методы или процедурные формулировки | Общий словарь области описывает один и тот же процесс одинаково в разных работах | Редко, если только весь раздел не был заимствован, а не написан заново |
| Один длинный, непрерывный абзац без кавычек, совпадающий с одним источником | Формулировка достаточно близко следует за предложением другого автора, чтобы механизм сопоставления это обнаружил | Да, это тот шаблон, который стоит открыть в источнике и проверить |
Очеловечить свою работу
Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.
Почему низкий балл все еще может скрывать проблему
Низкое число отвечает на более узкий вопрос, чем кажется, а именно, совпадает ли небольшой фрагмент текста слово в слово с базами данных Turnitin, и не более того. Парафраз, который достаточно меняет формулировки, сохраняя при этом структуру и аргументацию другого автора, может получить почти нулевой результат и все же оставаться серьезной проблемой академической добросовестности, поскольку механизм работает со строками слов, а не с заимствованными идеями. Переведенный контент или материал из баз данных, не индексируемых Turnitin, ведет себя так же, ничего не совпадает, ничего не помечается.
Сфабрикованные источники создают такую же слепую зону с другой стороны. Ссылка, которой не существует, не может ни с чем совпасть, потому что нигде нет ничего, с чем ее можно было бы сопоставить, и показатель сходства не может пометить цитату, которая изначально никогда не была реальной. Бесплатный AI citation checker от TextPulse free AI citation checker существует именно для этого пробела, он сопоставляет каждую запись в списке литературы с реальными реестрами, в которых эти источники должны быть, прежде чем читателю придется обнаруживать этот пробел трудным путем.
Еще одно различие стоит провести, прежде чем полностью перейти от самого числа. Работа с низким показателем сходства все равно может сопровождаться отдельным индикатором AI writing Turnitin, это другой показатель, созданный для выявления другого типа проблемы, о чем говорится в руководстве на этом сайте о том, может ли Turnitin на самом деле обнаруживать ChatGPT. Эти два процента рассчитываются не одинаково, и в этом материале речь идет только о показателе сходства.
Как читать отчет, а не число
Не реагируйте на общий результат, пока не откроете разбивку совпадений. Turnitin ранжирует источники, из которых складывается показатель, по вкладу каждого из них. Общий результат в двадцать два процента, составленный из одиннадцати источников, каждый из которых дает по два процента, воспринимается иначе, чем тот же результат, полученный от одного источника. Первый вариант обычно отражает пересечение по множеству распространенных фраз. Второй требует прямого просмотра того, что именно говорит этот источник.
Turnitin также относит тот же процент к цветовой категории, как это воспроизведено в собственных рекомендациях Loughborough College для студентов: синий, если совпадающего текста нет, зеленый, если совпадение составляет от одного слова до двадцати четырех процентов, желтый, если от двадцати пяти до сорока девяти, оранжевый, если от пятидесяти до семидесяти четырех, красный, если от семидесяти пяти и выше. Собственные рекомендации колледжа прямо говорят о том, чем цвета не являются: проверки сходства не означают, что в работе содержится плагиат. Цветовая маркировка нужна для того, чтобы привлечь внимание к отчету, а не для вынесения вердикта.
Также стоит проверить, исключают ли собственные настройки учреждения цитаты и библиографию из подсчета, поскольку одна и та же работа может дать два разных числа в зависимости от того, как установлен этот переключатель. После того как это видно, ничего сложного в этом нет. Это остается невидимым только в том случае, если никто не открывает отчет дальше первой страницы.
Что делать, если ваш результат вас удивил
Открывайте каждый отмеченный источник по отдельности, а не реагируйте на совокупный итог. Подтвердите, исключены ли в версии, которая оценивается, цитаты и библиография, поскольку число, которое студент видит во время черновой работы, не всегда настроено так же, как число, которое видит преподаватель при сдаче. Если обнаруживается подлинное совпадение без указания источника, исправьте цитирование напрямую, а не перефразируйте предложения, чтобы проскочить мимо механизма сопоставления, который устраняет симптом и оставляет проблему на месте.
Если число по-прежнему кажется несоответствующим тому, что ожидает руководитель, прямо спросите, какова собственная конвенция этого подразделения. Разделы выше уже показывают, что единой линии, которой нужно достичь, не существует, поэтому ответ находится у того, кто обладает локальными полномочиями в отношении задания, а не у какого-либо процента, который можно было бы заранее посмотреть. Коллекция бесплатных инструментов TextPulse охватывает проверки цитирования и черновика, которые стоит выполнить до того, как отчет попадет в чужой почтовый ящик.
Оценки разных инструментов не взаимозаменяемы, а как работает GPTZero изложено на отдельной странице, вместе с статистикой perplexity, лежащей в основе обоих.
Оценка ведет себя так из-за того, как выполняется сопоставление под ней, а более новое число, которое теперь стоит рядом с ней в том же отчете, работает на другом механизме, том, который руководство этого сайта о том, как на самом деле работают детекторы AI излагает полностью. Чтение любого из этих чисел как вердикта пропускает единственную часть отчета, которую стоит читать.
Часто задаваемые вопросы
Что такое хороший результат Turnitin? Такого числа не существует. Turnitin не публикует допустимый процент, а показатель сходства измеряет, какая часть текста совпадает с его базами данных, а не то, сколько было заимствовано без указания источника. Правильно оформленный обзор литературы может набрать более двадцати процентов только за счет цитат, тогда как один неатрибутированный парафраз может оставаться ниже пяти. Смотрите на совпавшие источники, а не на заголовочную цифру.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.