AI Detection

Может ли Turnitin обнаружить перефразированный текст?

Да, Turnitin обнаруживает перефразированный текст, и он был для этого создан. Его механизм сходства выявляет перефразированные фрагменты, которые по-прежнему совпадают с опубликованными и ранее сданными работами, а отчет о написании ИИ содержит обозначенную категорию для текста, сгенерированного ИИ и переработанного с помощью инструмента для перефразирования или word spinner. Вот как каждая система это выявляет и почему замена слов синонимами не обходит ни одну из них.

9 min
Diagram answering can Turnitin detect paraphrased text, comparing similarity matching against the AI writing indicator

Да. Turnitin обнаруживает перефразированный текст, и именно для этого он был создан. Внутри одного и того же отчёта это делают две системы. Similarity Report отмечает фрагменты, которые после изменения формулировки всё ещё совпадают с опубликованными работами или ранее поданными статьями, и именно эту задачу он выполняет с тех пор, как существовало написание с помощью AI. AI Writing Report имеет собственную обозначенную категорию для текста, сгенерированного AI, который был пропущен через инструмент перефразирования или word spinner. Замена слов синонимами не снимает ни одно из этих двух обнаружений.

То, какая система обнаружит конкретный фрагмент, зависит от того, откуда взялся текст. Переформулированный материал, взятый из источника, это проблема similarity. Переформулированный материал, сгенерированный ChatGPT, это проблема AI writing. Многие работы одновременно относятся к обеим категориям, и в любом случае обе системы читают каждую работу.

Turnitin Относит Перефразированный AI Текст к Собственной Категории

Это не вывод из того, как в целом работают детекторы. AI Writing Report в Turnitin делит свой процент на две обозначенные категории, и вторая из них, это перефразированный AI текст.

Turnitin AI Writing Overview page listing two categories: AI-generated only, described as likely AI-generated text from a large-language model, and AI-generated text that was AI-paraphrased, described as likely AI-generated text that was likely revised using an AI-paraphrase tool or word spinner
Turnitin AI Writing Overview, с категорией перефразирования, указанной в собственном продукте. Заголовочный процент объединяет обе строки, а вторая охватывает текст, переработанный с помощью AI paraphraser или word spinner.

В отчёте его заглавное число определяется как "the combined amount of likely AI-generated text as well as likely AI-generated text that was also likely AI-paraphrased". Вторая строка обозначена как "AI-generated text that was AI-paraphrased" и описана как "likely AI-generated text that was likely revised using an AI-paraphrase tool or word spinner".

В документации поддержки Turnitin вопрос прямо разъясняется. На прямой вопрос о том, может ли система обнаруживать контент, перефразированный с помощью инструмента для перефразирования на основе AI, в руководстве сказано: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been paraphrased using a word spinner/AI paraphrasing tool." Почти идентичный ответ относится к тексту, пропущенному через инструмент обхода, специально созданный для переписывания вывода AI так, чтобы он проходил мимо детектора. Ни один из них не формирует отдельную оценку. Оба поступают в тот же единый процент, который видит преподаватель.

Что выявляет каждая система

Similarity ReportAI Writing Report
Что проверяетсяЕсть ли у текста совпадения с источниками, уже находящимися в базе Turnitin, включающей веб-контент, публикации и студенческие работыЗвучит ли проза статистически типично для машинно-сгенерированного письма
Что выявляет при перефразированииЧужую опубликованную или сданную работуЧерновики, сгенерированные AI, включая те, которые были отредактированы с помощью paraphraser или bypasser
Эффект замены синонимовСнижает процент, но сохраняет совпадение характерных терминов, цитат и структуры предложенийВ основном оставляет оценку на прежнем уровне, потому что классификатор анализирует структуру предложений, а не выбор слов
Где это отображаетсяПроцент плюс группы совпадений с указанием каждого источникаОдин процент, разделённый на AI-generated only и AI-paraphrased

Эти два отчёта являются отдельными продуктами с отдельными числами, и работа может быть чистой в одном отчёте и отмеченной в другом. TextPulse подробно рассматривает это разделение в своём сравнении similarity score Turnitin с его AI score, а также сам механизм классификатора в статье как Turnitin обнаруживает AI writing.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Сторона Similarity: Перефразированный текст по-прежнему совпадает

Проверка сходства представляет собой сопоставление. Turnitin сравнивает работу с собственным хранилищем веб-контента, публикаций и ранее сданных работ и сообщает, какая часть совпадает с уже проиндексированным материалом. Если достаточно изменить формулировки, точные строки, которые сопоставляются, сокращаются, и процент падает. Это действительно так, и именно поэтому существуют инструменты для перефразирования.

То, что сохраняется при такой замене, студенты часто недооценивают. Технические термины, имена собственные, цитируемые данные и прямые цитаты переносятся без изменений, потому что для них нет синонимов. То же относится и к структуре предложения, когда заменяются только связующие слова. Turnitin сообщает о совпадениях как о группах совпадений, каждая из которых указывает свой источник, и именно это отличает правильно процитированный фрагмент от переформулированного.

Отчет о сходстве Turnitin, показывающий 12% общего сходства, разделенного на группы совпадений: 115 совпадений без цитирования или кавычек на уровне 9%, и 41 совпадение с отсутствующими кавычками на уровне 3%, с перечислением основных источников из интернета, публикаций и студенческих работ
Отчет о сходстве разбивает свой процент на группы совпадений. 115 совпадений, помеченных как "not cited or quoted", это те, которые выглядят как переформулированный или заимствованный материал, а не как атрибутированная цитата.

Переформулирование источника с сохранением порядка предложений и поддерживающих деталей называется patchwriting, и в большинстве университетских правил оно рассматривается как форма плагиата, независимо от того, снижается ли процент сходства. Проверяющие, обученные распознавать его, часто замечают это визуально, потому что аргумент, который следует за источником предложение за предложением, читается как его копия, независимо от словаря. Низкое число не означает чистую работу, и именно в этом состоит смысл руководства TextPulse о том, что считается хорошим результатом Turnitin.

Сторона AI: проход по синонимам не меняет результат

Индикатор AI writing никогда не сравнивал ваш абзац с источником, поэтому здесь нет совпадения, которое могло бы быть нарушено синонимом. Он оценивает прозу предложение за предложением, определяя, насколько близко она соответствует статистическому шаблону машинно сгенерированного письма: предсказуемости слов, ритму предложений и общим формулировкам, к которым language model обращается по умолчанию.

Замена слов почти ничего из этого не меняет. Предложение сохраняет свою длину, порядок и ту же стандартную связующую ткань между частями. Именно поэтому прогон черновика, созданного AI, через инструмент для перефразирования и наблюдение за тем, что AI score остаётся на месте, является столь распространённым опытом. Словарь изменился. Шаблон, который оценивает classifier, не изменился, поэтому текст по-прежнему читается как машинно написанный, именно так, как, согласно категории paraphrase в Turnitin, и должно быть.

Распределение длины предложений сохраняется после переписывания

Проза, созданная машиной, укладывается в узкий диапазон длин предложений, потому что model, предсказывающая по одному token за раз, не имеет причин делать четвёртое предложение короче третьего. Человеческое письмо, напротив, распределяется иначе: предложение из девятнадцати слов, затем из шести слов, затем из тридцати двух слов, в котором утверждение и его оговорка соединены вместе. Собственное пояснение GPTZero прямо называет это, определяя burstiness как меру того, насколько сильно в документе варьируются patterns письма и text perplexities.

Замена синонимов меняет длину предложения на одно или два слова, и так же немного меняет длину каждого предложения, поэтому распределение сохраняет свою форму. Абзац, который до обработки содержит восемнадцать, девятнадцать, семнадцать и двадцать слов, после неё будет укладываться в тот же плоский профиль с отклонением всего на одно или два слова.

Это можно измерить, не прибегая к detector. free burstiness checker показывает, насколько велика вариативность на уровне предложений в отрывке, и если прогнать через него один и тот же абзац до и после paraphrase pass, число почти не изменится, хотя vocabulary полностью поменяется.

Порядок придаточных частей и переходы тоже сохраняются

Порядок придаточных предложений, это вторая структурная особенность, которую парафразер оставляет без изменений, и она заметнее для читателя, чем длина предложения. Машинная проза обычно выносит тему в начало, затем формулирует утверждение, а потом добавляет в конце уточняющее придаточное предложение, снова и снова. «Хотя размер выборки был ограничен, результаты позволяют предположить» и «Хотя необходимы дальнейшие исследования, полученные данные указывают» это одно и то же предложение, облаченное в разные слова.

Инструмент для перефразирования преобразует «while» в «although», а «suggest» в «show». Он не решает, что уточнение должно быть вынесено в отдельное короткое предложение тремя строками ниже, или что оговорку следует убрать полностью. Это редакторское суждение о том, что именно утверждает абзац, а у механизма подстановки нет мнения по поводу аргумента.

Переходные связки, это третья и наиболее заметная особенность. Модели тяготеют к небольшому, устойчивому набору связок на стыках: however, additionally, furthermore, in addition. Парафразер заменяет одну из них другой из того же набора, так что классификатор по-прежнему видит стандартную переходную связку из ожидаемого распределения в ожидаемой позиции. Это тот сигнал, который он считывал ещё до начала переписывания.

Признак, который считывает классификаторИзменяется при проходе парафразированияПочему
Индивидуальный выбор словДа, существенноЭто единственный признак, который механизм подстановки предназначен изменять
Длина предложения и её вариативностьПочти нетПодставляемые слова близки по длине, поэтому профиль сохраняется
Порядок придаточных предложений внутри предложенияРедкоПерестановка меняет акцент, а ограничение на смысл это сдерживает
Связки на стыкахЗаменяются внутри того же небольшого набораОдна стандартная переходная связка заменяет другую стандартную переходную связку
Предсказуемость следующего словаНемногоБолее редкий синоним менее ожидаем, но рамка вокруг него остаётся столь же предсказуемой, как и прежде
Конкретные доказательства и деталиНетПереписывание не может добавить материал, которого никогда не было в черновике

Что на самом деле меняет результат

Обе системы реагируют на разные симптомы одной и той же поверхностной переработки, поэтому и исправление для обеих одно и то же, нужно менять письмо, а не слова. Это означает перестраивать предложения, а не переставлять их содержимое, сознательно варьировать длину предложений, убирать общие связки, к которым по умолчанию прибегает модель, и добавлять поддерживающие детали, достаточно конкретные, чтобы они могли исходить только из того исходного материала, который вы действительно прочитали. Показатель сходства снижается, потому что структура больше не повторяет источник. Показатель AI снижается, потому что исчезает тот шаблон, который оценивает классификатор.

Инструмент для парафразирования не может выполнить эту работу, и разницу между двумя категориями инструментов стоит понять до оплаты любого из них, что TextPulse рассматривает в AI humanizer versus paraphraser. Проверка собственной предсказуемости черновика на уровне слов с помощью free perplexity checker показывает шаблон, на который реагирует классификатор, полезнее, чем один только балл.

AI humanizer for students от TextPulse работает со структурной стороной проблемы, перестраивая ритм предложений, вариативность длины и порядок придаточных частей вместо замены отдельных слов, именно это и оставляет широко открытым пробел, который возникает при проходе только по синонимам. Для учебных работ в частности humanizing an AI essay for college описывает весь рабочий процесс от начала до конца, а whether Turnitin detects DeepSeek отвечает на тот же вопрос для другой модели.

Ничто из этого не меняет того, что разрешает или не разрешает политика использования AI в вашем курсе, и ни один подход к переработке текста не исправляет балл задним числом. Перед тем как что-либо сдавать, стоит проверить, можете ли вы объяснить, предложение за предложением, почему работа перед вами говорит именно то, что она говорит.

XLinkedInFacebook

Часто задаваемые вопросы

Да. Его механизм сходства сравнивает работу с веб-контентом, публикациями и ранее сданными работами, поэтому перефразированные фрагменты, которые по-прежнему совпадают с источником, сохраняют совпадения по характерным терминам, цитатам и структуре предложений. Отдельно отчет о написании ИИ содержит обозначенную категорию для текста, сгенерированного ИИ и переработанного с помощью инструмента для парафразирования ИИ или word spinner, что, как подтверждает собственная документация Turnitin, он и предназначен выявлять.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.