AI Humanization

Может ли Turnitin обнаружить очеловеченный AI-текст?

Turnitin утверждает, что его индикатор AI-письма уже охватывает текст, пропущенный через humanizer. Что означает и чего не означает это утверждение, почему очеловеченный документ иногда всё же получает высокий балл, а иногда нет, и чего стоит это число для студента в любом случае.

12 min
Turnitin AI writing report panel illustrating can turnitin detect humanized text, with per-sentence scores averaged into one document percentage

Turnitin отвечает на этот вопрос на своём сайте поддержки, и ответ более конкретен, чем любая из сторон обычного спора. Его индикатор AI writing, Turnitin says, уже включает обнаружение контента, сгенерированного AI, который мог быть очеловечен или пропущен через bypasser, чтобы избежать обнаружения. Это описание собственного продукта самим поставщиком. Это также правильная отправная точка, потому что оно показывает, что, по утверждению модели, входит в её охват.

Итак, может ли Turnitin обнаруживать очеловеченный текст? Вопрос имеет более узкую и более полезную форму. Модель Turnitin не ищет отпечаток humanizer и не ведёт список инструментов. Она оценивает прозу предложение за предложением, определяя, насколько письмо соответствует статистическим паттернам машинно сгенерированного текста, а затем усредняет эти оценки по всему документу. Сохранится ли у очеловеченного фрагмента высокая оценка, зависит от того, насколько переписывание изменило этот паттерн, и от того, какая часть документа была переписана вообще.

Может ли Turnitin обнаруживать очеловеченный текст? Что утверждает Turnitin

Их опубликованная позиция, это однозначное да. Отвечая на вопрос, может ли он обнаруживать контент, пропущенный через humanizer, их руководство утверждает: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." На той же странице дан тот же ответ для инструментов AI paraphrasing.

Это утверждение не появляется как отдельное число где-то в отчёте. Turnitin включает его в единый процент AI writing, и опубликованное определение этого процента прямо говорит об этом: он охватывает текст, который модель определяет как, вероятно, сгенерированный AI, или как, вероятно, сгенерированный и затем изменённый с помощью AI paraphraser или bypasser. Оценка одна, и она уже учитывает переписывание настолько, насколько это позволяет модель.

Внимательно прочитайте, это утверждение о покрытии, а не об точности. Turnitin говорит, что humanized text входил в область применения, когда модель создавалась. Это далеко не означает, что каждый humanized document получает высокий балл, и его собственные опубликованные цифры, ниже, описывают модель, которая рассматривает отдельные предложения как неопределенные.

Что на самом деле оценивает индикатор AI Writing

Это не процент. Это доля текста, поэтому это не уровень уверенности. Это мера того, какая часть текста в вашем документе, по мнению нашей модели, вероятно, сгенерирована AI. Мы называем это qualified text, то есть это прозаические предложения в формате длинного текста. Оно не включает маркированные списки, код, таблицы или короткие фрагменты. Именно поэтому вы можете видеть разные числа для одной и той же работы в зависимости от того, какая часть ее представляет собой связную прозу.

Механизм, лежащий в основе, достаточно прост, чтобы его можно было представить. Turnitin разбивает документ на перекрывающиеся сегменты примерно по несколько сотен слов, примерно по пять, десять предложений каждый, с перекрытием так, чтобы каждое предложение оценивалось в контексте. Каждому предложению присваивается значение от 0 до 1. Затем оценки сегментов усредняются по всему документу, чтобы получить одно число, которое видит преподаватель. Пошаговое описание how Turnitin detects AI подробнее разбирает каждый этап.

Этот шаг усреднения важнее для humanized text, чем что-либо еще в конвейере, и именно его почти никто не учитывает. Показатель, который читает преподаватель, представляет собой арифметическое среднее оценок на уровне сегментов. Документ может быть наполовину переписан и оказаться где-то посередине по причинам, которые мало связаны с тем, насколько удачной была переработка.

Почему humanized output иногда все равно получает высокий балл

Самая распространённая причина, это охват. Humanizer, применённый к введению и заключению, оставляет обзор литературы и обсуждение без изменений, и эти фрагменты напрямую вносят свои исходные оценки в среднее значение. В длинной главе переписывание первых страниц изменяет лишь несколько сегментов и оставляет остальные точно такими, какими они были, что даёт меньшее смещение, чем ожидает автор от работы, которая казалась существенной.

Вторая причина, это глубина переписывания. Проход, который заменяет лексику, сохраняя длину предложений, порядок придаточных частей и выбор связок, оставляет шаблон, на котором обучался классификатор, в значительной степени нетронутым. Модель оценивает форму прозы, поэтому изменение того, какие слова заполняют эту форму, даёт меньший эффект, чем предполагает большинство людей. free perplexity checker покажет, насколько предсказуемо фрагмент всё ещё читается после переписывания, и это более информативный сигнал, чем сравнение на уровне слов до и после.

Третья причина состоит в том, что переписывание может внедрять собственную регулярность. Программа, которая применяет одно и то же преобразование к каждому абзацу, создаст новый шаблон, который будет столь же регулярным, как и старый. Если в каждом предложении есть один и тот же тип соединительного разреза, или если в каждое предложение в одном и том же месте добавляется один и тот же тип оговорочной конструкции, то классификатор будет воспринимать эти предложения как столь же равномерные, как если бы они изначально все были одной длины.

СитуацияЧто делает оценка AIПочему
Была переписана только часть документаПадает меньше, чем ожидаетсяНетронутые фрагменты сохраняют свои исходные оценки в среднем значении
Словарь изменён, структура предложений сохраненаМеняется очень малоКлассификатор оценивает шаблоны на уровне предложений, которые замена оставила на месте
Предложения действительно перестроены по всему текстуМеняется сильнееЕдинообразный ритм, который модель была обучена распознавать, нарушается
Подано менее 300 слов прозыОценка вообще не генерируетсяTurnitin требует 300 слов подходящей прозы, прежде чем сообщить процент
Результат оказывается ниже 20 percentЗвёздочка вместо числаTurnitin помечает результаты в этом диапазоне как менее надёжные

Почему одна и та же переработка иногда даёт низкую оценку

Очеловеченный документ может вернуться с низкой оценкой по причинам, не связанным с переработкой текста. Turnitin требует как минимум 300 слов подходящей прозы, прежде чем вообще сгенерирует процент AI, и этот порог был повышен с исходных 150 слов на заявленном основании, что точность улучшается при немного большем объёме текста. Короткий рефлексивный текст не даёт числа, а отсутствие оценки не то же самое, что чистая оценка.

Turnitin помечает диапазон ниже 20 percent звёздочкой вместо точного процента, потому что в этом диапазоне выше частота ложноположительных результатов. На момент запуска в образовательных сообщениях также говорилось об этом поведении, указывая, что результаты, заявленные как менее 20 percent AI-written, имели более высокую частоту ложноположительных результатов, и поэтому Turnitin добавил предупреждения. Документ, попавший в эту полосу, был отмечен как диапазон, который Turnitin отказывается сообщать точно, и это не то же самое, что быть признанным чистым.

Существует также институциональный барьер, стоящий над всем этим. Turnitin обрабатывает работу для выявления AI writing detection только если учреждение включило эту функцию, и администраторы могут отключить её для всей учётной записи. Vanderbilt University сделала именно это в августе 2023 года, сославшись на опубликованный тогда Turnitin показатель ложноположительных срабатываний в 1 percent на примерно 75,000 ежегодных работ, предвзятость против авторов, для которых английский не является родным, и отсутствие прозрачности в том, как работает модель. У студента в учреждении, где функция выключена, нет AI score ни у одной работы, humanized или иной.

И когда переписывание действительно было структурным, score может снижаться, потому что измеряемый pattern изменился. Turnitin сообщает оценку, вычисленную на основе writing patterns, поэтому текст, чьи patterns отличаются, получает иной score. Механизм действует в обе стороны, и именно это вызывает неудобство: оригинальный человеческий текст иногда получает высокий score по той же самой причине.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Что утверждает каждый поставщик humanizer, и что документально подтверждено

Одно правило определяет таблицу. Средний столбец содержит собственный маркетинговый язык поставщика, взятый с его собственного сайта, где бы этот сайт ни служил источником. Правый столбец фиксирует, что на самом деле стоит за каждым утверждением, а в большинстве случаев это вообще не набор данных, не дата и не метод. Публичного прямого сравнения для этих брендов не существует.

БрендЧто заявляет поставщикЧто задокументировано
Undetectable.aiУказывает прохождение AI detectors как функцию продукта без привязанной цифры и предлагает вернуть стоимость humanization, если результат помечен как не человеческийВозврат денег является коммерческим условием, за заявлением не стоит ни набор данных, ни дата, ни результат по каждому detector
QuillBotНа своих отдельных страницах не делает заявлений о detection или bypass для функции humanizer. Его отдельный AI detector описывается только как средство обнаружения AI-generated contentQuillBot продает humanizer внутри общего набора инструментов для письма и не делает для него специфического заявления о Turnitin
WriteHumanЗанимает первое место в Humanizer Leaderboard и описывается как premium AI humanizer для серьезного письмаВ leaderboard не указаны ни методология, ни выборка, а WriteHuman не привязывает к этому ранжированию числовой показатель точности
Walter Writes AIПродвигает широкую humanization на более чем 80 языках без специфического заявления о TurnitinНет тестовых данных ни в пользу, ни против
HIX BypassПродвигает страницы bypass для каждого detector отдельно без специфической для Turnitin цифрыHIX Bypass и BypassGPT являются отдельными продуктами на отдельных доменах, поэтому следует уточнять, о каком из них идет речь в заявлении
StealthGPTСредний показатель human на Turnitin 98% и 95% на GPTZero, каждый из указанного прогона в 30 samples с нулевыми detections, плюс гарантия возврата денег, если подписчик обнаруженСамостоятельно заявлено. Рядом с цифрами не опубликованы ни набор данных, ни отбор samples, ни дата, ни метод, а 30 документов это небольшой прогон для заявления о модели, оценивающей миллионы submissions
PhraslyПозиционирует себя как средство удаления AI detection, тестовые данные не публикуетПубличных заявлений ни в одну, ни в другую сторону нет. Цифры, которые циркулируют в обзорах, являются вторичными и по принципу исключены здесь
GrammarlyВообще не продвигает свое rewriting как bypass detection. На странице AI detector заявляет о 99% accuracy обнаружения и о первом месте в независимом benchmark RAIDНа той же странице Grammarly указано, что ни один AI detector не является 100% accurate. Функция Authorship помечает текст как набранный человеком, созданный с помощью AI или отредактированный с помощью Grammarly
TextPulseПоказатель прохождения 92.33% на Turnitin AI, 89.12% на Originality.ai и 87.91% на GPTZero, измеренный на академическом корпусе из 2,000 documentsИзмерено и опубликовано TextPulse, поэтому это самоотчет, как и каждая цифра выше. Размер корпуса и detectors названы, но для любого отдельного document не обещается определенный результат detector

Из этой таблицы вытекают три вещи. Большинство этих инструментов вообще не публикуют никакого утверждения о детекторе, которое можно было бы проверить. Некоторые привязывают число к размеру выборки, и это уже больше, чем удаётся остальной части категории. И ни один из них не публикует набор данных, который кто-либо вне компании мог бы самостоятельно запустить. Однако следует признать заслугу каждого бренда там, где она есть. Undetectable.ai сопровождает своё утверждение гарантией возврата средств, и это конкретное обязательство, а не прилагательное. WriteHuman публикует точные лимиты запросов и слов по каждому тарифу, так что покупатель знает, что он получает. Grammarly оговаривает собственный показатель точности на той же странице, где его приводит, и это больше, чем делают большинство поставщиков детекторов. А отказ QuillBot вообще делать утверждение о обходе является самой обоснованной позицией в списке.

Почему никто вне поставщика не может проверить эти числа

Поставщик humanizer, заявляющий о проценте прохождения Turnitin, описывает прогоны, выполненные через контролируемую им учётную запись, на документах, которые он сам выбрал, в дату, которую он обычно не указывает, в отношении классификатора, который Turnitin пересматривает по мере выхода новых языковых моделей. Это верно для показателя StealthGPT в тридцать образцов и столь же верно для показателя в 2,000 документов, который публикует этот сайт. Размер корпуса влияет на то, сколько шума содержится в числе. Он не превращает самоотчёт в аудит.

Другая половина проблемы состоит в том, что собственный список моделей Turnitin, которые, как утверждается, он способен обнаруживать, редактируется по мере появления новых выпусков. Этот показатель прохождения, измеренный относительно классификатора прошлого квартала, описывает классификатор прошлого квартала и больше ничего. Почему это означает, что никто не может назвать лучший AI humanizer для обхода Turnitin, отдельно изложено ниже. Каждое число на каждой домашней странице humanizer, включая этот сайт, представляет собой снимок, к которому привязана дата, которую поставщик, возможно, никогда не публиковал.

Как читать утверждение об обходе, прежде чем платить за него

Четыре вопроса отделяют утверждение, которое стоит взвесить, от утверждения, которое стоит игнорировать, и они применимы к каждой строке в таблице выше, включая последнюю.

  • Сколько документов было протестировано и кто их выбрал? Процент без указания размера выборки, это лозунг, которому придали вид числа.
  • На какую дату и против какой версии детектора? Модели обнаружения пересматриваются по мере выхода новых языковых моделей, и показатель прохождения без даты быстро устаревает.
  • Гарантия, это возврат денег или результат? Обещание возврата средств переносит небольшой финансовый риск и вообще ничего не делает с комиссией по академической добросовестности.
  • Что, по словам поставщика, происходит с цитатой, техническим термином или блочной цитатой? На большинстве страниц humanizer об этом ничего не сказано, и это само по себе ответ.

Именно этот последний вопрос решает больше, чем арифметика детектора, для любого, кто сдаёт академическую работу. Переписывание, которое получает высокий балл и тихо обобщает предложение из раздела методов, лишает вас того, за что вас оценивали. академический humanizer TextPulse документирует сохранение цитирования в APA, MLA, IEEE, Chicago, Harvard и Vancouver, freeze terms для фиксации точной лексики до запуска прохода, а также обучение на рецензируемых академических текстах с выходом, удерживаемым в пределах Flesch-Kincaid grade 13 to 18. Это утверждения о том, что происходит с текстом, а это иной тип утверждения, чем процент по детектору, и читатель может проверить их в результате в течение минуты.

Что означает оценка для студента в любом случае

Turnitin ясно указывает, что индикатор AI writing не является установлением нарушения. На странице продукта Turnitin прямо сказано, что Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." Там также ясно указано, что Turnitin предоставляет информацию, чтобы преподаватели могли принять обоснованное решение на основе политики своего учреждения. Это дополнительно подчёркивается предупреждением о том, что модель "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."

Студенты по умолчанию не видят оценку. Turnitin прямо указывает, что индикатор и отчет о выявлении AI writing detection не видны студентам, и единственный способ их увидеть состоит в том, что преподаватель загружает отчет в формате PDF и передает его. Студент, проверяющий собственный черновик, использует другой инструмент, обученный на других данных, и эти два числа не обязаны совпадать.

Тем самым остается то, что не решается никакой оценкой. Было ли использование AI вообще разрешено, это вопрос курса и учреждения, а AI use policy отвечает на него так, как не отвечает ни один процент. Высокая оценка при разрешенном и раскрытом использовании, это разговор с доказательствами. Низкая оценка при нераскрытом использовании, которое запрещено политикой, все равно остается нераскрытым использованием.

Для автора, редактирующего собственный черновик, практическое прочтение всего этого состоит в том, что оценка следует за текстом. Модель Turnitin измеряет шаблон на уровне предложений по всему документу, поэтому частичные переписывания дают частичное смещение, а замены словаря дают очень небольшое смещение или не дают его вовсе. Полное руководство how to humanize AI text последовательно разбирает структурные правки, которые меняют шаблон, в том порядке, который сдвигает его сильнее всего.

AI humanizer от TextPulse применяет эти структурные правки ко всему документу сразу и сообщает предполагаемый Human Score, вычисленный на основе самого текста, а не предсказание того, что скажет какой-либо названный детектор. Ни один инструмент не может обещать результат в Turnitin, потому что ни один инструмент не может видеть внутреннее устройство модели Turnitin. Любой продукт, который утверждает обратное, описывает результат, который он не может наблюдать.

Различие между humanizer и paraphraser здесь имеет значение, как и причина, по которой перефразированный текст все равно помечается.

Число здесь наименее интересная часть. Исход определяют двадцать минут после того, как проверяющий смотрит на работу: может ли текст показать ход рассуждений, историю черновиков, набор заметок, источники, о которых автор может говорить, не открывая их. Эти доказательства доступны любому, кто выполнял работу, и они сохраняются, даже если переписывание не смогло изменить оценку.

XLinkedInFacebook

Часто задаваемые вопросы

В собственных рекомендациях Turnitin говорится, что его AI-индикатор включает обнаружение контента, который мог быть очеловечен или пропущен через bypasser. На практике продукт выводит процент текста, который соответствует критериям, а не вердикт об авторстве. Поэтому практический ответ на вопрос, может ли Turnitin обнаружить очеловеченный текст, состоит в том, что оценка отражает, какая часть машинного шаблона письма сохранилась после переписывания.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.