Как Turnitin обнаруживает AI, шаг за шагом
Детектор AI-письма Turnitin не читает документ как единое целое. Он сегментирует работу на фрагменты, оценивает каждый из них, усредняет результаты и только затем выводит процент в отчёте. Здесь рассматривается этот процесс, то, что он отмечает в ChatGPT, Claude и Gemini, что показало независимое тестирование в части пропусков, и кто на самом деле видит этот показатель.
Отчет Turnitin может выдать одно число, скажем сорок два процента, и почти ничего больше не сказать о том, как он был получен, если только кто-то не начнет искать механизм, стоящий за ним. Это число не считывается с документа в целом и не является догадкой. Это результат конкретного, документированного конвейера, который работает одинаково для каждой отправки.
Итак, как Turnitin обнаруживает AI? Разбивая отправку на части, оценивая их по отдельности на основе того, сгенерированы ли они, вероятно, AI или сгенерированы AI и затем перефразированы, и усредняя эти оценки, чтобы определить общий процентный показатель, отображаемый в отчете. Каждый этап этого конвейера описан в собственной документации Turnitin, а не восстановлен путем обратной разработки извне.
Здесь речь идет именно о функции обнаружения AI writing в Turnitin, отдельной системе от более старой проверки similarity или plagiarism, которая сопоставляет отправку с другими документами. Механика, описанная ниже, входит в более широкий вопрос о том, как AI detectors на самом деле работают, и Turnitin является полезным наглядным примером именно потому, что публикует больше сведений о своем методе, чем большинство поставщиков. Далее сначала рассматривается конвейер, затем то, что он отмечает на практике, что показало независимое тестирование о его пропусках, и кто именно внутри учреждения видит результат.

Как Turnitin обнаруживает AI? Конвейер в кратком изложении
Детектор AI writing в Turnitin выполняет четыре шага в фиксированном порядке. Сначала он проверяет, достаточно ли в документе подходящего прозаического текста, чтобы вообще можно было выставить оценку. Затем он делит этот текст на сегменты по несколько сотен слов каждый. После этого модель оценивает каждый сегмент по отдельности. Наконец, оценки сегментов усредняются в единый процент на уровне документа, который и видит читатель.
Отчет AI Writing не является отчетом о сходстве
Отчет AI writing в Turnitin представляет собой отдельный продукт, отличный от отчета о сходстве, который проверяет на плагиат. Они работают на разных моделях и отображаются на разных вкладках в одном и том же интерфейсе. Показатель сходства сравнивает загруженную работу с базой данных ранее опубликованных источников и других студенческих работ, а затем возвращает процент совпадения. Показатель AI делает нечто иное: классификатор читает прозаический текст, присваивает каждому оцененному сегменту вероятность того, что он был сгенерирован AI, и сводит эти оценки к единому проценту для всего документа. Поскольку они измеряют разные вещи, у одной и той же работы показатель сходства может составлять 2 процента, а показатель AI, 60 процентов, или наоборот.
Процент AI также уже, чем может показаться. Он описывает долю подходящего прозаического текста, который, по прогнозу модели, был написан AI, а не весь документ, поскольку блоки кода, маркированные пункты, заголовки и краткие формы письма удаляются до расчета показателя. На момент написания этот детектор работает только с текстом на английском, испанском и японском языках.
Шаг первый: разбиение документа на фрагменты
Прежде чем что-либо оценивается, модель Turnitin делит загруженную работу на фрагменты по несколько сотен слов каждый, примерно по пять, десять предложений на фрагмент. Разбиение выполняется первым, потому что модель была создана для оценки фрагмента такого размера, а не одного предложения и не всей диссертации за один проход.
В зачёт фрагмента идёт только прозаический текст. Модель была разработана для чтения длинных текстов. Документ, который содержит и прозаический текст, и таблицы или код, будет оценён как содержащий некоторый процент прозаического текста, но может не описывать весь прозаический текст в документе. Это связано с тем, что детектор оценивает набор данных, который не включает блоки кода, маркированные пункты или краткий текст. Поэтому документ может вернуть процент, который описывает только часть того, что было отправлено.
Оценка на уровне фрагмента имеет менее заметное последствие, которое стоит назвать. Одно предложение, сгенерированное AI, находящееся внутри в остальном написанного человеком фрагмента в несколько сотен слов, усредняется вместе со всем остальным в этом фрагменте, поэтому его влияние на собственную оценку этого фрагмента ослабляется тем, сколько окружающего текста, написанного человеком, разделяет тот же фрагмент. Короткая вставка, сгенерированная AI, всё равно достигает модели. Просто она имеет меньший вес, чем фрагмент, который сгенерирован AI от первого слова до последнего.
Шаг второй: оценка каждого сегмента
Каждый фрагмент оценивается отдельно, независимо от любого другого фрагмента в документе. Модель предсказывает, является ли этот конкретный отрезок текста написанным человеком, сгенерированным AI или сгенерированным AI и затем перефразированным, то есть различает три категории, а не отвечает простым да или нет.
Это отдельная категория, а не просто расширение сгенерированного AI, указывает на то, что существует реальная проблема, связанная с тем, что перефразирование ослабляет обнаружение. Это подтверждается исследованием 2023 года, которое показало, что пропуск сгенерированного AI текста через специализированную модель перефразирования снижает точность исследовательского детектора под названием DetectGPT с 70.3% до 4.6% при постоянном уровне ложноположительных срабатываний 1%. Не похоже, что Turnitin публиковала что-либо о том, насколько их собственный трёхкатегорийный классификатор устойчив к той же технике. Эта категория существует по документированной причине.
Оценивание на уровне фрагментов, а не на уровне всего документа, является сознательным проектным решением. Диссертация на девяносто страниц с двумя абзацами, написанными с помощью AI, и эссе на пять страниц, полностью написанное с помощью AI, представляют собой разные задачи, и усреднение по фрагментам позволяет одному числу на уровне документа отражать это различие, а не сглаживать его.
Turnitin не публиковал внутреннюю архитектуру этой модели по фрагментам с той же степенью детализации, что и шаги своего конвейера. Это классификатор с обучением под надзором, обученный на размеченных примерах, а не простой порог на основе того сырого показателя следующего токена, который рассматривается в руководстве TextPulse о том, что именно измеряет perplexity в AI detection, хотя та же лежащая в основе идея, необычно предсказуемый текст, почти наверняка является частью того, что такой классификатор учится распознавать.
Шаг третий: усреднение в процент на уровне документа
Оценки по фрагментам усредняются в единый процент, который отображается в отчете. Этот процент представляет долю соответствующего критериям прозаического текста, только текстов длинной формы, которую модель прогнозирует как сгенерированную AI или сгенерированную AI и затем перефразированную. Это доля оцененных сегментов, а не утверждение о том, что точная часть слов документа была буквально набрана машиной.
Процент в отчете является средним значением. Именно поэтому два документа, которые оба показывают сорок процентов, могут выглядеть по-разному при более внимательном рассмотрении. В одном сорок процентов фрагментов могут быть оценены как полностью сгенерированные AI. В другом каждый фрагмент может быть оценен как частично вероятный, что в среднем дает то же итоговое число. Это не показывает, какой именно шаблон его породил.

Может ли Turnitin обнаружить ChatGPT, Claude или Gemini?
Обычно да, когда документ содержит значительный объём текста, написанного с помощью ИИ, и классификатору не важно, какой именно поставщик его создал. Turnitin заявляет, что его модель ищет не название бренда, а характерный шаблон письма, и с момента первоначального запуска GPT-3.5 и GPT-4 в 2023 году охват неоднократно расширялся. В текущих рекомендациях среди систем, против которых она обучена, названы серии GPT-5, Gemini и Claude, а новые версии моделей добавляются на постоянной основе. Студент, который использовал вместо этого Gemini, Claude или DeepSeek, не обходит детектор просто за счёт выбора другой компании.
Доля работ, на которые это влияет, выросла. Примерно 15 процентов эссе, которые Turnitin проверил в период с октября 2025 года по февраль 2026 года, показали 80 процентов или более текста, сгенерированного ИИ, тогда как на момент запуска инструмента в апреле 2023 года этот показатель составлял около 3 процентов.
Перефразированный текст ИИ получает отдельную категорию, а не проходит без проверки, именно это и представляет собой описанная выше трёхчастная классификация. В документации Turnitin текст, который система считает только сгенерированным ИИ, отделён от текста, который она считает сгенерированным ИИ и затем перефразированным ИИ, а в августе 2025 года была добавлена функция обнаружения, нацеленная специально на инструменты обхода ИИ, созданные для переписывания машинного вывода так, чтобы он проходил мимо детектора. Это не означает, что перефразирование бесполезно или что каждый переписанный фрагмент будет обнаружен. Это означает, что предположение о том, будто перефразированный текст по умолчанию невидим для Turnitin, уже давно устарело. То, что инструмент делает с перефразированным текстом в частности, и с выводом DeepSeek, рассматривается отдельно.
Очеловечить свою работу
Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.
Минимальное требование к числу слов и порог со звёздочкой
Чтобы детектор ИИ Turnitin вообще выдал оценку, в работе должно быть не менее 300 слов подходящего прозаического текста, тогда как ранее минимальный порог составлял 150 слов. При меньшем объёме текста просто недостаточно материала, чтобы работал процесс сегментации и усреднения.
Порог в 300 слов соответствует размеру одного блока оценки, описанного ранее, то есть нескольким сотням слов, пяти-десяти предложениям. Документ, находящийся ровно на минимуме, фактически передаёт конвейеру для усреднения лишь примерно один блок подходящего текста, а не несколько, и именно поэтому отчёт, находящийся около этого порога, с большей вероятностью попадает в менее надёжный диапазон, который следующий порог и предназначен отмечать.
Turnitin также не отображает процент ниже порога в 20%. С июля 2024 года в отчёте вместо числа рядом со знаком процента показывается звёздочка. Именно эта особенность поведения отчёта вызывает больше путаницы, чем любая другая часть конвейера, поэтому ниже ей посвящён отдельный раздел.
| Условие | Что показывает отчёт | Почему |
|---|---|---|
| Менее 300 слов подходящей прозы | Вообще никакой оценки AI | Недостаточно текста, чтобы конвейер сегментации и усреднения мог надёжно работать |
| Оценка была бы ниже 20% | Звёздочка рядом со знаком процента, а не число | Собственная документация Turnitin сообщает о заметно более высокой доле ложноположительных срабатываний в этом диапазоне |
| Оценка 20% или выше | Конкретный процент | Turnitin считает его достаточно надёжным, чтобы отображать в виде числа |
Что означает оценка со звёздочкой в Turnitin?
Звёздочка в отчёте Turnitin AI writing означает, что модель обнаружила некоторый объём AI writing, но менее 20 процентов документа, и Turnitin отказывается публиковать число в этом диапазоне. Там, где обычно стоял бы процент, в отчёте вместо него показывается звёздочка рядом со знаком процента. Собственная продуктовая документация Turnitin прямо говорит об этом: "When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed."
Таким образом, звёздочка не является ошибкой, не означает отсутствующий результат и не указывает на то, что при загрузке что-то пошло не так. Это сознательное решение поставщика не указывать значение, которое он не считает достаточно надёжным для печати.
Почему Turnitin скрывает число ниже 20 percent
Потому что именно в этом диапазоне инструмент с наибольшей вероятностью ошибается, а собственное обещание точности Turnitin не распространяется на него. Компания обязуется удерживать долю ложноположительных результатов "under 1% for documents with over 20% of AI writing". Внимательно прочитайте рамки этого обещания: в него встроен нижний предел, и этот предел составляет те же 20 percent. Ниже этой границы компания не заявляет о той же надёжности, поэтому вместо того, чтобы печатать небольшое число, которое читатель неизбежно воспринял бы как точное, она не печатает ничего. Звёздочка существует, чтобы избежать ложноположительных результатов, то есть чтобы не передавать преподавателю значение, которое исказило бы документ, написанный человеком.
Логика этого решения соответствует механизму, описанному ранее. Оценка на уровне документа представляет собой среднее по фрагментам в несколько сотен слов. Когда лишь небольшая доля этих фрагментов получает оценку как AI, полученное среднее опирается на очень слабый сигнал, и конвейер не может надёжно отличить подлинные 8 percent от ложных. Сокрытие числа является честным ответом на это, и тот же подход лежит в основе минимального порога в 300 words.
Что звёздочка означает на практике в университете
На практике большинство учреждений рассматривают звёздочку как нечто, на что не нужно реагировать, и читают её как низкий результат, согласующийся с работой, написанной человеком. Логика здесь проста. Если поставщик, создавший детектор, не готов подтверждать значение в этом диапазоне, у преподавателя нет ничего существенного, что можно было бы предъявить студенту, не говоря уже о том, чтобы выносить это на рассмотрение комиссии по нарушениям. Для большинства процедур академической добросовестности отчёт со звёздочкой функционально эквивалентен чистому отчёту.
Это описание того, как используется результат, и это важно знать, если вы смотрите на такой отчёт. Это не то же самое, что вывод о том, чем документ является на самом деле, и это различие важно в обе стороны.
Что не означает звёздочка
- Это не свидетельство человеческого авторства. Turnitin отказывается уверенно оценивать документ, и это утверждение относится к детектору, а не к автору.
- Это не то же самое, что ноль. Документ без какого-либо AI writing и документ с одним абзацем, написанным с помощью AI, могут дать одну и ту же звёздочку, и именно поэтому число не показывается.
- Это нельзя сравнивать между отправками. Две звёздочки говорят лишь о том, что оба документа оказались ниже одного и того же порога, и ничего не говорят о том, как они соотносятся друг с другом.
- Это не показатель similarity score. Сопоставление на плагиат является отдельным отчётом на отдельной вкладке, и в нём отображается собственный процент независимо от того, что показывает AI indicator.
Практический вывод, который стоит запомнить, состоит в том, что лёгкая правка с помощью AI, один абзац, переписанный с помощью, а остальной текст написанный без посторонней помощи, часто приводит к звёздочке, а не к небольшому проценту. Ни наличие, ни отсутствие числа само по себе не решает вопрос, и к тому же выводу с другой стороны приходят приведённые ниже показатели точности.
Что Turnitin утверждает о точности, и чьи это числа
Turnitin публикует собственные показатели точности, и их следует читать именно так, как они и представлены, как собственные валидационные числа поставщика, а не как независимый аудит. Опубликованные материалы утверждают уровень false-positive ниже 1% для документов, которым модель присваивает более 20% AI writing, порог, который совпадает с описанным выше отсечением для звёздочки. Позднее та же программа была расширена на образцы письма English Language Learner в ответ на исследования смещения детектора.
Turnitin утверждает, что оно проверило эту цифру на большом базовом наборе работ, написанных людьми и поданных до появления ChatGPT. Материалы Turnitin непоследовательны в отношении точного размера этой базы, страница FAQ ссылается на 700,000 работ, тогда как в блоге Chief Product Officer Turnitin указано 800,000, при этом к обеим цифрам привязано одно и то же утверждение о менее чем 1%. Материалы Turnitin также описывают компромисс, по собственному изложению компании, более агрессивное выявление контента, сгенерированного ИИ, означает пропуск примерно 15% такого контента.
Компания также публично пересматривала собственные утверждения. В 2023 году, вскоре после запуска, chief product officer Turnitin признал, что лабораторные испытания не предсказали, сколько ложноположительных результатов появится при реальном использовании, особенно в коротких работах, и сообщил о ложноположительной частоте на уровне предложения около 4 percent. Повышение минимальной длины, подлежащей оценке, с 150 до 300 слов стало ответом на этот разрыв.
Если рассматривать эти цифры вместе, они описывают конкретный компромисс, а не одно число точности. Ложноположительная частота ниже 1% звучит почти пренебрежимо, пока ее не соотнесут с тем, сколько работ проходит через систему, а частота пропуска 15% означает, что значительная доля контента, сгенерированного ИИ, по замыслу оценивается как человеческий, а не из-за сбоя. Собственные материалы Turnitin представляют оба числа как предполагаемый баланс системы, а не как доказательство того, что инструмент просто прав или просто ошибается.
Что показало независимое тестирование
Независимое тестирование добавляет детали, которых нет в цифрах поставщика, в том же духе, что и более широкое независимое тестирование детекторов ИИ, которое снова и снова выявляет разрыв между лабораторными условиями и реальными работами. Центр по развитию преподавания Temple University провел одно из наиболее тщательных доступных исследований. Исследователи подали 120 образцов письменных работ, поровну разделенных между полностью человеческим письмом, полностью сгенерированным ИИ письмом, сгенерированным ИИ письмом, пропущенным через инструмент перефразирования, и гибридными текстами, сочетающими вклад человека и ИИ, и зафиксировали, что Turnitin выдал для каждого из них.
Инструмент корректно определил 93 percent образцов, полностью написанных человеком, и 77 percent образцов, полностью сгенерированных AI. На более сложных вопросах точность снизилась ещё сильнее. Turnitin точно определил лишь 63 percent перефразированных образцов AI как сгенерированные AI, и только 43 percent гибридных образцов как не полностью человеческие и не полностью AI. Это те категории, которые ближе всего к тому, как на самом деле создаются тексты с помощью AI, и исследователи особенно отметили гибридный текст как, вероятно, составляющий большую и растущую долю реальных работ по мере того, как всё больше курсов задают задания, в которых AI используется для части задачи.
| Что было протестировано | Результат Turnitin |
|---|---|
| Образцы, на 100% написанные человеком | 93% correctly identified as human |
| Образцы, на 100% сгенерированные AI | 77% correctly identified as AI |
| Текст AI, пропущенный через инструмент перефразирования | 63% correctly identified as AI |
| Гибридные образцы, частично человеческие и частично AI | 43% correctly identified as neither 0% nor 100% |
| Документы, в которых более 20% было отмечено как подозрительное, собственная цифра Turnitin | Under 1% false positive rate |
Ни одно из этого не является независимыми выводами со стороны Turnitin. Исследователи вне компании, упоминаемые в материалах о собственных исследованиях предвзятости Turnitin, описывают ещё более сложную картину, особенно для авторов, для которых английский не является родным языком, и для существенно отредактированных черновиков.
Где разрушаются выделения на уровне предложений
Оценка на уровне документа не является единственным представлением, которое может открыть преподаватель, и другое представление менее надёжно. Некоторые интерфейсы показывают отчёт с пометками, который выделяет отдельные предложения как вероятно написанные AI. Исследователи Temple сопоставили эти выделения с тем, какие предложения в их гибридных образцах действительно были написаны AI, и не обнаружили связи между ними. Это имеет значение, если преподаватель пересылает снимок экрана с выделенным абзацем, а не сводный процент: общая оценка документа работала значительно лучше, чем выделения на уровне предложений.
Кто на самом деле видит оценку
Оценка AI по умолчанию не входит в отчёт, который видит студент. Она находится на отдельной вкладке, доступной преподавателям и администраторам, а студент видит её только если преподаватель решает поделиться отчётом или показать её напрямую. Это реальное структурное отличие от оценки сходства, которую студенты обычно могут просматривать сами в той же системе после обработки отправленной работы.
То же самое относится и к тому, существует ли эта функция вообще для конкретного курса, поскольку это институциональное решение, принимаемое выше уровня преподавателя. Администраторы на уровне учётной записи могут включать или отключать обнаружение AI в Turnitin для всего учреждения. Один преподаватель может не иметь возможности включить его, если университет отключил его, и наоборот. Два студента в разных университетах могут сдать сопоставимую работу и получить совершенно разный опыт использования этого инструмента по причинам, не имеющим никакого отношения к тому, что написал каждый из них.
Почему некоторые университеты отключили его
University of Waterloo прекратил использование функции обнаружения AI в Turnitin в сентябре 2025, и его опубликованное обоснование необычно прямолинейно. Университет сослался на документированную ненадёжность инструмента, его предвзятость против студентов, для которых английский не является первым языком, а также на собственное внутреннее тестирование, которое включало по меньшей мере один случай полностью написанного человеком текста, получившего оценку 100 percent AI-generated. Сопоставив это с затратами на инструмент, университет пришёл к выводу, что издержки перевешивают преимущества, и вместо этого перенаправил усилия на переработку системы оценивания и обучение AI-грамотности.
Ватерлоо является одним из наглядных примеров более широкого расхождения, а не исключением. Университеты, которые оставляют эту функцию включенной, как правило, добавляют защитные ограничения, а не рассматривают оценку как самостоятельный вердикт, требуя разговора со студентом до начала каких-либо формальных действий и воспринимая число как повод начать этот разговор, а не завершить его. Ознакомление с тем, как университеты в более широком смысле подходят к политике в отношении AI, делает эту закономерность более очевидной: вопрос о том, будет ли вам вообще доступна оценка, зависит от решения, принятого значительно выше уровня вашей семинарской аудитории, а не от фиксированного свойства самой технологии.
Что доказывает высокий балл, а что не доказывает
Высокий AI score является свидетельством, а не вердиктом. Сам Turnitin представляет этот процент как один из данных, на которые преподаватель может опираться при вынесении суждения, а не как установление нарушения, и приведенные выше показатели точности объясняют, почему такая формулировка важна: даже оценка на уровне документа, которая работает достаточно хорошо, неверно интерпретирует значительную долю сильно отредактированного, перефразированного или гибридного текста, а выделения на уровне предложений заметно менее надежны, чем сводное число. Все это не гарантирует, что какой-либо конкретный балл неверен. Это означает, что один процент является поводом задать вопросы, а не выводом, который следует принимать на первый взгляд.
Один процент на уровне документа сжимает четыре отдельных шага в одно число, и ни один из этих шагов не считывает смысл и не проверяет, является ли аргумент обоснованным. Более прямой способ понять отчет, чем воспринимать процент как вердикт, состоит в том, чтобы увидеть, как более короткий фрагмент оценивается по базовым статистическим сигналам, из которых построен такой конвейер. Бесплатный free perplexity checker от TextPulse запускает упрощенную версию такого покомпонентного оценивания слов на вашем собственном черновике, вне какого-либо институционального конвейера, а его free burstiness checker охватывает вторую половину того же измерения, связанную с ритмом предложений. Оба инструмента дают вам оценку вашего собственного текста, а не предсказание того, что скажет о нем Turnitin. Ни один инструмент не может добросовестно обещать это в отношении системы, которой он не управляет.
Turnitin сообщает два числа, и они измеряют несвязанные вещи. Что есть что, изложено отдельно, вместе с тем, что на самом деле считается хорошим показателем Turnitin, если вы уже знаете, к чему относится этот процент. Несколько связанных вопросов имеют собственные страницы: может ли преподаватель понять, что вы использовали ChatGPT без какого-либо детектора вообще, более прямой вариант этого, поймают ли меня, а для конкретных условий, обнаружение AI в программах сестринского дела и проверяют ли эти запросы приёмные комиссии колледжей. Более широкая постановка вопроса изложена в отдельном материале о академической добросовестности и AI.
Ничто из этого, вероятно, не является окончательной версией. Turnitin не раз пересматривал свои пороговые значения, правила видимости и охват моделей с 2023 года, и август 2026 года тоже не будет последним словом. Это находится рядом с остальными бесплатными инструментами TextPulse для тех, кто хочет получить дополнительный сигнал, прежде чем считать процент одного учреждения окончательным выводом.
Что показало наше собственное исследование
В исследовании согласованности детекторов TextPulse Research девять коммерческих ИИ-детекторов оценили одни и те же 90 академических текстов. Один из них был гибридным текстом из 455 слов: написанные человеком начало и концовка вокруг сгенерированной ИИ средней части из 168 слов. Turnitin оценил этот текст в 26.8% ИИ, тогда как вердикты остальных инструментов по тем же словам разошлись от 0% до 95.7% ИИ. Полная статья, корпус и матрица оценок по каждому инструменту открыто доступны на TextPulse Research.

Часто задаваемые вопросы
Как Turnitin обнаруживает AI? Он делит работу на сегменты по несколько сотен слов, оценивает каждый сегмент отдельно на предмет того, выглядит ли он сгенерированным AI или сгенерированным AI и затем перефразированным, после чего усредняет оценки сегментов в единый процент, показанный в отчёте. Процесс одинаково работает для каждой работы, которая соответствует минимальному требованию по числу слов.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.