AI Detection

Turnitin Similarity Score vs AI Score: Два разных отчета

Показатель сходства и AI score отвечают на разные вопросы, поэтому работа может получить низкий результат по одному и высокий по другому, и при этом ни одно из чисел не будет ошибочным. Что измеряет каждый из них, что его запускает и что высокий показатель доказывает и не доказывает.

5 min
Turnitin similarity vs AI score comparison chart showing two independent report numbers

Отчёт содержит две цифры: показатель сходства 3 процента и AI score 88 процентов. Естественно предположить, что они должны измерять одно и то же, так что низкое число должно означать, что и высокое число, вероятно, тоже неверно. Но это не так. Turnitin similarity vs AI score, это сравнение двух отдельных систем, которые проверяют два разных аспекта, и одна и та же работа может получить низкий результат по одной системе и высокий по другой, при этом ни одна из цифр не будет ошибкой.

Система сходства старше, она создана для выявления текста, совпадающего с уже существующим. Система AI новее, она добавлена в тот же Similarity Report как собственное независимое измерение и предназначена для оценки того, выглядит ли проза как сгенерированная машиной, независимо от того, совпадает ли она вообще с чем-либо. Согласно собственной документации Turnitin, эти два показателя полностью независимы и не влияют друг на друга. Всё остальное в этой статье.

Turnitin Similarity vs AI Score: Что показывает каждая цифра

Turnitin рассматривает эти два показателя как разные измерения, объединённые в одном продукте, а не как два взгляда на один результат. Similarity Report сравнивает работу с базой данных веб-контента, академических публикаций и ранее загруженных студенческих работ и возвращает процент текста работы, который совпадает с чем-то уже имеющимся в этой базе. Обнаружение AI-письма использует совершенно другую модель, также добавленную в этот же отчёт как собственный независимый показатель, модель, обученную оценивать, насколько проза фрагмента похожа на текст, сгенерированный машиной, без какого-либо обращения к внешней базе данных. Более полные механизмы того, как AI-классификатор Turnitin приходит к этой цифре, рассматриваются отдельно, здесь важно лишь то, что он отвечает на другой вопрос, чем механизм сходства, находящийся внутри того же отчёта.

Что на самом деле измеряет показатель сходства

Сходство, это упражнение на сопоставление, а не суждение. Собственные рекомендации Turnitin прямо указывают, что инструмент не проверяет на плагиат. Он проверяет совпадения и оставляет интерпретацию преподавателю, который читает отчёт. Цитата, правильно выделенная, фраза из раздела методов, общая для всей узкой области, список литературы, оформленный так, как каждый текст в журнале оформляет свой список литературы: всё это может быть зафиксировано как совпадение, потому что система подсчитывает перекрывающиеся строки текста, а не оценивает, является ли это перекрытие допустимым.

Именно поэтому показатель сходства, равный нулю, доказывает меньше, чем кажется. Он означает, что в работе нет длинного, непрерывного фрагмента текста, найденного в других индексируемых источниках Turnitin. Он ничего не говорит о том, как были созданы имеющиеся там предложения, потому что создать предложение, которое не совпадает ни с чем в базе данных, это не то же самое, что создать предложение, которое языковая модель не предсказала бы.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Что на самом деле измеряет показатель AI

У показателя AI нет базы данных, с которой можно было бы его сопоставить. Классификатор читает представленный текст и, исходя из закономерностей, усвоенных на примерах человеческого и сгенерированного AI письма, оценивает, насколько вероятно, что этот текст создан моделью, а не человеком. В этой оценке не имеет значения, появлялось ли когда-либо точное предложение где-либо раньше. Предложение может быть полностью уникальным, его мог никто не печатать до этой работы, и всё же оно может восприниматься как статистически типичное для вывода AI, если выбор слов и ритм следуют той модели, которую языковая модель обычно производит.

Это та же статистическая область, которая полностью рассматривается в более широком изложении как AI detectors actually work: предсказуемость на уровне слов и ритм на уровне предложений, объединённые в один показатель документа. Версия этого классификатора у Turnitin является проприетарной, но исходная предпосылка, что сгенерированный текст обычно статистически более типичен, чем человеческое письмо, остаётся той же самой и лежит в основе каждого инструмента в этой категории.

Показатель сходстваПоказатель AI
Что он измеряетНасколько текст работы совпадает с другими проиндексированными документамиНасколько проза напоминает статистически типичное письмо, сгенерированное AI
Что вызывает высокий показательДлинные цитаты, распространённые формулировки, характерные для данной области, повторно использованный материал или совпадение с предыдущей подачейОднообразный ритм предложений и последовательно предсказуемый выбор слов по всему документу
Что высокий показатель не доказываетЧто совпавший текст был использован ненадлежащим образом. Корректно процитированный материал всё равно может быть отмечен как совпадение.Что какое-либо отдельное предложение было сгенерировано AI. Классификатор читает общий рисунок документа, а не одну строку изолированно.

Может ли в работе быть 0 Percent Similarity и 90 Percent AI Score?

Да, и такое сочетание не является сбоем. Эти два показателя отвечают на разные вопросы, поэтому возможны все четыре сочетания высокого и низкого значений, и каждое из них по-разному указывает на то, как был создан текст.

  • Низкое сходство, низкий показатель AI: обычный оригинальный текст, который при этом читается с типичной человеческой вариативностью. Обычный случай для большинства подлинных студенческих работ.
  • Низкое сходство, высокий показатель AI: оригинальные предложения, не скопированные ниоткуда, которые читаются как статистически предсказуемые, в том смысле, в каком это свойственно сгенерированному тексту. Признак неотредактированного AI-текста, который никто не пересказывал по существующему источнику.
  • Высокое сходство, низкий показатель AI: текст, который близко совпадает с существующим человеческим источником, без статистической однообразности, которую классификатор связывает с генерацией. Скопированный текст, обнаруженный старым инструментом, а не новым.
  • Высокое сходство, высокий показатель AI: текст, который совпадает с существующим источником, сам по себе сгенерированным AI, например с ранее поданной работой, написанной AI, или со страницей текста, произведённого AI, уже проиндексированной в открытой сети.

Ни одна из этих комбинаций не требует чего-либо необычного со стороны программного обеспечения. Они вытекают из того факта, что одна система проверяет совпадение, а другая проверяет шаблон, и фрагмент текста может обладать любым из этих свойств, обоими или ни одним.

Что высокий AI Score доказывает, а что не доказывает

Высокий AI Score, это статистическая оценка, а не признание, извлечённое из текста. Она означает, что проза перед классификатором по своему выбору слов и ритму напоминает тот тип письма, который модель была обучена связывать с генерацией AI. Она не определяет конкретное предложение как определённо написанное машиной и не знает ничего о том, как документ был фактически создан, только о том, как он читается после завершения. TextPulse занимает ту же позицию в отношении собственных чисел: то, что он сообщает, это оценка Human Score, вычисленная по тексту перед ним, а не вердикт о том, какой инструмент, если таковой был, затронул документ.

Практический ответ на любое из этих чисел, низкий показатель сходства или высокий AI Score, одинаков: относиться к нему как к основанию для более внимательного рассмотрения, а не как к выводу, который следует принять или отвергнуть с первого взгляда. Черновики, заметки и история версий говорят о том, как документ был фактически написан, так, как процент никогда не может, ни в одном из отчётов. Любой, кому интересно, на что именно реагирует классификатор в его собственном черновике, может сам увидеть тот же шаблон на уровне слов с помощью free perplexity checker, задолго до того, как будет сгенерирован какой-либо отчёт.

Коллекция free tools collection TextPulse охватывает и другие статистические уровни, которые стоит проверить, прежде чем черновик попадёт к преподавателю, а не только два, сравниваемые здесь.

После того как два числа разделены, следующий вопрос, это что считается хорошим Turnitin score. Для другого детектора, с которым студенты сталкиваются чаще всего, как работает GPTZero рассматривается на отдельной странице.

Эти два числа будут по-прежнему стоять рядом в одном и том же отчёте, и люди, спешащие при чтении, будут по-прежнему воспринимать их как одно число. Понимание того, на какой именно вопрос отвечает каждое из них, превращает запутанную пару процентов в два отдельных, полезных фрагмента информации.

XLinkedInFacebook

Часто задаваемые вопросы

Turnitin similarity vs AI score сводится к тому, что проверяет каждый из них. Показатель сходства сообщает, какая часть работы совпадает с текстом, уже имеющимся в базе данных Turnitin, включающей веб-страницы, публикации и прошлые студенческие работы. AI score представляет собой отдельную, независимую оценку, которая показывает, насколько проза похожа на машинно сгенерированную, без какого-либо обращения к базе данных. В собственной документации Turnitin указано, что эти два показателя не влияют друг на друга.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсе новостей об очеловечивании AI

Получайте советы по академическому письму, обнаружению AI и очеловечиванию прямо на вашу почту.

Без спама. Отписаться можно в любой момент.