AI Detection

Що таке хороший бал Turnitin?

Turnitin не публікує прийнятного відсотка схожості, а заклади встановлюють власні орієнтири. Цей допис пояснює, що саме зумовлює високий або низький бал, чому цитований матеріал і списки джерел завищують його, хоча нічого неправильного немає, і як читати розподіл збігів за числом, а не саме число.

6 min
What is a good Turnitin score? A similarity report broken into matched sources rather than one number.

Одному студенту керівник каже, що все, що нижче п'ятнадцяти відсотків, є прийнятним. Іншому студенту, також у тому самому факультеті, роботу позначають у коридорі як дванадцять відсотків, оскільки три з цих пунктів припадають на один неперервний абзац без лапок поруч. Обидва правильно читають показник подібності Turnitin. Цей інструмент від самого початку не був створений для того, щоб видавати єдине число, яке означає складено або не складено.

Тож що таке добрий показник Turnitin? Такого числа не існує. Turnitin не публікує прийнятний відсоток, не оцінює подання і прямо зазначає, що сама по собі ця цифра не є показником плагіату. Кожна установа встановлює власні рекомендації, і часто кожен керівник усередині неї також, саме тому один і той самий звіт може виглядати звичайним в одному кабінеті й тривожним у наступному. Число, яке варто навчитися читати, це те, що стоїть за ним.

Що таке добрий показник Turnitin?

Turnitin ніколи не публікував число, яке вважалося б добрим, безпечним або прийнятним, і на це є конкретна причина: показник подібності вимірює, яка частина тексту в поданні збігається з текстом, уже наявним у базах даних Turnitin, а не те, чи було це збігання використано неналежним чином. Високий показник може цілком походити з матеріалу, який процитовано і належно оформлено. Низький показник може бути вищим за показник роботи, що дуже близько перефразовує одне джерело настільки, що це викликає занепокоєння в екзаменатора, і при цьому зовсім не спрацьовує механізм зіставлення. Читати число як оцінку означає неправильно розуміти сам інструмент.

Показник на кшталт десяти до двадцяти відсотків широко поширюється як неформальне правило, його повторюють на форумах і в навчальних посібниках, доки воно не починає звучати офіційно. Воно не є офіційним. Turnitin не встановлює такого показника, а правило, яке ігнорує обсяг документа, щільність цитування та галузеві норми, руйнується в момент, коли стикається з реальною роботою. Огляд літератури, побудований на тридцяти належно процитованих джерелах, може перевищити двадцять відсотків лише за рахунок цитат. Один близько перефразований абзац без лапок може залишатися нижче п'яти відсотків і все одно бути серйознішою проблемою.

Що насправді вимірює показник подібності

Turnitin описує свій власний інструмент майже тими самими словами. Рекомендації Boise State University, що спираються на власну мову Turnitin, пояснюють, що показник схожості є відсотком змісту роботи, який збігається з матеріалом, уже наявним у базах даних Turnitin, і що сам цей відсоток не є оцінкою того, чи містить робота плагіатний матеріал. Це розрізнення має реальне значення: збіг є механічним, це рядок слів, що вирівнюється з іншим рядком слів десь іще, а визначення того, чи було цей збіг належно атрибутовано, потребує людини, а не алгоритму.

Бази даних, на яких ґрунтується збіг, навмисно широкі: поточні та архівні студентські подання, відкритий веб і великий корпус академічних публікацій. Жоден із цих матеріалів не читається на рівні змісту. Система знаходить перекривні рядки слів і повідомляє, яку частину подання вони охоплюють, саме тому процитоване речення і мовчки скопійоване речення можуть дати ідентичний збіг. Лише детальний вигляд звіту показує, що є чим.

Чому високий показник може бути цілком правомірним

Дві звичайні особливості академічного письма пояснюють більшу частину цього. Цитовані уривки збігаються за задумом, оскільки слова навмисно скопійовано і на сторінці позначено як чужі. Списки літератури збігаються не менш надійно, тому що імена авторів, назви журналів і формати цитування повторюються в тисячах інших робіт, які посилаються на ті самі джерела. І те, і інше є тим, як має виглядати коректне академічне письмо.

Якщо поставити їх поруч, завищений показник і справжня проблема на перший погляд виглядають по-різному.

Що збіглосяЧому це сталосяЧи варто придивитися уважніше?
Цитований уривок із лапками та посиланнямСлова були навмисно скопійовані та належно вказані на сторінціНі, саме так і виглядає коректне цитування
Список джерел або бібліографіяІмена авторів, назви журналів і формати цитування повторюються в багатьох інших роботахНі, якщо не було застосовано налаштування виключення
Стандартні методи або процедурні формулюванняСпільна лексика галузі описує той самий процес однаково в різних роботахРідко, якщо тільки весь розділ не було запозичено, а не написано заново
Один довгий, суцільний абзац без лапок, що збігається з одним джереломФормулювання досить близько відтворює речення іншого автора, щоб механізм зіставлення це виявивТак, саме такий шаблон варто відкрити в джерелі для перевірки

Гуманізуйте свою власну статтю

Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.

Почати безкоштовно

Чому низький бал усе ще може приховувати проблему

Низьке число відповідає на вужче запитання, ніж здається, а саме, чи збігається невеликий обсяг тексту слово в слово з базами даних Turnitin, і не більше. Парафраз, який достатньо змінює формулювання, але зберігає структуру та аргументацію іншого автора, може отримати майже нульовий бал і все одно бути серйозною проблемою академічної доброчесності, оскільки механізм працює з послідовностями слів, а не з запозиченими ідеями. Перекладений вміст або матеріал поза індексованими базами даних Turnitin поводиться так само, нічого зіставляти, нічого позначати.

Сфабриковані джерела створюють таку саму сліпу зону з іншого боку. Посилання, якого не існує, не може збігтися ні з чим, бо ніде немає того, з чим його можна було б зіставити, а показник подібності не має способу позначити цитування, яке від самого початку не було реальним. Безкоштовний AI citation checker від TextPulse free AI citation checker існує саме для цієї прогалини, він звіряє кожен запис у списку джерел із фактичними реєстрами, де ці джерела мають бути, ще до того, як читачеві доведеться виявляти цю прогалину складним шляхом.

Ще одна відмінність заслуговує на увагу, перш ніж зовсім перейти від самого числа. Подання з низьким показником схожості все одно може містити окремий індикатор AI writing від Turnitin, інший вимір, створений для виявлення іншого типу проблеми, про який ідеться в посібнику цього сайту про те, чи може Turnitin насправді виявляти ChatGPT. Ці два відсотки обчислюються не однаково, і цей текст стосується лише показника схожості.

Як читати звіт, а не число

Не реагуйте на загальний показник, перш ніж відкрити розбивку збігів. Turnitin упорядковує джерела, які формують показник, за внеском кожного з них у нього. Загальний показник у двадцять два відсотки, що складається з одинадцяти джерел, які дають по два відсотки кожне, читається інакше, ніж загальний показник, що складається з одного джерела. Перший варіант зазвичай відображає перетин із багатьма поширеними фразами. Другий варто перевірити безпосередньо, щоб побачити, що саме це джерело насправді говорить.

Turnitin також позначає той самий відсоток кольоровою смугою, яку відтворено у власних рекомендаціях Loughborough College для студентів: синій для відсутності збігів тексту, зелений від одного слова до двадцяти чотирьох відсотків, жовтий від двадцяти п'яти до сорока дев'яти, помаранчевий від п'ятдесяти до сімдесяти чотирьох, червоний від сімдесяти п'яти і вище. Власні рекомендації коледжу прямо пояснюють, чим кольори не є: перевірки схожості не означають, що подання містить плагіатний матеріал. Колір лише впорядковує звіт для уваги, а не виносить вердикт.

Також варто перевірити, чи власні налаштування закладу виключають цитати та бібліографію з підрахунку, оскільки те саме подання може дати два різні числа залежно від того, як установлено цей перемикач. Усе це не є складним, коли стає видимим. Це залишається невидимим лише тоді, коли ніхто не відкриває звіт далі першої сторінки.

Що робити, якщо ваш показник вас здивував

Відкривайте кожне позначене джерело окремо, а не реагуйте на сукупний підсумок. Перевірте, чи у версії, що оцінюється, виключено цитати та бібліографію, оскільки число, яке студент бачить під час чернетки, не завжди налаштоване так само, як число, яке бачить викладач під час подання. Якщо виявляється справжній збіг без атрибуції, виправте цитування безпосередньо, а не перефразовуйте речення, щоб прослизнути повз механізм зіставлення, який усуває симптом і залишає проблему на місці.

Якщо число й далі здається невідповідним тому, що очікує керівник, прямо запитайте, якою є власна конвенція цього підрозділу. Розділи вище вже показують, що немає єдиної межі, якої слід досягти, тож відповідь залежить від того, хто має локальні повноваження щодо завдання, а не від відсотка, який будь-хто міг би заздалегідь знайти. безкоштовна добірка інструментів TextPulse охоплює перевірки цитування та чернетки, які варто виконати, перш ніж звіт потрапить до чужої поштової скриньки.

Оцінки з різних інструментів не є взаємозамінними, а як працює GPTZero викладено на окремій сторінці, разом із статистикою perplexity, що лежить в основі обох.

Оцінка поводиться так, як вона поводиться, через те, як виконується зіставлення під нею, а новіше число, що тепер стоїть поруч із нею в тому самому звіті, працює на іншому механізмі, тому, який повністю викладено в посібнику цього сайту про те, як насправді працюють AI detectors. Читати будь-яке з цих чисел як вердикт означає пропустити єдину частину звіту, яку варто читати.

XLinkedInFacebook

Часті запитання

Що таке хороший бал Turnitin? Такого числа не існує. Turnitin не публікує прийнятного відсотка, а бал схожості вимірює, скільки тексту збігається з його базами даних, а не скільки було запозичено без посилання. Правильно процитований огляд літератури може дати понад двадцять відсотків лише через цитати, тоді як один неатрибутований парафраз може мати менше п'яти. Читайте зіставлені джерела, а не заголовне число.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Будьте в курсі AI-гуманізації

Отримуйте поради щодо академічного письма, виявлення AI та гуманізації прямо на вашу пошту.

Жодного спаму. Відписатися можна будь-коли.