Чи може Turnitin виявити гуманізований AI-текст?
Turnitin каже, що його індикатор AI-письма вже охоплює текст, пропущений через humanizer. Що означає і чого не означає це твердження, чому гуманізований документ іноді все одно отримує високий бал, а іноді ні, і чого варте це число для студента в будь-якому разі.
Turnitin відповідає на це запитання на власному сайті підтримки, і відповідь є конкретнішою, ніж будь-яка зі сторін звичайної дискусії. Його індикатор AI writing, Turnitin says, уже включає виявлення контенту, згенерованого AI, який міг бути humanized або пропущений через bypasser, щоб уникнути виявлення. Це опис власного продукту самим постачальником. Це також правильна відправна точка, тому що вона показує, що саме, за твердженням моделі, охоплюється.
Отже, чи може Turnitin виявляти humanized текст? Питання має вужчу і кориснішу форму. Модель Turnitin не шукає відбиток humanizer і не веде список інструментів. Вона оцінює прозу речення за реченням за тим, наскільки близько письмо відповідає статистичним моделям машинно згенерованого тексту, а потім усереднює ці оцінки по всьому документу. Чи зберігає humanized уривок високу оцінку, залежить від того, наскільки переписування змінило цю модель, і від того, наскільки значна частина документа була переписана взагалі.
Чи може Turnitin виявляти humanized текст? Що стверджує Turnitin
Їхня опублікована позиція є простим так. Відповідаючи на запитання, чи може він виявляти контент, пропущений через humanizer, їхні вказівки стверджують: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." Та сама сторінка дає ту саму відповідь для інструментів AI paraphrasing.
Це твердження не з'являється як окреме число десь у звіті. Turnitin включає його в єдиний відсоток AI writing, і опубліковане визначення цього відсотка прямо це підтверджує: він охоплює текст, який модель визначає як імовірно згенерований AI, або імовірно згенерований, а потім змінений AI paraphraser або bypasser. Є один показник, і він уже враховує переписування настільки, наскільки це здатна зробити модель.
Уважно прочитайте, це твердження про охоплення, а не твердження про точність. Turnitin каже, що humanized text був у межах охоплення, коли модель створювали. Це аж ніяк не означає, що кожен humanized document отримує високий бал, а власні опубліковані показники, далі нижче, описують модель, яка розглядає окремі речення як невизначені.
Що насправді оцінює AI Writing Indicator
Це не відсоток. Це частка тексту, тож це не рівень упевненості. Це міра того, скільки тексту у вашому документі, на думку нашої моделі, ймовірно згенеровано AI. Ми називаємо це qualified text, тобто це прозові речення у форматі довгого письмового тексту. Воно не включає марковані списки, код, таблиці або короткі фрагменти. Саме тому ви можете бачити різні числа для однієї й тієї самої роботи залежно від того, яка її частина є суцільною прозою.
Механізм під цим досить простий, щоб його уявити. Turnitin ділить документ на перекривні сегменти приблизно по кілька сотень слів, десь по п'ять до десяти речень кожен, з перекриттям, щоб кожне речення отримувало оцінку в контексті. Кожне речення отримує значення від 0 до 1. Потім оцінки сегментів усереднюються по всьому документу, щоб отримати одне число, яке бачить викладач. Покроковий опис how Turnitin detects AI докладніше розглядає кожен етап.
Цей крок усереднення важливіший для humanized text, ніж будь-що інше в конвеєрі, і саме його майже ніхто не враховує. Показник, який читає викладач, є арифметичним середнім суджень на рівні сегментів. Документ може бути наполовину переписаний і опинитися десь посередині з причин, які мало пов'язані з тим, наскільки якісним було переписування.
Чому humanized output іноді все одно отримує високий бал
Найпоширенішою причиною є охоплення. Humanizer, застосований до вступу та висновку, залишає огляд літератури і обговорення без змін, а ці сегменти безпосередньо переносять свої початкові оцінки в середнє значення. У довгому розділі переписування перших сторінок змінює лише кілька сегментів і залишає решту точно такими, якими вони були, що дає менший зсув, ніж автор очікує від роботи, яка здавалася суттєвою.
Друга причина полягає в глибині переписування. Прохід, який замінює лексику, зберігаючи довжину речень, порядок підрядних частин і вибір сполучних елементів, залишає шаблон, на якому модель була навчена, значною мірою незмінним. Модель оцінює форму прози, тож зміна того, які слова заповнюють цю форму, дає менший ефект, ніж припускає більшість людей. free perplexity checker покаже, наскільки передбачуваним усе ще читається уривок після переписування, і це є більш інформативним сигналом, ніж порівняння на рівні слів до і після.
Третя причина полягає в тому, що переписування може запровадити власну регулярність. Програмне забезпечення, яке застосовує однакове перетворення до кожного абзацу, створить новий шаблон, який буде таким самим регулярним, як і старий. Якщо кожне речення має один і той самий тип сполучного розрізу всередині нього, або якщо до кожного речення в те саме місце додається один і той самий тип застережної вставної конструкції, то classifier сприйматиме ці речення як однаково рівномірні, так само як і тоді, якби всі вони від початку мали однакову довжину.
| Ситуація | Що робить AI-оцінка | Чому |
|---|---|---|
| Було переписано лише частину документа | Падає менше, ніж очікувалося | Незмінені сегменти переносять свої початкові оцінки до середнього значення |
| Словниковий запас змінено, структуру речень збережено | Майже не змінюється | Класифікатор оцінює шаблони на рівні речень, які заміна залишила на місці |
| Речення справді перебудовано в усьому тексті | Змінюється більше | Рівномірний ритм, який модель навчилася розпізнавати, порушено |
| Подано менше ніж 300 слів прозового тексту | Оцінка взагалі не генерується | Turnitin вимагає 300 слів прозового тексту, що відповідає вимогам, перш ніж повідомити відсоток |
| Результат опускається нижче 20 percent | Замість числа з'являється зірочка | Turnitin позначає результати в цьому діапазоні як менш надійні |
Чому той самий перепис іноді дає низьку оцінку
Гуманізований документ може повернутися з низькою оцінкою з причин, які не мають нічого спільного з переписуванням. Turnitin потребує щонайменше 300 слів прозового тексту, що відповідає вимогам, перш ніж взагалі згенерує AI-відсоток, і цей мінімум було підвищено з початкових 150 слів на підставі того, що точність поліпшується з трохи більшим обсягом тексту. Короткий рефлексивний текст не дає числа, а відсутня оцінка не є тим самим, що й чиста оцінка.
Turnitin позначає діапазон нижче 20 percent зірочкою замість точного відсотка, тому що в цьому діапазоні частіше трапляються хибнопозитивні результати. На момент запуску освітні звіти також посилалися на цю поведінку, зазначаючи, що результати, які повідомлялися як такі, що є менш ніж 20 percent AI-written, мали вищу частоту хибнопозитивних результатів, і тому Turnitin додав застереження. Документ, що опинився в цій смузі, було позначено як діапазон, який Turnitin відмовляється повідомляти точно, і це не те саме, що бути визнаним чистим.
Існує також інституційний бар’єр над усім цим. Turnitin обробляє подання для виявлення AI writing detection лише тоді, коли заклад увімкнув цю функцію, а адміністратори можуть вимкнути її для всього облікового запису. Vanderbilt University саме так і зробив у серпні 2023 року, посилаючись на тодішній оприлюднений Turnitin показник хибнопозитивних спрацьовувань 1 percent щодо приблизно 75,000 щорічних подань, упередженість проти неносіїв англійської мови та брак прозорості щодо того, як працює модель. Студент у закладі, де функцію вимкнено, не має AI score для жодного подання, humanized чи іншого.
А там, де переписування було справді структурним, score може знизитися, тому що вимірюваний pattern змінився. Turnitin повідомляє оцінку, обчислену на основі writing patterns, тож текст, чиї patterns відрізняються, отримує інший score. Механізм працює в обох напрямках, і саме це є незручним: оригінальне людське письмо іноді отримує високий score з тієї самої причини.
Гуманізуйте свою власну статтю
Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.
Що стверджує кожен постачальник humanizer, і що задокументовано
Таблицею керує одне правило. Середня колонка містить власну маркетингову мову постачальника, взяту з його власного сайту, де б цей сайт не слугував джерелом. Права колонка фіксує те, що насправді стоїть за кожним твердженням, а в більшості випадків це взагалі не dataset, дата чи method. Для цих брендів не існує публічного прямого порівняльного тесту.
| Бренд | Що заявляє постачальник | Що задокументовано |
|---|---|---|
| Undetectable.ai | Перелічує проходження AI detectors як характеристику продукту без зазначеної цифри, і пропонує відшкодувати вартість humanization, якщо результат буде позначено як не людський | Відшкодування є комерційною умовою, за ним не стоїть жоден набір даних, дата або результат для кожного detector окремо |
| QuillBot | На власних сторінках не висуває жодної заяви про detection або bypass для функції humanizer. Його окремий AI detector описано лише як такий, що виявляє AI-generated content | QuillBot продає humanizer у складі загального writing suite і не робить для нього жодної Turnitin-specific заяви |
| WriteHuman | Посідає перше місце в Humanizer Leaderboard і описується як premium AI humanizer для серйозного письма | У leaderboard не наведено методології або вибірки, і WriteHuman не додає до рейтингу жодної числової показової точності |
| Walter Writes AI | Маркетує широке humanization для 80+ мов без Turnitin-specific заяви | Немає тестових даних ні на користь, ні проти |
| HIX Bypass | Маркетує сторінки bypass для кожного detector окремо без Turnitin-specific цифри | HIX Bypass і BypassGPT є окремими продуктами на окремих доменах, тому слід підтвердити, про який саме продукт ідеться в заяві |
| StealthGPT | Середній показник 98% human на Turnitin і 95% на GPTZero, кожен із зазначеного запуску на 30 samples із нульовими detections, плюс гарантія повернення коштів, якщо subscriber буде detected | Самозвіт. Поруч із цифрами не опубліковано жодного набору даних, відбору samples, дати або методу, а 30 documents є малим запуском для заяви про model, що оцінює мільйони submissions |
| Phrasly | Позиціонує себе як AI detection remover, тестових даних не публікує | Жодної публічної заяви ні на користь, ні проти. Цифри, що циркулюють у reviews, є з других рук і тут принципово не враховуються |
| Grammarly | Взагалі не рекламує своє rewriting як detection bypass. На сторінці AI detector стверджує 99% detection accuracy і перше місце в незалежному benchmark RAID | На тій самій сторінці Grammarly зазначає, що жоден AI detector не є 100% accurate. Його функція Authorship позначає текст як набраний людиною, створений за допомогою AI або відредагований Grammarly |
| TextPulse | Показник проходження 92.33% на Turnitin AI, 89.12% на Originality.ai і 87.91% на GPTZero, виміряний на академічному корпусі з 2,000 documents | Виміряно і опубліковано TextPulse, отже це самозвіт, як і кожна наведена вище цифра. Розмір корпусу і detectors названо, але для жодного окремого document не обіцяно певного результату detector |
З цієї таблиці випливають три речі. Більшість цих інструментів взагалі не публікують жодної заяви про детектор, яку можна було б перевірити. Декілька додають до числа розмір вибірки, і це більше, ніж вдається решті категорії. І жоден з них не публікує набір даних, який будь-хто поза компанією міг би самостійно запустити. Втім, належне визнання кожному бренду там, де воно заслужене. Undetectable.ai підкріплює свою заяву гарантією повернення коштів, а це конкретне зобов'язання, а не прикметник. WriteHuman публікує точні ліміти запитів і слів для кожного тарифу, тож покупець знає, що саме отримує. Grammarly уточнює власний показник точності на тій самій сторінці, де його наводить, і це більше, ніж робить більшість постачальників детекторів. А відмова QuillBot узагалі робити заяву про обходження є найобґрунтованішою позицією в цьому списку.
Чому ніхто поза постачальником не може перевірити ці числа
Постачальник humanizer, який заявляє про відсоток проходження Turnitin, описує запуски, виконані через обліковий запис, яким він керує, на документах, які він сам обрав, у дату, яку він зазвичай не вказує, щодо класифікатора, який Turnitin переглядає, коли виходять нові мовні моделі. Це справедливо для показника StealthGPT на тридцяти зразках і так само справедливо для показника на 2,000 документах, який публікує цей сайт. Розмір корпусу змінює, скільки шуму міститься в числі. Але він не перетворює самозвіт на аудит.
Інша половина проблеми полягає в тому, що власний список моделей Turnitin, які, за його твердженням, він виявляє, редагується в міру появи нових випусків. Цей відсоток проходження, виміряний щодо класифікатора минулого кварталу, описує класифікатор минулого кварталу і нічого більше. Чому це означає, що ніхто не може назвати найкращий AI humanizer для обходу Turnitin, викладено окремо. Кожне число на кожній домашній сторінці humanizer, включно з цим сайтом, є знімком, що містить дату, яку постачальник, можливо, ніколи не публікував.
Як читати заяву про обходження перед тим, як платити за неї
Чотири запитання відокремлюють заяву, яку варто зважувати, від заяви, яку варто ігнорувати, і вони застосовні до кожного рядка в таблиці вище, включно з останнім.
- Скільки документів було протестовано, і хто їх обрав? Відсоток без зазначення розміру вибірки, це гасло, що носить число.
- На яку дату, і щодо якої версії детектора? Моделі виявлення переглядають у міру виходу нових мовних моделей, а показник успішності без дати швидко старіє.
- Чи є гарантія повернення коштів, чи результату? Обіцянка повернення грошей переносить невеликий фінансовий ризик і зовсім нічого не робить щодо комісії з академічної доброчесності.
- Що, за словами постачальника, відбувається з цитатою, технічним терміном або блоковою цитатою? Більшість сторінок humanizer взагалі нічого не кажуть, і це саме по собі є відповіддю.
Саме це останнє запитання вирішує більше, ніж арифметика детектора, для будь-кого, хто подає академічну роботу. Переписаний текст, який отримує високий бал і непомітно узагальнює речення з розділу методів, коштував вам того, за що вас оцінювали. Академічний humanizer від TextPulse документує збереження цитувань в APA, MLA, IEEE, Chicago, Harvard і Vancouver, freeze terms для фіксації точного словника перед запуском проходу, а також навчання на рецензованому академічному тексті з виходом, обмеженим рівнем Flesch-Kincaid 13 to 18. Це твердження про те, що відбувається з текстом, і воно відрізняється від твердження у відсотках про детектор, а читач може перевірити їх у результаті протягом хвилини.
Що означає бал для студента в будь-якому разі
Turnitin чітко зазначає, що індикатор AI writing не є висновком про порушення. На сторінці продукту Turnitin прямо сказано, що Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." Також чітко вказано, що Turnitin надає інформацію, щоб дати змогу викладачам ухвалити обґрунтоване рішення на основі політик їхнього закладу. Це ще раз підкреслюється застереженням, що модель "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."
Студенти не бачать оцінку за замовчуванням. Turnitin прямо зазначає, що індикатор і звіт виявлення AI writing detection не видимі для студентів, а єдиний спосіб їх побачити полягає в тому, що викладач завантажує звіт у форматі PDF і передає його. Студент, який перевіряє власний чернетковий текст, перевіряє інший інструмент, навчений на інших даних, і ці два числа не зобов'язані збігатися.
Отже, залишається те, що не вирішується жодною оцінкою. Чи було використання AI assistance взагалі дозволене, це питання курсу та інституції, і AI use policy відповідає на нього так, як це ніколи не робить відсоток. Висока оцінка за дозволене, задеклароване використання, це розмова з доказами за нею. Низька оцінка за незадеклароване використання, яке забороняє політика, все одно залишається незадекларованим використанням.
Для автора, який редагує власний чернетковий текст, практичне прочитання всього цього полягає в тому, що оцінка слідує за текстом. Модель Turnitin вимірює шаблон на рівні речень у межах усього документа, тому часткові переписування спричиняють частковий зсув, а заміна лексики спричиняє дуже незначний зсув або взагалі не спричиняє його. Повний розбір how to humanize AI text послідовно розглядає структурні редагування, які змінюють шаблон, у порядку, що змінює його найбільше.
AI humanizer від TextPulse застосовує ці структурні редагування до всього документа одночасно і повідомляє про приблизний Human Score, обчислений із самого тексту, а не про прогноз того, що скаже будь-який названий детектор. Жоден інструмент не може гарантувати результат у Turnitin, тому що жоден інструмент не може бачити всередину моделі Turnitin. Будь-який продукт, який стверджує протилежне, описує результат, який він не має способу спостерігати.
Різниця між humanizer і paraphraser тут має значення, як і причина, чому перефразований текст усе одно позначається.
Число є найменш цікавою частиною цього. Те, що визначає результат, це двадцять хвилин після того, як перевіряльник на нього дивиться: чи може робота показати свій хід міркувань, історію чернеток, набір нотаток, джерела, про які автор може говорити, не відкриваючи їх. Ці докази доступні кожному, хто виконав роботу, і вони переживають оцінку, яку не змогло зрушити переписування.
Часті запитання
Власні настанови Turnitin кажуть, що його AI-індикатор охоплює виявлення контенту, який міг бути гуманізований або пропущений через bypasser. Фактично продукт виводить відсоток тексту, що відповідає критеріям, а не вердикт щодо авторства. Отже, практична відповідь на питання, чи може Turnitin виявити гуманізований текст, полягає в тому, що бал відображає, яка частина шаблону машинного письма збереглася після переписування.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.