AI Humanization

Dokáže Turnitin odhalit zhumanizovaný AI text?

Turnitin uvádí, že jeho indikátor AI psaní už pokrývá text, který prošel humanizerem. Co toto tvrzení znamená a co neznamená, proč zhumanizovaný dokument někdy stále získá vysoké skóre a někdy ne, a jakou hodnotu má číslo pro studenta v obou případech.

12 min
Turnitin AI writing report panel illustrating can turnitin detect humanized text, with per-sentence scores averaged into one document percentage

Turnitin odpovídá na tuto otázku na svém vlastním podpůrném webu a odpověď je konkrétnější než kterýkoli z obou pólů obvyklé debaty. Jeho ukazatel AI psaní, Turnitin says, již zahrnuje detekci obsahu generovaného AI, který mohl být zhumanizován nebo prošel přes bypasser, aby se vyhnul detekci. To je popis vlastního produktu ze strany dodavatele. Je to také správné místo, kde začít, protože ukazuje, co model tvrdí, že pokrývá.

Může tedy Turnitin detekovat zhumanizovaný text? Otázka má užší a užitečnější podobu. Model Turnitin nehledá otisk humanizeru a nevede seznam nástrojů. Hodnotí prózu větu po větě podle toho, jak blízko se psaní shoduje se statistickými vzorci strojově generovaného textu, a poté tyto hodnoty zprůměruje v celém dokumentu. Zda zhumanizovaný úsek stále dosáhne vysokého skóre, závisí na tom, jak moc přepis změnil tento vzorec, a na tom, kolik z dokumentu bylo vůbec přepsáno.

Může Turnitin detekovat zhumanizovaný text? Co Turnitin tvrdí

Jejich zveřejněné stanovisko je prosté ano. V odpovědi na otázku, zda dokáže detekovat obsah, který prošel humanizerem, jejich pokyny uvádějí: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." Stejná stránka uvádí stejnou odpověď i pro nástroje pro parafrázování AI.

Toto tvrzení se v přehledu neobjevuje jako druhé číslo někde jinde. Turnitin je zahrnuje do jediného procenta AI psaní a zveřejněná definice tohoto procenta to říká přímo: pokrývá text, který model určí jako pravděpodobně generovaný AI, nebo pravděpodobně generovaný a poté upravený pomocí AI paraphraseru nebo bypasseru. Existuje jedno skóre a to již zohledňuje přepis v rozsahu, v jakém je toho model schopen.

Pečlivě čtěte, to je tvrzení o pokrytí, nikoli tvrzení o přesnosti. Turnitin říká, že humanized text byl v rozsahu, když byl model vytvářen. Zdaleka tím netvrdí, že každý humanized dokument dosahuje vysokého skóre, a jeho vlastní zveřejněné údaje níže popisují model, který považuje jednotlivé věty za nejisté.

Co AI Writing Indicator ve skutečnosti hodnotí

Není to procento. Je to zlomek textu, takže to není úroveň jistoty. Je to míra toho, kolik textu ve vašem dokumentu si náš model myslí, že je pravděpodobně generováno AI. Nazýváme to kvalifikovaný text, což znamená věty v próze v dlouhé psané formě. Nezahrnuje odrážkové seznamy, kód, tabulky ani krátké úryvky. A právě proto můžete u stejné práce vidět různá čísla podle toho, kolik z ní tvoří souvislá próza.

Mechanismus pod tím je dostatečně jednoduchý na představu. Turnitin rozděluje dokument na překrývající se segmenty o zhruba několika stech slovech, přibližně po pěti až deseti větách, s překryvem tak, aby každá věta byla hodnocena v kontextu. Každá věta dostane hodnotu mezi 0 a 1. Skóre segmentů se pak v celém dokumentu zprůměrují, aby vzniklo jediné číslo, které vidí vyučující. Podrobný popis jak Turnitin detekuje AI prochází každou fází podrobněji.

Tento krok průměrování je pro humanized text důležitější než cokoli jiného v celém procesu a je to část, kterou téměř nikdo nezohledňuje. Číslo, které vyučující čte, je aritmetický průměr úsudků na úrovni segmentů. Dokument může být z poloviny přepsán a skončit někde uprostřed z důvodů, které mají jen málo společného s tím, jak dobrý ten přepis byl.

Proč humanized výstup někdy přesto dosahuje vysokého skóre

Nejběžnějším důvodem je rozsah pokrytí. Humanizer použitý na úvod a závěr ponechá přehled literatury a diskusi nedotčené a tyto části přenesou své původní skóre přímo do průměru. V dlouhé kapitole přepsání úvodních stran změní jen několik segmentů a zbytek ponechá přesně tak, jak byl, což vyvolá menší posun, než autor očekává od práce, která působila podstatně.

Druhým důvodem je hloubka přepisu. Úprava, která nahrazuje slovní zásobu, ale zachovává délky vět, pořadí vět vedlejších a volbu přechodů, ponechává vzorec, na němž byl klasifikátor trénován, z velké části nedotčený. Model hodnotí tvar prózy, takže změna slov, která tento tvar vyplňují, má menší účinek, než většina lidí předpokládá. free perplexity checker ukáže, jak předvídatelně daný úryvek po přepisu stále působí, což je informativnější signál než porovnání na úrovni slov před a po.

Třetím důvodem je, že přepis může zavést vlastní pravidelnost. Software, který použije stejnou transformaci na každý odstavec, vytvoří nový vzorec, který je stejně pravidelný jako ten původní. Pokud má každá věta stejný typ společného řezu, nebo pokud je do stejného místa u každé věty vložena stejná druhová vyhýbavá vedlejší věta, budou tyto věty klasifikátorem vnímány stejně rovnoměrně, jako by byly všechny od začátku stejně dlouhé.

SituaceCo dělá skóre AIProč
Přepsána byla jen část dokumentuKlesne méně, než se očekáváNedotčené úseky si do průměru nesou svá původní skóre
Změnila se slovní zásoba, struktura vět zůstala zachovánaPosune se jen velmi máloKlasifikátor hodnotí vzorce na úrovni vět, které tato záměna ponechala na místě
Věty byly napříč textem skutečně přepracoványPosune se víceRovnoměrný rytmus, který se model naučil rozpoznávat, je narušen
Bylo odevzdáno méně než 300 slov prózyŽádné skóre se vůbec nevygenerujeTurnitin vyžaduje 300 slov způsobilé prózy, než zobrazí procento
Výsledek se dostane pod 20 percentMísto čísla se zobrazí hvězdičkaTurnitin označuje výsledky v tomto rozmezí jako méně spolehlivé

Proč stejný přepis někdy vede k nízkému skóre

Humanizovaný dokument se může vrátit s nízkým skóre z důvodů, které s přepisem nijak nesouvisejí. Turnitin potřebuje alespoň 300 slov způsobilé prózy, než vůbec vygeneruje procento AI, a tuto hranici zvýšil z původních 150 slov s uvedeným odůvodněním, že přesnost se s o něco delším textem zlepšuje. Krátký reflexivní text nevytvoří žádné číslo a chybějící skóre není totéž co čisté skóre.

Turnitin označuje rozmezí pod 20 percent hvězdičkou místo přesného procenta, protože v tomto rozmezí je vyšší výskyt falešně pozitivních výsledků. V době uvedení na trh se o tomto chování zmiňovalo i vzdělávací zpravodajství, které uvádělo, že výsledky označené jako méně než 20 percent AI-written měly vyšší výskyt falešně pozitivních výsledků, a Turnitin proto přidal upozornění. Dokument nacházející se v tomto pásmu byl označen jako rozmezí, které Turnitin odmítá uvádět přesně, což je něco jiného než být vyčištěn.

Existuje také institucionální brána nad tím vším. Turnitin zpracuje odevzdanou práci pro detekci psaní pomocí AI pouze tehdy, pokud instituce tuto funkci zapne, a administrátoři ji mohou vypnout pro celý účet. Vanderbilt University to přesně udělala v srpnu 2023 s odkazem na tehdy zveřejněnou 1 procentní míru falešně pozitivních výsledků společnosti Turnitin u přibližně 75,000 ročních odevzdání, zaujatost vůči autorům, pro něž angličtina není rodným jazykem, a nedostatek transparentnosti ohledně toho, jak model funguje. Student na instituci, kde je tato funkce vypnutá, nemá u žádné odevzdané práce žádné skóre AI, ať už je humanizovaná, nebo ne.

A tam, kde bylo přepsání skutečně strukturální, může skóre klesnout, protože se změnil měřený vzorec. Turnitin uvádí odhad vypočtený z psacích vzorců, takže text, jehož vzorce se liší, dostává jiné skóre. Mechanismus funguje oběma směry, a to je ta nepříjemná část, původní lidské psaní někdy získá vysoké skóre ze zcela stejného důvodu.

Zlidštit vlastní práci

Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.

Začít zdarma

Co tvrdí jednotliví dodavatelé humanizerů a co je doloženo

Pro tabulku platí jedno pravidlo. Prostřední sloupec je vlastní marketingový jazyk dodavatele, převzatý z jeho vlastních stránek všude tam, kde by tyto stránky posloužily jako zdroj. Pravý sloupec zaznamenává, co za každým tvrzením skutečně stojí, což ve většině případů není žádný dataset, datum ani metoda. Neexistuje žádný veřejný přímý srovnávací test těchto značek.

ZnačkaCo tvrdí dodavatelCo je doloženo
Undetectable.aiUvádí průchod AI detektory jako funkci produktu bez připojeného čísla a nabízí vrácení nákladů na humanizaci, pokud je výstup označen jako ne lidskýVrácení peněz je obchodní podmínka, za tvrzením nestojí žádný dataset, datum ani výsledek po jednotlivých detektorech
QuillBotNa svých vlastních stránkách neuvádí pro funkci humanizer žádné tvrzení o detekci ani obcházení. Jeho samostatný AI detektor je popisován pouze jako nástroj pro detekci AI generovaného obsahuQuillBot prodává humanizer v rámci obecného balíku pro psaní a pro něj neuvádí žádné tvrzení specifické pro Turnitin
WriteHumanJe na Humanizer Leaderboardu uveden na prvním místě a popisován jako prémiový AI humanizer pro seriózní psaníLeaderboard neuvádí žádnou metodiku ani vzorek a WriteHuman k tomuto umístění nepřipojuje žádné číselné údaje o přesnosti
Walter Writes AIMarketingově uvádí širokou humanizaci ve více než 80 jazycích bez tvrzení specifického pro TurnitinŽádná testovací data ani jedním směrem
HIX BypassMarketingově uvádí stránky pro obcházení po jednotlivých detektorech bez číselného údaje specifického pro TurnitinHIX Bypass a BypassGPT jsou samostatné produkty na samostatných doménách, proto je třeba ověřit, který z nich dané tvrzení popisuje
StealthGPTPrůměr 98% lidského výsledku na Turnitin a 95% na GPTZero, každý z uvedeného běhu 30 vzorků s nulovou detekcí, plus záruka vrácení peněz, pokud je předplatitel detekovánVlastní tvrzení. Vedle čísel nejsou zveřejněny žádný dataset, výběr vzorků, datum ani metoda a 30 dokumentů je malý běh pro tvrzení o modelu, který hodnotí miliony odevzdaných textů
PhraslyPrezentuje se jako odstraňovač AI detekce, nezveřejňuje žádná testovací dataŽádné veřejné tvrzení ani jedním směrem. Čísla kolující v recenzích jsou z druhé ruky a zde jsou z principu vyloučena
GrammarlySvůj přepis vůbec neprodává jako obcházení detekce. Jeho stránka AI detektoru tvrdí 99% přesnost detekce a první místo v nezávislém benchmarku RAIDStejná stránka Grammarly uvádí, že žádný AI detektor není 100% přesný. Funkce Authorship označuje text jako napsaný člověkem, vytvořený pomocí AI nebo upravený pomocí Grammarly
TextPulse92.33% míra průchodu na Turnitin AI, 89.12% na Originality.ai a 87.91% na GPTZero, měřeno na akademickém korpusu o 2,000 dokumentechMěřeno a zveřejněno TextPulse, tedy vlastní tvrzení stejně jako každé číslo výše. Velikost korpusu i detektory jsou uvedeny, žádný výsledek detektoru není slibován pro jednotlivý dokument

Tři věci z té tabulky vyplývají. Většina těchto nástrojů nezveřejňuje žádné tvrzení o detekci, které by vůbec bylo možné ověřit. Několik z nich připojuje k číslu velikost vzorku, což je víc, než dokáže zbytek této kategorie. A žádný z nich nezveřejňuje datovou sadu, kterou by si mohl kdokoli mimo společnost sám spustit. Každé značce je však třeba přiznat to, co si zaslouží. Undetectable.ai staví za své tvrzení možnost vrácení peněz, což je konkrétní závazek, nikoli přídavné jméno. WriteHuman zveřejňuje přesné limity požadavků a slov pro jednotlivé tarify, takže kupující ví, co dostává. Grammarly na stejné stránce, kde uvádí své tvrzení, kvalifikuje i vlastní údaj o přesnosti, což je víc, než dělá většina prodejců detektorů. A to, že QuillBot vůbec netvrdí, že lze obejít detekci, je na tomto seznamu nejlépe obhajitelný postoj.

Proč nikdo mimo dodavatele nemůže tato čísla ověřit

Dodavatel humanizeru, který tvrdí míru průchodu Turnitin, popisuje běhy provedené přes účet, který ovládá, na dokumentech, které sám vybral, k datu, které obvykle neuvádí, proti klasifikátoru, který Turnitin upravuje s tím, jak jsou vydávány nové jazykové modely. To platí pro StealthGPT a jeho údaj z třiceti vzorků a stejně tak pro údaj o 2.000 dokumentech, který tento web zveřejňuje. Velikost korpusu mění, kolik šumu v čísle je. Nepřeměňuje však vlastní hlášení v audit.

Druhá polovina problému spočívá v tom, že vlastní seznam modelů, které Turnitin tvrdí detekovat, se upravuje s příchodem nových verzí. Ta míra průchodu změřená proti klasifikátoru z minulého čtvrtletí popisuje klasifikátor z minulého čtvrtletí a nic jiného. Proč to znamená, že nikdo nemůže jmenovat nejlepší AI humanizer pro obejití Turnitin, je vysvětleno samostatně. Každé číslo na každé domovské stránce humanizeru, včetně této, je snímek stavu nesoucí datum, které dodavatel možná nikdy nezveřejnil.

Jak číst tvrzení o obejití, než za něj zaplatíte

Čtyři otázky oddělují tvrzení, které stojí za zvážení, od tvrzení, které stojí za ignorování, a platí pro každý řádek v tabulce výše, včetně posledního.

  • Kolik dokumentů bylo testováno a kdo je vybral? Procento bez uvedené velikosti vzorku je slogan s číslem.
  • K jakému datu a proti které verzi detektoru? Detekční modely se revidují, jakmile jsou vydávány nové jazykové modely, a neoznačená míra úspěšnosti rychle zastarává.
  • Je záruka vrácení peněz, nebo výsledek? Slib vrácení peněz přenáší malé finanční riziko a vůbec nic neřeší v rámci akademické integrity komise.
  • Co vendor říká, že se stane s citací, technickým termínem nebo blokovou citací? Většina stránek humanizeru neříká nic, a to je samo o sobě odpověď.

Právě tato poslední otázka rozhoduje pro každého, kdo odevzdává akademickou práci, více než aritmetika detektoru. Přepis, který dosáhne dobrého skóre a nenápadně zobecní větu v metodice, vás stál to, za co jste byli hodnoceni. TextPulse's academic humanizer dokumentuje zachování citací v APA, MLA, IEEE, Chicago, Harvard a Vancouver, freeze terms pro uzamčení přesné slovní zásoby před spuštěním průchodu a trénink na recenzovaném akademickém textu s výstupem udržovaným na Flesch-Kincaid grade 13 to 18. To jsou tvrzení o tom, co se děje s textem, což je jiný druh tvrzení než procento o detektoru, a čtenář je může ověřit ve výstupu během minuty.

Co skóre znamená pro studenta v každém případě

Turnitin jasně uvádí, že ukazatel AI psaní není zjištěním pochybení. Stránka produktu Turnitin výslovně uvádí, že Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." Také jasně uvádí, že Turnitin poskytuje informace, aby učitelé mohli učinit informované rozhodnutí na základě zásad své instituce. To je znovu zdůrazněno upozorněním, že model "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."

Studenti ve výchozím nastavení skóre nevidí. Turnitin výslovně uvádí, že indikátor detekce psaní pomocí AI a zpráva nejsou studentům viditelné, a jediná cesta, jak je vidět, je, aby vyučující stáhl zprávu jako PDF a předal ji dál. Student, který kontroluje vlastní návrh, kontroluje jiný nástroj trénovaný na jiných datech, a tato dvě čísla nemají povinnost se shodovat.

Tím zůstává část, kterou žádné skóre nevyřeší. Zda byla pomoc AI vůbec povolena, je otázka pro kurz a instituci, a politika používání AI ji zodpovídá způsobem, jakým to procento nikdy nedokáže. Vysoké skóre u povoleného, přiznaného použití je rozhovor s důkazy v pozadí. Nízké skóre u nepřiznaného použití, které politika zakazuje, je stále nepřiznané použití.

Pro autora, který upravuje vlastní návrh, je praktické čtení toho všeho takové, že skóre následuje psaní. Model Turnitin měří vzorec na úrovni vět v celém dokumentu, takže částečné přepisy vyvolávají jen částečný posun a průchody slovní zásobou vyvolávají vůbec jen velmi malý posun. Úplný postup jak zlidštit AI text rozebírá strukturální úpravy, které vzorec mění, v pořadí, které jej posouvá nejvíce.

AI humanizer od TextPulse tyto strukturální úpravy aplikuje na celý dokument najednou a uvádí odhadované Human Score vypočtené ze samotného textu, nikoli předpověď toho, co řekne kterýkoli pojmenovaný detektor. Žádný nástroj nemůže slíbit výsledek v Turnitin, protože žádný nástroj nemůže nahlédnout do modelu Turnitin. Každý produkt, který tvrdí opak, popisuje výsledek, který nemá jak pozorovat.

Rozdíl mezi humanizerem a paraphraserem je zde důležitý, stejně jako důvod, proč je parafrázovaný text stále označován.

Číslo je na tom to nejméně zajímavé. O výsledku rozhoduje dvacet minut poté, co se na to podívá hodnotitel: zda práce může ukázat svůj postup, historii návrhů, soubor poznámek, zdroje, o nichž může autor mluvit, aniž by je otevíral. Tento důkaz je dostupný každému, kdo práci skutečně udělal, a přežije známku, s níž přepsaná verze nehnula.

XLinkedInFacebook

Často kladené otázky

Vlastní pokyny Turnitin uvádějí, že jeho AI indikátor zahrnuje detekci obsahu, který mohl být zhumanizován nebo prošel bypasserem. To, co produkt skutečně výstupuje, je procento kvalifikovaného textu, nikoli verdikt o autorství. Praktická odpověď na otázku, zda Turnitin dokáže odhalit zhumanizovaný text, tedy je, že skóre odráží, kolik z vzorce strojového psaní přežilo přepis.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

Zůstaňte v obraze o humanizaci AI

Získejte tipy na akademické psaní, detekci AI a humanizaci doručené do vaší schránky.

Žádný spam. Kdykoli se můžete odhlásit.