AI Detection

Turnitin false positive rate: Co říkají čísla

Turnitin zveřejňuje dvě hodnoty falešně pozitivních výsledků, ne jednu, a ani jedna nepopisuje práci ležící před konkrétním profesorem. Zde je rozdělení na úrovni dokumentu versus na úrovni věty, hvězdička pod 20 procent a aritmetika, která mění zlomek procenta na skutečný počet studentů.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

Falešně pozitivní míra Turnitin není jedno číslo. Společnost zveřejňuje dvě, hodnotu pod 1 procento na úrovni dokumentu a hodnotu blíže 4 procentům na úrovni věty. Obě jsou skutečné, obě jsou zveřejněné a ani jedna sama o sobě neříká mnoho o konkrétním textu, který leží před konkrétním vyučujícím.

Právě tento rozdíl mezi oběma hodnotami a to, co nastane, jakmile se kterákoli z nich použije na skutečnou třídu místo na jediný dokument, je předmětem tohoto textu: co Turnitin sám uvádí, co obě čísla skutečně pokrývají a jak aritmetika mění zlomek procenta v reálný počet studentů.

Jaká je falešně pozitivní míra Turnitin podle Turnitin?

Na úrovni dokumentu, vlastními slovy společnosti: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Tato podmínka je stejně důležitá jako samotné číslo. Hodnota pod 1 procento není tvrzením o každé práci, kterou Turnitin vyhodnocuje. Popisuje pouze podmnožinu prací, které již v odhadu modelu překročily hranici 20 procent textu napsaného AI.

Na úrovni věty, kde rozhraní zvýrazňuje jednotlivé řádky místo celého dokumentu, je vlastní hodnota Turnitin zhruba čtyřikrát vyšší. "Our sentence-level false positive rate is around 4%," uvádí společnost. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin dodává, že tyto chybně označené věty se nerozptylují náhodně: v 54 procentech případů leží falešně označená věta bezprostředně vedle skutečného textu napsaného AI, což společnost uvádí jako součást důvodu, proč skóre za celý dokument obvykle obstojí lépe než kterýkoli jednotlivý zvýrazněný řádek.

Úroveň dokumentu a úroveň věty nejsou totéž tvrzení

Toto dvouúrovňové rozdělení je upravené sdělení, nikoli původní stanovisko Turnitin. Při uvedení na trh v dubnu 2023 společnost zveřejnila jedinou hodnotu pod 1 procento, bez jakéhokoli rozlišení mezi dokumentem a větou. Poté, co instituce začaly tuto hodnotu citovat a poté, co vzdělávací tisk informoval o vyšším než očekávaném počtu falešně pozitivních výsledků v praxi, hlavní produktový ředitel Turnitin zveřejnil rozklad použitý výše, spolu se dvěma změnami produktu provedenými v reakci na to, zvýšením minimální délky dokumentu, který lze bodovat, ze 150 na 300 slov a změnou způsobu, jakým se bodují úvodní a závěrečné věty v dokumentu.

Limit 300 slov existuje z příbuzného důvodu. Turnitin jej zvýšil z původního minima 150 slov poté, co zjistil, slovy společnosti, že přesnost roste s větším množstvím textu. Krátké odevzdání, jednostránková reflexe, neúplný návrh, příspěvek do diskuse, poskytuje modelu méně signálu, s nímž může pracovat, než proti čemu byly měřeny výše uvedené hodnoty falešně pozitivních výsledků, což je jedním z důvodů, proč cokoli pod tímto limitem nedostane žádné AI skóre vůbec, místo aby dostalo nespolehlivé.

ÚroveňTurnitinem uvedená míraCo skutečně zahrnuje
Na úrovni dokumentuPod 1%Pouze dokumenty, které již byly označeny jako 20% nebo více napsané AI, celkové procento pro celé odevzdání
Na úrovni větyPřibližně 4%Jakákoli jednotlivá věta zvýrazněná v rámci zprávy o psaní AI, bez ohledu na celkové skóre dokumentu
Pod hranicí 20% dokumentuŽádné číslo se nezobrazujeTurnitin místo procenta zobrazuje hvězdičku, čímž označuje výsledek v tomto rozmezí jako méně spolehlivý

Zlidštit vlastní práci

Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.

Začít zdarma

Aritmetika, co znamená zlomek procenta pro skutečnou kohortu

Matematika byla provedena veřejně, když Vanderbilt University v srpnu 2023 vypočítala míry chyb spojené s detekcí AI od Turnitin. Nejlepším příkladem toho, jak tuto matematiku provést, je vlastní výpočet čísel od Vanderbilt. V blogovém příspěvku o svém rozhodnutí vypnout detektor AI od Turnitin uvedli: "[i]n 2022 jsme odeslali do Turnitin přibližně 75,000 prací, což znamená, že Turnitinem uváděná 1 procentní míra falešně pozitivních výsledků znamená, že přibližně 750 studentských prací mohlo být nesprávně označeno jako práce, v nichž bylo některé části napsány pomocí AI."

Tento údaj je vlastní extrapolací Vanderbilt z veřejně uvedeného čísla dodavatele aplikovaného na vlastní objem Vanderbilt, nikoli samostatně měřeným výsledkem. Logika této aritmetiky se dá zobecnit i mimo počet studentů jedné univerzity. Míra pod 1 procento aplikovaná na několik set prací vytvoří jen hrstku nesprávně označených studentů, což lze snadno přehlédnout. Stejná míra aplikovaná na desítky tisíc prací, tedy na rozsah, který skutečná univerzita odevzdává každý rok, vytvoří stovky, nikoli hrstku, protože se násobí malé procento a velká populace, místo aby se posuzovaly izolovaně.

Nic z toho neprokazuje, že skutečná míra v praxi přesně odpovídá laboratornímu údaji. Vlastní hlavní produktový ředitel Turnitin veřejně uznal, že výsledky v praxi se liší od laboratorního testování, což je jedním z důvodů, proč společnost své sdělení původně upravila. Výše uvedená aritmetika zachází s vlastním uváděným číslem Turnitin jako s údajem, který stojí za to brát vážně, nikoli jako s horní hranicí toho, co se skutečně děje, jakmile nástroj hodnotí odevzdané práce, které se vůbec nepodobají pečlivě vybranému benchmarku.

Co míra nepokrývá

Výsledek pod hranicí 20 percent nedostane přiřazené malé procento. Místo čísla dostane hvězdičku, což je volba, kterou Turnitin učinil proto, že právě v tomto rozmezí je nástroj v obou směrech nejméně spolehlivý, což potvrzuje nezávislé zpravodajství z oblasti vzdělávání spolu s vlastním rámováním nízké jistoty společnosti v tomto rozmezí. Lehké upravení, jeden odstavec přepracovaný s pomocí a zbytek napsaný bez pomoci, může vést k tomu, že se nezobrazí žádné viditelné skóre, nikoli jen malé, a je dobré to vědět dříve, než se chybějící číslo začne číst buď jako obvinění, nebo jako čistý zdravotní stav. Průvodce TextPulse k tomu, co se počítá jako dobré skóre Turnitin, pokrývá stejnou hranici z pohledu čtenáře zprávy.

Jak by se tedy mělo číst zveřejněné procento falešně pozitivních výsledků?

Jako údaj dodavatele o užším stavu, než se na první pohled zdá, že popisuje, nikoli jako tvrzení o textu ležícím před konkrétním profesorem. Turnitin své vlastní výstupy rámuje stejně, společnost výslovně uvádí, že její technologie pro detekci AI psaní neposkytuje "a determination of misconduct", pouze "data for educators to make an informed decision." Širší důkazy o tom, zda jsou AI detektory vůbec přesné, podporují stejné čtení, zveřejněná míra popisuje referenční hodnotu, nikoli dokument, který je právě hodnocen.

Autoři, kteří chtějí vědět, kde se jejich vlastní návrh nachází na stejném typu statistického měření, místo aby hádali, si to mohou přímo ověřit pomocí free perplexity checker ještě předtím, než se cokoli z toho dostane k detektoru instituce. To je jiné použití technologie než snaha zpětně polemizovat se skóre, a je to jediné místo, kde autor, nikoli administrátor, uvidí číslo jako první.

Přesnost ZeroGPT je posuzována samostatně pro každého, jehož instituce používá právě tento nástroj. Skupina, na kterou tyto chyby dopadají nejsilněji, autoři píšící anglicky jako nerodilí mluvčí, je předmětem vlastní stránky.

Nejvíce vystavená populace této aritmetice také není rozložena rovnoměrně. Autoři, pro něž angličtina není rodným jazykem nesou nejvyšší zdokumentované riziko, že skončí na nesprávné straně kteréhokoli z těchto procent, což je přesně publikum, kolem něhož je postavena stránka TextPulse pro akademické autory používající angličtinu jako druhý jazyk. Turnitin bude tato čísla nadále revidovat, jak bude svůj model znovu trénovat. Co se nezmění, je samotná aritmetika, takto malá míra stále potřebuje takto velkou populaci, do níž může zmizet, a většina skutečných odevzdaných prací takové štěstí nemá.

XLinkedInFacebook

Často kladené otázky

Míra falešně pozitivních výsledků Turnitin, podle vlastních zveřejněných údajů společnosti, není jedno číslo. Na úrovni dokumentu Turnitin uvádí míru pod 1 procento, ale pouze pro dokumenty, které už označil jako 20 procent nebo více AI-written. Na úrovni věty, kde jsou zvýrazněny jednotlivé řádky, je vlastní údaj společnosti kolem 4 procent.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Zůstaňte v obraze o humanizaci AI

Získejte tipy na akademické psaní, detekci AI a humanizaci doručené do vaší schránky.

Žádný spam. Kdykoli se můžete odhlásit.