Turnitin: wskaźnik fałszywie dodatnich wyników, co mówią liczby
Turnitin publikuje dwie wartości fałszywie dodatnich wyników, a nie jedną, i żadna nie opisuje pracy leżącej przed konkretnym profesorem. Oto podział na poziom dokumentu i poziom zdania, zastrzeżenie poniżej 20 procent oraz obliczenia, które zamieniają ułamek procenta w rzeczywistą liczbę studentów.
Wskaźnik fałszywie dodatnich wyników Turnitin nie jest jedną liczbą. Firma publikuje dwie: wartość poniżej 1 procenta na poziomie dokumentu oraz wartość bliższą 4 procentom na poziomie zdania. Obie są rzeczywiste, obie są publikowane i żadna z nich sama w sobie nie mówi wiele o konkretnym tekście leżącym przed konkretnym profesorem.
Ta różnica między tymi dwiema wartościami oraz to, co dzieje się, gdy którąkolwiek z nich zastosuje się do rzeczywistej klasy, a nie do pojedynczego dokumentu, stanowi przedmiot tego tekstu: co sam Turnitin stwierdza, co rzeczywiście obejmują te dwie liczby oraz arytmetyka, która zamienia ułamek procenta w rzeczywistą liczbę studentów.
Czym jest wskaźnik fałszywie dodatnich wyników Turnitin, według Turnitin?
Na poziomie dokumentu, własnymi słowami firmy: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Ten warunek ma znaczenie równie duże jak sama liczba. Wartość poniżej 1 procenta nie jest twierdzeniem dotyczącym każdego tekstu ocenianego przez Turnitin. Opisuje wyłącznie tę część tekstów, które już przekroczyły próg 20 procent tekstu napisanego przez AI w szacunku samego modelu.
Na poziomie zdania, gdzie interfejs wyróżnia pojedyncze linie zamiast całego dokumentu, własna wartość Turnitin jest mniej więcej cztery razy wyższa. "Our sentence-level false positive rate is around 4%," stwierdza firma. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin dodaje, że te błędnie oznaczone zdania nie rozpraszają się losowo: w 54 percent przypadków fałszywie oznaczone zdanie znajduje się bezpośrednio obok rzeczywistego tekstu AI, co firma podaje jako część wyjaśnienia, dlaczego wynik dla całego dokumentu zwykle utrzymuje się lepiej niż jakakolwiek pojedyncza wyróżniona linia.
Poziom dokumentu i poziom zdania nie są tym samym twierdzeniem
Ten dwupoziomowy podział jest zmienionym przekazem, a nie pierwotnym stanowiskiem Turnitin. W momencie uruchomienia w kwietniu 2023 roku firma opublikowała jedną wartość poniżej 1 procenta, bez jakiegokolwiek rozróżnienia między dokumentem a zdaniem. Po tym, jak instytucje zaczęły cytować tę liczbę, a prasa edukacyjna zaczęła informować o wyższej niż oczekiwano liczbie fałszywych trafień w warunkach rzeczywistych, dyrektor ds. produktu Turnitin opublikował przedstawiony wyżej podział, wraz z dwiema zmianami produktu wprowadzonymi w odpowiedzi: podniesieniem minimalnej długości dokumentu podlegającego ocenie z 150 do 300 słów oraz zmianą sposobu punktowania zdań początkowych i końcowych w dokumencie.
Próg 300 słów istnieje z pokrewnego powodu. Turnitin podniósł go z pierwotnego minimum 150 słów po stwierdzeniu, jak podaje sama firma, że dokładność rośnie wraz z większą ilością tekstu. Krótkie zgłoszenie, jednostronicowa refleksja, niepełny szkic, wpis na forum, dostarcza modelowi mniej sygnałów do pracy niż te, względem których mierzono powyższe wskaźniki fałszywych trafień, dlatego wszystko poniżej tego progu nie otrzymuje w ogóle wyniku AI, zamiast wyniku niewiarygodnego.
| Poziom | Podawany przez Turnitin wskaźnik | Co faktycznie obejmuje |
|---|---|---|
| Poziom dokumentu | Poniżej 1% | Tylko dokumenty już oznaczone jako zawierające 20% lub więcej tekstu napisanego przez AI, ogólny odsetek dla całego zgłoszenia |
| Poziom zdania | Około 4% | Każde pojedyncze zdanie wyróżnione w raporcie pisania AI, niezależnie od ogólnego wyniku dokumentu |
| Poniżej progu 20% dla dokumentu | Nie wyświetla się żadna liczba | Turnitin wyświetla gwiazdkę zamiast procentu, oznaczając wynik jako mniej wiarygodny w tym zakresie |
Humanizuj własną pracę
Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.
Artymetyka: co oznacza ułamek procenta dla rzeczywistej kohorty
Obliczenia zostały wykonane publicznie, gdy Vanderbilt University w sierpniu 2023 roku obliczył wskaźniki błędów związane z wykrywaniem AI przez Turnitin. Najlepszym przykładem tego, jak wykonać te obliczenia, jest własne wyliczenie liczb przez Vanderbilt. W poście na blogu dotyczącym decyzji o wyłączeniu detektora AI Turnitin zauważyli: "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
Ta liczba jest własną ekstrapolacją Vanderbilt z opublikowanej przez dostawcę wartości zastosowanej do własnej skali Vanderbilt, a nie osobno zmierzonym wynikiem. Logika tych obliczeń wykracza poza liczebność jednej uczelni. Wskaźnik poniżej 1 procenta zastosowany do kilkuset prac daje garstkę błędnie oznaczonych studentów, łatwą do przeoczenia. Ten sam wskaźnik zastosowany do dziesiątek tysięcy prac, czyli skali, jaką rzeczywista uczelnia przesyła każdego roku, daje setki, a nie garstkę, ponieważ mały procent i duża populacja są mnożone razem, a nie rozpatrywane osobno.
Nic z tego nie dowodzi, że rzeczywisty wskaźnik dokładnie odpowiada wartości laboratoryjnej. Własny chief product officer Turnitin publicznie przyznał, że wyniki w warunkach rzeczywistych różnią się od testów laboratoryjnych, co częściowo wyjaśnia, dlaczego firma od początku zmieniła sposób komunikowania tych danych. Powyższe obliczenia traktują własną podaną przez Turnitin wartość jako dane wejściowe, które warto traktować poważnie, a nie jako górny limit tego, co faktycznie dzieje się, gdy narzędzie ocenia prace, które w niczym nie przypominają starannie dobranego benchmarku.
Co wskaźnik nie obejmuje
Wynik poniżej progu 20 percent nie otrzymuje przypisanego małego procentu. Zamiast liczby pojawia się gwiazdka, a nie cyfra, co Turnitin przyjęło dlatego, że właśnie w tym zakresie narzędzie jest najmniej wiarygodne w obu kierunkach, co potwierdzają niezależne relacje prasy edukacyjnej oraz własne ujęcie niskiej pewności przez firmę w tym zakresie. Lekka redakcja, jeden akapit poprawiony z pomocą, a reszta napisana samodzielnie, może dać w ogóle brak widocznego wyniku zamiast małego, co warto wiedzieć, zanim brak liczby zostanie odczytany jako oskarżenie albo czyste świadectwo zdrowia. Przewodnik TextPulse po tym, co liczy się jako dobry wynik Turnitin omawia ten sam próg z perspektywy czytelnika raportu.
Jak zatem należy odczytywać opublikowany wskaźnik fałszywie dodatnich wyników?
Jako liczbę podaną przez dostawcę dla węższego warunku, niż początkowo wydaje się opisywać, a nie jako stwierdzenie dotyczące pracy leżącej przed konkretnym profesorem. Turnitin ujmuje własny wynik w ten sam sposób, firma wyraźnie stwierdza, że jej technologia wykrywania pisania przez AI nie daje "a determination of misconduct," lecz jedynie "data for educators to make an informed decision." Szersze dowody dotyczące tego, czy detektory AI są w ogóle dokładne potwierdzają to samo odczytanie, opublikowany wskaźnik opisuje punkt odniesienia, a nie dokument aktualnie oceniany.
Autorzy, którzy chcą wiedzieć, gdzie ich własny szkic znajduje się na tego samego rodzaju pomiarze statystycznym, zamiast zgadywać, mogą sprawdzić to bezpośrednio za pomocą darmowego sprawdzacza perplexity zanim cokolwiek trafi do detektora instytucji. To inne zastosowanie tej technologii niż próba sporu z wynikiem po fakcie, i to jedyne miejsce, w którym autor, a nie administrator, widzi liczbę jako pierwszy.
Dokładność ZeroGPT jest omawiana osobno dla każdego, czyja instytucja korzysta z tego narzędzia. Grupa, na którą te błędy spadają najmocniej, autorzy piszący po angielsku niebędący native speakerami, jest tematem własnej strony.
Populacja najbardziej narażona na tę arytmetykę również nie jest rozłożona równomiernie. Autorzy piszący po angielsku jako języku nienatywnym ponoszą największe udokumentowane ryzyko znalezienia się po niewłaściwej stronie któregokolwiek z tych procentów, a właśnie do tej grupy odbiorców jest skierowana strona TextPulse dla akademickich autorów ESL. Turnitin będzie nadal korygować te liczby, gdy ponownie będzie trenować swój model. To, co się nie zmieni, to sama arytmetyka: tak mały wskaźnik nadal potrzebuje tak dużej populacji, aby mógł w niej zniknąć, a większość rzeczywistych zgłoszeń nie ma takiego szczęścia.
Najczęściej zadawane pytania
Wskaźnik fałszywie dodatnich wyników Turnitin, według własnych opublikowanych danych firmy, nie jest jedną liczbą. Na poziomie dokumentu Turnitin podaje wskaźnik poniżej 1 procenta, ale tylko dla dokumentów już oznaczonych jako w co najmniej 20 procentach napisane przez AI. Na poziomie zdania, gdzie wyróżniane są pojedyncze linie, własna wartość firmy wynosi około 4 procent.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.