Czy Turnitin wykrywa zhumanizowany tekst AI?
Turnitin twierdzi, że jego wskaźnik pisania AI już obejmuje tekst przepuszczony przez humanizer. Co to twierdzenie oznacza, a czego nie oznacza, dlaczego zhumanizowany dokument czasem nadal uzyskuje wysoki wynik, a czasem nie, oraz ile ta liczba jest warta dla studenta w obu przypadkach.
Turnitin odpowiada na to pytanie na własnej stronie pomocy technicznej, a odpowiedź jest bardziej precyzyjna niż którakolwiek ze stron zwykłego sporu. Jego wskaźnik pisania AI, Turnitin says, obejmuje już wykrywanie treści wygenerowanych przez AI, które mogły zostać uczłowieczone lub przepuszczone przez bypasser, aby uniknąć wykrycia. To opis własnego produktu przez dostawcę. Jest to również właściwe miejsce, od którego należy zacząć, ponieważ mówi ono, co model twierdzi, że obejmuje.
Zatem, czy Turnitin może wykryć uczłowieczony tekst? Pytanie ma węższą i bardziej użyteczną postać. Model Turnitin nie szuka odcisku palca humanizera i nie prowadzi listy narzędzi. Ocenia prozę zdanie po zdaniu pod kątem tego, jak ściśle pisanie odpowiada statystycznym wzorcom tekstu generowanego maszynowo, a następnie uśrednia te oceny w całym dokumencie. To, czy uczłowieczony fragment nadal uzyska wysoką ocenę, zależy od tego, jak bardzo przeróbka zmieniła ten wzorzec oraz od tego, jak duża część dokumentu została w ogóle przepisana.
Czy Turnitin może wykryć uczłowieczony tekst? Co twierdzi Turnitin
Ich opublikowane stanowisko brzmi po prostu tak. Odpowiadając na pytanie, czy może wykrywać treści przepuszczone przez humanizer, ich wytyczne stwierdzają: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." Ta sama strona podaje taką samą odpowiedź w odniesieniu do narzędzi do parafrazowania AI.
To twierdzenie nie pojawia się jako druga liczba gdzieś w raporcie. Turnitin ujmuje je w jednym procencie pisania AI, a opublikowana definicja tego procentu mówi to wprost: obejmuje on tekst, który model uznaje za prawdopodobnie wygenerowany przez AI, albo prawdopodobnie wygenerowany, a następnie zmodyfikowany przez parafrazator AI lub bypasser. Jest jeden wynik i już uwzględnia on przeróbkę w takim zakresie, w jakim model jest do tego zdolny.
Przeczytaj uważnie, to stwierdzenie dotyczy zakresu, a nie trafności. Turnitin mówi, że tekst zhumanizowany był objęty zakresem, gdy model był budowany. To daleko od stwierdzenia, że każdy zhumanizowany dokument uzyskuje wysoki wynik, a własne opublikowane dane, dalej poniżej, opisują model, który traktuje pojedyncze zdania jako niepewne.
Co tak naprawdę ocenia wskaźnik pisania AI
To nie jest procent. To jest ułamek tekstu, więc nie jest to poziom ufności. To miara tego, jak dużą część tekstu w Twoim dokumencie nasz model uznaje za prawdopodobnie wygenerowaną przez AI. Nazywamy to tekstem kwalifikowanym, co oznacza zdania prozatorskie w formacie długiego tekstu. Nie obejmuje list punktowanych, kodu, tabel ani krótkich fragmentów. I dlatego możesz widzieć różne liczby dla tej samej pracy w zależności od tego, ile z niej stanowi ciągła proza.
Mechanizm pod spodem jest na tyle prosty, że można go sobie wyobrazić. Turnitin dzieli dokument na nakładające się segmenty liczące mniej więcej po kilkaset słów, około pięć do dziesięć zdań każdy, z nakładaniem tak, aby każde zdanie było oceniane w kontekście. Każde zdanie otrzymuje wartość między 0 i 1. Wyniki segmentów są następnie uśredniane w całym dokumencie, aby uzyskać jedną liczbę, którą widzi prowadzący. Szczegółowy opis jak Turnitin wykrywa AI przechodzi przez każdy etap bardziej szczegółowo.
Ten etap uśredniania ma większe znaczenie dla tekstu zhumanizowanego niż cokolwiek innego w całym procesie i to właśnie jego prawie nikt nie uwzględnia. Liczba, którą odczytuje prowadzący, jest średnią arytmetyczną ocen na poziomie segmentów. Dokument może być w połowie przepisany i trafić gdzieś pośrodku z powodów, które mają niewiele wspólnego z tym, jak dobre było przepisanie.
Dlaczego wynik tekstu zhumanizowanego czasem nadal jest wysoki
Najczęstszym powodem jest zakres objęcia. Humanizer zastosowany do wstępu i zakończenia pozostawia przegląd literatury oraz dyskusję bez zmian, a te segmenty przenoszą swoje pierwotne wyniki wprost do średniej. W długim rozdziale przepisanie początkowych stron zmienia kilka segmentów i pozostawia resztę dokładnie taką, jaka była, co daje mniejszą zmianę, niż autor oczekuje po pracy, która wydawała się znacząca.
Drugim powodem jest głębokość przeredagowania. Przejście, które zastępuje słownictwo, zachowując długości zdań, kolejność zdań podrzędnych i wybór łączników, pozostawia wzorzec, na którym model został wytrenowany, w dużej mierze nienaruszony. Model ocenia kształt prozy, więc zmiana tego, jakie słowa wypełniają ten kształt, daje mniej, niż zakłada większość osób. free perplexity checker pokaże, jak przewidywalnie dany fragment nadal się czyta po przeredagowaniu, co jest bardziej informacyjnym sygnałem niż porównanie słowo po słowie wersji przed i po.
Trzecim powodem jest to, że przeredagowanie może wprowadzać własną regularność. Oprogramowanie, które stosuje tę samą transformację do każdego akapitu, wytworzy nowy wzorzec, równie regularny jak stary. Jeśli każde zdanie ma przez siebie przeprowadzony ten sam rodzaj cięcia składniowego albo jeśli do każdego zdania w to samo miejsce dodawany jest ten sam rodzaj klauzuli osłabiającej, takie zdania będą oceniane przez klasyfikator równie równomiernie, jak byłyby oceniane, gdyby wszystkie od początku miały tę samą długość.
| Sytuacja | Co robi wynik AI | Dlaczego |
|---|---|---|
| Przepisano tylko część dokumentu | Spada mniej niż oczekiwano | Nienaruszone fragmenty wnoszą swoje pierwotne wyniki do średniej |
| Zmieniono słownictwo, zachowano strukturę zdań | Zmienia się bardzo niewiele | Klasyfikator ocenia wzorce na poziomie zdań, które pozostawiła na miejscu zamiana |
| Zdania zostały rzeczywiście przebudowane w całym tekście | Zmienia się bardziej | Jednolity rytm, który model został wytrenowany rozpoznawać, zostaje przerwany |
| Przesłano mniej niż 300 słów prozy | Nie generuje się żaden wynik | Turnitin wymaga 300 słów kwalifikującej się prozy, zanim poda procent |
| Wynik spada poniżej 20 percent | Zamiast liczby pojawia się gwiazdka | Turnitin oznacza wyniki w tym zakresie jako mniej wiarygodne |
Dlaczego ten sam przeredagowany tekst czasem daje niski wynik
Dokument poddany humanizacji może wrócić z niskim wynikiem z powodów, które nie mają nic wspólnego z przeredagowaniem. Turnitin potrzebuje co najmniej 300 słów kwalifikującej się prozy, zanim w ogóle wygeneruje procent AI, a ten próg podniósł z pierwotnych 150 słów, uzasadniając to tym, że dokładność poprawia się przy nieco większej ilości tekstu. Krótki tekst refleksyjny nie daje żadnej liczby, a brak wyniku nie jest tym samym co wynik czysty.
Turnitin oznacza zakres poniżej 20 percent gwiazdką zamiast podawać dokładny procent, ponieważ w tym zakresie występuje większa częstość wyników fałszywie dodatnich. W momencie uruchomienia raportowanie edukacyjne również odnosiło się do tego zachowania, stwierdzając, że wyniki zgłaszane jako mniej niż 20 percent napisane przez AI miały wyższą częstość wyników fałszywie dodatnich i dlatego Turnitin dodał zastrzeżenia. Dokument znajdujący się w tym przedziale został oznaczony jako zakres, którego Turnitin odmawia raportować precyzyjnie, a to jest czymś innym niż uznanie go za wolny od zastrzeżeń.
Istnieje również instytucjonalna bramka ponad tym wszystkim. Turnitin przetwarza zgłoszenie do wykrywania pisania przez AI tylko wtedy, gdy instytucja włączyła tę funkcję, a administratorzy mogą ją wyłączyć dla całego konta. Vanderbilt University zrobił dokładnie to w sierpniu 2023 roku, powołując się na opublikowany wówczas przez Turnitin 1 procentowy wskaźnik fałszywie dodatnich wyników wobec około 75,000 rocznych zgłoszeń, uprzedzenie wobec osób piszących po angielsku jako języku obcym oraz brak przejrzystości co do tego, jak działa model. Student w instytucji, w której funkcja jest wyłączona, nie ma żadnego wyniku AI dla żadnego zgłoszenia, niezależnie od tego, czy tekst został zhumanizowany, czy nie.
A tam, gdzie przepisywanie miało rzeczywiście charakter strukturalny, wynik może spaść, ponieważ zmienił się mierzony wzorzec. Turnitin podaje szacunkową wartość obliczaną na podstawie wzorców pisania, więc tekst, którego wzorce są inne, otrzymuje inny wynik. Mechanizm działa w obie strony, i to jest niepokojące, ponieważ oryginalne ludzkie pisanie czasem uzyskuje wysoki wynik dokładnie z tego samego powodu.
Humanizuj własną pracę
Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.
Co twierdzi każdy dostawca humanizera i co jest udokumentowane
Jedna zasada rządzi tabelą. Środkowa kolumna zawiera własny język marketingowy dostawcy, zaczerpnięty z jego własnej strony wszędzie tam, gdzie taka strona mogła go dostarczyć. Prawa kolumna odnotowuje, co faktycznie stoi za każdym twierdzeniem, a w większości przypadków nie jest to żaden zbiór danych, data ani metoda. Nie istnieje publiczny test porównawczy jeden na jeden dla tych marek.
| Brand | Co twierdzi dostawca | Co jest udokumentowane |
|---|---|---|
| Undetectable.ai | Wymienia przechodzenie przez detektory AI jako cechę produktu, bez podania liczby, i oferuje zwrot kosztu humanizacji, jeśli wynik zostanie oznaczony jako niehumanistyczny | Zwrot jest warunkiem handlowym, nie ma danych, daty ani wyniku dla poszczególnych detektorów, które potwierdzałyby to twierdzenie |
| QuillBot | Na własnych stronach nie formułuje żadnego twierdzenia o wykrywaniu ani omijaniu dla funkcji humanizera. Jego osobny detektor AI jest opisywany wyłącznie jako wykrywający treści generowane przez AI | QuillBot sprzedaje humanizer w ramach ogólnego pakietu do pisania i nie składa dla niego żadnego twierdzenia specyficznego dla Turnitin |
| WriteHuman | Umieszczony na pierwszym miejscu w Humanizer Leaderboard i opisany jako premium AI humanizer do poważnego pisania | Leaderboard nie podaje metodologii ani próby, a WriteHuman nie przypisuje temu rankingowi żadnej liczbowej wartości dokładności |
| Walter Writes AI | Oferuje szeroką humanizację w ponad 80 językach, bez twierdzenia specyficznego dla Turnitin | Brak danych testowych w jedną lub drugą stronę |
| HIX Bypass | Oferuje strony omijania dla poszczególnych detektorów, bez liczby specyficznej dla Turnitin | HIX Bypass i BypassGPT to odrębne produkty na odrębnych domenach, więc należy potwierdzić, którego z nich dotyczy dane twierdzenie |
| StealthGPT | Średnio 98% human na Turnitin i 95% na GPTZero, każdorazowo na podstawie podanego przebiegu 30 próbek z zerową liczbą wykryć, plus gwarancja zwrotu pieniędzy, jeśli subskrybent zostanie wykryty | Samodzielnie raportowane. Obok tych liczb nie opublikowano danych, doboru próby, daty ani metody, a 30 dokumentów to mały przebieg jak na twierdzenie dotyczące modelu oceniającego miliony zgłoszeń |
| Phrasly | Pozycjonuje się jako remover wykrywania AI, nie publikuje danych testowych | Brak publicznego twierdzenia w jedną lub drugą stronę. Liczby krążące w recenzjach pochodzą z drugiej ręki i z zasady są tu wyłączone |
| Grammarly | W ogóle nie reklamuje swojego przepisywania jako omijania wykrywania. Jego strona detektora AI twierdzi, że osiąga 99% dokładności wykrywania i zajmuje pierwsze miejsce w niezależnym benchmarku RAID | Ta sama strona Grammarly stwierdza, że żaden detektor AI nie jest w 100% dokładny. Funkcja Authorship oznacza tekst jako wpisany przez człowieka, utworzony z użyciem AI albo edytowany przez Grammarly |
| TextPulse | Wskaźnik przejścia 92.33% na Turnitin AI, 89.12% na Originality.ai i 87.91% na GPTZero, zmierzony na akademickim korpusie 2,000 dokumentów | Zmierzony i opublikowany przez TextPulse, więc tak jak wszystkie powyższe liczby jest to informacja samodzielnie raportowana. Wielkość korpusu i detektory są nazwane, nie obiecuje się jednak żadnego wyniku detektora dla pojedynczego dokumentu |
Trzy rzeczy wynikają z tej tabeli. Większość z tych narzędzi w ogóle nie publikuje żadnego twierdzenia o wykrywaniu, które można by sprawdzić. Kilka z nich dołącza do liczby wielkość próby, co jest więcej niż udaje się reszcie tej kategorii. I żadne z nich nie publikuje zbioru danych, który ktokolwiek spoza firmy mógłby samodzielnie uruchomić. Trzeba jednak oddać każdej marce to, na co zasługuje. Undetectable.ai umieszcza za swoim twierdzeniem gwarancję zwrotu pieniędzy, co jest konkretnym zobowiązaniem, a nie przymiotnikiem. WriteHuman publikuje dokładne limity zapytań i słów dla każdego planu, więc kupujący wie, co otrzymuje. Grammarly kwalifikuje własną wartość dokładności na tej samej stronie, na której ją podaje, co jest więcej niż robi większość dostawców detektorów. A to, że QuillBot w ogóle odmawia złożenia twierdzenia o obejściu, jest najbardziej obronnym stanowiskiem na liście.
Dlaczego nikt spoza dostawcy nie może sprawdzić tych liczb
Dostawca humanizera, który twierdzi, że osiąga wskaźnik przejścia przez Turnitin, opisuje uruchomienia wykonane na koncie, które kontroluje, na dokumentach, które sam wybrał, w dniu, którego zwykle nie podaje, wobec klasyfikatora, który Turnitin zmienia wraz z wprowadzaniem nowych modeli językowych. Dotyczy to zarówno trzydziestopróbkowej wartości StealthGPT, jak i wartości dla 2,000 dokumentów publikowanej przez tę stronę. Wielkość korpusu wpływa na to, ile szumu zawiera liczba. Nie zamienia jednak samodzielnego raportu w audyt.
Drugą częścią problemu jest to, że własna lista modeli, które Turnitin twierdzi, że wykrywa, jest edytowana wraz z pojawianiem się nowych wydań. Ten wskaźnik przejścia mierzony względem klasyfikatora z poprzedniego kwartału opisuje klasyfikator z poprzedniego kwartału i nic więcej. Dlaczego oznacza to, że nikt nie może wskazać najlepszego AI humanizera do obejścia Turnitin, zostało omówione osobno. Każda liczba na każdej stronie głównej humanizera, w tym na tej stronie, jest migawką niosącą datę, której dostawca mógł nigdy nie opublikować.
Jak czytać twierdzenie o obejściu, zanim za nie zapłacisz
Cztery pytania oddzielają twierdzenie warte rozważenia od twierdzenia wartego zignorowania i odnoszą się do każdego wiersza w powyższej tabeli, w tym do ostatniego.
- Ile dokumentów zostało przetestowanych i kto je wybrał? Procent bez podanej liczebności próby jest sloganem ubranym w liczbę.
- W jakiej dacie i względem której wersji detektora? Modele wykrywania są aktualizowane wraz z publikacją nowych modeli językowych, a wskaźnik skuteczności bez daty szybko się dezaktualizuje.
- Czy gwarancja oznacza zwrot pieniędzy czy wynik? Obietnica zwrotu pieniędzy przenosi niewielkie ryzyko finansowe i nie robi absolutnie nic w odniesieniu do komisji ds. integralności akademickiej.
- Co według dostawcy dzieje się z cytatem, terminem technicznym albo cytatem blokowym? Większość stron dotyczących humanizacji nie mówi nic, a to samo w sobie jest odpowiedzią.
To ostatnie pytanie decyduje o czymś więcej niż arytmetyka detektora dla każdej osoby składającej pracę akademicką. Przeredagowanie, które uzyskuje dobry wynik i po cichu uogólnia zdanie metodologiczne, kosztowało Cię to, za co byliście oceniani. Akademicki humanizer TextPulse dokumentuje zachowanie cytowań w APA, MLA, IEEE, Chicago, Harvard i Vancouver, freeze terms do blokowania dokładnego słownictwa przed uruchomieniem pass, oraz szkolenie na recenzowanych tekstach akademickich z wynikiem utrzymanym na poziomie Flesch-Kincaid od 13 do 18. Są to twierdzenia o tym, co dzieje się z tekstem, a to jest inny rodzaj twierdzenia niż procent dotyczący detektora, i czytelnik może je zweryfikować w wyniku w ciągu minuty.
Co wynik oznacza dla studenta w obu przypadkach
Turnitin jasno stwierdza, że wskaźnik pisania AI nie jest stwierdzeniem naruszenia. Strona produktu Turnitin wyraźnie podaje, że Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." Wyjaśnia również, że Turnitin dostarcza informacji, aby umożliwić nauczycielom podjęcie świadomej decyzji na podstawie polityk ich instytucji. Zostaje to powtórzone przez ostrzeżenie, że model "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."
Studenci domyślnie nie widzą wyniku. Turnitin stwierdza wyraźnie, że wskaźnik wykrywania pisania przez AI i raport nie są widoczne dla studentów, a jedyną drogą do ich zobaczenia jest pobranie raportu przez prowadzącego jako pliku PDF i przekazanie go dalej. Student sprawdzający własny szkic korzysta z innego narzędzia, wytrenowanego na innych danych, a te dwie liczby nie mają obowiązku się zgadzać.
To pozostawia bez rozstrzygnięcia tę część, której nie rozstrzyga żaden wynik. To, czy użycie AI było w ogóle dozwolone, jest kwestią kursu i instytucji, a polityka użycia AI odpowiada na nią w sposób, w jaki procent nigdy nie odpowiada. Wysoki wynik przy dozwolonym, ujawnionym użyciu jest rozmową opartą na dowodach. Niski wynik przy nieujawnionym użyciu, którego polityka zabrania, nadal jest nieujawnionym użyciem.
Dla autora redagującego własny szkic praktyczny sens tego wszystkiego jest taki, że wynik podąża za tekstem. Model Turnitin mierzy wzorce na poziomie zdań w całym dokumencie, więc częściowe przeróbki powodują częściowy ruch, a przejścia słownikowe powodują bardzo niewielki ruch albo nie powodują go wcale. Pełny przewodnik po jak humanizować tekst AI omawia zmiany strukturalne, które zmieniają wzorzec, w kolejności, która porusza go najbardziej.
AI humanizer TextPulse stosuje te zmiany strukturalne w całym dokumencie naraz i podaje szacowany Human Score obliczony na podstawie samego tekstu, nigdy nie prognozę tego, co powie jakikolwiek wskazany detektor. Żadne narzędzie nie może obiecać wyniku w Turnitin, ponieważ żadne narzędzie nie może zajrzeć do modelu Turnitin. Każdy produkt, który twierdzi inaczej, opisuje wynik, którego nie ma sposobu zaobserwować.
Różnica między humanizerem a parafrazatorem ma tu znaczenie, podobnie jak powód, dla którego sparafrazowany tekst nadal jest oznaczany.
Liczba jest najmniej interesującą częścią tego. O wyniku decyduje dwadzieścia minut po tym, jak oceniający spojrzy na pracę: czy tekst może pokazać swój tok rozumowania, historię wersji roboczych, zestaw notatek, źródła, o których autor może mówić bez ich otwierania. Takie dowody są dostępne dla każdego, kto wykonał pracę, i przetrwają ocenę, której przeredagowanie nie zdołało zmienić.
Najczęściej zadawane pytania
Własne wytyczne Turnitin mówią, że jego wskaźnik AI obejmuje wykrywanie treści, które mogły zostać zhumanizowane lub przepuszczone przez bypasser. To, co produkt faktycznie zwraca, to procent kwalifikującego się tekstu, a nie werdykt o autorstwie. Zatem praktyczna odpowiedź na pytanie, czy Turnitin wykrywa zhumanizowany tekst, brzmi, że wynik odzwierciedla, ile wzorca pisania maszynowego przetrwało przepisanie.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.