AI Detection

Turnitin Similarity Score vs AI Score: Dwa różne raporty

Wynik podobieństwa i wynik AI odpowiadają na różne pytania, więc praca może uzyskać niski wynik w jednym i wysoki w drugim, bez tego, by którykolwiek z tych wyników był błędny. Co każdy z nich mierzy, co go uruchamia oraz co wysoki wynik pokazuje, a czego nie pokazuje.

5 min
Turnitin similarity vs AI score comparison chart showing two independent report numbers

Raport zawiera dwie liczby: wynik podobieństwa na poziomie 3 procent oraz wynik AI na poziomie 88 procent. Naturalne odczytanie jest takie, że muszą mierzyć to samo, więc niska liczba powinna oznaczać, że wysoka liczba też jest prawdopodobnie błędna. Tak to nie działa. Porównanie Turnitin similarity vs AI score zestawia dwa odrębne systemy, które sprawdzają dwie odrębne rzeczy, a przesłany tekst może uzyskać niski wynik w jednym i wysoki w drugim, bez tego, by którakolwiek z tych liczb była pomyłką.

Jest starszy niż ten dotyczący AI, zbudowany po to, by wykrywać tekst pasujący do czegoś, co już istnieje. Jest nowszy, dodany do tego samego Similarity Report jako własny, niezależny pomiar, zbudowany po to, by oszacować, czy proza brzmi jak wygenerowana przez maszynę, niezależnie od tego, czy pasuje do czegokolwiek. Zgodnie z własną dokumentacją Turnitin, oba są całkowicie niezależne i nie wpływają na siebie nawzajem. Wszystko inne w tym tekście.

Turnitin Similarity vs AI Score: Co raportuje każda liczba

Turnitin traktuje te dwa wskaźniki jako różne pomiary połączone w jeden produkt, a nie jako dwa widoki jednego wyniku. Similarity Report porównuje przesłany tekst z bazą treści internetowych, publikacji akademickich oraz wcześniej przesłanych prac studenckich i zwraca procent tekstu w przesłanym materiale, który odpowiada czemuś już obecnemu w tej bazie. Wykrywanie pisania AI działa na zupełnie innym modelu, dodanym do tego samego raportu jako własny, niezależny wynik, wytrenowany po to, by oceniać, jak bardzo proza danego fragmentu przypomina tekst generowany maszynowo, bez jakiegokolwiek odniesienia do zewnętrznej bazy danych. Bardziej szczegółowy mechanizm tego, jak klasyfikator AI Turnitin dochodzi do tej liczby został omówiony osobno, tutaj istotne jest to, że odpowiada on na inne pytanie niż silnik podobieństwa znajdujący się w tym samym raporcie.

Co właściwie mierzy wynik podobieństwa

Podobieństwo jest ćwiczeniem dopasowywania, a nie oceną. Własne wytyczne Turnitin jasno stwierdzają, że narzędzie nie sprawdza plagiatu. Sprawdza nakładanie się treści i pozostawia interpretację wykładowcy czytającemu raport. Cytat poprawnie wyróżniony, fraza z sekcji metod wspólna dla całej subdyscypliny, pozycja na liście literatury sformatowana tak, jak każdy artykuł w czasopiśmie formatuje swoją listę literatury, wszystko to może zostać zarejestrowane jako dopasowanie, ponieważ system liczy nakładające się ciągi tekstu, zamiast oceniać, czy nakładanie się jest uzasadnione.

To także dlatego wynik podobieństwa równy zero mówi mniej, niż się wydaje. Oznacza, że w przesłanym tekście nie ma długiego, nieprzerwanego fragmentu tekstu znalezionego gdzie indziej w zindeksowanych źródłach Turnitin. Nie mówi nic o tym, w jaki sposób powstały zdania, które się tam znajdują, ponieważ stworzenie zdania, które nie pasuje do niczego w bazie danych, nie jest tym samym umiejętnością co stworzenie zdania, którego model językowy nie przewidziałby.

Humanizuj własną pracę

Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.

Zacznij za darmo

Co naprawdę mierzy wynik AI

Wynik AI nie ma bazy danych, z którą można go porównać. Klasyfikator czyta przesłaną prozę i szacuje, na podstawie wzorców, których nauczył się na przykładach pisania ludzkiego i generowanego przez AI, jak prawdopodobne jest, że ta proza pochodzi od modelu, a nie od osoby. Nic w tym szacunku nie zależy od tego, czy dokładne zdanie kiedykolwiek pojawiło się wcześniej gdziekolwiek. Zdanie może być całkowicie unikalne, nigdy wcześniej nie wpisane przez nikogo aż do tego zgłoszenia, a mimo to zostać odczytane jako statystycznie typowe dla wyników AI, jeśli dobór słów i rytm podążają za wzorcem, który model językowy zwykle wytwarza.

Jest to to samo pole statystyczne, które w pełni opisuje szersze omówienie tego, jak naprawdę działają detektory AI: przewidywalność na poziomie słów i rytm na poziomie zdań, połączone w jeden wynik dokumentu. Wersja tego klasyfikatora stosowana przez Turnitin jest zastrzeżona, ale podstawowe założenie, że tekst generowany ma tendencję do bycia bardziej statystycznie typowym niż pisanie ludzkie, jest tym samym założeniem, które działa pod spodem każdego narzędzia z tej kategorii.

Wynik podobieństwaWynik AI
Co mierzyJak duża część tekstu zgłoszenia odpowiada innym zindeksowanym dokumentomJak bardzo proza przypomina statystycznie typowe teksty generowane przez AI
Co wywołuje wysoki wynikDługie cytaty, powszechne sformułowania właściwe dla danej dziedziny, ponownie użyty materiał albo zgodność z wcześniejszym zgłoszeniemJednolity rytm zdań i konsekwentnie przewidywalny dobór słów w całym dokumencie
Czego wysoki wynik nie dowodziŻe dopasowany tekst został użyty niewłaściwie. Prawidłowo cytowany materiał nadal może zostać oznaczony jako zgodność.Że jakiekolwiek pojedyncze zdanie zostało wygenerowane przez AI. Klasyfikator odczytuje ogólny wzorzec dokumentu, a nie jeden wiersz w izolacji.

Czy praca może mieć 0 Percent podobieństwa i 90 Percent wyniku AI?

Tak, a takie połączenie nie jest usterką. Te dwa wyniki odpowiadają na różne pytania, więc wszystkie cztery kombinacje wysokich i niskich wartości są możliwe, a każda z nich oznacza coś innego o tym, jak tekst został wytworzony.

  • Niskie podobieństwo, niski wynik AI: zwykłe oryginalne pisanie, które jednocześnie czyta się z typową ludzką zmiennością. To częsty przypadek w większości autentycznych prac studenckich.
  • Niskie podobieństwo, wysoki wynik AI: oryginalne zdania, niekopiowane z żadnego źródła, które brzmią statystycznie przewidywalnie, tak jak zwykle brzmi tekst generowany. To cecha nieedytowanego pisania AI, którego nikt nie parafrazował z istniejącego źródła.
  • Wysokie podobieństwo, niski wynik AI: tekst bardzo blisko odpowiadający istniejącemu źródłu napisanemu przez człowieka, bez statystycznej płaskości, którą klasyfikator wiąże z generowaniem. Skopiowany tekst, wykryty przez starsze narzędzie, a nie przez nowsze.
  • Wysokie podobieństwo, wysoki wynik AI: tekst odpowiadający istniejącemu źródłu, które samo zostało wygenerowane przez AI, na przykład wcześniej zgłoszona praca napisana przez AI albo strona tekstu wytworzonego przez AI, już zindeksowana z otwartej sieci.

Żadna z tych kombinacji nie wymaga niczego niezwykłego po stronie oprogramowania. Wynikają one z faktu, że jeden system sprawdza zgodność, a drugi sprawdza wzorzec, a fragment tekstu może mieć jedną z tych właściwości, obie albo żadną.

Co wysoki wynik AI dowodzi, a czego nie dowodzi

Wysoki wynik AI jest estymacją statystyczną, a nie przyznaniem się wydobytym z tekstu. Oznacza to, że proza przed klasyfikatorem przypomina, pod względem doboru słów i rytmu, taki rodzaj pisania, z którym model był trenowany, aby kojarzyć generowanie przez AI. Nie identyfikuje on konkretnego zdania jako z pewnością napisanego przez maszynę i nie wie nic o tym, jak dokument został faktycznie wytworzony, tylko o tym, jak brzmi po zakończeniu. TextPulse zajmuje takie samo stanowisko wobec własnych liczb: to, co raportuje, jest szacowanym Human Score obliczonym na podstawie tekstu przed nim, a nie werdyktem dotyczącym tego, które narzędzie, jeśli w ogóle jakieś, miało kontakt z dokumentem.

Praktyczna reakcja na każdą z tych liczb, niski wynik podobieństwa albo wysoki wynik AI, jest taka sama: należy traktować ją jako powód do dokładniejszego sprawdzenia, a nie jako ustalenie, które trzeba przyjąć lub odrzucić na pierwszy rzut oka. Szkice, notatki i historia wersji mówią o tym, jak dokument został faktycznie napisany, w sposób, w jaki procent nigdy nie może tego zrobić, w żadnym z tych raportów. Każdy, kto chce zobaczyć, na co klasyfikator faktycznie reaguje we własnym szkicu, może samodzielnie dostrzec ten sam wzorzec na poziomie słów za pomocą free perplexity checker, jeszcze zanim zostanie wygenerowany jakikolwiek raport.

free tools collection TextPulse obejmuje inne warstwy statystyczne, które warto sprawdzić, zanim szkic trafi do prowadzącego, nie tylko te dwie porównane tutaj.

Gdy te dwie liczby zostaną rozdzielone, następnym pytaniem jest co uznaje się za dobry wynik Turnitin. W przypadku drugiego detektora, z którym studenci spotykają się najczęściej, jak działa GPTZero zostało omówione na osobnej stronie.

Te dwie liczby będą nadal znajdować się obok siebie w tym samym raporcie i będą nadal odczytywane jako jedna liczba przez osoby w pośpiechu. Wiedza o tym, na które pytanie każda z nich rzeczywiście odpowiada, sprawia, że myląca para procentów staje się dwiema odrębnymi, użytecznymi informacjami.

Najczęściej zadawane pytania

Turnitin similarity vs AI score sprowadza się do tego, co każdy z nich sprawdza. Wynik podobieństwa pokazuje, jaka część przesłanego tekstu pokrywa się z tekstem już znajdującym się w bazie Turnitin obejmującej strony internetowe, publikacje i wcześniejsze prace studentów. Wynik AI jest odrębnym, niezależnym pomiarem szacującym, jak bardzo proza przypomina tekst wygenerowany przez maszynę, bez jakiegokolwiek odniesienia do bazy danych. W dokumentacji Turnitin podano, że te dwie wartości nie wpływają na siebie nawzajem.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Bądź na bieżąco z humanizacją AI

Otrzymuj wskazówki dotyczące pisania akademickiego, wykrywania AI i humanizacji prosto na swoją skrzynkę.

Bez spamu. Możesz zrezygnować w dowolnym momencie.