Jak Turnitin wykrywa AI, krok po kroku
Detektor pisania AI Turnitin nie odczytuje dokumentu jako całości. Dzieli zgłoszenie na fragmenty, ocenia każdy z nich, uśrednia wyniki, a dopiero potem podaje procent w raporcie. Ten tekst omawia ten proces, to, co oznacza w odniesieniu do ChatGPT, Claude i Gemini, co wykazały niezależne testy, że pomija, oraz kto faktycznie ma dostęp do liczby.
Raport Turnitin może zwrócić pojedynczą liczbę, na przykład czterdzieści dwa procent, i powiedzieć prawie nic więcej o tym, jak do niej doszedł, chyba że ktoś zacznie szukać mechanizmu, który za tym stoi. Ta liczba nie jest odczytywana z dokumentu jako całości i nie jest zgadywana. Jest końcem konkretnego, udokumentowanego potoku, który działa tak samo przy każdym zgłoszeniu.
Jak więc Turnitin wykrywa AI? Dzieląc zgłoszenie na części, oceniając je indywidualnie na podstawie tego, czy prawdopodobnie zostały wygenerowane przez AI, czy zostały wygenerowane przez AI, a następnie sparafrazowane, i uśredniając te oceny, aby określić ogólny wynik procentowy pokazany w raporcie. Każdy etap tego potoku jest opisany we własnej dokumentacji Turnitin, a nie zrekonstruowany z zewnątrz.
Dotyczy to konkretnie funkcji wykrywania pisania przez AI w Turnitin, odrębnego systemu od starszej kontroli podobieństwa lub plagiatu, która porównuje zgłoszenie z innymi dokumentami. Mechanika opisana poniżej mieści się w szerszym pytaniu o to, jak detektory AI rzeczywiście działają, a Turnitin jest użytecznym przykładem roboczym właśnie dlatego, że publikuje więcej własnej metody niż większość dostawców. Poniżej najpierw przedstawiono potok, potem to, co jest w praktyce oznaczane, co niezależne testy wykazały, że jest pomijane, oraz kto w instytucji faktycznie widzi wynik.

Jak Turnitin wykrywa AI? Potok w skrócie
Detektor pisania AI Turnitin działa w czterech krokach, w ustalonej kolejności. Po pierwsze, sprawdza, czy dokument zawiera wystarczającą ilość kwalifikującego się tekstu prozatorskiego, aby w ogóle można było nadać mu wynik. Po drugie, dzieli ten tekst na segmenty liczące po kilkaset słów każdy. Po trzecie, model ocenia każdy segment osobno. Po czwarte, wyniki segmentów są uśredniane do jednego procentu na poziomie dokumentu, który rzeczywiście widzi czytelnik.
Raport pisania AI nie jest raportem podobieństwa
Raport pisania AI Turnitin jest odrębnym produktem od raportu podobieństwa, który sprawdza plagiat. Działają one na różnych modelach i są wyświetlane na różnych kartach w tym samym interfejsie. Wynik podobieństwa porównuje przesłany tekst z bazą wcześniej opublikowanych źródeł i innych prac studenckich, a następnie zwraca procent zgodności. Wynik AI robi coś zupełnie innego: klasyfikator odczytuje prozę, przypisuje każdemu ocenianemu segmentowi prawdopodobieństwo, że został wygenerowany przez AI, i agreguje te wyniki do jednego procentu dla dokumentu. Ponieważ mierzą różne rzeczy, przesłany tekst może mieć wynik podobieństwa na poziomie 2 procent i wynik AI na poziomie 60 procent, albo odwrotnie.
Procent AI jest też węższy, niż mogłoby się wydawać. Opisuje on proporcję kwalifikującej się prozy, którą model przewiduje jako napisaną przez AI, a nie cały dokument, ponieważ bloki kodu, wypunktowania, nagłówki i tekst w krótkiej formie są usuwane przed obliczeniem wyniku. W chwili pisania tego tekstu detektor działa wyłącznie na tekście w języku angielskim, hiszpańskim i japońskim.
Krok pierwszy: dzielenie dokumentu na fragmenty
Zanim cokolwiek zostanie ocenione, model Turnitin dzieli przesłany tekst na fragmenty liczące po kilkaset słów każdy, mniej więcej po pięć do dziesięć zdań na fragment. Segmentacja następuje najpierw, ponieważ model został zbudowany do oceniania fragmentu o takiej wielkości, a nie pojedynczego zdania i nie całej rozprawy za jednym przejściem.
Tylko tekst prozatorski jest liczony jako fragment. Model został zaprojektowany do czytania dłuższych form pisanych. Dokument, który zawiera zarówno tekst prozatorski, jak i tabele lub kod, będzie oceniany jako zawierający pewien procent tekstu prozatorskiego, ale może nie opisywać całego tekstu prozatorskiego w dokumencie. Wynika to z tego, że detektor ocenia pulę danych, która nie obejmuje bloków kodu, wypunktowań ani krótkich form tekstu. Dlatego dokument może zwrócić procent, który opisuje tylko część tego, co zostało przesłane.
Ocena na poziomie fragmentu ma mniej oczywisty skutek, który warto nazwać. Pojedyncze zdanie wygenerowane przez AI, umieszczone w innym przypadku w ludzko napisanym fragmencie liczącym kilkaset słów, jest uśredniane razem ze wszystkim innym w tym fragmencie, więc jego wpływ na wynik tego fragmentu jest rozcieńczany przez to, jak dużo otaczającego tekstu napisanego przez człowieka współdzieli ten sam fragment. Krótkie wstawienie wygenerowane przez AI nadal dociera do modelu. Po prostu ma mniejszą wagę niż fragment wygenerowany przez AI od pierwszego do ostatniego słowa.
Krok drugi: ocenianie każdego segmentu
Każdy fragment jest oceniany osobno, niezależnie od każdego innego fragmentu w dokumencie. Model przewiduje, czy ten konkretny odcinek tekstu został napisany przez człowieka, wygenerowany przez AI, czy wygenerowany przez AI, a następnie sparafrazowany, czyli rozróżnienie trójkategorialne, a nie proste tak albo nie.
To jest odrębna kategoria, a nie tylko rozszerzenie wygenerowane przez AI, sugeruje, że istnieje rzeczywisty problem polegający na tym, że parafrazowanie osłabia wykrywanie. Potwierdza to badanie z 2023 roku, które wykazało, że przepuszczenie tekstu wygenerowanego przez AI przez specjalny model parafrazujący obniżyło skuteczność badawczego detektora o nazwie DetectGPT z 70.3% dokładności do 4.6%, przy stałym 1% wskaźniku fałszywie dodatnich wyników. Nie wydaje się, aby Turnitin opublikował cokolwiek na temat tego, jak odporny jest jego własny klasyfikator trójkategorialny na tę samą technikę. Ta kategoria istnieje z udokumentowanego powodu.
Ocenianie na poziomie fragmentów, a nie całego dokumentu, jest świadomym wyborem projektowym. Praca dyplomowa licząca dziewięćdziesiąt stron, zawierająca dwa akapity napisane przez AI, oraz pięciostronicowy esej, który w całości został napisany przez AI, to różne problemy, a uśrednianie wyników dla fragmentów pozwala, by jedna liczba na poziomie dokumentu odzwierciedlała tę różnicę zamiast ją spłaszczać.
Turnitin nie opublikował wewnętrznej architektury tego modelu działającego na poziomie fragmentów z taką samą szczegółowością jak swoich etapów potoku przetwarzania. Jest to klasyfikator nadzorowany, trenowany na oznaczonych przykładach, a nie prosty próg oparty na rodzaju surowego wyniku dla następnego tokenu, omówionego w przewodniku TextPulse dotyczącym tego, co perplexity w wykrywaniu AI rzeczywiście mierzy, choć ta sama leżąca u podstaw idea, niezwykle przewidywalny tekst, niemal na pewno stanowi część tego, czego taki klasyfikator uczy się rozpoznawać.
Krok trzeci: uśrednianie do procentu na poziomie dokumentu
Wyniki dla fragmentów są uśredniane do jednej wartości procentowej, którą wyświetla raport. Ten procent oznacza odsetek kwalifikującego się tekstu prozatorskiego, wyłącznie pisania dłuższej formy, który model przewiduje jako wygenerowany przez AI albo wygenerowany przez AI, a następnie sparafrazowany. Jest to odsetek ocenionych segmentów, a nie twierdzenie, że dokładnie taki udział słów w dokumencie został dosłownie wpisany przez maszynę.
Procent podany w raporcie jest średnią. Dlatego dwa dokumenty, które oba dają czterdzieści procent, mogą wyglądać inaczej przy bliższym spojrzeniu. W jednym czterdzieści procent fragmentów może zostać ocenione jako całkowicie wygenerowane przez AI. W innym każdy fragment może zostać oceniony jako częściowo prawdopodobny, co po uśrednieniu daje tę samą wartość główną. Nie pokazuje to, jaki wzorzec ją wygenerował.

Czy Turnitin może wykryć ChatGPT, Claude lub Gemini?
Zwykle tak, gdy dokument zawiera znaczną ilość tekstu napisanego przez AI, a klasyfikator nie ma znaczenia, który dostawca go wygenerował. Turnitin podaje, że jego model szuka wzorca pisania, a nie nazwy marki, a zakres jego działania był wielokrotnie rozszerzany od pierwotnego uruchomienia GPT-3.5 i GPT-4 w 2023. Aktualne wytyczne wymieniają serię GPT-5, Gemini i Claude wśród systemów, wobec których jest trenowany, a nowe wersje modeli są dodawane na bieżąco. Student, który użył zamiast tego Gemini, Claude lub DeepSeek, nie omija detektora tylko dlatego, że wybrał inną firmę.
Odsetek prac, których to dotyczy, wzrósł. Około 15 procent esejów skanowanych przez Turnitin między październikiem 2025 a lutym 2026 wykazywało 80 procent lub więcej tekstu wygenerowanego przez AI, wobec około 3 procent w momencie uruchomienia narzędzia w kwietniu 2023.
Tekst AI po parafrazie otrzymuje własną kategorię, a nie automatyczne przepuszczenie, co odpowiada opisanej wyżej klasyfikacji trójdzielnej. Dokumentacja Turnitin rozróżnia tekst uznany wyłącznie za wygenerowany przez AI od tekstu uznanego za wygenerowany przez AI, a następnie sparafrazowany przez AI, a w sierpniu 2025 dodała wykrywanie ukierunkowane konkretnie na narzędzia omijające detektory AI, zbudowane po to, by przepisywać wynik maszynowy tak, aby przechodził przez detektor. Nie oznacza to, że parafrazowanie jest bezcelowe albo że każdy przeredagowany fragment zostaje wykryty. Oznacza to, że założenie, iż parafraza jest domyślnie niewidoczna dla Turnitin, od pewnego czasu jest nieaktualne. To, co narzędzie robi konkretnie z tekstem po parafrazie oraz z wynikiem DeepSeek, zostało omówione osobno.
Humanizuj własną pracę
Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.
Minimalny wymóg liczby słów i próg oznaczony gwiazdką
Przesłanie musi zawierać co najmniej 300 słów kwalifikującego się tekstu prozatorskiego, zanim detektor AI Turnitin w ogóle wygeneruje wynik, co podniesiono z wcześniejszego minimum 150 słów. Poniżej tej długości po prostu nie ma wystarczającej ilości tekstu, aby mógł zadziałać proces dzielenia na segmenty i uśredniania.
Próg 300 słów odpowiada wielkości pojedynczego fragmentu oceny opisanego wcześniej, kilku setkom słów, pięciu do dziesięciu zdaniom. Dokument znajdujący się dokładnie przy minimum przekazuje więc potokowi do uśrednienia tylko około jednego fragmentu kwalifikującego się tekstu, a nie kilku, i to częściowo dlatego raport utrzymujący się blisko tego progu częściej trafia do mniej wiarygodnego zakresu, który następny próg ma oznaczać.
Turnitin również nie wyświetla wartości procentowej poniżej progu 20%. Od lipca 2024 raport pokazuje gwiazdkę obok znaku procentu zamiast liczby. Ten pojedynczy element zachowania raportu powoduje więcej niejasności niż jakakolwiek inna część potoku, dlatego poniżej poświęcono mu osobną sekcję.
| Warunek | Co pokazuje raport | Dlaczego |
|---|---|---|
| Mniej niż 300 słów kwalifikującej się prozy | Brak jakiegokolwiek wyniku AI | Zbyt mało tekstu, aby potok dzielenia na segmenty i uśredniania działał wiarygodnie |
| Wynik spadłby poniżej 20% | Gwiazdka obok znaku procentu, a nie liczba | Własna dokumentacja Turnitin podaje w tym zakresie mierzalnie wyższy wskaźnik wyników fałszywie dodatnich |
| Wynik 20% lub wyższy | Określony procent | Turnitin uznaje go za wystarczająco wiarygodny, aby wyświetlić go jako liczbę |
Co oznacza wynik z gwiazdką w Turnitin?
Gwiazdka w raporcie pisania AI w Turnitin oznacza, że model wykrył pewną ilość tekstu AI, ale mniej niż 20 procent dokumentu, a Turnitin odmawia publikowania liczby w tym zakresie. Tam, gdzie zwykle znajdowałaby się wartość procentowa, raport pokazuje zamiast niej gwiazdkę obok znaku procentu. Własna dokumentacja produktu Turnitin stwierdza to wprost: "When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed."
Gwiazdkа nie jest więc błędem, nie oznacza braku wyniku ani nie wskazuje, że podczas przesyłania pliku coś poszło nie tak. Jest to świadoma decyzja dostawcy, aby wstrzymać się z podaniem wartości, której nie uważa za wystarczająco wiarygodną, by ją wydrukować.
Dlaczego Turnitin ukrywa liczbę poniżej 20 percent
Ponieważ właśnie w tym przedziale narzędzie najczęściej się myli, a własna obietnica dokładności Turnitin obejmuje wyłączenie tego zakresu. Firma zobowiązuje się utrzymywać swój wskaźnik fałszywie dodatnich wyników "under 1% for documents with over 20% of AI writing". Należy uważnie odczytać zakres: zobowiązanie ma wbudowaną dolną granicę, a tą granicą jest właśnie 20 percent. Poniżej tej wartości firma nie deklaruje tej samej wiarygodności, więc zamiast podawać małą liczbę, którą czytelnik nieuchronnie uznałby za precyzyjną, nie podaje nic. Gwiazdka istnieje po to, by unikać fałszywie dodatnich wyników, to znaczy po to, by nie przekazywać prowadzącemu wartości, która zniekształcałaby dokument napisany przez człowieka.
To rozumowanie odpowiada mechanice opisanej wcześniej. Wynik na poziomie całego dokumentu jest średnią z fragmentów liczących po kilkaset słów. Gdy tylko niewielka część tych fragmentów otrzymuje ocenę AI, uzyskana średnia opiera się na bardzo słabym sygnale, a pipeline nie może wiarygodnie odróżnić rzeczywistego 8 percent od wyniku pozornego. Ukrycie liczby jest uczciwą odpowiedzią na tę sytuację i jest tym samym odruchem, który stoi za minimalnym progiem 300 words.
Co gwiazdka oznacza w praktyce na uniwersytecie
W praktyce większość instytucji traktuje gwiazdkę jako coś, na co nie trzeba reagować, i odczytuje ją jako niski wynik zgodny z pracą napisaną przez człowieka. Rozumowanie jest proste. Jeśli dostawca, który zbudował detektor, nie chce ręczyć za wartość z tego zakresu, prowadzący nie ma niczego istotnego, co mógłby przedstawić studentowi, a tym bardziej niczego, co można by skierować do komisji ds. naruszeń. W większości procedur dotyczących integralności akademickiej raport z gwiazdką jest funkcjonalnie równoważny raportowi bez zastrzeżeń.
Jest to opis tego, jak wynik jest używany, a warto to wiedzieć, jeśli się na niego patrzy. Nie jest to jednak to samo co stwierdzenie, czym dokument rzeczywiście jest, a to rozróżnienie ma znaczenie w obu kierunkach.
Co nie oznacza gwiazdka
- Nie jest to certyfikat autorstwa ludzkiego. Turnitin odmawia pewnego ocenienia dokumentu, co jest stwierdzeniem dotyczącym detektora, a nie autora.
- Nie jest to to samo co zero. Dokument bez żadnego pisania przez AI oraz dokument z jednym akapitem wspomaganym przez AI mogą wygenerować identyczną gwiazdkę, i właśnie dlatego liczba jest wstrzymywana.
- Nie jest to porównywalne między zgłoszeniami. Dwie gwiazdki mówią jedynie, że oba dokumenty znalazły się poniżej tego samego progu, i nic nie mówią o tym, jak wypadają względem siebie.
- Nie jest to wynik podobieństwa. Dopasowanie plagiatu jest osobnym raportem na osobnej karcie i pokazuje własny procent, niezależnie od tego, co robi wskaźnik AI.
Praktyczny wniosek, który warto zapamiętać, jest taki, że lekka edycja wspomagana przez AI, jeden akapit przepisany z pomocą i reszta napisana bez wsparcia, często da gwiazdkę zamiast małego procentu. Ani obecność, ani brak liczby nie rozstrzyga samodzielnie tej kwestii, i do tego samego wniosku dochodzą poniższe dane o dokładności, tylko z drugiej strony.
Co Turnitin twierdzi o dokładności i czyje są to liczby
Turnitin publikuje własne dane o dokładności i warto je czytać dokładnie tak, jak są przedstawione, jako własne liczby walidacyjne dostawcy, a nie niezależny audyt. Opublikowane materiały podają wskaźnik wyników fałszywie dodatnich poniżej 1% dla dokumentów, które model ocenia na ponad 20% pisania przez AI, czyli przy progu zgodnym z opisanym wyżej odcięciem gwiazdki. Ten sam program został później rozszerzony na próbki pisania przez English Language Learner w odpowiedzi na badania dotyczące stronniczości detektorów.
Turnitin twierdzi, że zweryfikował tę wartość względem dużego zbioru bazowego prac napisanych przez ludzi, złożonych przed pojawieniem się ChatGPT. Materiały Turnitin są niespójne co do dokładnej wielkości tego zbioru bazowego, strona FAQ podaje 700,000 prac, natomiast wpis na blogu autorstwa Chief Product Officer Turnitin podaje 800,000, przy czym do obu odnosi się to samo twierdzenie o wyniku poniżej 1%. Materiały Turnitin opisują też kompromis, według własnego ujęcia firmy, bardziej agresywne wykrywanie treści wygenerowanych przez AI oznacza pomijanie około 15% z nich.
Firma publicznie zrewidowała także własne twierdzenia. W 2023 roku, krótko po uruchomieniu, chief product officer Turnitin przyznał, że testy laboratoryjne nie przewidziały, ile fałszywych trafień pojawi się w rzeczywistym użyciu, zwłaszcza w przypadku krótkich zgłoszeń, i podał wskaźnik fałszywych trafień na poziomie zdania wynoszący około 4 percent. Zwiększenie minimalnej długości umożliwiającej ocenę z 150 do 300 słów było odpowiedzią na tę lukę.
Odczytane razem, liczby te opisują określony kompromis, a nie pojedynczą wartość dokładności. Wskaźnik fałszywych trafień poniżej 1% brzmi niemal jak wartość pomijalna, dopóki nie zostanie zestawiony z liczbą zgłoszeń przechodzących przez system, a wskaźnik pominięć na poziomie 15% oznacza, że znacząca część treści wygenerowanych przez AI jest z założenia oceniana jako ludzka, a nie wskutek awarii. Własne materiały Turnitin przedstawiają obie liczby jako zamierzony balans systemu, a nie jako dowód, że narzędzie po prostu ma rację albo po prostu się myli.
Co wykazały niezależne testy
Niezależne testy dodają szczegóły, których nie pokazują dane producenta, w tym samym duchu co szersze niezależne testowanie detektorów AI, które konsekwentnie ujawnia rozbieżności między warunkami laboratoryjnymi a rzeczywistymi zgłoszeniami. Center for the Advancement of Teaching na Temple University przeprowadziło jedno z bardziej starannych dostępnych badań. Badacze przesłali 120 próbek pisemnych, podzielonych równo między teksty w pełni napisane przez ludzi, teksty w pełni wygenerowane przez AI, teksty wygenerowane przez AI przepuszczone przez narzędzie parafrazujące oraz teksty hybrydowe łączące wkład ludzki i AI, a następnie odnotowali, co Turnitin zwrócił dla każdej z nich.
Narzędzie poprawnie zidentyfikowało 93 procent próbek całkowicie napisanych przez człowieka oraz 77 procent próbek całkowicie wygenerowanych przez AI. W trudniejszych przypadkach dokładność spadła jeszcze bardziej. Turnitin poprawnie zidentyfikował jedynie 63 procent próbek AI po parafrazowaniu jako wygenerowanych przez AI oraz tylko 43 procent próbek hybrydowych jako ani całkowicie ludzkich, ani całkowicie AI. Są to kategorie najbliższe temu, jak w rzeczywistości powstaje tekst tworzony z pomocą AI, a badacze wskazali zwłaszcza tekst hybrydowy jako prawdopodobnie odpowiadający za dużą i rosnącą część rzeczywistych zgłoszeń, ponieważ coraz więcej kursów zadaje prace wykorzystujące AI do części zadania.
| Co testowano | Wynik Turnitin |
|---|---|
| Próbki w 100% napisane przez człowieka | 93% poprawnie zidentyfikowane jako ludzkie |
| Próbki w 100% wygenerowane przez AI | 77% poprawnie zidentyfikowane jako AI |
| Tekst AI przepuszczony przez narzędzie do parafrazowania | 63% poprawnie zidentyfikowane jako AI |
| Próbki hybrydowe, częściowo ludzkie i częściowo AI | 43% poprawnie zidentyfikowane jako ani 0%, ani 100% |
| Dokumenty z ponad 20% oznaczonych fragmentów (własna wartość Turnitin) | Mniej niż 1% odsetek wyników fałszywie pozytywnych |
Żadne z tych ustaleń nie są niezależnymi wynikami po stronie Turnitin. Badacze spoza firmy, cytowani w omówieniach własnych badań nad stronniczością Turnitin, opisują jeszcze bardziej złożony obraz, zwłaszcza w przypadku autorów piszących po angielsku jako języku obcym oraz silnie redagowanych wersji roboczych.
Gdzie załamują się wyróżnienia na poziomie zdania
Wynik na poziomie dokumentu nie jest jedynym widokiem, który może otworzyć prowadzący, a ten drugi jest mniej wiarygodny. Niektóre interfejsy pokazują raport z oznaczeniami, który wyróżnia konkretne zdania jako prawdopodobnie napisane przez AI. Badacze z Temple sprawdzili te wyróżnienia względem zdań w swoich hybrydowych próbkach, które rzeczywiście były napisane przez AI, i nie stwierdzili żadnej zależności między nimi. Ma to znaczenie, jeśli prowadzący przekazuje zrzut ekranu wyróżnionego akapitu zamiast procentu podsumowującego, ogólny wynik dokumentu wypadał znacznie lepiej niż wyróżnienia na poziomie zdań.
Kto faktycznie widzi wynik
Wynik AI nie jest domyślnie częścią raportu widocznego dla studenta. Znajduje się na osobnej karcie, widocznej dla prowadzących i administratorów, a student widzi go tylko wtedy, gdy prowadzący zdecyduje się udostępnić raport albo ujawnić go bezpośrednio. Jest to rzeczywista różnica strukturalna względem wyniku podobieństwa, który studenci mogą zazwyczaj sami przeglądać w tym samym systemie po przetworzeniu zgłoszenia.
To samo dotyczy tego, czy dana funkcja w ogóle istnieje dla konkretnego kursu, ponieważ jest to decyzja instytucjonalna, wykraczająca poza kompetencje prowadzącego. Administratorzy na poziomie konta mogą włączyć lub wyłączyć wykrywanie AI w Turnitin dla całej instytucji. Jeden wykładowca może nie mieć możliwości włączenia tej funkcji, jeśli jego uniwersytet ją wyłączył, i odwrotnie. Dwóch studentów na różnych uniwersytetach może oddać porównywalną pracę i mieć bardzo różne doświadczenia związane z tym narzędziem, z powodów, które nie mają nic wspólnego z tym, co którykolwiek z nich napisał.
Dlaczego niektóre uniwersytety je wyłączyły
University of Waterloo zaprzestał korzystania z funkcji wykrywania AI w Turnitin we wrześniu 2025, a podane uzasadnienie jest wyjątkowo bezpośrednie. Uniwersytet wskazał na udokumentowaną zawodność narzędzia, jego stronniczość wobec studentów, których pierwszym językiem nie jest angielski, oraz własne testy wewnętrzne, które obejmowały co najmniej jeden przypadek całkowicie napisanej przez człowieka treści ocenionej jako w 100 percent wygenerowana przez AI. Po zestawieniu tego z kosztem narzędzia uniwersytet uznał, że koszty przewyższają korzyści, i zamiast tego skierował wysiłki na przeprojektowanie oceniania oraz szkolenia z zakresu kompetencji AI.
Waterloo jest jednym z widocznych przykładów szerszego podziału, a nie przypadkiem odstającym. Uniwersytety, które pozostawiają tę funkcję włączoną, zazwyczaj dodały zabezpieczenia zamiast traktować wynik jako samodzielny werdykt, wymagając rozmowy ze studentem, zanim zacznie się cokolwiek formalnego, i traktując liczbę jako powód do rozpoczęcia tej rozmowy, a nie jej zakończenia. Zapoznanie się szerzej z tym, jak uniwersytety podchodzą do polityki AI, wyraźniej pokazuje ten wzorzec: to, czy wynik w ogóle do Ciebie trafi, zależy od decyzji podjętej znacznie powyżej sali seminaryjnej, a nie od stałej właściwości samej technologii.
Co wysoki wynik dowodzi, a czego nie dowodzi
Wysoki wynik AI jest dowodem, a nie werdyktem. Sam Turnitin przedstawia ten procent jako jeden z danych wejściowych do oceny prowadzącego, a nie jako stwierdzenie naruszenia, a podane wyżej wskaźniki trafności wyjaśniają, dlaczego takie ujęcie ma znaczenie: nawet wynik na poziomie całego dokumentu, który działa dość dobrze, błędnie odczytuje znaczącą część tekstów mocno redagowanych, parafrazowanych lub hybrydowych, a wyróżnienia na poziomie zdań są wyraźnie mniej wiarygodne niż liczba zbiorcza. Nic z tego nie gwarantuje, że jakikolwiek pojedynczy wynik jest błędny. Oznacza to, że jeden procent jest powodem do zadawania pytań, a nie ustaleniem, które należy przyjąć na pierwszy rzut oka.
Pojedynczy procent na poziomie dokumentu kompresuje cztery odrębne etapy do jednej liczby, a żaden z nich nie odczytuje znaczenia ani nie sprawdza, czy argument jest poprawny. Zobaczenie, jak krótszy fragment wypada na podstawowych sygnałach statystycznych, z których zbudowany jest taki potok, jest bardziej bezpośrednim sposobem zrozumienia raportu niż traktowanie procentu jako werdyktu. Darmowy checker perplexity TextPulse uruchamia uproszczoną wersję takiego poziomu oceny słowo po słowie na własnym szkicu, poza jakimkolwiek instytucjonalnym potokiem, a jego darmowy checker burstiness obejmuje część dotyczącą rytmu zdań tego samego pomiaru. Oba dają odczyt własnego pisania, a nie prognozę tego, co Turnitin o nim powie. Żadne narzędzie nie może odpowiedzialnie obiecywać tego w odniesieniu do systemu, którego nie kontroluje.
Turnitin podaje dwie liczby i mierzą one niepowiązane ze sobą rzeczy. Która jest która, wyjaśniono osobno, wraz z tym, co rzeczywiście liczy się jako dobry wynik Turnitin, gdy wiadomo już, do czego odnosi się ten procent. Kilka powiązanych pytań ma własne strony: czy profesor może stwierdzić, że użyto ChatGPT bez żadnego detektora, bardziej bezpośrednia wersja tego pytania, czy zostanę przyłapany, a także, w odniesieniu do konkretnych kontekstów, wykrywanie AI w programach pielęgniarskich oraz czy biura rekrutacyjne uczelni przeprowadzają takie kontrole. Szersze ujęcie znajduje się w osobnym tekście o integralności akademickiej i AI.
Nic z tego nie jest prawdopodobnie wersją ostateczną. Turnitin wielokrotnie zmieniał swoje progi, zasady widoczności i zakres modeli od 2023, a sierpień 2026 również nie będzie ostatnim słowem. Całość funkcjonuje obok pozostałych bezpłatnych narzędzi TextPulse, dla każdego, kto chce uzyskać dodatkowy sygnał, zanim potraktuje procent podany przez jedną instytucję jako rozstrzygający.
Co wykazały nasze własne badania
W badaniu zgodności detektorów TextPulse Research dziewięć komercyjnych detektorów AI oceniło te same 90 tekstów akademickich. Jednym z nich był hybrydowy tekst o długości 455 słów: napisany przez człowieka wstęp i zakończenie wokół środkowej części 168 słów wygenerowanej przez AI. Turnitin ocenił ten tekst na 26.8% AI, podczas gdy werdykty pozostałych narzędzi dla tych samych słów wahały się od 0% do 95.7% AI. Pełny artykuł, korpus i macierz wyników wszystkich narzędzi są otwarcie dostępne na TextPulse Research.

Najczęściej zadawane pytania
Jak Turnitin wykrywa AI? Dzieli zgłoszenie na segmenty liczące po kilkaset słów, ocenia każdy segment osobno pod kątem tego, czy wygląda na wygenerowany przez AI albo wygenerowany przez AI i następnie sparafrazowany, a potem uśrednia te wyniki segmentów do pojedynczego procentu pokazywanego w raporcie. Proces przebiega tak samo dla każdego zgłoszenia, które spełnia minimalny limit słów.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.