AI Detection

Najlepsze detektory AI do pisania akademickiego w 2026: porównanie 10 narzędzi

Dwa z tych dziesięciu detektorów podają tę samą nagłówkową dokładność 99.98%. Jeden wskazuje badaczy stojących za tym wynikiem i rozbija swój wskaźnik fałszywych trafień według gatunku. Drugi nie podaje żadnego testu. Dziesięć narzędzi ujętych w czterech wymiarach, kto je kupuje, co deklarują, jakie dowody stoją za deklaracją i co rzeczywiście pokazuje raport, a także model śledzenia procesu, który może całkowicie zastąpić punktację.

15 min
AI detectors compared by who each one is sold to and whether a named study sits behind its accuracy figure

Dwa z dziesięciu narzędzi tutaj publikują tę samą liczbę w nagłówku: 99.98% accuracy. Jedno z nich podaje nazwiska badaczy i uniwersytetów stojących za tą wartością oraz rozbija swój wskaźnik false positive rate według gatunku treści. Drugie nie podaje żadnego testu. Ten kontrast jest najważniejszą rzeczą w każdym zestawieniu AI detectors porównywanych obok siebie i pozostanie ważny także wtedy, gdy każda cena na każdej z tych stron ulegnie zmianie.

Ten przewodnik porównuje najlepsze AI detectors do pisania akademickiego w 2026: Turnitin, GPTZero, Copyleaks, Originality.ai, Pangram, Winston AI, ZeroGPT, Scribbr, Sapling i Compilatio, czyli dziesięć narzędzi, z którymi student, badacz, oceniający lub redaktor najprawdopodobniej się zetknie. Są one sprzedawane różnym nabywcom, wyceniane według różnych modeli i zwracają różne informacje. Porównywanie ich wyłącznie pod względem accuracy pomija niemal wszystko, co decyduje o tym, przez które z nich przechodzi tekst i co dzieje się potem.

Cztery rzeczy, które rzeczywiście się różnią

Strony marketingowe detectorów zbliżają się do jednej liczby i różnią się we wszystkim innym. Cztery pytania odróżniają te produkty, a tylko jedno z nich dotyczy procentu na stronie głównej.

  • Komu jest sprzedawane. Narzędzie licencjonowane dla instytucji i widoczne wyłącznie dla wykładowców zajmuje inną pozycję niż takie, do którego każdy może założyć konto w przeglądarce, a ta różnica decyduje o tym, kto w ogóle zobaczy wynik dotyczący użytkownika.
  • Jaką wartość publikuje. Każdy z tych dostawców publikuje jakąś deklarację, od samego procentu po false positive rate podany z dokładnością do czterech cyfr.
  • Czy za tą wartością stoi nazwany test. To oś, która najsilniej odróżnia te dziesięć narzędzi, i jedyna, której nie używa żadna tabela porównawcza dostawców.
  • Co właściwie zwraca raport. Procent na poziomie dokumentu, wyróżnienia na poziomie zdań, widok interpretacyjny i raport możliwy do udostępnienia to cztery różne obiekty, a oskarżenie oparte na jednym z nich jest inną rozmową niż oskarżenie oparte na innym.

Trzecie pytanie jest warte namysłu. Procent z nazwaną instytucją, nazwanym zbiorem danych i podaną metodą można kwestionować, odtwarzać lub podważać. Procent bez niczego za nim można jedynie uznać za prawdziwy albo zignorować, a wiara nie stanowi podstawy do postępowania w sprawie naruszenia zasad. Perplexity, właściwość statystyczna, na której najmocniej opierało się wcześniejsze pokolenie detektorów, jest na tyle mierzalna, że darmowy checker perplexity pokaże, jak wygląda ona w Państwa własnym tekście, choć żaden z poniższych dostawców nie podaje swojego werdyktu jako wyniku perplexity.

Tabela porównawcza: komu każdy z nich jest sprzedawany i co twierdzi

DetectorSprzedawany dlaJak uzyskuje się dostępGłówne twierdzenieBadanie nazwane jako podstawa twierdzenia
TurnitinNauczyciele i administratorzy w licencjonowanych instytucjachTylko licencja instytucjonalnaWskaźnik fałszywie dodatnich wyników dokumentów poniżej 1% powyżej progu 20%Własny zestaw walidacyjny Turnitin, bez wskazanego zewnętrznego badania
GPTZeroNauczyciele, studenci, pisarze, rekruterzy, wydawcyBezpośrednia rejestracja, darmowy poziom99% dokładności, 96.5% w przypadku dokumentów mieszanychOdwołanie do RAID, zewnętrznego benchmarku, oraz partnerstwa z Penn State
CopyleaksEdukacja i przedsiębiorstwa, w ramach Canvas, Blackboard i MoodleBezpośrednia rejestracja i licencja LMSPonad 99% dokładności przy wskaźniku fałszywie dodatnich wyników 0.03%Dostępne są niezależne dane, poniżej badanie VUB z 2026 roku
Originality.aiPisarze, redaktorzy, marketerzy, agencje, przedsiębiorstwaBezpośrednia rejestracja, rozliczanie na podstawie kredytów99% dokładności w przypadku najnowszych modeli AIWłasne badanie dokładności oraz recenzowane prace stron trzecich
PangramUniwersytety, szkoły i przedsiębiorstwaBezpośrednia rejestracja, plany instytucjonalne i API99.98% dokładności, wskaźnik fałszywie dodatnich wyników 1 na 10,000Badanie przypisywane badaczom z Chicago Booth i University of Maryland
Winston AIOsoby indywidualne, zespoły, klienci certyfikacji stron internetowychBezpośrednia rejestracja, rozliczanie na podstawie kredytów99.98% dokładności, wskazywane jako jedyny detektor, który to osiągaBrak wskazanego
ZeroGPTOsoby indywidualne, wstępna kontrola bez rejestracjiDarmowe, 15,000 znaków, bez kontaPowyżej 98% w ocenach wewnętrznychBrak wskazanego, liczba pochodzi od samego dostawcy
ScribbrStudenci, darmowy sprawdzacz oraz poziom premiumDarmowe w przeglądarce78% tekstów testowych zidentyfikowanych poprawnieWłasne porównanie Scribbr, przeprowadzone przez samo Scribbr
SaplingProgramiści i zespoły wsparcia, podejście API-firstBezpośrednia rejestracja, publiczne API, rozszerzenie przeglądarkiPrawdopodobieństwa AI dla poszczególnych zdańBrak wskazanego, niezależne recenzje ostro się ze sobą nie zgadzają
CompilatioInstytucje europejskie i studenci, najsilniej w systemach francuskojęzycznychLicencja instytucjonalna albo bezpośredni zakup przez studenta od 4.99 euro94 do 99% niezawodności, poniżej 1% fałszywych trafieńOcenione na 2. miejscu spośród 14 narzędzi, Weber-Wulff et al. 2023

Jedna pozycja zachowuje się inaczej niż pozostałe. Turnitin nie może zostać kupiony przez osobę ocenianą, nie może zostać przez nią uruchomiony przed przesłaniem i przekazuje wyniki komuś innemu. Compilatio jest licencjonowany przez instytucje w ten sam sposób, ale sprzedaje też studentom te same kontrole bezpośrednio, więc jest jedynym detektorem instytucjonalnym, który można uruchomić na własnym szkicu najpierw. Każdy inny detektor tutaj jest produktem, który student, autor lub redaktor może otworzyć w przeglądarce i skierować na własny tekst jeszcze dziś po południu.

Twierdzenia dotyczące dokładności i które z nich mają za sobą nazwany test

Winston AI i Pangram podają tę samą liczbę. Winston stwierdza, że jest "The only AI detector with a 99.98% accuracy rate". Strona główna Pangram stwierdza: "Detect AI-generated content with 99.98% accuracy. Trusted by universities, schools, and enterprises worldwide." Liczby są identyczne. Dowody stojące za nimi są od tego bardzo dalekie.

Pangram podaje swoje źródło. Jego własne strony przypisują tę statystykę badaniu porównawczemu przeprowadzonemu przez badaczy z University of Chicago's Booth School of Business oraz University of Maryland i publikują rozbicie wyników fałszywie dodatnich według gatunku treści. Strony Winston nie podają żadnego badania: żadnego zbioru danych, żadnej wielkości próby, żadnej metody dla liczby 99.98%. Znacznikami wiarygodności są tam odznaki SOC 2 i GDPR oraz logotypy prasowe, które odnoszą się do poziomu bezpieczeństwa i zasięgu medialnego, a nie do skuteczności wykrywania. Pełna analiza każdego twierdzenia znajduje się w osobnych recenzjach: Pangram reviewed oraz Winston AI reviewed.

Najbardziej szczegółowe liczby spośród dziesięciu publikuje Turnitin i są to wskaźniki błędu, a nie wskaźniki dokładności: odsetek fałszywie dodatnich dla dokumentu poniżej 1% powyżej progu 20%, około 4% prawdopodobieństwa błędu na poziomie zdania oraz podane prawdopodobieństwo pominięcia 15% tekstu AI w dokumencie, opublikowany wskaźnik pominięć, którego prawie nikt nie przytacza. Jak działa detektor Turnitin oraz co w praktyce oznacza jego wskaźnik fałszywie dodatnich wyników są omówione osobno.

GPTZero publikuje 99% dokładności i wskazuje na RAID, zewnętrzny benchmark, oraz partnerstwo badawcze z Penn State, co stawia go o krok wyżej niż sama goła liczba i o krok niżej niż cytowanie. Originality.ai publikuje 99% dla najnowszych modeli AI, powołując się na własne badanie i recenzowane prace stron trzecich, a także publikuje zdanie, które powinno regulować całą tę sekcję: "Any AI detector accuracy claim that is not transparently supported by methodology, benchmark data, and independent or reproducible analysis should be viewed skeptically." Stosowany konsekwentnie, ten standard stawia to samo pytanie wobec każdej liczby na tej stronie, w tym obu twierdzeń o 99.98%. Liczba ZeroGPT, powyżej 98% w ocenach wewnętrznych, również nie ma za sobą nazwanego testu, the ZeroGPT accuracy review wyjaśnia, skąd pochodzi ta liczba. 78% Scribbr jest przynajmniej uczciwe co do swojej skali, choć test jest własny Scribbr.

Ten sam standard musi mieć zastosowanie także do naszych własnych liczb. TextPulse publikuje zmierzone wskaźniki zaliczenia na poziomie 92.33% dla Turnitin AI, 89.12% dla Originality.ai i 87.91% dla GPTZero w przypadku swojego academic AI humanizer. Są to liczby dostawcy pochodzące z testów dostawcy, dokładnie tak jak w przypadku Winston's i Pangram's, i żadne narzędzie po żadnej stronie tego rynku nie może obiecać tego, co detektor zgłosi o konkretnym dokumencie.

10 najlepszych detektorów AI do pisania akademickiego

Każdy wpis obejmuje te same cztery kwestie: jak działa silnik, co twierdzi dostawca, co pokazują niezależne dowody oraz kto rzeczywiście używa narzędzia. Szczegółowa recenzja, do której prowadzi link z każdej sekcji, idzie dalej.

1. Turnitin: domyślne rozwiązanie instytucjonalne

Turnitin homepage positioning AI writing detection inside its authentic learning and similarity workflow
Turnitin sprzedaje instytucjom, nie autorom: wykrywanie AI jest dołączone do przepływu pracy z podobieństwem, z którego wykładowcy już korzystają.

Wskaźnik pisania AI w Turnitin to klasyfikator oparty na głębokim uczeniu, trenowany na prozie akademickiej. Dzieli on przesłany tekst na nakładające się segmenty liczące po kilkaset słów, ocenia każdy segment pod kątem statystycznych wzorców tekstu generowanego przez model, a następnie agreguje wyniki do procentu dokumentu, który widzą prowadzący. Tylko proza ciągła jest liczona jako tekst kwalifikujący się, listy punktowane, cytaty i przypisy są wyłączone.

Turnitin publikuje wskaźniki błędu, a nie wskaźnik dokładności: odsetek fałszywie dodatnich wyników dla dokumentu poniżej 1% w przypadku prac powyżej progu 20%, około 4% prawdopodobieństwa błędu dla pojedynczego wyróżnionego zdania oraz deklarowaną szansę pominięcia 15% tekstu AI w dokumencie. Badanie VUB z 2026 roku było bardziej surowe niż własne dane dostawcy: Turnitin wskazał 0% AI w każdym z 40 całkowicie wygenerowanych przez AI prac dyplomowych w zbiorze testowym. Pozostaje domyślnym rozwiązaniem, ponieważ jest dostarczany w ramach przepływu pracy związanego z plagiatem, na który już licencję ma ponad 16,000 instytucji, według własnych danych Turnitin, a wynik widzą tylko prowadzący i administratorzy. Jest to także narzędzie, z którego najczęściej się wycofywano na tej stronie: kilka dużych uniwersytetów wyłączyło je z powodu obaw o fałszywie dodatnie wyniki, odnotowanych w uniwersytetach, które przestały używać Turnitin. Jak Turnitin wykrywa AI oraz podobieństwo a wynik AI omawiają mechanizm działania.

2. GPTZero: największa marka po stronie studentów

Strona główna GPTZero: detektor AI stworzony, aby zachować to, co ludzkie, z deklaracją 99% dokładności, 17 milionami użytkowników i 1 milionem nauczycieli
Skala GPTZero po stronie studentów: darmowy plan, miliony użytkowników i deklaracja 99% dokładności odnosząca się do testów zewnętrznych.

GPTZero wystartował w styczniu 2023 jako narzędzie do sprawdzania perplexity i burstiness, a następnie przebudował swój silnik w wielowarstwowy klasyfikator. Skan zwraca werdykt dokumentu, podział prawdopodobieństwa na AI, człowieka i tekst mieszany, wyróżnienie zdań dla fragmentów wpływających na wynik oraz listę słownictwa AI. Strona główna podaje 99% dokładności, 17 milionów użytkowników i 1 milion nauczycieli, a darmowy plan przyjmuje około 10,000 znaków na skan, zaś firma publikuje kalibrację ESL, której celem jest ograniczenie fałszywych oznaczeń w tekstach po angielsku pisanych przez osoby niebędące native speakerami.

Na podstawie dowodów plasuje się w środku stawki. Wskazuje na zewnętrzny benchmark RAID oraz partnerstwo badawcze z Penn State, co stanowi krok dalej niż gołe twierdzenie, jednak w badaniu VUB jego mediana wyniku dla całkowicie wygenerowanych przez AI prac dyplomowych pozostawała poniżej 20%, przy dużych wahaniach między poszczególnymi pracami. Jest to narzędzie, którego studenci najczęściej używają do wstępnego sprawdzania własnych szkiców przed złożeniem. Jak działa GPTZero omawia raport warstwa po warstwie, a GPTZero versus Turnitin wyjaśnia, dlaczego oba narzędzia różnią się w ocenie tego samego tekstu.

3. Copyleaks: detektor wewnątrz Twojego LMS

Strona główna Copyleaks: platforma integralności treści i wykrywania AI dla przedsiębiorstw i uniwersytetów
Copyleaks pozycjonuje się przed salą dydaktyczną, jako platforma integralności dla przedsiębiorstw, która dociera do studentów poprzez integracje z LMS.

Copyleaks sprzedaje wykrywanie AI i sprawdzanie plagiatu jako jeden produkt dla przedsiębiorstw, zintegrowany z Canvas, Blackboard i Moodle, z najszerszym zakresem językowym spośród dziesięciu, dostawca wymienia ponad 30 języków z modelami wykrywania dla poszczególnych języków. Skan zwraca procent dla dokumentu z wyróżnionymi fragmentami. Dostawca deklaruje ponad 99% dokładności przy 0.03% odsetku fałszywie dodatnich wyników, a darmowy skaner przyjmuje około 25,000 znaków.

Niezależny zapis jest słabszą połową tej propozycji. W badaniu VUB Copyleaks nie sklasyfikował ani jednej z 40 całkowicie wygenerowanych przez AI prac jako w pełni napisanej przez AI, oznaczył tylko 10 z 40 choćby częściowo i utrzymał medianę zgłaszanego udziału AI poniżej 20% w pracach, które były w 100% wygenerowane maszynowo. Udało mu się natomiast poprawnie przepuścić wszystkie 40 prac napisanych przez ludzi, każdą przez osobę niebędącą native speakerem języka angielskiego, co stanowi rzeczywisty argument na jego korzyść w zakresie fałszywych pozytywów. Recenzja Copyleaks przedstawia pełny obraz.

4. Originality.ai: zbudowany dla wydawców, nie dla sal wykładowych

Strona darmowego detektora AI Originality.ai z regulowanym suwakiem dopuszczalnego udziału AI i trzema darmowymi skanami dziennie
Kalibracja Originality.ai jest z założenia regulowana, suwak dopuszczalnego udziału AI, przeznaczony dla redaktorów sprawdzających teksty, a nie dla komisji zajmujących się naruszeniami.

Originality.ai służy wydawcom, agencjom SEO i zespołom contentowym sprawdzającym teksty freelancerów, a każda decyzja projektowa wynika z tego odbiorcy: cenę opartą na kredytach, po jednym kredycie na 100 words, API, rozszerzenie do Chrome, dodatki do wykrywania plagiatu i sprawdzania faktów oraz regulowany suwak dopuszczalnego udziału AI, który pozwala redaktorowi ustawić, ile tekstu wspomaganego przez AI jest akceptowalne. Model wykrywania jest ponownie trenowany dla każdej nowej generacji modeli językowych i firma twierdzi, że osiąga 99% dokładności w przypadku najnowszych z nich, powołując się na własne badanie oraz recenzowane prace stron trzecich.

W niezależnych testach wypada przyzwoicie, należy do najsilniejszych narzędzi komercyjnych w benchmarku RAID, a jego kalibracja jest celowo agresywna, woli nadmiernie oznaczyć niż nie oznaczyć. To właściwy kompromis dla wydawcy i niewłaściwy dla komisji zajmującej się naruszeniami, i jest to najważniejsza rzecz do zrozumienia, gdy wynik wstępnej kontroli nie zgadza się z tym, co później pokazuje narzędzie uniwersyteckie. Originality.ai versus Turnitin pokazuje tę różnicę.

5. Pangram: jedyne narzędzie, które badania niezależne nadal faworyzują

Strona główna Pangram: detektor AI, który naprawdę działa, z deklaracją dokładności 99.98% przypisaną badaczom z University of Maryland i University of Chicago
Pangram wyróżnia to, czego brakuje większości dostawców, weryfikacja przez stronę trzecią przypisana z imienia badaczom uniwersyteckim.

Pangram jest najmłodszym narzędziem w tym zestawieniu i tym, które badacze nadal potwierdzają. Jego klasyfikator został wytrenowany specjalnie po to, aby utrzymywać liczbę fałszywych pozytywów blisko zera, a raport zawiera widok interpretowalności pokazujący, które frazy wpłynęły na werdykt. Funkcje obejmują ponad 20 języków, przesyłanie plików z OCR, rozszerzenie przeglądarki oraz integrację z Google Docs, a darmowy plan skanuje do 2,000 słów dziennie. Dostawca twierdzi, że dokładność wynosi 99.98%, a wskaźnik fałszywych pozytywów to 1 na 10,000, opublikowane z podziałem według gatunku.

Co nietypowe, niezależne dowody wskazują w tym samym kierunku co marketing. Badanie VUB z 2026 roku uznało go za jedyne z czterech testowanych narzędzi, którego mediana wyniku w pełni wygenerowanych przez AI pracach dyplomowych zbliżała się do wartości rzeczywistej, oraz za najbliżej dopasowane w pracach hybrydowych i humanizowanych. Working paper NBER autorstwa badaczy z Chicago Booth i Maryland wykazał, że jest to jedyny detektor utrzymujący fałszywe pozytywy na poziomie 0.5% lub niższym, przy jednoczesnym zachowaniu wysokiej skuteczności wobec tekstu przeredagowanego. Oba badania są świeże i ograniczone zakresem, ale żadne inne narzędzie na tej stronie nie ma tak dużej ilości aktualnych dowodów przemawiających na jego korzyść. Recenzja Pangram omawia oba badania szczegółowo.

6. Winston AI: największa deklaracja, najmniej dowodów

Strona główna Winston AI: najbardziej zaufany detektor AI, z odznaką dokładności 99.98% i 10 million users
Odznaka 99.98% firmy Winston znajduje się na stronie głównej, za nią nie stoi żadne nazwane badanie zewnętrzne.

Winston AI jest detektorem opartym na kredytach, przeznaczonym dla nauczycieli i zespołów ds. treści. Jego zestaw funkcji jest praktyczny: mapa cieplna dla poszczególnych zdań, OCR odczytujący sfotografowane i odręcznie napisane strony, dodatek do wykrywania plagiatu oraz integracja z Google Classroom. Strona główna podaje 99.98% dokładności i ponad 10 million users; liczba dotycząca dokładności pochodzi z testów wewnętrznych, a na stronie nie opublikowano nigdzie metodologii, zbioru danych ani wielkości próby.

Najlepszym niezależnym punktem odniesienia jest benchmark RAID (ACL 2024), gdzie Winston wykrył 71% tekstu AI łącznie przy stałym 5% wskaźniku fałszywie dodatnich wyników: znakomity wynik dla treści w stylu ChatGPT, na poziomie 99.6%, znacznie słabszy w przypadku starszych modeli i modeli open-source, a w przypadku tekstu parafrazowanego spadający do 52.6%. Kompetentne narzędzie z zawyżonym nagłówkiem. Recenzja Winston AI analizuje to twierdzenie szczegółowo.

7. ZeroGPT: darmowa wstępna weryfikacja

Detektor na stronie głównej ZeroGPT z darmowym limitem 15,000 znaków i bez konieczności rejestracji
Oferta ZeroGPT opiera się na braku tarcia i dużej skali, 15,000 znaków, bez konta, oraz najsłabszym dorobku dowodowym spośród dziesięciu.

ZeroGPT jest najczęściej używaną darmową wstępną weryfikacją: wklej do 15,000 znaków bez konta i otrzymaj natychmiastowy procent oraz wyróżnione zdania z tego, co marka określa jako technologię DeepAnalyse. Dostawca twierdzi, że dokładność przekracza 98% w testach wewnętrznych, i nie wskazuje żadnego testu zewnętrznego. Niezależne porównania konsekwentnie sytuują to narzędzie blisko końca stawki komercyjnej, a jego wynik dla tego samego tekstu może zmieniać się między kolejnymi uruchomieniami. Jako pobieżny pierwszy ogląd jest nieszkodliwe, jako werdykt jest to najmniej obronne narzędzie na tej stronie. Recenzja dokładności ZeroGPT prowadzi jego twierdzenia do źródeł.

8. Scribbr: zaufana marka z licencjonowanym silnikiem

Scribbr free AI detector scoring an academic paragraph 100% AI-generated, with the QuillBot engine version visible in the result panel
Sprawdzarka Scribbr w działaniu, znacznik wersji QuillBot w panelu wyników to szczegół dotyczący rodziny korporacyjnej, którym marketing nie zaczyna.

Sprawdzarka AI Scribbr to silnik wykrywania QuillBot pod marką Scribbr, panel wyników wyświetla wersję silnika, a strona o firmie Scribbr umieszcza obie spółki w rodzinie Learneo. Darmowy poziom skanuje około 1,200 słów w przeglądarce, bez rejestracji, i raportuje trójdzielny podział na AI-generated, AI-refined oraz human-written. W lipcowym porównaniu Scribbr z 2026 darmowa sprawdzarka zidentyfikowała 78% tekstów testowych, a wersja premium 84%, przy zerowej liczbie false positives w tej próbie.

To są najlepsze opublikowane liczby w darmowym poziomie, a pochodzą z testu, który Scribbr zaprojektował, przeprowadził i sam ocenił, w którym jego własna korporacyjna siostrzana spółka zajęła ex aequo pierwsze miejsce. Studenci ufają tej sprawdzarce, ponieważ zaufanie zdobyły przewodniki Scribbr dotyczące cytowań i prac dyplomowych, a detektor je dziedziczy. Recenzja Scribbr omawia, co naprawdę mierzą wersje free i premium.

9. Sapling: narzędzie dla deweloperów

Sapling AI detector output highlighting AI sentences in red with a fake probability of 73.6%
Widok Sapling na poziomie zdań, czerwone wyróżnienie i prawdopodobieństwo dokumentu, stworzone do triage w przepływach pracy branżowych.

Detektor Sapling pochodzi od firmy NLP, której główną działalnością jest wsparcie pisania dla zespołów obsługi klienta, i to widać, najbardziej dostępne API w grupie, oceny prawdopodobieństwa dla poszczególnych zdań z widokiem perplexity oraz rozszerzenie przeglądarki, które skanuje tekst w Google Docs, Gmail, Zendesk i Salesforce. Darmowe sprawdzenia mają limit 2,000 znaków, plany płatne podnoszą limit do 100,000.

Jego niezależny dorobek jest najbardziej zmienny spośród dziesięciu, 68% bez żadnych wyników fałszywie dodatnich w porównaniu Scribbr, niemal całkowite chybienia w benchmarku arXiv z 2023 roku oraz co najmniej jedna praktyczna recenzja, która wykazała, że oznaczał wszystko jako fałszywe. Wyniki pojedynczych recenzji słabo uogólniają się na każdy detektor, a Sapling jest najjaśniejszym tego przykładem. Recenzja Sapling wyjaśnia dlaczego.

10. Compilatio: instytucjonalny odpowiednik Europy

Strona główna Compilatio: wykrywanie treści AI za pomocą Compilatio, narzędzia do sprawdzania plagiatu i detektora AI dla europejskich instytucji
Oferta Compilatio odzwierciedla ofertę Turnitin, skierowaną do nauczycieli i instytucji w systemach francuskich oraz szerzej europejskich.

Compilatio to pakiet do sprawdzania plagiatu i AI, który europejskie instytucje licencjonują tam, gdzie zestawienia z perspektywy USA zakładają Turnitin: najsilniejszy w systemach francuskojęzycznych, z wykrywaniem AI zintegrowanym z tym samym przepływem pracy dla prowadzącego zajęcia co sprawdzanie podobieństwa, oraz z edycją dla studentów, która sprzedaje te same kontrole w modelu kredytowym. Firma deklaruje wskaźnik niezawodności od 94 do 99% i mniej niż 1% wyników fałszywie dodatnich, a także jest jedynym narzędziem tutaj, obok Turnitin, które znalazło się blisko czoła w recenzowanym teście, na drugim miejscu spośród czternastu w badaniu Weber-Wulff i współautorów. Jeśli studiujesz w UE, detektor czytający Twoją pracę dyplomową może bardzo dobrze być właśnie tym. Recenzja Compilatio omawia, co to zestawienie ustala, a czego nie ustala.

Humanizuj własną pracę

Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.

Zacznij za darmo

iThenticate: detektor na biurku wydawcy

Jeszcze jeden produkt Turnitin zasługuje tutaj na osobną sekcję, ponieważ większość badaczy spotyka się z nim, nigdy go nie widząc. iThenticate jest narzędziem Turnitin do kontroli dla wydawców, czasopism i instytucji badawczych, przeznaczonym do sprawdzania manuskryptów przed publikacją, a nie do oceniania prac zaliczeniowych. Jego obietnica brzmi: publikowanie z pewnością, sprawdź dokument o wysokiej stawce pod kątem potencjalnych nadużyć, zanim zostanie opublikowany. Tysiące czasopism naukowych przepuszcza zgłoszenia przez to narzędzie za pośrednictwem usługi Crossref Similarity Check, więc jeśli złożyłeś lub złożyłaś manuskrypt do czasopisma recenzowanego, prawdopodobnie przeszedł on przez iThenticate, niezależnie od tego, czy ktoś Ci o tym powiedział.

iThenticate homepage for publishers and researchers: publish with confidence by screening high-stakes documents for potential misconduct before publication, with log in and buy credits buttons
iThenticate sprzedaje kontrolę przed publikacją z kredytami kupowanymi na dokument, to jedyne narzędzie z rodziny Turnitin, z którego autor może skorzystać bez instytucji.

Dwie rzeczy odróżniają je od wiersza Turnitin powyżej. Jest ono najpierw ukierunkowane na dokument, a nie na kurs, nie ma klas, nie ma zadań, jest jeden raport na manuskrypt. I w przeciwieństwie do Turnitin może je kupić osoba poddawana ocenie. Kredyty są sprzedawane bezpośrednio na stronie, w cenie za dokument, co czyni je jedynym narzędziem z rodziny Turnitin, z którego autor może skorzystać na własnym manuskrypcie, zanim zrobi to czasopismo. Raport jest przede wszystkim raportem podobieństwa, porównującym z opublikowaną literaturą i siecią, a Turnitin wymienia iThenticate wśród produktów, które oferują jego wykrywanie pisania przez AI dla uprawnionych klientów.

Dla autora akademickiego praktyczne zastosowanie jest wąskie i konkretne: wstępna kontrola oryginalności przed złożeniem ostatecznej wersji manuskryptu, wykonywana przez tę samą firmę, której narzędzi prawdopodobnie użyje czasopismo. Raport nie służy do naprawiania czegokolwiek. Wskazuje nakładanie się treści i prawdopodobne pisanie przez AI, a przeredagowanie zaznaczonego tekstu nadal należy do autora, i właśnie do tej połowy listy kontrolnej przed złożeniem pracy służy akademicki AI humanizer.

Co niezależne badania mówią o tej kategorii

Dane dostawców skupiają się blisko 99%. Opublikowane badania nie. Weber-Wulff i współautorzy przetestowali 14 systemów w International Journal for Educational Integrity w 2023 roku, w tym Turnitin, a Liang i współautorzy stwierdzili w Patterns w tym samym roku, że 89 z 91 esejów TOEFL napisanych przez osoby niebędące rodzimymi użytkownikami języka angielskiego, czyli 97.8%, zostało oznaczonych jako AI przez co najmniej jeden z siedmiu detektorów, a 18 przez wszystkie siedem.

Najbardziej bezpośrednim akademickim testem powyższych narzędzi jest badanie VUB z 2026 roku, opublikowane w otwartym dostępie w International Journal for Educational Integrity: rzeczywiste prace magisterskie, cztery komercyjne detektory i mediany poniżej 20% dla w pełni wygenerowanych przez AI prac w przypadku trzech z czterech narzędzi. Jabarian i Imas, w working paper NBER w34223, zbudowali korpus 1,992 tekstów ludzkich sprzed 2020 roku oraz 1,992 tekstów AI z czterech modeli frontier i przeprowadzili testy obciążeniowe na Pangram, GPTZero, Originality.ai oraz otwartoźródłowej bazie odniesienia: komercyjne detektory wypadły lepiej niż baza odniesienia, a tylko jedno narzędzie utrzymało odsetek fałszywie dodatnich wyników na poziomie 0.5% lub niższym, pozostając jednocześnie skuteczne wobec tekstu przeredagowanego. Otwartoźródłowa baza odniesienia oznaczała od 30% do 69% tekstu ludzkiego, dlatego darmowe detektory z GitHub nie pojawiają się w powyższej tabeli.

OpenAI wycofał własny AI Text Classifier 20 lipca 2023, stwierdzając, że jest on "no longer available due to its low rate of accuracy". Giray, Roe i Espiritu, publikując w English Teaching: Practice & Critique w marcu 2026, jasno ujęli problem równości: "These tools disproportionately flag authentic writing by multilingual students, creating a chilling effect that paradoxically encourages AI use to avoid false accusations." Wzorzec stojący za tym ustaleniem został udokumentowany w how detectors treat non-native English writing.

Instytucje zareagowały na dane dotyczące false positives. Vanderbilt wyłączył detektor AI Turnitin w sierpniu 2023, uznając, że wobec 75,000 prac złożonych w 2022, wskaźnik false positive na poziomie 1% oznacza około 750 prac błędnie oznaczonych. Dokumentacja Michigan State stwierdza, że narzędzia do wykrywania AI nie powinny być jedyną podstawą do podjęcia niekorzystnych działań wobec studenta, a University of Texas at Austin w ogóle nie rekomenduje oprogramowania do wykrywania AI. How accurate AI detectors actually are, jako kategoria, to odrębne pytanie od tego, na licencji której z nich opiera się Państwa instytucja.

Model, który omija ocenianie, śledzenie procesu

Inna odpowiedź na problem false positive zyskuje zainteresowanie instytucjonalne: przestać oceniać gotowy tekst i zamiast tego rejestrować, w jaki sposób dokument został napisany. Funkcja Authorship w Grammarly oraz platforma oceniania Cadmus działają właśnie w ten sposób, rejestrując proces pisania, wpisywanie tekstu, wklejanie, historię poprawek, w miarę jak się to dzieje. Rejestr procesu nie może błędnie oznaczyć eseju, który rzeczywiście został napisany ręcznie, a to dokładnie ten tryb awarii sprawił, że uniwersytety wyłączały detektory. Kompromisy są inne, pytania o nadzór zastępują pytania statystyczne, ale jeśli Państwa instytucja przyjmie jedno z tych rozwiązań, powyższa debata o detektorach staje się dla Państwa w dużej mierze nieistotna: dowodem jest dziennik procesu, a nie wynik prawdopodobieństwa.

Jak odczytać wynik detektora, który został Państwu przekazany

Liczba pojawia się niemal za każdym razem bez swojego kontekstu. Cztery pytania przywracają go na tyle, by można było prowadzić sensowną rozmowę.

  • Jakie narzędzie i jaka wartość. Procent na poziomie dokumentu i wyróżnienie na poziomie zdania mają różne opublikowane wskaźniki błędu od tego samego dostawcy, a wskaźniki Turnitin wynoszą odpowiednio 1% i około 4%.
  • Co dostawca opublikował na temat błędów. Narzędzie, które podaje wskaźnik pominięć i wskaźnik fałszywie dodatnich wyników, wskazało już, gdzie leżą jego ograniczenia. Narzędzie, które publikuje wyłącznie procent dokładności, tego nie zrobiło.
  • Czy wynik jest dowodem, czy sygnałem do dalszej oceny. Sformułowanie Michigan State, że narzędzia te nie powinny stanowić jedynej podstawy do podjęcia niekorzystnych działań, jest częstym stanowiskiem instytucjonalnym i warto je zacytować w odwołaniu. Przewodnik po piśmie odwoławczym pokazuje, jak to zrobić.
  • Co faktycznie mówi polityka Twojej instytucji. To, czy detektor jest licencjonowany, czy jego wynik może być użyty w postępowaniu dotyczącym naruszenia zasad oraz o co student może wystąpić, jest gdzieś zapisane i bardzo się różni między uniwersytetami.

Co Turnitin robi z humanizowanym tekstem jest omówione osobno, wraz z szerszym przeglądem alternatyw dla humanizerów.

Dostawcy detektorów będą nadal publikować zaokrąglone liczby, a większość z nich nadal będzie odmawiać podania, skąd te liczby pochodzą. To, które z tych dziesięciu dotyczy Twojej pracy, rozstrzyga osoba, która ją czyta, więc użyteczne przygotowanie polega na tym, by wiedzieć, co dane narzędzie publikuje o własnych wskaźnikach błędu, zanim ktokolwiek poda Ci procent. Aktualne ceny TextPulse znajdują się na osobnej stronie, aktualizowane tam, a nie w zestawieniu.

Co wykazały nasze własne badania

W badaniu zgodności detektorów TextPulse Research dziewięć komercyjnych detektorów AI oceniło te same 90 tekstów akademickich. Jednym z nich był hybrydowy tekst o długości 455 słów: napisany przez człowieka wstęp i zakończenie wokół środkowej części 168 słów wygenerowanej przez AI. Copyleaks ocenił ten tekst na 0% AI, podczas gdy werdykty pozostałych narzędzi dla tych samych słów wahały się od 0% do 95.7% AI. Pełny artykuł, korpus i macierz wyników wszystkich narzędzi są otwarcie dostępne na TextPulse Research.

Copyleaks wobec hybrydowego tekstu z korpusu badania.
Copyleaks wobec hybrydowego tekstu z korpusu badania.
Sapling wobec hybrydowego tekstu z korpusu badania.
Sapling wobec hybrydowego tekstu z korpusu badania.

Najczęściej zadawane pytania

Żadna deklaracja dostawcy nie rozstrzyga sprawy, ale najnowsze niezależne dowody przemawiają za Pangram: badanie z 2026 roku przeprowadzone na Vrije Universiteit Brussel, opublikowane w International Journal for Educational Integrity, wykazało, że był to jedyny narzędzie, którego mediana wyniku dla całkowicie wygenerowanych przez AI prac akademickich zbliżała się do wartości rzeczywistej, podczas gdy GPTZero, Copyleaks i Turnitin uzyskały mediany poniżej 20%, a working paper NBER wykazał, że był to jedyny detektor utrzymujący odsetek fałszywych trafień na poziomie 0.5% lub niższym. Oba badania są świeże i ograniczone zakresem, a wynik żadnego detektora sam w sobie nie stanowi dowodu.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

Bądź na bieżąco z humanizacją AI

Otrzymuj wskazówki dotyczące pisania akademickiego, wykrywania AI i humanizacji prosto na swoją skrzynkę.

Bez spamu. Możesz zrezygnować w dowolnym momencie.