Recenzja detektora AI Pangram: narzędzie, które badacze nadal weryfikują
Pangram podaje wskaźnik fałszywych trafień na poziomie około 1 na 10,000 i, w odróżnieniu od większości dostawców detektorów, ma już najnowsze niezależne badania wskazujące w tym samym kierunku. Recenzowane badanie z 2026 roku z Vrije Universiteit Brussel wykazało, że był to jedyny z czterech narzędzi, który uzyskał zadowalające wyniki w przypadku prac na poziomie magisterskim. Oto, co mierzyły badania, gdzie dowody są nadal słabe i czego nie może dowieść żaden wynik detektora.
Pangram to detektor AI, który niezależni badacze konsekwentnie wyróżniają, co sprawia, że warto przyjrzeć mu się bliżej niż zwykłej tabeli wyników dostawcy. Jego twórca, Pangram Labs, podaje wskaźnik fałszywie dodatnich wyników na poziomie około 1 na 10,000 oraz nagłówkową dokładność 99.98 percent. Są to własne liczby firmy, mierzone na jej własnych benchmarkach. To, co odróżnia Pangram od większości rynku, polega na tym, że po raz pierwszy najnowsze badania zewnętrzne wskazują w tym samym ogólnym kierunku.
W ciągu ostatniego roku pojawiły się dwie niezależne oceny: recenzowane badanie z Vrije Universiteit Brussel, opublikowane przez Springer w June 2026, oraz working paper University of Chicago Booth School omówiony w Chicago Booth Review w December 2025. Oba jednoznacznie sytuowały Pangram przed lepiej znanymi rywalami, w tym Turnitin, GPTZero i Copyleaks. Żadne z tych badań nie uznaje wyniku żadnego detektora za dowód czegokolwiek w odniesieniu do jednego konkretnego dokumentu, i oba mówią to wprost.
To, co następuje dalej, obejmuje to, co Pangram twierdzi o sobie, co rzeczywiście zmierzyły oba badania, gdzie dowody są nadal skąpe oraz co wzrost znaczenia tego narzędzia mówi o reszcie rynku detekcji.
Czym jest Pangram i kto z niego korzysta
Pangram Labs to niewielka firma założona w 2023 w Brooklyn przez badaczy AI, którzy wcześniej pracowali w Tesla i Google. Produkt sprawdza wklejony lub przesłany tekst i zwraca szacunek tego, jaka jego część została wygenerowana przez AI, z podświetlaniem na poziomie zdań, a także z wykrywaniem obrazów i sprawdzaniem plagiatu w płatnych planach.
Jego baza użytkowników wygląda inaczej niż w przypadku Turnitin. Turnitin jest sprzedawany instytucjom i działa wewnątrz systemów zarządzania nauczaniem, natomiast Pangram może uruchomić każdy, kto ma darmowe konto, co oznacza, że korzystają z niego bezpośrednio studenci, redaktorzy, pracownicy czasopism i osoby oceniające kandydatury w rekrutacji. Jest to nowicjusz na tym rynku i coraz częściej narzędzie, po które sięgają badacze integralności akademickiej, gdy chcą punktu odniesienia, właśnie dlatego, że w testach nadal wypada lepiej niż dotychczasowi liderzy.
Co twierdzi dostawca
Pangram na stronie głównej reklamuje 99.98 percent accuracy i stwierdza, że jego false positive rate, czyli odsetek, z jakim dokumenty napisane przez ludzi są błędnie oznaczane jako AI, wynosi obecnie 1 in 10,000. Wpis na firmowym blogu o false positives, napisany przez jego CTO, rozbija tę ogólną wartość według gatunku: 0.004 percent w przypadku academic essays, 0.001 percent w przypadku scientific abstracts, przy słabszych obszarach, które sama firma ujawnia, takich jak 0.05 percent w przypadku poetry i 0.23 percent w przypadku recipes. Firma twierdzi również, że jej model nadal wykrywa tekst AI po przetworzeniu go przez tak zwane humanizer tools.
Wszystkie te liczby są samodzielnie raportowane przez dostawcę na podstawie jego własnych zbiorów testowych, a ten sam wpis zawiera także własne zastrzeżenia dostawcy: model działa najlepiej na dłuższym tekście napisanym pełnymi zdaniami, a firma odradza sprawdzanie krótkich list punktowanych lub tekstu o silnie sformalizowanej strukturze. Należy mieć na uwadze obie te części. Twierdzenia są wyjątkowo szczegółowe i wyjątkowo niskie, ale pozostają twierdzeniami, dopóki ktoś spoza firmy ich nie sprawdzi.

Co pokazują niezależne dowody
Najmocniejszym dotąd testem jest recenzowane badanie autorstwa Van Vlasselaer, Van Droogenbroeck i Spruyt z Vrije Universiteit Brussel, opublikowane w czerwcu 2026 w International Journal for Educational Integrity. Zespół przygotował 160 prac akademickich na poziomie magisterskim, każda o objętości co najmniej 4,000 słów: 40 napisanych przez rzeczywistych studentów przed 2019, 40 w pełni wygenerowanych przez GPT-4o Deep Research, 40 hybrydowych oraz 40 wygenerowanych przez AI, a następnie celowo uczłowieczonych. Wszystkie przepuszczono przez Turnitin, GPTZero, Copyleaks i Pangram.
W przypadku w pełni wygenerowanych przez AI prac badanie podaje, że Turnitin, GPTZero i Copyleaks "completely failed to detect the AI-generated content." Turnitin przyznał każdej z tych 40 prac wynik od 0 do 20 percent AI; mediana wyników wszystkich trzech dominujących narzędzi była poniżej 20 percent w pracach, które w 100 percent zostały napisane przez maszynę. Pangram osiągnął ścisłą dokładność na poziomie 65 percent oraz dokładność inkluzywną 97.5 percent dla tego samego zbioru, błędnie klasyfikując jedną pracę. W zbiorze uczłowieczonym Pangram poprawnie zidentyfikował treści AI w 37 z 40 przypadków, co daje ścisłą dokładność 92.5 percent, podczas gdy GPTZero osiągnął 2.5 percent, Copyleaks 22.5 percent, a Turnitin 50 percent.
| Narzędzie | W pełni AI prace (ścisła dokładność) | Uczłowieczone AI prace (ścisła dokładność) | Prace ludzkie poprawnie odrzucone |
|---|---|---|---|
| Pangram | 65% | 92.5% | 100% |
| Turnitin | 0% | 50% | 100% |
| GPTZero | 0% | 2.5% | 100% |
| Copyleaks | 0% | 22.5% | 100% |
Drugim punktem danych jest working paper autorstwa Briana Jabariana i Alexa Imasa z Chicago Booth, podsumowany w Chicago Booth Review w grudniu 2025. Testując detektory na około 2,000 fragmentach napisanych przez ludzi, obejmujących sześć mediów, oraz na wersjach AI z czterech frontier models, badacze stwierdzili, że wskaźnik false positive Pangram był zasadniczo zerowy w większości progów decyzyjnych, a dokładność nigdy nie spadła poniżej 99.8 percent w ich korpusie, przy false negatives wynoszących od 2 do 4 percent w zależności od modelu. Badacze proponują, aby instytucje przyjęły ścisły limit polityki, na przykład nie więcej niż 0.5 percent tekstu ludzkiego oznaczanego jako podejrzany, zanim zaczną operacyjnie ufać jakiemukolwiek detektorowi. Zwróć uwagę na różnicę statusu, artykuł Booth jest working paper, jeszcze nie recenzowany przez ekspertów, i testował niezmodyfikowany tekst AI, a nie „uczłowieczone” prace akademickie.
False Positives i kto ponosi szkody
False positives to obszar, w którym koncentrują się szkody wyrządzane przez detektory, a wzorzec udokumentowany w całej tej branży polega na tym, że oznaczenia trafiają nieproporcjonalnie często do autorów piszących po angielsku jako języku obcym. Badanie VUB warto przeczytać właśnie pod tym względem, jego 40 prac napisali wyłącznie autorzy, dla których angielski nie był językiem ojczystym, a wszystkie cztery narzędzia, w tym Pangram, uznały je w 100 percent za poprawne. To rzeczywiście budujący wynik, ale jest to także 40 prac. Próba tej wielkości nie może potwierdzić wskaźnika takiego jak 0.004 percent, tylko własne, znacznie większe wewnętrzne testy dostawcy dają tak precyzyjne liczby, a żadna strona zewnętrzna nie odtworzyła ich w takiej skali.
Sekcja dotycząca rzeczywistego świata w badaniu pokazuje, dlaczego ostrożność utrzymuje się nawet przy dobrych benchmarkach. Gdy badacze uruchomili Pangram na 1,163 rzeczywistych pracach magisterskich z 2024 i 2025, oznaczył on 45.5 procent z nich na pewnym poziomie, przy medianie szacowanego udziału AI wynoszącej 30 percent wśród przypadków oznaczonych, a dla żadnej z tych prac nie istnieje ground truth. Autorzy mówią wprost: wyniki detekcji są użytecznymi wstępnymi sygnałami i nigdy nie powinny być jedynym dowodem w decyzjach o wysokiej stawce. Student stojący wobec oskarżenia nadal potrzebuje proceduralnych sposobów wykazania autorstwa, niezależnie od tego, który detektor wygenerował liczbę.
Humanizuj własną pracę
Przekształć tekst wspomagany przez AI i spraw, by brzmiał naturalnie, bez naruszania ważnych słów ani cytowań.
Cennik i dostęp
Strona Pangram oferuje 20 darmowych sprawdzeń dziennie po założeniu konta, a płatne subskrypcje zwiększają liczbę kredytów i dodają funkcje takie jak wykrywanie plagiatu. Ten model dostępu ma znaczenie równie duże jak liczby dotyczące dokładności: w przeciwieństwie do Turnitin, z którym autor styka się dopiero wtedy, gdy instytucja uruchamia go przeciwko niemu, Pangram można sprawdzić bezpośrednio, więc autor może zobaczyć ten sam rodzaj sygnału, jaki recenzent mógłby zobaczyć przed złożeniem czegokolwiek.
Gdzie Pangram mieści się w krajobrazie detektorów
Podsumowanie dziedziny przygotowane przez autorów VUB jest jednoznaczne: "Spośród czterech badanych tutaj narzędzi do wykrywania AI, w tej chwili tylko jedno uzyskało zadowalające wyniki." To zdanie mówi równie wiele o obecnych liderach rynku, jak i o Pangram. Turnitin, narzędzie, na którym większość instytucji rzeczywiście polega, uzyskało dla w pełni wygenerowanego przez AI zbioru wynik zero, a jego osobno udokumentowany poziom false positive już zmusił uniwersytety do ostrożnego traktowania jego wyników. Wszystkie te narzędzia mierzą statystyczne właściwości tekstu, a mechanizmy leżące u podstaw wyjaśniają zarówno to, dlaczego nowsze podejście treningowe Pangram może wysunąć się na prowadzenie, jak i to, dlaczego każde z nich pozostaje probabilistyczne.
Uczciwy werdykt: Pangram jest obecnie najlepiej wspieranym detektorem w niezależnych testach, i to z dużą przewagą, na podstawie najnowszych dowodów. Te dowody są jednak również ograniczone. Dwa badania, jedno recenzowane, drugie nie, oba z ostatniego roku, głównie po angielsku, głównie długie teksty akademickie i internetowe. Wykrywanie to wyścig zbrojeń z modelami, które zmieniają się co kwartał, a narzędzie, które prowadzi w 2026, utrzymuje tę przewagę tylko do następnej generacji tekstu. Wynik Pangram jest lepiej skalibrowanym oszacowaniem niż to, co produkują jego rywale. Nadal jest to oszacowanie, a nie dowód tego, co zrobiła konkretna osoba.
Zobacz pełne porównanie
Pangram jest jednym z narzędzi na zatłoczonym, nierównym rynku. Aby zobaczyć, jak wypada na tle Turnitin, GPTZero, Copyleaks, ZeroGPT i pozostałych według tych samych kryteriów, zobacz pełny przewodnik AI detectors compared.
Co wykazały nasze własne badania
W badaniu zgodności detektorów TextPulse Research dziewięć komercyjnych detektorów AI oceniło te same 90 tekstów akademickich. Jednym z nich był hybrydowy tekst o długości 455 słów: napisany przez człowieka wstęp i zakończenie wokół środkowej części 168 słów wygenerowanej przez AI. Pangram ocenił ten tekst na 34% AI, podczas gdy werdykty pozostałych narzędzi dla tych samych słów wahały się od 0% do 95.7% AI. Pełny artykuł, korpus i macierz wyników wszystkich narzędzi są otwarcie dostępne na TextPulse Research.

Najczęściej zadawane pytania
Własne twierdzenia Pangram to 99.98 percent dokładności i wskaźnik fałszywych trafień na poziomie około 1 na 10,000, mierzony na wewnętrznych benchmarkach. Niezwykle jak na tę branżę, najnowsze niezależne badania wskazują w tym samym kierunku: recenzowane badanie z czerwca 2026 roku z Vrije Universiteit Brussel wykazało, że było to jedyne z czterech narzędzi, które wiarygodnie wykrywało w pełni AI generated oraz zhumanizowane prace magisterskie, a working paper Chicago Booth wykazał wskaźnik fałszywych trafień bliski zeru w swoim korpusie. Niezależne dowody są mocne, ale świeże i ograniczone zakresem.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.