Αξιολόγηση του Pangram AI Detector: Το εργαλείο που οι ερευνητές συνεχίζουν να επικυρώνουν
Το Pangram δημοσιεύει ποσοστό ψευδώς θετικών περίπου 1 στις 10,000, και, σε αντίθεση με τους περισσότερους προμηθευτές ανιχνευτών, διαθέτει πλέον πρόσφατη ανεξάρτητη έρευνα που κινείται προς την ίδια κατεύθυνση. Μια αξιολογημένη από ομοτίμους μελέτη του 2026 από το Vrije Universiteit Brussel διαπίστωσε ότι ήταν το μόνο από τα τέσσερα εργαλεία που παρήγαγε ικανοποιητικά αποτελέσματα σε εργασίες επιπέδου μεταπτυχιακού. Εδώ εξετάζονται τι μέτρησαν οι μελέτες, πού τα στοιχεία παραμένουν ακόμη περιορισμένα και τι δεν μπορεί να αποδείξει καμία βαθμολογία ανιχνευτή.
Pangram είναι ο ανιχνευτής AI που οι ανεξάρτητοι ερευνητές συνεχώς ξεχωρίζουν, γεγονός που τον καθιστά άξιο μιας πιο προσεκτικής εξέτασης από το συνηθισμένο πίνακα αξιολόγησης προμηθευτών. Η εταιρεία του, Pangram Labs, δημοσιεύει ποσοστό ψευδώς θετικών περίπου 1 στις 10,000 και συνολική ακρίβεια 99.98 percent. Αυτοί είναι οι δικοί της αριθμοί, μετρημένοι στα δικά της benchmarks. Αυτό που διακρίνει το Pangram από το μεγαλύτερο μέρος του πεδίου είναι ότι, για μία φορά, πρόσφατη εξωτερική έρευνα δείχνει προς την ίδια γενική κατεύθυνση.
Δύο ανεξάρτητες αξιολογήσεις δημοσιεύτηκαν μέσα στον τελευταίο χρόνο, μια αξιολογημένη από ομοτίμους μελέτη από το Vrije Universiteit Brussel, που δημοσιεύθηκε από το Springer τον June 2026, και ένα working paper του University of Chicago Booth School που καλύφθηκε στο Chicago Booth Review τον December 2025. Και οι δύο τοποθέτησαν το Pangram σαφώς μπροστά από πιο γνωστούς ανταγωνιστές, συμπεριλαμβανομένων των Turnitin, GPTZero και Copyleaks. Καμία από τις δύο μελέτες δεν παρουσιάζει τη βαθμολογία οποιουδήποτε ανιχνευτή ως απόδειξη για οτιδήποτε σχετικά με ένα συγκεκριμένο έγγραφο, και και οι δύο το δηλώνουν αυτό.
Ακολουθούν όσα ισχυρίζεται το Pangram για τον εαυτό του, τι μέτρησαν πραγματικά οι δύο μελέτες, πού τα στοιχεία παραμένουν ακόμη αδύναμα και τι λέει η άνοδος αυτού του εργαλείου για το υπόλοιπο πεδίο της ανίχνευσης.
Τι Είναι το Pangram και Ποιοι Το Χρησιμοποιούν
Η Pangram Labs είναι μια μικρή εταιρεία που ιδρύθηκε το 2023 στο Brooklyn από ερευνητές AI που εργάστηκαν προηγουμένως στην Tesla και τη Google. Το προϊόν ελέγχει κείμενο που έχει επικολληθεί ή μεταφορτωθεί και επιστρέφει μια εκτίμηση για το πόσο από αυτό έχει παραχθεί από AI, με επισήμανση σε επίπεδο πρότασης, καθώς και ανίχνευση εικόνων και έλεγχο λογοκλοπής στα επί πληρωμή πακέτα.
Η βάση χρηστών του μοιάζει διαφορετική από εκείνη του Turnitin. Το Turnitin πωλείται σε ιδρύματα και λειτουργεί μέσα σε learning management systems, ενώ το Pangram μπορεί να χρησιμοποιηθεί από οποιονδήποτε διαθέτει δωρεάν λογαριασμό, πράγμα που σημαίνει ότι φοιτητές, επιμελητές, προσωπικό περιοδικών και αξιολογητές εισαγωγών το χρησιμοποιούν απευθείας. Είναι ο νεοεισερχόμενος σε αυτή την αγορά και, ολοένα και περισσότερο, το εργαλείο στο οποίο καταφεύγουν οι ερευνητές ακαδημαϊκής ακεραιότητας όταν θέλουν ένα σημείο σύγκρισης, ακριβώς επειδή συνεχίζει να αποδίδει σε δοκιμές όπου οι καθιερωμένοι παίκτες δεν το κάνουν.
Τι Ισχυρίζεται ο Προμηθευτής
Η αρχική σελίδα του Pangram διαφημίζει ακρίβεια 99.98 percent και δηλώνει ότι το ποσοστό ψευδώς θετικών, δηλαδή ο ρυθμός με τον οποίο ανθρώπινα έγγραφα επισημαίνονται εσφαλμένα ως AI, είναι επί του παρόντος 1 in 10,000. Μια ανάρτηση στο εταιρικό blog σχετικά με τα ψευδώς θετικά, γραμμένη από τον CTO της, αναλύει αυτό το συνολικό ποσοστό ανά είδος κειμένου, 0.004 percent σε ακαδημαϊκές εκθέσεις, 0.001 percent σε επιστημονικές περιλήψεις, με πιο αδύναμα σημεία που η ίδια η εταιρεία αποκαλύπτει, όπως 0.05 percent στην ποίηση και 0.23 percent στις συνταγές. Η εταιρεία ισχυρίζεται επίσης ότι το μοντέλο της εξακολουθεί να ανιχνεύει κείμενο AI αφού αυτό έχει υποστεί επεξεργασία από τα λεγόμενα εργαλεία humanizer.
Όλα αυτά είναι αριθμοί που αναφέρονται από την ίδια την εταιρεία, με βάση τα δικά της σύνολα δοκιμών, και η ίδια ανάρτηση περιλαμβάνει επίσης τις δικές της επιφυλάξεις, το μοντέλο λειτουργεί καλύτερα σε μεγαλύτερα κείμενα γραμμένα σε πλήρεις προτάσεις, και η εταιρεία συνιστά να μην γίνεται έλεγχος σύντομων λιστών με κουκκίδες ή ιδιαίτερα τυποποιημένου κειμένου. Κρατήστε και τις δύο πλευρές αυτού υπόψη. Οι ισχυρισμοί είναι ασυνήθιστα συγκεκριμένοι και ασυνήθιστα χαμηλοί, και παραμένουν ισχυρισμοί μέχρι να τους ελέγξει κάποιος εκτός της εταιρείας.

Τι δείχνουν τα ανεξάρτητα στοιχεία
Η ισχυρότερη μέχρι σήμερα δοκιμή είναι μια αξιολογημένη από ομοτίμους μελέτη των Van Vlasselaer, Van Droogenbroeck και Spruyt στο Vrije Universiteit Brussel, που δημοσιεύθηκε τον Ιούνιο του 2026 στο International Journal for Educational Integrity. Η ομάδα δημιούργησε 160 ακαδημαϊκές εργασίες επιπέδου μεταπτυχιακού, καθεμία τουλάχιστον 4.000 λέξεων, 40 γραμμένες από πραγματικούς φοιτητές πριν από το 2019, 40 πλήρως παραγόμενες με GPT-4o Deep Research, 40 υβριδικές και 40 παραγόμενες από AI και στη συνέχεια σκόπιμα εξανθρωπισμένες. Τις πέρασαν όλες από Turnitin, GPTZero, Copyleaks και Pangram.
Στις πλήρως παραγόμενες από AI εργασίες, η μελέτη αναφέρει ότι τα Turnitin, GPTZero και Copyleaks "completely failed to detect the AI-generated content." Το Turnitin έδωσε σε καθεμία από αυτές τις 40 εργασίες βαθμολογία μεταξύ 0 και 20 percent AI, ενώ οι διάμεσες βαθμολογίες και των τριών καθιερωμένων εργαλείων παρέμειναν κάτω από 20 percent σε εργασίες που ήταν 100 percent γραμμένες από μηχανή. Το Pangram πέτυχε strict accuracy 65 percent και inclusive accuracy 97.5 percent στο ίδιο σύνολο, ταξινομώντας λανθασμένα μία εργασία. Στο σύνολο των εξανθρωπισμένων εργασιών, το Pangram αναγνώρισε σωστά το περιεχόμενο AI σε 37 από 40 περιπτώσεις, με strict accuracy 92.5 percent, ενώ το GPTZero πέτυχε 2.5 percent, το Copyleaks 22.5 percent και το Turnitin 50 percent.
| Εργαλείο | Πλήρως AI εργασίες (strict accuracy) | Εξανθρωπισμένες AI εργασίες (strict accuracy) | Ανθρώπινες εργασίες που απορρίφθηκαν σωστά |
|---|---|---|---|
| Pangram | 65% | 92.5% | 100% |
| Turnitin | 0% | 50% | 100% |
| GPTZero | 0% | 2.5% | 100% |
| Copyleaks | 0% | 22.5% | 100% |
Το δεύτερο σημείο δεδομένων είναι μια working paper των Brian Jabarian και Alex Imas στο Chicago Booth, η οποία συνοψίστηκε στο Chicago Booth Review τον Δεκέμβριο του 2025. Εξετάζοντας ανιχνευτές σε περίπου 2,000 ανθρώπινα γραμμένα αποσπάσματα σε έξι μέσα, καθώς και εκδοχές AI από τέσσερα frontier models, διαπίστωσαν ότι το ποσοστό ψευδώς θετικών του Pangram ήταν ουσιαστικά μηδενικό στα περισσότερα όρια απόφασης, με ακρίβεια που δεν έπεσε ποτέ κάτω από 99.8 percent στο corpus τους και ψευδώς αρνητικά μεταξύ 2 και 4 percent ανάλογα με το model. Οι ερευνητές προτείνουν ότι τα ιδρύματα θα πρέπει να υιοθετήσουν ένα αυστηρό ανώτατο όριο πολιτικής, για παράδειγμα να επισημαίνεται όχι περισσότερο από 0.5 percent της ανθρώπινης γραφής, πριν εμπιστευθούν λειτουργικά οποιονδήποτε ανιχνευτή. Σημειώστε τη διαφορά ως προς το status, η Booth paper είναι working paper, δεν έχει ακόμη υποβληθεί σε peer review, και δοκίμασε αμετάβλητο AI text αντί για ακαδημαϊκές εργασίες που είχαν εξανθρωπιστεί.
Ψευδώς θετικά και ποιοι ζημιώνονται
Τα ψευδώς θετικά είναι το σημείο όπου συγκεντρώνεται η ζημία από τους ανιχνευτές, και το μοτίβο που τεκμηριώνεται σε ολόκληρο αυτόν τον κλάδο είναι ότι οι επισημάνσεις πλήττουν δυσανάλογα τους μη φυσικούς ομιλητές της αγγλικής. Η μελέτη του VUB αξίζει να διαβαστεί ακριβώς ως προς αυτό το σημείο, τα 40 ανθρώπινα γραπτά της ήταν όλα γραμμένα από μη φυσικούς ομιλητές της αγγλικής, και και τα τέσσερα εργαλεία, συμπεριλαμβανομένου του Pangram, τα πέρασαν όλα σε ποσοστό 100 percent. Αυτό είναι πράγματι ένα ενθαρρυντικό αποτέλεσμα, και είναι επίσης 40 εργασίες. Ένα δείγμα αυτού του μεγέθους δεν μπορεί να επιβεβαιώσει έναν ρυθμό όπως 0.004 percent, μόνο οι πολύ μεγαλύτερες εσωτερικές δοκιμές του ίδιου του προμηθευτή παράγουν τόσο λεπτομερείς αριθμούς, και κανένα εξωτερικό μέρος δεν τους έχει αναπαράγει σε τέτοια κλίμακα.
Το πραγματικό τμήμα της μελέτης δείχνει γιατί η επιφύλαξη επιβιώνει ακόμη και όταν υπάρχουν καλοί δείκτες αναφοράς. Όταν οι ερευνητές έτρεξαν το Pangram σε 1,163 πραγματικές μεταπτυχιακές διατριβές από το 2024 και το 2025, αυτό επισήμανε το 45.5 percent αυτών σε κάποιο επίπεδο, με διάμεση εκτιμώμενη μερίδα AI 30 percent μεταξύ των περιπτώσεων που επισημάνθηκαν, και δεν υπάρχει αληθινή τιμή αναφοράς για καμία από αυτές τις διατριβές. Οι συγγραφείς είναι σαφείς: οι βαθμολογίες ανίχνευσης είναι χρήσιμες αρχικές ενδείξεις και δεν πρέπει ποτέ να αποτελούν τη μοναδική απόδειξη σε αποφάσεις υψηλού διακυβεύματος. Ένας φοιτητής που αντιμετωπίζει μια κατηγορία εξακολουθεί να χρειάζεται διαδικαστικούς τρόπους για να αποδείξει τη συγγραφική του ιδιότητα, ανεξάρτητα από το ποιος ανιχνευτής παρήγαγε τον αριθμό.
Ανθρωποποιήστε τη δική σας εργασία
Μετασχηματίστε το κείμενό σας με τη βοήθεια AI και κάντε το να ακούγεται ανθρώπινο, χωρίς να αγγίξετε σημαντικές λέξεις ή παραπομπές.
Τιμολόγηση και Πρόσβαση
Ο ιστότοπος του Pangram προσφέρει 20 δωρεάν ελέγχους την ημέρα μετά την εγγραφή για λογαριασμό, ενώ οι επί πληρωμή συνδρομές προσθέτουν όγκο πιστώσεων και λειτουργίες όπως ανίχνευση λογοκλοπής. Αυτό το μοντέλο πρόσβασης έχει τόση σημασία όσο και οι αριθμοί ακρίβειας, σε αντίθεση με το Turnitin, το οποίο ένας συγγραφέας συναντά μόνο όταν ένας θεσμός το χρησιμοποιεί εναντίον του, το Pangram μπορεί να ελεγχθεί απευθείας, έτσι ώστε ένας συγγραφέας να μπορεί να δει την ίδια κατηγορία σήματος που θα μπορούσε να δει ένας αξιολογητής πριν υποβληθεί οτιδήποτε.
Πού εντάσσεται το Pangram στο τοπίο των ανιχνευτών
Η σύνοψη των συγγραφέων του VUB για το πεδίο είναι κατηγορηματική: "From the four AI detection tools studied here, at this moment only one produced satisfactory results." Αυτή η πρόταση λέει πολλά τόσο για τους καθιερωμένους παίκτες όσο και για το Pangram. Το Turnitin, το εργαλείο στο οποίο βασίζονται στην πράξη οι περισσότεροι θεσμοί, βαθμολογήθηκε με μηδέν στο πλήρως AI generated σύνολο, και το ξεχωριστά τεκμηριωμένο ιστορικό ψευδώς θετικών αποτελεσμάτων του έχει ήδη αναγκάσει τα πανεπιστήμια να αντιμετωπίζουν τις βαθμολογίες του με προσοχή. Όλα αυτά τα εργαλεία μετρούν στατιστικές ιδιότητες του κειμένου, και οι υποκείμενοι μηχανισμοί εξηγούν τόσο γιατί η νεότερη προσέγγιση εκπαίδευσης του Pangram μπορεί να υπερισχύσει όσο και γιατί καθένα από αυτά παραμένει πιθανοκρατικό.
Η ειλικρινής εκτίμηση: το Pangram είναι επί του παρόντος ο ανιχνευτής με την καλύτερη υποστήριξη σε ανεξάρτητες δοκιμές, με μεγάλη διαφορά, με βάση πρόσφατα στοιχεία. Αυτά τα στοιχεία είναι επίσης περιορισμένα. Δύο μελέτες, η μία με αξιολόγηση από ομοτίμους, η άλλη όχι, και οι δύο από τον τελευταίο χρόνο, κυρίως στα αγγλικά, κυρίως ακαδημαϊκά κείμενα και κείμενα του ιστού μεγάλης έκτασης. Η ανίχνευση είναι μια κούρσα εξοπλισμών απέναντι σε μοντέλα που αλλάζουν ανά τρίμηνο, και ένα εργαλείο που προηγείται το 2026 διατηρεί αυτό το προβάδισμα μόνο μέχρι την επόμενη γενιά κειμένου. Μια βαθμολογία Pangram είναι μια καλύτερα βαθμονομημένη εκτίμηση από ό,τι παράγουν οι ανταγωνιστές του. Παραμένει όμως εκτίμηση, όχι απόδειξη για το τι έκανε οποιοδήποτε συγκεκριμένο άτομο.
Δείτε την Πλήρη Σύγκριση
Το Pangram είναι ένα εργαλείο σε ένα πολυσύχναστο, ανομοιογενές πεδίο. Για το πώς συγκρίνεται με τα Turnitin, GPTZero, Copyleaks, ZeroGPT και τα υπόλοιπα με τα ίδια κριτήρια, δείτε τον πλήρη οδηγό σύγκριση ανιχνευτών AI.
Τι έδειξε η δική μας έρευνα
Στη μελέτη συμφωνίας ανιχνευτών της TextPulse Research, εννέα εμπορικοί ανιχνευτές AI βαθμολόγησαν τα ίδια 90 ακαδημαϊκά κείμενα. Ένα από αυτά ήταν ένα υβριδικό κείμενο 455 λέξεων: ανθρώπινη αρχή και κατακλείδα γύρω από ένα μεσαίο τμήμα 168 λέξεων γραμμένο από AI. Το Pangram βαθμολόγησε αυτό το κείμενο με 34% AI, ενώ οι ετυμηγορίες των υπόλοιπων εργαλείων για τις ίδιες λέξεις κυμάνθηκαν από 0% έως 95.7% AI. Η πλήρης εργασία, το σώμα κειμένων και ο πίνακας βαθμολογιών κάθε εργαλείου είναι ανοικτά διαθέσιμα στο TextPulse Research.

Συχνές ερωτήσεις
Οι ίδιες οι ισχυρισμοί του Pangram είναι 99.98 percent ακρίβεια και ποσοστό ψευδώς θετικών περίπου 1 στις 10,000, μετρημένα σε εσωτερικά benchmarks. Ασυνήθιστα για τον κλάδο αυτό, πρόσφατη ανεξάρτητη έρευνα δείχνει προς την ίδια κατεύθυνση, μια αξιολογημένη από ομοτίμους μελέτη του Ιουνίου 2026 από το Vrije Universiteit Brussel διαπίστωσε ότι ήταν το μόνο από τα τέσσερα εργαλεία που εντόπιζε αξιόπιστα πλήρως AI generated και humanized εργασίες επιπέδου μεταπτυχιακού, και ένα working paper του Chicago Booth βρήκε ποσοστό ψευδώς θετικών κοντά στο μηδέν στο corpus του. Τα ανεξάρτητα στοιχεία είναι ισχυρά, αλλά πρόσφατα και περιορισμένα ως προς το εύρος.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.