AI Detection

Γιατί οι ανιχνευτές AI είναι μεροληπτικοί απέναντι σε συγγραφείς που δεν είναι φυσικοί ομιλητές της αγγλικής

Μια μελέτη του Stanford το 2023 διαπίστωσε ότι οι ανιχνευτές AI παρερμήνευαν τη ρέουσα αγγλική γραφή μη φυσικών ομιλητών ως παραγόμενη από μηχανή με πολύ υψηλότερο ποσοστό από ό,τι τη γραφή φυσικών ομιλητών. Εδώ παρουσιάζεται ο μηχανισμός πίσω από αυτή τη διαφορά και τι συνέβη όταν τα ίδια δοκίμια ξαναγράφτηκαν με πλουσιότερο λεξιλόγιο.

Ενημερώθηκε στις 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

Οι ανιχνευτές AI που παρουσιάζουν μεροληψία εις βάρος μη φυσικών ομιλητών δεν αποτελούν υποκειμενικό παράπονο. Μια μελέτη του Stanford του 2023, αξιολογημένη από ομοτίμους, το μέτρησε άμεσα. Οι ερευνητές δοκίμασαν επτά ευρέως χρησιμοποιούμενους ανιχνευτές GPT σε 91 πραγματικές εκθέσεις TOEFL γραμμένες από μη φυσικούς ομιλητές της αγγλικής και σε 88 εκθέσεις γραμμένες από Αμερικανούς μαθητές της όγδοης τάξης, και στη συνέχεια συνέκριναν τον τρόπο με τον οποίο βαθμολογήθηκε κάθε ομάδα.

Οι ανιχνευτές διάβασαν τις εκθέσεις της όγδοης τάξης σωστά σχεδόν κάθε φορά. Στις εκθέσεις TOEFL, γραμμένες από ενήλικες που είχαν ήδη περάσει εξέταση επάρκειας αγγλικής γλώσσας επιπέδου μεταπτυχιακών σπουδών, τα ίδια επτά εργαλεία έδωσαν μέσο ποσοστό ψευδώς θετικών αποτελεσμάτων 61.22 percent. Ογδόντα εννέα από τις ενενήντα μία εκθέσεις, σχεδόν 98 percent, επισημάνθηκαν ως παραγόμενες από AI από τουλάχιστον ένα από τα επτά εργαλεία.

Η επισκόπηση του TextPulse για τα ευρύτερα τεκμήρια σχετικά με την ακρίβεια των ανιχνευτών AI καλύπτει αυτό το βασικό εύρημα και τις αγωγές στις οποίες έχει έκτοτε συμβάλει. Αυτό που παραλείπεται σχεδόν παντού όπου παρατίθεται η μελέτη είναι ο μηχανισμός, γιατί η πρόζα ενός ομιλητή αγγλικών επιπέδου μεταπτυχιακών σπουδών διαβάζεται εξαρχής ως κατασκευασμένη από μηχανή, και τι αλλάζει όταν παύει να διαβάζεται έτσι.

Οι ανιχνευτές AI που παρουσιάζουν μεροληψία εις βάρος μη φυσικών ομιλητών, ο μηχανισμός

Ένας ανιχνευτής δεν διαβάζει ποτέ για το νόημα. Διαβάζει για το πόσο προβλέψιμη είναι κάθε λέξη, δεδομένων των λέξεων που προηγήθηκαν, και βαθμολογεί ένα απόσπασμα χαμηλά όταν το μοντέλο θα μπορούσε να είχε μαντέψει το μεγαλύτερο μέρος του εκ των προτέρων. Η λεξιλογική ποικιλία, δηλαδή πόσο ευρύ λεξιλόγιο αξιοποιεί ένας συγγραφέας αντί να επαναλαμβάνει ένα μικρότερο σύνολο ασφαλών λέξεων, και η συντακτική προβλεψιμότητα, δηλαδή πόσο στενά η δομή των προτάσεων ακολουθεί το πιο συνηθισμένο πρότυπο της γλώσσας αντί να το διαφοροποιεί, είναι δύο ιδιότητες της γλωσσικής παραγωγής που μειώνουν αυτή τη βαθμολογία.

Η διάκριση έχει σημασία, επειδή τα δύο εμφανίζονται διαφορετικά στη σελίδα. Η λεξική ποικιλία αφορά τις ίδιες τις λέξεις, ένας συγγραφέας που επιλέγει τα 'obtain,' 'acquire,' και 'secure' σε τρεις διαφορετικές προτάσεις διαβάζεται ως πιο ποικίλος από έναν που γράφει 'get' τρεις φορές, ακόμη και όταν οι προτάσεις είναι κατά τα άλλα ταυτόσημες. Η συντακτική προβλεψιμότητα αφορά τη δομή, υποκείμενο, ρήμα, αντικείμενο, επαναλαμβανόμενα ξανά και ξανά, αντί για μια πρόταση που αρχίζει με δευτερεύουσα πρόταση ή τελειώνει με μια απροσδόκητη λέξη. Ένας συγγραφέας δεύτερης γλώσσας που εργάζεται υπό εξεταστικές συνθήκες έχει κάθε λόγο να καταφεύγει στην ασφαλέστερη εκδοχή και των δύο.

Η γραφή στη δεύτερη γλώσσα εμφανίζει σταθερά λιγότερα και από τα δύο, και όχι ως έλλειμμα. Ένας συγγραφέας που λειτουργεί σε μια πρόσθετη γλώσσα στηρίζεται στο λεξιλόγιο και στα μοτίβα προτάσεων που είναι πιθανότερο να είναι σωστά, επειδή η λανθασμένη εικασία κοστίζει περισσότερο όταν η γλώσσα δεν έχει ακόμη πλήρως αυτοματοποιηθεί. Η εργασία του Stanford που τεκμηρίωσε τη μεροληψία του ανιχνευτή παραπέμπει σε ένα σώμα ερευνών εφαρμοσμένης γλωσσολογίας ακριβώς για αυτό το μοτίβο, το οποίο είχε καθιερωθεί πολύ πριν υπάρξουν οι ανιχνευτές AI, η μειωμένη λεξική πλούσιανση, η μειωμένη λεξική ποικιλία και η απλούστερη δομή προτάσεων τεκμηριώνονται ως μετρήσιμα χαρακτηριστικά της γραφής στη δεύτερη γλώσσα, και όχι ως ένδειξη οτιδήποτε άλλου.

Αυτό το χάσμα ανάμεσα στη μητρική και στη μη μητρική γραφή εμφανίζεται ως διαφορά perplexity, η ίδια μέτρηση που εκτελεί ένας ανιχνευτής για να αποφασίσει αν ένα απόσπασμα δημιουργήθηκε από μηχανή. Η χαμηλότερη perplexity διαβάζεται ως πιο μηχανική, ανεξάρτητα από το ποιος την παρήγαγε, και η γραφή στη μη μητρική γλώσσα βρίσκεται χαμηλότερα σε αυτή την κλίμακα για λόγους που δεν έχουν καμία σχέση με ένα chatbot. Το αν αυτό το χάσμα είναι πράγματι εκείνο που οδηγεί τους ανιχνευτές, και όχι μια σύμπτωση, είναι ένα ερώτημα που μπορεί να ελεγχθεί. Η ομάδα του Stanford το εξέτασε άμεσα.

Τι συνέβη όταν τα ίδια δοκίμια ξαναγράφτηκαν με πλουσιότερο λεξιλόγιο

Οι ερευνητές πήραν τα ίδια 91 δοκίμια TOEFL που είχαν προκαλέσει μέσο ποσοστό ψευδώς θετικών 61.22 percent και ζήτησαν από το ChatGPT να τα αναθεωρήσει με μία μόνο οδηγία: "Enhance the word choices to sound more like that of a native speaker." Τίποτε ως προς το περιεχόμενο, το επιχείρημα ή τη γραμματική δεν ζητήθηκε να αλλάξει. Μετά από αυτή τη μία επεξεργασία, το μέσο ποσοστό ψευδώς θετικών στους ίδιους επτά ανιχνευτές έπεσε στο 11.77 percent, δηλαδή κατά σχεδόν πενήντα ποσοστιαίες μονάδες, και ο αριθμός των δοκιμίων που κάθε ανιχνευτής χαρακτήρισε ομόφωνα ως προβληματικά μειώθηκε από δεκαοκτώ σε ένα.

Στη συνέχεια οι ερευνητές έκαναν το πείραμα αντίστροφα. Πήραν τα 88 δοκίμια μαθητών της όγδοης τάξης, γραμμένα από φυσικούς ομιλητές, τα οποία οι ανιχνευτές είχαν αρχικά βαθμολογήσει σωστά σχεδόν κάθε φορά, και ζήτησαν από το ChatGPT να απλοποιήσει τις λεξιλογικές τους επιλογές σαν να είχαν γραφτεί από μη φυσικό ομιλητή. Το μέσο ποσοστό ψευδώς θετικών στα ίδια αυτά δοκίμια, γραμμένα από φυσικούς ομιλητές, εκτινάχθηκε από 5.19 percent σε 56.65 percent. Τα δοκίμια δεν άλλαξαν συγγραφέα. Μόνο το λεξιλόγιο άλλαξε, και οι ανιχνευτές ακολούθησαν το λεξιλόγιο.

Η perplexity μετακινήθηκε σε πλήρη αντιστοιχία με το ποσοστό εσφαλμένης ταξινόμησης και προς τις δύο κατευθύνσεις, αυξήθηκε απότομα όταν τα δοκίμια TOEFL εμπλουτίστηκαν και μειώθηκε απότομα όταν τα δοκίμια της όγδοης τάξης απλοποιήθηκαν. Οι συγγραφείς καταλήγουν σε ένα σαφές συμπέρασμα από αυτό, ότι σε ό,τι πραγματικά ανταποκρίνονταν οι ανιχνευτές δεν ήταν ποτέ η συγγραφή. Ήταν η επιλογή λέξεων, ένα χαρακτηριστικό που μπορεί να φέρει το λεξιλόγιο κάθε συγγραφέα, ανεξάρτητα από το πού έμαθε αγγλικά.

Πόσο συνεπής είναι η μεροληψία μεταξύ διαφορετικών ανιχνευτών

Οι επτά ανιχνευτές δεν συμφώνησαν σε πολλά, εκτός από την κατεύθυνση προς την οποία κινούνταν το σφάλμα. Καθένας από αυτούς χαρακτήρισε τα δοκίμια TOEFL ως προβληματικά πολύ συχνότερα από τα δοκίμια της όγδοης τάξης, αλλά με πολύ διαφορετικά περιθώρια.

ΑνιχνευτήςΠοσοστό ψευδώς θετικών, εκθέσεις TOEFLΠοσοστό ψευδώς θετικών, εκθέσεις φυσικών ομιλητών
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
ανιχνευτής του OpenAI58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Αυτά είναι στοιχεία του 2023, μετρημένα σε εργαλεία όπως υπήρχαν τότε. Έκτοτε αρκετά έχουν αλλάξει πλήρως: το OpenAI έκλεισε τον δικό του ανιχνευτή τον Ιούλιο του 2023, τέσσερις μήνες μετά από αυτή τη δοκιμή, αφού διαπίστωσε ότι εντόπιζε σωστά μόνο το 26 percent του πραγματικού κειμένου που είχε γραφτεί από AI, ενώ εξακολουθούσε να χαρακτηρίζει λανθασμένα το 9 percent της ανθρώπινης γραφής. Αυτό που δεν έχει αλλάξει είναι η κατεύθυνση της απόκλισης. Ένα ευρύτερο σημείο αναφοράς μεροληψίας, κατασκευασμένο ειδικά για να δοκιμάζει ανιχνευτές σε δημογραφικές και γλωσσικές κατηγορίες, το οποίο δημοσιεύθηκε τον Δεκέμβριο του 2025 και εφαρμόστηκε σε τέσσερα νεότερα εργαλεία ανοικτού κώδικα, εξακολουθούσε να αναφέρει σταθερά χαμηλότερη ανάκληση για ομάδες συγγραφέων που υποεκπροσωπούνται.

Ανθρωποποιήστε τη δική σας εργασία

Μετασχηματίστε το κείμενό σας με τη βοήθεια AI και κάντε το να ακούγεται ανθρώπινο, χωρίς να αγγίξετε σημαντικές λέξεις ή παραπομπές.

Ξεκινήστε δωρεάν

Εμφανίζεται ακόμη αυτή η μεροληψία σε νεότερους ανιχνευτές;

Η μελέτη του Stanford είναι πλέον αρκετές γενιές AI παλιά, και οι ίδιοι οι συγγραφείς της ανέφεραν τον περιορισμό: ένα μικρό πιλοτικό δείγμα, και ανιχνευτές που βασίζονταν κυρίως στο GPT-2, ένα πολύ μικρότερο και παλαιότερο μοντέλο από εκείνο που τροφοδοτεί την ανίχνευση σήμερα. Αυτό θέτει ένα εύλογο ερώτημα. Έχει η καλύτερη τεχνολογία κλείσει το χάσμα;

Η πιο πρόσφατη ειδική δοκιμή λέει όχι ακόμη. Σε μια μελέτη του Φεβρουαρίου 2026 από το Sultan Qaboos University, οι ερευνητές δοκίμασαν δύο τρέχοντες εμπορικούς ανιχνευτές, Turnitin και Originality, απέναντι σε 192 κείμενα που συνδύαζαν αυθεντική προ του ChatGPT γραφή φοιτητών EFL, επαγγελματική ανθρώπινη γραφή, κείμενο παραγόμενο από AI και υβριδικό ανθρώπινο AI κείμενο. Τα αποτελέσματα έδειξαν συνολική ακρίβεια 69 percent και 61 percent για τα δύο εργαλεία, ενώ η ακρίβεια στην υβριδική κατηγορία, το είδος γραφής που στην πραγματικότητα παράγει μια επιμέλεια, έπεσε κοντά στο μηδέν. Η ίδια μελέτη αποκάλυψε επίσης μια δεύτερη μεροληψία που λειτουργεί παράλληλα με τη γλωσσική, η ακρίβεια στην επιστημονική γραφή ήταν 28 to 38 ποσοστιαίες μονάδες χαμηλότερη από ό,τι στην ανθρωπιστική γραφή.

Κανένα από τα δύο ευρήματα δεν αφορά ένα μόνο ελαττωματικό προϊόν. Δύο διαφορετικές αρχιτεκτονικές ανιχνευτών, που δοκιμάστηκαν με διαφορά τριών ετών σε διαφορετικά σώματα κειμένων από διαφορετικές ερευνητικές ομάδες, καταλήγουν στο ίδιο αποτέλεσμα, η γραφή που διαμορφώνεται από τις συμβάσεις του είδους ή από μια δεύτερη γλώσσα βρίσκεται πιο κοντά σε αυτό που αυτά τα εργαλεία αποκαλούν κατασκευασμένο από μηχανή από ό,τι η γραφή που δεν είναι ούτε το ένα ούτε το άλλο. TextPulse's free tools επιτρέπουν σε έναν συγγραφέα να ελέγξει αυτό το ίδιο στατιστικό προφίλ πριν από το να φτάσει οτιδήποτε σε ανιχνευτή ενός ιδρύματος.

Ανεξάρτητη Τεκμηρίωση ότι το Χάσμα Είναι Πραγματικό, Όχι Τεχνούργημα της Δοκιμής

Το πρώτο πρόβλημα με τα αποτελέσματα του TOEFL είναι ότι θα μπορούσε να υποστηριχθεί πως ισχύουν μόνο για μια μικρή πιλοτική μελέτη του 2023. Σε αυτό απάντησε η ίδια ερευνητική ομάδα σε άλλη μελέτη που χρησιμοποίησε δεδομένα τα οποία δεν έχουν καμία σχέση με ανιχνευτές. Εξέτασαν 1,574 εργασίες που έγιναν δεκτές στο ICLR 2023, ένα σημαντικό συνέδριο μηχανικής μάθησης, περιορίζοντας το δείγμα σε περιλήψεις που υποβλήθηκαν και αξιολογήθηκαν πριν υπάρξει το ChatGPT.

Οι συγγραφείς που εδρεύουν σε χώρες όπου τα αγγλικά δεν είναι η κύρια γλώσσα έγραψαν περιλήψεις με σημαντικά χαμηλότερη perplexity από συγγραφείς που εδρεύουν σε χώρες όπου τα αγγλικά είναι η μητρική γλώσσα, και η διαφορά παρέμεινε ακόμη και μετά τον έλεγχο για το πόσο υψηλά αξιολογήθηκε κάθε άρθρο από τους κριτές. Αυτό το δείγμα δεν θα μπορούσε να έχει διαμορφωθεί από κανέναν που προσπαθούσε να ακούγεται περισσότερο ή λιγότερο σαν chatbot. Το ChatGPT απείχε τρεις μήνες από την κυκλοφορία του όταν έκλεισε η περίοδος υποβολών. Το χάσμα perplexity μεταξύ ακαδημαϊκής γραφής από φυσικούς και μη φυσικούς ομιλητές των αγγλικών δεν είναι κάτι που επινόησαν οι ανιχνευτές. Είναι κάτι που κληρονόμησαν.

Μια στατιστική ανάλυση του 2026 για την ανίχνευση AI ως πρόβλημα ελέγχου προσφέρει μια τυπική εκδοχή του ίδιου συμπεράσματος. Κάθε φορά που μια ομάδα συγγραφέων παράγει γλώσσα που επικαλύπτεται, συνολικά, με το τυπικό αποτέλεσμα του AI, κάθε ανιχνευτής με πραγματική ισχύ να εντοπίζει κείμενο γραμμένο από AI πρέπει να φέρει υψηλότερο ποσοστό ψευδώς θετικών για τη συγκεκριμένη ομάδα, μια μαθηματική ιδιότητα της δοκιμής ενός ποικιλόμορφου πληθυσμού και όχι ελάττωμα σε οποιοδήποτε μεμονωμένο εργαλείο. Οι συγγραφείς αγγλικών ως μητρικής γλώσσας που δεν είναι φυσικοί ομιλητές αποτελούν την πιο σαφή τεκμηριωμένη περίπτωση ακριβώς αυτής της επικάλυψης.

Τι σημαίνει αυτό για συγγραφείς σε δεύτερη γλώσσα

Τίποτε από αυτά δεν αποτελεί επιχείρημα υπέρ του να γράφετε λιγότερο σαν τον εαυτό σας. Είναι λόγος να γνωρίζετε τι ακριβώς μετριέται πριν εμφανιστεί μια βαθμολογία. Ένας ανιχνευτής που διαβάζει την πρόζα σας ως προβλέψιμη εντοπίζει μια πραγματική στατιστική ιδιότητα της γραφής σε δεύτερη γλώσσα, όχι απόδειξη ότι χρησιμοποιήσατε ένα εργαλείο που δεν χρησιμοποιήσατε.

Οι ερευνητές του Stanford που διεξήγαγαν την αρχική μελέτη επισημαίνουν μια δυσάρεστη συνέπεια του ίδιου τους του ευρήματος, η ίδια προσαρμογή λεξιλογίου που μειώνει τον κίνδυνο ψευδώς θετικών είναι επίσης το είδος αναθεώρησης που ένας συγγραφέας ίσως να επιθυμεί για εντελώς διαφορετικούς λόγους, πιο σαφή διατύπωση, μια πιο ακριβή λέξη, ανεξάρτητα από οποιονδήποτε ανιχνευτή. Η σελίδα του TextPulse για ακαδημαϊκούς συγγραφείς ESL καλύπτει πώς μοιάζει αυτό το είδος αναθεώρησης σε πραγματικές προτάσεις, ανεξάρτητα από οτιδήποτε σχετίζεται με μια βαθμολογία ανίχνευσης.

Οι νεότεροι ανιχνευτές αρχίζουν να λαμβάνουν ρητά υπόψη αυτό το μοτίβο. Το Pangram, ένας από τους πιο πρόσφατους εμπορικούς νεοεισερχόμενους, αναφέρει στη δική του τεχνική τεκμηρίωση ότι ο ταξινομητής του δεν παρουσιάζει μεροληψία εις βάρος συγγραφέων που δεν έχουν τα αγγλικά ως μητρική γλώσσα, αν και ο ισχυρισμός αυτός προέρχεται από τον προμηθευτή και όχι από ανεξάρτητη δοκιμή. Ένας δωρεάν ελεγκτής perplexity δείχνει την ίδια υποκείμενη μέτρηση που υπολογίζουν όλα αυτά τα εργαλεία από ένα κείμενο, χωρίς να αποστέλλει πρώτα το προσχέδιο οπουδήποτε.

Δύο πρακτικά συνοδευτικά εργαλεία βρίσκονται στο ίδιο σύνολο, το πότε να χρησιμοποιείτε το a, το an και το the, που αποτελεί τη συχνότερη μεμονωμένη πηγή του μοτίβου, και το πώς να ακούγεστε φυσικοί στη ακαδημαϊκή γραφή στα αγγλικά γενικότερα.

Η έρευνα συνεχίζει να συσσωρεύεται προς την ίδια κατεύθυνση δύο χρόνια μετά, σε διαφορετικές ομάδες, διαφορετικούς ανιχνευτές και διαφορετικούς σχεδιασμούς δοκιμών. Αυτό που δεν έχει συμβαδίσει είναι μια ευρέως υιοθετημένη θεσμική απάντηση, η διεξαγωγή ελέγχου ενός ανιχνευτή απέναντι σε ένα εύρος συγγραφέων πριν τον εμπιστευθούν για οποιονδήποτε από αυτούς, αντί αφού ένας συγκεκριμένος φοιτητής έχει ήδη κατηγορηθεί. Μέχρι αυτό να γίνει ρουτίνα, το βάρος της απόδειξης ότι μια ψευδής ένδειξη είναι λανθασμένη πέφτει ακριβώς σε εκείνους τους συγγραφείς για τους οποίους η έρευνα αυτή λέει ότι είναι πιο πιθανό να λάβουν μία.

XLinkedInFacebook

Συχνές ερωτήσεις

Το ότι οι ανιχνευτές AI είναι μεροληπτικοί απέναντι σε μη φυσικούς ομιλητές είναι εύρημα αξιολογημένο από ομοτίμους, όχι εικασία. Μια μελέτη του Stanford το 2023 διαπίστωσε ότι επτά ευρέως χρησιμοποιούμενοι ανιχνευτές GPT ταξινόμησαν εσφαλμένα κατά μέσο όρο το 61.22 percent των πραγματικών δοκιμίων TOEFL ως παραγόμενα από AI, ενώ αναγνώριζαν σωστά τα δοκίμια φυσικών ομιλητών σχεδόν κάθε φορά.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Μείνετε ενημερωμένοι για την εξανθρωποποίηση AI

Λάβετε συμβουλές για ακαδημαϊκή γραφή, ανίχνευση AI και εξανθρωποποίηση, απευθείας στο email σας.

Χωρίς ανεπιθύμητα μηνύματα. Κατάργηση εγγραφής οποιαδήποτε στιγμή.