AI Detection

Είναι ακριβείς οι ανιχνευτές AI; Ψευδώς θετικά και μεροληψία

Οι προμηθευτές δημοσιεύουν ποσοστά ψευδώς θετικών κάτω από 1 τοις εκατό. Ανεξάρτητοι ερευνητές που δοκίμασαν τους ίδιους ανιχνευτές σε γραφή μη φυσικών ομιλητών της αγγλικής βρήκαν ποσοστά πάνω από 60 τοις εκατό. Να τι δείχνουν τα στοιχεία.

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Το Turnitin ισχυρίζεται ότι το ποσοστό ψευδώς θετικών αποτελεσμάτων του είναι μικρότερο από 1%. Μια ομάδα ανεξάρτητων ερευνητών δοκίμασε πολλαπλούς ανιχνευτές σε ένα ευρύτερο φάσμα δειγμάτων γραφής από ομιλητές που δεν έχουν τα αγγλικά ως μητρική γλώσσα. Διαπίστωσαν ότι ο μέσος όρος του ποσοστού ψευδώς θετικών αποτελεσμάτων ήταν πάνω από 60% στο ίδιο είδος γραφής. Και οι δύο αριθμοί είναι πραγματικοί, και οι δύο δημοσιεύτηκαν, και οι δύο αφορούν ανιχνευτές που πωλούνται στην ίδια αγορά. Είναι ακριβείς οι ανιχνευτές AI; Εξαρτάται από τον πληθυσμό που δοκιμάσατε, από τον ανιχνευτή που χρησιμοποιήσατε και από τον τρόπο με τον οποίο ο προμηθευτής σας τον όρισε εξαρχής.

Αυτή η ανάρτηση δεν θα εξηγήσει εκ νέου πώς ένας ανιχνευτής υπολογίζει αυτή τη βαθμολογία. Ο μηχανισμός, η perplexity, η πιθανότητα των token, ο τρόπος με τον οποίο εκπαιδεύεται ο ταξινομητής, καλύπτονται λεπτομερώς αλλού, και αξίζει να το διαβάσετε πρώτα, αν δεν το έχετε ήδη κάνει. Αυτό που έχει σημασία εδώ είναι τι συμβαίνει αφού υπάρχει η βαθμολογία, πόσο συχνά είναι λανθασμένη, για ποιανού τη γραφή είναι λανθασμένη πιο συχνά, και τι πραγματικά κοστίζει μια ψευδής κατηγορία σε κάποιον που δεν έκανε τίποτα λάθος.

Είναι ακριβείς οι ανιχνευτές AI;

Όχι με συνέπεια, και το χάσμα ανάμεσα στους ισχυρισμούς μάρκετινγκ και στις ανεξάρτητες δοκιμές είναι καλά τεκμηριωμένο. Μια ομάδα ερευνητών με επικεφαλής τη Debora Weber-Wulff δημοσίευσε τα ευρήματά της για 14 εργαλεία ανίχνευσης, συμπεριλαμβανομένων 12 δωρεάν και δύο εμπορικών, τα οποία δοκιμάστηκαν απέναντι σε ένα μείγμα ανθρώπινου κειμένου και κειμένου ChatGPT το 2023. Διαπίστωσαν ότι κανένα από αυτά τα εργαλεία δεν είναι ακριβές ή αξιόπιστο, με ενσωματωμένη μεροληψία να χαρακτηρίζουν το κείμενο μηχανής ως ανθρώπινο και όχι το αντίστροφο. Δύο από τα εμπορικά εργαλεία που περιλήφθηκαν σε αυτή τη δοκιμή ήταν το Turnitin και το PlagiarismCheck. Όλα τα εργαλεία σε αυτή τη δοκιμή είχαν χειρότερη επίδοση όταν το κείμενο είχε παραφραστεί.

Αλλά δύο χρόνια μετά, τα πράγματα δεν παραμένουν στάσιμα. Ένα working paper από το Booth School του University of Chicago, από τους Brian Jabarian και Alex Imas, έθεσε σε δοκιμή τρεις νεοεισερχόμενους, Pangram, GPTZero και Originality.ai, καθώς και έναν ανταγωνιστή ανοικτού κώδικα, με σχεδόν 2,000 κείμενα γραμμένα από ανθρώπους, από blogs, ειδήσεις, κριτικές και μυθοπλασία. Υπό ελεγχόμενες συνθήκες δοκιμής, το καλύτερο εργαλείο στο σύνολο δεν έπεσε ποτέ κάτω από 99.8 percent ακρίβεια και διατήρησε το ποσοστό ψευδώς θετικών σε χαμηλό επίπεδο. Το μοντέλο ανοικτού κώδικα τα πήγε εξίσου καλά με έναν τυχαίο μαντευτή. Τα πράγματα έχουν πράγματι βελτιωθεί. Κάπως. Λίγο.

Αλλά η παγίδα είναι η λέξη ελεγχόμενες. Τα αποσπάσματα αναφοράς είναι καθαρά, πλήρη και παράγονται υπό γνωστές συνθήκες. Ένα υποβαλλόμενο δοκίμιο δεν είναι τίποτε από αυτά με αξιοπιστία. Τα αποτελέσματα στον πραγματικό κόσμο μπορεί να μην είναι ίδια με τα αποτελέσματα του εργαστηρίου, όπως έχει δηλώσει δημόσια ο ίδιος ο chief product officer του Turnitin, αν και αυτό αποτελεί σπάνια και χρήσιμη παραδοχή από έναν προμηθευτή. Η επόμενη ενότητα τοποθετεί τους αριθμούς του προμηθευτή δίπλα στους ανεξάρτητους, ώστε το χάσμα να είναι ορατό και όχι απλώς να διατυπώνεται ως ισχυρισμός.

Ισχυρισμοί του προμηθευτή έναντι ανεξάρτητης δοκιμής

Ο παρακάτω πίνακας παραθέτει τι ισχυρίζονται για τον εαυτό τους τέσσερις ανιχνευτές σε αντιπαράθεση με ό,τι μέτρησαν ανεξάρτητοι ερευνητές όταν δοκίμασαν τα εργαλεία απευθείας. Διαβάστε μαζί τις δύο μεσαίες στήλες, όχι μόνο τη στήλη του προμηθευτή.

ΑνιχνευτήςΑκρίβεια που ισχυρίζεται ο προμηθευτήςΑνεξάρτητα παρατηρούμενηΤι λέει ο προμηθευτής για τα ψευδώς θετικά
TurnitinΌριο εμπιστοσύνης 98% πριν από τη σήμανση, κάτω από 1% ψευδώς θετικά σε επίπεδο εγγράφουΠερίπου 80% ακρίβεια, η καλύτερη από 12 εργαλεία σε σύγκριση του 2023, σε παλαιότερη έκδοση του εργαλείουΚάτω από 1% σε επίπεδο εγγράφου πάνω από όριο 20% AI-written, περίπου 4% σε επίπεδο πρότασης
GPTZero95.7% ανίχνευση κειμένου AI με ποσοστό ψευδώς θετικών 1% στο ανεξάρτητο σημείο αναφοράς RAID96% ακρίβεια σε σύντομα αποσπάσματα, ποσοστό ψευδώς θετικών κάτω από 1% σε μελέτη του 2025 του University of Chicago BoothΑναφέρει ποσοστό ψευδώς θετικών 1% στο σημείο αναφοράς RAID
Originality.ai99% ακρίβεια, ποσοστό ψευδώς θετικών 0.5% (μοντέλο Lite), 1.5% (μοντέλο Turbo)Ποσοστό ψευδώς θετικών κάτω από 1%, αλλά παρέλειψε 10% έως 40% κειμένου γραμμένου από AI στην ίδια μελέτη BoothΔημοσιεύει ξεχωριστά στοιχεία ψευδώς θετικών ανά βαθμίδα μοντέλου
PangramΠοσοστά σφάλματος που, όπως λέει, είναι πάνω από 38 φορές χαμηλότερα από ανταγωνιστικά εργαλεία, δηλώνει ότι δεν υπάρχει μεροληψία εις βάρος συγγραφέων που δεν έχουν τα αγγλικά ως μητρική γλώσσαΑκρίβεια ποτέ κάτω από 99.8%, ποσοστό ψευδώς θετικών κοντά στο μηδέν, στη μελέτη BoothΔηλώνει ποσοστά ψευδώς θετικών κοντά στο μηδέν σε 10 τομείς κειμένου και 8 γλωσσικά μοντέλα

Δύο πράγματα ξεχωρίζουν. Πρώτον, όλα τα στοιχεία των προμηθευτών προέρχονται από ένα εργαστήριο που ελέγχεται από τον προμηθευτή και τα στοιχεία Booth προέρχονται από ερευνητές που δεν έχουν τίποτα να πουλήσουν. Δεύτερον, το Turnitin δεν εμφανίζεται καθόλου σε εκείνη τη μεσαία στήλη, καθώς η μελέτη του 2025 δεν το δοκίμασε. Στον πίνακα, το ανεξάρτητο στοιχείο του βασίζεται σε μια παλαιότερη σύγκριση του 2023, αλλά έγινε σε παλαιότερη έκδοση του εργαλείου, επομένως να το θυμάστε αυτό όταν εξετάζετε τον πίνακα ως σύγκριση όμοιου με όμοιο.

Πόσο ακριβής είναι η ανίχνευση AI του Turnitin;

Το Turnitin δεν δημοσιεύει ένα μόνο ποσοστό ακρίβειας. Αντίθετα, δημοσιεύει ένα κατώφλι και έναν συμβιβασμό. Η εταιρεία έχει δηλώσει ότι επισημαίνει ένα έγγραφο μόνο όταν είναι 98 percent βέβαιη ότι το επισημασμένο μέρος είναι γραμμένο από AI, και ότι αυτό το κατώφλι είναι εκείνο που διατηρεί το ποσοστό ψευδώς θετικών σε επίπεδο εγγράφου κάτω από 1 percent. Το Turnitin έχει εκτιμήσει ότι εντοπίζει περίπου 85 percent της γραφής που έχει υποβοηθηθεί από AI, αφήνοντας το υπόλοιπο να περάσει σκόπιμα, αντί να διακινδυνεύσει μια λανθασμένη κατηγορία.

Το πραγματικό ποσοστό ψευδώς θετικών που επιστρέφει το Turnitin σε επίπεδο πρότασης, όπου ένα περιβάλλον εργασίας επισημαίνει συγκεκριμένες γραμμές αντί για ολόκληρο έγγραφο, είναι στην πραγματικότητα πιο κοντά στο 4 percent. Αυτός είναι ο αριθμός που αξίζει να γνωρίζει κανείς αν ένας καθηγητής τραβήξει στιγμιότυπο οθόνης μιας μόνο επισημασμένης παραγράφου αντί για μια βαθμολογία σε επίπεδο ολόκληρου εγγράφου, επειδή μια επισημασμένη πρόταση φέρει ουσιαστικά μεγαλύτερη πιθανότητα να είναι λανθασμένη από ό,τι η βαθμολογία του εγγράφου δίπλα της.

Αξίζει επίσης να σημειωθεί ότι το Turnitin έχει αναγνωρίσει άμεσα αυτό το κενό. Διαπίστωσαν ότι τα πρώτα αποτελέσματά τους στον πραγματικό κόσμο, ιδίως για συντομότερα έγγραφα, είχαν υψηλότερα ποσοστά ψευδώς θετικών από ό,τι αναμενόταν με βάση τις εργαστηριακές δοκιμές τους. Έτσι, προσαρμόσαν το ελάχιστο μήκος εγγράφου που βαθμολογείται από 150 σε 300 λέξεις. Αυτό σημαίνει ότι ένας προμηθευτής προσαρμόζει το ίδιο του το προϊόν επειδή ο δημοσιευμένος αριθμός δεν επιβεβαιώθηκε εκτός εργαστηρίου, κάτι που λέει πολλά, όσο και κάθε ανεξάρτητη μελέτη.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Τι πραγματικά κοστίζει σε έναν φοιτητή ένα ψευδώς θετικό

Αυτό συνέβη σε έναν φοιτητή executive MBA στη Σχολή Διοίκησης του Yale. Στον φοιτητή απαγγέλθηκε κατηγορία για παράβαση, με την πιο κυριολεκτική έννοια του όρου. Ο ανιχνευτής που εμπλεκόταν ήταν το GPTZero. Η τελική εξέταση του φοιτητή σε ένα μάθημα χρηματοοικονομικών είχε επισημανθεί από έναν βοηθό διδασκαλίας, ο οποίος θεώρησε ότι η γραφή ήταν εκτενής και περίτεχνη, με σχεδόν τέλεια στίξη και γραμματική. Και αυτός ο συγκεκριμένος καθηγητής την πέρασε από το GPTZero, το οποίο βαθμολόγησε τις απαντήσεις ως πιθανώς παραγόμενες από AI.

Απέτυχε στο μάθημα και τέθηκε σε αναστολή για ένα έτος. Η αγωγή του, που κατατέθηκε σε ομοσπονδιακό δικαστήριο τον Φεβρουάριο του 2025, υποστηρίζει ότι η ίδια η πολιτική του Yale περιορίζει τη χρήση εργαλείων όπως το GPTZero ακριβώς για αυτόν τον λόγο, δηλαδή το τεκμηριωμένο ποσοστό ψευδώς θετικών αποτελεσμάτων του απέναντι σε μη φυσικούς ομιλητές της αγγλικής, και ότι το χρησιμοποίησε κατά παράβαση αυτής της πολιτικής. Η κατάθεσή του επικαλείται επίσης ότι το GPTZero έδωσε βαθμολογία 100 percent AI-generated σε ακαδημαϊκή γραφή του ίδιου του πρώην πρύτανη του Yale και του κοσμήτορα της σχολής διοίκησης επιχειρήσεων.

Ο δικαστής αρνήθηκε να εκδώσει πρόωρη ασφαλιστική διαταγή τον Μάιο του 2025. Η υπόθεση δεν έχει ακόμη επιλυθεί, καθώς γράφω. Ο ενάγων, Γάλλος υπήκοος, υποστηρίζει ότι η ίδια γνωστή προκατάληψη κατά των μη φυσικών ομιλητών της αγγλικής προκάλεσε στη γραφή του την απόδοση που είχε. Αυτό εξετάζουμε στην επόμενη ενότητα. Αυτό που δεν αμφισβητείται είναι το κόστος, ένα έτος χαμένο από πρόγραμμα σπουδών, ένας αποτυχημένος βαθμός, νομικά έξοδα και αρκετοί μήνες αντιδικίας για μια βαθμολογία αντί για την απόκτηση πτυχίου. Ένα ποσοστό ψευδώς θετικών αποτελεσμάτων 1 percent ακούγεται μικρό, μέχρις ότου ένας μεγάλος πληθυσμός το κάνει να αφορά ένα συγκεκριμένο άτομο.

Γιατί οι ανιχνευτές AI ταξινομούν εσφαλμένα τους μη φυσικούς ομιλητές της αγγλικής;

Κακώς, και με μεγάλη διαφορά. Αυτό είναι το συμπέρασμα της μελέτης που πρώτα το ποσοτικοποίησε. Ερευνητές του Stanford δοκίμασαν επτά ευρέως χρησιμοποιούμενους ανιχνευτές GPT σε 91 εκθέσεις TOEFL γραμμένες από μη φυσικούς ομιλητές της αγγλικής και σε 88 εκθέσεις μαθητών της όγδοης τάξης στις ΗΠΑ. Οι ανιχνευτές διάβασαν σωστά τις εκθέσεις της όγδοης τάξης σχεδόν κάθε φορά. Όταν ήρθε η σειρά των εκθέσεων TOEFL, οι οποίες είχαν γραφτεί από ενήλικες αρκετά άνετους ώστε να δώσουν εξέταση αγγλικών επιπέδου μεταπτυχιακών σπουδών, οι ανιχνευτές είχαν κατά μέσο όρο ποσοστό ψευδώς θετικών αποτελεσμάτων 61.3 percent. Ογδόντα εννέα από τις 91 εκθέσεις επισημάνθηκαν ως παραγόμενες από GPT από τουλάχιστον έναν από τους επτά ανιχνευτές, 18 από αυτές τις εκθέσεις επισημάνθηκαν και από τους επτά ανιχνευτές.

Ο μηχανισμός είναι ο ίδιος που διέπει και την υπόλοιπη ανίχνευση, το προβλέψιμο λεξιλόγιο και η απλούστερη δομή προτάσεων διαβάζονται ως χαμηλή perplexity, και η χαμηλή perplexity διαβάζεται ως κατασκευασμένη από μηχανή, ανεξάρτητα από το ποιος κρατά το στυλό. Οι συγγραφείς που εργάζονται σε δεύτερη γλώσσα βασίζονται σε καθιερωμένες διατυπώσεις, επειδή αυτό ακριβώς μοιάζει με τη γλωσσική ευχέρεια σε μια πρόσθετη γλώσσα, και αυτό ακριβώς είναι το προφίλ που ένας ανιχνευτής έχει κατασκευαστεί για να επισημαίνει.

Οι συγγραφείς σε αυτή τη θέση δεν εξυπηρετούνται καλά από τη συμβουλή να γράφουν απλώς πιο φυσικά, αφού το φυσικό είναι ακριβώς αυτό που επισημάνθηκε. Η σελίδα του TextPulse για ακαδημαϊκούς συγγραφείς ESL καλύπτει λεπτομερέστερα τα μοτίβα διατύπωσης πίσω από αυτόν τον κίνδυνο, συμπεριλαμβανομένου του τι τα αλλάζει χωρίς να αλλάζει το νόημα της πρότασης.

Αυτό δεν ήταν μεμονωμένη περίπτωση. Τον Δεκέμβριο του 2025, κυκλοφόρησε ένα νέο benchmark, σχεδιασμένο ρητά για να αξιολογεί την προκατάληψη σε αυτούς τους ανιχνευτές. Περιλάμβανε πάνω από 200,000 δείγματα από πολλαπλά δημογραφικά και γλώσσες. Παρά το γεγονός ότι είχαν περάσει δύο χρόνια από την πρώτη μελέτη του Stanford και ότι περιλάμβανε πολλές διαφορετικές εκδόσεις μοντέλων των ίδιων ανιχνευτών, αυτό το benchmark αποκάλυψε ότι η προκατάληψη απέναντι στους μαθητές της αγγλικής γλώσσας εξακολουθεί να υπάρχει.

Αυτό δεν ισχύει για όλους τους προμηθευτές. Η δική του τεχνική τεκμηρίωση του Pangram αναφέρει ότι ο ταξινομητής του δεν είναι προκατειλημμένος απέναντι σε ομιλητές της αγγλικής που δεν είναι φυσικοί. Οι ερευνητές του Chicago Booth δεν δοκίμασαν ανεξάρτητα αυτόν τον ισχυρισμό, αλλά δείχνει ότι η νεότερη γενιά ανιχνευτών κατασκευάζεται έχοντας υπόψη το πρόβλημα, αντί να το αγνοεί.

Αν θέλετε να δείτε πού βρίσκεται η δική σας γραφή πριν τη βαθμολογήσει κάποιος άλλος, ένας δωρεάν perplexity checker σας δίνει τον ίδιο υποκείμενο αριθμό που θα υπολόγιζε ένας ανιχνευτής, χωρίς να υποβάλλετε πρώτα τίποτα σε κάποιο ίδρυμα.

Ποιοι άλλοι επισημαίνονται, και γιατί

Οι ομιλητές της αγγλικής ως μη μητρικής γλώσσας φέρουν τον μεγαλύτερο τεκμηριωμένο κίνδυνο, αλλά η ίδια στατιστική λογική εντοπίζει και άλλα κείμενα. Η ομάδα του Weber-Wulff διαπίστωσε ότι και τα 14 εργαλεία που δοκίμασαν ήταν λιγότερο ακριβή όταν τα εφάρμοζαν σε παραφρασμένα κείμενα, αυτό περιγράφει ένα ουσιαστικό μέρος της ακαδημαϊκής γραφής που έχει περάσει από διορθωτή, επιμελητή ή το κόκκινο στυλό ενός επιβλέποντα πριν κάποιος εφαρμόσει πάνω του έναν ανιχνευτή.

Τίποτε από αυτά δεν σημαίνει ότι ο αριθμός είναι χωρίς νόημα, μόνο ότι χρειάζεται επιβεβαίωση πριν σημαίνει οτιδήποτε για ένα συγκεκριμένο άτομο. Αν έχετε ένα κείμενο που διαβάζεται ως ομοιόμορφο, με παρόμοια μήκη προτάσεων, παρόμοιο ρυθμό σε όλη την έκταση, θα βαθμολογηθεί ως πιο μηχανικό, ανεξάρτητα από το ποιος το έγραψε ή γιατί. Αυτό μπορεί να ελεγχθεί άμεσα με ένα free burstiness checker αντί να γίνεται εικασία.

Πώς μοιάζει μια τεκμηριώσιμη πολιτική ανίχνευσης AI

Το Yale είχε ήδη μια πολιτική που, σύμφωνα με αναφορές, περιορίζει εργαλεία όπως το GPTZero, για σχεδόν τους λόγους που έχει εκθέσει αυτό το άρθρο, δηλαδή έναν τεκμηριωμένο ρυθμό ψευδώς θετικών και μια τεκμηριωμένη μεροληψία εις βάρος συγγραφέων που δεν έχουν τα αγγλικά ως μητρική γλώσσα. Άρα, αυτό δεν είναι τόσο η ιστορία ενός άτυχου φοιτητή όσο η ιστορία ενός υπάρχοντος κανόνα που δεν τηρήθηκε. Όταν μια πολιτική πράγματι επιβάλλει τη διάκριση ανάμεσα σε μια βαθμολογία και σε μια κρίση, τότε η βαθμολογία γίνεται μία είσοδος και όχι κρίση.

  • Να αντιμετωπίζεται η βαθμολογία ως μία είσοδος, ποτέ ως η μοναδική βάση για διαπίστωση παραπτώματος
  • Να γνωστοποιείται στους φοιτητές ο δημοσιευμένος ρυθμός ψευδώς θετικών του εργαλείου πριν χρησιμοποιηθεί εναντίον τους
  • Να εφαρμόζεται πρόσθετη προσοχή σε σύντομες υποβολές και σε γραφή στα αγγλικά από μη μητρικούς ομιλητές, και τα δύο τεκμηριωμένα αδύναμα σημεία
  • Να εγγυάται μια οδό προσφυγής που δεν απαιτεί την απόδειξη ότι ένα στατιστικό στοιχείο είναι λανθασμένο

Τίποτε από αυτά δεν είναι εξωτικό. Είναι πιο κοντά στον τρόπο με τον οποίο θα έπρεπε να αντιμετωπίζεται οποιοδήποτε μεμονωμένο στοιχείο εγκληματολογικής απόδειξης οπουδήποτε αλλού, χρήσιμο, ελέγξιμο και ποτέ επαρκές από μόνο του.

Για έναν μεμονωμένο συγγραφέα, η ίδια αρχή ισχύει πριν υπάρξει μια βαθμολογία και όχι μετά. Ένας μόνο αριθμός, από οποιοδήποτε εργαλείο, είναι εκτίμηση και όχι κρίση, και η αντιμετώπισή του ως βεβαιότητας προς οποιαδήποτε κατεύθυνση, ασφαλής ή εντοπισμένος, απαιτεί από τον αριθμό περισσότερα από όσα μπορεί να στηρίξει.

Το ίδιο το εργαλείο εξανθρωπισμού AI του TextPulse αναφέρει μια Βαθμολογία Ανθρώπου με βάση την ίδια λογική, μια εκτίμηση που υπολογίζεται από το δικό σας κείμενο, όχι μια κρίση ανιχνευτή γι' αυτό, χρήσιμη ως ένδειξη του πώς διαβάζεται επί του παρόντος ένα προσχέδιο, και όχι ως υπόσχεση για το τι θα πει οποιοσδήποτε συγκεκριμένος ανιχνευτής.

Το ζήτημα της ακρίβειας διασπάται σε στενότερα ζητήματα, καθένα με τη δική του σελίδα. Το ποσοστό με το οποίο οι ανιχνευτές επισημαίνουν ανθρώπινη γραφή καλύπτεται ξεχωριστά, όπως και τα συγκεκριμένα στοιχεία για το ποσοστό ψευδώς θετικών του Turnitin και για την ακρίβεια του ZeroGPT. Αν μια βαθμολογία έχει ήδη χρησιμοποιηθεί εναντίον σας, υπάρχουν πρακτικά κείμενα για τι να κάνετε όταν σας κατηγορούν ότι χρησιμοποιήσατε AI, για τα στοιχεία που μπορείτε να συγκεντρώσετε ώστε να αποδείξετε ότι δεν χρησιμοποιήσατε AI, και για τη σύνταξη επιστολής ένστασης που απαντά στη βαθμολογία με τους δικούς της όρους.

Ο αριθμός σε οποιαδήποτε αναφορά θα συνεχίσει να μεταβάλλεται καθώς οι προμηθευτές επανεκπαιδεύουν τα μοντέλα τους και οι ερευνητές συνεχίζουν να τα δοκιμάζουν απέναντι σε δυσκολότερες περιπτώσεις. Αλλά αυτό που δεν πρέπει να μεταβάλλεται είναι η συνήθεια που βρίσκεται από κάτω του, να διαβάζετε μια βαθμολογία ως μία μέτρηση ανάμεσα σε άλλες, να ρωτάτε σε ποιον πληθυσμό επικυρώθηκε, και να ρωτάτε τι δεν λέει ο προμηθευτής για τις περιπτώσεις στις οποίες εξακολουθεί να σφάλλει.

Frequently Asked Questions

Ναι. Η Weber-Wulff και οι συνεργάτες της διαπίστωσαν ότι τα εργαλεία ανίχνευσης AI ήταν «ούτε ακριβή ούτε αξιόπιστα» σε μια σύγκριση του 2023, και οι συγγραφείς που δεν έχουν ως μητρική γλώσσα τα αγγλικά αντιμετωπίζουν τον υψηλότερο τεκμηριωμένο κίνδυνο, με μία μελέτη να βρίσκει μέσο ποσοστό ψευδώς θετικών πάνω από 60 τοις εκατό σε εκθέσεις TOEFL. Μια μεμονωμένη βαθμολογία δεν αποτελεί από μόνη της απόδειξη για τίποτα, γι' αυτό δεν πρέπει ποτέ να είναι η μόνη βάση μιας κατηγορίας.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.