Turnitin False Positive Rate: Τι δείχνουν οι αριθμοί
Το Turnitin δημοσιεύει δύο τιμές ψευδώς θετικών, όχι μία, και καμία δεν περιγράφει το κείμενο που βρίσκεται μπροστά σε έναν συγκεκριμένο καθηγητή. Εδώ παρουσιάζεται η διάκριση μεταξύ επιπέδου εγγράφου και επιπέδου πρότασης, η αστερίσκος για κάτω από 20%, και η αριθμητική που μετατρέπει ένα κλάσμα του ποσοστού σε πραγματικό αριθμό φοιτητών.
Το ποσοστό ψευδώς θετικών του Turnitin δεν είναι ένας αριθμός. Η εταιρεία δημοσιεύει δύο: ένα ποσοστό κάτω από 1 τοις εκατό σε επίπεδο εγγράφου, και ένα πιο κοντά στο 4 τοις εκατό σε επίπεδο πρότασης. Και τα δύο είναι πραγματικά, και τα δύο έχουν δημοσιευθεί, και κανένα από τα δύο, από μόνο του, δεν λέει πολλά για τη συγκεκριμένη εργασία που βρίσκεται μπροστά σε έναν συγκεκριμένο καθηγητή.
Το χάσμα ανάμεσα στα δύο αυτά ποσοστά, και το τι συμβαίνει όταν οποιοδήποτε από τα δύο εφαρμόζεται σε μια πραγματική τάξη αντί σε ένα μεμονωμένο έγγραφο, είναι αυτό που εξετάζει αυτό το κείμενο: τι δηλώνει η ίδια η Turnitin, τι καλύπτουν πραγματικά οι δύο αριθμοί, και η αριθμητική που μετατρέπει ένα κλάσμα του τοις εκατό σε πραγματικό αριθμό φοιτητών.
Ποιο είναι το ποσοστό ψευδώς θετικών του Turnitin, σύμφωνα με το Turnitin;
Σε επίπεδο εγγράφου, με τα ίδια τα λόγια της εταιρείας: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Αυτή η προϋπόθεση έχει τόση σημασία όσο και ο αριθμός. Το ποσοστό κάτω από 1 τοις εκατό δεν αποτελεί ισχυρισμό για κάθε εργασία που βαθμολογεί το Turnitin. Περιγράφει μόνο το υποσύνολο των εργασιών που είχαν ήδη ξεπεράσει ένα όριο 20 τοις εκατό γραφής από AI στην ίδια την εκτίμηση του μοντέλου.
Σε επίπεδο πρότασης, όπου μια διεπαφή επισημαίνει μεμονωμένες γραμμές αντί για ολόκληρο έγγραφο, το δικό του ποσοστό του Turnitin είναι περίπου τέσσερις φορές υψηλότερο. "Our sentence-level false positive rate is around 4%," δηλώνει η εταιρεία. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Το Turnitin προσθέτει ότι αυτές οι λανθασμένες προτάσεις δεν κατανέμονται τυχαία: στο 54 τοις εκατό των περιπτώσεων, μια λανθασμένα επισημασμένη πρόταση βρίσκεται ακριβώς δίπλα σε γνήσια γραφή AI, κάτι που η εταιρεία προβάλλει ως μέρος του λόγου για τον οποίο η βαθμολογία σε επίπεδο ολόκληρου εγγράφου τείνει να είναι πιο αξιόπιστη από οποιαδήποτε μεμονωμένη επισημασμένη γραμμή.
Το επίπεδο εγγράφου και το επίπεδο πρότασης δεν είναι η ίδια δήλωση
Αυτός ο διπλός διαχωρισμός σε δύο επίπεδα είναι αναθεωρημένη διατύπωση, όχι η αρχική θέση του Turnitin. Κατά την κυκλοφορία του τον Απρίλιο του 2023, η εταιρεία δημοσίευσε ένα ενιαίο ποσοστό κάτω του 1%, χωρίς καμία διάκριση μεταξύ εγγράφου και πρότασης. Αφού τα ιδρύματα άρχισαν να παραπέμπουν σε αυτόν τον αριθμό και αφού ο εκπαιδευτικός Τύπος ανέφερε ψευδώς θετικά αποτελέσματα στην πραγματική χρήση υψηλότερα από το αναμενόμενο, ο chief product officer του Turnitin δημοσίευσε την ανάλυση που χρησιμοποιείται παραπάνω, μαζί με δύο αλλαγές προϊόντος που έγιναν ως απάντηση, την αύξηση του ελάχιστου μήκους εγγράφου που μπορεί να βαθμολογηθεί από 150 σε 300 λέξεις, και την αλλαγή στον τρόπο με τον οποίο βαθμολογούνται οι αρχικές και οι τελικές προτάσεις σε ένα έγγραφο.
Το κατώφλι των 300 λέξεων υπάρχει για συναφή λόγο. Το Turnitin το αύξησε από το αρχικό ελάχιστο των 150 λέξεων, αφού διαπίστωσε, με τα λόγια της ίδιας της εταιρείας, ότι η ακρίβεια αυξάνεται με περισσότερο κείμενο. Μια σύντομη υποβολή, ένας στοχασμός μίας σελίδας, ένα μερικό προσχέδιο, μια ανάρτηση σε συζήτηση, παρέχουν στο μοντέλο λιγότερα σήματα για να εργαστεί σε σχέση με εκείνα ως προς τα οποία μετρήθηκαν τα παραπάνω ποσοστά ψευδώς θετικών αποτελεσμάτων, και αυτός είναι ένας από τους λόγους για τους οποίους οτιδήποτε κάτω από αυτό το κατώφλι δεν λαμβάνει καθόλου βαθμολογία AI, αντί για μια αναξιόπιστη βαθμολογία.
| Επίπεδο | Δηλωμένος ρυθμός του Turnitin | Τι καλύπτει στην πραγματικότητα |
|---|---|---|
| Σε επίπεδο εγγράφου | Κάτω του 1% | Μόνο έγγραφα που έχουν ήδη επισημανθεί με 20% ή περισσότερο ως γραμμένα από AI, το συνολικό ποσοστό για ολόκληρη την υποβολή |
| Σε επίπεδο πρότασης | Περίπου 4% | Οποιαδήποτε μεμονωμένη πρόταση επισημαίνεται μέσα στην αναφορά γραφής AI, ανεξάρτητα από τη συνολική βαθμολογία του εγγράφου |
| Κάτω από το κατώφλι εγγράφου του 20% | Δεν εμφανίζεται αριθμός | Το Turnitin εμφανίζει αστερίσκο αντί για ποσοστό, επισημαίνοντας το αποτέλεσμα ως λιγότερο αξιόπιστο σε αυτό το εύρος |
Ανθρωποποιήστε τη δική σας εργασία
Μετασχηματίστε το κείμενό σας με τη βοήθεια AI και κάντε το να ακούγεται ανθρώπινο, χωρίς να αγγίξετε σημαντικές λέξεις ή παραπομπές.
Η αριθμητική: τι σημαίνει ένα κλάσμα του ποσοστού για μια πραγματική ομάδα
Τα μαθηματικά έγιναν δημόσια όταν το Vanderbilt University υπολόγισε τα ποσοστά σφάλματος που συνδέονται με την ανίχνευση τεχνητής νοημοσύνης του Turnitin τον Αύγουστο του 2023. Το καλύτερο παράδειγμα για το πώς γίνεται αυτός ο υπολογισμός είναι ο ίδιος ο υπολογισμός των αριθμών από το Vanderbilt. Σε μια ανάρτηση ιστολογίου σχετικά με την απόφασή τους να απενεργοποιήσουν τον ανιχνευτή τεχνητής νοημοσύνης του Turnitin, σημείωσαν ότι, "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
Αυτό το μέγεθος είναι η δική του προέκταση του Vanderbilt από τον δημοσιευμένο αριθμό του προμηθευτή, εφαρμοσμένη στον δικό του όγκο, όχι ένα αποτέλεσμα που μετρήθηκε ξεχωριστά. Η μορφή της αριθμητικής γενικεύεται πέρα από το πλήθος ενός μόνο πανεπιστημίου. Ένα ποσοστό κάτω του 1 percent, όταν εφαρμόζεται σε μερικές εκατοντάδες εργασίες, παράγει λίγους λανθασμένα επισημασμένους φοιτητές, κάτι που είναι εύκολο να παραβλεφθεί. Το ίδιο ποσοστό, όταν εφαρμόζεται σε δεκάδες χιλιάδες εργασίες, δηλαδή στην κλίμακα που υποβάλλει κάθε πραγματικό πανεπιστήμιο κάθε χρόνο, παράγει εκατοντάδες αντί για λίγους, επειδή ένα μικρό ποσοστό και ένας μεγάλος πληθυσμός πολλαπλασιάζονται μεταξύ τους αντί να εξετάζονται απομονωμένα.
Τίποτε από αυτά δεν αποδεικνύει ότι το ποσοστό στον πραγματικό κόσμο αντιστοιχεί ακριβώς στο εργαστηριακό μέγεθος. Ο ίδιος ο chief product officer του Turnitin έχει αναγνωρίσει δημόσια ότι τα αποτελέσματα στον πραγματικό κόσμο διαφέρουν από τις εργαστηριακές δοκιμές, κάτι που αποτελεί μέρος του λόγου για τον οποίο η εταιρεία αναθεώρησε εξαρχής τη διατύπωσή της. Η παραπάνω αριθμητική αντιμετωπίζει τον ίδιο τον δηλωμένο αριθμό του Turnitin ως δεδομένο που αξίζει να ληφθεί σοβαρά υπόψη, όχι ως ανώτατο όριο για το τι συμβαίνει στην πράξη όταν ένα εργαλείο βαθμολογεί υποβολές που δεν μοιάζουν καθόλου με ένα επιλεγμένο πρότυπο αναφοράς.
Τι Δεν Καλύπτει το Ποσοστό
Ένα αποτέλεσμα κάτω από το όριο του 20 percent δεν συνοδεύεται από ένα μικρό ποσοστό. Αντί για αριθμό, εμφανίζεται ένας αστερίσκος, μια επιλογή που έκανε το Turnitin επειδή αυτό το εύρος είναι εκεί όπου το εργαλείο είναι λιγότερο αξιόπιστο προς οποιαδήποτε κατεύθυνση, κάτι που επιβεβαιώνεται από ανεξάρτητη δημοσιογραφική κάλυψη στον εκπαιδευτικό Τύπο, μαζί με το ίδιο το πλαίσιο χαμηλής βεβαιότητας της εταιρείας για αυτό το εύρος. Μια ελαφριά επιμέλεια, μία παράγραφος αναθεωρημένη με βοήθεια και το υπόλοιπο γραμμένο χωρίς υποστήριξη, μπορεί να μην παράγει καθόλου ορατή βαθμολογία, αντί για μια μικρή, κάτι που αξίζει να γνωρίζει κανείς πριν ένα ελλείπον νούμερο διαβαστεί είτε ως κατηγορία είτε ως καθαρό πιστοποιητικό καλής κατάστασης. Ο οδηγός του TextPulse για το τι θεωρείται καλό Turnitin score καλύπτει το ίδιο όριο από την πλευρά του αναγνώστη της αναφοράς.
Πώς πρέπει λοιπόν να διαβάζεται ένα δημοσιευμένο ποσοστό ψευδώς θετικών;
Ως ένας αριθμός του προμηθευτή για μια στενότερη συνθήκη από ό,τι αρχικά φαίνεται να περιγράφει, όχι ως δήλωση για το κείμενο που βρίσκεται μπροστά σε έναν συγκεκριμένο καθηγητή. Το Turnitin διατυπώνει το δικό του αποτέλεσμα με τον ίδιο τρόπο, η εταιρεία δηλώνει ρητά ότι η τεχνολογία ανίχνευσης γραφής με AI δεν παρέχει "a determination of misconduct," αλλά μόνο "data for educators to make an informed decision." Τα ευρύτερα στοιχεία σχετικά με το whether AI detectors are accurate at all επιβεβαιώνουν την ίδια ανάγνωση, ένα δημοσιευμένο ποσοστό περιγράφει ένα σημείο αναφοράς, όχι το έγγραφο που βαθμολογείται αυτή τη στιγμή.
Οι συγγραφείς που θέλουν να γνωρίζουν πού βρίσκεται το δικό τους προσχέδιο στο ίδιο είδος στατιστικής μέτρησης, αντί να μαντεύουν, μπορούν να το ελέγξουν απευθείας με έναν free perplexity checker πριν φτάσει σε οποιονδήποτε ανιχνευτή ενός ιδρύματος. Αυτό είναι διαφορετική χρήση της τεχνολογίας από το να προσπαθεί κανείς να αμφισβητήσει εκ των υστέρων μια βαθμολογία, και είναι το ένα σημείο όπου ο συγγραφέας, και όχι ο διαχειριστής, βλέπει πρώτος τον αριθμό.
Η ακρίβεια του ZeroGPT εξετάζεται ξεχωριστά για όποιον οργανισμό χρησιμοποιεί αυτό. Η ομάδα πάνω στην οποία πέφτουν πιο βαριά αυτά τα σφάλματα, οι μη φυσικοί ομιλητές της αγγλικής, αποτελεί αντικείμενο δικής της σελίδας.
Ο πληθυσμός που εκτίθεται περισσότερο σε αυτή την αριθμητική δεν κατανέμεται ομοιόμορφα ούτε αυτός. Οι συγγραφείς στα αγγλικά που δεν είναι φυσικοί ομιλητές φέρουν τον μεγαλύτερο τεκμηριωμένο κίνδυνο να βρεθούν στη λάθος πλευρά οποιουδήποτε από αυτά τα ποσοστά, και αυτό ακριβώς είναι το κοινό γύρω από το οποίο έχει σχεδιαστεί η σελίδα του TextPulse για ακαδημαϊκούς συγγραφείς ESL. Το Turnitin θα συνεχίσει να αναθεωρεί αυτά τα στοιχεία καθώς επανεκπαιδεύει το μοντέλο του. Αυτό που δεν θα αλλάξει είναι η ίδια η αριθμητική, ένα ποσοστό τόσο μικρό εξακολουθεί να χρειάζεται έναν πληθυσμό τόσο μεγάλο για να χαθεί μέσα του, και οι περισσότερες πραγματικές υποβολές δεν είναι τόσο τυχερές.
Συχνές ερωτήσεις
Ο ρυθμός ψευδώς θετικών του Turnitin, σύμφωνα με τα δικά του δημοσιευμένα στοιχεία, δεν είναι ένας ενιαίος αριθμός. Σε επίπεδο εγγράφου, το Turnitin αναφέρει ρυθμό κάτω από 1%, αλλά μόνο για έγγραφα που έχουν ήδη επισημανθεί ως 20% ή περισσότερο γραμμένα από AI. Σε επίπεδο πρότασης, όπου επισημαίνονται μεμονωμένες γραμμές, η δική του τιμή είναι περίπου 4%.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.