Το ChatGPT επινοεί αναφορές; Τι έδειξαν οι μελέτες για την κατασκευή
Έξι μελέτες, τέσσερα πεδία, τρία χρόνια. Ο ρυθμός με τον οποίο το ChatGPT επινοεί μια αναφορά κυμαίνεται από μονοψήφια ποσοστά έως πολύ πάνω από το μισό, και ο αριθμός δεν σημαίνει τίποτα χωρίς την έκδοση του μοντέλου και την ημερομηνία που τον συνοδεύει.
Τον Ιούνιο του 2025, ερευνητές στο Deakin University ζήτησαν από το GPT-4o να γράψει έξι βιβλιογραφικές ανασκοπήσεις πάνω σε θέματα ψυχικής υγείας. Από τις 176 παραπομπές που παρήγαγε, οι 35 δεν υπήρχαν καθόλου. Άλλες 64 παρέπεμπαν σε πραγματικές εργασίες, αλλά με λανθασμένα στοιχεία. Δηλαδή, μία στις πέντε παραπομπές ήταν εξ ολοκλήρου επινοημένη, από ένα μοντέλο που κυκλοφόρησε περισσότερο από έναν χρόνο αφότου το πρόβλημα των παραπομπών του ChatGPT μετρήθηκε για πρώτη φορά σε έντυπη μορφή.
Επινοεί το ChatGPT παραπομπές; Ναι, και εξακολουθεί να το κάνει το 2026, στα τρέχοντα μοντέλα, όχι μόνο στην έκδοση που έγινε πρωτοσέλιδο το 2023. Το ανοιχτό ερώτημα δεν ήταν ποτέ αν αυτό συμβαίνει. Είναι πόσο συχνά, και αυτός ο αριθμός μεταβάλλεται ανάλογα με το μοντέλο, την έκδοση, το πεδίο και την ημερομηνία κατά την οποία πραγματοποιήθηκε η δοκιμή.
Επινοεί το ChatGPT Παραπομπές;
Ναι. Ένα γλωσσικό μοντέλο προβλέπει την επόμενη εύλογη λέξη με βάση ό,τι προηγείται. Δεν αναζητά τίποτε, εκτός αν προσθέσετε στο προϊόν σας ένα βήμα ανάκτησης ή αναζήτησης. Αν αφεθεί να προβλέψει πώς μοιάζει μια παραπομπή, θα δημιουργήσει μία που φαίνεται σωστή, όνομα συγγραφέα, έτος, τίτλος περιοδικού, αριθμός τόμου, DOI, χωρίς να επαληθεύει ότι οποιοδήποτε από αυτά αντιστοιχεί σε πραγματική δημοσίευση. Κάποια από αυτά θα είναι ακριβή από σύμπτωση ή από μηχανική απομνημόνευση. Κάποια άλλα θα είναι επινοημένα από την αρχή και θα μοιάζουν ακριβώς τα ίδια.
Γιατί ο Ρυθμός Επινοήσεων Χρειάζεται Έκδοση Μοντέλου και Ημερομηνία
Επειδή ο ρυθμός δεν είναι ένας αριθμός. Στη μοναδική μελέτη που έχει αναφερθεί περισσότερο γι' αυτό, το ChatGPT-3.5 επινόησε το 55 percent των παραπομπών σε ένα σύνολο σύντομων βιβλιογραφικών ανασκοπήσεων, ενώ το ChatGPT-4, που δοκιμάστηκε από τους ίδιους ερευνητές στα ίδια 42 θέματα, επινόησε το 18 percent. Η ίδια μελέτη, τα ίδια prompts, η ίδια ημέρα δοκιμής. Το μόνο που άλλαξε ήταν το μοντέλο, και ο ρυθμός μειώθηκε κατά τα δύο τρίτα.
Η ημερομηνία έχει τόση σημασία όσο και το όνομα του μοντέλου. Το GPT-4 σε εκείνη τη μελέτη σήμαινε ό,τι ακριβώς παρείχε το OpenAI στα μέσα του 2023. Μια μελέτη του 2026 για δέκα τρέχοντα μοντέλα και ερευνητικούς πράκτορες, η οποία έλεγξε συνολικά περισσότερους από 220,000 συνδέσμους παραπομπών, βρήκε ποσοστά κατασκευής από 3 percent έως 13 percent, με το ακριβές ποσοστό να εξαρτάται από το συγκεκριμένο μοντέλο και από το αν το προϊόν χρησιμοποιούσε αναζήτηση με τεκμηρίωση ή λειτουργία deep research. Κανένα από τα δύο ποσοστά δεν είναι λανθασμένο. Περιγράφουν διαφορετικά πράγματα που μετρήθηκαν με διαφορά σχεδόν τριών ετών.
Η θεματική περιοχή έχει επίσης σημασία, ανεξάρτητα από το μοντέλο. Έχουμε επίσης δει έρευνα στην οικονομική επιστήμη, η οποία πέρασε από το ίδιο ζεύγος GPT-3.5 και GPT-4, να βρίσκει πάνω από 30 percent των παραπομπών του GPT-3.5 επινοημένες και ποσοστό ακόμη πάνω από 20 percent για το GPT-4, κοντά σε αυτό που βρήκε η διεπιστημονική μελέτη, ενώ η μελέτη συστηματικής ανασκόπησης στην ιατρική, δοκιμάζοντας ειδικά αυτό που επισημάνθηκε ως η έκδοση του March 2023 του GPT-4, μέτρησε 28.6 percent σε μια εντελώς διαφορετική εργασία, την ανάκτηση αναφορών για υπάρχουσες συστηματικές ανασκοπήσεις αντί για τη συγγραφή νέων περιλήψεων βιβλιογραφίας από το μηδέν.
Τι βρήκαν οι δημοσιευμένες μελέτες
Έξι μελέτες, που πραγματοποιήθηκαν μεταξύ 2023 και 2026, στην ιατρική, τη νομική, την οικονομική επιστήμη και τη γενική ακαδημαϊκή γραφή, συγκλίνουν στο ίδιο εύρημα που διατυπώνεται με έξι διαφορετικούς τρόπους, ελέγξτε κάθε αναφορά που σας δίνει ένα εργαλείο AI, ανεξάρτητα από το ποιο μοντέλο την παρήγαγε ή πότε.
| Μελέτη και πεδίο | Μοντέλο και έκδοση | Ημερομηνία δοκιμής | Δείγμα | Ποσοστό κατασκευής |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (διεπιστημονικό) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 παραπομπές, 42 θέματα | 55% (3.5) έναντι 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (οικονομικά) | GPT-3.5 and GPT-4 | 2023 | Προτροπές από θέματα του Journal of Economic Literature | Πάνω από 30% (3.5), πάνω από 20% (4) |
| Chelli et al, JMIR (ιατρικές συστηματικές ανασκοπήσεις) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 αναφορές, 11 ανασκοπήσεις | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (δίκαιο) | ChatGPT-4 and Llama 2 | 2024 | Τυχαίες ερωτήσεις από ομοσπονδιακές δικαστικές υποθέσεις | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (ανασκοπήσεις ψυχικής υγείας) | GPT-4o | Tested June 2025 | 176 παραπομπές, 6 ανασκοπήσεις | 19.9% πλήρως κατασκευασμένες, 56% κατασκευασμένες ή ελαττωματικές |
| Rao, Wong and Callison-Burch, arXiv preprint (πολυτομεακοί, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Πάνω από 220,000 URL παραπομπών | 3% έως 13% ανάλογα με το μοντέλο |
Η νομική μελέτη προσθέτει μια λεπτομέρεια που το ακατέργαστο ποσοστό δεν αποτυπώνει: η ίδια έρευνα διαπίστωσε ότι τα μοντέλα δυσκολεύονται να προβλέψουν τις δικές τους παραισθήσεις και τείνουν να αποδέχονται την εσφαλμένη υπόθεση του χρήστη για μια υπόθεση αντί να τη διορθώνουν. Μια κατασκευασμένη παραπομπή είναι ένας τρόπος αποτυχίας. Ένα μοντέλο που επίσης δεν μπορεί να επισημάνει τη δική του αβεβαιότητα αποτελεί δυσκολότερο πρόβλημα, και αυτό εμφανίζεται περισσότερο ακριβώς στο πεδίο όπου μια λανθασμένη παραπομπή έχει το υψηλότερο κόστος.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Έχει βελτιωθεί το ChatGPT από το 2023;
Κάπως, και άνισα. Η πιο καθαρή μεμονωμένη σύγκριση πριν και μετά βρίσκεται στην ίδια τη μελέτη των Walters και Wilder, GPT-3.5 προς GPT-4, την ίδια ημέρα, η κατασκευή μειώθηκε από 55 percent σε 18 percent. Προχωρώντας στο GPT-4o στα μέσα του 2025, το ποσοστό που μετρήθηκε από την ομάδα του Linardon ήταν 19.9 percent, σε μια δυσκολότερη και στενότερη εργασία, έξι ανασκοπήσεις βιβλιογραφίας σε ένα μόνο ερευνητικό πεδίο, αντί για σύντομες περιλήψεις κατανεμημένες σε 42 άσχετα θέματα. Προχωρώντας ξανά στα μοντέλα με ενεργοποιημένες λειτουργίες αναζήτησης ή deep-research, που δοκιμάστηκαν στις αρχές του 2026, το εύρος πέφτει σε μονοψήφια ποσοστά για τα περισσότερα από αυτά, 3 to 9 percent, αν και μία λειτουργία deep-research έφτασε ακόμη το 13.3 percent.
Τίποτε από αυτά δεν αποτελεί ευθεία καθοδική πορεία. Ο αριθμός του Linardon βρίσκεται ανάμεσα στο 2023 GPT-4 figure και στο 2023 GPT-3.5 figure, σε ένα μοντέλο που κυκλοφόρησε περισσότερο από έναν χρόνο μετά και από τα δύο, επειδή δοκιμάστηκε σε δυσκολότερη εργασία, πραγματική παραγωγή ανασκόπησης βιβλιογραφίας σε πεδίο όπου μεγάλο μέρος του πρωτογενούς υλικού είναι από μόνο του δύσκολο να εντοπιστεί. Ένα ποσοστό κατασκευής περιγράφει ένα μοντέλο σε μια εργασία σε μια ημερομηνία. Αλλάξτε οποιοδήποτε από τα τρία και ο αριθμός μεταβάλλεται, μερικές φορές πολύ.
Η οικογένεια του μοντέλου δεν είναι η μόνη μεταβλητή που εξακολουθεί να μεταβάλλει τον αριθμό σήμερα. Μια μελέτη του 2025 που αξιολόγησε οκτώ δωρεάν chatbots, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat και Perplexity, σε 400 αναφορές σε πέντε ακαδημαϊκά πεδία, διαπίστωσε ότι μόνο το 26.5 percent όλων των αναφορών που παρήχθησαν ήταν πλήρως σωστές. Τα Grok και DeepSeek παρήγαγαν μηδενικές κατασκευασμένες αναφορές σε εκείνη τη δοκιμή. Τα Claude, Copilot και Perplexity ήταν μεταξύ των χειρότερων επιδόσεων. Δύο προϊόντα βασισμένα σε συγκρίσιμη υποκείμενη τεχνολογία, δοκιμασμένα τον ίδιο μήνα, στις ίδιες προτροπές, κατέληξαν στα αντίθετα άκρα του εύρους, και αυτό είναι το ίδιο μάθημα με τον πίνακα μοντέλου και ημερομηνίας παραπάνω, εφαρμοσμένο στο προϊόν και όχι στην έκδοση.
Γιατί οι Κατασκευασμένες Παραπομπές Φαίνονται Πραγματικές
Μια κατασκευασμένη παραπομπή δεν είναι ένα προφανές σύμβολο κράτησης θέσης. Οι Walters και Wilder διαπίστωσαν ότι οι επινοημένες εγγραφές τους έφεραν πραγματικά ονόματα συγγραφέων, ανθρώπων που δημοσιεύουν στον πραγματικό τομέα, προσαρτημένα σε τίτλους περιοδικών που πράγματι υπάρχουν, διαμορφωμένα αρκετά καλά ώστε να περνούν έναν σύντομο οπτικό έλεγχο. Η ομάδα του Linardon βρήκε κάτι πιο αιχμηρό, από τις 35 κατασκευασμένες παραπομπές που παρήγαγε το GPT-4o, οι 33 συνοδεύονταν από ένα DOI, και το 64 percent αυτών των DOI οδηγούσε σε μια πραγματική, δημοσιευμένη εργασία πάνω σε εντελώς άσχετο θέμα, όχι σε νεκρό σύνδεσμο και όχι σε σελίδα σφάλματος, η πραγματική έρευνα κάποιου άλλου να υποδύεται μια πηγή που δεν υπάρχει.
Πώς να Ελέγξετε αν μια Παραπομπή του ChatGPT Είναι Πραγματική
Αναζητήστε τον ακριβή τίτλο στο Google Scholar ή στον ίδιο τον ιστότοπο του περιοδικού, αντί να εμπιστεύεστε μόνο το DOI, αφού ένα DOI που λειτουργεί μπορεί να οδηγεί σε εντελώς λάθος εργασία. Επιβεβαιώστε ότι η λίστα των συγγραφέων, το έτος και το περιοδικό αντιστοιχούν σε αυτό που πράγματι εμφανίζεται, όχι απλώς ότι εμφανίζεται κάτι. Κάντε το για κάθε αναφορά που σας δίνει ένα chatbot, όχι μόνο για εκείνες που φαίνονται άγνωστες, αφού οι κατασκευασμένες εγγραφές σε αυτές τις μελέτες σχεδιάστηκαν ειδικά ώστε να φαίνονται συνηθισμένες.
Αντιμετωπίστε ένα άγνωστο ή στενό θέμα ως υψηλότερου κινδύνου από ένα ευρέως διαδεδομένο. Η ομάδα του Linardon βρήκε κατασκευή κοντά στο 6 percent για μια καλά μελετημένη κατάσταση, τη μείζονα καταθλιπτική διαταραχή, και κοντά στο 30 percent για δύο λιγότερο μελετημένες στο ίδιο σύνολο ανασκοπήσεων. Το μοτίβο ισχύει και πέρα από την ψυχική υγεία, ένα μοντέλο έχει περισσότερο πραγματικό κείμενο από το οποίο μπορεί να αντλήσει μοτίβα σε έναν πυκνό τομέα, και περισσότερο περιθώριο να επινοήσει πειστικά σε έναν αραιό.
Ένας ελεγκτής παραπομπών AI που εκτελεί κάθε εγγραφή σε μια πραγματική ακαδημαϊκή βάση δεδομένων αυτοματοποιεί αυτή την αναζήτηση αντί να την αφήνει σε μια χειροκίνητη αναζήτηση για κάθε μεμονωμένη αναφορά, που είναι το μέρος που οι περισσότεροι παραλείπουν υπό την πίεση της προθεσμίας, ακριβώς η συνθήκη υπό την οποία μια κατασκευασμένη παραπομπή είναι πιο πιθανό να επιβιώσει μέχρι ένα τελικό προσχέδιο.
Η εύρεσή τους σε μια ολοκληρωμένη βιβλιογραφία είναι δική της διαδικασία και έχει τη δική της σελίδα. Για τις παραπομπές που είναι πραγματικές, το πώς να παραπέμψετε το ChatGPT σε APA παρουσιάζεται βήμα προς βήμα.
Τίποτε από αυτά δεν αλλάζει τον τρόπο με τον οποίο μορφοποιείτε μια παραπομπή, αφού έχετε επιβεβαιώσει ότι είναι αληθινή. Αυτό είναι ένα ξεχωριστό ζήτημα: How to cite ChatGPT καλύπτει APA, MLA, Chicago και IEEE για την ίδια την ανταλλαγή, και ένας γεννήτορας παραπομπών χειρίζεται την κοινή αναφορά με τον ίδιο τρόπο, ανεξάρτητα από το σε ποιο στυλ γράφετε. Αυτό που δεν μπορεί να διορθώσει καμία μορφή παραπομπής είναι μια αναφορά σε κάτι που δεν δημοσιεύτηκε ποτέ. Αυτός ο έλεγχος γίνεται πριν από τη μορφοποίηση, σε κάθε αναφορά, ανεξάρτητα από το ποιο μοντέλο έγραψε το προσχέδιό σας ή ποια έκδοση ισχυρίζεται η ετικέτα του.
Frequently Asked Questions
Το ChatGPT επινοεί αναφορές; Ναι, σε κάθε μοντέλο που έχει δοκιμαστεί μέχρι τώρα, σε κάθε δημοσιευμένη μελέτη από το 2023 έως το 2026. Ο ρυθμός διαφέρει πάρα πολύ ανά έκδοση μοντέλου, ανά πεδίο και ανά ημερομηνία, από περίπου 3 percent στα πιο πρόσφατα grounded μοντέλα έως πολύ πάνω από το μισό στο GPT-3.5 το 2023, επομένως ένας μόνο αριθμός δεν δίνει ποτέ την πλήρη απάντηση.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.