ChatGPT có bịa ra tài liệu tham khảo không? Nghiên cứu về sự bịa đặt cho thấy gì
Sáu nghiên cứu, bốn lĩnh vực, ba năm. Tỷ lệ mà ChatGPT bịa ra một tài liệu tham khảo dao động từ mức một chữ số đến hơn một nửa, và con số đó không có ý nghĩa gì nếu không kèm theo phiên bản mô hình và ngày tháng gắn với nó.
Vào tháng 6 năm 2025, các nhà nghiên cứu tại Deakin University đã yêu cầu GPT-4o viết sáu bài tổng quan tài liệu về các chủ đề sức khỏe tâm thần. Trong số 176 trích dẫn mà nó tạo ra, 35 trích dẫn hoàn toàn không tồn tại. Thêm 64 trích dẫn khác dẫn tới các bài báo có thật nhưng kèm theo thông tin chi tiết sai. Nghĩa là cứ năm tài liệu tham khảo thì có một tài liệu được bịa ra hoàn toàn, từ một mô hình được phát hành hơn một năm sau khi vấn đề trích dẫn của ChatGPT lần đầu tiên được đo lường trên văn bản in.
ChatGPT có bịa ra tài liệu tham khảo không? Có, và đến năm 2026 nó vẫn làm như vậy, trên các mô hình hiện tại, không chỉ trên phiên bản đã gây chú ý vào năm 2023. Câu hỏi mở chưa bao giờ là liệu điều này có xảy ra hay không. Câu hỏi là tần suất bao nhiêu, và con số đó thay đổi theo mô hình, phiên bản, lĩnh vực và ngày tiến hành kiểm tra.
ChatGPT Có Bịa Ra Tài Liệu Tham Khảo Không?
Có. Một mô hình ngôn ngữ dự đoán từ có khả năng xuất hiện tiếp theo dựa trên mọi thứ đứng trước nó. Nó không tra cứu bất cứ thứ gì trừ khi bạn thêm một bước truy xuất hoặc tìm kiếm vào sản phẩm của mình. Nếu chỉ để nó dự đoán một trích dẫn trông như thế nào, nó sẽ tạo ra một trích dẫn có vẻ đúng, tên tác giả, năm, tên tạp chí, số tập, DOI, mà không xác minh rằng bất kỳ yếu tố nào trong số đó khớp với một ấn phẩm có thật. Một phần trong số đó sẽ chính xác do ngẫu nhiên hoặc do ghi nhớ máy móc. Một phần khác sẽ được bịa ra từ đầu và trông hoàn toàn giống hệt.
Tại Sao Tỷ Lệ Bịa Đặt Cần Có Phiên Bản Mô Hình Và Ngày Tháng
Bởi vì tỷ lệ đó không phải là một con số duy nhất. Trong nghiên cứu được trích dẫn nhiều nhất về vấn đề này, ChatGPT-3.5 đã bịa ra 55 phần trăm số trích dẫn trong một tập các bài tổng quan tài liệu ngắn, còn ChatGPT-4, được cùng các nhà nghiên cứu kiểm tra trên cùng 42 chủ đề, đã bịa ra 18 phần trăm. Cùng một nghiên cứu, cùng lời nhắc, cùng ngày kiểm tra. Điều duy nhất thay đổi là mô hình, và tỷ lệ đã giảm đi hai phần ba.
Ngày tháng quan trọng không kém tên mô hình. GPT-4 trong nghiên cứu đó có nghĩa là bất cứ thứ gì OpenAI đang cung cấp vào giữa năm 2023. Một nghiên cứu năm 2026 về mười mô hình hiện tại và tác nhân nghiên cứu, kiểm tra tổng cộng hơn 220,000 liên kết trích dẫn, cho thấy tỷ lệ bịa đặt từ 3 percent đến 13 percent, với con số chính xác phụ thuộc vào mô hình cụ thể và vào việc sản phẩm có dùng tìm kiếm làm nền tảng hay chế độ nghiên cứu sâu hay không. Không con số nào là sai. Chúng mô tả những điều khác nhau được đo cách nhau gần ba năm.
Lĩnh vực cũng quan trọng, độc lập với mô hình. Chúng tôi cũng có nghiên cứu kinh tế được chạy qua cùng cặp GPT-3.5 và GPT-4, cho thấy hơn 30 percent trích dẫn của GPT-3.5 là bịa ra và tỷ lệ của GPT-4 vẫn trên 20 percent, gần với điều nghiên cứu đa ngành tìm thấy, trong khi nghiên cứu tổng quan hệ thống y học, thử nghiệm cụ thể bản GPT-4 được ghi nhãn là bản dựng tháng 3 năm 2023, đo được 28.6 percent trên một nhiệm vụ hoàn toàn khác, đó là truy xuất tài liệu tham khảo cho các tổng quan hệ thống đã có sẵn thay vì viết các bản tóm tắt tài liệu mới từ đầu.
Những gì các nghiên cứu đã công bố tìm thấy
Sáu nghiên cứu, được thực hiện trong giai đoạn từ 2023 đến 2026, trên y học, luật, kinh tế và viết học thuật nói chung, hội tụ về cùng một phát hiện được diễn đạt theo sáu cách khác nhau, hãy kiểm tra mọi tài liệu tham khảo mà một công cụ AI đưa cho bạn, bất kể mô hình nào tạo ra nó hay vào thời điểm nào.
| Nghiên cứu và lĩnh vực | Mô hình và phiên bản | Ngày kiểm tra | Mẫu | Tỷ lệ bịa đặt |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (đa ngành) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 trích dẫn, 42 chủ đề | 55% (3.5) so với 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (kinh tế học) | GPT-3.5 and GPT-4 | 2023 | Các lời nhắc từ các chủ đề của Journal of Economic Literature | Hơn 30% (3.5), hơn 20% (4) |
| Chelli et al, JMIR (các tổng quan hệ thống y học) | GPT-3.5, GPT-4 (bản dựng gpt-4-32k-0314), Bard (PaLM 2.0) | Được truy vấn vào tháng 7 năm 2023 | 471 tài liệu tham khảo, 11 bài tổng quan | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (luật) | ChatGPT-4 and Llama 2 | 2024 | Các câu hỏi ngẫu nhiên về vụ án tại tòa án liên bang | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (các tổng quan về sức khỏe tâm thần) | GPT-4o | Được kiểm tra vào tháng 6 năm 2025 | 176 trích dẫn, 6 bài tổng quan | 19.9% hoàn toàn bịa đặt, 56% bịa đặt hoặc có lỗi |
| Rao, Wong and Callison-Burch, bản in trước arXiv (đa lĩnh vực, các tác tử deep research) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Hơn 220,000 URL trích dẫn | Từ 3% đến 13% tùy theo mô hình |
Nghiên cứu về luật bổ sung một chi tiết mà tỷ lệ phần trăm thô không nắm bắt được: cùng nghiên cứu đó cho thấy các mô hình gặp khó khăn trong việc dự đoán chính các ảo giác của mình và có xu hướng chấp nhận tiền đề sai của người dùng về một vụ án thay vì sửa lại. Một trích dẫn bịa đặt là một dạng lỗi. Một mô hình còn không thể chỉ ra sự không chắc chắn của chính nó thì là một vấn đề khó hơn, và điều này xuất hiện rõ nhất ngay trong lĩnh vực mà một trích dẫn sai có chi phí cao nhất.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
ChatGPT đã tốt hơn kể từ năm 2023 chưa?
Phần nào đó, và không đồng đều. So sánh rõ ràng nhất trước và sau nằm ngay trong nghiên cứu của Walters và Wilder: từ GPT-3.5 sang GPT-4, cùng một ngày, tỷ lệ bịa đặt giảm từ 55 phần trăm xuống 18 phần trăm. Tiến lên GPT-4o vào giữa năm 2025 và tỷ lệ mà nhóm của Linardon đo được là 19.9 phần trăm, trên một nhiệm vụ khó hơn và hẹp hơn, sáu bài tổng quan tài liệu trong một lĩnh vực nghiên cứu duy nhất thay vì các bản tóm tắt ngắn trải trên 42 chủ đề không liên quan. Tiến thêm một bước nữa đến các mô hình có bật tính năng tìm kiếm hoặc deep-research, được thử nghiệm vào đầu năm 2026, và phạm vi giảm xuống mức một chữ số đối với phần lớn trong số đó, từ 3 đến 9 phần trăm, dù một chế độ deep-research vẫn đạt 13.3 phần trăm.
Không có gì trong số đó là một đường thẳng đi xuống. Con số của Linardon nằm giữa số liệu GPT-4 năm 2023 và số liệu GPT-3.5 năm 2023, trên một mô hình được phát hành muộn hơn cả hai hơn một năm, vì nó được thử nghiệm trên một nhiệm vụ khó hơn: tạo ra tổng quan tài liệu thực sự trong một lĩnh vực mà phần lớn tài liệu nguồn tự thân đã khó tìm. Tỷ lệ bịa đặt mô tả một mô hình trên một nhiệm vụ vào một ngày cụ thể. Chỉ cần thay đổi một trong ba yếu tố đó, con số sẽ thay đổi, đôi khi rất nhiều.
Họ mô hình không phải là biến số duy nhất vẫn làm thay đổi con số ngày nay. Một nghiên cứu năm 2025 đánh giá tám chatbot miễn phí, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat và Perplexity, trên 400 tài liệu tham khảo thuộc năm lĩnh vực học thuật cho thấy chỉ 26.5 phần trăm tổng số tài liệu tham khảo được tạo ra là hoàn toàn chính xác. Grok và DeepSeek tạo ra không có tài liệu tham khảo bịa đặt nào trong phép thử đó. Claude, Copilot và Perplexity nằm trong nhóm có kết quả tệ nhất. Hai sản phẩm được xây dựng trên công nghệ nền tảng tương đương, được thử nghiệm trong cùng một tháng, với cùng các lời nhắc, lại rơi vào hai đầu đối lập của phạm vi, và đó cũng chính là bài học như bảng mô hình và ngày tháng ở trên, nhưng được áp dụng cho sản phẩm thay vì cho phiên bản.
Vì sao các trích dẫn bịa đặt trông có vẻ thật
Một trích dẫn bịa đặt không phải là một chỗ giữ chỗ hiển nhiên. Walters và Wilder phát hiện rằng các mục do họ tạo ra mang tên tác giả thật, những người xuất bản trong lĩnh vực thực tế, gắn với các tên tạp chí thực sự tồn tại, được định dạng đủ tốt để qua được một kiểm tra thị giác nhanh. Nhóm của Linardon tìm thấy một điều sắc nét hơn, trong 35 trích dẫn bịa đặt mà GPT-4o tạo ra, 33 trích dẫn có kèm một DOI, và 64 phần trăm trong số các DOI đó dẫn đến một bài báo đã xuất bản thật, về một chủ đề hoàn toàn không liên quan, không phải một liên kết hỏng và cũng không phải một trang lỗi, nghiên cứu thực sự của người khác được dùng thay cho một nguồn không tồn tại.
Cách kiểm tra liệu một trích dẫn ChatGPT có thật hay không
Hãy tìm chính xác tiêu đề trong Google Scholar hoặc trên trang riêng của tạp chí thay vì chỉ tin vào DOI, vì một DOI hoạt động được vẫn có thể trỏ hoàn toàn sai bài báo. Xác nhận danh sách tác giả, năm và tạp chí có khớp với kết quả thực sự xuất hiện hay không, chứ không chỉ là có thứ gì đó xuất hiện. Hãy làm điều này với mọi tài liệu tham khảo mà chatbot đưa ra, không chỉ những mục trông lạ, vì các mục bịa đặt trong những nghiên cứu này được tạo ra đặc biệt để trông bình thường.
Hãy xem một chủ đề xa lạ hoặc hẹp là có rủi ro cao hơn một chủ đề phổ biến. Nhóm của Linardon phát hiện tỷ lệ bịa đặt gần 6 phần trăm đối với một tình trạng được nghiên cứu kỹ, rối loạn trầm cảm nặng, và gần 30 phần trăm đối với hai tình trạng ít được nghiên cứu hơn trong cùng bộ tổng quan. Mô hình này cũng đúng ngoài sức khỏe tâm thần, một mô hình có nhiều văn bản thực hơn để rút ra các mẫu trong một lĩnh vực đông đúc, và có nhiều khoảng trống hơn để bịa ra một cách có vẻ hợp lý trong một lĩnh vực mỏng.
Một công cụ kiểm tra trích dẫn AI chạy từng mục đối chiếu với một cơ sở dữ liệu học thuật thực tự động hóa việc tìm kiếm đó thay vì để người dùng tự tra cứu thủ công từng tài liệu tham khảo, vốn là phần mà hầu hết mọi người bỏ qua dưới áp lực thời hạn, chính là điều kiện khiến một trích dẫn bịa đặt dễ lọt vào bản thảo cuối cùng nhất.
Việc phát hiện chúng trong một thư mục tài liệu tham khảo đã hoàn chỉnh là một quy trình riêng và có trang riêng của nó. Đối với các trích dẫn là thật, cách trích dẫn ChatGPT theo APA được trình bày từng bước.
Không điều gì trong số này làm thay đổi cách bạn định dạng một trích dẫn sau khi bạn đã xác nhận rằng nó là thật. Đó là một câu hỏi riêng: Cách trích dẫn ChatGPT bao gồm APA, MLA, Chicago và IEEE cho chính cuộc trao đổi, và một công cụ tạo trích dẫn xử lý tài liệu tham khảo thông thường theo cùng một cách bất kể bạn đang viết theo kiểu nào. Điều mà không định dạng trích dẫn nào có thể sửa là một tham chiếu đến thứ chưa từng được xuất bản. Việc kiểm tra đó diễn ra trước khi định dạng, trên mọi tài liệu tham khảo, bất kể mô hình nào đã viết bản nháp của bạn hoặc nhãn của nó tuyên bố phiên bản nào.
Frequently Asked Questions
ChatGPT có bịa ra tài liệu tham khảo không? Có, trên mọi mô hình đã được thử nghiệm cho đến nay, trong mọi nghiên cứu đã công bố từ 2023 đến 2026. Tỷ lệ này thay đổi rất lớn theo phiên bản mô hình, theo lĩnh vực và theo ngày tháng, từ khoảng 3 phần trăm trên các mô hình có căn cứ mới nhất đến hơn một nửa trên GPT-3.5 vào năm 2023, vì vậy một con số đơn lẻ không bao giờ là câu trả lời đầy đủ.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.