Academic Writing

Trích dẫn ảo giác: kiểm tra bài viết của bạn trước khi nộp

Một tài liệu tham khảo bịa đặt không phải là một tài liệu bị lỗi ký tự. Nó xuất hiện với tác giả có vẻ hợp lý, một nhan đề phù hợp, một tạp chí có thật và một DOI trông hợp lệ, vì vậy đọc lại nó sẽ không phát hiện ra. Các cuộc kiểm tra ở quy mô văn liệu được công bố vào năm 2026 cho thấy tỷ lệ bài báo có ít nhất một tài liệu tham khảo bịa đặt đã tăng xấp xỉ mười lần trong ba năm. Đây là cuộc kiểm tra cần thực hiện trước tiên trên danh mục của chính bạn.

11 min
Checklist for a hallucinated citation audit: DOI resolution, title matching, author-year cross-check, and journal name verification

Vào tháng 6 năm 2023, một thẩm phán liên bang ở New York đã xử phạt hai luật sư vì nộp một bản biện hộ được xây dựng trên ít nhất sáu vụ án không hề tồn tại. Steven Schwartz đã hỏi ChatGPT về án lệ hỗ trợ, nhận được tên các vụ án và phần lập luận được trích dẫn nghe đều có vẻ hợp lý, rồi nộp bản biện hộ mà không tự mình mở bất kỳ vụ án nào. Thẩm phán P. Kevin Castel phạt ông ta năm nghìn đô la và yêu cầu gửi thư tới mọi thẩm phán thực sự có tên đã bị gán cho một ý kiến được bịa ra.

Một danh mục tài liệu tham khảo cũng có thể rơi vào cùng tình trạng đó. Cách khắc phục là tiến hành kiểm tra trích dẫn ảo trên chính danh mục tài liệu tham khảo của bạn trước khi biên tập viên, người hướng dẫn hoặc người phản biện làm việc đó cho bạn. Đây không chỉ là vấn đề do soạn thảo bằng chatbot gây ra. Một trích dẫn được nhớ lại nhưng chưa bao giờ thực sự tồn tại, một tiêu đề đồng tác giả bị chép sai đôi chút, hoặc một bản tiền in đã thay đổi trích dẫn cuối cùng sau khi được chấp nhận, tất cả đều có thể để lại cùng một kiểu khoảng trống trong danh mục tài liệu tham khảo như một trích dẫn bịa ra. Quy trình kiểm tra dưới đây phát hiện tất cả những trường hợp đó, bất kể từng mục đã xuất hiện bằng cách nào.

Trích dẫn ảo thực sự phổ biến đến mức nào?

Phạm vi này phụ thuộc rất nhiều vào mô hình nào tạo ra bản thảo. Walters và Wilder, công bố trên Scientific Reports vào năm 2023, đã kiểm tra các danh mục tài liệu tham khảo do GPT-3.5 và GPT-4 tạo ra đối chiếu với các đề bài viết học thuật thực tế: 636 trích dẫn được lấy từ 84 danh mục tài liệu tham khảo do AI tạo ra, 42 cho mỗi mô hình. Năm mươi lăm phần trăm trích dẫn của GPT-3.5 là hoàn toàn bịa ra, so với 18 phần trăm của GPT-4. Ngay cả những trích dẫn có thật cũng không nhất thiết sạch lỗi: 43 phần trăm trích dẫn có thật của GPT-3.5 và 24 phần trăm của GPT-4 vẫn mang một lỗi đáng kể ở đâu đó trong tác giả, tiêu đề, năm hoặc nơi công bố.

Nghiên cứu pháp lý về các trích dẫn do AI tạo ra cho thấy tỷ lệ thất bại còn cao hơn, nhưng công trình đó đo lường một dạng thất bại khác, các phán quyết vụ án bị bịa đặt thay vì các tham chiếu thư mục bị tạo dựng, vì vậy con số đó không phải là con số có thể đưa vào bối cảnh học thuật. Điểm chung của cả hai lĩnh vực là nguyên nhân nền tảng, một mô hình tạo ra một trích dẫn nghe có vẻ hợp lý đang tối ưu hóa cho việc một trích dẫn thường trông như thế nào, chứ không phải cho việc nó có thực sự tồn tại hay không. Bài viết riêng của TextPulse về việc ChatGPT có bịa ra tài liệu tham khảo hay không xem xét cụ thể chatbot đó, còn cuộc kiểm tra này áp dụng bất kể công cụ nào, hay trí nhớ của đồng tác giả nào, đã tạo ra mục nhập trước mắt bạn.

Các cuộc kiểm tra quy mô văn liệu năm 2026 đã phát hiện gì

Các tỷ lệ ở cấp mô hình đó mô tả những gì đi ra từ một chatbot. Một câu hỏi riêng, và là câu hỏi quan trọng đối với bất kỳ ai nộp bài cho một tạp chí, là một tài liệu tham khảo bị bịa ra thường xuyên sống sót qua mọi bước kiểm tra giữa bản thảo và bài báo đã xuất bản đến mức nào. Hai cuộc kiểm tra được công bố trong vòng một ngày của nhau vào tháng 5 năm 2026 đã trả lời câu hỏi đó ở quy mô của văn liệu, và câu trả lời là thất bại này không còn hiếm nữa.

Một cuộc kiểm tra được công bố trên The Lancet đã sàng lọc các tài liệu tham khảo trên khoảng 2.5 triệu bài báo y sinh trong PubMed Central Open Access, bao quát giai đoạn từ tháng 1 năm 2023 đến tháng 2 năm 2026. Vài nghìn tài liệu tham khảo dẫn tới những công trình không tồn tại, phân bố trên hơn 2,800 bài báo đã xuất bản. Xu hướng quan trọng hơn tổng số.

Giai đoạnBài báo có ít nhất một tài liệu tham khảo bị bịa raTrên 10,000 bài báo
20231 trong 2,8283.5
20251 trong 45821.8
2026, bảy tuần đầu tiên1 trong 27736.1

Đó xấp xỉ là mức tăng gấp mười lần trong ba năm, và con số của năm 2026 được rút ra từ bảy tuần chứ không phải từ cả một năm, vì vậy đây là một phép đo ban đầu hơn là một tỷ lệ thường niên đã ổn định. Điều nó xác lập là các tài liệu tham khảo bịa đặt đang đi vào bản in ở các tạp chí bình duyệt, sau khi đã đi qua tác giả, đồng tác giả, biên tập viên và phản biện.

Nghiên cứu đi kèm, Zhao và cộng sự về các trích dẫn không tồn tại, mở rộng phạm vi lên 111 triệu tài liệu tham khảo trên arXiv, bioRxiv, SSRN và PubMed Central, và đặt một ngưỡng tối thiểu thận trọng là 146,932 trích dẫn ảo chỉ riêng trong năm 2025. Phát hiện hữu ích hơn của nghiên cứu này liên quan đến phân bố hơn là khối lượng, các tài liệu tham khảo bịa đặt tập trung ở những lĩnh vực có mức độ tiếp nhận AI nhanh, và trong các nhóm tác giả nhỏ, cũng như các nhóm ở giai đoạn đầu sự nghiệp. Nếu bạn là tác giả đơn lẻ hoặc một nhóm nhỏ không có văn phòng nghiên cứu kiểm tra thư mục tài liệu của mình, bạn thuộc nhóm mà điều này xảy ra sai sót thường xuyên nhất, và đó là một lý do để tự chạy kiểm tra thay vì cho rằng sẽ có người ở khâu sau làm việc đó.

Mô hình nào bịa đặt nhiều nhất, và điều gì thực sự làm giảm nó

Câu trả lời trung thực là hiện không có một chuẩn công khai nghiêm ngặt nào xếp hạng các mô hình lớn hiện nay với nhau về riêng hành vi bịa đặt trích dẫn. Các so sánh không chính thức quy mô nhỏ vẫn lưu hành, thường là vài chục tài liệu tham khảo được đưa qua hai hoặc ba chatbot bằng tay, và các mẫu quá mỏng để có thể dùng làm cơ sở xếp hạng giữa chúng. Xem một trong số đó như một bảng xếp hạng là cách để một khẳng định tự tin nhưng sai lọt vào bài báo.

Điều có cơ sở là so sánh theo thế hệ trong dữ liệu của Walters và Wilder ở trên, trong đó mô hình mới hơn bịa đặt với tần suất xấp xỉ bằng một phần ba mô hình cũ hơn.

Mô hình được thử nghiệmTrích dẫn hoàn toàn bịa đặtTrích dẫn có thật nhưng vẫn chứa một lỗi thực chất
GPT-3.555%43%
GPT-418%24%

Ba khuôn mẫu lặp lại xuyên suốt văn liệu và đáng chú ý hơn bất kỳ bảng xếp hạng đơn lẻ nào. Các mô hình lớn bịa đặt ít hơn các mô hình nhỏ. Các mô hình có thể thực sự tìm kiếm và truy xuất nguồn bịa đặt ít hơn đáng kể so với các mô hình chỉ trả lời từ chính tham số của chúng, và đây là hiệu ứng lớn nhất mà bất kỳ ai từng đo được. Và các nguồn ít được biết đến rủi ro hơn nhiều so với các nguồn nổi tiếng, vì một bài báo được trích dẫn nhiều xuất hiện trong dữ liệu huấn luyện đủ thường xuyên để được tái tạo chính xác, trong khi một nguồn chuyên biệt có nhiều khả năng được tái dựng từ các mảnh rời rạc.

Cách hiểu thực tiễn là không có mô hình nào đủ an toàn để bỏ qua bước kiểm tra, và những mục có khả năng sai nhất chính là những mục mà bạn ít có khả năng xác minh từ trí nhớ nhất, trích dẫn chuyên ngành, bài báo hội nghị ít được biết đến, nguồn bạn vừa thêm vào sau cùng.

Kiểm tra tự động phát hiện gì, và dừng lại ở đâu

Chạy danh sách qua một công cụ kiểm tra trước sẽ nhanh hơn việc tự tay đối chiếu bốn mươi DOI, và công cụ kiểm tra trích dẫn AI miễn phí của trang này làm đúng việc đó đối với Crossref, OpenAlex và Semantic Scholar. Cần biết lớp công cụ này làm kém ở điểm nào trước khi dựa vào nó.

Một đánh giá năm 2026 về năm bộ phát hiện trích dẫn ảo, Badalova and Mayr, cho thấy chúng đưa ra cảnh báo sớm hữu ích nhưng vẫn bị giới hạn bởi bốn yếu tố, trích xuất tài liệu tham khảo một cách sạch sẽ từ tài liệu, siêu dữ liệu không đầy đủ ngay trong mục nhập, phạm vi bao phủ cơ sở dữ liệu không đồng đều, và các sổ đăng ký không nhất quán với nhau. Chỉ yếu tố đầu tiên trong số đó biến mất khi bạn dán một danh sách thay vì tải lên một PDF.

Hệ quả đối với việc tự kiểm tra của bạn là một quy tắc về diễn giải. Một công cụ kiểm tra mạnh nhất ở phát hiện quan trọng nhất, một DOI dẫn đến một bài báo khác với bài được mục trích dẫn mô tả, điều này gần như mang tính kết luận. Nó yếu nhất đối với sách, chương sách, luận văn, kỷ yếu hội nghị, các công trình rất mới và các nguồn không phải tiếng Anh, tất cả đều được lập chỉ mục rất thưa thớt ở mọi nơi và thường xuyên trả về kết quả không tìm thấy dù hoàn toàn có thật. Không tìm thấy là một gợi ý để kiểm tra thủ công, không bao giờ là một phán quyết. Các bước thủ công dưới đây là những gì bạn áp dụng cho bất kỳ phần nào mà lượt kiểm tra tự động không thể xác định được.

Nhân hóa bài viết của bạn

Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.

Bắt đầu miễn phí

Giải quyết mọi DOI trước khi bạn nộp

DOI, tức Digital Object Identifier, được cho là sẽ dẫn đến đúng một bản ghi thông qua bộ phân giải doi.org. Hãy thêm DOI từ danh mục tài liệu tham khảo của bạn vào bộ phân giải, và một DOI hợp lệ sẽ dẫn đến trang của nhà xuất bản cho đúng bài báo đó. Một DOI dẫn đến một bài báo không liên quan, một tạp chí hoàn toàn khác, hoặc không dẫn đến gì cả, là một trong những cách kiểm tra ảo giác nhanh nhất hiện có, vì một mô hình bịa ra một trích dẫn thường cũng bịa ra một chuỗi DOI trông có vẻ hợp lý đi kèm, thay vì dùng lại một DOI có thật.

Một DOI được giải quyết đúng không phải là bằng chứng tự động rằng trích dẫn là có thật. Một số tài liệu tham khảo bịa đặt mượn DOI có thật của một bài báo không liên quan, DOI này vẫn giải quyết mà không báo lỗi và dẫn đến một bài báo có thật nhưng hoàn toàn không liên quan đến luận điểm mà nó được cho là đang hỗ trợ. Hãy đọc trang mà DOI dẫn tới, chứ không chỉ nhìn vào việc nó đã tải được.

Đối chiếu mọi tiêu đề với một cơ sở dữ liệu có thật

Tìm chính xác tiêu đề đó, đặt trong dấu ngoặc kép, trong một cơ sở dữ liệu bao quát lĩnh vực của bạn, không phải trên web mở. Hãy dùng một công cụ như Crossref, PubMed cho công trình y sinh, hoặc chỉ mục riêng của ngành bạn. Nếu bạn dùng Crossref, bạn có thể dùng tìm kiếm khách miễn phí của họ để tra cứu một tài liệu tham khảo theo tiêu đề và tác giả đầu tiên, hoặc theo tác giả và số trang nếu bạn không chắc về tiêu đề. Cách này sẽ trả về DOI và siêu dữ liệu đầy đủ cho bất cứ gì họ có trong hồ sơ. Nếu không có kết quả khớp, hoặc nếu kết quả trả về là một bài báo thật nhưng có một bộ tác giả hoàn toàn khác, bạn có thể đang gặp kiểu ảo giác thứ hai, một DOI bị hỏng.

Tìm kiếm theo tiêu đề phát hiện một lỗi cụ thể mà kiểm tra DOI không phát hiện được, đó là một trích dẫn có DOI thật, hoạt động bình thường, nhưng gắn với tiêu đề sai, vì số và phần văn bản đã được ghép riêng rẽ và thực ra chưa bao giờ được đối chiếu với nhau. Nếu tiêu đề trong cơ sở dữ liệu không khớp gần đúng với tiêu đề trong danh mục tài liệu tham khảo của bạn, hãy xem đó là một sự bịa đặt cho đến khi bạn có thể giải thích được sự không khớp, chứ không phải là một lỗi đánh máy để lặng lẽ sửa đi.

Đối chiếu danh sách tác giả và năm xuất bản

Một trích dẫn ảo thường đúng tác giả nhưng sai bài báo, vì một tên tuổi thật, nổi bật trong lĩnh vực chính là thứ mà một mô hình khi tìm một trích dẫn có vẻ hợp lý sẽ tạo ra. Hãy tìm danh sách công bố của chính tác giả đó, trên cơ sở dữ liệu mà bạn đã mở, theo năm mà danh mục tài liệu tham khảo của bạn nêu. Nếu tác giả đó đã công bố ba bài trong năm ấy và không bài nào khớp với tiêu đề của bạn, thì trích dẫn đó rất có khả năng là bịa ra, được ghép từ một tên thật và một năm thật vốn chưa từng đi cùng nhau trong thực tế.

Mẫu ngược lại cũng xuất hiện: một bài báo thật, có tiêu đề đúng, nhưng gắn với năm sai, thường là năm của bản tiền in hơn là năm xuất bản cuối cùng, hoặc một phiên bản hội nghị được trích dẫn với năm xuất bản muộn hơn của tạp chí. Không trường hợp nào là bịa đặt theo nghĩa chặt của cuộc kiểm tra, nhưng cả hai đều khiến người đọc phải tìm trong trình quản lý trích dẫn hoặc hỏi đồng tác giả rồi vẫn không thể tìm ra thứ bạn đã trích dẫn, đủ gần với cùng một vấn đề để cần sửa trong cùng một lượt.

Phát hiện tên tạp chí có vẻ hợp lý nhưng bị bịa ra

Một tên tạp chí bịa đặt được tạo ra để nghe giống hệt một tên thật: một lĩnh vực có vẻ hợp lý, một tính từ có vẻ hợp lý, một cái tên đủ gần với một tạp chí có thật để không ai dừng lại kiểm tra. "The Journal of Applied Cognitive Studies" là bịa đặt; "The Journal of Applied Psychology" và "Journal of Cognitive Science" đều tồn tại, và một cái tên ghép các phần của hai tên đó lại với nhau đọc lên rất quen thuộc chính vì lý do đó.

Hãy tìm tên tạp chí một mình, đặt trong dấu ngoặc kép, và tìm trang tạp chí chính thức của nhà xuất bản cùng một ISSN hiện hành, chứ không chỉ một kết quả trên một trang khác trích dẫn cùng tài liệu tham khảo đó. Một tạp chí thật có trang chủ liệt kê biên tập viên, tập và số hiện tại, cùng một ISSN hợp lệ được đăng ký cho nó. Một tên không có trang của nhà xuất bản, không có ISSN, và không có bài viết nào khác trích dẫn công trình từ đó là dấu hiệu rõ ràng nhất trong toàn bộ cuộc kiểm tra rằng tài liệu tham khảo đó không tồn tại.

Biến cuộc kiểm tra trích dẫn bịa đặt của bạn thành một danh sách kiểm tra có thể lặp lại

Thực hiện các bước kiểm tra này theo thứ tự, với mọi tài liệu tham khảo, trước khi danh sách được xem là cuối cùng. Thứ tự quan trọng ít hơn việc bao quát đủ cả bốn bước, một trích dẫn có thể qua một bước nhưng vẫn trượt ở bước khác.

Kiểm traNó phát hiện điều gì
Phân giải DOIMột DOI dẫn đến không đâu cả, hoặc dẫn đến một bài viết không liên quan
Đối chiếu tiêu đề với cơ sở dữ liệuMột DOI có thật gắn với sai tiêu đề, hoặc một tiêu đề không trả về kết quả nào
Đối chiếu chéo tác giả cộng nămTên của một tác giả có thật được gắn với một bài báo mà họ không viết trong năm đó
Xác minh tên tạp chíMột tạp chí nghe có vẻ hợp lý nhưng không có ISSN, không có trang của nhà xuất bản, và không tồn tại thật

Trình kiểm tra trích dẫn AI của TextPulse AI citation checker chạy tự động một phiên bản của bước này trên toàn bộ danh mục tài liệu tham khảo, nhanh hơn so với việc thực hiện thủ công cả bốn bước kiểm tra trên một thư mục tài liệu dài, dù việc đọc kỹ những gì nó gắn cờ vẫn đáng để tự làm thay vì chấp nhận hoặc bác bỏ một cờ cảnh báo chỉ dựa trên niềm tin. Riêng với bước DOI, một công cụ chuyển DOI sang trích dẫn chuyên dụng giúp tiết kiệm việc phải truy cập trình phân giải cho từng mục, từng mục một.

Một danh mục tài liệu tham khảo sạch là một trong số nhiều bước kiểm tra trước khi bản thảo được gửi đi. Giảm điểm AI cho việc nộp bài cho tạp chí được trình bày riêng, và thư phản hồi cho người phản biện theo sau nó cũng vậy.

Không điều nào trong số này thay thế cho việc đọc lại bài viết của chính bạn một lần nữa trước khi nộp. Nếu một phần nào đó vẫn đọc lên như chung chung sau khi các факт đã được kiểm tra, một AI humanizer có thể làm mượt văn phong mà không chạm vào dù chỉ một trích dẫn nào; hướng dẫn của TextPulse về cách nhân hóa văn bản AI trong viết học thuật trình bày bước này theo từng phần. Một danh mục tài liệu tham khảo được phân giải trơn tru và một bản thảo đọc lên như chính giọng văn của bạn là hai bước kiểm tra riêng biệt, đáng thực hiện liên tiếp thay vì tin rằng một bước sẽ bao quát bước kia.

XLinkedInFacebook

Câu hỏi thường gặp

Một cuộc kiểm tra trích dẫn ảo giác là một quy trình kiểm tra có thể lặp lại, được thực hiện trên toàn bộ danh mục tài liệu tham khảo trước khi nộp, gồm xác minh mọi DOI, đối chiếu mọi nhan đề với một cơ sở dữ liệu có thật, kiểm tra chéo danh sách tác giả và năm, và xác nhận rằng tên tạp chí thực sự tồn tại. Nó phát hiện các tài liệu tham khảo bịa đặt bất kể chúng được đưa vào bởi chatbot, lỗi của trình quản lý trích dẫn, hay một chi tiết bị nhớ sai.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.

Cập nhật về AI humanization

Nhận mẹo về viết học thuật, phát hiện AI và humanization được gửi thẳng vào hộp thư của bạn.

Không spam. Có thể hủy đăng ký bất cứ lúc nào.