AI Detection

Vì sao các bộ phát hiện AI thiên lệch chống lại người viết tiếng Anh không phải bản ngữ

Một nghiên cứu Stanford năm 2023 cho thấy các bộ phát hiện AI đọc sai bài viết tiếng Anh lưu loát của người không phải bản ngữ là do máy tạo ra với tỷ lệ cao hơn nhiều so với bài viết của người bản ngữ. Dưới đây là cơ chế đứng sau khoảng cách đó, và điều gì đã xảy ra khi các bài luận giống nhau được viết lại với vốn từ phong phú hơn.

Cập nhật lúc 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

Việc các bộ phát hiện AI thiên lệch chống lại người nói không phải bản ngữ không phải là một lời phàn nàn mang tính chủ quan. Một nghiên cứu Stanford năm 2023 đã được bình duyệt đã đo lường điều này trực tiếp. Các nhà nghiên cứu đã chạy bảy bộ phát hiện GPT được dùng rộng rãi đối với 91 bài luận TOEFL thực do người nói tiếng Anh không phải bản ngữ viết và 88 bài luận do học sinh lớp tám ở Mỹ viết, rồi so sánh điểm số của từng nhóm.

Các bộ phát hiện đọc đúng gần như mọi bài luận lớp tám. Với các bài luận TOEFL, do những người trưởng thành viết, những người này đã vượt qua một kỳ thi năng lực tiếng Anh ở trình độ sau đại học, cùng bảy công cụ đó cho ra tỷ lệ dương tính giả trung bình là 61.22 percent. Tám mươi chín trong số chín mươi mốt bài luận, gần 98 percent, đã bị ít nhất một trong bảy công cụ gắn cờ là do AI tạo ra.

Tổng quan của TextPulse về bằng chứng rộng hơn về độ chính xác của bộ phát hiện AI trình bày phát hiện nổi bật đó và các vụ kiện mà nó sau đó đã góp phần dẫn tới. Điều hầu như bị bỏ qua ở mọi nơi khi nghiên cứu này được trích dẫn là cơ chế, vì sao văn xuôi của một người nói tiếng Anh ở trình độ sau đại học lại bị đọc như do máy tạo ra ngay từ đầu, và điều gì thay đổi khi nó không còn bị đọc theo cách đó nữa.

Các bộ phát hiện AI thiên lệch chống lại người nói không phải bản ngữ, cơ chế

Một bộ phát hiện không bao giờ đọc để hiểu nghĩa. Nó đọc xem mỗi từ có thể dự đoán được đến mức nào, dựa trên những từ đứng trước nó, và cho một đoạn văn điểm thấp khi mô hình có thể đã đoán trước phần lớn nội dung đó. Tính đa dạng từ vựng, tức mức độ rộng của vốn từ mà người viết sử dụng thay vì lặp lại một tập nhỏ các từ an toàn, và tính dự đoán được về cú pháp, tức mức độ cấu trúc câu đi theo mẫu phổ biến nhất của ngôn ngữ thay vì biến đổi nó, là hai đặc tính của quá trình tạo ngôn ngữ làm kéo điểm số đó xuống.

Sự phân biệt này quan trọng vì hai hiện tượng xuất hiện khác nhau trên trang. Đa dạng từ vựng là về chính các từ: một người viết dùng 'obtain,' 'acquire,' và 'secure' trong ba câu khác nhau sẽ được đọc là đa dạng hơn người viết 'get' ba lần, ngay cả khi các câu còn lại giống hệt nhau. Tính dự đoán cú pháp là về cấu trúc: chủ ngữ, động từ, tân ngữ, lặp đi lặp lại, thay vì một câu mở đầu bằng mệnh đề phụ thuộc hoặc kết thúc bằng một từ bất ngờ. Một người viết bằng ngôn ngữ thứ hai trong điều kiện thi cử có mọi lý do để mặc định chọn phiên bản an toàn hơn của cả hai.

Viết bằng ngôn ngữ thứ hai một cách nhất quán cho thấy mức độ thấp hơn của cả hai, và không phải như một khiếm khuyết. Một người viết trong một ngôn ngữ bổ sung sẽ dựa vào vốn từ vựng và các mẫu câu có khả năng đúng cao nhất, vì đoán sai gây tốn kém hơn khi ngôn ngữ đó chưa hoàn toàn tự động hóa. Bài báo của Stanford đã ghi nhận thiên lệch của bộ phát hiện trích dẫn một khối nghiên cứu ngôn ngữ học ứng dụng về đúng mô hình này, được xác lập từ lâu trước khi các bộ phát hiện AI tồn tại: độ phong phú từ vựng giảm, đa dạng từ vựng giảm, và cấu trúc câu đơn giản hơn là những đặc điểm được ghi nhận, có thể đo lường của việc viết bằng ngôn ngữ thứ hai, chứ không phải dấu hiệu của bất kỳ điều gì khác.

Khoảng cách giữa văn viết của người bản ngữ và người không phải bản ngữ này biểu hiện thành một khác biệt về perplexity, chính là phép đo mà một bộ phát hiện chạy để quyết định liệu một đoạn văn có được tạo ra bởi máy hay không. Perplexity thấp hơn được đọc là giống máy hơn bất kể ai là người tạo ra, và văn viết bằng ngôn ngữ thứ hai nằm thấp hơn trên thang đó vì những lý do hoàn toàn không liên quan đến chatbot. Việc khoảng cách đó có thực sự là yếu tố thúc đẩy các bộ phát hiện hay không, thay vì chỉ là sự trùng hợp, là một câu hỏi có thể kiểm chứng. Nhóm Stanford đã kiểm tra trực tiếp điều này.

Điều Gì Đã Xảy Ra Khi Các Bài Luận Giống Nhau Được Viết Lại Với Vốn Từ Vựng Phong Phú Hơn

Các nhà nghiên cứu đã lấy cùng 91 bài luận TOEFL vốn đã kích hoạt tỷ lệ dương tính giả trung bình 61.22 percent và yêu cầu ChatGPT chỉnh sửa chúng bằng một chỉ dẫn duy nhất: "Enhance the word choices to sound more like that of a native speaker." Không có gì về nội dung, lập luận, hay ngữ pháp được yêu cầu thay đổi. Sau lần chỉnh sửa đó, tỷ lệ dương tính giả trung bình trên cùng bảy bộ phát hiện giảm xuống 11.77 percent, tức giảm gần năm mươi điểm phần trăm, và số bài luận mà mọi bộ phát hiện đều đồng loạt gắn cờ giảm từ mười tám xuống một.

Sau đó, các nhà nghiên cứu tiến hành thí nghiệm theo chiều ngược lại. Họ lấy 88 bài luận lớp tám của người bản ngữ, vốn ban đầu được các bộ phát hiện chấm đúng gần như mọi lần, và yêu cầu ChatGPT đơn giản hóa lựa chọn từ ngữ của chúng như thể được viết bởi một người không phải bản ngữ. Tỷ lệ dương tính giả trung bình trên chính những bài luận do người bản ngữ viết đó tăng từ 5.19 percent lên 56.65 percent. Các bài luận không đổi tác giả. Chỉ có vốn từ vựng thay đổi, và các bộ phát hiện đã đi theo vốn từ vựng.

Perplexity biến động cùng nhịp với tỷ lệ phân loại sai theo cả hai hướng, nó tăng mạnh khi các bài luận TOEFL được làm giàu, và giảm mạnh khi các bài luận lớp tám được đơn giản hóa. Các tác giả rút ra một kết luận thẳng thắn từ điều này, đó là thứ mà các bộ phát hiện thực sự phản ứng chưa bao giờ là tác giả. Đó là lựa chọn từ ngữ, một thuộc tính mà vốn từ vựng của bất kỳ người viết nào cũng có thể mang theo, bất kể họ học tiếng Anh ở đâu.

Mức độ thiên lệch này nhất quán đến đâu giữa các bộ phát hiện khác nhau

Bảy bộ phát hiện không đồng thuận với nhau về nhiều điều, ngoại trừ hướng mà sai số diễn ra. Tất cả đều gắn cờ các bài luận TOEFL thường xuyên hơn nhiều so với các bài luận lớp tám, nhưng với mức chênh lệch rất khác nhau.

Trình phát hiệnTỷ lệ dương tính giả, bài luận TOEFLTỷ lệ dương tính giả, bài luận của người bản ngữ
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Đây là các số liệu năm 2023, được đo trên các công cụ như chúng tồn tại khi đó. Kể từ đó, một số đã thay đổi hoàn toàn: OpenAI đã ngừng công cụ phát hiện của chính mình vào tháng 7 năm 2023, bốn tháng sau thử nghiệm này, sau khi phát hiện rằng nó chỉ gắn nhãn đúng 26 phần trăm văn bản do AI viết thực sự, trong khi vẫn gắn nhãn sai 9 phần trăm bài viết của con người. Điều không thay đổi là hướng của khoảng cách. Một chuẩn đánh giá thiên lệch rộng hơn, được xây dựng riêng để kiểm tra các bộ phát hiện trên các danh mục nhân khẩu học và ngôn ngữ, công bố vào tháng 12 năm 2025 và chạy trên bốn công cụ mã nguồn mở mới hơn, vẫn báo cáo mức recall thấp hơn một cách nhất quán đối với các nhóm nhà văn ít được đại diện.

Nhân hóa bài viết của bạn

Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.

Bắt đầu miễn phí

Thiên lệch này có còn xuất hiện trong các bộ phát hiện mới hơn không?

Nghiên cứu Stanford hiện đã cách nhiều thế hệ AI, và chính các tác giả của nghiên cứu cũng nêu rõ hạn chế này: một mẫu thử nghiệm nhỏ, và các bộ phát hiện chủ yếu được xây dựng trên GPT-2, một mô hình nhỏ hơn nhiều và cũ hơn so với mô hình đang vận hành khả năng phát hiện ngày nay. Điều đó đặt ra một câu hỏi hợp lý. Công nghệ tốt hơn đã thu hẹp khoảng cách chưa?

Thử nghiệm chuyên biệt gần đây nhất cho thấy là chưa. Trong một nghiên cứu tháng 2 năm 2026 của Đại học Sultan Qaboos, các nhà nghiên cứu đã kiểm tra hai bộ phát hiện thương mại hiện hành, Turnitin và Originality, đối với 192 văn bản pha trộn giữa bài viết EFL của sinh viên trước ChatGPT có tính xác thực, bài viết chuyên nghiệp do con người viết, văn bản do AI tạo ra, và văn bản lai giữa người và AI. Kết quả cho thấy độ chính xác tổng thể là 69 phần trăm và 61 phần trăm cho hai công cụ, trong đó độ chính xác ở hạng mục lai, kiểu viết mà một lần chỉnh sửa thực sự tạo ra, giảm xuống gần bằng 0. Nghiên cứu này cũng cho thấy một thiên lệch thứ hai diễn ra song song với thiên lệch ngôn ngữ, đó là độ chính xác đối với văn viết khoa học thấp hơn 28 đến 38 điểm phần trăm so với văn viết nhân văn.

Không phát hiện nào trong số này liên quan đến một sản phẩm đơn lẻ bị lỗi. Hai kiến trúc bộ phát hiện khác nhau, được kiểm tra cách nhau ba năm trên các tập ngữ liệu khác nhau bởi các nhóm nghiên cứu khác nhau, vẫn liên tục cho cùng một kết quả, rằng văn viết được định hình bởi quy ước thể loại hoặc bởi ngôn ngữ thứ hai nằm gần hơn với điều mà các công cụ này gọi là do máy tạo ra so với văn viết không như vậy. các công cụ miễn phí của TextPulse cho phép người viết kiểm tra cùng một hồ sơ thống kê đó trước khi bất kỳ nội dung nào đến bộ phát hiện của một cơ sở.

Bằng chứng độc lập cho thấy khoảng cách là có thật, không phải là một sai lệch do thử nghiệm

Vấn đề đầu tiên với kết quả TOEFL là có thể lập luận rằng chúng chỉ áp dụng cho một nghiên cứu thí điểm nhỏ năm 2023. Điều này đã được cùng nhóm nghiên cứu trả lời trong một nghiên cứu khác sử dụng dữ liệu không liên quan gì đến bộ phát hiện. Họ đã xem xét 1,574 bài báo được chấp nhận vào ICLR 2023, một hội nghị lớn về học máy, và giới hạn mẫu ở các tóm tắt được nộp và phản biện trước khi ChatGPT tồn tại.

Các tác giả ở những quốc gia mà tiếng Anh không phải là ngôn ngữ chính đã viết các tóm tắt với perplexity thấp hơn đáng kể so với các tác giả ở những quốc gia nói tiếng Anh bản ngữ, và sự khác biệt này vẫn tồn tại ngay cả sau khi kiểm soát mức độ mỗi bài báo được người phản biện đánh giá cao đến đâu. Mẫu này không thể đã bị định hình bởi bất kỳ ai cố gắng nghe giống hoặc kém giống một chatbot hơn. ChatGPT còn cách thời điểm phát hành ba tháng khi cửa sổ nộp bài kết thúc. Khoảng cách perplexity giữa văn bản học thuật của người bản ngữ và người không bản ngữ không phải là điều mà các bộ phát hiện tự bịa ra. Đó là điều mà chúng kế thừa.

Một phân tích thống kê năm 2026 về phát hiện AI như một bài toán kiểm định đưa ra một phiên bản chính thức của cùng kết luận đó. Bất cứ khi nào một nhóm người viết tạo ra ngôn ngữ mà, xét trên tổng thể, chồng lấn với đầu ra điển hình của AI, thì bất kỳ bộ phát hiện nào có năng lực thực sự để bắt văn bản do AI viết đều phải mang theo tỷ lệ dương tính giả cao hơn đối với chính nhóm đó, một tính chất toán học của việc kiểm định một quần thể đa dạng hơn là một khiếm khuyết của bất kỳ công cụ nào. Những người viết tiếng Anh không bản ngữ là trường hợp được ghi nhận rõ ràng nhất của chính sự chồng lấn đó.

Điều này có ý nghĩa gì đối với người viết bằng ngôn ngữ thứ hai

Không có điều nào trong số này là một lập luận cho việc viết ít giống chính mình hơn. Đây là lý do để biết thực sự điều gì đang được đo lường trước khi một điểm số xuất hiện. Một bộ phát hiện đọc văn xuôi của bạn là có thể dự đoán được đang ghi nhận một tính chất thống kê có thật của văn viết bằng ngôn ngữ thứ hai, chứ không phải bằng chứng rằng bạn đã dùng một công cụ mà bạn không hề dùng.

Các nhà nghiên cứu Stanford đã thực hiện nghiên cứu ban đầu lưu ý một hệ quả khó chịu từ chính phát hiện của họ, cùng một điều chỉnh từ vựng làm giảm rủi ro dương tính giả cũng là kiểu chỉnh sửa mà một người viết có thể muốn vì những lý do hoàn toàn khác, cách diễn đạt rõ ràng hơn, một từ chính xác hơn, bất kể bất kỳ bộ phát hiện nào. Trang dành cho các nhà văn học thuật ESL của TextPulse trình bày kiểu chỉnh sửa đó trông như thế nào trên các câu thực tế, tách biệt khỏi mọi điều liên quan đến điểm phát hiện.

Các bộ phát hiện mới hơn đang bắt đầu tính đến mô hình này một cách rõ ràng. Pangram, một trong những đơn vị thương mại gia nhập thị trường gần đây hơn, nêu trong tài liệu kỹ thuật của chính mình rằng bộ phân loại của họ không thiên lệch chống lại những người viết tiếng Anh không phải bản ngữ, dù tuyên bố đó đến từ nhà cung cấp chứ không phải từ thử nghiệm độc lập. Một trình kiểm tra perplexity miễn phí cho thấy cùng một phép đo nền tảng mà bất kỳ công cụ nào trong số này đều tính từ một đoạn viết, mà không gửi bản thảo đi nơi khác trước.

Hai công cụ thực hành đi kèm nằm trong cùng một nhóm: khi nào dùng a, an và the, vốn là nguồn phổ biến nhất duy nhất của mô hình này, và cách nghe tự nhiên trong văn viết học thuật tiếng Anh nói chung hơn.

Nghiên cứu vẫn tiếp tục tích lũy theo cùng một hướng sau hai năm, qua các nhóm khác nhau, các bộ phát hiện khác nhau, và các thiết kế thử nghiệm khác nhau. Điều chưa theo kịp là một phản ứng thể chế được áp dụng rộng rãi: kiểm tra một bộ phát hiện đối với một phổ người viết trước khi tin cậy nó để đánh giá bất kỳ người nào trong số họ, thay vì sau khi một sinh viên cụ thể đã bị buộc tội. Cho đến khi điều đó trở thành thông lệ, gánh nặng chứng minh một cảnh báo sai là sai sẽ rơi đúng vào những người viết mà nghiên cứu này cho rằng có khả năng cao nhất sẽ nhận một cảnh báo như vậy.

XLinkedInFacebook

Câu hỏi thường gặp

Các bộ phát hiện AI thiên lệch chống lại người không phải bản ngữ là một phát hiện đã qua bình duyệt, không phải suy đoán. Một nghiên cứu Stanford năm 2023 cho thấy bảy bộ phát hiện GPT được dùng rộng rãi đã phân loại sai trung bình 61.22 phần trăm các bài luận TOEFL thật là do AI tạo ra, trong khi đọc đúng gần như mọi bài luận của người bản ngữ.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Cập nhật về AI humanization

Nhận mẹo về viết học thuật, phát hiện AI và humanization được gửi thẳng vào hộp thư của bạn.

Không spam. Có thể hủy đăng ký bất cứ lúc nào.