AI Detection

Vì sao các bộ phát hiện AI thiên lệch chống lại người viết tiếng Anh không phải bản ngữ

Một nghiên cứu Stanford năm 2023 cho thấy các bộ phát hiện AI đọc sai bài viết tiếng Anh lưu loát của người không phải bản ngữ là do máy tạo ra với tỷ lệ cao hơn nhiều so với bài viết của người bản ngữ. Dưới đây là cơ chế đứng sau khoảng cách đó, và điều gì đã xảy ra khi cùng những bài luận ấy được viết lại với vốn từ phong phú hơn.

7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

Các bộ phát hiện AI thiên lệch chống lại người nói không phải bản ngữ không phải là một lời phàn nàn mang tính chủ quan. Một nghiên cứu Stanford năm 2023 đã được bình duyệt đo lường điều này trực tiếp. Các nhà nghiên cứu đã chạy bảy bộ phát hiện GPT được dùng rộng rãi trên 91 bài luận TOEFL thực do những người nói tiếng Anh không phải bản ngữ viết và 88 bài luận do học sinh lớp tám ở Mỹ viết, sau đó so sánh điểm số của từng nhóm.

Các bộ phát hiện đọc các bài luận lớp tám gần như chính xác mọi lần. Với các bài luận TOEFL, do những người trưởng thành viết, những người này đã vượt qua một kỳ thi năng lực tiếng Anh ở trình độ sau đại học, bảy công cụ tương tự cho ra tỷ lệ dương tính giả trung bình là 61.22 percent. Tám mươi chín trong số chín mươi mốt bài luận, gần 98 percent, đã bị gắn cờ là do AI tạo ra bởi ít nhất một trong bảy công cụ.

Tổng quan của TextPulse về bằng chứng rộng hơn về độ chính xác của bộ phát hiện AI trình bày phát hiện chính đó và các vụ kiện mà nó sau này đã góp phần dẫn tới. Điều hầu như bị bỏ qua ở mọi nơi khi nghiên cứu này được trích dẫn là cơ chế, tại sao văn xuôi của một người nói tiếng Anh ở trình độ sau đại học lại bị đọc như do máy tạo ra ngay từ đầu, và điều gì thay đổi khi nó không còn bị đọc theo cách đó nữa.

Các Bộ Phát Hiện AI Thiên Lệch Chống Lại Người Nói Không Phải Bản Ngữ, Cơ Chế

Một bộ phát hiện không bao giờ đọc để tìm ý nghĩa. Nó đọc mức độ dự đoán được của từng từ, dựa trên những từ đứng trước nó, và chấm một đoạn văn thấp khi mô hình có thể đã đoán trước phần lớn nội dung đó. Sự đa dạng từ vựng, tức mức độ rộng của vốn từ mà người viết sử dụng thay vì lặp lại một tập hợp nhỏ các từ an toàn, và khả năng dự đoán cú pháp, tức mức độ chặt chẽ mà cấu trúc câu đi theo mẫu phổ biến nhất của ngôn ngữ thay vì biến đổi nó, là hai đặc tính của việc tạo ngôn ngữ làm kéo điểm số đó xuống.

Sự phân biệt này quan trọng vì hai hiện tượng xuất hiện khác nhau trên trang. Đa dạng từ vựng là về chính các từ: một người viết dùng 'obtain,' 'acquire,' và 'secure' trong ba câu khác nhau sẽ được đọc là đa dạng hơn người viết 'get' ba lần, ngay cả khi các câu còn lại giống hệt nhau. Tính dự đoán cú pháp là về cấu trúc: chủ ngữ, động từ, tân ngữ, lặp đi lặp lại, thay vì một câu mở đầu bằng mệnh đề phụ hoặc kết thúc bằng một từ bất ngờ. Một người viết ngôn ngữ thứ hai làm bài trong điều kiện thi cử có mọi lý do để mặc định phiên bản an toàn hơn của cả hai.

Viết bằng ngôn ngữ thứ hai một cách nhất quán cho thấy ít hơn ở cả hai mặt, và không phải như một khiếm khuyết. Một người viết sử dụng một ngôn ngữ bổ sung sẽ dựa vào vốn từ vựng và các mẫu câu có khả năng đúng cao nhất, vì đoán sai phải trả giá nhiều hơn khi ngôn ngữ đó chưa hoàn toàn tự động hóa. Bài báo của Stanford đã ghi nhận thiên lệch của bộ phát hiện dẫn chiếu một khối nghiên cứu ngôn ngữ học ứng dụng về đúng mô hình này, đã được xác lập từ lâu trước khi các bộ phát hiện AI tồn tại: độ phong phú từ vựng giảm, đa dạng từ vựng giảm, và cấu trúc câu đơn giản hơn là những đặc điểm được ghi nhận, có thể đo lường của việc viết bằng ngôn ngữ thứ hai, chứ không phải dấu hiệu của bất cứ điều gì khác.

Khoảng cách giữa bài viết của người bản ngữ và người không phải bản ngữ này xuất hiện như một khác biệt về perplexity, cùng một phép đo mà một bộ phát hiện dùng để quyết định liệu một đoạn văn có do máy tạo ra hay không. perplexity thấp hơn được đọc là giống máy hơn bất kể ai là người tạo ra, và bài viết bằng ngôn ngữ thứ hai nằm thấp hơn trên thang đo đó vì những lý do không liên quan gì đến chatbot. Việc khoảng cách đó có thực sự là thứ thúc đẩy các bộ phát hiện hay không, thay vì chỉ là sự trùng hợp, là một câu hỏi có thể kiểm chứng. Nhóm Stanford đã kiểm tra trực tiếp điều này.

Điều Gì Đã Xảy Ra Khi Cùng Những Bài Luận Đó Được Viết Lại Với Vốn Từ Vựng Phong Phú Hơn

Các nhà nghiên cứu đã lấy cùng 91 bài luận TOEFL vốn đã kích hoạt tỷ lệ dương tính giả trung bình 61.22 percent và yêu cầu ChatGPT chỉnh sửa chúng bằng một chỉ dẫn duy nhất: "Enhance the word choices to sound more like that of a native speaker." Không có gì về nội dung, lập luận, hay ngữ pháp được yêu cầu thay đổi. Sau lần chỉnh sửa đó, tỷ lệ dương tính giả trung bình trên cùng bảy bộ phát hiện giảm xuống 11.77 percent, tức giảm gần năm mươi điểm phần trăm, và số bài luận mà mọi bộ phát hiện đều đồng loạt gắn cờ giảm từ mười tám xuống còn một.

Sau đó, các nhà nghiên cứu tiến hành thí nghiệm theo chiều ngược lại. Họ lấy 88 bài luận lớp tám của người bản ngữ, vốn ban đầu được các bộ phát hiện chấm đúng gần như mọi lần, và yêu cầu ChatGPT đơn giản hóa lựa chọn từ ngữ của chúng như thể được viết bởi một người không phải bản ngữ. Tỷ lệ dương tính giả trung bình trên chính những bài luận do người bản ngữ viết đó tăng từ 5.19 percent lên 56.65 percent. Các bài luận không đổi tác giả. Chỉ có vốn từ vựng thay đổi, và các bộ phát hiện đã đi theo vốn từ vựng.

Perplexity biến động song song với tỷ lệ phân loại sai theo cả hai hướng, nó tăng mạnh khi các bài luận TOEFL được làm giàu, và giảm mạnh khi các bài luận lớp tám được đơn giản hóa. Các tác giả rút ra một kết luận thẳng thắn từ điều này, đó là thứ mà các bộ phát hiện thực sự phản ứng chưa bao giờ là tác giả. Đó là lựa chọn từ ngữ, một đặc tính mà vốn từ của bất kỳ người viết nào cũng có thể mang theo, bất kể họ học tiếng Anh ở đâu.

Mức độ thiên lệch này nhất quán đến đâu giữa các bộ phát hiện khác nhau

Bảy bộ phát hiện không đồng thuận nhiều với nhau, ngoại trừ việc chúng cùng nhất trí về hướng của sai số. Mỗi bộ đều gắn cờ các bài luận TOEFL thường xuyên hơn nhiều so với các bài luận lớp tám, nhưng với mức chênh lệch rất khác nhau.

DetectorTỷ lệ dương tính giả, bài luận TOEFLTỷ lệ dương tính giả, bài luận của người bản ngữ
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

Đây là các số liệu của năm 2023, được đo trên các công cụ như chúng tồn tại khi đó. Kể từ đó, một số công cụ đã thay đổi hoàn toàn: OpenAI đã ngừng bộ phát hiện của chính mình vào tháng 7 năm 2023, bốn tháng sau thử nghiệm này, sau khi phát hiện rằng nó chỉ gắn nhãn đúng 26 phần trăm văn bản do AI viết thực sự, trong khi vẫn gắn nhãn sai 9 phần trăm văn bản của con người. Điều chưa thay đổi là hướng của khoảng cách. Một chuẩn đánh giá thiên lệch rộng hơn, được xây dựng riêng để kiểm tra các bộ phát hiện trên các nhóm nhân khẩu học và ngôn ngữ, công bố vào tháng 12 năm 2025 và chạy trên bốn công cụ mã nguồn mở mới hơn, vẫn báo cáo độ thu hồi thấp hơn một cách nhất quán đối với các nhóm người viết ít được đại diện.

Nhân hóa bài viết của bạn

Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.

Bắt đầu miễn phí

Thiên lệch này có còn xuất hiện trong các bộ phát hiện mới hơn không?

Nghiên cứu của Stanford hiện đã cũ qua nhiều thế hệ AI, và chính các tác giả của nghiên cứu cũng nêu rõ hạn chế này: một mẫu thử nghiệm nhỏ, và các bộ phát hiện chủ yếu được xây dựng trên GPT-2, một mô hình nhỏ hơn nhiều và cũ hơn so với mô hình đang cung cấp năng lực phát hiện ngày nay. Điều đó đặt ra một câu hỏi hợp lý. Công nghệ tốt hơn đã thu hẹp khoảng cách chưa?

Bài kiểm tra chuyên biệt gần đây nhất cho thấy là chưa. Trong một nghiên cứu tháng 2 năm 2026 của Sultan Qaboos University, các nhà nghiên cứu đã thử nghiệm hai bộ phát hiện thương mại hiện hành, Turnitin và Originality, trên 192 văn bản kết hợp giữa bài viết EFL của sinh viên trước ChatGPT có tính xác thực, bài viết của con người chuyên nghiệp, văn bản do AI tạo ra, và văn bản lai giữa con người và AI. Kết quả cho thấy độ chính xác tổng thể là 69 phần trăm và 61 phần trăm cho hai công cụ, trong đó độ chính xác ở nhóm lai, kiểu viết mà một lần biên tập thực sự tạo ra, giảm xuống gần bằng 0. Nghiên cứu này cũng cho thấy một thiên lệch thứ hai song hành với thiên lệch ngôn ngữ, đó là độ chính xác đối với văn bản khoa học thấp hơn 28 đến 38 điểm phần trăm so với văn bản nhân văn.

Không phát hiện nào trong số này nói về một sản phẩm đơn lẻ bị lỗi. Hai kiến trúc bộ phát hiện khác nhau, được thử nghiệm cách nhau ba năm trên các tập dữ liệu khác nhau bởi các nhóm nghiên cứu khác nhau, vẫn liên tục cho ra cùng một kết quả, đó là văn bản được định hình bởi quy ước thể loại hoặc bởi ngôn ngữ thứ hai nằm gần hơn với điều mà các công cụ này gọi là do máy tạo ra so với văn bản không như vậy. các công cụ miễn phí của TextPulse cho phép người viết kiểm tra cùng một hồ sơ thống kê đó trước khi bất kỳ phần nào trong số đó đến được bộ phát hiện của một cơ sở.

Bằng chứng độc lập cho thấy khoảng cách là có thật, không phải là một sai lệch do thử nghiệm

Vấn đề đầu tiên với kết quả TOEFL là có thể lập luận rằng chúng chỉ áp dụng cho một nghiên cứu thí điểm nhỏ năm 2023. Điều này đã được cùng nhóm nghiên cứu trả lời trong một nghiên cứu khác sử dụng dữ liệu hoàn toàn không liên quan đến bộ phát hiện. Họ đã xem xét 1,574 bài báo được chấp nhận vào ICLR 2023, một hội nghị lớn về học máy, và giới hạn mẫu ở các bản tóm tắt được nộp và phản biện trước khi ChatGPT tồn tại.

Các tác giả ở những quốc gia nơi tiếng Anh không phải là ngôn ngữ chính đã viết các bản tóm tắt với perplexity thấp hơn đáng kể so với các tác giả ở những quốc gia nói tiếng Anh bản ngữ, và sự khác biệt này vẫn tồn tại ngay cả sau khi kiểm soát mức độ mỗi bài báo được người phản biện đánh giá cao đến đâu. Mẫu này không thể đã bị định hình bởi bất kỳ ai cố gắng nghe giống hoặc kém giống một chatbot hơn. ChatGPT còn cách thời điểm phát hành ba tháng khi cửa sổ nộp bài kết thúc. Khoảng cách perplexity giữa văn bản học thuật của người bản ngữ và người không bản ngữ không phải là điều do các bộ phát hiện bịa ra. Đó là điều mà chúng kế thừa.

Một phân tích thống kê năm 2026 về phát hiện AI như một bài toán kiểm định đưa ra một phiên bản chính thức của cùng kết luận đó. Bất cứ khi nào một nhóm người viết tạo ra ngôn ngữ mà, xét trên tổng thể, chồng lấn với đầu ra AI điển hình, thì bất kỳ bộ phát hiện nào có năng lực thực sự để bắt văn bản do AI viết đều phải mang tỷ lệ dương tính giả cao hơn đối với riêng nhóm đó, một tính chất toán học của việc kiểm định một quần thể đa dạng hơn là một khiếm khuyết của bất kỳ công cụ nào. Những người viết tiếng Anh không bản ngữ là trường hợp được ghi nhận rõ ràng nhất của chính sự chồng lấn đó.

Điều này có ý nghĩa gì đối với người viết bằng ngôn ngữ thứ hai

Không có điều nào trong số này là một lập luận cho việc viết ít giống chính mình hơn. Đây là lý do để biết chính xác điều gì đang được đo lường trước khi một điểm số xuất hiện. Một bộ phát hiện đọc văn xuôi của bạn là có thể dự đoán được đang ghi nhận một tính chất thống kê có thật của việc viết bằng ngôn ngữ thứ hai, chứ không phải bằng chứng rằng bạn đã dùng một công cụ mà bạn không hề dùng.

Các nhà nghiên cứu Stanford đã thực hiện nghiên cứu ban đầu lưu ý một hàm ý khó chịu từ chính phát hiện của họ: sự điều chỉnh từ vựng làm giảm nguy cơ dương tính giả cũng chính là kiểu chỉnh sửa mà một người viết có thể muốn thực hiện vì những lý do hoàn toàn khác, cách diễn đạt rõ ràng hơn, một từ chính xác hơn, bất kể bất kỳ bộ phát hiện nào. Trang của TextPulse dành cho người viết học thuật ESL trình bày kiểu chỉnh sửa đó trông như thế nào trên các câu thực tế, tách biệt khỏi mọi điều liên quan đến điểm phát hiện.

Các bộ phát hiện mới hơn đang bắt đầu tính đến mô hình này một cách rõ ràng. Pangram, một trong những nhà cung cấp thương mại xuất hiện gần đây hơn, nêu trong tài liệu kỹ thuật của chính mình rằng bộ phân loại của nó không thiên lệch đối với những người viết tiếng Anh không phải bản ngữ, dù tuyên bố đó đến từ nhà cung cấp chứ không phải từ thử nghiệm độc lập. Một bộ kiểm tra perplexity miễn phí cho thấy cùng một phép đo nền tảng mà bất kỳ công cụ nào trong số này đều tính từ một đoạn viết, mà không gửi bản nháp đi đâu trước.

Hai công cụ hỗ trợ thực tiễn nằm trong cùng một nhóm: khi nào dùng a, an và the, vốn là nguồn phổ biến nhất duy nhất của mô hình này, và làm thế nào để nghe tự nhiên trong văn viết học thuật bằng tiếng Anh nói chung hơn.

Nghiên cứu vẫn tiếp tục tích lũy theo cùng một hướng sau hai năm, trên các nhóm nghiên cứu khác nhau, các bộ phát hiện khác nhau, và các thiết kế thử nghiệm khác nhau. Điều chưa theo kịp là một phản ứng thể chế được áp dụng rộng rãi: kiểm tra một bộ phát hiện đối với một loạt người viết trước khi tin cậy nó với bất kỳ người nào trong số họ, thay vì sau khi một sinh viên cụ thể đã bị cáo buộc. Cho đến khi điều đó trở thành thông lệ, gánh nặng chứng minh một cảnh báo sai là sai rơi đúng vào những người viết mà nghiên cứu này cho rằng có khả năng cao nhất sẽ nhận được một cảnh báo như vậy.

XLinkedInFacebook

Câu hỏi thường gặp

Các bộ phát hiện AI thiên lệch chống lại người không phải bản ngữ là một phát hiện đã qua bình duyệt, không phải suy đoán. Một nghiên cứu Stanford năm 2023 cho thấy bảy bộ phát hiện GPT được dùng rộng rãi đã phân loại sai trung bình 61.22 phần trăm các bài luận TOEFL thực là do con người viết thành do AI tạo ra, trong khi đọc đúng các bài luận của người bản ngữ gần như mọi lần.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Bộ phát hiện AI thiên lệch với người không phải bản ngữ: Nguyên nhân | TextPulse.ai