AI Detection

Bộ phát hiện AI có chính xác không? Dương tính giả và thiên lệch

Các nhà cung cấp công bố tỷ lệ dương tính giả dưới 1 phần trăm. Các nhà nghiên cứu độc lập thử cùng bộ phát hiện trên bài viết tiếng Anh của người không bản ngữ ghi nhận tỷ lệ trên 60 phần trăm. Đây là điều bằng chứng cho thấy.

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin tuyên bố rằng tỷ lệ dương tính giả của họ thấp hơn 1%. Một nhóm các nhà nghiên cứu độc lập đã thử nghiệm nhiều bộ phát hiện trên một phạm vi rộng hơn các mẫu viết của người không phải là người bản ngữ tiếng Anh. Họ phát hiện rằng tỷ lệ dương tính giả trung bình vượt quá 60% đối với cùng loại bài viết đó. Cả hai con số đều là thật, cả hai đều đã được công bố, và cả hai đều liên quan đến các bộ phát hiện bán cho cùng một thị trường. Các bộ phát hiện AI có chính xác không? Điều đó phụ thuộc vào quần thể nào đã được thử nghiệm, bạn đã dùng bộ phát hiện nào, và nhà cung cấp của bạn đã định nghĩa nó như thế nào ngay từ đầu.

Bài viết này sẽ không giải thích lại cách một bộ phát hiện tính toán điểm số đó. Cơ chế, perplexity, xác suất token, cách bộ phân loại được huấn luyện, đã được trình bày chi tiết ở nơi khác, và nên đọc trước nếu bạn chưa đọc. Điều quan trọng ở đây là điều gì xảy ra khi điểm số đã tồn tại: nó sai bao nhiêu lần, nó sai về bài viết của ai nhiều nhất, và một cáo buộc sai thực sự gây tốn kém gì cho một người không làm gì sai.

Các bộ phát hiện AI có chính xác không?

Không nhất quán, và khoảng cách giữa các tuyên bố tiếp thị và thử nghiệm độc lập đã được ghi nhận rõ ràng. Một nhóm các nhà nghiên cứu do Debora Weber-Wulff dẫn đầu đã công bố phát hiện của họ về 14 công cụ phát hiện, gồm 12 công cụ miễn phí và hai công cụ thương mại, được thử nghiệm đối với một tập hợp văn bản do con người và ChatGPT tạo ra vào năm 2023. Họ phát hiện rằng không có công cụ nào trong số này chính xác hoặc đáng tin cậy, với một thiên lệch sẵn có là gán văn bản do máy tạo ra là do con người viết thay vì ngược lại. Hai trong số các công cụ thương mại được đưa vào thử nghiệm này là Turnitin và PlagiarismCheck. Tất cả các công cụ trong thử nghiệm này đều hoạt động kém hơn khi văn bản được diễn đạt lại.

Nhưng sau hai năm, tình hình không hề trì trệ. Một working paper từ Booth School của University of Chicago, do Brian Jabarian và Alex Imas thực hiện, đã đưa ba công cụ mới, Pangram, GPTZero và Originality.ai, cùng một đối thủ mã nguồn mở vào thử nghiệm với gần 2.000 đoạn viết do con người tạo ra từ blog, tin tức, bài đánh giá và tiểu thuyết. Trong điều kiện kiểm tra được kiểm soát, công cụ tốt nhất trong nhóm này chưa bao giờ giảm xuống dưới độ chính xác 99.8 percent và giữ tỷ lệ dương tính giả ở mức thấp. Mô hình mã nguồn mở hoạt động tốt ngang một người đoán ngẫu nhiên. Tình hình thực sự đã tốt hơn. Đại khái là vậy. Chỉ một chút thôi.

Nhưng điểm mấu chốt nằm ở từ được kiểm soát. Các đoạn văn dùng để benchmark là sạch, đầy đủ và được tạo ra trong những điều kiện đã biết. Một bài luận được nộp thì không đáng tin cậy có đủ cả ba đặc điểm đó. Kết quả trong thế giới thực có thể không giống hệt kết quả trong phòng thí nghiệm, như chính giám đốc sản phẩm của Turnitin đã công khai nói, dù đó là một sự thừa nhận hiếm hoi và hữu ích từ một nhà cung cấp. Phần tiếp theo đặt các con số của nhà cung cấp cạnh các con số độc lập để khoảng cách hiện ra thay vì chỉ được khẳng định.

Các tuyên bố của nhà cung cấp so với thử nghiệm độc lập

Bảng dưới đây đặt những gì bốn bộ phát hiện tự tuyên bố về mình cạnh những gì các nhà nghiên cứu độc lập đo được khi họ kiểm tra trực tiếp các công cụ. Hãy đọc hai cột ở giữa cùng nhau, chứ không chỉ đọc riêng cột của nhà cung cấp.

DetectorĐộ chính xác do nhà cung cấp công bốQuan sát độc lậpNhà cung cấp nói gì về dương tính giả
TurnitinNgưỡng tin cậy 98% trước khi gắn cờ, dưới 1% dương tính giả ở cấp tài liệuKhoảng 80% độ chính xác, tốt nhất trong 12 công cụ trong một so sánh năm 2023, trên một phiên bản sớm hơn của công cụDưới 1% ở cấp tài liệu khi vượt ngưỡng 20% do AI viết, khoảng 4% ở cấp câu
GPTZeroPhát hiện văn bản AI 95.7% với tỷ lệ dương tính giả 1% trên chuẩn RAID độc lập96% độ chính xác trên các đoạn ngắn, tỷ lệ dương tính giả dưới 1% trong một nghiên cứu năm 2025 của University of Chicago BoothBáo cáo tỷ lệ dương tính giả 1% trên chuẩn RAID
Originality.ai99% độ chính xác, tỷ lệ dương tính giả 0.5% (mô hình Lite), 1.5% (mô hình Turbo)Tỷ lệ dương tính giả dưới 1%, nhưng bỏ sót 10% đến 40% văn bản do AI viết trong cùng nghiên cứu BoothCông bố các số liệu dương tính giả riêng theo từng cấp mô hình
PangramCác tỷ lệ lỗi mà công cụ này nói là thấp hơn hơn 38 lần so với các công cụ cạnh tranh, khẳng định không có thiên lệch đối với người viết tiếng Anh không phải bản ngữĐộ chính xác không bao giờ thấp hơn 99.8%, tỷ lệ dương tính giả gần bằng 0, trong nghiên cứu BoothKhẳng định tỷ lệ dương tính giả gần bằng 0 trên 10 miền văn bản và 8 mô hình ngôn ngữ

Hai điểm nổi bật. Thứ nhất, tất cả các số liệu của nhà cung cấp đều đến từ một phòng thí nghiệm do chính nhà cung cấp kiểm soát, còn các số liệu Booth đến từ những nhà nghiên cứu không có gì để bán. Thứ hai, Turnitin hoàn toàn không xuất hiện ở cột giữa đó vì nghiên cứu năm 2025 không kiểm tra công cụ này. Trong bảng, số liệu độc lập của nó dựa trên một so sánh năm 2023 trước đó nhưng được thực hiện trên một phiên bản cũ hơn của công cụ, vì vậy hãy nhớ điều này khi xem bảng như một so sánh tương đương trực tiếp.

Khả năng phát hiện AI của Turnitin chính xác đến mức nào?

Turnitin không công bố một con số độ chính xác duy nhất. Thay vào đó, công ty công bố một ngưỡng và một sự đánh đổi. Công ty đã nói rằng họ chỉ gắn cờ một tài liệu khi họ tin chắc 98 phần trăm rằng phần bị gắn cờ là do AI viết, và rằng ngưỡng này là điều giữ cho tỷ lệ dương tính giả ở cấp độ tài liệu dưới 1 phần trăm. Turnitin đã ước tính rằng họ phát hiện khoảng 85 phần trăm bài viết có sự hỗ trợ của AI, và cố ý để phần còn lại lọt qua thay vì mạo hiểm đưa ra một cáo buộc sai.

Tỷ lệ phần trăm thực tế của các dương tính giả mà Turnitin trả về ở cấp độ câu, nơi giao diện làm nổi bật các dòng cụ thể thay vì toàn bộ tài liệu, thực ra gần với 4 phần trăm hơn. Đây là con số đáng biết nếu một giáo sư chụp màn hình một đoạn văn bị gắn cờ riêng lẻ thay vì một điểm số cho toàn bộ tài liệu, vì một câu được làm nổi bật có khả năng sai cao hơn đáng kể so với điểm số của toàn bộ tài liệu đặt bên cạnh nó.

Cũng đáng lưu ý rằng Turnitin đã thừa nhận trực tiếp khoảng cách này. Họ nhận thấy rằng các kết quả thực tế ban đầu của họ, đặc biệt đối với các tài liệu ngắn hơn, có tỷ lệ dương tính giả cao hơn so với dự kiến dựa trên các thử nghiệm trong phòng thí nghiệm. Vì vậy, họ đã điều chỉnh độ dài tài liệu tối thiểu để được chấm điểm từ 150 lên 300 từ. Đó là việc một nhà cung cấp tự điều chỉnh sản phẩm của mình vì con số đã công bố không đứng vững khi ra ngoài phòng thí nghiệm, và điều đó nói lên nhiều điều không kém gì bất kỳ nghiên cứu độc lập nào.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Thực tế một dương tính giả gây tốn kém gì cho sinh viên

Điều này đã xảy ra với một sinh viên MBA điều hành tại Trường Quản lý Yale. Sinh viên này đã bị cáo buộc vi phạm, theo nghĩa đen nhất có thể. Công cụ phát hiện liên quan là GPTZero. Bài thi cuối kỳ của sinh viên trong một khóa học tài chính đã bị một trợ giảng gắn cờ vì người này cho rằng bài viết dài và cầu kỳ, với dấu câu và ngữ pháp gần như hoàn hảo. Và vị giáo sư này đã đưa bài đó qua GPTZero, công cụ chấm các câu trả lời là có khả năng do AI tạo ra.

Ông ấy trượt môn học và bị đình chỉ trong một năm. Đơn kiện của ông, được nộp tại tòa án liên bang vào tháng 2 năm 2025, cho rằng chính sách của Yale tự nó hạn chế việc sử dụng các công cụ như GPTZero vì đúng lý do này, tức tỷ lệ dương tính giả đã được ghi nhận đối với người nói tiếng Anh không phải bản ngữ, và rằng ông đã sử dụng nó trái với chính sách đó. Đơn nộp của ông cũng dẫn chứng rằng GPTZero đã trả về điểm 100 phần trăm do AI tạo ra đối với bài viết học thuật của cựu hiệu trưởng đại học của Yale và của trưởng khoa kinh doanh.

Thẩm phán đã từ chối ban hành lệnh cấm tạm thời vào tháng 5 năm 2025. Vụ việc vẫn chưa được giải quyết, tính đến thời điểm tôi viết. Nguyên đơn, một công dân Pháp, cho rằng chính sự thiên lệch đã biết đối với người nói tiếng Anh không phải bản ngữ đã khiến bài viết của ông có kết quả như vậy. Đó là điều chúng ta xem xét ở phần tiếp theo. Điều không còn tranh cãi là cái giá phải trả, một năm bị mất khỏi chương trình cấp bằng, một điểm trượt, chi phí pháp lý, và nhiều tháng tranh cãi về một điểm số thay vì theo đuổi việc lấy bằng. Tỷ lệ dương tính giả 1 phần trăm nghe có vẻ nhỏ cho đến khi một quần thể lớn biến nó thành chuyện của một cá nhân cụ thể.

Tại sao các bộ phát hiện AI lại phân loại sai người nói tiếng Anh không phải bản ngữ?

Rất tệ, và với mức chênh lệch rất lớn. Đó là kết luận của nghiên cứu đầu tiên định lượng được vấn đề này. Các nhà nghiên cứu Stanford đã chạy bảy bộ phát hiện GPT được sử dụng rộng rãi đối với 91 bài luận TOEFL của người nói tiếng Anh không phải bản ngữ và 88 bài luận của học sinh lớp 8 ở Mỹ. Các bộ phát hiện đọc đúng các bài luận lớp 8 gần như mọi lần. Khi xét đến các bài luận TOEFL, vốn do người lớn viết và đủ thành thạo để làm bài kiểm tra tiếng Anh ở trình độ sau đại học, các bộ phát hiện có tỷ lệ dương tính giả trung bình là 61.3 phần trăm. Tám mươi chín trong số 91 bài luận bị ít nhất một trong bảy bộ phát hiện gắn cờ là do GPT tạo ra, 18 trong số đó bị cả bảy bộ phát hiện gắn cờ.

Cơ chế này giống hệt cơ chế chi phối phần còn lại của việc phát hiện, vốn từ vựng có thể dự đoán và cấu trúc câu đơn giản được đọc là perplexity thấp, và perplexity thấp được đọc là do máy tạo ra, bất kể ai đang cầm bút. Những người viết bằng ngôn ngữ thứ hai dựa vào các cách diễn đạt đã được thiết lập vững chắc vì đó chính là hình thức mà sự lưu loát trong một ngôn ngữ bổ sung thực sự biểu hiện, và đó chính xác là kiểu hồ sơ mà một bộ phát hiện được xây dựng để gắn cờ.

Những người viết ở vị trí đó không được hỗ trợ tốt bởi lời khuyên chỉ đơn giản là viết tự nhiên hơn, vì tự nhiên chính là điều đã bị gắn cờ. Trang dành cho nhà văn học thuật ESL của TextPulse page for ESL academic writers trình bày sâu hơn các mẫu diễn đạt đứng sau rủi ro đó, bao gồm cả những gì thay đổi chúng mà không làm thay đổi ý nghĩa của câu.

Đây không phải là một trường hợp đơn lẻ. Vào tháng 12 năm 2025, một benchmark mới đã được công bố, được thiết kế rõ ràng để đánh giá thiên lệch trong các bộ phát hiện này. Nó bao gồm hơn 200,000 mẫu trên nhiều nhóm nhân khẩu học và ngôn ngữ khác nhau. Mặc dù đã cách nghiên cứu đầu tiên của Stanford hai năm và bao gồm nhiều phiên bản mô hình khác nhau của cùng các bộ phát hiện đó, benchmark này cho thấy thiên lệch đối với người học tiếng Anh vẫn còn tồn tại.

Điều này không đúng với tất cả các nhà cung cấp. Tài liệu kỹ thuật của chính Pangram nêu rằng bộ phân loại của họ không thiên lệch chống lại những người nói tiếng Anh không phải bản ngữ. Các nhà nghiên cứu của Chicago Booth đã không tự mình kiểm tra độc lập tuyên bố này, nhưng điều đó cho thấy thế hệ bộ phát hiện mới hơn đang được xây dựng với vấn đề này trong tầm nhìn thay vì phớt lờ nó.

Nếu bạn muốn xem bài viết của chính mình đang ở đâu trước khi bất kỳ ai khác chấm điểm nó, một free perplexity checker sẽ cho bạn cùng một con số nền tảng mà một bộ phát hiện sẽ tính toán, mà không cần nộp bất cứ thứ gì cho một cơ sở trước tiên.

Ai khác bị gắn cờ, và vì sao

Người không phải là người bản ngữ tiếng Anh mang rủi ro được ghi nhận lớn nhất, nhưng cùng một logic thống kê cũng bắt được các kiểu viết khác. Nhóm của Weber-Wulff phát hiện rằng cả 14 công cụ mà họ thử đều kém chính xác hơn khi họ chạy chúng trên các văn bản được diễn đạt lại, điều này mô tả một phần đáng kể của văn bản học thuật đã được người hiệu đính, biên tập viên, hoặc bút đỏ của người hướng dẫn chỉnh sửa trước khi bất kỳ ai chạy một bộ phát hiện trên đó.

Không có gì trong số này có nghĩa là con số đó vô nghĩa, chỉ là nó cần được xác nhận trước khi nó có ý nghĩa gì về một cá nhân cụ thể. Nếu bạn có một văn bản đọc như đồng nhất, độ dài câu tương tự nhau, nhịp điệu tương tự xuyên suốt, nó sẽ được chấm là giống máy hơn bất kể ai đã viết nó hay vì sao. Điều này có thể được kiểm tra trực tiếp bằng một free burstiness checker thay vì đoán mò.

Chính sách phát hiện AI có thể biện minh trông như thế nào

Yale đã có một chính sách được cho là hạn chế các công cụ như GPTZero, gần với những lý do mà bài viết này đã nêu ra, một tỷ lệ dương tính giả đã được ghi nhận và một thiên lệch đã được ghi nhận đối với người viết tiếng Anh không phải là người bản ngữ. Vì vậy, đây không hẳn là câu chuyện về một sinh viên xui xẻo, mà là về việc một quy định hiện có không được tuân thủ. Khi một chính sách thực sự thực thi sự khác biệt giữa một điểm số và một phán quyết, thì điểm số trở thành một đầu vào thay vì một phán quyết.

  • Xem điểm số như một đầu vào, không bao giờ là cơ sở duy nhất cho một kết luận vi phạm
  • Công bố tỷ lệ dương tính giả đã được công bố của công cụ cho sinh viên trước khi sử dụng nó để chống lại họ
  • Áp dụng sự thận trọng bổ sung đối với các bài nộp ngắn và bài viết tiếng Anh không phải là người bản ngữ, cả hai đều là những điểm yếu đã được ghi nhận
  • Đảm bảo một con đường kháng nghị không đòi hỏi phải bác bỏ một thống kê

Không có gì trong số này là khác thường. Nó gần với cách bất kỳ một mảnh chứng cứ pháp y nào cũng nên được đối xử ở nơi khác, hữu ích, có thể kiểm tra, và không bao giờ đủ chỉ riêng nó.

Đối với một người viết cá nhân, cùng nguyên tắc đó áp dụng trước khi có một điểm số hơn là sau đó. Một con số duy nhất, từ bất kỳ công cụ nào, là một ước lượng hơn là một phán quyết, và xem nó như sự chắc chắn theo bất kỳ hướng nào, an toàn hay bị bắt, là đòi hỏi ở con số đó nhiều hơn mức nó có thể hỗ trợ.

Công cụ AI humanizer tool của TextPulse tự báo cáo một Human Score dựa trên cùng logic đó: một ước tính được tính từ chính văn bản của bạn, không phải phán quyết của một detector về văn bản ấy, hữu ích như một tín hiệu về cách bản thảo hiện đang được đọc hơn là một lời hứa về việc bất kỳ detector cụ thể nào sẽ nói gì.

Câu hỏi về độ chính xác tách thành những câu hỏi hẹp hơn, mỗi câu hỏi có một trang riêng. Tỷ lệ mà các detector gắn cờ văn bản do con người viết được trình bày riêng, cũng như bằng chứng cụ thể về tỷ lệ dương tính giả của Turnitin và về độ chính xác của ZeroGPT. Nếu một điểm số đã được dùng để chống lại bạn, có những bài viết thực hành về việc cần làm khi bạn bị cáo buộc sử dụng AI, về bằng chứng bạn có thể thu thập để chứng minh rằng bạn không dùng AI, và về cách viết thư kháng nghị đáp lại điểm số theo chính các tiêu chí của nó.

Con số trên bất kỳ báo cáo nào sẽ tiếp tục thay đổi khi các nhà cung cấp huấn luyện lại mô hình của họ và các nhà nghiên cứu tiếp tục kiểm tra chúng trên những trường hợp khó hơn. Nhưng điều không nên thay đổi là thói quen nằm bên dưới nó: hãy đọc một điểm số như một phép đo trong số nhiều phép đo, hãy hỏi nó đã được thẩm định trên quần thể nào, và hãy hỏi nhà cung cấp không nói gì về những trường hợp mà nó vẫn còn nhận sai.

Frequently Asked Questions

Có. Weber-Wulff và cộng sự cho thấy các công cụ phát hiện AI là 'không chính xác cũng không đáng tin cậy' trong một so sánh năm 2023, và người viết tiếng Anh không bản ngữ chịu rủi ro cao nhất đã được ghi nhận, với một nghiên cứu cho thấy tỷ lệ dương tính giả trung bình trên 60 phần trăm đối với bài luận TOEFL. Một điểm số đơn lẻ tự nó không chứng minh điều gì, vì vậy nó không bao giờ nên là bằng chứng duy nhất đứng sau một cáo buộc.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.