Đánh giá Pangram AI Detector: Công cụ mà các nhà nghiên cứu tiếp tục xác thực
Pangram công bố tỷ lệ dương tính giả xấp xỉ 1 trên 10,000, và khác với hầu hết các nhà cung cấp công cụ phát hiện, hiện nay công cụ này có nghiên cứu độc lập gần đây cho thấy cùng một hướng. Một nghiên cứu bình duyệt năm 2026 từ Vrije Universiteit Brussel cho thấy đây là công cụ duy nhất trong bốn công cụ cho kết quả thỏa đáng đối với các bài luận trình độ thạc sĩ. Dưới đây là những gì các nghiên cứu đã đo lường, nơi bằng chứng vẫn còn mỏng, và điều mà không điểm số nào của công cụ phát hiện có thể chứng minh.
Pangram là công cụ phát hiện AI mà các nhà nghiên cứu độc lập liên tục nêu bật, điều này khiến nó đáng được xem xét kỹ hơn so với bảng điểm nhà cung cấp thông thường. Nhà phát triển của nó, Pangram Labs, công bố tỷ lệ dương tính giả vào khoảng 1 trên 10,000 và độ chính xác tiêu đề là 99.98 percent. Đây là các con số do chính công ty đưa ra, được đo trên các bộ chuẩn của chính họ. Điều khiến Pangram khác với phần lớn lĩnh vực này là, lần hiếm hoi này, các nghiên cứu bên ngoài gần đây lại chỉ theo cùng một hướng chung.
Hai đánh giá độc lập đã xuất hiện trong năm qua, một nghiên cứu được bình duyệt từ Vrije Universiteit Brussel, được Springer công bố vào tháng 6 năm 2026, và một bản thảo làm việc của University of Chicago Booth School được Chicago Booth Review đưa tin vào tháng 12 năm 2025. Cả hai đều đặt Pangram rõ ràng cao hơn các đối thủ nổi tiếng hơn, bao gồm Turnitin, GPTZero, và Copyleaks. Không nghiên cứu nào coi điểm số của bất kỳ công cụ phát hiện nào là bằng chứng cho điều gì đó về một tài liệu cụ thể, và cả hai đều nói rõ như vậy.
Phần tiếp theo trình bày những gì Pangram tự tuyên bố về mình, hai nghiên cứu thực sự đã đo lường điều gì, ở đâu bằng chứng vẫn còn mỏng, và sự nổi lên của công cụ này nói gì về phần còn lại của lĩnh vực phát hiện.
Pangram là gì và ai sử dụng nó
Pangram Labs là một công ty nhỏ được thành lập vào năm 2023 tại Brooklyn bởi các nhà nghiên cứu AI trước đây từng làm việc tại Tesla và Google. Sản phẩm kiểm tra văn bản được dán vào hoặc tải lên và trả về ước tính về mức độ văn bản đó do AI tạo ra, với đánh dấu ở cấp câu, cùng với phát hiện hình ảnh và kiểm tra đạo văn trên các gói trả phí.
Cơ sở người dùng của nó khác với Turnitin. Turnitin được bán cho các tổ chức và chạy bên trong các hệ thống quản lý học tập, còn Pangram có thể được bất kỳ ai có tài khoản miễn phí sử dụng, nghĩa là sinh viên, biên tập viên, nhân viên tạp chí, và người đọc hồ sơ tuyển sinh đều dùng trực tiếp. Đây là công cụ mới đến trong thị trường này, và ngày càng là công cụ mà các nhà nghiên cứu liêm chính học thuật tìm đến khi họ muốn có một điểm so sánh, chính xác vì nó tiếp tục cho kết quả tốt trong các thử nghiệm mà các công cụ đương nhiệm không làm được.
Nhà cung cấp tuyên bố gì
Trang chủ của Pangram quảng cáo độ chính xác 99.98 percent và cho biết tỷ lệ dương tính giả của nó, tức tỷ lệ mà các tài liệu do con người viết bị gắn nhãn nhầm là AI, hiện là 1 trên 10,000. Một bài đăng trên blog của công ty về dương tính giả, do CTO của công ty viết, phân tách con số tổng thể đó theo thể loại: 0.004 percent đối với bài luận học thuật, 0.001 percent đối với tóm tắt khoa học, cùng các điểm yếu mà chính công ty công bố, chẳng hạn 0.05 percent đối với thơ và 0.23 percent đối với công thức nấu ăn. Công ty cũng khẳng định mô hình của mình vẫn phát hiện được văn bản AI sau khi nó đã được xử lý bằng các công cụ humanizer được gọi như vậy.
Tất cả những con số này đều là số liệu do chính nhà cung cấp tự báo cáo từ các bộ kiểm thử của họ, và cùng bài đăng đó cũng nêu các lưu ý của chính nhà cung cấp, rằng mô hình hoạt động tốt nhất với văn bản dài hơn được viết bằng các câu hoàn chỉnh, và công ty khuyên không nên sàng lọc các danh sách gạch đầu dòng ngắn hoặc văn bản có tính công thức cao. Cần giữ cả hai mặt đó trong tầm nhìn. Các tuyên bố này đặc biệt cụ thể và đặc biệt thấp, nhưng chúng vẫn chỉ là tuyên bố cho đến khi có người ngoài công ty kiểm tra chúng.

Bằng chứng độc lập cho thấy gì
Bài kiểm tra mạnh nhất cho đến nay là một nghiên cứu đã qua bình duyệt của Van Vlasselaer, Van Droogenbroeck, và Spruyt tại Vrije Universiteit Brussel, được công bố vào tháng 6 năm 2026 trên International Journal for Educational Integrity. Nhóm đã tạo ra 160 bài học thuật trình độ thạc sĩ, mỗi bài có ít nhất 4.000 từ: 40 bài do sinh viên thực viết trước năm 2019, 40 bài được tạo hoàn toàn bằng GPT-4o Deep Research, 40 bài lai, và 40 bài do AI tạo ra rồi được con người chỉnh sửa có chủ đích. Họ đưa tất cả qua Turnitin, GPTZero, Copyleaks, và Pangram.
Đối với các bài được AI tạo hoàn toàn, nghiên cứu cho biết Turnitin, GPTZero, và Copyleaks "hoàn toàn thất bại trong việc phát hiện nội dung do AI tạo ra." Turnitin chấm tất cả 40 bài đó trong khoảng từ 0 đến 20 phần trăm AI, điểm trung vị của cả ba công cụ hiện hành đều dưới 20 phần trăm đối với các bài được máy viết 100 phần trăm. Pangram đạt độ chính xác nghiêm ngặt 65 phần trăm và độ chính xác bao gồm 97.5 phần trăm trên cùng bộ này, phân loại sai một bài. Ở bộ bài đã được nhân hóa, Pangram xác định đúng nội dung AI trong 37 trên 40 trường hợp, với độ chính xác nghiêm ngặt 92.5 phần trăm, trong khi GPTZero đạt 2.5 phần trăm, Copyleaks 22.5 phần trăm, và Turnitin 50 phần trăm.
| Công cụ | Bài viết AI hoàn toàn (độ chính xác nghiêm ngặt) | Bài viết AI đã được nhân hóa (độ chính xác nghiêm ngặt) | Bài viết do con người viết được loại trừ đúng |
|---|---|---|---|
| Pangram | 65% | 92.5% | 100% |
| Turnitin | 0% | 50% | 100% |
| GPTZero | 0% | 2.5% | 100% |
| Copyleaks | 0% | 22.5% | 100% |
Điểm dữ liệu thứ hai là một working paper của Brian Jabarian và Alex Imas tại Chicago Booth, được tóm tắt trong Chicago Booth Review vào tháng 12 năm 2025. Khi thử các bộ phát hiện trên khoảng 2,000 đoạn văn do con người viết, trải rộng trên sáu phương tiện cùng với các phiên bản AI từ bốn mô hình frontier, họ nhận thấy tỷ lệ dương tính giả của Pangram về cơ bản bằng không trên hầu hết các ngưỡng quyết định, với độ chính xác không bao giờ giảm xuống dưới 99.8 percent trên tập dữ liệu của họ và tỷ lệ âm tính giả từ 2 đến 4 percent tùy theo mô hình. Các nhà nghiên cứu đề xuất rằng các cơ sở nên áp dụng một mức trần chính sách nghiêm ngặt, chẳng hạn không quá 0.5 percent bài viết của con người bị gắn cờ, trước khi tin cậy bất kỳ bộ phát hiện nào trong vận hành. Lưu ý sự khác biệt về trạng thái: bài báo của Booth là một working paper, chưa được bình duyệt, và nó thử nghiệm văn bản AI chưa chỉnh sửa thay vì các bài báo học thuật đã được nhân hóa.
Dương tính giả và những người bị ảnh hưởng
Dương tính giả là nơi thiệt hại của bộ phát hiện tập trung, và mô hình được ghi nhận trên toàn ngành này là các cờ cảnh báo rơi không cân xứng vào người viết tiếng Anh không phải bản ngữ. Nghiên cứu của VUB đáng đọc chính ở điểm này, 40 bài viết do con người của nghiên cứu đều do những người viết tiếng Anh không phải bản ngữ thực hiện, và cả bốn công cụ, bao gồm Pangram, đều không gắn cờ 100 percent trong số đó. Đó là một kết quả thực sự đáng khích lệ, và đồng thời cũng chỉ là 40 bài viết. Một mẫu cỡ đó không thể xác nhận một tỷ lệ như 0.004 percent, chỉ việc thử nghiệm nội bộ lớn hơn nhiều của chính nhà cung cấp mới tạo ra các con số tinh như vậy, và chưa có bên ngoài nào tái lập chúng ở quy mô đó.
Phần thực tế của nghiên cứu cho thấy vì sao sự thận trọng vẫn tồn tại ngay cả khi các chuẩn đánh giá tốt. Khi các nhà nghiên cứu chạy Pangram trên 1,163 luận văn thạc sĩ thực tế từ năm 2024 và 2025, công cụ này gắn cờ 45.5 phần trăm trong số đó ở một mức nào đó, với tỷ lệ AI ước tính trung vị là 30 phần trăm trong các trường hợp bị gắn cờ, và không có ground truth nào tồn tại cho bất kỳ luận văn nào trong số đó. Các tác giả nói thẳng: điểm phát hiện hữu ích như những tín hiệu ban đầu và tuyệt đối không nên là bằng chứng duy nhất trong các quyết định có hệ quả lớn. Một sinh viên đối mặt với cáo buộc vẫn cần các cách thức dựa trên quy trình để chứng minh quyền tác giả, bất kể bộ phát hiện nào tạo ra con số đó.
Nhân hóa bài viết của bạn
Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.
Giá cả và quyền truy cập
Trang web của Pangram cung cấp 20 lượt kiểm tra miễn phí mỗi ngày sau khi đăng ký tài khoản, với các gói trả phí bổ sung khối lượng tín dụng và các tính năng như phát hiện đạo văn. Mô hình truy cập đó quan trọng không kém các con số về độ chính xác, khác với Turnitin, mà người viết chỉ gặp khi một cơ sở giáo dục chạy nó để đối chiếu với họ, Pangram có thể được kiểm tra trực tiếp, vì vậy người viết có thể thấy cùng loại tín hiệu mà một người phản biện có thể thấy trước khi bất cứ điều gì được nộp.
Pangram phù hợp ở đâu trong bối cảnh các bộ phát hiện
Tóm tắt của các tác giả VUB về lĩnh vực này rất thẳng thắn: "Trong bốn công cụ phát hiện AI được nghiên cứu ở đây, vào thời điểm này chỉ có một công cụ cho kết quả thỏa đáng." Câu đó nói lên nhiều điều về các công cụ hiện hành cũng như về Pangram. Turnitin, công cụ mà hầu hết các cơ sở giáo dục thực sự dựa vào, đạt điểm bằng 0 đối với bộ hoàn toàn do AI tạo ra, và hồ sơ dương tính giả đã được ghi nhận riêng của nó đã buộc các trường đại học phải xử lý các điểm số của nó một cách thận trọng. Tất cả các công cụ này đều đo các thuộc tính thống kê của văn bản, và cơ chế nền tảng giải thích cả vì sao phương pháp huấn luyện mới hơn của Pangram có thể vượt lên và vì sao từng công cụ trong số đó vẫn mang tính xác suất.
Đánh giá thẳng thắn, Pangram hiện là bộ phát hiện được hỗ trợ tốt nhất trong các thử nghiệm độc lập, với khoảng cách rất lớn, dựa trên các bằng chứng gần đây. Tuy nhiên, bằng chứng đó cũng khá hẹp. Có hai nghiên cứu, một đã qua bình duyệt, một chưa, đều trong năm qua, chủ yếu là tiếng Anh, chủ yếu là văn bản học thuật và văn bản web dài. Phát hiện là một cuộc chạy đua vũ trang với các mô hình thay đổi theo từng quý, và một công cụ dẫn đầu vào năm 2026 chỉ giữ được lợi thế đó cho đến thế hệ văn bản tiếp theo. Điểm số của Pangram là một ước lượng được hiệu chỉnh tốt hơn so với những gì các đối thủ tạo ra. Nó vẫn chỉ là một ước lượng, không phải bằng chứng về việc bất kỳ cá nhân cụ thể nào đã làm gì.
Xem so sánh đầy đủ
Pangram là một công cụ trong một lĩnh vực đông đúc, không đồng đều. Để xem nó so sánh với Turnitin, GPTZero, Copyleaks, ZeroGPT và các công cụ còn lại theo cùng các tiêu chí như thế nào, hãy xem hướng dẫn đầy đủ so sánh các bộ phát hiện AI.
Nghiên cứu của chính chúng tôi cho thấy gì
Trong nghiên cứu về mức đồng thuận giữa các công cụ phát hiện của TextPulse Research, chín công cụ phát hiện AI thương mại đã chấm cùng 90 văn bản học thuật. Một trong số đó là văn bản lai 455 từ: phần mở và kết do con người viết, kẹp giữa là đoạn 168 từ do AI tạo. Pangram chấm văn bản này 34% AI, trong khi phán quyết của các công cụ khác trên cùng những từ đó trải từ 0% đến 95.7% AI. Toàn văn bài báo, kho ngữ liệu và ma trận điểm từng công cụ được mở tại TextPulse Research.

Câu hỏi thường gặp
Các tuyên bố của chính Pangram là độ chính xác 99.98 percent và tỷ lệ dương tính giả khoảng 1 trên 10,000, được đo trên các chuẩn đánh giá nội bộ. Điều bất thường đối với ngành này là các công trình độc lập gần đây cho thấy cùng một hướng, một nghiên cứu bình duyệt tháng 6 năm 2026 từ Vrije Universiteit Brussel cho thấy đây là công cụ duy nhất trong bốn công cụ có thể phát hiện đáng tin cậy các bài luận trình độ thạc sĩ được tạo hoàn toàn bằng AI và được nhân hóa, và một working paper của Chicago Booth cho thấy tỷ lệ dương tính giả gần bằng không trên tập dữ liệu của họ. Bằng chứng độc lập là mạnh nhưng còn mới và phạm vi còn hạn chế.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.