AI Detection

GPTZero hoạt động như thế nào

GPTZero đã làm cho perplexity và burstiness trở nên nổi tiếng, rồi lặng lẽ loại bỏ cả hai. Đây là những gì bộ phân loại của nó đo lường hiện nay, báo cáo thực sự cho thấy gì, và công cụ này tự nói gì về các giới hạn của nó.

Cập nhật lúc 5 min
Diagram showing how GPTZero works today: a sentence-level AI classifier replacing its original perplexity and burstiness method

Gõ cụm từ "how gptzero works" vào thanh tìm kiếm và phần lớn những gì hiện ra vẫn mô tả perplexity và burstiness, hai chỉ số mà chính người sáng lập của nó đã làm nên danh tiếng trong những tuần đầu tiên sau khi ChatGPT ra mắt. Mô tả đó là chính xác vào tháng 1 năm 2023. Kể từ mùa thu của năm đó, mô tả này không còn chính xác nữa, khi tài liệu nội bộ của GPTZero cho biết công ty đã thay phương pháp đó bằng một phương pháp khác hoàn toàn. Khoảng cách giữa những gì công cụ làm lúc mới ra mắt và những gì nó làm hiện nay đủ lớn để hầu hết các giải thích vẫn đang lưu hành ngày nay mô tả một sản phẩm không còn tồn tại.

Ngày nay, GPTZero chạy một bộ phân loại theo từng câu trên một tập hợp lớn gồm văn bản do con người tạo ra và văn bản do AI tạo ra, thay vì tính toán perplexity. GPTZero hiện nay vẫn cung cấp một con số tiêu đề duy nhất, nhưng phép tính là khác nhau. Phần tô sáng theo cấp độ câu nằm bên dưới con số tiêu đề cũng mang ý nghĩa khác so với năm 2023. Cả hai phiên bản của câu chuyện đều đáng để biết, phiên bản đã làm cho các thuật ngữ trở nên nổi tiếng, và phiên bản thực sự đang vận hành ngày hôm nay.

GPTZero result screen highly confident a passage is AI generated: 100% AI probability with per-sentence highlighting and an AI vocabulary tab
GPTZero trên một đoạn văn do AI viết: kết luận ở cấp độ tài liệu, tô sáng theo từng câu cho các câu tạo ra kết luận đó, và danh sách từ vựng AI. Bài đăng đi qua cả ba lớp.

Lịch sử: Perplexity và Burstiness đã làm GPTZero trở nên nổi tiếng như thế nào

Vào ngày 2 tháng 1 năm 2023, cựu sinh viên Princeton Edward Tian đã phát hành một bản demo công khai của GPTZero, chỉ vài tuần sau khi ChatGPT ra mắt. Trang giải thích ban đầu của anh mô tả cách anh sử dụng hai thống kê được mượn từ mô hình hóa ngôn ngữ để phát hiện khi một mô hình ngôn ngữ đã viết ra một nội dung nào đó. Perplexity là một điểm số phản ánh mức độ mô hình tham chiếu đã bị bất ngờ đến đâu trước các lựa chọn từ trong văn bản. Burstiness là tên gọi của GPTZero cho mức độ sự bất ngờ đó dao động nhiều đến mức nào trong một tài liệu. Những trang giải thích đó là lý do khiến cả hai từ này mới đi vào hội thoại hằng ngày về việc viết bằng AI. Phần lớn những người có thể định nghĩa perplexity hoặc burstiness ngày nay đã học các thuật ngữ này từ GPTZero, chứ không phải từ một giáo trình.

Cơ chế bản thân thì khá dễ mô tả. Cho một đoạn văn đi qua một mô hình ngôn ngữ tham chiếu, và phần văn bản mà mô hình thấy có tính dự đoán cao, perplexity thấp, sẽ được đọc như điển hình của máy móc, vì quá trình tạo ra thường ưu tiên từ tiếp theo có khả năng xảy ra cao hơn so với từ gây bất ngờ. Tài liệu đã được ngừng xuất bản của GPTZero thậm chí còn công bố một kinh nghiệm: một điểm perplexity trên 85 được hiểu là có khả năng là con người hơn máy. Ngưỡng này đến từ một nhà cung cấp, trên một mô hình, tại một thời điểm, và bản thân GPTZero hiện không còn đứng đằng sau ngưỡng đó nữa.

Cách GPTZero Hoạt Động Hiện Nay: Bộ Phân Loại Ở Cấp Độ Câu

Trung tâm hỗ trợ của GPTZero nêu rõ ràng: "Tính đến mùa thu năm 2023, GPTZero không còn sử dụng perplexity và burstiness cho việc phát hiện AI của chúng tôi vì chúng tôi đã chuyển sang một kiến trúc dựa trên học sâu." Trang công nghệ hiện tại của họ, xác nhận rằng sự chuyển đổi là hoàn toàn. Trang này mô tả "một cách tiếp cận học sâu end-to-end, được huấn luyện trên các tập dữ liệu văn bản từ web, giáo dục, và AI-generated từ nhiều LLM khác nhau", trong đó "một mô hình phân loại theo từng câu xác định xác suất và mức độ tin cậy rằng một văn bản được tạo ra bởi AI". Perplexity và burstiness không xuất hiện ở bất cứ đâu trên trang đó.

Từ đó, nó cũng bổ sung một lớp phòng vệ, Paraphraser Shield, được thiết kế để bắt văn bản do AI tạo ra đã được đưa qua một công cụ viết lại nhằm né phát hiện. Bạn có thể dán văn bản, tải lên các tài liệu Word, PDF và tệp hình ảnh, tối đa năm mươi tệp cùng một lúc. Toàn bộ hạ tầng đó không liên quan gì đến việc đếm mức độ thường xuyên một mô hình tham chiếu có thể đã đoán ra cùng một từ.

Báo cáo GPTZero Thực Sự Cho Bạn Thấy Gì

Kết quả GPTZero gồm ba phần: phân loại AI, con người hoặc pha trộn, một tỷ lệ phần trăm thể hiện xác suất của mô hình rằng tài liệu được viết bằng AI, và nhãn độ tin cậy mô tả mức độ đáng tin của dự đoán cụ thể đó. Nhãn quan trọng hơn mức có thể bạn nghĩ. GPTZero gắn "rất tự tin" với tỷ lệ sai dưới 2 phần trăm và "ít tự tin" với tỷ lệ sai từ 14 phần trăm trở lên, một khoảng dao động đủ rộng để cùng một tỷ lệ phần trăm ở tiêu đề có thể mang trọng lượng rất khác nhau giữa các báo cáo.

Các lượt quét trả phí bổ sung làm nổi bật theo cấp độ câu, và đáng để đọc cho đúng. GPTZero mô tả các câu được làm nổi bật là những câu ảnh hưởng một cách không tương xứng đến điểm số tổng thể, chứ không phải là danh sách các cáo buộc nhắm vào từng dòng riêng lẻ. Một câu có thể không được làm nổi bật và vẫn đã định hình kết quả, vì bộ phân loại đọc toàn bộ tài liệu thay vì bỏ phiếu theo từng câu.

Thành phần báo cáoNó cho bạn biết điều gì
Phân loạiMột nhãn duy nhất: AI, con người, hoặc pha trộn
Điểm xác suất AIMột tỷ lệ phần trăm phản ánh mức độ mô hình đánh giá rằng tài liệu có khả năng được viết bằng AI
Nhãn độ tin cậyDao động từ rất tự tin, với tỷ lệ sai dưới 2 phần trăm, đến ít tự tin, 14 phần trăm hoặc cao hơn
Làm nổi bật theo câuĐánh dấu các câu đóng góp nhiều nhất cho điểm số trong Advanced Scan, không phải mọi câu có liên quan đến nó

Không có bất kỳ thành phần báo cáo nào trong số này tồn tại ở dạng hiện tại khi phần giải thích về perplexity và burstiness vẫn là mô tả công khai của GPTZero về chính nó. Giao diện đã thay đổi cùng với phương pháp.

Nhân hóa bài viết của bạn

Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.

Bắt đầu miễn phí

Vì sao mô tả về Perplexity và Burstiness vẫn tiếp tục được lan truyền

Bài giải thích ban đầu của GPTZero vẫn còn trực tuyến, vẫn được lập chỉ mục, và vẫn là một trong những mô tả tổng quan rõ ràng hơn về cách perplexity và burstiness hoạt động như những khái niệm. Các công cụ tìm kiếm và các trang web khác vẫn tiếp tục trích dẫn nó, và một số dẫn tới một bản đánh giá năm 2026 được chia sẻ rộng rãi, cho rằng công cụ này vẫn chạy một lớp perplexity và burstiness một cách âm thầm bên cạnh bộ phân loại của nó. Các trang hiện tại của chính GPTZero, trang công nghệ và cả hai bài viết hỗ trợ, lại nói điều ngược lại: các thuật ngữ đã được ngừng sử dụng, chứ không chỉ bị ẩn đi trong hậu trường. Một trang mô tả một khái niệm ở mức độ trừu tượng không giống với một trang mô tả phương pháp hiện tại của công cụ này, và việc coi hai trang đó là có thể thay thế cho nhau chính là lý do khiến sự nhầm lẫn đã kéo dài thêm ba năm sau ngày hết hạn của nó.

Điều này quan trọng vượt ra ngoài chuyện vặt. Một sinh viên hoặc đồng nghiệp được khuyên giảm perplexity hoặc giãn độ dài câu ra để vượt qua GPTZero một cách cụ thể đang được đưa lời khuyên nhắm tới một phiên bản của sản phẩm đã ngừng chạy vào năm 2023. Điều gì làm thay đổi bộ phân loại câu là một câu hỏi liên quan nhưng khác, gần hơn với phần mô tả rộng hơn về cách các AI detectors thực sự hoạt động hơn là với bất kỳ một thống kê nào đứng riêng lẻ. GPTZero chưa ngừng đo chúng, theo chính tài khoản của mình thì chúng nằm trong số bảy chỉ báo cung cấp cho mô hình hiện tại, nhưng chúng đã ngừng trở thành thứ quyết định câu trả lời.

GPTZero nói rằng nó không thể làm được gì

Các bảng benchmark được công bố của GPTZero có sức mạnh tương đương mức mà một nhà cung cấp có thể sẵn sàng công bố về chính sản phẩm của mình. Công ty báo cáo "tỷ lệ chính xác 99% khi phát hiện văn bản do AI tạo ra so với văn viết của con người", nói "chúng tôi giữ tỷ lệ dương tính giả của GPTZero ở mức không quá 1% khi đánh giá văn bản do AI tạo ra so với văn bản của con người", và ghi nhận "tỷ lệ chính xác 96,5%" trên các bài nộp kết hợp giữa văn bản do AI tạo ra và văn viết của con người, cùng với 1,1 phần trăm trên các bài TOEFL, một chỉ báo thay thế phổ biến cho văn viết tiếng Anh của người không phải bản ngữ. Các con số này đến từ phần đánh giá nội bộ của GPTZero, được công bố vào tháng 1 năm 2025, và không có bản sao độc lập nào được trích dẫn trên trang nêu các số liệu đó. Trang tương tự cũng bác bỏ tuyên bố mà hầu hết các nhà cung cấp thường viện đến, nêu rằng "sẽ không bao giờ có một bảo đảm 100%" và rằng bất kỳ ai tuyên bố ngược lại có lẽ đều có sai sót trong dữ liệu hoặc phương pháp đánh giá của họ.

Trang nêu các hạn chế của GPTZero cụ thể hơn so với các con số mang tính marketing. Công ty cho biết độ chính xác tăng lên khi nộp thêm nhiều văn bản và giảm ở cấp độ câu và đoạn văn so với toàn bộ tài liệu. Công ty cho biết dữ liệu huấn luyện của họ chủ yếu là văn xuôi tiếng Anh dành cho người trưởng thành, vì vậy văn bản đi chệch khỏi mẫu đó sẽ khó phân loại một cách đáng tin cậy hơn. Công ty cho biết bộ phân loại không được huấn luyện để phát hiện văn bản do AI tạo ra đã bị chỉnh sửa đáng kể sau khi tạo. Và công ty nêu rõ ràng rằng các dạng văn bản do máy tạo khác hoặc văn bản có tính quy trình cao, không chỉ riêng đầu ra của chatbot, cũng có thể bị gắn cờ theo cách tương tự.

Không có điều nào trong số đó là lý do để coi con số của GPTZero là không thể bị đặt dấu hỏi, và đó cũng không phải là bộ phát hiện duy nhất đáng để hiểu theo đúng nghĩa của nó. Những người đọc tò mò về việc một bộ phân loại như vậy thực sự phản hồi với điều gì có thể tự xem một phiên bản của mẫu đó với bộ kiểm tra perplexity miễn phí hoặc bộ kiểm tra burstiness miễn phí, hai công cụ trong bộ sưu tập các công cụ miễn phí đầy đủ hơn, bao phủ các lớp thống kê khác mà một báo cáo như thế này dựa vào.

Hai số liệu tiêu đề của GPTZero có các trang riêng: perplexity đo lường điều gì trong phát hiện AI, và phép tính xác suất token tạo ra cả hai con số.

Một công cụ sẵn sàng nêu rõ các điểm mù của chính nó một cách chính xác như vậy đáng tin cậy hơn một công cụ khẳng định rằng không có điểm mù nào, và tỷ lệ phần trăm chưa được giải thích tiếp theo trong một báo cáo là một nơi tốt để bắt đầu đặt câu hỏi công cụ thuộc loại nào đã tạo ra nó.

Nghiên cứu của chính chúng tôi cho thấy gì

Trong nghiên cứu về mức đồng thuận giữa các công cụ phát hiện của TextPulse Research, chín công cụ phát hiện AI thương mại đã chấm cùng 90 văn bản học thuật. Một trong số đó là văn bản lai 455 từ: phần mở và kết do con người viết, kẹp giữa là đoạn 168 từ do AI tạo. GPTZero chấm văn bản này 41.2% AI, trong khi phán quyết của các công cụ khác trên cùng những từ đó trải từ 0% đến 95.7% AI. Toàn văn bài báo, kho ngữ liệu và ma trận điểm từng công cụ được mở tại TextPulse Research.

GPTZero với văn bản lai từ kho ngữ liệu của nghiên cứu.
GPTZero với văn bản lai từ kho ngữ liệu của nghiên cứu.
XLinkedInFacebook

Câu hỏi thường gặp

Không. Trung tâm hỗ trợ của GPTZero nêu rằng công ty đã ngừng dùng perplexity và burstiness để phát hiện từ mùa thu năm 2023, sau khi chuyển sang một bộ phân loại học sâu. Trang công nghệ hiện tại của nó mô tả một mô hình phân loại theo từng câu và không nhắc đến bất kỳ thuật ngữ nào trong hai thuật ngữ đó. Mô tả này vẫn còn lưu hành vì phần giải thích năm 2023 của chính GPTZero đã phổ biến cả hai từ trước khi phương pháp thay đổi.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Cập nhật về AI humanization

Nhận mẹo về viết học thuật, phát hiện AI và humanization được gửi thẳng vào hộp thư của bạn.

Không spam. Có thể hủy đăng ký bất cứ lúc nào.