Đánh giá Winston AI: Tuyên bố độ chính xác 99.98% so với bằng chứng
Winston AI quảng cáo độ chính xác 99.98%, con số tự tuyên bố cao nhất trong ngành công cụ phát hiện, được đo trên một bộ kiểm tra nội bộ mà công ty chưa bao giờ công bố. Bài kiểm tra RAID được bình duyệt cho thấy độ chính xác tổng thể là 71% ở mức tỷ lệ dương tính giả cố định 5%, vẫn đứng thứ hai trong bốn công cụ phát hiện thương mại được thử nghiệm. Đây là ý nghĩa thực sự của từng con số, và công cụ này thực sự phù hợp với ai.
Winston AI quảng cáo độ chính xác 99.98%, con số tự công bố cao nhất trong số các công cụ phát hiện AI phổ biến. Con số này nằm trên trang chủ của công ty, cạnh dòng chữ "The Most Trusted AI Detector", và nó xuất phát từ thử nghiệm nội bộ của chính công ty, không phải từ một phòng thí nghiệm bên ngoài. Không có phương pháp luận, kích thước bộ dữ liệu thử nghiệm, tỷ lệ mẫu người so với AI, hay ngưỡng vận hành nào được công bố kèm theo. Khoảng cách giữa tuyên bố và tài liệu chứng minh đó là điều đầu tiên một độc giả cẩn trọng cần biết về công cụ này.
Điều thứ hai là Winston thực sự đã được bên ngoài kiểm tra, điều mà một số công cụ phát hiện khác không thể nói. Bài đánh giá RAID, một nghiên cứu được bình duyệt và trình bày tại ACL 2024, đã thử Winston trên khoảng 6.2 triệu văn bản do máy tạo ra và đo được độ chính xác tổng thể 71.0% với tỷ lệ dương tính giả được cố định ở mức 5%. Con số này rất xa 99.98%. Nó cũng xếp Winston ở vị trí thứ hai trong bốn công cụ phát hiện thương mại được thử nghiệm, đứng trên GPTZero và ZeroGPT. Cả hai sự thật đều quan trọng, và không sự thật nào phủ định sự thật kia.
Phần tiếp theo trình bày Winston là gì và ai là đối tượng sử dụng, nhà cung cấp tuyên bố gì, một phép đánh giá nội bộ với 99.98% có thể và không thể có nghĩa gì về mặt thống kê, và các con số độc lập thực sự cho thấy điều gì.
Winston AI Là Gì và Ai Sử Dụng Nó?
Winston AI là một công cụ phát hiện trả phí, dựa trên thuê bao, nhắm trực tiếp vào giảng viên và các nhà xuất bản nội dung. Danh sách tính năng của nó giống như quy trình làm việc của giáo viên: trang web của công ty mô tả OCR trích xuất văn bản từ tài liệu quét, ảnh và chữ viết tay, tích hợp Google Classroom được liệt kê trong số các nền tảng được hỗ trợ, một trình kiểm tra đạo văn đi kèm với phát hiện AI, và tổ chức tài liệu để quản lý các lô bài nộp. Nhà cung cấp cho biết nó phát hiện đầu ra từ ChatGPT, Gemini, Claude, LLaMA "and much more."
Phần đặc trưng nhất của giao diện là đầu ra theo từng câu. Thay vì chỉ trả về một tỷ lệ phần trăm duy nhất, Winston tạo ra cái mà họ gọi là bản đồ dự đoán AI: một đánh giá được mã hóa bằng màu sắc, theo từng câu, về những phần nào của tài liệu có vẻ do máy tạo ra. Đối với nhà giáo dục, bản đồ đó hữu ích hơn một điểm số đơn lẻ, vì nó cho thấy nơi sự nghi ngờ của công cụ tập trung. Nó cũng dễ bị diễn giải quá mức, một điểm sẽ được bàn dưới đây.

Công ty tuyên bố điều gì?
Tuyên bố nổi bật trên trang chủ của Winston AI là "99.98% Accurate." Tính đến thời điểm viết bài này, trang hiển thị con số đó không công bố cách bộ dữ liệu kiểm tra được xây dựng, có bao nhiêu mẫu, nó dùng tỷ lệ nào giữa văn bản do con người và AI tạo ra, hoặc ngưỡng quyết định nào đã được đặt cho bộ phát hiện khi con số đó được đo. Điều đó không phải là hiếm trong ngành này, cùng một khoảng cách giữa các tuyên bố về độ chính xác của nhà cung cấp và bằng chứng độc lập xuất hiện ở gần như mọi bộ phát hiện trên thị trường. Phiên bản tuyên bố của Winston đơn giản là con số lớn nhất mà bất kỳ ai đã gắn lên nó.
99.98% từ tự đối chiếu thực sự có thể có nghĩa là gì?
Hãy xem xét phép tính một cách nghiêm túc trong chốc lát. Tỷ lệ chính xác 99.98% nghĩa là 2 lỗi trong mỗi 10,000 mẫu. Để đo được con số đó, một công ty cần một bộ kiểm tra đã gán nhãn với ít nhất hàng chục nghìn tài liệu, trong đó nguồn gốc thực sự của mọi văn bản đều được biết chắc chắn. Khi đó, con số này chỉ mô tả hiệu suất trên bộ dữ liệu đó, những mô hình AI đó, những lời nhắc đó, những thể loại đó, độ dài văn bản đó, tại một ngưỡng đã chọn.
Không có điều gì trong số đó đòi hỏi ác ý. Một bộ phát hiện được huấn luyện trên các bài luận do các mô hình chat phổ biến tạo ra, rồi được kiểm tra trên một tập hợp bài luận do các mô hình chat phổ biến tạo ra, thực sự sẽ đạt điểm gần mức trần. Vấn đề là khả năng chuyển giao. Ngay khi văn bản đầu vào đến từ một mô hình khác, một chiến lược lấy mẫu khác, hoặc một người viết có phong cách tự nhiên đặc biệt đồng nhất, tập hợp mà chuẩn đánh giá được đo trên đó không còn mô tả văn bản đang được đánh giá nữa. Một chuẩn đánh giá nội bộ là một thí nghiệm có kiểm soát do bên có lợi ích lớn nhất đối với kết quả của nó tiến hành, trong các điều kiện do chính họ lựa chọn. Đó là bằng chứng, nhưng là loại yếu nhất, và việc thiếu phương pháp luận có nghĩa là không ai ở ngoài công ty có thể kiểm tra nó.
Kiểm tra độc lập cho thấy điều gì?
Thử nghiệm công khai nghiêm ngặt nhất có bao gồm Winston là RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, một nghiên cứu được bình duyệt của Dugan và các cộng sự, được trình bày tại ACL 2024. RAID đánh giá 12 bộ phát hiện, bao gồm bốn sản phẩm thương mại, trên khoảng 6.2 triệu đầu ra trải rộng trên 11 mô hình ngôn ngữ, 8 lĩnh vực viết, 4 chiến lược giải mã, và 11 cuộc tấn công đối kháng, với mọi bộ phát hiện đều được hiệu chỉnh về cùng tỷ lệ dương tính giả 5% để các điểm số có thể so sánh được.
| Bộ phát hiện | Độ chính xác tổng thể trong RAID (FPR cố định ở 5%) |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
Hai cách đọc bảng đó đều đúng cùng một lúc. 71.0% của Winston còn rất xa 99.98%, và Winston vẫn vượt qua hai trong số ba đối thủ thương mại của nó trên chuẩn công khai khó nhất hiện có. Các giá trị trung bình cũng che giấu một độ phân tán đáng chú ý. Trong kết quả theo từng mô hình của RAID, Winston đạt 99.6% trên đầu ra của ChatGPT và 98.8% trên đầu ra của GPT-4, gần với con số được quảng cáo của chính nó, nhưng giảm xuống 47.6% đối với văn bản GPT-2 và 24.8% đối với văn bản từ mô hình MPT-30B cơ sở. Trên văn bản máy được diễn đạt lại, độ chính xác của nó giảm xuống 52.6%.
Độ phân tán đó là toàn bộ câu chuyện của tuyên bố 99.98% ở dạng thu nhỏ. Trên văn bản giống với loại mà bộ phát hiện có lẽ được tinh chỉnh cho, tức các mô hình hội thoại gần đây viết văn xuôi đơn giản, Winston hoạt động gần với mức tiếp thị của nó. Ngoài phân phối đó, hiệu năng giảm mạnh. Một chuẩn đánh giá nội bộ được xây dựng từ văn bản trong phân phối có thể thực sự tạo ra một con số gần như hoàn hảo, trong khi gần như không cho bạn biết gì về hỗn hợp lộn xộn của mô hình, chỉnh sửa và diễn đạt lại mà một hộp thư thực tế chứa đựng. Các tín hiệu thống kê mà bộ phát hiện dựa vào được trình bày chi tiết hơn trong phần giải thích của chúng tôi về cách bộ phát hiện AI hoạt động.
Nhân hóa bài viết của bạn
Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.
Dương tính giả, Ai bị ảnh hưởng?
Thiết kế của RAID làm lộ rõ một sự đánh đổi mà tiếp thị của nhà cung cấp hiếm khi nêu ra, mọi điểm chính xác trong nghiên cứu đều được đo sau khi cố định tỷ lệ dương tính giả ở mức 5%. Ở mức hiệu chỉnh đó, 1 trong 20 tài liệu thực sự do con người viết sẽ bị gắn cờ. Một bộ phát hiện có thể hạ tỷ lệ đó bằng cách nâng ngưỡng của nó, nhưng chỉ bằng cách bắt được ít văn bản AI hơn, hai con số này biến động cùng nhau, và một nhà cung cấp trích dẫn một con số mà không có con số kia thì chỉ đang trích dẫn nửa kết quả.
Gánh nặng của những lỗi đó không được phân bổ đồng đều. Lối viết mang tính công thức, quy ước và có độ biến thiên thấp đọc lên giống máy đối với mọi bộ phát hiện thống kê, và mô tả đó phù hợp với các phần phương pháp, tổng quan tài liệu, và lối văn cẩn trọng của những người viết bằng ngôn ngữ thứ hai. Mẫu hình AI detectors gắn cờ người nói tiếng Anh không phải bản ngữ với tỷ lệ cao hơn đã được ghi nhận trên toàn ngành, và không có gì trong phương pháp của Winston miễn trừ nó khỏi điều đó. Bản đồ dự đoán theo từng câu cũng cần cùng một mức độ thận trọng, một câu được tô đỏ là một quan sát thống kê về các mẫu từ ngữ, không phải bằng chứng về quyền tác giả. Sinh viên đối mặt với một cảnh báo sai nên bắt đầu từ tài liệu, không phải từ sự thú nhận, hướng dẫn của chúng tôi về cách chứng minh bạn không dùng AI trình bày những gì thực sự có sức thuyết phục.
Giá cả và quyền truy cập
Winston là một sản phẩm trả phí với bản dùng thử có giới hạn. Winston niêm yết bản dùng thử miễn phí 14 ngày với 2,000 tín dụng, gói Essential ở mức $18 mỗi tháng, hoặc $10 mỗi tháng nếu thanh toán theo năm, với 100,000 tín dụng hằng tháng, gói Advanced ở mức $29 mỗi tháng, hoặc $16 mỗi năm, bổ sung chỗ ngồi cho nhóm và các lần quét lớn hơn, và một bậc Elite cao hơn nữa. Đối với một nhà giáo dục cá nhân đang sàng lọc số bài nộp tương đương một lớp học, điều đó đặt Winston vào vùng mua theo cảm hứng, rẻ hơn các hợp đồng cấp संस्थutions, nhưng có năng lực hơn hầu hết các công cụ miễn phí.
Winston phù hợp ở đâu trong bối cảnh các bộ phát hiện
Dựa trên các bằng chứng độc lập, Winston là một bộ phát hiện thương mại tầm trung, hoạt động tốt hơn gói miễn phí của thị trường và kém hơn so với quảng cáo của chính nó. Nó phù hợp với một nhà giáo dục muốn có khả năng xem theo từng câu, tích hợp Classroom, và kiểm tra đạo văn trong một công cụ giá rẻ, và người đó xem mọi kết quả như một gợi ý cho cuộc trao đổi hơn là một phán quyết. Nó không phù hợp với bất kỳ ai cần điểm số hoạt động như bằng chứng, vì không có điểm số của bộ phát hiện nào làm được điều đó.
So sánh đầy đủ
Winston là một công cụ phát hiện trong một lĩnh vực đông đúc, và khoảng cách 71% so với 99.98% là một trường hợp của một mô hình trên toàn ngành. Để xem nó so sánh với Turnitin, GPTZero, Originality, ZeroGPT và các công cụ còn lại trên cùng các tiêu chí dựa trên bằng chứng, hãy xem hướng dẫn đầy đủ của chúng tôi về các công cụ phát hiện AI được so sánh.
Nghiên cứu của chính chúng tôi cho thấy gì
Trong nghiên cứu về mức đồng thuận giữa các công cụ phát hiện của TextPulse Research, chín công cụ phát hiện AI thương mại đã chấm cùng 90 văn bản học thuật. Một trong số đó là văn bản lai 455 từ: phần mở và kết do con người viết, kẹp giữa là đoạn 168 từ do AI tạo. Winston AI chấm văn bản này 7% AI, trong khi phán quyết của các công cụ khác trên cùng những từ đó trải từ 0% đến 95.7% AI. Toàn văn bài báo, kho ngữ liệu và ma trận điểm từng công cụ được mở tại TextPulse Research.

Câu hỏi thường gặp
Con số 99.98% là tuyên bố của riêng Winston AI, được đo trên một bộ kiểm tra nội bộ mà công ty chưa công bố. Trong bài kiểm tra RAID được bình duyệt, trình bày tại ACL 2024, Winston đạt độ chính xác tổng thể 71.0% với tỷ lệ dương tính giả được cố định ở mức 5%, dù riêng với đầu ra của ChatGPT thì đạt 99.6%. Tuyên bố này mô tả một tập ngữ liệu được chọn, không phải hiệu năng trong thực tế.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.