AI Detection

Tỷ lệ dương tính giả của Turnitin: Các con số cho thấy gì

Turnitin công bố hai con số dương tính giả, không phải một, và cả hai đều không mô tả bài viết đang nằm trước mặt một giảng viên cụ thể. Đây là sự tách biệt giữa cấp độ tài liệu và cấp độ câu, dấu sao dưới ngưỡng 20%, và phép tính biến một phần trăm thành số lượng sinh viên thực tế.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

Tỷ lệ dương tính giả của Turnitin không phải là một con số duy nhất. Công ty công bố hai con số, một con số dưới 1 phần trăm ở cấp độ tài liệu, và một con số gần 4 phần trăm hơn ở cấp độ câu. Cả hai đều là thật, cả hai đều được công bố, và riêng từng con số thì không nói lên nhiều điều về bài viết cụ thể đang đặt trước một giảng viên cụ thể.

Khoảng cách giữa hai con số đó, và điều gì xảy ra khi một trong hai con số được áp dụng cho cả một lớp học thực tế thay vì cho một tài liệu đơn lẻ, là điều mà phần này phân tích, Turnitin tự nêu gì, hai con số thực sự bao quát những gì, và phép tính nào biến một phần nhỏ của một phần trăm thành một số lượng sinh viên thực tế.

Tỷ lệ dương tính giả của Turnitin là gì, theo Turnitin?

Ở cấp độ tài liệu, theo chính lời của công ty: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Điều kiện này quan trọng không kém con số. Con số dưới 1 phần trăm không phải là một tuyên bố về mọi bài viết mà Turnitin chấm. Nó chỉ mô tả nhóm bài viết đã vượt qua ngưỡng 20 phần trăm văn bản do AI viết trong ước tính của chính mô hình.

Ở cấp độ câu, nơi giao diện làm nổi bật từng dòng riêng lẻ thay vì toàn bộ tài liệu, con số của Turnitin cao hơn khoảng bốn lần. "Our sentence-level false positive rate is around 4%," công ty nêu. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin bổ sung rằng những câu bị nhận sai này không rải rác ngẫu nhiên: 54 phần trăm thời gian, một câu bị gắn cờ sai nằm ngay cạnh phần văn bản AI thực sự, điều mà công ty đưa ra như một phần lý do vì sao điểm số ở cấp độ toàn tài liệu thường đáng tin hơn bất kỳ dòng được làm nổi bật đơn lẻ nào.

Cấp độ tài liệu và cấp độ câu không phải là cùng một tuyên bố

Phân tách hai tầng này là thông điệp đã được sửa đổi, không phải lập trường ban đầu của Turnitin. Khi ra mắt vào tháng 4 năm 2023, công ty đã công bố một con số duy nhất dưới 1 phần trăm, hoàn toàn không có sự phân biệt giữa cấp độ tài liệu và cấp độ câu. Sau khi các cơ sở giáo dục bắt đầu trích dẫn con số đó và báo chí giáo dục đưa tin về tỷ lệ dương tính giả trong thực tế cao hơn dự kiến, giám đốc sản phẩm của Turnitin đã công bố phần phân tách được dùng ở trên, cùng với hai thay đổi sản phẩm được thực hiện để phản hồi, nâng độ dài tài liệu tối thiểu có thể chấm điểm từ 150 lên 300 từ, và thay đổi cách các câu ở đầu và cuối một tài liệu được chấm điểm.

Mức sàn 300 từ tồn tại vì một lý do liên quan. Turnitin đã nâng mức này từ ngưỡng tối thiểu ban đầu 150 từ sau khi nhận thấy, theo chính lời công ty, rằng độ chính xác tăng lên khi có nhiều văn bản hơn. Một bài nộp ngắn, một bài phản tư một trang, một bản nháp dở dang, một bài đăng thảo luận, cung cấp cho mô hình ít tín hiệu hơn để xử lý so với các con số dương tính giả ở trên được đo lường dựa trên, đó là một phần lý do vì sao bất kỳ nội dung nào dưới ngưỡng đó sẽ không nhận được điểm AI nào cả, thay vì một điểm không đáng tin cậy.

MứcTỷ lệ được Turnitin nêuPhạm vi thực tế mà nó bao phủ
Cấp độ tài liệuDưới 1%Chỉ các tài liệu đã bị gắn cờ ở mức 20% trở lên là do AI viết, tức là tỷ lệ phần trăm tổng thể cho toàn bộ bài nộp
Cấp độ câuKhoảng 4%Bất kỳ câu riêng lẻ nào được tô sáng trong báo cáo bài viết AI, bất kể điểm tổng thể của tài liệu
Dưới ngưỡng 20% của tài liệuKhông hiển thị con sốTurnitin hiển thị dấu sao thay vì phần trăm, đánh dấu kết quả là kém đáng tin cậy hơn trong phạm vi đó

Nhân hóa bài viết của bạn

Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.

Bắt đầu miễn phí

Phép tính: Một phần nhỏ của một phần trăm có nghĩa gì đối với một nhóm thực tế

Phép tính này đã được công khai khi Vanderbilt University tính toán các tỷ lệ lỗi liên quan đến khả năng phát hiện AI của Turnitin vào tháng 8 năm 2023. Ví dụ tốt nhất về cách thực hiện phép tính này là chính cách Vanderbilt tự tính ra các con số. Trong một bài đăng trên blog về quyết định tắt bộ phát hiện AI của Turnitin, họ lưu ý rằng, "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."

Con số đó là phép ngoại suy của Vanderbilt từ số liệu do nhà cung cấp công bố, áp dụng cho khối lượng của chính Vanderbilt, chứ không phải là một kết quả được đo lường riêng. Cấu trúc của phép tính này có thể được khái quát vượt ra ngoài quy mô nhân sự của một trường đại học. Một tỷ lệ dưới 1 phần trăm áp dụng cho vài trăm bài viết sẽ tạo ra một số ít sinh viên bị gắn nhãn sai, điều này dễ bị bỏ qua. Cùng tỷ lệ đó áp dụng cho hàng chục nghìn bài viết, tức quy mô mà một trường đại học thực sự nộp mỗi năm, sẽ tạo ra hàng trăm trường hợp thay vì chỉ một số ít, vì một tỷ lệ nhỏ và một quần thể lớn đang được nhân với nhau thay vì được xem xét tách biệt.

Không điều gì trong số này chứng minh rằng tỷ lệ trong thực tế khớp chính xác với con số trong phòng thí nghiệm. Chính giám đốc sản phẩm của Turnitin đã công khai thừa nhận rằng kết quả trong thực tế khác với thử nghiệm trong phòng thí nghiệm, đây là một phần lý do khiến công ty trước hết phải sửa đổi cách truyền đạt của mình. Phép tính ở trên xem con số do Turnitin tự công bố là một đầu vào đáng được nghiêm túc xem xét, chứ không phải là một giới hạn trên đối với điều thực sự xảy ra khi một công cụ đang chấm điểm các bài nộp có hình thức hoàn toàn khác với một bộ chuẩn được tuyển chọn.

Điều Tỷ Lệ Không Bao Quát

Một kết quả dưới ngưỡng 20 percent không được gắn kèm một tỷ lệ nhỏ. Thay vào đó, nó nhận một dấu sao thay vì một con số, một lựa chọn mà Turnitin đưa ra vì khoảng đó là nơi công cụ kém đáng tin cậy nhất theo cả hai hướng, điều này được xác nhận bởi các bài tường thuật độc lập trên báo chí giáo dục cùng với cách chính công ty mô tả mức độ tin cậy thấp ở khoảng đó. Một chỉnh sửa nhẹ, một đoạn được sửa với sự hỗ trợ và phần còn lại được viết mà không có trợ giúp, có thể tạo ra hoàn toàn không có điểm hiển thị thay vì một điểm nhỏ, điều đáng biết trước khi một con số bị thiếu được đọc như một lời buộc tội hoặc một giấy chứng nhận hoàn toàn ổn. Hướng dẫn của TextPulse về điều gì được tính là một điểm Turnitin tốt đề cập cùng ngưỡng đó từ phía người đọc của báo cáo.

Vậy Một Tỷ Lệ Dương Tính Giả Đã Được Công Bố Nên Được Đọc Như Thế Nào?

Như một con số của nhà cung cấp về một điều kiện hẹp hơn so với điều nó ban đầu có vẻ mô tả, chứ không phải như một tuyên bố về bài viết đang nằm trước mặt một giáo sư cụ thể. Turnitin cũng định khung đầu ra của mình theo cách tương tự, công ty nói rõ rằng công nghệ phát hiện viết bằng AI của họ không đưa ra "a determination of misconduct," mà chỉ cung cấp "data for educators to make an informed decision." Bằng chứng rộng hơn về việc các bộ phát hiện AI có chính xác hay không cũng ủng hộ cách đọc này, một tỷ lệ được công bố mô tả một chuẩn đối chiếu, chứ không phải tài liệu hiện đang được chấm.

Những người viết muốn biết bản thảo của mình đang ở đâu trên cùng một kiểu đo lường thống kê, thay vì đoán, có thể kiểm tra trực tiếp bằng một free perplexity checker trước khi bất kỳ phần nào trong đó đến bộ phát hiện của một cơ sở. Đó là một cách sử dụng công nghệ khác với việc cố tranh luận với một điểm số sau khi sự việc đã xảy ra, và đó là nơi duy nhất mà người viết, thay vì người quản trị, được xem con số trước.

Độ chính xác của ZeroGPT được xem xét riêng cho bất kỳ ai có cơ sở sử dụng công cụ đó. Nhóm chịu tác động nặng nề nhất bởi các lỗi này, những người viết tiếng Anh không phải tiếng mẹ đẻ, là chủ đề của một trang riêng.

Nhóm dân số chịu ảnh hưởng nhiều nhất bởi phép tính này cũng không phân bố đồng đều. Những người viết tiếng Anh không phải tiếng mẹ đẻ mang theo nguy cơ được ghi nhận lớn nhất là rơi vào phía sai của bất kỳ tỷ lệ phần trăm nào trong số này, và đó chính xác là đối tượng mà trang của TextPulse dành cho các nhà văn học thuật ESL được xây dựng xoay quanh. Turnitin sẽ tiếp tục điều chỉnh các con số này khi nó huấn luyện lại mô hình của mình. Điều sẽ không thay đổi là chính phép tính: một tỷ lệ nhỏ như vậy vẫn cần một quần thể lớn như vậy để biến mất vào đó, và phần lớn các bài nộp thực tế không may mắn đến thế.

XLinkedInFacebook

Câu hỏi thường gặp

Tỷ lệ dương tính giả của Turnitin, theo các số liệu đã công bố của công ty, không phải là một con số duy nhất. Ở cấp độ tài liệu, Turnitin nêu tỷ lệ dưới 1 phần trăm, nhưng chỉ đối với các tài liệu đã bị gắn cờ ở mức 20 phần trăm trở lên là do AI viết. Ở cấp độ câu, nơi các dòng riêng lẻ được tô sáng, con số do chính công ty đưa ra vào khoảng 4 phần trăm.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Cập nhật về AI humanization

Nhận mẹo về viết học thuật, phát hiện AI và humanization được gửi thẳng vào hộp thư của bạn.

Không spam. Có thể hủy đăng ký bất cứ lúc nào.