AI Detection

รีวิว Winston AI: ข้ออ้างความแม่นยำ 99.98% เทียบกับหลักฐาน

Winston AI อ้างความแม่นยำ 99.98% ซึ่งเป็นตัวเลขที่อ้างเองสูงที่สุดในอุตสาหกรรมเครื่องตรวจจับ โดยวัดจากชุดทดสอบภายในที่บริษัทไม่เคยเผยแพร่ การประเมิน RAID แบบ peer-reviewed ให้ความแม่นยำโดยรวมที่ 71% เมื่อกำหนดอัตราบวกลวงไว้ที่ 5% ซึ่งยังคงเป็นอันดับสองในบรรดาเครื่องตรวจจับเชิงพาณิชย์สี่รายที่ทดสอบ นี่คือสิ่งที่แต่ละตัวเลขวัดจริง และผู้ใช้ที่เครื่องมือนี้เหมาะสมอย่างแท้จริง

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI โฆษณาความแม่นยำ 99.98% ซึ่งเป็นตัวเลขที่อ้างว่าเป็นของตนเองและสูงที่สุดในบรรดาเครื่องมือตรวจจับ AI กระแสหลักทั้งหมด ตัวเลขนี้ปรากฏบนหน้าแรกของบริษัทถัดจากคำว่า "The Most Trusted AI Detector" และมาจากการทดสอบภายในของบริษัทเอง ไม่ได้มาจากห้องปฏิบัติการภายนอก ไม่มีการเผยแพร่วิธีการ ขนาดชุดทดสอบ อัตราส่วนตัวอย่างมนุษย์ต่อ AI หรือเกณฑ์การทำงานควบคู่ไปกับตัวเลขดังกล่าว ช่องว่างระหว่างคำกล่าวอ้างกับเอกสารประกอบนี้เป็นสิ่งแรกที่ผู้อ่านอย่างรอบคอบจำเป็นต้องรู้เกี่ยวกับเครื่องมือนี้

สิ่งที่สองคือ Winston ได้รับการทดสอบโดยบุคคลภายนอกจริง ซึ่งมากกว่าที่เครื่องมือตรวจจับบางตัวจะกล่าวได้ เกณฑ์มาตรฐาน RAID ซึ่งเป็นงานศึกษาที่ผ่านการประเมินโดยผู้ทรงคุณวุฒิและนำเสนอที่ ACL 2024 ได้ทดสอบ Winston กับข้อความที่สร้างโดยเครื่องจักรราว 6.2 ล้านรายการ และวัดความแม่นยำโดยรวมได้ 71.0% โดยกำหนดอัตราบวกลวงไว้ที่ 5% นั่นห่างไกลจาก 99.98% มาก นอกจากนี้ยังจัดให้ Winston อยู่ในอันดับสองจากเครื่องมือตรวจจับเชิงพาณิชย์ 4 รายการที่ทดสอบ โดยอยู่เหนือ GPTZero และ ZeroGPT ข้อเท็จจริงทั้งสองประการมีความสำคัญ และไม่มีข้อใดลบล้างอีกข้อหนึ่ง

ต่อไปนี้จะอธิบายว่า Winston คืออะไรและออกแบบมาสำหรับใคร ผู้ให้บริการอ้างว่าอย่างไร ค่า 99.98% จากการทดสอบมาตรฐานของตนเองมีความหมายทางสถิติได้และไม่ได้อย่างไร และตัวเลขอิสระแสดงอะไรจริง

Winston AI คืออะไร และใครเป็นผู้ใช้?

Winston AI เป็นเครื่องมือตรวจจับแบบชำระเงินที่ใช้ระบบสมัครสมาชิก โดยมุ่งเป้าไปที่นักการศึกษาและผู้เผยแพร่เนื้อหาโดยตรง รายการคุณลักษณะของมันอ่านได้เหมือนขั้นตอนการทำงานของครู เว็บไซต์ของบริษัทอธิบายว่า OCR สามารถดึงข้อความจากเอกสารที่สแกน ภาพถ่าย และลายมือได้ มีการผสานรวมกับ Google Classroom ซึ่งระบุไว้ในบรรดาแพลตฟอร์มที่รองรับ และมีตัวตรวจสอบการคัดลอกผลงานควบคู่กับการตรวจจับ AI รวมถึงการจัดระเบียบเอกสารสำหรับจัดการชุดงานที่ส่งเข้ามา ผู้ให้บริการระบุว่าสามารถตรวจจับผลลัพธ์จาก ChatGPT, Gemini, Claude, LLaMA "and much more."

ส่วนที่โดดเด่นที่สุดของอินเทอร์เฟซคือผลลัพธ์รายประโยค แทนที่จะส่งคืนเพียงเปอร์เซ็นต์เดียว Winston สร้างสิ่งที่เรียกว่าแผนที่การคาดการณ์ AI, ซึ่งเป็นการประเมินแบบแยกตามประโยคและใช้รหัสสี ว่าส่วนใดของเอกสารอ่านได้เหมือนสร้างโดยเครื่อง สำหรับผู้สอน แผนที่นั้นมีประโยชน์มากกว่าคะแนนเปล่า เพราะแสดงให้เห็นว่าความสงสัยของเครื่องมุ่งไปที่ใด อย่างไรก็ตาม ก็สามารถตีความเกินจริงได้ง่าย ซึ่งจะกล่าวถึงด้านล่าง

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
ตราที่กล่าวถึงนี้, 99.98% accurate, บนหน้าแรก, โดยไม่มีงานวิจัยที่ระบุชื่อรองรับ

บริษัทอ้างว่าอย่างไร?

ข้ออ้างหลักบน หน้าแรกของ Winston AI คือ "99.98% Accurate." ณ เวลาที่เขียนนี้ หน้าเว็บที่แสดงตัวเลขดังกล่าวไม่ได้เผยแพร่ว่าชุดทดสอบถูกสร้างขึ้นอย่างไร, มีตัวอย่างกี่รายการ, ใช้สัดส่วนของข้อความมนุษย์และข้อความ AI เท่าใด, หรือกำหนดเกณฑ์การตัดสินของตัวตรวจจับไว้ที่ระดับใดเมื่อวัดตัวเลขนี้ นี่ไม่ใช่เรื่องผิดปกติสำหรับอุตสาหกรรมนี้, ช่องว่างเดียวกันระหว่างคำกล่าวอ้างความแม่นยำของผู้ขายกับหลักฐานอิสระ เกิดขึ้นกับตัวตรวจจับแทบทุกตัวในตลาด เวอร์ชันของ Winston สำหรับคำกล่าวอ้างนี้ก็เป็นเพียงตัวเลขที่ใหญ่ที่สุดที่ใครสักคนเคยใส่ไว้เท่านั้น

การอ้างอิงตนเองว่าแม่นยำ 99.98% จริง ๆ แล้วหมายความว่าอะไร?

ลองพิจารณาคณิตศาสตร์อย่างจริงจังสักครู่ อัตราความแม่นยำ 99.98% หมายถึงความผิดพลาด 2 ครั้งในทุก 10,000 ตัวอย่าง เพื่อจะวัดตัวเลขนี้ได้ บริษัทจำเป็นต้องมีชุดทดสอบที่ติดป้ายกำกับแล้วอย่างน้อยหลายหมื่นเอกสาร ซึ่งทราบแหล่งที่มาที่แท้จริงของทุกข้อความอย่างแน่นอน จากนั้นตัวเลขดังกล่าวจึงอธิบายได้เพียงประสิทธิภาพบนคลังข้อมูลนั้นเท่านั้น, คือโมเดล AI เหล่านั้น, prompt เหล่านั้น, ประเภทข้อความเหล่านั้น, ความยาวข้อความนั้น, ที่เกณฑ์ที่เลือกไว้หนึ่งระดับ

ไม่มีสิ่งใดในนั้นต้องอาศัยเจตนาไม่สุจริต เครื่องตรวจที่ฝึกด้วยเรียงความซึ่งสร้างโดยโมเดลแชตที่ได้รับความนิยม แล้วทดสอบกับคลังเรียงความซึ่งสร้างโดยโมเดลแชตที่ได้รับความนิยม จะได้คะแนนใกล้เพดานอย่างแท้จริง ปัญหาคือความสามารถในการถ่ายโอน ทันทีที่ข้อความขาเข้ามาจากโมเดลอื่น กลยุทธ์การสุ่มตัวอย่างอื่น หรือผู้เขียนที่มีรูปแบบการเขียนตามธรรมชาติซึ่งสม่ำเสมอผิดปกติ คลังข้อมูลที่ใช้วัดเกณฑ์มาตรฐานนั้นก็ไม่อธิบายข้อความที่กำลังถูกตัดสินอีกต่อไป เกณฑ์มาตรฐานภายในคือการทดลองแบบควบคุมที่ดำเนินการโดยฝ่ายที่มีผลประโยชน์สูงสุดต่อผลลัพธ์ของมัน ภายใต้เงื่อนไขที่ตนเลือกเอง นี่เป็นหลักฐาน แต่เป็นหลักฐานที่อ่อนที่สุด และระเบียบวิธีที่ขาดหายไปหมายความว่าคนนอกบริษัทไม่อาจตรวจสอบได้แม้แต่จะตรวจดูมัน

การทดสอบอิสระแสดงอะไร?

การทดสอบสาธารณะที่เข้มงวดที่สุดซึ่งรวม Winston ไว้ คือ RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors งานวิจัยที่ผ่านการประเมินโดยผู้ทรงคุณวุฒิโดย Dugan และคณะ นำเสนอที่ ACL 2024 RAID ประเมินเครื่องตรวจ 12 ตัว รวมถึงผลิตภัณฑ์เชิงพาณิชย์ 4 รายการ เทียบกับการสร้างข้อความประมาณ 6.2 ล้านครั้ง ครอบคลุมโมเดลภาษา 11 แบบ โดเมนการเขียน 8 แบบ กลยุทธ์การถอดรหัส 4 แบบ และการโจมตีเชิงปฏิปักษ์ 11 แบบ โดยปรับเทียบเครื่องตรวจทุกตัวให้มีอัตราบวกลวง 5% เท่ากัน เพื่อให้คะแนนเปรียบเทียบกันได้

Detectorความแม่นยำโดยรวมใน RAID (FPR กำหนดคงที่ที่ 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

การอ่านตารางนั้นมีได้อย่างซื่อสัตย์พร้อมกัน 2 แบบ Winston ที่ 71.0% อยู่ห่างไกลจาก 99.98% มาก และ Winston ก็ยังเอาชนะคู่แข่งเชิงพาณิชย์ 2 ใน 3 รายบนเกณฑ์มาตรฐานสาธารณะที่ยากที่สุดที่มีอยู่ ค่าเฉลี่ยยังปกปิดการกระจายที่เผยให้เห็นสิ่งสำคัญอีกด้วย ในผลลัพธ์รายโมเดลของ RAID Winston ได้ 99.6% บนผลลัพธ์จาก ChatGPT และ 98.8% บนผลลัพธ์จาก GPT-4 ใกล้เคียงกับตัวเลขที่โฆษณาไว้ของตนเอง แต่ลดลงเหลือ 47.6% บนข้อความจาก GPT-2 และ 24.8% บนข้อความจากโมเดลฐาน MPT-30B สำหรับข้อความจากเครื่องที่ถูกถอดความ ความแม่นยำลดลงเหลือ 52.6%

การกระจายนั้นคือเรื่องราวทั้งหมดของคำกล่าวอ้าง 99.98% ในขนาดย่อส่วน บนข้อความที่คล้ายกับสิ่งที่ตัวตรวจจับน่าจะถูกปรับจูนมาเพื่อจับ คือข้อความสนทนารูปแบบใหม่ที่เขียนเป็นร้อยแก้วธรรมดา Winston ทำงานได้ใกล้เคียงกับที่การตลาดของตนระบุไว้ นอกเหนือจากการกระจายนั้น ประสิทธิภาพจะตกลงอย่างรวดเร็ว เกณฑ์มาตรฐานภายในที่สร้างจากข้อความในการกระจายเดียวกันสามารถให้ตัวเลขที่เกือบสมบูรณ์แบบได้จริง ขณะเดียวกันก็แทบไม่บอกอะไรเลยเกี่ยวกับส่วนผสมที่ยุ่งเหยิงของโมเดล การแก้ไข และการถอดความที่กล่องจดหมายจริงมีอยู่ สัญญาณทางสถิติที่ตัวตรวจจับอาศัยอยู่มีการอธิบายอย่างละเอียดมากขึ้นในบทอธิบายของเราเกี่ยวกับ AI detectors ทำงานอย่างไร.

ทำให้บทความของคุณเป็นธรรมชาติมากขึ้น

ปรับข้อความที่ช่วยโดย AI ของคุณให้ฟังดูเป็นธรรมชาติ, โดยไม่แตะต้องคำสำคัญหรือการอ้างอิง

เริ่มต้นฟรี

ผลบวกลวง, ใครได้รับผลกระทบ?

การออกแบบของ RAID ทำให้เห็นการแลกเปลี่ยนอย่างหนึ่งที่การตลาดของผู้ขายแทบไม่เคยแสดงให้เห็น, นั่นคือ คะแนนความแม่นยำทุกคะแนนในงานศึกษานี้ถูกวัดหลังจากกำหนดอัตราผลบวกลวงไว้ที่ 5% แล้ว ที่การปรับเทียบระดับนั้น เอกสารที่เป็นมนุษย์จริง 1 ใน 20 ฉบับจะถูกตั้งธง ตัวตรวจจับสามารถลดอัตรานั้นได้โดยการเพิ่มเกณฑ์ตัดสิน แต่ทำได้เพียงแลกกับการจับข้อความ AI ได้น้อยลงเท่านั้น ตัวเลขทั้งสองเคลื่อนไปด้วยกัน และผู้ขายที่อ้างเพียงตัวเลขหนึ่งโดยไม่อ้างอีกตัวเลขหนึ่ง ก็กำลังอ้างเพียงครึ่งหนึ่งของผลลัพธ์

ภาระของข้อผิดพลาดเหล่านั้นไม่ได้กระจายอย่างเท่าเทียมกัน งานเขียนที่เป็นสูตรสำเร็จ เป็นแบบแผน และมีความแปรปรวนต่ำ จะอ่านดูคล้ายเครื่องจักรต่อเครื่องตรวจจับเชิงสถิติทุกชนิด และลักษณะดังกล่าวตรงกับส่วนวิธีการ บททบทวนวรรณกรรม และร้อยแก้วที่ระมัดระวังของผู้เขียนที่ทำงานในภาษาที่สอง รูปแบบของ AI detectors ที่ระบุผู้พูดภาษาอังกฤษที่ไม่ใช่เจ้าของภาษาในอัตราที่สูงกว่า ได้รับการบันทึกไว้ทั่วทั้งอุตสาหกรรม และไม่มีสิ่งใดในวิธีการของ Winston ที่ยกเว้นตัวมันเอง แผนที่การคาดการณ์รายประโยคสมควรได้รับความระมัดระวังเช่นเดียวกัน, ประโยคที่ถูกไฮไลต์เป็นสีแดงเป็นเพียงข้อสังเกตเชิงสถิติเกี่ยวกับรูปแบบของคำ ไม่ใช่หลักฐานเกี่ยวกับความเป็นผู้ประพันธ์ นักศึกษาที่เผชิญการระบุผิดควรเริ่มจากเอกสารหลักฐาน ไม่ใช่การยอมรับความผิด, คู่มือของเราเกี่ยวกับ วิธีพิสูจน์ว่าคุณไม่ได้ใช้ AI อธิบายสิ่งที่โน้มน้าวได้จริง

ราคาและการเข้าถึง

Winston เป็นผลิตภัณฑ์แบบชำระเงินที่มีช่วงทดลองใช้งานจำกัด Winston ระบุการทดลองใช้ฟรี 14 วันพร้อมเครดิต 2,000 หน่วย, แผน Essential ราคา $18 ต่อเดือน, หรือ $10 ต่อเดือนเมื่อเรียกเก็บเป็นรายปี, พร้อมเครดิตรายเดือน 100,000 หน่วย, แผน Advanced ราคา $29 ต่อเดือน, หรือ $16 ต่อปี, ซึ่งเพิ่มที่นั่งสำหรับทีมและการสแกนที่มีขนาดใหญ่ขึ้น, และระดับ Elite ที่สูงกว่านั้น สำหรับผู้สอนรายบุคคลที่คัดกรองงานส่งของทั้งชั้นเรียน สิ่งนี้ทำให้ Winston อยู่ในขอบเขตของการซื้อแบบฉับพลัน, ราคาถูกกว่าสัญญาระดับสถาบัน, แต่มีความสามารถมากกว่าเครื่องมือฟรีส่วนใหญ่

Winston อยู่ตรงไหนในภูมิทัศน์ของเครื่องตรวจจับ

จากหลักฐานอิสระ Winston เป็นเครื่องตรวจจับเชิงพาณิชย์ระดับราคากลางที่ทำงานได้ดีกว่าระดับฟรีของตลาด และแย่กว่าที่โฆษณาไว้เอง มันเหมาะกับผู้สอนที่ต้องการมองเห็นรายประโยค, การเชื่อมต่อกับ Classroom, และการตรวจสอบการลอกเลียนในเครื่องมือราคาย่อมเยาเพียงตัวเดียว, และผู้ที่มองผลลัพธ์ทุกครั้งเป็นจุดเริ่มต้นของการสนทนา ไม่ใช่คำตัดสิน มันไม่เหมาะกับผู้ใดก็ตามที่ต้องการให้คะแนนทำหน้าที่เป็นหลักฐาน, เพราะคะแนนของเครื่องตรวจจับใด ๆ ก็ทำไม่ได้

การเปรียบเทียบฉบับเต็ม

Winston เป็นหนึ่งในเครื่องตรวจจับในสนามที่มีการแข่งขันหนาแน่น และช่องว่างระหว่าง 71% กับ 99.98% เป็นตัวอย่างหนึ่งของรูปแบบที่พบได้ทั่วทั้งอุตสาหกรรม สำหรับการเปรียบเทียบว่าเครื่องมือนี้อยู่ในระดับใดเมื่อเทียบกับ Turnitin, GPTZero, Originality, ZeroGPT และเครื่องมืออื่น ๆ บนเกณฑ์ที่ยึดหลักฐานเป็นสำคัญเหมือนกัน โปรดดูคู่มือฉบับเต็มของเราเกี่ยวกับ AI detectors compared

สิ่งที่งานวิจัยของเราเองค้นพบ

ในการศึกษาความสอดคล้องของเครื่องตรวจจับโดย TextPulse Research เครื่องตรวจจับ AI เชิงพาณิชย์เก้าตัวให้คะแนนบทความวิชาการชุดเดียวกัน 90 ชิ้น หนึ่งในนั้นเป็นข้อความไฮบริดยาว 455 คำ: ส่วนเปิดและส่วนปิดเขียนโดยมนุษย์ คั่นกลางด้วยส่วนที่ AI สร้างยาว 168 คำ Winston AI ให้คะแนนข้อความนี้ 7% AI ขณะที่คำตัดสินของเครื่องมืออื่นต่อคำชุดเดียวกันกระจายตั้งแต่ 0% ถึง 95.7% AI บทความฉบับเต็ม คลังข้อความ และตารางคะแนนของทุกเครื่องมือเปิดให้เข้าถึงได้ที่ TextPulse Research

Winston AI กับข้อความไฮบริดจากคลังข้อความของการศึกษา
Winston AI กับข้อความไฮบริดจากคลังข้อความของการศึกษา
XLinkedInFacebook

คำถามที่พบบ่อย

ตัวเลข 99.98% เป็นข้ออ้างของ Winston AI เอง โดยวัดจากชุดทดสอบภายในที่บริษัทไม่ได้เผยแพร่ ในการประเมิน RAID แบบ peer-reviewed ที่นำเสนอใน ACL 2024 Winston ได้คะแนนความแม่นยำโดยรวม 71.0% เมื่อกำหนดอัตราบวกลวงไว้ที่ 5% แม้ว่าในผลลัพธ์จาก ChatGPT โดยเฉพาะจะได้ 99.6% ข้ออ้างนี้อธิบายคลังข้อมูลที่เลือกไว้ ไม่ใช่สมรรถนะในโลกจริง

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

ติดตามข่าวสารเกี่ยวกับการทำให้ AI เป็นธรรมชาติมากขึ้น

รับเคล็ดลับเกี่ยวกับการเขียนเชิงวิชาการ การตรวจจับ AI และการทำให้ข้อความเป็นธรรมชาติ ส่งตรงถึงกล่องจดหมายของคุณ

ไม่มีสแปม ยกเลิกการสมัครได้ทุกเมื่อ