AI Detection

ZeroGPT แม่นยำหรือไม่?

คำถามที่พบบ่อยของ ZeroGPT เองอ้างอัตราใกล้ 98 เปอร์เซ็นต์จากการทดสอบภายใน และยอมรับแยกต่างหากว่างานเขียนที่เป็นสูตรสำเร็จอาจถูกอ่านว่าเป็น AI ไม่ว่าใครจะเป็นผู้เขียนก็ตาม นี่คือสิ่งที่บริษัทระบุเกี่ยวกับวิธีการของตน สิ่งที่การทดสอบอิสระต่อผลิตภัณฑ์นี้โดยตรงพบ และคะแนนฟรีมีประโยชน์จริงอย่างไร.

4 min
ZeroGPT accuracy: the company's own claimed rate next to its disclosed limitations on formulaic writing

ความแม่นยำของ ZeroGPT ตามที่บริษัทอ้างในปัจจุบันเอง คืออัตรา "เข้าใกล้ >98% ในการประเมินภายใน" ซึ่งเป็นตัวเลขที่บริษัทยอมรับว่ามาจากการทดสอบที่บริษัททำกับตัวเอง ไม่ใช่จากห้องปฏิบัติการภายนอก ข้อกำกับเพียงคำเดียวนี้ คือ internal, ก็แทบเพียงพอแล้วสำหรับผู้อ่าน ก่อนจะถือว่าเปอร์เซ็นต์ของเครื่องตรวจจับฟรีใด ๆ เป็นข้อเท็จจริงที่ยุติแล้ว

ZeroGPT เป็นหนึ่งในเครื่องตรวจจับ AI แบบใช้ฟรีที่มีการใช้งานมากที่สุด ส่วนใหญ่เพราะไม่เสียค่าใช้จ่ายและให้คำตอบภายในไม่กี่วินาที ช่องว่างระหว่างคำกล่าวอ้างของผู้ให้บริการกับการทดสอบอิสระที่ปรากฏในเครื่องตรวจจับ AI โดยทั่วไป ปรากฏที่นี่เช่นกัน สิ่งต่อไปนี้คือสิ่งที่บริษัทระบุในปัจจุบันเกี่ยวกับความแม่นยำและวิธีการของตนเอง สิ่งที่วิธีการนั้นดูเหมือนจะวัดจริง และเหตุใดเครื่องมือเช่นนี้จึงมักทำงานผิดพลาดในลักษณะเฉพาะที่คาดเดาได้ เมื่อใช้กับงานเขียนประเภทที่ผู้อ่านเชิงวิชาการส่งเข้ามา

ZeroGPT homepage detector with a 15,000 character free input and no signup required
การตรวจเบื้องต้นแบบฟรีที่เป็นแกนกลางของบทความนี้, 15,000 ตัวอักษร, ไม่ต้องมีบัญชี

ความแม่นยำของ ZeroGPT คืออะไร ตามที่บริษัทระบุ?

คำถามที่พบบ่อยของ ZeroGPT เองระบุว่าบริษัท "มอบความแม่นยำชั้นนำของอุตสาหกรรม และได้รับการปรับปรุงอย่างต่อเนื่องเพื่อคงประสิทธิภาพระดับดีที่สุดในกลุ่ม โดยเข้าใกล้ >98% ในการประเมินภายใน" นี่คือคำกล่าวอ้างของผู้ให้บริการเกี่ยวกับผลิตภัณฑ์ของตนเอง ซึ่งทดสอบโดยบริษัทเอง และถ้อยคำก็มีการกันความเสี่ยงไว้จริงในตัวอยู่แล้ว, "เข้าใกล้" ตัวเลขหนึ่ง ไม่ใช่ถ้อยแถลงเดียวกับการไปถึงและคงไว้ซึ่งตัวเลขนั้น, และ "การประเมินภายใน" หมายความว่าไม่มีฝ่ายภายนอกใดเผยแพร่ตัวเลขที่สอดคล้องกัน หน้าเว็บไม่ได้ระบุว่าชุดทดสอบภายในนั้นมีขนาดเท่าใด มีอะไรอยู่ในนั้น หรือใครที่อยู่นอกบริษัทเป็นผู้ตรวจสอบวิธีการดังกล่าว

บริษัทแนะนำให้มีข้อความอย่างน้อย 150 ถึง 200 คำเพื่อให้ได้ผลลัพธ์ที่เสถียร และระบุว่าหากมี 500 ถึง 1,000 คำหรือมากกว่านั้นจะช่วยเพิ่มความน่าเชื่อถือยิ่งขึ้น อีกทั้งยังกล่าวโดยตรงว่าข้อความที่สั้นมากหรือถูกแก้ไขอย่างหนัก "carry fewer signals." การเปิดเผยเพียงข้อนี้มีความสำคัญมากกว่าร้อยละที่พาดหัวไว้ นี่คือการยอมรับของผู้ให้บริการเองว่าคะแนนจะน่าเชื่อถือได้เท่ากับความยาวของข้อมูลนำเข้าและการที่ข้อมูลนั้นไม่ถูกแตะต้อง ซึ่งเป็นเงื่อนไขที่งานส่งจริงไม่ได้เป็นไปตามเสมอไป

ZeroGPT ใช้วิธีการใดกันแน่?

ZeroGPT เรียกระบบพื้นฐานของตนว่า DeepAnalyse ซึ่งอธิบายบนเว็บไซต์ของตนเองว่าเป็น "multi-stage methodology designed to optimize accuracy while minimizing false positives and negatives" ที่อ่านข้อความ "from the macro level to the micro one." คำถามที่พบบ่อยของมันอธิบายสิ่งที่เฉพาะเจาะจงยิ่งขึ้นอยู่ใต้ชื่อแบรนด์ว่าเป็นการวิเคราะห์ "token patterns, burstiness, entropy, and ensemble classifier features trained on mixed datasets."

Burstiness และ entropy ไม่ได้มีเฉพาะใน ZeroGPT เท่านั้น ทั้งสองเป็นคุณสมบัติทางสถิติแบบเดียวกัน คือระดับที่ความยาวและจังหวะของประโยคแปรผันมากน้อยเพียงใด และระดับที่คำถัดไปแต่ละคำคาดเดาได้มากน้อยเพียงใด ซึ่งคำอธิบายของ TextPulse เองเกี่ยวกับ how AI detectors work กล่าวถึงว่าเป็นกลไกทั่วไปเบื้องหลังเครื่องมือทั้งหมวดหมู่นี้ free perplexity checker แสดงค่าพื้นฐานเดียวกันนั้นโดยตรง โดยไม่ต้องให้ผู้เขียนเชื่อถือร้อยละของผู้ให้บริการรายใดรายหนึ่งก่อน

ทำให้บทความของคุณเป็นธรรมชาติมากขึ้น

ปรับข้อความที่ช่วยโดย AI ของคุณให้ฟังดูเป็นธรรมชาติ, โดยไม่แตะต้องคำสำคัญหรือการอ้างอิง

เริ่มต้นฟรี

เหตุใดงานเขียนเชิงวิชาการจึงทำให้ตัวตรวจจับเหล่านี้ทำงานผิดพลาด?

คำถามที่พบบ่อยของ ZeroGPT อธิบายไว้ดังนี้, "highly polished, formulaic, or low-entropy writing can resemble AI." งานเขียนเชิงวิชาการถูกออกแบบมาให้เป็นงานเขียนที่ขัดเกลาอย่างมาก เป็นแบบแผน และมี entropy ต่ำ ส่วนของวิธีการ ทบทวนวรรณกรรม และจดหมายปะหน้าทางการ ล้วนให้คุณค่ากับวลีตามแบบแผนมากกว่าวลีที่สร้างสรรค์ เพราะแบบแผนคือสิ่งที่ทำให้เอกสารนั้นใช้งานได้สำหรับผู้อ่านตั้งแต่แรก และแบบแผนดังกล่าวก็คือรูปแบบ entropy ต่ำที่การเปิดเผยของผู้ให้บริการเองระบุว่าเป็นความเสี่ยง

การทดสอบแบบอิสระและผ่านการตรวจสอบโดยผู้ทรงคุณวุฒิแสดงให้เห็นว่าเหตุใดโหมดความล้มเหลวนี้จึงกระทบผู้เขียนบางคนหนักกว่าคนอื่น การศึกษาในปี 2023 ของ Stanford ได้ทดสอบตัวตรวจจับที่ใช้กันอย่างแพร่หลาย 7 ตัว รวมถึง ZeroGPT กับเรียงความ TOEFL จริง 91 ฉบับที่เขียนโดยผู้ใช้ภาษาอังกฤษที่ไม่ใช่เจ้าของภาษา และเรียงความ 88 ฉบับที่เขียนโดยนักเรียนชั้นประถมศึกษาปีที่ 8 ในสหรัฐอเมริกา ZeroGPT ระบุว่า 48 เปอร์เซ็นต์ของเรียงความ TOEFL เป็นข้อความที่สร้างโดย AI เทียบกับ 0 เปอร์เซ็นต์ของเรียงความชั้นประถมศึกษาปีที่ 8 ซึ่งเป็นทิศทางของความผิดพลาดแบบเดียวกับที่ตัวตรวจจับทุกตัวในการศึกษานั้นแสดง เพียงแต่มีขนาดต่างกัน

ช่องว่างนั้นไม่ได้มีลักษณะเฉพาะของ ZeroGPT และก็ไม่ได้เป็นข้อมูลใหม่แต่อย่างใด มันคือรูปแบบอคติต่อผู้เขียนที่ไม่ใช่เจ้าของภาษาซึ่งได้รับการบันทึกไว้ทั่วทั้งอุตสาหกรรมตัวตรวจจับ และมีการอธิบายอย่างละเอียดมากขึ้นในหน้าของ TextPulse เองเกี่ยวกับเหตุผลที่ตัวตรวจจับ AI มีอคติต่อผู้ใช้ภาษาอังกฤษที่ไม่ใช่เจ้าของภาษา สิ่งที่ช่องว่างนี้แสดงโดยเฉพาะเกี่ยวกับเครื่องมือฟรีสำหรับผู้ใช้ทั่วไป คือข้อจำกัดที่ผู้ขายเปิดเผยไว้เอง, งานเขียนที่มีเอนโทรปีต่ำอ่านได้ราวกับสร้างโดยเครื่องจักร, ไม่ใช่เพียงสมมติฐาน การทดสอบโดยผู้ทรงคุณวุฒิพบว่ามันเกิดขึ้นกับผลิตภัณฑ์นี้โดยตรงหลายปีก่อนที่ FAQ ปัจจุบันของบริษัทจะอธิบายกลไกนี้ด้วยถ้อยคำของตนเอง

คะแนนจากตัวตรวจจับฟรีสามารถพิสูจน์อะไรเกี่ยวกับเอกสารฉบับหนึ่งได้หรือไม่?

ไม่ได้ด้วยตัวมันเอง เปอร์เซ็นต์จาก ZeroGPT ไม่ใช่หลักฐานของสิ่งใดเกี่ยวกับเอกสารฉบับใดฉบับหนึ่ง ไม่ว่าในทิศทางใดก็ตาม มันเป็นเพียงค่าประมาณของโมเดลหนึ่ง ซึ่งสร้างจากการทดสอบภายในที่บริษัทไม่ได้เผยแพร่ในรูปแบบที่บุคคลภายนอกบริษัทสามารถตรวจสอบได้ ใช้กับงานเขียนที่ความยาว ประวัติการแก้ไข และประเภทของงาน ล้วนเปลี่ยนการอ่านไปในลักษณะที่ FAQ ของผู้ขายเองก็ยอมรับอยู่แล้ว การนำคะแนนฟรีเพียงคะแนนเดียวมาใช้เป็นคำตัดสินนั้น เป็นการคาดหวังจากคะแนนนั้นมากกว่าที่บริษัทผู้ออกคะแนนอ้างไว้สำหรับมัน

สิ่งที่คะแนนมีประโยชน์อย่างแท้จริงนั้นมีขอบเขตแคบและเป็นเรื่องพื้นฐานมากกว่า, คือการอ่านอย่างรวดเร็วโดยไม่มีค่าใช้จ่ายว่า ร่างต้นฉบับในขณะนั้นอยู่ตรงไหนบนการวัดทางสถิติชนิดเดียวกับที่เครื่องมือสถาบันแบบเสียค่าบริการก็ใช้เช่นกัน, ก่อนที่ใครจะเห็นมัน เครื่องมือฟรีของ TextPulse ครอบคลุมพื้นที่เดียวกันนี้โดยตรง, โดยไม่ต้องให้ผู้เขียนเดาว่าควรเชื่อคะแนนจากเครื่องตรวจจับฟรีหลายตัวใดก่อน

ตัวเลขความแม่นยำปกปิดว่า ข้อผิดพลาดตกกับใครและอะไรเป็นตัวกระตุ้นมัน การรู้ เมื่อใดควรใช้ a, an และ the ช่วยขจัดรูปแบบหนึ่งที่ทำให้เกิดการตั้งธง, และ false positive หมายถึงอะไรจริง ๆ ได้อธิบายแยกไว้ต่างหาก

ทั้งหมดนี้ไม่ได้ทำให้ตัวเลขของ ZeroGPT ไร้ความหมาย, และก็ไม่ได้ทำให้ตัวเลขนั้นเพียงพอได้ด้วยตัวมันเอง คะแนนเป็นเพียงค่าประมาณตั้งต้น, ที่ได้มาจากวิธีการซึ่งบริษัทอธิบายไว้เพียงคร่าว ๆ และยังไม่ได้เปิดให้มีการทดสอบจากภายนอก, บนงานเขียนที่เพียงแค่ประเภทของมันก็สามารถทำให้ผลลัพธ์เปลี่ยนไปได้ก่อนที่ผู้เกี่ยวข้องจะทำสิ่งใดผิด คำสองคำที่ให้ข้อมูลมากที่สุดบนหน้า FAQ นั้นไม่ใช่เปอร์เซ็นต์ แต่เป็นคำบอกเงื่อนไขที่อยู่ถัดจากมันโดยตรง, คือ internal และ pushing toward คะแนนฟรีเป็นจุดเริ่มต้นสำหรับการสนทนาเกี่ยวกับร่างต้นฉบับ, ไม่ใช่ข้อสรุปปิดท้ายในการสนทนานั้น

สิ่งที่งานวิจัยของเราเองค้นพบ

ในการศึกษาความสอดคล้องของเครื่องตรวจจับโดย TextPulse Research เครื่องตรวจจับ AI เชิงพาณิชย์เก้าตัวให้คะแนนบทความวิชาการชุดเดียวกัน 90 ชิ้น หนึ่งในนั้นเป็นข้อความไฮบริดยาว 455 คำ: ส่วนเปิดและส่วนปิดเขียนโดยมนุษย์ คั่นกลางด้วยส่วนที่ AI สร้างยาว 168 คำ ZeroGPT ให้คะแนนข้อความนี้ 7.6% AI ขณะที่คำตัดสินของเครื่องมืออื่นต่อคำชุดเดียวกันกระจายตั้งแต่ 0% ถึง 95.7% AI บทความฉบับเต็ม คลังข้อความ และตารางคะแนนของทุกเครื่องมือเปิดให้เข้าถึงได้ที่ TextPulse Research

ZeroGPT กับข้อความไฮบริดจากคลังข้อความของการศึกษา
ZeroGPT กับข้อความไฮบริดจากคลังข้อความของการศึกษา
XLinkedInFacebook

คำถามที่พบบ่อย

ความแม่นยำของ ZeroGPT ตามที่บริษัทอ้างในปัจจุบันเอง อยู่ที่อัตรา "ใกล้ >98% ในการประเมินภายใน" ตัวเลขนั้นมาจากการทดสอบที่บริษัททำกับผลิตภัณฑ์ของตนเอง ไม่ใช่จากห้องปฏิบัติการภายนอก และคำถามที่พบบ่อยของผู้จำหน่ายเองยังระบุแยกต่างหากว่างานเขียนที่ขัดเกลามากหรือเป็นสูตรสำเร็จอาจถูกอ่านว่าเป็นข้อความที่สร้างโดย AI ไม่ว่าใครจะเป็นผู้เขียนก็ตาม.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

ติดตามข่าวสารเกี่ยวกับการทำให้ AI เป็นธรรมชาติมากขึ้น

รับเคล็ดลับเกี่ยวกับการเขียนเชิงวิชาการ การตรวจจับ AI และการทำให้ข้อความเป็นธรรมชาติ ส่งตรงถึงกล่องจดหมายของคุณ

ไม่มีสแปม ยกเลิกการสมัครได้ทุกเมื่อ