AI Detection

อัตราบวกเท็จของ Turnitin: ตัวเลขบอกอะไร

Turnitin เผยตัวเลขบวกเท็จสองค่า ไม่ใช่ค่าเดียว และทั้งสองค่าไม่ได้อธิบายเอกสารที่อยู่ตรงหน้าศาสตราจารย์คนใดคนหนึ่ง นี่คือการแยกระดับเอกสารกับระดับประโยค เครื่องหมายดอกจันสำหรับต่ำกว่า 20 เปอร์เซ็นต์ และการคำนวณที่ทำให้เศษเสี้ยวของเปอร์เซ็นต์กลายเป็นจำนวนจริงของนักศึกษา

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

อัตราผลบวกลวงของ Turnitin ไม่ได้มีเพียงตัวเลขเดียว บริษัทเผยแพร่ไว้สองค่า คือค่าที่ต่ำกว่า 1 เปอร์เซ็นต์ในระดับเอกสาร และอีกค่าที่ใกล้ 4 เปอร์เซ็นต์ในระดับประโยค ทั้งสองค่ามีอยู่จริง ทั้งสองค่าถูกเผยแพร่จริง และไม่มีค่าใดเพียงลำพังที่จะบอกอะไรได้มากเกี่ยวกับบทความเฉพาะชิ้นที่วางอยู่ตรงหน้าศาสตราจารย์คนใดคนหนึ่ง

ช่องว่างระหว่างตัวเลขทั้งสองค่า และสิ่งที่เกิดขึ้นเมื่อใช้ค่าหนึ่งค่าใดกับชั้นเรียนจริงแทนที่จะเป็นเอกสารเพียงชิ้นเดียว คือประเด็นที่บทความนี้จะพิจารณา, Turnitin ระบุอะไรไว้เอง, ตัวเลขทั้งสองค่าครอบคลุมอะไรจริง, และการคำนวณแบบใดที่เปลี่ยนเศษส่วนของเปอร์เซ็นต์ให้กลายเป็นจำนวนผู้เรียนจริง

อัตราผลบวกลวงของ Turnitin คืออะไร ตามที่ Turnitin ระบุ?

ในระดับเอกสาร ตามถ้อยคำของบริษัทเอง, "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." เงื่อนไขนี้มีความสำคัญพอ ๆ กับตัวเลข ค่าที่ต่ำกว่า 1 เปอร์เซ็นต์นี้ไม่ใช่การอ้างถึงทุกบทความที่ Turnitin ให้คะแนน แต่เป็นการอธิบายเฉพาะกลุ่มย่อยของบทความที่ผ่านเกณฑ์ข้อความที่เขียนโดย AI อย่างน้อย 20 เปอร์เซ็นต์แล้ว ตามการประมาณของแบบจำลองเอง

ในระดับประโยค ซึ่งส่วนติดต่อผู้ใช้จะเน้นบรรทัดแต่ละบรรทัดแทนที่จะเป็นทั้งเอกสาร ตัวเลขของ Turnitin เองสูงกว่าประมาณสี่เท่า "Our sentence-level false positive rate is around 4%," บริษัทระบุ "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin เสริมว่าประโยคที่ถูกระบุผิดเหล่านี้ไม่ได้กระจายแบบสุ่ม, 54 เปอร์เซ็นต์ของเวลา ประโยคที่ถูกแจ้งเตือนผิดจะอยู่ติดกับข้อความที่เขียนโดย AI จริง ซึ่งบริษัทเสนอว่านี่เป็นส่วนหนึ่งของเหตุผลที่คะแนนระดับทั้งเอกสารมักมีความน่าเชื่อถือมากกว่าบรรทัดที่ถูกเน้นเพียงบรรทัดเดียว

ระดับเอกสารและระดับประโยคไม่ใช่ข้ออ้างเดียวกัน

การแบ่งออกเป็นสองระดับนี้เป็นการสื่อสารที่ปรับแก้แล้ว ไม่ใช่จุดยืนเดิมของ Turnitin เมื่อเปิดตัวในเดือนเมษายน 2023 บริษัทได้เผยแพร่ตัวเลขเดียวที่ต่ำกว่า 1% โดยไม่มีการแยกความแตกต่างระหว่างระดับเอกสารกับระดับประโยคเลย หลังจากสถาบันต่าง ๆ เริ่มอ้างอิงตัวเลขนั้น และหลังจากสื่อการศึกษารายงานผลบวกลวงในโลกจริงที่สูงกว่าที่คาดไว้ ประธานเจ้าหน้าที่ฝ่ายผลิตภัณฑ์ของ Turnitin จึงเผยแพร่การแจกแจงที่ใช้ข้างต้น พร้อมกับการเปลี่ยนแปลงผลิตภัณฑ์สองประการที่ทำขึ้นเพื่อตอบสนอง ได้แก่ การเพิ่มความยาวเอกสารขั้นต่ำที่สามารถให้คะแนนได้จาก 150 เป็น 300 คำ และการเปลี่ยนวิธีให้คะแนนประโยคต้นและประโยคท้ายในเอกสาร

เกณฑ์ขั้นต่ำ 300 คำมีอยู่ด้วยเหตุผลที่เกี่ยวข้องกัน Turnitin ได้เพิ่มจากขั้นต่ำเดิม 150 คำ หลังจากพบว่า ตามถ้อยคำของบริษัทเอง ความแม่นยำเพิ่มขึ้นเมื่อมีข้อความมากขึ้น การส่งงานที่สั้น, การสะท้อนความคิดหนึ่งหน้า, ร่างบางส่วน, โพสต์อภิปราย, ล้วนให้สัญญาณแก่โมเดลน้อยกว่าที่ใช้ในการวัดตัวเลขผลบวกลวงข้างต้น ซึ่งเป็นส่วนหนึ่งของเหตุผลที่สิ่งใดก็ตามที่ต่ำกว่าเกณฑ์นั้นจะไม่ได้รับคะแนน AI เลย แทนที่จะได้คะแนนที่ไม่น่าเชื่อถือ

ระดับอัตราที่ Turnitin ระบุสิ่งที่ครอบคลุมจริง
ระดับเอกสารต่ำกว่า 1%เฉพาะเอกสารที่ถูกตั้งธงไว้แล้วว่าเป็นงานที่เขียนโดย AI ตั้งแต่ 20% ขึ้นไป, เป็นเปอร์เซ็นต์รวมของการส่งงานทั้งฉบับ
ระดับประโยคประมาณ 4%ประโยคใดก็ตามที่ถูกไฮไลต์ภายในรายงานการเขียนด้วย AI, ไม่ว่าคะแนนรวมของเอกสารจะเป็นเท่าใด
ต่ำกว่าเกณฑ์เอกสาร 20%ไม่แสดงตัวเลขTurnitin จะแสดงเครื่องหมายดอกจันแทนเปอร์เซ็นต์, เพื่อระบุว่าผลลัพธ์ในช่วงนั้นมีความน่าเชื่อถือน้อยกว่า

ทำให้บทความของคุณเป็นธรรมชาติมากขึ้น

ปรับข้อความที่ช่วยโดย AI ของคุณให้ฟังดูเป็นธรรมชาติ, โดยไม่แตะต้องคำสำคัญหรือการอ้างอิง

เริ่มต้นฟรี

คณิตศาสตร์: เศษส่วนของเปอร์เซ็นต์หมายถึงอะไรสำหรับกลุ่มตัวอย่างจริง

การคำนวณนี้ถูกเปิดเผยต่อสาธารณะเมื่อ Vanderbilt University คำนวณอัตราความผิดพลาดที่เกี่ยวข้องกับการตรวจจับด้วย AI ของ Turnitin ในเดือนสิงหาคม 2023 ตัวอย่างที่ดีที่สุดของวิธีคำนวณนี้คือการคำนวณตัวเลขของ Vanderbilt เอง ในบล็อกโพสต์เกี่ยวกับการตัดสินใจปิดตัวตรวจจับ AI ของ Turnitin พวกเขาระบุว่า "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."

ตัวเลขดังกล่าวเป็นการประมาณขยายของ Vanderbilt เองจากตัวเลขที่ผู้ขายเผยแพร่ โดยนำไปใช้กับปริมาณงานของ Vanderbilt เอง ไม่ใช่ผลลัพธ์ที่วัดแยกต่างหาก รูปแบบของการคำนวณนี้สามารถขยายไปเกินจำนวนบุคลากรของมหาวิทยาลัยหนึ่งแห่งได้ อัตราต่ำกว่า 1 เปอร์เซ็นต์ที่นำไปใช้กับเอกสารเพียงไม่กี่ร้อยฉบับจะก่อให้เกิดนักศึกษาที่ถูกตั้งธงผิดเพียงไม่กี่ราย ซึ่งมองข้ามได้ง่าย อัตราเดียวกันเมื่อนำไปใช้กับเอกสารหลายหมื่นฉบับ ซึ่งเป็นขนาดที่มหาวิทยาลัยจริงส่งในแต่ละปี จะก่อให้เกิดกรณีผิดพลาดเป็นร้อยแทนที่จะเป็นเพียงไม่กี่ราย เพราะเปอร์เซ็นต์เล็กน้อยและประชากรขนาดใหญ่ถูกนำมาคูณกัน แทนที่จะพิจารณาแยกจากกัน

ทั้งหมดนี้ไม่ได้พิสูจน์ว่าอัตราในโลกจริงตรงกับตัวเลขจากห้องปฏิบัติการอย่างแม่นยำ Chief product officer ของ Turnitin เองได้ยอมรับต่อสาธารณะว่าผลลัพธ์ในโลกจริงแตกต่างจากการทดสอบในห้องปฏิบัติการ ซึ่งเป็นส่วนหนึ่งของเหตุผลที่บริษัทปรับถ้อยแถลงของตนตั้งแต่แรก การคำนวณข้างต้นถือว่าตัวเลขที่ Turnitin ระบุเองเป็นข้อมูลนำเข้าที่ควรให้ความสำคัญ ไม่ใช่เพดานของสิ่งที่เกิดขึ้นจริงเมื่อเครื่องมือหนึ่งกำลังให้คะแนนงานส่งที่ไม่เหมือนกับ benchmark ที่คัดสรรมาเลย

อัตรานี้ไม่ครอบคลุมอะไรบ้าง

ผลลัพธ์ที่ต่ำกว่าเกณฑ์ 20 percent จะไม่ได้มีเปอร์เซ็นต์ขนาดเล็กกำกับไว้ แต่จะมีเครื่องหมายดอกจันแทนตัวเลข ซึ่งเป็นการเลือกของ Turnitin เพราะช่วงดังกล่าวเป็นช่วงที่เครื่องมือนี้มีความน่าเชื่อถือน้อยที่สุดในทั้งสองทิศทาง และมีการยืนยันจากรายงานอิสระของสื่อการศึกษา ควบคู่กับกรอบการสื่อสารของบริษัทเองที่ระบุความไม่มั่นใจในช่วงนั้น การแก้ไขเพียงเล็กน้อย, หนึ่งย่อหน้าที่ปรับปรุงด้วยความช่วยเหลือและส่วนที่เหลือเขียนโดยไม่มีผู้ช่วย, อาจทำให้ไม่มีคะแนนที่มองเห็นได้เลย แทนที่จะเป็นคะแนนเล็กน้อย ซึ่งควรรู้ไว้ก่อนที่ตัวเลขที่หายไปจะถูกอ่านว่าเป็นทั้งข้อกล่าวหา หรือใบรับรองความบริสุทธิ์ TextPulse's guide to what counts as a good Turnitin score ครอบคลุมเกณฑ์เดียวกันนี้จากมุมมองของผู้อ่านรายงาน

ดังนั้น ควรอ่านอัตรา false positive ที่เผยแพร่อย่างไร?

ควรอ่านว่าเป็นตัวเลขของผู้ให้บริการเกี่ยวกับเงื่อนไขที่แคบกว่าที่ดูเหมือนจะอธิบายในตอนแรก ไม่ใช่คำกล่าวเกี่ยวกับเอกสารที่วางอยู่ตรงหน้าศาสตราจารย์คนใดคนหนึ่ง Turnitin อธิบายผลลัพธ์ของตนในลักษณะเดียวกัน, บริษัทระบุอย่างชัดเจนว่าเทคโนโลยีตรวจจับการเขียนด้วย AI ของตนไม่ได้ให้ "a determination of misconduct," แต่ให้เพียง "data for educators to make an informed decision." หลักฐานในวงกว้างเกี่ยวกับ whether AI detectors are accurate at all สนับสนุนการอ่านแบบเดียวกันนี้, อัตราที่เผยแพร่หมายถึงเกณฑ์มาตรฐาน ไม่ใช่เอกสารที่กำลังถูกให้คะแนนอยู่ในขณะนั้น

ผู้เขียนที่ต้องการทราบว่าร่างของตนอยู่ตรงไหนบนการวัดทางสถิติแบบเดียวกันนี้ แทนที่จะเดา สามารถตรวจสอบได้โดยตรงด้วย free perplexity checker ก่อนที่สิ่งใดจะไปถึงเครื่องมือตรวจจับของสถาบัน นั่นเป็นการใช้เทคโนโลยีคนละแบบกับการพยายามโต้แย้งคะแนนภายหลัง และเป็นจุดเดียวที่ผู้เขียน, ไม่ใช่ผู้ดูแลระบบ, ได้เห็นตัวเลขก่อน

ZeroGPT's accuracy is examined separately สำหรับผู้ที่สถาบันของตนใช้เครื่องมือนั้น กลุ่มที่ได้รับผลกระทบจากข้อผิดพลาดเหล่านี้หนักที่สุด, non-native English writers, เป็นหัวข้อของหน้าเฉพาะของตนเอง

ประชากรที่เผชิญกับคณิตศาสตร์เช่นนี้มากที่สุดก็ไม่ได้กระจายอย่างสม่ำเสมอเช่นกัน ผู้เขียนภาษาอังกฤษที่ไม่ใช่เจ้าของภาษามีความเสี่ยงที่ได้รับการบันทึกไว้สูงที่สุดที่จะตกอยู่ในด้านที่ผิดของเปอร์เซ็นต์เหล่านี้ ซึ่งก็คือกลุ่มผู้อ่านที่ หน้าสำหรับนักเขียนวิชาการ ESL ของ TextPulse ถูกสร้างขึ้นมาเพื่อรองรับ Turnitin จะยังคงปรับปรุงตัวเลขเหล่านี้ต่อไปเมื่อมีการฝึกโมเดลใหม่ สิ่งที่จะไม่เปลี่ยนคือคณิตศาสตร์เอง, อัตราที่เล็กเช่นนี้ยังคงต้องอาศัยประชากรที่ใหญ่เช่นนี้เพื่อกลืนหายไป และการส่งงานจริงส่วนใหญ่ไม่ได้โชคดีเช่นนั้น

XLinkedInFacebook

คำถามที่พบบ่อย

อัตราบวกเท็จของ Turnitin ตามตัวเลขที่บริษัทเผยแพร่เอง ไม่ใช่ตัวเลขค่าเดียว ที่ระดับเอกสาร Turnitin ระบุอัตราต่ำกว่า 1 เปอร์เซ็นต์ แต่ใช้กับเอกสารที่ถูกระบุไว้แล้วว่ามี AI-written ตั้งแต่ 20 เปอร์เซ็นต์ขึ้นไปเท่านั้น ที่ระดับประโยค ซึ่งเป็นระดับที่มีการไฮไลต์แต่ละบรรทัด ตัวเลขของบริษัทเองอยู่ที่ประมาณ 4 เปอร์เซ็นต์

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

ติดตามข่าวสารเกี่ยวกับการทำให้ AI เป็นธรรมชาติมากขึ้น

รับเคล็ดลับเกี่ยวกับการเขียนเชิงวิชาการ การตรวจจับ AI และการทำให้ข้อความเป็นธรรมชาติ ส่งตรงถึงกล่องจดหมายของคุณ

ไม่มีสแปม ยกเลิกการสมัครได้ทุกเมื่อ