เหตุใดเครื่องตรวจจับ AI จึงมีอคติต่อผู้เขียนภาษาอังกฤษที่ไม่ใช่เจ้าของภาษา
การศึกษา Stanford ปี 2023 พบว่าเครื่องตรวจจับ AI อ่านงานเขียนภาษาอังกฤษของผู้ที่ไม่ใช่เจ้าของภาษาอย่างคล่องแคล่วว่าเป็นข้อความที่สร้างโดยเครื่องในอัตราที่สูงกว่างานเขียนของเจ้าของภาษาอย่างมาก ต่อไปนี้คือกลไกเบื้องหลังช่องว่างดังกล่าว และสิ่งที่เกิดขึ้นเมื่อเรียงความชุดเดียวกันถูกเขียนใหม่ด้วยคำศัพท์ที่หลากหลายกว่า
ตัวตรวจจับ AI ที่มีอคติต่อผู้พูดที่ไม่ใช่เจ้าของภาษาไม่ใช่ข้อร้องเรียนเชิงอัตวิสัย งานศึกษาของ Stanford ในปี 2023 ที่ผ่านการทบทวนโดยผู้ทรงคุณวุฒิได้วัดเรื่องนี้โดยตรง นักวิจัยนำตัวตรวจจับ GPT ที่ใช้กันอย่างแพร่หลาย 7 ตัวมาทดสอบกับเรียงความ TOEFL จริง 91 ชิ้นที่เขียนโดยผู้พูดภาษาอังกฤษที่ไม่ใช่เจ้าของภาษา และเรียงความ 88 ชิ้นที่เขียนโดยนักเรียนชั้นประถมศึกษาปีที่ 8 ในสหรัฐอเมริกา จากนั้นจึงเปรียบเทียบว่ากลุ่มแต่ละกลุ่มได้คะแนนอย่างไร
ตัวตรวจจับอ่านเรียงความของนักเรียนชั้นประถมศึกษาปีที่ 8 ได้ถูกต้องเกือบทุกครั้ง สำหรับเรียงความ TOEFL ซึ่งเขียนโดยผู้ใหญ่ที่ได้ผ่านการสอบวัดความสามารถภาษาอังกฤษระดับบัณฑิตศึกษาแล้ว ตัวตรวจจับทั้ง 7 ตัวให้ค่าอัตราบวกลวงเฉลี่ย 61.22 เปอร์เซ็นต์ เรียงความ 89 จาก 91 ชิ้น คิดเป็นเกือบ 98 เปอร์เซ็นต์ ถูกระบุว่าเป็นข้อความที่สร้างโดย AI โดยอย่างน้อยหนึ่งใน 7 เครื่องมือ
ภาพรวมของ TextPulse เกี่ยวกับหลักฐานที่กว้างขึ้นว่าตัวตรวจจับ AI แม่นยำเพียงใดครอบคลุมข้อค้นพบสำคัญนั้นและคดีความที่ต่อมามีส่วนเกี่ยวข้อง สิ่งที่มักถูกข้ามไปแทบทุกครั้งเมื่อมีการอ้างถึงงานศึกษานี้คือกลไก, เหตุใดร้อยแก้วของผู้พูดภาษาอังกฤษระดับบัณฑิตศึกษาจึงถูกอ่านเหมือนเป็นงานที่สร้างโดยเครื่องตั้งแต่แรก และอะไรเปลี่ยนไปเมื่อมันหยุดถูกอ่านเช่นนั้น
ตัวตรวจจับ AI ที่มีอคติต่อผู้พูดที่ไม่ใช่เจ้าของภาษา, กลไก
ตัวตรวจจับไม่เคยอ่านเพื่อความหมาย มันอ่านว่าคำแต่ละคำคาดเดาได้เพียงใด เมื่อพิจารณาจากคำที่มาก่อนหน้า และจะให้คะแนนข้อความต่ำเมื่อโมเดลสามารถเดาส่วนใหญ่ของมันได้ล่วงหน้า ความหลากหลายของคำศัพท์, คือความกว้างของคลังคำที่ผู้เขียนหยิบมาใช้ แทนที่จะใช้ชุดคำที่ปลอดภัยชุดเล็กซ้ำ ๆ, และความคาดเดาได้ของโครงสร้างวากยสัมพันธ์, คือระดับที่โครงสร้างประโยคเป็นไปตามแบบแผนที่พบบ่อยที่สุดของภาษาแทนที่จะเปลี่ยนแปลงไป, เป็นคุณสมบัติสองประการของการผลิตภาษา ที่ทำให้คะแนนนั้นลดลง
ความแตกต่างนี้มีความสำคัญ เพราะทั้งสองอย่างปรากฏบนหน้าเอกสารแตกต่างกัน lexical diversity เกี่ยวกับตัวคำเอง, ผู้เขียนที่เลือกใช้ 'obtain,' 'acquire,' และ 'secure' ในสามประโยคที่ต่างกัน จะอ่านดูมีความหลากหลายมากกว่าผู้ที่เขียน 'get' สามครั้ง แม้ว่าในด้านอื่นประโยคจะเหมือนกันก็ตาม syntactic predictability เกี่ยวกับโครงสร้าง, คือ ประธาน กริยา กรรม ที่ถูกทำซ้ำครั้งแล้วครั้งเล่า แทนที่จะเป็นประโยคที่เปิดด้วย subordinate clause หรือจบลงด้วยคำที่ไม่คาดคิด ผู้เขียนที่ใช้ภาษาเป็นภาษาที่สองและอยู่ภายใต้เงื่อนไขการสอบ ย่อมมีเหตุผลทุกประการที่จะเลือกใช้รูปแบบที่ปลอดภัยกว่าของทั้งสองอย่าง
งานเขียนในภาษาที่สองแสดงให้เห็นอย่างสม่ำเสมอว่ามีทั้งสองอย่างน้อยกว่า และไม่ใช่ในฐานะข้อบกพร่อง ผู้เขียนที่ทำงานในภาษาเพิ่มเติมจะพึ่งพาคำศัพท์และรูปแบบประโยคที่มีแนวโน้มถูกต้องมากที่สุด เพราะการเดาผิดมีต้นทุนสูงกว่าเมื่อภาษานั้นยังไม่เป็นอัตโนมัติอย่างเต็มที่ บทความของ Stanford ที่บันทึกอคติของตัวตรวจจับได้อ้างถึงงานวิจัยด้านภาษาศาสตร์ประยุกต์จำนวนหนึ่งเกี่ยวกับรูปแบบนี้โดยตรง ซึ่งได้รับการยืนยันมานานก่อนที่ตัวตรวจจับ AI จะมีอยู่จริง, ความมั่งคั่งทางคำศัพท์ที่ลดลง, lexical diversity ที่ลดลง, และโครงสร้างประโยคที่เรียบง่ายกว่า เป็นลักษณะที่บันทึกได้และวัดได้ของงานเขียนในภาษาที่สอง มากกว่าจะเป็นสัญญาณของสิ่งอื่นใด
ช่องว่างระหว่างงานเขียนของเจ้าของภาษาและผู้ที่ไม่ใช่เจ้าของภาษาปรากฏเป็นความแตกต่างของ perplexity, ซึ่งเป็นการวัดเดียวกับที่ตัวตรวจจับใช้เพื่อพิจารณาว่าข้อความตอนหนึ่งสร้างโดยเครื่องหรือไม่ perplexity ที่ต่ำกว่าจะอ่านดูเหมือนเครื่องมากกว่า ไม่ว่าใครจะเป็นผู้ผลิต และงานเขียนในภาษาที่สองก็อยู่ต่ำกว่าบนสเกลนั้นด้วยเหตุผลที่ไม่เกี่ยวข้องกับ chatbot เลย คำถามที่ว่าช่องว่างนั้นเป็นสิ่งที่ขับเคลื่อนตัวตรวจจับจริงหรือไม่, แทนที่จะเป็นเพียงความบังเอิญ, เป็นคำถามที่ทดสอบได้ ทีม Stanford ทดสอบมันโดยตรง
เกิดอะไรขึ้นเมื่อเรียงความชุดเดียวกันถูกเขียนใหม่ด้วยคำศัพท์ที่หลากหลายกว่า
นักวิจัยได้นำเรียงความ TOEFL จำนวน 91 ชิ้นเดิมที่เคยทำให้อัตราบวกลวงเฉลี่ยอยู่ที่ 61.22 เปอร์เซ็นต์ และขอให้ ChatGPT ปรับแก้โดยใช้คำสั่งเพียงข้อเดียว, "ปรับปรุงการเลือกใช้คำให้ฟังดูเหมือนเจ้าของภาษาให้มากขึ้น" ไม่มีการสั่งให้เปลี่ยนแปลงเนื้อหา, ข้อโต้แย้ง, หรือไวยากรณ์แต่อย่างใด หลังจากการแก้ไขเพียงครั้งนั้น อัตราบวกลวงเฉลี่ยของตัวตรวจจับทั้งเจ็ดชุดเดียวกันลดลงเหลือ 11.77 เปอร์เซ็นต์, ลดลงเกือบห้าสิบจุดเปอร์เซ็นต์ และจำนวนเรียงความที่ตัวตรวจจับทุกตัวระบุพร้อมกันลดลงจากสิบแปดเหลือหนึ่ง
จากนั้นนักวิจัยได้ทำการทดลองย้อนกลับ พวกเขานำเรียงความระดับชั้นประถมศึกษาปีที่ 8 ของเจ้าของภาษา จำนวน 88 ชิ้น ซึ่งเดิมตัวตรวจจับให้คะแนนถูกต้องเกือบทุกครั้ง และขอให้ ChatGPT ทำให้การเลือกใช้คำง่ายลงราวกับเขียนโดยผู้ที่ไม่ใช่เจ้าของภาษา อัตราบวกลวงเฉลี่ยบนเรียงความที่เขียนโดยเจ้าของภาษาเหล่านั้นเพิ่มจาก 5.19 เปอร์เซ็นต์เป็น 56.65 เปอร์เซ็นต์ เรียงความไม่ได้เปลี่ยนผู้ประพันธ์ มีเพียงคำศัพท์ที่เปลี่ยนไป และตัวตรวจจับก็ทำตามคำศัพท์นั้น
Perplexity เปลี่ยนไปในทิศทางเดียวกับอัตราการจำแนกผิดทั้งสองด้าน, โดยเพิ่มขึ้นอย่างรวดเร็วเมื่อเรียงความ TOEFL ถูกทำให้มีคำศัพท์ซับซ้อนขึ้น และลดลงอย่างรวดเร็วเมื่อเรียงความระดับชั้นประถมศึกษาปีที่ 8 ถูกทำให้ง่ายลง ผู้เขียนสรุปอย่างตรงไปตรงมาจากเรื่องนี้ว่า, สิ่งที่ตัวตรวจจับกำลังตอบสนองจริง ๆ ไม่เคยเป็นผู้ประพันธ์เลย แต่เป็นการเลือกใช้คำ, ซึ่งเป็นคุณลักษณะที่คำศัพท์ของผู้เขียนคนใดก็สามารถมีได้ ไม่ว่าพวกเขาจะเรียนภาษาอังกฤษที่ใดก็ตาม
อคติมีความสม่ำเสมอเพียงใดในตัวตรวจจับที่แตกต่างกัน
ตัวตรวจจับทั้งเจ็ดชุดเห็นพ้องกันไม่มากนัก ยกเว้นทิศทางที่ความผิดพลาดเกิดขึ้น ทุกตัวระบุเรียงความ TOEFL บ่อยกว่าเรียงความระดับชั้นประถมศึกษาปีที่ 8 อย่างมาก แต่ด้วยระยะห่างที่แตกต่างกันมาก
| เครื่องตรวจจับ | อัตราบวกลวง, บทความ TOEFL | อัตราบวกลวง, บทความของเจ้าของภาษา |
|---|---|---|
| Originality.ai | 76% | 1% |
| Quil.org | 75% | 9% |
| Sapling | 68% | 5% |
| OpenAI's detector | 58% | 9% |
| Crossplag | 52% | 12% |
| GPTZero | 52% | 0% |
| ZeroGPT | 48% | 0% |
ตัวเลขเหล่านี้เป็นข้อมูลปี 2023 ซึ่งวัดจากเครื่องมือในสภาพที่เป็นอยู่ในขณะนั้น หลายเครื่องได้เปลี่ยนแปลงไปอย่างสิ้นเชิงตั้งแต่นั้นมา, OpenAI ยุติเครื่องตรวจจับของตนเองในเดือนกรกฎาคม 2023, สี่เดือนหลังการทดสอบนี้, หลังจากพบว่ามันระบุข้อความที่เขียนโดย AI จริงได้ถูกต้องเพียง 26 เปอร์เซ็นต์ ขณะเดียวกันยังติดป้ายข้อความที่มนุษย์เขียนผิดพลาด 9 เปอร์เซ็นต์ สิ่งที่ไม่เปลี่ยนแปลงคือทิศทางของช่องว่าง ชุดเกณฑ์มาตรฐานอคติที่กว้างกว่า ซึ่งสร้างขึ้นโดยเฉพาะเพื่อทดสอบเครื่องตรวจจับในหมวดหมู่ด้านประชากรและภาษา, เผยแพร่ในเดือนธันวาคม 2025 และนำไปใช้กับเครื่องมือโอเพนซอร์สรุ่นใหม่ 4 เครื่อง, ยังคงรายงานค่า recall ที่ต่ำกว่าอย่างสม่ำเสมอสำหรับกลุ่มนักเขียนที่มีตัวแทนน้อยกว่า
ทำให้บทความของคุณเป็นธรรมชาติมากขึ้น
ปรับข้อความที่ช่วยโดย AI ของคุณให้ฟังดูเป็นธรรมชาติ, โดยไม่แตะต้องคำสำคัญหรือการอ้างอิง
อคตินี้ยังปรากฏในเครื่องตรวจจับรุ่นใหม่อยู่หรือไม่?
การศึกษาของ Stanford ในตอนนี้มีอายุห่างจากยุคของ AI หลายรุ่นแล้ว และผู้เขียนเองก็ระบุข้อจำกัดนี้ไว้, คือกลุ่มตัวอย่างนำร่องมีขนาดเล็ก และเครื่องตรวจจับส่วนใหญ่สร้างบน GPT-2 ซึ่งเป็นโมเดลที่เล็กกว่าและเก่ากว่ามากเมื่อเทียบกับสิ่งที่ขับเคลื่อนการตรวจจับในปัจจุบัน นั่นทำให้เกิดคำถามที่สมเหตุสมผลว่า เทคโนโลยีที่ดีกว่าช่วยลดช่องว่างนี้ได้หรือไม่?
การทดสอบเฉพาะทางล่าสุดระบุว่ายังไม่ใช่ ในการศึกษาช่วงเดือนกุมภาพันธ์ 2026 จาก Sultan Qaboos University นักวิจัยได้ทดสอบเครื่องมือตรวจจับเชิงพาณิชย์ที่ใช้อยู่ในปัจจุบันสองตัว คือ Turnitin และ Originality กับข้อความ 192 ชิ้นที่ผสมระหว่างงานเขียนของนักศึกษา EFL ก่อนยุค ChatGPT ที่เป็นของแท้ งานเขียนของมนุษย์ระดับมืออาชีพ ข้อความที่สร้างโดย AI และข้อความแบบผสมระหว่างมนุษย์กับ AI ผลการศึกษาพบความแม่นยำโดยรวมที่ 69 เปอร์เซ็นต์ และ 61 เปอร์เซ็นต์สำหรับเครื่องมือทั้งสอง โดยความแม่นยำในหมวดแบบผสม ซึ่งเป็นลักษณะของงานเขียนที่เกิดขึ้นจริงหลังผ่านการแก้ไข ลดลงใกล้ศูนย์ การศึกษาเดียวกันยังเผยให้เห็นอคติอีกชนิดหนึ่งที่เกิดควบคู่กับอคติด้านภาษา คือ ความแม่นยำในงานเขียนเชิงวิทยาศาสตร์ต่ำกว่างานเขียนด้านมนุษยศาสตร์ 28 ถึง 38 จุดเปอร์เซ็นต์
ข้อค้นพบทั้งสองไม่ได้ชี้ไปที่ผลิตภัณฑ์ที่มีข้อบกพร่องเพียงตัวเดียว สถาปัตยกรรมของเครื่องมือตรวจจับสองแบบที่แตกต่างกัน ซึ่งทดสอบห่างกันสามปี บนคลังข้อมูลคนละชุด โดยทีมวิจัยคนละกลุ่ม ยังคงให้ผลลัพธ์เดียวกัน คือ งานเขียนที่ถูกกำหนดรูปแบบโดยขนบของประเภทงาน หรือโดยภาษาที่สอง มีแนวโน้มเข้าใกล้สิ่งที่เครื่องมือเหล่านี้เรียกว่าเป็นงานที่สร้างโดยเครื่อง มากกว่างานเขียนที่ไม่เป็นเช่นนั้น TextPulse's free tools ช่วยให้นักเขียนตรวจสอบโปรไฟล์ทางสถิติแบบเดียวกันนี้ได้ก่อนที่งานใด ๆ จะไปถึงเครื่องมือตรวจจับของสถาบัน
หลักฐานอิสระที่แสดงว่าช่องว่างนี้เป็นเรื่องจริง ไม่ใช่สิ่งที่เกิดจากวิธีทดสอบ
ปัญหาแรกของผลลัพธ์ TOEFL คืออาจโต้แย้งได้ว่ามันใช้ได้เฉพาะกับการศึกษานำร่องเล็ก ๆ ในปี 2023 เท่านั้น ข้อโต้แย้งนี้ถูกตอบโดยทีมวิจัยเดียวกันในการศึกษาอีกชิ้นหนึ่งที่ใช้ข้อมูลซึ่งไม่เกี่ยวข้องกับเครื่องมือตรวจจับเลย พวกเขาตรวจสอบบทความ 1,574 ชิ้นที่ได้รับการยอมรับให้ตีพิมพ์ใน ICLR 2023 ซึ่งเป็นการประชุมด้าน machine learning ขนาดใหญ่ โดยจำกัดตัวอย่างไว้ที่บทคัดย่อที่ส่งและผ่านการประเมินก่อนที่ ChatGPT จะมีอยู่
ผู้เขียนที่อยู่ในประเทศซึ่งภาษาอังกฤษไม่ใช่ภาษาหลักได้เขียนบทคัดย่อที่มี perplexity ต่ำกว่าอย่างมีนัยสำคัญเมื่อเทียบกับผู้เขียนที่อยู่ในประเทศที่ใช้ภาษาอังกฤษเป็นภาษาแม่ และความแตกต่างนี้ยังคงอยู่แม้จะควบคุมว่าบทความแต่ละชิ้นได้รับการประเมินจากผู้ประเมินในระดับใดก็ตาม ตัวอย่างนี้ไม่อาจถูกกำหนดรูปแบบโดยใครก็ตามที่พยายามทำให้ฟังดูเหมือนหรือไม่เหมือนแชตบอตมากขึ้น ChatGPT เหลือเวลาอีกสามเดือนก่อนการเผยแพร่เมื่อช่วงเวลารับส่งบทความปิดลง ช่องว่างของ perplexity ระหว่างงานเขียนทางวิชาการของเจ้าของภาษาและผู้ที่ไม่ใช่เจ้าของภาษาไม่ใช่สิ่งที่ตัวตรวจจับสร้างขึ้น แต่เป็นสิ่งที่พวกมันสืบทอดมา
การวิเคราะห์เชิงสถิติในปี 2026 ว่าด้วยการตรวจจับ AI ในฐานะปัญหาการทดสอบ เสนอข้อสรุปเดียวกันในรูปแบบที่เป็นทางการมากขึ้น เมื่อใดก็ตามที่กลุ่มผู้เขียนกลุ่มหนึ่งผลิตภาษาที่โดยรวมแล้วทับซ้อนกับผลลัพธ์ทั่วไปของ AI ตัวตรวจจับใดก็ตามที่มีพลังจริงในการจับข้อความที่เขียนโดย AI จะต้องมีอัตราบวกเท็จที่สูงกว่าสำหรับกลุ่มนั้นโดยเฉพาะ ซึ่งเป็นคุณสมบัติทางคณิตศาสตร์ของการทดสอบประชากรที่หลากหลาย มากกว่าจะเป็นข้อบกพร่องของเครื่องมือใดเครื่องมือหนึ่ง ผู้เขียนภาษาอังกฤษที่ไม่ใช่เจ้าของภาษาเป็นกรณีที่ชัดเจนที่สุดที่มีการบันทึกไว้ของการทับซ้อนเช่นนั้น
สิ่งนี้หมายความว่าอย่างไรสำหรับผู้เขียนที่ใช้ภาษาที่สอง
ทั้งหมดนี้ไม่ใช่ข้อโต้แย้งให้เขียนให้ไม่เหมือนตัวเองมากขึ้น แต่เป็นเหตุผลให้รู้ว่าสิ่งที่กำลังถูกวัดจริง ๆ คืออะไร ก่อนที่คะแนนจะปรากฏขึ้น หากตัวตรวจจับอ่านร้อยแก้วของคุณว่าเป็นสิ่งที่คาดเดาได้ นั่นคือการจับคุณสมบัติทางสถิติที่แท้จริงของการเขียนด้วยภาษาที่สอง ไม่ใช่หลักฐานว่าคุณใช้เครื่องมือที่คุณไม่ได้ใช้
นักวิจัยจาก Stanford ที่ทำการศึกษาต้นฉบับระบุถึงนัยที่ไม่สบายใจจากข้อค้นพบของตนเอง, การปรับคำศัพท์แบบเดียวกันที่ช่วยลดความเสี่ยงของผลบวกเท็จ ก็เป็นชนิดของการแก้ไขที่ผู้เขียนอาจต้องการด้วยเหตุผลอื่นโดยสิ้นเชิง, ถ้อยคำที่ชัดเจนขึ้น, คำที่แม่นยำกว่า, โดยไม่ขึ้นกับตัวตรวจจับใด ๆ หน้า สำหรับผู้เขียนวิชาการ ESL ของ TextPulse อธิบายว่าการแก้ไขลักษณะนั้นมีหน้าตาอย่างไรในประโยคจริง แยกออกจากทุกสิ่งที่เกี่ยวข้องกับคะแนนการตรวจจับ
เครื่องตรวจจับรุ่นใหม่เริ่มคำนึงถึงรูปแบบนี้อย่างชัดเจนแล้ว Pangram ซึ่งเป็นหนึ่งในผู้เข้ามาในตลาดเชิงพาณิชย์ที่ค่อนข้างใหม่ ระบุไว้ในเอกสารทางเทคนิคของตนเองว่า ตัวจำแนกของตนไม่ได้มีอคติต่อผู้เขียนภาษาอังกฤษที่ไม่ใช่เจ้าของภาษา แม้ข้ออ้างนั้นจะมาจากผู้ขายเอง ไม่ใช่จากการทดสอบอิสระก็ตาม free perplexity checker แสดงการวัดพื้นฐานเดียวกันที่เครื่องมือเหล่านี้คำนวณจากชิ้นงานเขียน โดยไม่ต้องส่งร่างไปที่ใดก่อน
เครื่องมือประกอบที่ใช้ได้จริงสองอย่างอยู่ในกลุ่มเดียวกัน คือ when to use a, an and the ซึ่งเป็นแหล่งที่มาของรูปแบบนี้ที่พบบ่อยที่สุด และ how to sound natural in English academic writing ในความหมายที่กว้างกว่า
งานวิจัยยังคงสะสมไปในทิศทางเดียวกันต่อเนื่องมา 2 ปี ครอบคลุมทีมวิจัยที่ต่างกัน เครื่องตรวจจับที่ต่างกัน และการออกแบบการทดสอบที่ต่างกัน สิ่งที่ยังไม่ก้าวทันคือการตอบสนองของสถาบันที่ได้รับการยอมรับอย่างกว้างขวาง, การตรวจสอบเครื่องตรวจจับกับผู้เขียนหลายกลุ่มก่อนจะเชื่อถือมันกับผู้เขียนคนใดคนหนึ่ง แทนที่จะทำหลังจากนักศึกษาคนใดคนหนึ่งถูกกล่าวหาไปแล้ว ตราบใดที่สิ่งนั้นยังไม่กลายเป็นเรื่องปกติ ภาระในการพิสูจน์ว่าการแจ้งเตือนผิดนั้นตกอยู่กับผู้เขียนกลุ่มเดียวกับที่งานวิจัยนี้ระบุว่ามีแนวโน้มจะได้รับการแจ้งเตือนดังกล่าวมากที่สุด
คำถามที่พบบ่อย
เครื่องตรวจจับ AI มีอคติต่อผู้พูดที่ไม่ใช่เจ้าของภาษาเป็นข้อค้นพบที่ผ่านการทบทวนโดยผู้ทรงคุณวุฒิ ไม่ใช่การคาดเดา การศึกษา Stanford ปี 2023 พบว่า GPT detectors ที่ใช้กันอย่างแพร่หลาย 7 ตัวระบุผิดเรียงความ TOEFL จริงเฉลี่ย 61.22 เปอร์เซ็นต์ว่าเป็นข้อความที่สร้างโดย AI ขณะที่ระบุเรียงความของเจ้าของภาษาได้ถูกต้องเกือบทุกครั้ง
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.