ChatGPT สร้างรายการอ้างอิงขึ้นมาเองหรือไม่? สิ่งที่การศึกษาว่าด้วยการสร้างขึ้นพบ
การศึกษา 6 ชิ้น, 4 สาขา, 3 ปี อัตราที่ ChatGPT สร้างรายการอ้างอิงขึ้นมาอยู่ตั้งแต่ระดับเลขหลักเดียวไปจนถึงมากกว่าครึ่ง และตัวเลขนี้ไม่มีความหมายหากไม่ระบุเวอร์ชันของโมเดลและวันที่กำกับไว้ด้วย
ในเดือนมิถุนายน 2025 นักวิจัยที่ Deakin University ขอให้ GPT-4o เขียนบทปริทัศน์วรรณกรรม 6 ฉบับเกี่ยวกับหัวข้อสุขภาพจิต จากการอ้างอิง 176 รายการที่มันสร้างขึ้น 35 รายการไม่มีอยู่จริงเลย อีก 64 รายการชี้ไปยังบทความจริงแต่แนบรายละเอียดผิดมาให้ หนึ่งในห้าของเอกสารอ้างอิงถูกแต่งขึ้นทั้งหมด จากแบบจำลองที่เผยแพร่ช้ากว่าที่ปัญหาเรื่องการอ้างอิงของ ChatGPT จะถูกวัดและรายงานในสิ่งพิมพ์ครั้งแรกมากกว่าหนึ่งปี
ChatGPT แต่งเอกสารอ้างอิงขึ้นมาหรือไม่ ใช่ และมันยังคงทำเช่นนั้นในปี 2026 บนแบบจำลองปัจจุบัน ไม่ใช่เฉพาะบนเวอร์ชันที่เป็นข่าวในปี 2023 คำถามที่เปิดอยู่ไม่เคยเป็นว่าปรากฏการณ์นี้เกิดขึ้นหรือไม่ แต่เป็นว่ามันเกิดขึ้นบ่อยเพียงใด และตัวเลขนั้นเปลี่ยนไปตามแบบจำลอง เวอร์ชัน สาขาวิชา และวันที่ทำการทดสอบ
ChatGPT แต่งเอกสารอ้างอิงขึ้นมาหรือไม่
ใช่ แบบจำลองภาษาคาดการณ์คำถัดไปที่มีความเป็นไปได้มากที่สุดจากทุกสิ่งที่มาก่อนหน้า มันไม่ได้ค้นหาอะไรเลย เว้นแต่คุณจะเพิ่มขั้นตอนการดึงข้อมูลหรือการค้นหาเข้าไปในผลิตภัณฑ์ของคุณ หากปล่อยให้มันคาดการณ์ว่าการอ้างอิงควรมีลักษณะอย่างไร มันจะสร้างสิ่งที่ดูเหมือนถูกต้องขึ้นมา, ชื่อผู้แต่ง, ปี, ชื่อวารสาร, เลขเล่ม, DOI โดยไม่ตรวจสอบว่าสิ่งเหล่านั้นสอดคล้องกับสิ่งพิมพ์จริงหรือไม่ บางส่วนจะถูกต้องโดยบังเอิญหรือจากการจดจำแบบท่องจำ บางส่วนจะถูกแต่งขึ้นใหม่ทั้งหมดและดูเหมือนกันทุกประการ
เหตุใดอัตราการแต่งขึ้นจึงต้องระบุเวอร์ชันของแบบจำลองและวันที่
เพราะอัตรานี้ไม่ใช่ตัวเลขเดียว ในการศึกษาที่ถูกอ้างถึงมากที่สุดเกี่ยวกับเรื่องนี้ ChatGPT-3.5 แต่งขึ้น 55 เปอร์เซ็นต์ของการอ้างอิงในชุดบทปริทัศน์วรรณกรรมสั้น ๆ และ ChatGPT-4 ซึ่งทดสอบโดยนักวิจัยกลุ่มเดียวกันในหัวข้อเดียวกัน 42 หัวข้อ แต่งขึ้น 18 เปอร์เซ็นต์ การศึกษาเดียวกัน คำสั่งเดียวกัน วันทดสอบเดียวกัน สิ่งเดียวที่เปลี่ยนไปคือแบบจำลอง และอัตราลดลงสองในสาม
วันที่มีความสำคัญพอ ๆ กับชื่อรุ่นของโมเดล GPT-4 ในการศึกษานั้นหมายถึงสิ่งที่ OpenAI กำลังให้บริการอยู่ในช่วงกลางปี 2023 การศึกษาในปี 2026 ที่ตรวจสอบโมเดลปัจจุบันและตัวแทนวิจัย 10 รายการ โดยตรวจสอบลิงก์การอ้างอิงรวมมากกว่า 220,000 รายการ พบอัตราการสร้างข้อมูลเท็จตั้งแต่ 3 เปอร์เซ็นต์ถึง 13 เปอร์เซ็นต์ โดยค่าที่แน่นอนขึ้นอยู่กับโมเดลเฉพาะและขึ้นอยู่กับว่าผลิตภัณฑ์ใช้การยึดโยงกับการค้นหาหรือโหมดวิจัยเชิงลึกหรือไม่ ตัวเลขทั้งสองไม่ผิด ทั้งสองอธิบายสิ่งที่ต่างกันซึ่งวัดห่างกันเกือบสามปี
สาขาวิชาก็มีความสำคัญเช่นกัน โดยไม่ขึ้นกับโมเดล เราเคยมีงานวิจัยด้านเศรษฐศาสตร์ที่ใช้คู่ GPT-3.5 และ GPT-4 เดียวกัน พบว่ามากกว่า 30 เปอร์เซ็นต์ของการอ้างอิงของ GPT-3.5 ถูกแต่งขึ้น และอัตรายังสูงกว่า 20 เปอร์เซ็นต์สำหรับ GPT-4 ซึ่งใกล้เคียงกับที่การศึกษาสหสาขาวิชาพบ ขณะที่การศึกษาทบทวนอย่างเป็นระบบทางการแพทย์ ซึ่งทดสอบสิ่งที่ระบุว่าเป็นบิลด์ของ GPT-4 เดือนมีนาคม 2023 โดยเฉพาะ วัดได้ 28.6 เปอร์เซ็นต์ในงานที่แตกต่างกันโดยสิ้นเชิง, คือการดึงรายการอ้างอิงสำหรับการทบทวนอย่างเป็นระบบที่มีอยู่แล้ว แทนที่จะเขียนสรุปวรรณกรรมใหม่ตั้งแต่ต้น
สิ่งที่การศึกษาที่ตีพิมพ์พบ
การศึกษา 6 รายการ ซึ่งดำเนินการระหว่างปี 2023 ถึง 2026 ครอบคลุมการแพทย์ กฎหมาย เศรษฐศาสตร์ และการเขียนวิชาการทั่วไป มาบรรจบกันที่ข้อค้นพบเดียวกันซึ่งกล่าวไว้ 6 แบบที่ต่างกัน, คือให้ตรวจสอบรายการอ้างอิงทุกชิ้นที่เครื่องมือ AI ให้มา โดยไม่คำนึงว่าโมเดลใดเป็นผู้สร้างหรือเป็นช่วงเวลาใด
| การศึกษาและสาขา | โมเดลและเวอร์ชัน | วันที่ทดสอบ | ตัวอย่าง | อัตราการสร้างข้อมูลขึ้นมาเอง |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (สหสาขาวิชา) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (เศรษฐศาสตร์) | GPT-3.5 and GPT-4 | 2023 | Prompts from Journal of Economic Literature topics | Over 30% (3.5), over 20% (4) |
| Chelli et al, JMIR (medical systematic reviews) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 references, 11 reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law) | ChatGPT-4 and Llama 2 | 2024 | Random federal court case questions | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (mental health reviews) | GPT-4o | Tested June 2025 | 176 citations, 6 reviews | 19.9% fully fabricated, 56% fabricated or flawed |
| Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Over 220,000 citation URLs | 3% to 13% depending on model |
การศึกษาทางกฎหมายเพิ่มรายละเอียดที่ร้อยละดิบไม่สามารถสะท้อนได้, งานวิจัยเดียวกันพบว่าโมเดลมีปัญหาในการคาดการณ์ภาพหลอนของตนเอง และมักยอมรับข้อสมมติที่ไม่ถูกต้องของผู้ใช้เกี่ยวกับคดี แทนที่จะปรับแก้ให้ถูกต้อง การอ้างอิงที่ถูกสร้างขึ้นมาเองเป็นหนึ่งในรูปแบบความล้มเหลว หากโมเดลยังไม่สามารถระบุความไม่แน่นอนของตนเองได้ด้วย นั่นเป็นปัญหาที่ยากกว่า และปรากฏชัดที่สุดในสาขาที่การอ้างอิงที่ผิดพลาดมีต้นทุนสูงที่สุด
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
ChatGPT ดีขึ้นแล้วหรือยังตั้งแต่ปี 2023?
ค่อนข้างเป็นเช่นนั้น และไม่สม่ำเสมอ จุดเปลี่ยนก่อนและหลังที่ชัดเจนที่สุดเพียงจุดเดียวอยู่ในงานศึกษาของ Walters และ Wilder เอง, จาก GPT-3.5 ไป GPT-4, ในวันเดียวกัน, อัตราการสร้างข้อมูลเท็จลดจาก 55 เปอร์เซ็นต์เหลือ 18 เปอร์เซ็นต์. เมื่อก้าวไปถึง GPT-4o ในกลางปี 2025 และอัตราที่ทีมของ Linardon วัดได้คือ 19.9 เปอร์เซ็นต์, บนงานที่ยากกว่าและแคบกว่า, คือการทบทวนวรรณกรรม 6 ฉบับในสาขาวิจัยเดียว แทนที่จะเป็นบทสรุปสั้น ๆ ที่กระจายอยู่ใน 42 หัวข้อที่ไม่เกี่ยวข้องกัน. เมื่อก้าวต่อไปอีกครั้งไปยังโมเดลที่เปิดใช้ฟีเจอร์การค้นหาหรือ deep-research, ซึ่งทดสอบในต้นปี 2026, ช่วงค่าลดลงเหลือเลขหลักเดียวสำหรับส่วนใหญ่, 3 ถึง 9 เปอร์เซ็นต์, แม้ว่าโหมด deep-research หนึ่งโหมดจะยังแตะ 13.3 เปอร์เซ็นต์.
ทั้งหมดนี้ไม่ได้เป็นเส้นตรงลงมา. ตัวเลขของ Linardon อยู่ระหว่างค่าของ GPT-4 ในปี 2023 และค่าของ GPT-3.5 ในปี 2023, ทั้งที่เป็นโมเดลซึ่งเผยแพร่มากกว่าหนึ่งปีหลังจากทั้งสองตัว, เพราะมันถูกทดสอบบนงานที่ยากกว่า, คือการสร้างการทบทวนวรรณกรรมจริงในสาขาที่แหล่งข้อมูลจำนวนมากค้นหาได้ยากอยู่แล้ว. อัตราการสร้างข้อมูลเท็จอธิบายโมเดลหนึ่งตัวบนงานหนึ่งงานในวันหนึ่งวันใด. เปลี่ยนองค์ประกอบใดองค์ประกอบหนึ่งในสามอย่างนี้ ตัวเลขก็จะเปลี่ยนไป, บางครั้งเปลี่ยนไปมาก.
ตระกูลของโมเดลไม่ใช่ตัวแปรเดียวที่ยังทำให้ตัวเลขเปลี่ยนได้ในปัจจุบัน. งานศึกษาในปี 2025 ที่ประเมินแชตบอตฟรี 8 ตัว, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat และ Perplexity, บนเอกสารอ้างอิง 400 รายการใน 5 สาขาวิชาการ พบว่า มีเพียง 26.5 เปอร์เซ็นต์ของเอกสารอ้างอิงทั้งหมดที่สร้างขึ้นซึ่งถูกต้องสมบูรณ์. Grok และ DeepSeek ไม่สร้างเอกสารอ้างอิงที่เป็นข้อมูลเท็จเลยในการทดสอบนั้น. Claude, Copilot และ Perplexity อยู่ในกลุ่มที่มีผลการดำเนินงานแย่ที่สุด. ผลิตภัณฑ์ 2 รายการที่สร้างบนเทคโนโลยีพื้นฐานที่ใกล้เคียงกัน, ทดสอบในเดือนเดียวกัน, ด้วยพรอมป์ต์เดียวกัน, กลับไปอยู่คนละปลายของช่วงค่า, ซึ่งเป็นบทเรียนเดียวกับตารางโมเดลและวันที่ข้างต้น, เพียงแต่ประยุกต์กับผลิตภัณฑ์แทนที่จะเป็นเวอร์ชัน.
เหตุใดการอ้างอิงที่สร้างขึ้นจึงดูเหมือนจริง
การอ้างอิงที่ถูกสร้างขึ้นไม่ใช่เพียงตัวแทนชั่วคราวที่เห็นได้ชัด Walters และ Wilder พบว่ารายการที่พวกเขาประดิษฐ์ขึ้นมีชื่อผู้แต่งจริง, เป็นผู้ที่ตีพิมพ์ในสาขานั้นจริง, ผูกอยู่กับชื่อวารสารที่มีอยู่จริง, และจัดรูปแบบได้ดีพอที่จะผ่านการตรวจด้วยสายตาอย่างรวดเร็ว ทีมของ Linardon พบสิ่งที่ชัดเจนยิ่งกว่า, จากการอ้างอิงที่ถูกสร้างขึ้น 35 รายการที่ GPT-4o สร้างขึ้น, 33 รายการมี DOI แนบมาด้วย, และ 64 เปอร์เซ็นต์ของ DOI เหล่านั้นนำไปสู่บทความที่ตีพิมพ์จริงในหัวข้อที่ไม่เกี่ยวข้องกันโดยสิ้นเชิง, ไม่ใช่ลิงก์เสียและไม่ใช่หน้าข้อผิดพลาด, กล่าวคือ งานวิจัยจริงของผู้อื่นถูกนำมาแทนที่แหล่งอ้างอิงที่ไม่มีอยู่จริง
วิธีตรวจสอบว่า Citation ของ ChatGPT เป็นของจริงหรือไม่
ค้นหาชื่อเรื่องที่ตรงตัวใน Google Scholar หรือในเว็บไซต์ของวารสารเอง แทนที่จะเชื่อ DOI เพียงอย่างเดียว, เพราะ DOI ที่ใช้งานได้อาจชี้ไปยังบทความที่ผิดทั้งหมดได้ ตรวจสอบให้แน่ใจว่ารายชื่อผู้แต่ง, ปี และวารสารตรงกับสิ่งที่ปรากฏขึ้นจริง, ไม่ใช่เพียงว่ามีบางอย่างปรากฏขึ้นมาเท่านั้น ให้ทำเช่นนี้กับทุกเอกสารอ้างอิงที่ chatbot ให้มา, ไม่ใช่เฉพาะรายการที่ดูไม่คุ้นเคย, เพราะรายการที่ถูกสร้างขึ้นในงานศึกษาเหล่านี้ถูกออกแบบมาโดยเฉพาะให้ดูธรรมดา
ให้ถือว่าหัวข้อที่ไม่คุ้นเคยหรือมีขอบเขตแคบมีความเสี่ยงสูงกว่าหัวข้อกระแสหลัก ทีมของ Linardon พบอัตราการสร้างขึ้นเทียมใกล้ 6 เปอร์เซ็นต์สำหรับภาวะที่มีการศึกษามาก, major depressive disorder, และใกล้ 30 เปอร์เซ็นต์สำหรับอีกสองภาวะที่มีการศึกษาน้อยกว่าในชุดบททบทวนเดียวกัน รูปแบบนี้ยังคงพบได้นอกสาขาสุขภาพจิตเช่นกัน, โมเดลมีข้อความจริงให้ดึงรูปแบบจากมากกว่าในสาขาที่มีข้อมูลหนาแน่น, และมีพื้นที่ให้ประดิษฐ์อย่างน่าเชื่อถือได้มากกว่าในสาขาที่ข้อมูลบาง
ตัวตรวจสอบ citation ด้วย AI ที่ตรวจสอบแต่ละรายการเทียบกับฐานข้อมูลวิชาการจริง ทำให้การค้นหานั้นเป็นแบบอัตโนมัติ แทนที่จะปล่อยให้เป็นการค้นหาด้วยตนเองสำหรับเอกสารอ้างอิงแต่ละรายการ, ซึ่งเป็นส่วนที่คนส่วนใหญ่มักข้ามไปเมื่อถูกกดดันด้วยกำหนดเวลา, และนั่นคือเงื่อนไขที่ทำให้การอ้างอิงที่ถูกสร้างขึ้นมีแนวโน้มสูงสุดที่จะหลุดรอดไปถึงฉบับร่างสุดท้าย
การพบมันในบรรณานุกรมฉบับสมบูรณ์ เป็นกระบวนการเฉพาะของมันเองและมีหน้าเฉพาะของมันเอง สำหรับ citation ที่เป็นของจริง, การอ้าง ChatGPT ใน APA ได้อธิบายไว้เป็นขั้นตอน
ไม่มีสิ่งใดในนี้เปลี่ยนวิธีที่คุณจัดรูปแบบการอ้างอิงเมื่อคุณยืนยันแล้วว่าเป็นข้อมูลจริงแล้ว นั่นเป็นคำถามอีกเรื่องหนึ่ง: How to cite ChatGPT ครอบคลุม APA, MLA, Chicago และ IEEE สำหรับการโต้ตอบนั้นเอง และ เครื่องมือสร้างการอ้างอิงจัดการข้อมูลอ้างอิงทั่วไป ในลักษณะเดียวกัน ไม่ว่าคุณจะเขียนตามรูปแบบใด สิ่งที่รูปแบบการอ้างอิงใดก็แก้ไม่ได้ คือการอ้างถึงสิ่งที่ไม่เคยได้รับการตีพิมพ์ การตรวจสอบนั้นเกิดขึ้นก่อนการจัดรูปแบบ กับข้อมูลอ้างอิงทุกชิ้น โดยไม่ขึ้นกับว่าโมเดลใดเขียนร่างของคุณ หรือฉลากของมันอ้างว่าเป็นเวอร์ชันใด
Frequently Asked Questions
ChatGPT สร้างรายการอ้างอิงขึ้นมาเองหรือไม่? ใช่, ในทุกโมเดลที่ได้มีการทดสอบจนถึงตอนนี้, ในทุกการศึกษาที่ตีพิมพ์ตั้งแต่ปี 2023 ถึง 2026 อัตราดังกล่าวแตกต่างกันอย่างมากตามเวอร์ชันของโมเดล, ตามสาขา และตามวันที่, ตั้งแต่ประมาณ 3 เปอร์เซ็นต์ในโมเดลที่มีการอ้างอิงแหล่งข้อมูลล่าสุด ไปจนถึงมากกว่าครึ่งใน GPT-3.5 เมื่อปี 2023 ดังนั้นตัวเลขเพียงตัวเดียวจึงไม่ใช่คำตอบทั้งหมด
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.