ChatGPT가 참고문헌을 만들어 내는가? 조작 연구가 밝힌 내용
6개의 연구, 4개 분야, 3년. ChatGPT가 참고문헌을 만들어 내는 비율은 한 자릿수에서 절반을 훌쩍 넘는 수준까지 이르며, 모델 버전과 날짜가 없으면 그 수치는 아무 의미도 없다.
2025년 6월, Deakin University의 연구자들은 GPT-4o에게 정신 건강 주제에 관한 문헌 검토 6편을 작성하도록 요청했다. 이 모델이 생성한 176개의 인용문 중 35개는 아예 존재하지 않았다. 또 다른 64개는 실제 논문을 가리키고 있었지만, 잘못된 세부 정보가 붙어 있었다. 즉, 5개 중 1개의 참고문헌이 완전히 날조된 것이었으며, 이는 ChatGPT의 인용 문제를 인쇄물에서 처음 측정한 시점보다 1년 이상 뒤에 공개된 모델에서 나타난 결과였다.
ChatGPT는 참고문헌을 만들어내는가? 그렇다. 그리고 그것은 2026년에도 여전히 그렇다. 이는 2023년에 헤드라인을 장식한 버전에서만 나타나는 현상이 아니라, 현재의 모델에서도 마찬가지다. 핵심 질문은 이 현상이 일어나는지 여부가 아니었다. 얼마나 자주 일어나는지이며, 그 수치는 모델, 버전, 분야, 그리고 시험이 수행된 날짜에 따라 달라진다.
ChatGPT는 참고문헌을 만들어내는가?
그렇다. 언어 모델은 그 앞에 주어진 모든 정보를 바탕으로 다음에 올 그럴듯한 단어를 예측한다. 제품에 검색 또는 검색 단계가 추가되지 않는 한, 어떤 것도 찾아보지 않는다. 참고문헌이 어떤 모습인지 예측하도록 두면, 저자명, 연도, 학술지 제목, 권호, DOI까지 갖춘, 겉보기에 올바른 참고문헌을 만들어낸다. 그러나 이들 정보가 실제 출판물과 일치하는지는 검증하지 않는다. 그중 일부는 우연히 정확하거나 기계적인 암기 때문에 맞을 수 있다. 그러나 일부는 완전히 새로 만들어졌음에도 정확한 것과 똑같이 보인다.
날조 비율에 모델 버전과 날짜가 필요한 이유
그 비율은 하나의 숫자가 아니기 때문이다. 이 주제에서 가장 자주 인용되는 단일 연구에서, ChatGPT-3.5는 짧은 문헌 검토 집합에 포함된 인용문의 55%를 날조했고, 같은 연구자들이 같은 42개 주제를 대상으로 시험한 ChatGPT-4는 18%를 날조했다. 연구도 같고, 프롬프트도 같고, 시험한 날도 같았다. 달라진 것은 모델뿐이었고, 그 비율은 3분의 2로 감소했다.
날짜는 모델 이름만큼이나 중요하다. 그 연구에서 GPT-4는 2023년 중반에 OpenAI가 제공하던 것이 무엇이든 그것을 뜻했다. 2026년에 현재의 10개 모델과 연구 에이전트를 대상으로 수행한 한 연구는, 총 220,000개가 넘는 인용 링크를 점검한 결과, 조작률이 3%에서 13%까지였다고 밝혔으며, 정확한 수치는 특정 모델과 제품이 검색 기반 정렬을 사용했는지, 아니면 심층 연구 모드를 사용했는지에 따라 달라졌다. 어느 수치도 틀리지 않다. 그것들은 거의 3년의 간격을 두고 측정된 서로 다른 것을 설명한다.
분야 역시 모델과 무관하게 중요하다. 또한 경제학 연구에서 같은 GPT-3.5와 GPT-4 조합을 적용한 결과, GPT-3.5 인용문의 30%가 넘는 비율이 만들어졌고 GPT-4에서도 그 비율은 여전히 20%를 넘었는데, 이는 다학제 연구에서 발견된 수치와 가깝다. 반면 의학 체계적 문헌고찰 연구는, 특히 March 2023 빌드의 GPT-4로 표시된 것을 시험했으며, 완전히 다른 과제에서 28.6%를 측정했다. 그 과제는 새로운 문헌 요약을 처음부터 작성하는 것이 아니라 기존 체계적 문헌고찰을 위한 참고문헌을 찾아내는 것이었다.
출판된 연구들이 발견한 것
2023년부터 2026년 사이에 의학, 법학, 경제학, 일반 학술 글쓰기에 걸쳐 수행된 6개의 연구는, 서로 다른 6가지 방식으로 진술된 동일한 결론에 수렴한다. 어떤 모델이 그것을 생성했는지, 또는 언제 생성되었는지와 무관하게, AI 도구가 제공하는 모든 참고문헌을 점검하라는 것이다.
| 연구 및 분야 | 모델 및 버전 | 시험 날짜 | 표본 | 허위 생성률 |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (다학제) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | 55% (3.5) 대 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (경제학) | GPT-3.5 and GPT-4 | 2023 | Journal of Economic Literature 주제에서 나온 프롬프트 | 30% 초과 (3.5), 20% 초과 (4) |
| Chelli et al, JMIR (의학 체계적 문헌고찰) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | 2023년 7월 조회 | 471 references, 11 reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (법학) | ChatGPT-4 and Llama 2 | 2024 | 무작위 연방 법원 사건 질문 | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (정신 건강 문헌고찰) | GPT-4o | 2025년 6월 시험 | 176 citations, 6 reviews | 19.9% 완전 허위 생성, 56% 허위 생성 또는 결함 있음 |
| Rao, Wong and Callison-Burch, arXiv preprint (다영역, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | 220,000개가 넘는 citation URLs | 모델에 따라 3%에서 13% |
법학 연구는 원시 비율만으로는 드러나지 않는 세부 사항을 추가로 보여 준다. 같은 연구는 모델이 자신의 환각을 예측하는 데 어려움을 겪으며, 사건에 대한 사용자의 잘못된 전제를 바로잡기보다 받아들이는 경향이 있음을 발견했다. 허위 citation은 하나의 실패 양상이다. 자신의 불확실성까지 표시하지 못하는 모델은 더 어려운 문제이며, 잘못된 citation의 비용이 가장 큰 바로 그 분야에서 가장 두드러진다.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
ChatGPT는 2023년 이후 더 나아졌는가?
어느 정도는 그렇고, 또 고르지 않게 그렇다. 가장 분명한 단일 전후 비교는 Walters와 Wilder의 연구 자체에 있다. GPT-3.5에서 GPT-4로, 같은 날에, 허위 생성은 55%에서 18%로 줄었다. 2025년 중반의 GPT-4o로 가면 Linardon의 팀이 측정한 비율은 19.9%였는데, 이는 더 어렵고 더 좁은 과제, 즉 42개의 무관한 주제에 걸친 짧은 요약이 아니라 하나의 연구 분야에서의 6개 문헌 검토를 대상으로 한 것이었다. 다시 2026년 초에 검색 또는 deep-research 기능을 켠 모델들로 가면, 대부분에서 범위는 한 자릿수로 떨어져 3 to 9%가 되었지만, 하나의 deep-research 모드는 여전히 13.3%에 도달했다.
그 어떤 것도 곧바로 아래로 향하는 직선은 아니다. Linardon의 수치는 2023년 GPT-4 수치와 2023년 GPT-3.5 수치의 사이에 놓여 있으며, 두 수치보다 1년 이상 뒤에 출시된 모델에서 나온 것이다. 이는 더 어려운 과제, 즉 출처 자료 자체를 찾기 어려운 분야에서의 실제 문헌 검토 생성으로 시험했기 때문이다. 허위 생성 비율은 특정 날짜의 특정 과제에서의 모델을 설명한다. 이 셋 중 하나라도 바꾸면 수치는 움직이며, 때로는 크게 움직인다.
오늘날에도 수치를 움직이는 변수는 모델 계열만이 아니다. 2025년의 한 연구는 5개 학문 분야에 걸친 400개의 참고문헌을 대상으로 8개의 무료 챗봇, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat and Perplexity를 평가했는데, 생성된 모든 참고문헌 가운데 완전히 정확한 것은 26.5%에 불과했다. 이 시험에서 Grok과 DeepSeek은 허위 참고문헌을 하나도 생성하지 않았다. Claude, Copilot and Perplexity는 가장 낮은 성과를 보인 집단에 속했다. 같은 기반 기술 위에 구축되고 같은 달에 같은 프롬프트로 시험된 두 제품이 범위의 양 끝에 놓였는데, 이는 위의 모델과 날짜 표와 같은 교훈을 제품에 적용한 것일 뿐, 버전이 아니라 제품에 적용한 것이다.
허위 인용이 진짜처럼 보이는 이유
조작된 인용은 명백한 자리표시자가 아니다. Walters와 Wilder는 그들이 만들어 낸 항목들이 실제 분야에서 출판하는 저자들의 실명과, 실제로 존재하는 학술지 제목에 붙어 있으며, 빠른 시각적 점검을 통과할 만큼 충분히 그럴듯하게 형식화되어 있음을 발견했다. Linardon의 팀은 더 날카로운 점을 발견했다. GPT-4o가 생성한 35개의 조작된 인용 가운데 33개에는 DOI가 붙어 있었고, 그 DOI의 64%는 전혀 관련 없는 주제에 관한 실제 출판 논문으로 연결되었다. 끊어진 링크도 아니고 오류 페이지도 아니며, 존재하지 않는 출처를 대신하는 것은 다른 사람의 실제 연구였다.
ChatGPT 인용이 실제인지 확인하는 방법
DOI만 믿지 말고 Google Scholar나 해당 학술지의 자체 사이트에서 정확한 제목을 검색해야 한다. 작동하는 DOI가 완전히 잘못된 논문을 가리킬 수 있기 때문이다. 실제로 나타나는 것은 무엇인지가 아니라, 저자 목록, 연도, 학술지가 실제로 나타나는 내용과 일치하는지 확인해야 한다. chatbot이 제공하는 모든 참고문헌에 대해 이렇게 해야 하며, 낯설어 보이는 것만 확인해서는 안 된다. 이 연구들에서 조작된 항목은 바로 평범해 보이도록 만들어졌기 때문이다.
낯설거나 범위가 좁은 주제는 주류 주제보다 더 높은 위험으로 보아야 한다. Linardon의 팀은 잘 연구된 질환인 major depressive disorder에서는 조작 비율이 약 6%였고, 같은 검토 집합에 포함된 덜 연구된 두 질환에서는 약 30%였음을 발견했다. 이러한 패턴은 정신건강 영역 밖에서도 유지된다. 모델은 밀집된 분야에서는 패턴을 끌어올 실제 텍스트가 더 많고, 희박한 분야에서는 그럴듯하게 만들어 낼 여지가 더 많다.
각 항목을 실제 학술 데이터베이스와 대조하는 AI citation checker는 모든 참고문헌을 일일이 수동으로 조회하는 일을 자동화한다. 대부분의 사람들은 마감 압박 아래에서 바로 그 부분을 건너뛰며, 조작된 인용이 최종 초안까지 살아남기 가장 쉬운 조건이 바로 그 상황이다.
완성된 참고문헌 목록에서 이를 찾아내는 일은 별도의 절차이며, 별도의 페이지가 있다. 실제 인용에 대해서는 APA에서 ChatGPT를 인용하는 방법이 단계별로 제시되어 있다.
이것은 인용이 실제로 존재한다는 것을 확인한 뒤에 그 형식을 어떻게 지정하는지에는 아무런 영향을 주지 않는다. 이는 별개의 문제이다: How to cite ChatGPT는 그 대화 자체에 대해 APA, MLA, Chicago 및 IEEE를 다룬다, 그리고 a citation generator는 일반적인 참고문헌을 처리한다, 당신이 어떤 스타일로 글을 쓰고 있는지와 무관하게 동일하게 처리한다. 어떤 인용 형식도 고칠 수 없는 것은 애초에 출판된 적이 없는 것에 대한 참고문헌이다. 그 확인은 형식을 지정하기 전에 이루어지며, 모든 참고문헌에 대해, 당신의 초안을 어떤 모델이 작성했는지 또는 그 라벨이 어떤 버전을 주장하는지와 무관하게 이루어진다.
Frequently Asked Questions
ChatGPT가 참고문헌을 만들어 내는가? 그렇다. 2023년부터 2026년까지 발표된 모든 연구에서, 지금까지 시험된 모든 모델이 참고문헌을 만들어 냈다. 그 비율은 모델 버전, 분야, 날짜에 따라 크게 달라지며, 가장 최근의 근거 기반 모델에서는 약 3%인 반면 GPT-3.5의 2023년 결과에서는 절반을 훨씬 넘는다. 따라서 하나의 수치만으로는 결론을 내릴 수 없다.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.