AI가 작성한 주석이 존재하지 않는 논문을 설명하는 이유
조작된 참고문헌은 누군가 검색하기 전까지는 실제 참고문헌과 똑같아 보일 수 있습니다. 그 아래의 주석은 더 위조하기 어렵습니다, 아무도 쓰지 않은 논문에 대해 그 방법과 결과를 자세히 설명하는 유창한 문단이기 때문입니다.
감독자는 같은 문장 구조를 열 번 연속으로 읽고, 주석이 달린 참고문헌 목록을 펼쳐 한 페이지씩 소리 내어 읽는다. 이 연구는 X와 Y의 관계를 검토하며, 참가자 표본을 사용해 Z를 탐색하고, 추가 연구가 필요하다고 결론짓는다. 모든 항목은 유창하게 읽힌다. 제목으로 검색한 열두 개의 출처 중 두 개는 존재하지 않는다.
참고문헌 목록에서 AI가 환각한 인용은 대개 참고문헌 줄에서 스스로를 드러내지 않는다. 조작된 저자명과 조작된 학술지는 누군가 그것들을 검색하기 전까지는 실제 것과 정확히 같아 보일 수 있다. 조작을 가장 먼저, 거의 언제나 드러내는 것은 그 아래에 놓인 주석이다. 그것은 한 번도 쓰인 적 없는 논문에 대해, 그 논문의 방법과 결과를 자세히 설명할 만큼 자신감 있는 문단이다.
참고문헌 목록에서 AI가 환각한 인용을 식별하는 방법
주석을 참고문헌 줄보다 먼저 읽어라. 인용 자체, 저자, 연도, 학술지, DOI는 모두 언어 모델이 수천 번 보아 온 작고 구조화된 패턴이며, 실제로는 아무것도 없더라도 우연히 또는 암기 때문에 그럴듯해 보일 수 있다. 반면 주석은 그 특정 논문이 실제로 무엇을 했는지에 대해 말해야 하며, 그것이 참인지 거짓인지 확인할 수 있을 만큼 충분한 세부사항을 포함해야 한다. 모델이 출처를 검색하거나 읽지 않으면 이것을 신뢰성 있게 할 수 없고, 그 결과는 우리가 DOI를 확인하기도 훨씬 전에 일반성으로 드러난다.
주석이 인용보다 더 많은 것을 드러내는 이유
조작된 인용은 참고문헌처럼 꾸민 추측이다. 그럴듯한 저자, 그럴듯한 학술지, 올바른 자릿수의 DOI처럼 보이는 문자열이다. 조작된 주석은 이해처럼 꾸민 추측이며, 이해는 한 문단 전체에 걸쳐 그럴듯하게 위조하기가 훨씬 더 어렵다. 모델은 표본, 방법, 그리고 발견의 방향에 대해 확정해야 하며, 이 모든 세부사항은 실제 논문이 그것을 반박할 수 있는 지점이다.
이것이 또한 주석이 단순한 인용보다 독자가 확인하기 더 쉬운 이유이다. 참고문헌은 출처가 실제인지 여부와 무관하게 같은 방식으로 형식화되므로, 그 형태만으로는 어떠한 정보도 드러나지 않는다. 주석은 특정 내용에 대해 구체적인 주장을 하므로, 실제 논문에 의해 뒷받침되거나 그렇지 않으며, 실제 초록을 몇 분만 살펴보면 어느 쪽인지 판별된다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
모델이 논문을 실제로 한 번도 읽지 않았을 때 쓰는 것
언어 모델에게 제목과 대략적인 주제만 알고 있는 출처를 주석 처리하라고 요청하면, 그것은 거절하지도 않고 애매하게 답하지도 않는다. 대신 그 제목의 논문이라면 아마 포함했을 법한 문단을 예측하는데, 이는 훈련에서 본 수천 개의 유사한 초록을 바탕으로 구성되며, 자신이 줄 단위로 인용할 수 있는 논문에 대해 사용할 것과 같은 확신에 찬 문체로 이를 돌려준다.
그것은 그 주제 근처에서 지금까지 쓰인 모든 것의 평균처럼 읽힌다. 수면과 기억에 관한 연구를 정직하게 요약하면 실제 연구 참여자의 이름, 실제로 사용된 검사, 그리고 보고된 실제 효과 크기를 제시할 것이다. 반면에 지어낸 요약은 연구가 사람들이 얼마나 잘 잤는지와 기억을 살펴보았고, 그 둘 사이에 강한 연관이 있다고 발견했다고 말할 것이다. 그것은 너무 일반적이어서 다른, 관련 없는 제목 아래에도 무리 없이 들어갈 수 있다.
| 확인할 사항 | 진짜 주석은 보통 다음을 포함한다 | 조작된 주석은 보통 대신 다음을 포함한다 |
|---|---|---|
| 숫자 | 실제 초록과 일치하는 구체적인 표본 크기, 효과 크기 또는 백분율 | 숫자가 없거나, 실제 출처 어디에도 나타나지 않는 둥글고 검증할 수 없는 수치 |
| 방법 | 실제로 명시된 방법, 구체적인 검정, 설계 또는 데이터셋 | 방법이 명시되지 않은 채 "연구" 또는 "분석"에 대한 모호한 언급 |
| 한계 | 저자들이 직접 제기한, 그들의 설계에 특유한 하나의 한계 | 해당 분야의 거의 모든 논문에 적용되는 일반적인 한계 |
| 참고문헌 일치 | 인용이 주석과 제목이 일치하는 실제 기록으로 연결된다 | 참고문헌이 연결되지 않거나, 다른 무관한 논문으로 연결된다 |
이러한 확인은 논문 전체를 읽을 필요가 없다. 주석에 있는 구체적 주장들이 실제로 초록에 나타나는지 볼 수 있을 만큼, 한 번 열어 보는 것만 필요하다.
조작률에 모델 버전과 날짜가 필요한 이유
문제의 규모는 측정되지만, 그 측정값들은 서로 일치하지 않는다. 왜냐하면 그것들은 결코 같은 것을 측정한 것이 아니기 때문이다. 2023년 같은 날 같은 42개의 학술 주제에 대해 ChatGPT-3.5와 ChatGPT-4를 시험한 결과, 연구자들은 GPT-3.5의 인용문헌 중 55 percent가 완전히 조작된 것으로 발견했으며, GPT-4에서는 18 percent였다. 프롬프트도 같고, 연구자도 같고, 날짜도 같았다. 바뀐 것은 모델뿐이었고, 그 비율은 3분의 2로 감소했다.
별도의 연구에서는 서지 인용이 아니라 환각된 사례 사실을 시험했으며, 2024년에 발표된 연구에서 실제 연방 법원 사건에 관한 검증 가능한 질문에 대해 ChatGPT-4는 58 percent의 경우 틀렸고, Llama 2는 88 percent의 경우 틀렸다. 이 수치는 서로 다른 모델과 서로 다른 과제에 대한 것이므로, 위의 인용 조작 수치와 합쳐 하나의 총괄 비율로 평균 내서는 안 된다. 두 연구가 공통으로 보여 주는 것은 문제의 형태이다. 모델 버전과 날짜가 붙지 않은 percentage는 아무것도 구체적으로 말해 주지 않는다. 2023년부터 2026년까지 이어지는 이러한 여섯 개 연구 전반의 더 넓은 패턴은 그 자체로 하나의 주제이며, does ChatGPT make up references가 이를 전부 다룬다. 서지 목록에서 특히 중요한 것은 더 좁다. 즉, 주석이 DOI를 확인하기 전에 조작 사실을 드러내는지 여부이다.
AI가 작성한 주석 달린 서지 목록의 각 항목을 확인하는 방법
참고문헌 줄부터 시작하라. Google Scholar 또는 해당 학술지의 자체 사이트에서 정확한 제목을 검색하고, DOI는 실제로 그 제목으로 연결될 때까지는 확인되지 않은 것으로 간주하라. 조작된 인용은 다른 사람의 실제이지만 무관한 논문으로 이어지는 DOI를 포함할 수 있기 때문이다. 실제 학술 데이터베이스와 각 항목을 대조하여 확인하는 AI citation checker는 모든 출처를 일일이 수동으로 조회하게 두는 대신 이러한 검색을 자동화한다.
그다음에는 주석을 출처 자체와 대조하라, 얼마나 그럴듯하게 들리는지와 대조하지 말고. 실제 초록을 열어 주석이 주장하는 표본, 방법, 그리고 발견이 실제로 그 안에 있는지 확인하라. 논문의 초록 자체에 모든 요약을 근거시키는 무료 annotated bibliography generator는 기억에 의존해 하나를 구성하는 대신, 진정으로 출처에 근거한 주석이 어떤 모습인지, 그렇지 않은 주석과 나란히 보여 준다.
검토를 통과한 항목들에 대해서는, APA에서 ChatGPT를 인용하는 방법과 MLA에서 ChatGPT를 인용하는 방법이 각각 단계별로 정리되어 있다.
이러한 점은 그것이 실제임을 확인한 뒤 항목을 형식화하는 방식에는 아무런 변화를 주지 않는다. ChatGPT 자체를 인용하는 방법은 별개의 문제이며, APA, MLA, Chicago 및 IEEE에 대해 전체적으로 다루어진다. 또한 인용 생성기는 스타일과 무관하게 일반 참고문헌을 같은 방식으로 형식화한다. 그러나 어느 쪽도 포착하지 못하는 것은 아무도 작성하지 않은 논문을 설명하는 주석으로, 너무 유창해서 아무도 확인해야 한다고 생각하지 않았다는 점이다.
자주 묻는 질문
인용은 그럴듯하게 보이기만 하면 되기 때문입니다, 그럴듯한 저자, 저널, DOI만으로도 대충 훑어보는 검사를 통과할 수 있습니다. 주석은 정확해야 합니다, 논문의 방법과 결과에 대해 특정한 주장을 하기 때문이며, 그 주장은 실제 출처와 일치하거나 그렇지 않아야 합니다. 논문을 읽지 않은 모델은 참고문헌의 형식은 훨씬 쉽게 흉내 낼 수 있지만, 요약의 내용은 그렇게 쉽게 흉내 낼 수 없습니다.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.