Em Dash의 단서, 왜 ChatGPT는 이를 과도하게 사용하는가
ChatGPT가 em dash에 기대는 습관을 실제로 무엇이 유발하는지, 그 기호가 문장에서 어떤 역할을 하는지, 그리고 인간 편집자가 대신 무엇을 사용하는지, 즉 쉼표, 콜론 또는 마침표를 살펴본다.
때때로 채용 담당자는 동료에게 보낼 커버 레터에 한 줄을 덧붙인다. 대시를 확인하라는 것이다. 이 긴 종류의 기호는 두 문장 안에 세 번 나타나며, 한 번은 쉼표처럼, 한 번은 콜론처럼, 한 번은 마침표처럼 쓰이고, 모두 같은 문단 안에 있다. chatgpt가 가진 작은 습관은, 요점을 읽기 전에 대시를 먼저 보게 되는 그 습관이다. 실제로 그것이 무엇을 뜻하는지에 대해 어떤 결론을 내리기 전에, 이 습관을 제대로 이해하는 것이 중요하다. 즉, 논지를 읽기 전에 기호를 먼저 알아차리는 그 반사는 chatgpt의 em dash 습관을 축소해 보여 주는 것이며, 그것이 실제로 무엇을 입증하는지 판단하기 전에 제대로 이해할 가치가 있다.
em dash는 긴 대시로, 하이픈보다 길고 숫자 범위에 쓰이는 대시보다도 길며, 글쓴이가 문장 중간에 넣어 쉼표, 콜론 또는 마침표의 역할을 하게 하는 기호이다. ChatGPT는 편집된 산문 대부분보다 이를 더 자주 사용하지만, 정확히 얼마나 더 자주 쓰는지는 눈앞의 문단을 생성한 모델의 버전에 따라 달라진다. 이 글은 그 하나의 기호에만 좁게 초점을 맞춘다. 이 습관을 일으키는 원인은 무엇인지, 실제로 나타날 때 어떤 역할을 하는지, 그리고 인간 편집자는 그 대신 무엇으로 바꾸는지 살펴본다.
ChatGPT의 em dash 습관은 무엇 때문에 생기는가?
OpenAI의 누구도 기술적 설명을 발표한 적은 없지만, 우리가 알고 있는 많은 내용은 독립적인 조사 덕분이다. 회사 블로그 글은 필요하지 않다. 좋은 예로는 소프트웨어 엔지니어 Sean Goedecke가 2025년 10월에 쓴 심층 분석이 있다. 그는 추측하는 대신, 쉬운 이론들을 직접 시험했다. 그는 쉼표 대신 하나의 기호를 사용해 토큰을 절약하는 모델을 시험했다. 그러나 쉼표는 정확히 그만큼 짧다. 그는 또한 인간 피드백 작업자들로부터 얻은 방언 선호를 시험했고, 그 노동력과 흔히 연관되는 방언인 나이지리아 영어 텍스트의 대규모 표본을 확인했다. 실제로는 그곳에서 일반적인 현대 영어보다 더 자주 나타난 것이 아니라, 오히려 덜 자주 나타났다.
Goedecke 자신의 테스트가 남겨 둔 이론은 모델 버전 사이의 훈련 데이터 변화가 있었음을 가리킨다. 그는 GPT-3.5 출력에서는 그 습관이 거의 나타나지 않음을 확인했고, GPT-4o가 출시된 뒤에는 대략 10배 더 자주 나타남을 발견했다. 이는 모델 아키텍처 자체보다 훈련 세트에서 무엇이 바뀌었는지를 가리킨다. 그의 가장 유력한 추정은 1800년대 후반과 1900년대 초반의 디지털화된 책들인데, 그 시기는 인쇄된 영어에서 그 표지가 비정상적으로 높은 빈도로 나타났고, 현대 글쓰기에서의 수준보다 훨씬 높았던 때이다. 이 모델들을 훈련한 연구실 밖에서는 누구도 이를 확인할 수 없다. 이것은 현재 이용 가능한 이론들 가운데 가장 신중하게 검증된 이론이지, 확정된 사실은 아니다.
2026년 3월에 발표된 별도의 연구 흐름은 이름 붙일 만한 관련 원인을 가리킨다. 그것은 모델의 훈련 텍스트 중 얼마나 많은 부분이 일반 산문이 아니라 서식이 적용된 markdown이었는지에 관한 것으로, 그러한 서식 스타일에 많이 노출되면 구두점 선택 전반에 그 자체의 흔적이 남는다는 이론에 근거한다. 정직하게 요약하면, 여러 설명이 그럴듯하고, 그중 하나는 상당히 잘 검증되었으며, 실제로 확인할 수 있는 유일한 당사자에 의해 확인된 것은 하나도 없다.
문장에서 그 표지는 어떤 역할을 하는가?
대체 표지를 고르기 전에, 그 표지가 어떤 역할을 하는지 이름 붙이는 것이 도움이 된다. 쉼표, 콜론, 마침표는 서로 대체 가능하지 않으며, 긴 대시 대체물도 마찬가지이기 때문이다. 네 가지 역할이면 독자가 마주칠 거의 모든 경우를 포괄한다.
| 표시가 하는 역할 | 인간 저자가 대신 사용하는 것 | 예시 |
|---|---|---|
| 문장 안에 부가 설명을 덧붙일 때 | 쉼표 한 쌍, 또는 괄호 | 그 발견은, 두 번 반복 검증되었고, 두 조건 모두에서 유지되었다. |
| 갑작스러운 전환이나 급격한 중단을 표시할 때 | 마침표와 새 문장 | 그 발견은 두 조건 모두에서 유지되었다. 세 번째 조건에서는 그렇지 않았다. |
| 서로 밀접하게 관련된 두 독립된 진술을 연결할 때 | 마침표, 또는 연결이 중요할 때는 세미콜론 | 표본은 작았다. 효과 크기도 작았다. |
| 목록, 요약 또는 설명을 도입할 때 | 콜론 | 결과는 한 방향을 가리켰다: 복제는 실패했다. |
그 문장들 각각은 그 표시를 사용할 수도 있었지만 사용하지 않은 문장이었다. 이 글 자체가 그 표시가 기계적 단서라는 주장이고, 그 주장을 위와 아래의 어떤 문장에서도, 단 한 번도, 그것이 가리키는 문자를 사용하지 않음으로써 입증한다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
모든 Chatbot의 Em Dash 습관은 같은가?
아니며, 시스템 간 차이는 크다. TextPulse의 AI 글쓰기 패턴에 대한 더 넓은 안내에서 인용한, 2025년 중반 여섯 개 chatbot을 대상으로 한 동일 프롬프트 시험에서는, 세 시스템이 대략 70단어마다 한 번씩 그 표시를 생성했고, 한 시스템은 대략 470단어마다 한 번씩 생성했으며, 다른 두 시스템은 표본에서 전혀 생성하지 않았다. 빈도는 앞에 놓인 문단을 생성한 특정 시스템과 버전의 속성이지, 일반적인 AI 글쓰기의 고정된 특성이 아니다.
OpenAI는 2025년 11월에 부분적 수정안을 배포했다. 사용자가 이를 켜면 모델에게 중단하라고 지시하는 사용자 지정 지침 설정이다. Sam Altman은 이를 직접 발표하며, 오랫동안 제기된 불만을 마침내 듣는 것이라고 설명했다. 이 설정은 기본값이 아니라 선택적 활성화 방식이므로, 일상적인 ChatGPT 출력의 상당 부분은 이 설정의 영향을 전혀 받지 않았고, 아무도 스위치를 바꾸지 않은 곳에서는 그 습관이 계속된다.
이 표지가 AI의 징후라는 평판은 그 자체로도 비교적 최근의 것이며, 다소 과장되어 있다. 이를 추적한 논평에 따르면, 반발은 2025년 2월 무렵 시작되었다. 이 유행에 관한 한 대중적 글은, 챗봇이 세심한 인간 저자보다 이 표지를 더 많이 사용한다는 확실한 증거는 결코 없었다고 지적했다. 두 사실은 함께 성립할 수 있다. 이 습관은 실제로 존재하며 원시 출력에서 측정 가능하지만, 단 한 문장만 보고 그것을 알아차릴 수 있다는 인터넷의 확신은 실제 증거보다 훨씬 앞서 있다.
자신의 초안에서 이 습관을 확인하는 방법
한 단락을 소리 내어 읽고 긴 대시가 나타나는 모든 위치를 표시하라. 한 페이지에 한 번 나타나는 것은 문체적 선택이며, 인간 저자들이 수세기 동안 해 온 종류의 선택이다. 한 단락에 여러 번 나타나고, 특히 위의 표에서 서로 다른 역할을 수행한다면 다시 살펴볼 가치가 있다. 이러한 밀도는 AI 출력과, 의도적으로 대시를 많이 쓰는 몇몇 산문 문체가를 제외하면 드물다.
TextPulse의 무료 em dash 제거 도구는 이러한 밀도를 자동으로 점검하고, 각 경우에 필요한 쉼표, 콜론, 마침표 또는 재구성을 제안하므로, 긴 문서 전체를 손으로 세는 것보다 빠르다. 같은 무료 도구 모음은 기계가 초안 작성한 단락이 한꺼번에 드러내는 다른 수준, 즉 어휘 선택, 문장 리듬, 구조까지 다루므로, 구두점만을 넘는 점검이 가능하다.
군더더기 표현도 문장 수준에서 같은 역할을 하며, 가장 먼저 삭제할 만한 표현 목록이 있다. 이미 작성한 초안에서 이 어휘를 제거하는 것은 또 다른 접근을 취한다.
이 모든 것은 점검에 특별한 소프트웨어를 필요로 하지 않았고, 주의와 문장을 다시 읽으려는 의지만 있으면 되었다. 이 글은 초안 작성 전반에서 같은 선택을 했다. 쉼표, 콜론 또는 마침표를 택하고, 1500단어 동안 설명한 그 표지는 단 한 번도 택하지 않았다.
자주 묻는 질문
ChatGPT의 em dash 습관은 주로 모델 버전 사이에서 학습 데이터가 어떻게 달라졌는지에서 비롯되며, 의도적인 설계 선택은 아니다. 독립적 테스트에서는 이 기호가 GPT-4o 출력에서 GPT-3.5보다 훨씬 더 자주 나타났고, 유력한 이론은 이 기호가 비정상적으로 많이 쓰이던 시기의 오래된 인쇄본에 많이 노출되었다는 점을 가리킨다. OpenAI는 자체 설명을 공개하지 않았으므로, 이는 확인된 사실이 아니라 현재로서는 가장 근거가 있는 이론으로 남아 있다.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.