AI Detector 오탐: 왜 인간의 글이 표시되는가
업체들은 오탐률을 1% 안팎으로 공표한다. 그러나 서로 다른 글에 같은 도구를 적용한 독립적 시험에서는 대개 다른 결과가 나온다. 여기서는 실제로 무엇이 오탐을 유발하는지, 그리고 일단 그 수치가 존재할 때 그것이 무엇을 의미하고 무엇을 의미하지 않는지 살펴본다.
1982년, New England Journal of Medicine은 골수 이식 환자의 거대세포바이러스에 관한 논문을 게재했다. 이 논문은 동료 심사를 통과했고, 40년 동안 아카이브에 보관되어 있었다. 2023년, 연구자들은 OpenAI가 공개적으로 출시한 AI 글쓰기 탐지기에 이 논문을 넣어 보았고, 그 도구는 이 논문이 99.96 percent의 확률로 AI가 생성한 것이라고 평가했다. 그런데 이 논문은, 그것이 쓰였다고 추정되는 모델이 존재하기 37년 전의 것이었다. 이것은 AI detector false positive의 가장 순수한 형태이다. 즉, 기계가 쓴 것으로 표시되었지만 기계가 썼을 가능성은 전혀 없는 문서이다.
이 사례가 극단적인 것은 시점뿐이다. 그 이면의 패턴, 즉 누가 썼는지 또는 언제 썼는지와 무관하게 공식적이고 예측 가능한 산문을 기계가 쓴 것으로 읽어 내는 탐지기는, 에세이, 자기소개서, 실험 보고서, 개인 진술문 같은 일상적인 제출물에서 끊임없이 나타난다. 이 글은 false positive를 일으키는 원인, 어떤 종류의 글이 가장 취약한지, 그리고 왜 하나의 표시된 점수가 겉보기와 같은 증거가 아닌지를 다룬다.
AI Detector False Positive란 무엇인가?
AI detector false positive는 탐지 도구가 AI가 생성한 것으로 점수를 매긴 인간이 쓴 텍스트이다. 여기서 측정되는 것은 작성자의 과정, 정직성, 또는 능력이 아니다. 도구는 문장의 통계적 형태, 즉 단어 선택과 구조가 얼마나 예측 가능한지를, 기계 출력과 연관되도록 학습한 형태와 비교한다.
공급업체들은 false positive 비율을 하나의 작은 백분율로 보고하며, 보통 1 percent 또는 2 percent 미만이다. 그 수치는 공급업체가 만든 벤치마크에서 수행한 통제된 시험을 설명할 뿐, 개별 문서에 대한 보증은 아니다. AI detectors가 전반적으로 정확한지에 대한 더 넓은 질문은 이미 독립적으로 검증되었고, 그 결과는 전혀 다른 곳에, 때로는 어떤 공급업체 수치보다 훨씬 높은 곳에 도달한다. 이 글은 더 좁은 범위에 머문다. 어떤 종류의 글이 그 위험을 높이는지, 그리고 표시된 점수가 무엇을 말해 줄 수 있고 무엇을 말해 줄 수 없는지에 대해서이다.
어떤 글쓰기 특성이 인간의 텍스트를 기계가 쓴 것처럼 보이게 하는가
일반적인 글쓰기의 네 가지 유형은 가장 큰 위험을 지니며, 그 어느 것도 사람이 잘못을 저지르는 것과는 관련이 없다. 짧은 문서, 매우 공식화된 글쓰기, 인용되었거나 템플릿화된 자료, 그리고 철저히 교정된 글쓰기는 모두 자유롭게 구성된 산문보다 더 예측 가능한 것으로 점수가 매겨지는 경향이 있는데, 이것이야말로 모든 탐지기가 실제로 측정하는 하나의 속성이다. free burstiness checker는 바로 그 동일한 변동성을 직접 측정하며, 이는 그것에 대한 설명을 읽는 것보다 그 패턴을 더 빠르게 확인하는 방법이다.
일부 장르는 설계상 공식적이다. 방법 섹션, 실험실 보고서, 표준적인 자기소개서, 문헌 검토는 모두 관습적인 표현을 창의적인 표현보다 더 선호하는데, 이는 그 관습이야말로 문서를 독자가 사용할 수 있게 만드는 요소이기 때문이다. 연구자들은 실제 글쓰기에 대해 이를 직접 검증했다. 그들은 대규모 언어 모델이 존재하기 훨씬 전인 1980년부터 2023년 사이에 발표된 학술지 초록 14,400편을 공개적으로 이용 가능한 탐지기에 넣어 분석했다. 출판 연도와 무관하게 최대 8 percent가 AI-generated로 표시되었고, New England Journal of Medicine의 초록은 10.24 percent로 표시되었는데, 이는 시험된 다섯 학술지 가운데 가장 높은 false positive rate였다.
이 검사는 ChatGPT에 관한 어떤 것도 탐지할 수 없었을 것이다. 왜냐하면 ChatGPT는 그가 표본으로 삼은 대부분의 연도에 존재하지 않았기 때문이다. 그것이 탐지한 것은 장르였다. 더 형식적으로 말하면, 2026년의 탐지 문제에 대한 통계적 분석이 제시하듯, 소프트웨어가 작성했기 때문에 예측 가능한 문장과, 그 장르에서 쓰는 종류의 문장이기 때문에 예측 가능한 문장을 구별할 탐지기를 만드는 방법은 없다. 외부에서 보면 두 문장은 정확히 똑같아 보인다.
과도한 편집도 비슷한 방향으로 작용한다. 초고에는 글쓴이의 구체적인 불규칙성이 담겨 있다. 어색한 어순, 생각이 이어졌기 때문에 길어지는 문장 같은 것들이다. 그러나 철저한 교정 과정, 특히 다른 도구를 거친 교정은 바로 그런 불규칙성을 매끈하게 지워 버리는 경향이 있다. 지금까지 가장 큰 규모로 이루어진 탐지 도구 비교에서는 14개 도구를 시험했으며, 샘플 텍스트를 바꾸어 쓰거나 기계 번역한 뒤에는 모든 도구에서 정확도가 더 떨어진다는 사실을 발견했다.
| 글쓰기 특성 | 문서의 겉보기 예측 불가능성을 낮추는 이유 | 증거가 보여 주는 것 |
|---|---|---|
| 짧은 제출물 | 텍스트가 적을수록 인간의 리듬과 기계의 리듬을 가르는 자연스러운 변이가 들어갈 여지가 줄어든다 | 짧은 문서의 점수는 몇 개의 특이한 문장의 영향만으로 더 크게 흔들린다 |
| 공식적이거나 학문 분야 특유의 글쓰기 | 장르 관습은 창의적인 표현보다 예상 가능한 표현을 더 높이 평가한다 | ChatGPT 이전의 저널 초록 14,400개(1980 to 2023)는 여전히 최대 8%의 오탐을 유발했으며, 한 저널의 초록은 10.24%에 이르렀다 |
| 많이 편집되었거나 바꾸어 쓴 초고 | 다듬는 과정은 탐지기가 인간적인 것으로 읽는 개인적 불규칙성을 매끈하게 없앤다 | 독립적인 14개 도구 비교에서는 바꾸어 쓰기 또는 기계 번역 뒤에 정확도가 더 떨어졌다 |
| 인용되었거나 템플릿화된 자료 | 인용된 구절은 인용하는 글쓴이의 것이 아니라 원문의 통계적 특징을 지닌다 | 인용문을 제외하지 않는 탐지기는 차용된 텍스트를 기준으로 주변 문서를 점수화한다 |
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
공개된 비율과 실제 비율이 일치하지 않는 이유
모든 주요 탐지기는 1% 안팎 또는 그 이하의 오탐률을 공표한다. 그러나 서로 다른 문서를 서로 다른 조건에서 실행한 동일 도구의 독립적 시험은 일상적으로 훨씬 더 높은 수치를 보고하며, 때로는 10배 이상 높다. 이 두 수치는 모두 정확할 수 있지만, 같은 것을 측정하는 것이 아니므로 공통점은 거의 없다고 말할 수 있다.
Turnitin은 특히 더 많은 세부 정보를 공개한다는 점에서 유용한 사례이다. 문서 수준에서 1퍼센트 미만의 위양성률을 제시하며, 제출물의 20퍼센트 이상이 AI 작성으로 표시될 때에 한정되고, 동시에 실제 결과는 자사의 실험실 테스트와 다르다는 회사의 진술도 함께 제시한다. Washington Post는 2023년에 같은 도구에 실제 문서 16개를 통과시켰고, 그중 절반이 넘는 문서가 적어도 부분적으로 잘못 식별되었음을 발견했으며, 완전히 인간이 작성한 에세이 하나가 부분적으로 AI 생성으로 표시된 사례도 포함되었다. 이 두 수치는 조작된 것이 아니다. 서로 다른 표본, 서로 다른 기준점, 그리고 무엇이 표시로 간주되는지에 대한 서로 다른 정의에서 나온 것이다.
같은 간극은 한 회사에만 나타나는 것이 아니라 업계 전반에서 나타난다. 14개 도구를 비교한 그 분석에서는 모든 도구가 전체 정확도 80퍼센트에 미치지 못했고, 14개 중 6개는 어떤 패러프레이징도 들어가기 전에 수정되지 않은 인간의 글에서 위양성을 산출했다. 공개된 수치는 기준선을 설명할 뿐이다. 그것은 교수 앞에 지금 놓여 있는 문서를 설명하지 않는다.
왜 확신에 찬 점수가 확신에 찬 비난을 뜻하지 않는가
위양성률은 문제로 표시된 한 학생이 무고할 가능성을 가리키는 것처럼 들린다. 그러나 그렇지 않다. 그것은 검사를 받는 모든 사람에 대해 그 검사가 어떻게 작동하는지를 설명한다. 그리고 이는 의학이나 보안에서의 어떤 선별 검사와 마찬가지로, 서로 다른 답을 갖는 서로 다른 질문이다.
2026년 3월 Griffith University 연구자의 통계 분석은 그 기저 수학을 명시적으로 드러낸다. AI 탐지를 하나의 고립된 문서가 아니라 학생 작성자 집단에 적용되는 검사로 다루면, 절충이 나타난다. 그 집단의 일부가 전형적인 AI 출력과 자연스럽게 겹치는 방식으로, 장르 관습에 가깝게, 제2언어 학습자의 범위에 가깝게 글을 쓸 때마다, AI 작성물을 실제로 적발할 힘이 있는 어떤 탐지기라도 그 겹치는 일부에 대해서는 오작동해야 한다. 이것은 특정 탐지기가 형편없이 만들어졌다는 주장과는 다르다. 이는 다양한 집단을 하나의 문서와 다른 증거 없이 검사할 때의 속성이다.
이 논문의 설명용 예시는 관련된 규모를 보여준다. 어떤 학생 집단의 10퍼센트가 전형적인 AI 출력과 충분히 비슷하게 글을 쓰고, 탐지기가 실제 AI 작성물을 80퍼센트 포착하도록 조정되어 있다고 가정하자. 그러면 수학적으로 그 집단 전체에서 평균 오탐률은 최소 7.5퍼센트가 되어야 한다. 이는 탐지기의 공학적 결함이 아니라, 그 집단의 글이 탐지 대상과 통계적으로 얼마나 많이 겹치는지에 대한 직접적인 결과이다.
이를 10,000명의 학생이 있는 대학에 적용하면, 이 하한만으로도 집단 전체에서 대략 750건의 잘못된 경고가 발생함을 뜻하며, 이는 다른 증거를 함께 고려하지 않은 채 다양한 집단을 하나의 문서와 대조해 검사할 때 생기는 수학적 결과이다. 논문의 저자는 이 수치들이 실제 기관에서 측정된 것이 아니라 설명을 위한 예시임을 분명히 밝힌다. 이 예시는 특정 캠퍼스에 대한 구체적 예측이 아니라 문제의 형태를 보여준다.
이 모든 것이 경고된 점수가 무의미하다는 뜻은 아니다. 이는 그 점수가 하나의 약한 집단 수준 신호일 뿐이며, 단일 개인에 관한 질문에 답하도록 요구받고 있다는 뜻이다. 이러한 불일치는 어떤 공급업체의 다듬기만으로도 완전히 해소될 수 없다. 책임 있는 해석은 그 수치를 더 나은 증거를 모으기 위한 출발점으로 본다. 초안, 버전 기록, 실제로 무언가를 쓰는 사람에게서 흔히 남는 일반적인 문서 흔적이 그것이다. TextPulse의 무료 도구를 사용하면 작성자가 다른 누구보다 먼저 초안이 이러한 동일한 측정치에서 현재 어느 위치에 있는지 확인할 수 있으며, 이는 특정 탐지기를 무력화하려는 것과는 다른 기술의 사용 방식이다.
어떤 작성자가 가장 높은 위험에 직면하는가
연구는 다른 어떤 집단보다 더 두드러지는 두 집단을 보여준다. 하나는 제2언어로 글을 쓰는 사람들, 다른 하나는 에세이를 어떻게 썼는지와는 무관한 이유로 본래 매우 구조적이거나 반복적인 글쓰기 습관을 가진 사람들이다. 이 두 유형의 작성자는 모두 탐지기가 포착하도록 설계된 동일한 통계적 특징에 나타난다.
영어가 모국어가 아닌 화자는 문서화된 위험이 가장 크다. 독립적인 시험에서는 유창한 제2언어 학술 글쓰기를 기계 생성으로 오인하는 탐지기가 모국어 글쓰기보다 훨씬 높은 비율로 반복해서 확인되었다. TextPulse의 ESL 학술 저자를 위한 페이지는 이러한 위험의 메커니즘을 더 자세히 설명하며, 어떤 표현 패턴이 그 원인인지도 다룬다.
덜 논의되는 또 다른 집단도 관련된 문제에 직면한다. 연구자들은 약 60,000개의 Reddit 게시물을 비교했는데, 그중 일부는 자폐 저자가 작성했을 가능성이 있는 것으로 식별된 집단이었고, 나머지는 일반 표본이었다. 그런 다음 두 집단 모두를 GPT-2 기반 탐지기에 통과시켰다. 두 집단 모두 전체적으로 2 percent 미만이 표시되었지만, 자폐 가능성이 있는 집단은 일반 표본보다 유의하게 더 높은 비율로 표시되었다. 문자 그대로의 표현, 반복적 표현, 촘촘하게 패턴화된 표현으로 기우는 글쓰기는, 일부 자폐 의사소통 양식의 문서화된 특징인데, 탐지기가 포착하도록 설계된 바로 그 낮은 변동성의 텍스트를 만들어 낸다.
두 업체는 주장과 대조할 만큼 충분한 정보를 공개한다. Turnitin의 자체 오탐률은 별도로 제시되어 있고, ZeroGPT의 정확도는 별도 페이지에서 검토된다. 이러한 오류가 누구에게 가장 심각하게 작용하는지는 또 다른 문제이며, 영어가 모국어가 아닌 저자들이 더 자주 표시되는 이유에는 별도의 답이 있다.
이 모든 것이 곧 더 단순해질 가능성은 낮다. 탐지기는 실제로 기계가 작성한 텍스트를 잡아내는 데 계속 더 나아질 것이고, 인구 집단의 다양성은 더 나은 공학만으로는 완전히 없앨 수 없는 일정한 수준의 오탐을 계속 만들어 낼 것이다. 더 유용한 변화는 이미 일부 기관에서 일어나고 있다. 점수를 결론이 아니라 대화의 시작으로 다루고, 공개된 비율이 실제로 어떤 집단을 대상으로 시험되었는지 먼저 확인한 뒤에야 그것이 눈앞의 문서에 적용된다고 신뢰하는 것이다.
Frequently Asked Questions
AI detector 오탐은 탐지 도구가 인간이 쓴 글을 AI 생성으로 잘못 점수화한 경우를 말한다. 이는 detector가 누가 썼는지가 아니라 문장이 얼마나 예측 가능한지를 측정하기 때문에 발생한다. 짧고, 형식적이며, 많이 수정되었거나, 제2언어로 작성된 글은 저자성과는 무관한 이유로 예측 가능하게 읽히는 경우가 많고, 그것만으로도 표시가 발생하기에 충분하다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.