AI Detection

AI 탐지기는 어떻게 작동하는가? Perplexity, Burstiness 및 토큰 확률

AI 탐지기는 독자가 하듯 기계 작성물을 인식하지 않는다. 이들은 텍스트가 얼마나 예측 가능한지를 측정한 뒤, 그것을 점수로 바꾼다. 이를 이해하면 기술과 그 한계가 모두 더 잘 이해된다.

7 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

귀하의 대학은 제출물을 AI detector로 검사하기 시작했고, 예상하지 못한 수치가 담긴 보고서가 돌아왔습니다. 그것에 이의를 제기하려 하기 전에, 그 수치가 무엇을 의미하는지 아는 것이 도움이 됩니다. AI detector는 어떻게 작동합니까? 그것은 사람이 하듯 기계가 쓴 글을 읽지 않습니다. 언어 모델에 비추어 텍스트가 얼마나 예측 가능한지를 측정한 뒤, 그 예측 가능성을 점수로 바꿉니다. 그 과정 어디에도 의미, 논지, 또는 실제로 본인이 그것을 썼는지 여부를 살펴보는 부분은 없습니다.

저는 수년간 텍스트를 통계적으로 분해하는 도구를 만들어 왔으며, 탐지에 대해 이해해야 할 가장 유용한 단 하나의 사실은 이것입니다. 그것은 출처가 아니라 전형성의 측정입니다. 이것을 이해하면, 기술과 그 한계가 훨씬 더 잘 이해됩니다.

탐지기가 실제로 측정하는 것

탐지기는 누가 무엇을 썼는지 알지 못합니다. 그것이 가진 것은 언어 모델과 점수 함수입니다. 모델은 텍스트를 왼쪽에서 오른쪽으로 읽고, 각 지점에서 다음에 올 단어가 무엇일지에 대한 확률 분포를 생성합니다. "the results of the"라는 단어를 주면, "study"를 가장 높게, "experiment"를 조금 낮게, "marmalade"는 거의 0에 가깝게 순위를 매깁니다.

따라서 탐지기는 문서에 하나의 질문을 던집니다. 이 텍스트는 모델이 예상한 단어를 얼마나 자주 선택했는가? 높은 확률의 단어를 계속 선택하는 글은 기계가 만든 것처럼 보입니다. 그것이 바로 텍스트 생성기가 하는 일이기 때문입니다. 모델은 수천 개의 토큰에 걸쳐, 자기 분포의 상위에서 반복해서 샘플링합니다.

이 때문에 이 범주는 마케팅이 시사하는 것보다 훨씬 불안정한 기반 위에 있습니다. 탐지기는 워터마크나 지문을 찾는 것이 아닙니다. 그것은 귀하의 산문이 통계적으로 놀랍지 않다는 점을 알아차리는 것이며, 놀랍지 않은 산문에는 챗봇 말고도 많은 원인이 있습니다.

퍼플렉서티, 모델이 얼마나 놀라는가

핵심 지표는 perplexity라고 하며, 들리는 것보다 더 이해하기 쉽습니다. 실제로 나타난 각 단어에 대해 모델이 부여한 확률을 취하고, 그 확률들의 로그를 평균한 뒤, 그 결과를 지수화합니다. 그렇게 얻어지는 것은 모델이 당신의 문서에 얼마나 놀랐는지를 설명하는 하나의 수치입니다. 추측하기보다 자신의 초안의 perplexity를 확인할 수 있습니다.

낮은 perplexity는 텍스트가 모델이 예상한 방향으로 갔다는 뜻입니다. 높은 perplexity는 텍스트가 모델이 예상하지 못한 방향으로 계속 꺾였다는 뜻입니다. 인간의 글은 대체로 더 높은 값에 위치하는 경향이 있는데, 사람은 낯설고 구체적인 명사, 특이한 구문, 예상 밖에서 시작하는 문장을 자주 선택하기 때문입니다. 생성된 텍스트는 대체로 더 낮은 값에 위치하는 경향이 있는데, 디코딩 과정이 바로 그런 움직임을 피하도록 설계되어 있기 때문입니다.

방법론 절의 시작 방식을 두 가지로 비교해 보겠습니다. "The results of the study were statistically significant"는 거의 모든 모델이 높은 확신으로 예측할 수 있는 연속입니다. 여기에는 예상 밖의 정보가 없기 때문입니다. "Two of the three cohorts drifted before week six, which we had not planned for"는 훨씬 예측하기 어렵습니다. 논문의 나머지 부분만으로는 추측할 수 없는, 구체적이고 다루기 까다로운 정보를 담고 있기 때문입니다. 두 번째 문장은 탐지기에 실제 놀라움을 주며, 바로 그 놀라움이 인간적인 것으로 인식됩니다.

Burstiness: 평균이 아니라 분산

perplexity만으로는 충분하지 않습니다. 문서는 평균적으로는 매우 타당한 수치에 도달하면서도, 그 아래에서는 의심스러울 정도로 균일할 수 있기 때문입니다. 중요한 것은 텍스트 전반의 변동이며, burstiness는 바로 그것을 측정합니다. 글이 진행됨에 따라 문장 길이와 문장 수준의 perplexity가 얼마나 크게 흔들리는지를 보는 것입니다. burstiness checker는 그 분포를 직접 보여줍니다.

우리는 확신이 있을 때 더 빨리 쓰고, 주저할 때 더 천천히 쓰며, 그 리듬은 산문 속에도 남습니다. 사람은 덩어리로 씁니다. 한 단락은 여덟 단어로 된 짧은 평서문으로 시작하고, 세 개의 절과 괄호 안 부연을 담은 서른네 단어짜리 문장으로 이어진 뒤, 다시 간결한 표현으로 돌아갈 수 있습니다.

모델 출력은 이를 안정적으로 수행하지 못한다. 문장들은 평균 길이 근처에 모여 있다. 문단은 가지런한 묶음으로 나타난다. 각 절은 자기 제목을 다시 진술하는 방식으로 시작한다. 읽기에는 매끄럽지만 점수는 나쁘다, 문장 간 낮은 분산은 탐지기가 가진 가장 강한 신호 가운데 하나이기 때문이다. 이를 드러내는 것은 어떤 단일 문장이 아니다. 바로 그 균일성이다.

신호측정하는 것기계 생성 텍스트의 점수가 낮은 이유
Perplexity문서 전체에 걸쳐 평균화한, 모델이 사용자의 단어 선택에 얼마나 놀라는지디코딩이 설계상 고확률 토큰에서 표본을 추출하기 때문
Burstiness텍스트 전반에서 문장 길이와 예측 가능성이 얼마나 달라지는지출력이 흔들리기보다 평균 근처에 모이기 때문
Token probability앞의 두 값이 계산되는, 단어별 개연성개별적으로는 두드러지지 않는 선택이 길게 이어지기 때문

Token probability와 점수가 산출되는 방식

이 두 수치는 세 번째 값, 즉 토큰별 로그우도에서 만들어진다. 이것이 나머지 모든 것이 계산되는 원자료이다. 일부 도구는 이를 직접 보여 주면서, 텍스트가 가장 예측 가능했던 구간을 강조한다. 인터페이스가 무엇을 암시하든, 그 강조 표시는 특정 문장에 대한 비난이 아니다. 그것은 문서 수준의 수치에 가장 크게 기여한 부분이다.

연구 접근은 단순한 임계값을 넘어섰다. DetectGPT와 그 후속 방법들은 곡률을 살핀다. 이들은 텍스트를 약간 교란한 뒤, 생성된 텍스트가 보이는 경향과 같은 패턴으로 개연성이 떨어지는지 확인한다. 다른 방법들은 같은 구절을 두 개의 서로 다른 모델 아래에서 비교하고, 그 불일치를 신호로 사용한다.

이로 인해 평가를 받는 사람에게 중요한 결과가 하나 생긴다. 지표는 특정 기준 모델에 대해 계산되므로, 점수는 언제나 그 모델에 상대적이다. 두 탐지기는 같은 문단을 읽고도 완전히 다르게 판단할 수 있으며, 어느 쪽도 오작동하는 것은 아니다. 이들은 서로 다른 기준점을 가지고 같은 질문에 답하고 있다.

두 번째 결과는 덜 자주 언급된다. 모델은 어떤 구절이 훈련된 것과 닮아 있을 때만 그 구절을 예측 가능하다고 판단할 수 있으므로, 기준 모델과 텍스트를 생성한 대상 사이의 간극이 커질수록 탐지 품질은 저하된다. 더 새로운 생성기, 특이한 학문 분야, 그리고 영어가 아닌 언어는 모두 그 간극을 넓힌다. 이것이 통제된 벤치마크에서 측정된 정확도가 실제 제출물 더미와 마주하면 좀처럼 유지되지 않는 이유의 일부이다.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

상업용 탐지기가 추가하는 것

기관이 실제로 구매하는 도구는 교과서적인 perplexity를 실행하지 않는다. Turnitin, GPTZero, Originality.ai와 그 밖의 도구들은 인간과 기계가 작성한 대규모 라벨링 데이터셋을 바탕으로 지도학습 분류기를 훈련하며, 문체적 특징과 함께 통계적 특징을 사용한다. 분류기가 학습하는 것은 훈련 데이터에서 그 두 집합을 구분하는 무엇이든지이며, 이는 일반적인 "AI writing"보다 더 좁고 더 역사적인 것이다.

훈련 의존성은 조용한 문제이다. 주로 한 세대의 모델 출력으로 훈련된 분류기는 더 새로운 모델, 익숙하지 않은 학문 분야, 그리고 영어가 그 훈련 분포와 닮지 않은 작성자에게 일반화해야 한다. 공급업체는 자체 평가에서 얻은 정확도 수치를 공개하지만, 독립적인 벤치마크에서는 같은 도구에 대해 그 수치보다 일관되게 훨씬 낮은 결과가 나온다.

점수를 과도하게 해석하지 않고 읽기

탐지기 보고서는 보통 백분율로 제시되며, 그 백분율은 흔히 잘못 해석된다. 그것은 문서의 어느 비율이 기계에 의해 작성되었는지를 뜻하지 않는다. 도구에 따라 그것은 분류기의 신뢰도이거나, 어떤 내부 임계값을 넘은 문장들의 비율이며, 공급업체는 종종 어느 쪽인지 분명히 밝히지 않는다. 둘 다 60퍼센트를 보여 주는 두 보고서는 매우 다른 의미일 수 있다.

또한 점수가 작성자와는 아무 관련이 없는 이유로 어떻게 변하는지 아는 것도 중요하다. 짧은 문서는 잡음이 더 크다, 평균이 안정될 만큼 텍스트가 충분하지 않기 때문이다, 그리고 500단어짜리 에세이는 두세 개의 특이한 문장만으로도 크게 흔들릴 수 있다. 인용된 자료도, 도구가 이를 제외하지 않는 한, 점수에 반영된다. 따라서 블록 인용이 많은 문헌고찰은 인용한 내용이 지닌 예측 가능성을 그대로 이어받는다. 표준 용어가 많이 들어간 기술적 문단도 같은 방식으로 작동한다.

경고를 받게 되었다면, 유용한 대응은 지표에 대한 논쟁이 아니라 증거이다. 버전 기록, 초안, 메모, 검색 기록은 모두 작성 과정을 보여 주며, 부정행위 심사위원회가 실제로 평가할 수 있는 것은 바로 그 과정이다. 신중하게 쓴 글과 모델을 가르는 기준점은 누구도 제시할 수 없다.

왜 탐지기는 어떤 모델도 생성하지 않은 글에 경고를 표시하는가

오탐지는 드문 오작동이 아니다. 이는 전형성을 측정하는 데서 직접적으로 비롯된다. 실제로 예측 가능한 글이라면, 누가 작성했는지와 무관하게 예측 가능하다고 점수가 매겨진다.

비원어민 영어 화자가 가장 큰 영향을 받는다. Stanford 연구자들은 탐지기가 비원어민 화자의 에세이 상당수를 기계 생성으로 잘못 분류한 반면, 원어민의 에세이는 올바르게 분류했다고 밝혔다. 그 이유는 악의적이라기보다 기계적이다. 제2언어로 글을 쓰는 작성자는 익숙한 구문과 더 흔한 어휘에 의존하는 경향이 있다. 이는 낮은 perplexity의 정확한 특징이며, 그래서 ESL writers get flagged for writing carefully이다.

학술적 관습도 같은 문제를 일으킨다. 방법론 절은 정형화되어야 한다. 법률 문서, 기술 문서, 임상 보고는 모두 독창적인 표현보다 표준적인 표현을 더 높이 평가한다. 과도한 편집은 이를 더욱 심화시키는데, 초안을 다듬는다는 것은 대개 통계적 서명을 담고 있던 불규칙성을 제거하는 것을 뜻하기 때문이다.

기관들도 이를 알아차렸다. Vanderbilt는 검증할 수 없는 점수에 근거해 조치하기보다 Turnitin의 AI 탐지 기능을 비활성화했고, 다른 대학들은 부정행위 절차에서 해당 수치가 어떻게 사용될 수 있는지 제한해 왔다. 탐지기 점수는 판정이 아니라, 약한 증거 한 조각으로 취급해야 한다.

이것이 자신의 글쓰기에 의미하는 바

기계적 작동 원리에서 따라 나오는 실천적 조언은 특별하지 않으며, 그 어떤 것도 무언가를 속이는 일과 관련이 없다. 문장 길이를 의도적으로 다양하게 하라, 왜냐하면 지나친 균일성이야말로 감지되는 것이기 때문이다. 구체적 세부사항을 유지하라, 실제 수치, 실제 한계, 6주 차에 무엇이 잘못되었는지 같은 것들이다. 일반적인 유능함은 기계가 만든 것으로 점수화되기 쉽고, 구체성은 더 나은 글쓰기이자 더 강한 신호다.

자신만의 표현 방식도 유지하라. 어떤 식으로 말을 풀어가는 습관이 있다면 그대로 두라. 초고를 다듬어 학문 분야의 다른 모든 논문처럼 들리게 만들려는 충동은 perplexity를 낮추는 충동이다.

피해야 할 한 가지가 있다. 일부 도구는 perplexity를 높이기 위해 의도적으로 문법 오류를 넣는다. 이는 지표상으로는 효과가 있지만, 평가되거나 동료 심사를 받는 어떤 글에도 매우 나쁜 생각이다. 의심을 확실성으로 바꾸는 셈이기 때문이다. 목표는 당신의 글로 읽히는 글이지, 의도적으로 손상된 글이 아니다. 그것이 인간 독자를 위한 재작성과 점수를 속이기 위해 텍스트를 망가뜨리는 것 사이의 전부인 차이다.

검은 상자의 말을 그대로 믿기보다 자신의 초고에서 이러한 수치를 직접 보고 싶다면, 그 기저 측정값들은 비밀이 아니다. 무료 텍스트 분석 도구는 당신의 글이 어디에 위치하는지 보여 줄 것이며, 평탄한 구간이 수정할 가치가 있는 문체적 문제인지 스스로 판단할 수 있다.

Frequently Asked Questions

그렇다, 그리고 예측 가능한 일이다. 탐지기는 누가 썼는지가 아니라 텍스트가 통계적으로 얼마나 예측 가능한지를 측정하므로, 진정으로 공식적인 글쓰기는 모두 기계 작성으로 점수가 매겨진다. 독립적인 벤치마크는 일관되게 벤더의 주장보다 낮은 정확도를 보고하며, 여러 대학은 점수의 사용 방식을 제한했다.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI 탐지기는 어떻게 작동하는가? | TextPulse.ai