AI Detection

AI 탐지기는 여전히 perplexity와 burstiness에 의존하는가?

GPTZero는 perplexity와 burstiness를 널리 알려지게 했지만, 2023년 가을 두 개념을 조용히 폐기하고 딥러닝 분류기로 전환했다. 이 글은 무엇이 바뀌었는지, GPTZero와 Turnitin이 오늘날 실제로 무엇을 문서화하는지, 그리고 두 통계가 왜 기계 생성 텍스트가 탐지 가능한지를 여전히 설명하는지 추적한다. 다만 두 벤더가 더 이상 이를 직접 계산하지는 않는다.

최종 수정일 5 min
Is burstiness still used by AI detectors? GPTZero's 2023 shift from a statistical formula to a trained classifier.

오늘날 GPTZero가 AI 글쓰기를 어떻게 탐지하는지 검색하면, 대부분의 결과는 여전히 두 가지 통계, perplexity와 burstiness에 초점을 맞춘다. 이 둘은 GPTZero가 2023년 1월 출시된 지 몇 주 만에 유명해지게 만든 쌍이다. 그러나 GPTZero의 자체 지원 문서는 이제 다른 내용을 말한다. 같은 해 가을에 이 둘 모두의 사용을 중단했다는 것이다.

그렇다면 burstiness는 여전히 AI 탐지기에서 사용되는가? 이 용어를 학계에서 널리 알려진 말로 만든 바로 그 도구에서는 그렇지 않다. GPTZero의 지원 센터는 이제 perplexity나 burstiness를 더 이상 사용하지 않으며, 대신 딥러닝 아키텍처로 전환했다고 분명히 밝힌다. 대부분의 학생이 실제로 접하는 도구인 Turnitin은 애초에 그 방법의 일부로 이 두 용어를 공개한 적이 없다. 이 개념들이 대화에서 사라진 것은 아니다. 실제로 탐지를 수행하는 제품들에서 사라진 것이다.

Burstiness는 여전히 AI 탐지기에서 사용되는가?

아니다, GPTZero에서는 그렇지 않으며, 이름으로도 그렇지 않다. GPTZero의 자체 지원 문서는 이를 직접적으로 말한다. "2023년 가을 기준으로, GPTZero는 AI 탐지를 위해 더 이상 perplexity와 burstiness를 사용하지 않는다. 딥러닝 기반 아키텍처로 이전했기 때문이다." Turnitin의 자체 안내서는 또 다른 방법을 설명하는데, 훈련된 분류기를 사용해 제출물의 구간을 점수화하는 방식이며, 그 문서 어디에도 이 두 용어는 나타나지 않는다. AI 탐지의 첫 번째 물결을 정의했던 이 두 통계는 현재 주요 도구들이 실제로 사용하는 방식이 아니다. 이는 그것들이 완전히 버려졌다고 말하는 것보다 더 좁은 주장이다. GPTZero의 자체 설명문은 여전히 그것들을 모델에 입력되는 일곱 가지 지표 가운데 하나로 포함한다. 그것들은 측정값으로서의 지위를 잃지 않은 채 방법으로서의 지위를 잃었고, 이 두 주장 사이의 차이가 바로 이 질문의 핵심 대부분을 이룬다.

2023년 가을에 무엇이 바뀌었는가

두 용어는 결코 생소한 것이 아니었다. GPTZero의 초기 설명문 자체는 perplexity를 "문서에 나타난 것과 정확히 같은 단어 집합을 AI 모델이 선택했을 가능성을 측정하는 지표"로, burstiness를 "문서 전체에서 글쓰기 패턴과 텍스트 perplexity가 얼마나 변하는지를 측정하는 지표"로 정의했으며, 이는 단순한 문장 길이의 개수가 아니라 문서 수준의 통계이다. 이 두 정의는 지금도 GPTZero의 사이트에 게시되어 있다. 달라진 것은 탐지기가 실제로 실행하는 것이 이 둘 가운데 무엇인가이다.

"Migrated to a deep-learning based architecture"는 마케팅 문구가 아니라 구체적인 주장이며, 실제로 종류의 변화를 설명한다. perplexity 점수는 공식에서 직접 계산된다. 즉, 텍스트를 기준 언어 모델에 통과시키고, 로그 확률을 평균한 뒤, 그 결과를 지수화한다. 반면 deep-learning 분류기는 대신 학습된다. 즉, 대량의 인간 작성 예시와 AI 작성 예시를 보여 주면서, 훈련 데이터에서 두 집합을 가르는 특징들의 어떤 조합이든 스스로 학습하도록 한다. 두 번째 접근법에서는 아무도 규칙을 손으로 쓰지 않는다. 모델이 그것을 찾아낸다.

이전에 사용되던 두 용어에 대한 완전한 설명은 이 사이트의 다른 곳에 있다. perplexity가 실제로 무엇을 측정하는지burstiness가 실제로 무엇을 측정하는지는 각각 그 작동 원리를 공식까지 포함해 자세히 다룬다. 이 글은 오늘날 탐지기가 실제로 실행하는 것이 이 둘 가운데 어느 것인지에만 한정한다.

GPTZero와 Turnitin이 오늘 실제로 문서화하는 것

제품에 포함되어 제공되는 내용을 설명하는 현재 GPTZero 기술 페이지는, 회사가 "웹, 교육, 그리고 다양한 LLMs에서 생성된 AI 텍스트 데이터셋으로 학습된 end-to-end deep learning 접근법"을 사용하며, 그 안에서 "문장별 분류 모델이 텍스트가 AI에 의해 작성되었을 확률과 신뢰도를 결정한다"고 밝힌다. perplexity와 burstiness는 이 페이지 어디에도 나타나지 않는다. 구성 요소로도, 이전 기능으로도, 각주로도 나타나지 않는다.

Turnitin의 문서는 애초에 어느 용어를 중심으로 만들어진 적이 없었다. 해당 안내서는 수백 단어로 나뉜 제출물을 설명하며, 각 청크는 훈련된 모델에 의해 점수가 매겨지고, 청크 점수는 보고서에 표시되는 하나의 백분율로 평균화된다. 이는 텍스트 구간에 대해 작동하는 지도 학습 분류기이며, GPTZero가 채택한 것과 같은 계열의 방법이지, perplexity 계산도 아니고 burstiness 계산을 다른 이름으로 부른 것도 아니다.

이 변화는 나란히 놓고 보면 가장 쉽게 보인다.

초기 설명 자료가 제시한 내용(2023)현재 문서가 설명하는 내용
GPTZero참조 모델에 대해 점수가 매겨지는 perplexity와 burstiness문장 단위로 작동하는 딥러닝 분류기가 확률과 신뢰도 점수를 출력함
Turnitin공개된 적 없음, 해당 용어는 Turnitin의 자체 자료 어디에도 나타나지 않음수백 단어의 청크를 훈련된 분류기가 점수화하고, 이를 하나의 백분율로 평균화함

자신의 논문을 인간적으로 다듬기

중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.

무료로 시작하기

왜 이 개념들이 여전히 탐지 가능성을 설명하는가

이 모든 것은 perplexity와 burstiness가 틀렸다는 뜻이 아니라, 현재의 메커니즘을 설명하는 방식으로는 구식이라는 뜻일 뿐이다. 두 개념은 언제나 실제로 존재하는 어떤 것을 설명하고 있었다. 즉, 모델이 가장 높은 확률로 이어질 가능성이 큰 다음 표현 쪽으로 샘플링하여 생성한 텍스트는 사람이 처음부터 직접 쓴 텍스트보다 단어 단위로 더 예측 가능해지는 경향이 있으며, 한 문장에서 다음 문장으로 갈수록 변동이 더 적은 경향이 있다. 이러한 근본적인 규칙성은 공급업체가 탐지기의 구조를 바꾸었다고 해서 달라지지 않았다. 달라진 것은 탐지기가 그것을 찾아가는 방식이다.

훈련된 분류기는 perplexity나 burstiness를 명시적으로 찾도록 요청받지 않는다. 오히려 그것은 인간 텍스트와 기계 텍스트 사이의 동일한 기본적 구분에 대해 훈련되는데, 바로 그 두 통계가 포착하도록 설계된 것이 그것이다. 그리고 두 묶음을 구별하도록 훈련된 분류기가 바로 그 규칙성, 즉 두 집단 사이에서 가장 신뢰할 수 있는 차이 가운데 하나에 정확히 주목하지 않을 것이라고 보기는 매우 어렵다. 이것은 분류기가 왜 작동할 가능성이 높은지에 대한 추론이지, 공개된 특징 목록에 대한 주장과는 다르며, 이 둘은 구분되어야 한다.

독립적인 연구는, 그 기저 통계가 어떤 단일 업체의 제품 밖에서도 여전히 유효하다는 생각을 뒷받침한다. DetectGPT는 2023년에 발표된 학술적 zero-shot 방법으로, perplexity의 가까운 친척에 해당하는 지표, 즉 모델의 로그 확률 함수가 한 구절 주변에서 얼마나 급하게 굽는지를 살펴보고, 레이블이 붙은 예시로 분류기를 전혀 훈련하지 않은 채 한 벤치마크에서 0.95 AUROC를 달성한다. 이는 이전의 최선 zero-shot 기준선인 0.81보다 높은 수치이다. 핵심 아이디어, 즉 기계 생성 텍스트가 모델 자신의 확률 공간 안에서 통계적으로 구별되는 영역에 놓인다는 생각은 여전히 활발한 연구 주제이다. 다만 그것은 GPTZero가 사용자에게 제공하는 방식이 아니다.

왜 인터넷의 많은 부분이 여전히 이것을 잘못 이해하는가

AI 탐지가 어떻게 작동하는지에 대한 대부분의 출판된 설명은 GPTZero가 2023년 1월에 출시되었을 때 또는 그 직후에 작성되었다. 당시 perplexity와 burstiness는 회사가 직접 제시한 유일한 공개적 설명 틀이었다. 그 초기 설명 페이지들은 오늘날에도 여전히 공개되어 있다. 2023년 가을의 폐지 공지는 그것들에 통합되어 있지 않고 별도의 지원 페이지에 놓여 있으므로, 첫 페이지를 읽고 더 이상 조사하지 않은 작성자라면 그 방법이 1년이 채 지나지 않아 바뀌었다는 사실을 알 이유가 없었을 것이다.

2026년에 유통되는 제3자 탐지기 리뷰는 GPTZero가 여전히 더 큰 시스템 안의 여러 계층 중 하나로서 perplexity와 burstiness를 사용한다고 주장한다. 그 주장은 GPTZero의 현재 기술 페이지와 지원 문서와 직접적으로 충돌하며, GPTZero의 자체 사이트 어디에도 이를 뒷받침하는 내용은 없다. 자기 제품을 설명하는 회사의 진술은, 그 제품에 대한 검증되지 않은 제3자 주장보다 여전히 우선한다. 다만 공급업체 문서도 틀릴 수 있다. 이 글은 더 오래된 이야기를 되풀이하는 리뷰가 아니라 GPTZero의 자체 페이지를 따른다.

이것이 글쓰기 방식에 대해 의미하는 바

burstiness를 중심으로 구성된 실천적 지침은 그 단어가 GPTZero의 자체 자료에서 사라졌다는 이유만으로 쓸모없어지지 않았다. 의도적으로 문장 길이를 다양하게 하는 일은 여전히, 기계적으로 보면, 분류기가 매우 높은 확률로 감지하도록 학습되었을 동일한 통계적 균일성을 피하자는 주장이다. 내부적으로 그 신호를 무엇이라 부르든 상관없다. 이를 설명하는 어휘는 바뀌었지만, 그 근본적인 조언은 공급업체의 구조 변경 이후에도 남아 있었다.

이 글의 주장까지 포함해, 누구의 말을 그대로 믿을 필요는 없다. TextPulse의 무료 perplexity 검사기와 더 넓은 무료 도구 모음을 사용하면, 어떤 세대의 탐지기든 작동하기 전에 자신의 초안이 어디에 위치하는지 확인할 수 있다.

그 결과가 자신의 글로 돌아가게 만든다면, 실천적 후속 조치는 burstiness를 의도적으로 높이는 것학술 문단 전체에서 문장 길이를 다양하게 하는 것이다. 이는 지표를 쓰지 않고 같은 일을 설명한 것이다.

탐지기가 작동하는 메커니즘은 계속 바뀔 것이다. GPTZero는 이미 한 번 그것을 바꿨다. 변하지 않는 것은 이 사이트의 AI 탐지기가 실제로 어떻게 작동하는지에 대한 안내에서 자세히 다루는 실제 질문이다. 즉, 예측 가능한 글쓰기가 기계가 쓴 글쓰기와 같은 것인지, 특정 연도에 어떤 공식이 유행하든 상관없이 그렇다는 문제이다.

XLinkedInFacebook

자주 묻는 질문

burstiness는 여전히 AI 탐지기에 사용되는가? GPTZero에서는 그렇지 않으며, 그 명칭으로도 사용되지 않는다. GPTZero의 자체 지원 문서는 2023년 가을부터 탐지를 위해 perplexity와 burstiness 사용을 중단했다고 밝히며, 이는 딥러닝 기반 아키텍처로 전환한 뒤의 일이다. Turnitin은 두 용어를 방법의 일부로 공개한 적이 없고, 두 회사 모두 현재는 학습된 분류기를 설명한다.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI 휴머니제이션 소식을 받아보세요

학술 글쓰기, AI 탐지, 휴머니제이션에 대한 팁을 받은편지함으로 받아보세요.

스팸은 없습니다. 언제든지 구독을 취소할 수 있습니다.