버스티니스란 무엇인가? 왜 균일한 문장은 표시되는가
버스티니스는 평균 문장의 길이가 얼마나 되는지가 아니라, 한 구절에서 문장 길이가 얼마나 넓게 흔들리는지를 측정한다. 이 글은 이 용어의 기원, 분산이 실제로 어떻게 계산되는지, 그리고 language model의 출력이 왜 대체로 좁은 길이 범위에 머무는지를 설명한다.
문단을 소리 내어 읽으면, 어떤 종류의 평탄함은 이름 붙이기 전에 이미 들린다. 모든 문장이 대체로 같은 수의 호흡 안에 떨어지는데, 마치 아무도 끄는 것을 잊은 메트로놈처럼 들린다. 독자는 무엇이 잘못되었는지 말하기 전에 그 패턴을 알아차리고, 생성된 텍스트를 잡아내도록 설계된 탐지기도 바로 그 점을 알아차리도록 만들어졌다. 그 패턴의 이름이 burstiness이며, 이는 어떤 AI 탐지기보다도 오래된 단어다.
그렇다면 탐지기가 말하는 특정한 의미에서 burstiness란 무엇인가? 그것은 문장 길이가 한 구절 안에서 얼마나 넓게 흔들리는지를 나타내는 척도이며, 어떤 고정된 수와 비교하는 것이 아니라 그 구절 자체의 평균에 상대적으로 계산된다. 짧고 간결한 문장들이 길고 구불구불한 문장들 옆에 놓일 때 문단은 bursty하다고 말한다. 모든 문장이 같은 길이에 가깝게 떨어질 때, 그 길이가 6단어이든 26단어이든 문단은 낮은 burstiness를 가진다.
이 통계량은 짧은 문단에서는 손으로도 충분히 계산할 수 있을 만큼 단순하며, 한 번 눈에 들어오면 평평한 페이지는 막연한 인상이 아니라 가리킬 수 있는 수치가 된다. 또한 이 통계량은 우연히 같은 이름을 공유할 뿐인, 더 오래된 무관한 통계량과는 거의 아무 관련이 없다.
burstiness란 무엇인가?
문서 전체에서 문장 길이의 변동성이 있으면 AI 탐지기는 bursty하다고 불린다. AI 탐지기가 사용하는 의미에서의 burstiness는 문서 전체에 걸친 문장 길이의 분산이며, 하나의 수로 표현된다. 즉, 그 길이들의 표준편차를 평균으로 나눈 값이다. 수치가 높다는 것은 문장들이 평균을 중심으로 크게 달라진다는 뜻이다. 수치가 낮다는 것은 평균이 무엇이든 간에 문장들이 그 주변에 촘촘히 모여 있다는 뜻이다.
이 단어 자체는 훨씬 더 오래된 통계 어휘에 속한다. 연구자들은 burstiness를 지진, 질병의 발발, 네트워크 트래픽처럼 시간에 따라 고르게 퍼지기보다 한데 몰리는 모든 현상을 설명하는 데 사용하며, 이러한 분야에서 이를 측정하는 흔한 방법 중 하나는 Fano factor, 즉 어떤 개수의 분산을 그 평균으로 나눈 비율이다.
자연어 처리 자체 안에도 두 번째, 더 오래된 의미가 있으며, 이 의미는 이 글이 다루는 문장 길이 통계와 쉽게 혼동될 수 있다. 1990년대의 말뭉치 언어학자들은 burstiness를 사용해 개별 단어가 어떻게 군집하는지를 설명했다. 문서가 드문 단어를 한 번 언급하면, 그 단어를 다시 언급할 가능성은 첫 번째의 독립적인 출현이 시사하는 것보다 훨씬 높아진다. Kenneth Church와 William Gale는 1995년에 Poisson mixtures에서 이 패턴을 통계적으로 다루었고, 정보 검색 시스템은 반복된 단어가 얼마나 크게 반영되어야 하는지를 가중할 때 여전히 이를 조정한다. 그 통계는 하나의 단어가 반복되는 양상을 추적한다. 이 글의 측정은 다른 것을 추적한다. 어떤 단어가 그 문장을 채우는지와 무관한, 문장 전체의 형태이다.
이 글의 나머지 부분에서는 이 단어를 오직 그 두 번째 의미, 즉 단어의 재등장이 아니라 문장의 형태라는 뜻으로만 사용한다.
왜 평균보다 분산이 더 중요한가
두 문서는 정확히 같은 평균 문장 길이를 가질 수 있지만, 읽는 느낌은 전혀 다를 수 있다. 평균 12단어는 모든 문장이 대략 12단어인 문단에 해당할 수도 있고, 6단어 문장과 18단어 문장이 번갈아 나타나는 문단에 해당할 수도 있으며, 평균만으로는 이 두 문단을 구별할 수 없다. 평균 주변의 분산만이 이를 구분할 수 있다.
통계학자라면 평균만 비교하는 것을 분포의 첫 번째 모멘트 너머를 보지 못한 실패라고 부를 것이다. 탐지기나 신중한 독자도 암묵적으로 두 번째 모멘트까지 확인하고 있다. 중심 주변의 형태는 평균만으로는 결코 드러나지 않기 때문이다.
같은 결과를 보고하는 두 가지 방식을 생각해 보자. 'The intervention reduced symptoms in most participants. The effect was consistent across age groups. The finding supports further investigation into the mechanism.' 세 문장이 각각 8단어에서 9단어 정도로 이어지는 리듬은 거의 분산이 없다. 이제 다음과 비교해 보자. 'Symptoms dropped in most participants. That held up whether the person was twenty-two or sixty-eight, which nobody on the team expected going in, and it is the reason the next study needs to look at mechanism rather than outcome alone.' 주장은 동일하다. 그것을 실어 나르는 리듬은 동일하지 않다.
평균은 두 문단을 동일한 것으로 취급한다. 독자는, 그리고 분명히 탐지기도 그렇지 않다.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
버스티니스가 계산되는 방식
산술은 간단하다. 각 문장의 단어 수를 세고, 그 목록의 표준편차를 구한 다음, 이를 평균으로 나눈다. 예를 들어, 문장 길이가 각각 여덟 단어, 서른한 단어, 열한 단어, 스물네 단어, 아홉 단어인 구절을 보면, 평균의 약 56퍼센트에 해당하는 분산, 즉 큰 버스티니스가 나온다. 문장 길이가 각각 열다섯 단어, 열여섯 단어, 열네 단어, 열일곱 단어, 열다섯 단어인 구절을 보면, 두 구절의 평균 길이가 거의 같더라도 약 7퍼센트의 분산이 나온다.
표준편차만으로는 같은 역할을 할 수 없다. 평균이 문장당 열두 단어인 구절에서의 8단어 분산은 평균이 마흔인 구절에서의 8단어 분산과 다른 의미를 지니므로, 평균으로 나누는 것이야말로 한 구절에서 다음 구절로 수치를 비교 가능하게 만드는 방식이다.
이러한 상대적 틀 때문에 이 통계는 압축된 뉴스 문체와 밀도 높은 이론 문체에 대해 같은 방식으로 작동한다. 짧고 균일한 문장들로 구성된 기술적 절과 짧고 균일한 문장들로 구성된 일상적 문단은 모두 낮은 버스티니스로 나타날 수 있는데, 이는 이 측정이 문장의 절대적 길이를 묻지 않고, 각 문장이 이웃한 문장들의 평균에서 얼마나 떨어져 있는지만 보기 때문이다.
이것은 이 사이트의 free burstiness checker가 붙여넣은 초안에 대해 수행하는 것과 동일한 계산으로, 전체 구절을 하나의 수치로 압축하지 않고 모든 문장을 점으로 표시한다. 그 척도에서 대략 20퍼센트 미만은 촘촘하고 균일한 분포로 읽히고, 대략 45퍼센트 초과는 넓은 분포로 읽히며, 대부분의 편집된 학술 산문은 그 중간 어디쯤에 위치한다.
낮은 분산의 문단이 지면에서 보이는 모습
두 패턴을 나란히 놓으면, 무엇을 봐야 하는지 알고 난 뒤에는 쉽게 구별할 수 있다.
| 특성 | 낮은 변동성 문단 | 높은 변동성 문단 |
|---|---|---|
| 문장 길이 패턴 | 거의 모든 문장이 문단 평균에서 몇 단어 이내에 머문다 | 짧고 끊어진 문장들이 길고, 여러 절로 이루어진 문장들 옆에 놓인다 |
| 소리 내어 읽기 | 강조를 위해 자연스럽게 멈출 곳이 없는, 일정하고 고른 속도 | 강조가 실제로 놓이는 지점을 따라 빨라졌다가 느려지는 리듬 |
| 전형적 원인 | 모델이 한 번에 다음에 올 가능성이 가장 높은 문장을 예측해 낸, 편집되지 않은 출력, 또는 아무도 소리 내어 다시 읽어 보지 않은 초고 | 효과를 위해 문장을 짧게 끊는 작성자, 또는 길이에 걸맞은 내용을 담도록 두 개의 짧은 문장을 하나로 묶는 작성자 |
어느 열도 본질적으로 좋은 글쓰기를 뜻하지는 않는다. 방법론 절에서 다섯 단계를 다섯 개의 짧은 문장으로 나열하는 것은 왼쪽 열처럼 보이도록 되어 있으며, 번호가 매겨진 절차에 길고 구불구불한 문장을 넣는다고 해서 그것이 더 나아지지는 않는다. 이 패턴은 어떤 종류의 글을 보고 있는지 알게 된 뒤에야 비로소 정보가 된다.
왜 균일한 문장이 표시되는가
탐지기는 평탄한 리듬을 신호로 취급한다. 이는 문장들이 본질적으로 의심스럽기 때문이 아니라, 텍스트 생성이 작동하는 방식 때문입니다. AI 탐지기가 실제로 작동하는 방식의 더 넓은 메커니즘은 별도로 다루고 있으며, 간단히 말하면 모델은 한 번에 하나의 토큰을 예측하고, 여기에는 암묵적으로 문장이 끝날 가능성이 높은 시점도 포함된다. 지금까지의 텍스트가 주어지면, 어떤 시점에서든 일부 문장 길이는 다른 길이보다 통계적으로 더 가능성이 높고, 가장 가능성 높은 이어짐을 계속 선택하는 모델은 문서 전체에 걸쳐 문장마다 그와 같은 유력한 길이 근처에 계속 도달하게 된다.
하나의 평탄한 문단만으로는 그 자체로 아무것도 증명하지 못한다. 짧은 절차적 문단은 원래 그렇게 보이도록 되어 있다. 탐지기가 실제로 가중하는 것은 문서 전체에 걸친 패턴이다. 한 문단의 평탄함이 국지적이고 의도적인 선택인지, 아니면 글 전체의 모든 문단에 걸친 리듬인지이다.
단어별 예측 가능성은 관련은 있지만 별개의 측정이며, 이 사이트의 다른 곳에서 그 자체의 기준으로 다루고 있고, 개별 단어 선택을 문장의 형태가 아니라 살펴본다.
이 중 어느 것도 문서가 모델에 의해 생성되었다는 것을 증명하지 않으며, 평탄한 리듬을 그 자체로 결정적이라고 취급하는 것은 단일 perplexity 수치를 결정적이라고 취급하는 것과 같은 실수를 반복하는 것이다. 아무도 소리 내어 읽지 않은 급하게 쓴 초안은 생성된 텍스트만큼이나 쉽게 평탄해질 수 있다. 이것이 TextPulse의 자체 추정 Human Score가 문장 수준의 변동성과 몇 가지 다른 신호를 결합하고, 그중 어느 하나에만 의존하지 않는 이유의 일부이며, 이 사이트의 무료 진단 도구가 개별적으로가 아니라 함께 읽히도록 설계된 이유이기도 하다.
정의보다 더 중요한 것은 뒤따르는 두 가지 질문이다. 탐지기가 여전히 2023년과 같은 방식으로 burstiness에 가중치를 두는지가 하나이고, 자신의 초안에서 그것을 어떻게 높이면서도 문장을 망치지 않을지가 다른 하나이다.
평탄한 문단은 그 뒤에 있는 메커니즘이 보이게 되면 더 이상 수수께끼가 아니다. 그것은 모든 문장이 단 하나의 다음 단어가 하듯 같은 방식으로 만들어질 때, 가장 적은 저항으로 다음에 올 것을 향해 손을 뻗는 과정에서 일어나는 일이다. 그 압력이 이기는지는 작가나 모델이 문장마다 그것에 맞서 되받아치는지에 달려 있다.
Frequently Asked Questions
글쓰기에서 버스티니스란 무엇인가? 이는 한 구절에서 문장 길이가 얼마나 달라지는지를 뜻하며, 문장 길이의 표준편차를 평균으로 나눈 값으로 측정한다. 짧은 문장과 긴 문장 사이의 차이가 큰 구절은 버스티니스가 높다. 모든 문장이 거의 같은 길이에 머무는 구절은 그 길이가 짧든 길든 버스티니스가 낮다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.