글쓰기에서 Perplexity와 Burstiness를 높이는 방법
의도적으로 perplexity와 burstiness를 높이는 일은 대개 더 나은 글쓰기를 뜻한다, 문장 길이를 다양하게 하고, 절 구조를 섞고, 단지 훑어보기에 맞는 말이 아니라 실제로 가장 적절한 단어를 고르는 것이다. 구체적인 전후 예시와 함께, 이것이 언제부터는 글쓰기의 기술이 아니라 나쁜 생각이 되는지도 살펴본다.
burstiness를 높이는 방법을 검색하면, 대부분의 결과는 지름길을 약속한다. 동의어를 바꾸거나, 긴 문장을 무작위로 하나 끼워 넣거나, 혹은 문법 규칙을 일부러 하나 어기는 식이다. 그러나 실제로 수치를 움직이는 것은 그런 것이 아니다. 글에서 perplexity와 burstiness를 높이는 일은 대체로 문장 구조의 문제이며, 신중한 편집자가 이미 실천하고 있는 바로 그 기술을 습관이 아니라 의도적으로 적용하는 데 있다.
이 글은 작동 원리를 설명하는 글이 아니라 실용적인 글이다. burstiness의 공식과 이 용어가 실제로 어디에서 비롯되었는지는 burstiness가 실제로 무엇을 측정하는지에 대한 보조 글에서 다룬다. perplexity도 같은 역할을 하는 별도의 보조 글이 있다. 여기서 이어지는 내용은 기법이다. 두 지표를 더 많이 담아내는 문장을 만드는 구체적인 방법들, 전후 예시, 그리고 이것이 언제 글쓰기 조언의 범위를 벗어나 나쁜 생각이 되는지에 대한 솔직한 설명을 제시한다.
문장 길이를 의도적으로 달리하여 burstiness를 높이는 방법
burstiness는 문장들의 평균 길이가 아니라 문장들 사이의 분산을 추적하므로, 가장 빠른 방법은 한 단락 전체에서 익숙한 한 가지 길이로 흘러가 버리는 대신 그 분산을 의도적으로 넓히는 것이다. 대부분의 초고는 누구도 의도적으로 선택하지 않은 리듬에 안착한다. 열두 단어에서 열여섯 단어 사이의 문장 세 개는 안전하게 느껴지므로, 네 번째와 다섯 번째도 아무도 그렇게 하기로 결정하지 않았는데도 같은 패턴을 따른다.
전: 'The sample size limited statistical power. The results should be interpreted with caution. Future research should address this limitation with larger cohorts.' 세 문장, 각각 여덟 단어에서 열한 단어 사이, 전체에 걸쳐 하나의 문체. 후: 'The sample was little, which limited statistical power in ways worth saying plainly rather than hedging around. That matters. A single larger cohort could shift the effect size enough to change which claims the paper is entitled to make.' 같은 내용이지만, 분산은 완전히 다르다.
목표는 무조건 최대한의 다양성이 아니다. 매 줄마다 마흔 단어짜리 문장과 두 단어짜리 문장을 번갈아 배치한 문단은 리듬이라기보다 틱처럼 읽힌다. 목적은 사람이 설명을 소리 내어 자연스럽게 끊어 말하는 방식에 더 가깝다. 생각을 펼칠 공간이 필요할 때는 더 긴 도입 문장을 쓰고, 그렇지 않을 때는 짧은 문장을 쓴다.
하나를 반복하기보다 절 구조를 섞어라
문단은 단어 수를 달리할 수 있지만, 모든 문장이 같은 방식, 즉 주어, 동사, 목적어, 마침표, 반복으로 만들어지면 평평하게 느껴질 수 있다. Burstiness는 길이만큼이나 구조적 다양성에도 반응한다. 독자, 또는 다음에 올 가능성이 높은 구성을 예측하는 모델은, 몇 개의 문장이 주어로 시작한 뒤에 종속절로 시작하는 문장이나 질문문이 나오면 흐트러지기 때문이다.
이전: 'The intervention reduced anxiety scores. The effect held across age groups. The mechanism remains unclear.' 주어로 시작하는 문장 세 개가 연속으로 이어진다. 이후: 'Anxiety scores dropped after the intervention. Whether that held across every age group took a second look to confirm, and it did. What is still missing is a mechanism that explains why.' 이 두 버전 사이에서 근본적인 발견은 전혀 달라지지 않았다. 달라진 것은 독자가 그 발견에 도달하기 위해 지나가야 하는 구조뿐이다.
이것은 그 자체를 위한 복잡성이 아니다. 앞에 놓인 종속절은 뒤따르는 문장을 실제로 준비해 줄 때에만 제자리를 얻는다. 시간 표지, 조건, 양보가 그 예다. 그것을 정당화할 아무것도 없이 다양성만을 위해 덧붙이면, 같은 구조는 그것이 무엇인지 정확히 드러낸다. 장식이지 구조가 아니다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
예상되는 단어보다 더 구체적인 단어를 선택하라
Perplexity는 단어 수준에서 움직이므로, 위의 문장 길이 조절은 절반의 역할만 한다. 모델은 다음에 올 일반적인 단어에 높은 확률을 부여한다. significant, notable, important, 같은 장르의 다른 수많은 논문이 그 자리에 가져갈 만한 어떤 단어든 마찬가지다. 실제 숫자, 실제 메커니즘, 또는 검토자가 제기한 실제 반론을 명시하는 것은, 단지 무난했을 뿐인 단어보다 모델에 훨씬 더 큰 놀라움을 준다.
Before: 'The findings were major and have important implications for the field.' 심사자가 기대하는 단어들로, 심사자가 기대하는 순서대로 구성된 문장이다. After: 'Three of four cohorts cleared the threshold; the fourth missed it by two points, which the discussion section never explains.' 두 번째 버전만이 이 특정 연구를 설명할 수 있다. 첫 번째는 거의 어떤 분야의 어떤 논문의 끝에도 들어갈 수 있다.
이것은 문장에 불필요한 세부사항을 덧붙이라는 뜻이 아니다. 마감에 쫓기는 초안이 쉽게 끌어오는 일반적 표현으로 매끈하게 바꾸는 대신, 이미 사실이면서 구체적인 세부사항을 그대로 유지하라는 뜻이다. 정확한 수치, 명시된 한계, 특정한 반례는 덜 예측 가능하기 때문에 생성 비용이 더 크지만, 동시에 더 나은 문장이기도 하다.
긴 문장 뒤에 짧은 문장을 두어 여운을 남기라
앞의 두 기법은 문장 단위로 작동한다. 이 기법은 한 문장이 이웃한 문장에 대해 무엇을 하는지에 관한 것이다. 종속절에 수식어를 덧붙이고, 거기에 다시 구체적 세부사항을 얹는 긴 문장은 여지를 만든다. 그 뒤에 곧바로 짧은 문장을 두면, 독자와 분류기가 원래라면 빠져들었을 리듬이 끊긴다.
Before: 'The treatment group showed improvement across three of the four measures tracked, and while the fourth measure didn't reach statistical significance, the trend was directionally consistent with the other three, suggesting the null result there may reflect a power issue rather than a true absence of effect, a possibility the original protocol didn't expect.' 다섯 가지 생각을 담은 한 문장이다. After: 'The treatment group improved on three of four measures. The fourth didn't reach significance, though the trend pointed the same way. That gap was not in the original protocol.' 긴 버전과 짧은 버전은 결국 거의 같은 말을 하지만, 독자가 숨을 고를 여지를 주는 것은 둘 중 하나뿐이다.
문단마다 짧은 문장 하나는 제 몫을 한다. 이런 문장이 몇 개 연달아 나오면 광고 문구에서 빌려온 틱처럼 느껴지기 시작하는데, 세 단어씩 끊어지는 방식은 그 자체로 일종의 획일성이며, 전혀 변화를 주지 않을 때만큼이나 문단을 효과적으로 평평하게 만들 수 있다.
위의 모든 기법이 같은 레버를 당기는 것은 아니다. 어떤 것은 perplexity를 더 크게 움직이고, 어떤 것은 burstiness를 더 크게 움직이며, 몇몇은 둘 다 동시에 움직인다.
| 기법 | 주로 움직이는 것 | 이유 |
|---|---|---|
| 문장 길이의 변화 | Burstiness | 가장 짧은 문장과 가장 긴 문장 사이의 간격을 넓히는데, 이것이 바로 분산 기반 지표가 추적하는 것이다 |
| 절 구조를 섞기 | 둘 다 | 한 문장에서 다음 문장으로 이어질 때 고정된 패턴이 있을 것이라는 기대를 깨뜨린다 |
| 구체적인 단어를 선택하기 | Perplexity | 이름이 붙은 세부 사항은 일반적인 자리표시자보다 모델에 더 큰 놀라움을 요구한다 |
| 긴 문장 뒤에 짧은 문장 두기 | Burstiness | 분산 계산이 포착하도록 설계된 날카로운 대비를 만든다 |
점수를 이기기 위한 글쓰기가 아니라, 읽히기 위한 글쓰기
위의 모든 기법은 그 자체로도 좋은 편집이다. 문장 길이를 변화시키고, 절 구조를 섞고, 안전한 일반화 대신 구체적인 세부 사항을 이름으로 부르는 것, AI 탐지에 관심이 전혀 없는 편집자라도 같은 이유로 같은 수정을 할 것이다. 결과가 더 잘 읽히기 때문이다. 그 겹침은 우연이 아니다. 신중한 독자와 perplexity 계산은 글의 같은 속성에 반응하고 있다, 즉 예상되는 표현으로 공간만 채우는 것이 아니라 실제로 일을 하고 있는 부분이 얼마나 되는가 하는 점이다.
겹침은 목표가 잘 쓰는 것에서 숫자를 이기는 것으로 바뀌는 순간 무너진다. 평균을 올리는 것 말고는 아무 이유 없이 길어진 문장, 일부러 어색하게 만든 구문, 정확함보다 희귀성을 위해 고른 단어, 이 모든 것은 점수를 올리고 글을 더 나쁘게 만든다. 실제로 그것을 채점하거나 검토하는 사람이 어떻게 읽을지를 고려하기도 전에 이미 나쁜 거래다. 탐지기는 또한 방 안의 유일한 독자가 아니며, 하나의 통계만 만족시키도록 쓴 산문은 대체로 다른 누구도 만족시키지 못한다.
TextPulse의 무료 perplexity checker와 무료 burstiness checker는 바로 이런 종류의 자기 점검을 위해 만들어졌다. 초안을 붙여 넣고, 어디에 위치하는지 확인한 뒤, 평탄한 구간이 추정이 아니라 수정할 가치가 있는 문체상의 문제인지 판단하면 된다. TextPulse의 나머지 무료 도구 모음은 같은 질문의 다른 층위, 즉 어휘 선택, 구조, 어조를 다루며, 어느 한 지표만으로 얻는 것보다 더 완전한 읽기를 제공한다.
같은 기법은, 지표를 떼어 놓고 설명하면, 단순히 학술 글쓰기에서 문장 길이를 다양하게 하는 것이다. 이는 왜 AI 텍스트가 아예 탐지되는지라는 더 넓은 질문과 함께 살펴볼 가치가 있으며, 그렇게 해야 수정이 원인에 맞게 유지된다.
이 모든 것은 하나의 숫자가 글 한 편에 대한 전체 진실을 말한다고 믿을 필요가 없으며, 이러한 지표가 AI 탐지기가 실제로 어떻게 작동하는지에 대한 더 완전한 설명 속에서 어떤 위치를 차지하는지를 생각하면 그 점은 더욱 중요하다. 소리 내어 읽었을 때 자연스럽고, 숨 쉴 여지가 있으며, 적어도 하나는 그 자료를 아는 사람만이 쓸 수 있었을 문장이 있는 단락은, 나머지를 대체로 스스로 처리한다.
자주 묻는 질문
burstiness를 높이는 방법은 모든 문장이 비슷한 길이로 수렴하도록 두는 대신, 가장 짧은 문장과 가장 긴 문장 사이의 간격을 넓히는 데 있다. 연속된 세 개의 12단어 문장으로 이루어진 문단은 분산이 거의 없다. 그 패턴을 하나의 짧은 문장과 하나의 더 길고 자세한 문장으로 깨면 수치가 즉시 올라가며, 대개 읽기에도 더 좋다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.