AI 탐지기는 어떻게 작동하는가? Perplexity, Burstiness 및 토큰 확률
AI 탐지기는 독자가 글을 읽듯이 기계가 쓴 글을 인식하지 않는다. 이들은 텍스트가 얼마나 예측 가능한지를 측정한 뒤, 그것을 점수로 바꾼다. 이를 이해하면 기술과 그 한계가 모두 더 잘 이해된다.
귀하의 대학은 제출물을 AI detector로 돌리기 시작했고, 예상하지 못한 수치가 담긴 보고서가 돌아왔습니다. 그것에 이의를 제기하기 전에, 그 수치가 무엇을 의미하는지 아는 것이 도움이 됩니다. AI detector는 어떻게 작동할까요? 그것은 사람이 하듯 기계가 쓴 글을 읽지 않습니다. 언어 모델에 비추어 귀하의 텍스트가 얼마나 예측 가능한지를 측정한 뒤, 그 예측 가능성을 점수로 바꿉니다. 그 과정의 어느 부분도 귀하가 무엇을 의미하는지, 논지가 무엇인지, 또는 실제로 귀하가 그것을 썼는지를 보지 않습니다.
저는 텍스트를 통계적으로 분해하는 도구를 만드는 일을 수년간 해 왔고, 탐지에 대해 이해해야 할 가장 유용한 단 한 가지는 이것입니다. 그것은 기원에 대한 측정이 아니라 전형성에 대한 측정입니다. 이것을 이해하면, 기술과 그 한계가 훨씬 더 잘 이해됩니다.
탐지기가 실제로 측정하는 것
탐지기는 누가 무엇을 썼는지 알지 못합니다. 그것이 가진 것은 언어 모델과 채점 함수입니다. 모델은 귀하의 텍스트를 왼쪽에서 오른쪽으로 읽고, 각 지점에서 다음에 와야 할 단어에 대한 확률 분포를 생성합니다. "the results of the"라는 단어들을 주면, "study"를 가장 높게, "experiment"를 조금 낮게, "marmalade"를 거의 0에 가깝게 순위화할 것입니다.
따라서 탐지기는 귀하의 문서에 하나의 질문을 던집니다. 이 텍스트는 모델이 예상한 단어를 얼마나 자주 선택했는가? 높은 확률의 단어를 계속 선택하는 글은 기계가 만든 것처럼 보입니다. 그것이 바로 텍스트 생성기가 하는 일이기 때문입니다. 모델은 수천 개의 token에 걸쳐, 자기 분포의 상위에서 반복해서 샘플링합니다.
이 때문에 이 범주 전체는 마케팅이 시사하는 것보다 훨씬 불안정한 기반 위에 있습니다. 탐지기는 워터마크나 지문을 찾는 것이 아닙니다. 그것은 귀하의 산문이 통계적으로 놀랍지 않다는 점을 알아차리는 것이며, 놀랍지 않은 산문에는 chatbot 말고도 많은 원인이 있습니다.
perplexity, 모델이 얼마나 놀라는가
핵심 지표는 perplexity라고 하며, 생각보다 이해하기 쉽습니다. 실제로 나타난 각 단어에 대해 모델이 부여한 확률을 취하고, 그 확률들의 로그를 평균한 뒤, 그 결과를 지수화합니다. 그렇게 얻어지는 것은 모델이 귀하의 문서에 얼마나 놀랐는지를 나타내는 하나의 수치입니다. 추측하는 대신 자신의 초안의 perplexity를 확인할 수 있습니다.
낮은 perplexity는 텍스트가 모델이 예상한 방향으로 진행되었음을 뜻합니다. 높은 perplexity는 텍스트가 모델이 예상하지 못한 방향으로 계속 전환되었음을 뜻합니다. 사람의 글은 대체로 더 높은 값에 위치하는 경향이 있는데, 사람은 특이한 구체 명사, 비정상적인 구성, 예상 밖의 곳에서 시작하는 문장을 선택하기 때문입니다. 생성된 텍스트는 대체로 더 낮은 값에 위치하는 경향이 있는데, 디코딩 과정이 바로 그런 움직임을 피하도록 설계되어 있기 때문입니다.
방법 섹션의 시작 방식을 두 가지로 비교해 보십시오. "The results of the study were statistically significant"는 거의 모든 모델이 높은 확신으로 예측할 수 있는 연속입니다. 예상 밖의 정보가 전혀 없기 때문입니다. "Two of the three cohorts drifted before week six, which we had not planned for"는 훨씬 예측하기 어렵습니다. 논문의 나머지 부분으로부터 추측할 수 없는, 구체적이고 다루기 까다로운 정보를 담고 있기 때문입니다. 두 번째 문장은 탐지기에 실제 놀라움을 주며, 바로 그 놀라움이 인간적인 것으로 인식됩니다.
Burstiness: 평균이 아니라 분산
perplexity만으로는 충분하지 않습니다. 문서는 평균적으로는 매우 타당한 수치가 나오더라도, 그 아래에서는 의심스러울 정도로 균일할 수 있기 때문입니다. 중요한 것은 텍스트 전반의 변동이며, burstiness는 바로 그것을 측정합니다. 글이 진행됨에 따라 문장 길이와 문장 수준의 perplexity가 얼마나 크게 흔들리는지를 말합니다. burstiness checker는 그 분포를 직접 보여줍니다.
우리는 확신이 있을 때는 속도를 높이고, 조심스럽게 말할 때는 속도를 늦추며, 그 리듬은 산문 속에도 남습니다. 사람은 덩어리로 씁니다. 한 단락은 여덟 단어로 된 짧은 평서문으로 시작한 뒤, 세 개의 절과 괄호 안의 부연을 담은 서른네 단어짜리 문장으로 이어지고, 다시 간결한 표현으로 돌아갈 수 있습니다.
모델 출력은 이를 안정적으로 수행하지 못한다. 문장은 평균 길이 근처에 군집한다. 문단은 깔끔한 묶음으로 나타난다. 각 섹션은 자기 자신의 제목을 다시 진술하는 것으로 시작한다. 그것은 매끄럽게 읽히지만 점수는 낮다, 문장 간 낮은 분산은 탐지기가 가진 가장 강한 신호 중 하나이기 때문이다. 이를 드러내는 것은 어떤 단일 문장이 아니다. 바로 그 균일성이다.
| 신호 | 측정하는 것 | 기계 생성 텍스트의 점수가 낮은 이유 |
|---|---|---|
| Perplexity | 모델이 사용자의 단어 선택에 얼마나 놀라는지, 문서 전체에 걸쳐 평균한 값 | 디코딩은 설계상 고확률 토큰에서 샘플링하기 때문 |
| Burstiness | 텍스트 전반에서 문장 길이와 예측 가능성이 얼마나 변하는지 | 출력이 흔들리기보다 평균 근처에 군집하기 때문 |
| Token probability | 앞의 두 값이 계산되는, 단어별 가능도 | 개별적으로는 특별하지 않은 선택이 길게 이어지기 때문 |
Token probability와 점수가 어디에서 오는가
이 두 수치는 세 번째 값, 즉 토큰별 로그 가능도에서 만들어진다. 이것이 나머지 모든 것이 계산되는 원재료이다. 일부 도구는 이를 직접 보여 주며, 텍스트가 가장 예측 가능했던 구간을 강조한다. 인터페이스가 무엇을 암시하든, 그 강조 부분은 특정 문장에 대한 비난이 아니다. 그것들은 문서 수준의 수치에 가장 크게 기여한 부분이다.
연구 접근은 단순한 임계값을 넘어섰다. DetectGPT와 그 후속 연구들은 곡률을 살핀다. 즉, 텍스트를 약간 교란한 뒤 생성된 텍스트가 보이는 경향과 같은 패턴으로 가능도가 떨어지는지 확인한다. 다른 방법들은 같은 구절을 두 개의 서로 다른 모델 아래에서 비교하고, 그 불일치를 신호로 사용한다.
한 가지 결과는 평가 대상인 누구에게나 중요하다. 지표는 특정 기준 모델에 대해 계산되므로, 점수는 언제나 그 모델에 대한 상대값이다. 두 탐지기는 같은 문단을 읽고도 완전히 다르게 판단할 수 있으며, 어느 쪽도 오작동하는 것은 아니다. 이들은 서로 다른 기준점을 가지고 같은 질문에 답하고 있는 것이다.
두 번째 결과는 덜 자주 언급된다. 모델은 어떤 구절이 예측 가능하다고 판단하려면 그 구절이 자신이 학습한 것과 닮아 있어야 하므로, 기준 모델과 텍스트를 생성한 대상 사이의 간극이 커질수록 탐지 품질은 저하된다. 더 새로운 생성기, 특이한 학문 분야, 그리고 영어가 아닌 언어는 모두 그 간극을 넓힌다. 이것이 통제된 벤치마크에서 측정된 정확도가 실제 제출물 더미와 마주하면 좀처럼 유지되지 않는 이유의 일부이다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
AI 텍스트가 애초에 탐지되는 이유
언어 모델이 다음 단어를 선택하는 방식
언어 모델을 그대로 두면, 가능한 다음 단어의 전체 순위 목록을 단순히 제시하고 다른 무엇인가가 선택하도록 할 것이다. 실제로는 디코딩 전략이 단어마다 그 선택을 자동으로 수행하며, 어떤 전략이 작동하느냐에 따라 기반 모델이 전혀 변하지 않아도 출력의 모습이 달라진다.
탐욕적 디코딩은 항상 가장 확률이 높은 단일 단어를 선택한다. 이를 수정하기 위해 nucleus sampling을 도입한 논문에서 Ari Holtzman과 공동 저자들은 이 전략을 따르면 텍스트가, 그들 자신의 표현으로, '밋밋하고 이상하게 반복적'이 된다고 관찰했다. 한 번에 여러 개의 유력한 연속을 추적한 뒤 하나로 확정하는 beam search도 같은 문제의 유사한 형태에 부딪힌다.
샘플링 전략은 어느 정도의 무작위성을 다시 도입하지만, 통제된 방식으로 그렇게 한다. temperature는 단어를 추출하기 전에 모델이 자신의 상위 선택지를 얼마나 강하게 선호하는지를 조정한다. 때로 top-p라고도 불리는 nucleus sampling은, 누적 확률이 임계값을 넘는 가장 작은 단어 집합으로 분포를 절단하고 그 집합에서만 추출한다. 원 논문에서는 이를 분포의 신뢰할 수 없는 꼬리가 아니라 동적인 nucleus에서 샘플링하는 것으로 설명한다.
이러한 설정들 가운데 가장 결정론적이지 않은 것조차도, 모델이 이미 가능성이 높다고 판단하는 것들을 중심으로 구성된 후보군에서 여전히 추출한다. 인간의 글쓰기는 어휘를 순위화한 뒤 그 상위 항목에서 뽑는 방식으로 생성된 적이 없으므로, 그 후보군을 끊임없이 넘어선다. 의미는 때로는 목록에 한 번도 오르지 않았던 단어에 존재한다.
어휘의 평탄성: 더 적고, 더 안전한 단어들
어휘의 평탄성은 같은 습관이 단어 수준에서 나타난 형태이다. 문장의 각 지점에서 수십 개의 단어가 그 뒤를 이어갈 수 있지만, 모델의 순위에서는 그중 몇 개가 나머지보다 훨씬 위에 놓이고, 디코딩은 계속 그 몇 개에 도달한다. 이 선택을 문서의 모든 문장에 걸쳐 반복하면, 실제로 사용된 단어의 범위는 비슷한 길이의 인간 글쓰기와 비교할 때 측정 가능하게 좁아진다.
이 효과는 일정하게 유지되기보다 누적된다. 첫 번째 문장에서 가장 높은 순위의 단어를 택하는 모델은 두 번째 문장에서도 가장 높은 순위의 단어가 흔한 경우인 맥락을 형성할 가능성이 더 높다. 흔한 단어는 흔한 단어 뒤에 오는 경향이 있기 때문이다. 인간 저자는 이러한 흐름을 끊임없이 끊어내며, 구체적인 전문 용어, 약간은 특이한 동사, 안전한 근사치가 아니라 실제 대상을 지칭하는 단어를 선택한다. 이러한 차이는 두 버전이 같은 근본 사실을 설명하더라도, 생성된 버전에서 측정 가능하게 더 작은 작업 어휘로 드러난다.
이는 개별 단어 선택의 문제가 아니라 전체 구절의 특성이다. 안전한 단어 하나로는 아무것도 증명되지 않는다. 문장마다 같은 수준의 흔한 어휘를 향해 나아가는 단어들의 페이지가 바로, 탐지기의 단어 수준 신호가 실제로 포착하도록 설계된 것이다.
통사적 균일성: 같은 형태의 반복
통사적 균일성은 문장 수준의 대응물이다. 이는 문장이 얼마나 길게 이어지는가의 문제가 아니다. 한 구절이 얼마나 다양한 문법적 형태를 사용하는가의 문제이다. 즉, 문장이 어떻게 시작되는지, 절이 서로 어떻게 결합되는지, 전환어가 한 생각을 다음 생각과 연결하는 역할을 얼마나 자주 수행하는지의 문제이다. 통계적으로 가능성이 높은 다음 구조를 계속 예측하는 모델은 적은 수의 형태로 수렴한 뒤 그것을 반복한다.
문장은 문장 길이가 서로 달라도, 모든 문장이 같은 주어-동사-보어 구조를 따르거나, 같은 종류의 전환으로 시작하거나, 같은 방식으로 마무리되면 통사적으로 평평하게 읽힐 수 있다. 예측 가능성은 단어 수가 아니라 패턴에 있으며, 이 구분은 burstiness가 실제로 무엇을 측정하는지에 대한 안내에서 더 자세히 다룬다.
| 무엇이 범위를 좁히는가 | 디코딩 최적화 텍스트가 하는 경향이 있는 일 | 인간의 글쓰기가 하는 경향이 있는 일 |
|---|---|---|
| 단어 선택 | 각 단계에서 가장 가능성이 높은 일반적인 단어를 선택한다 | 실제 대상을 지칭하는 구체적이거나 덜 흔한 단어를 찾는다 |
| 문장 시작 | 안전한 전환적 시작 표현의 작은 순환을 반복한다 | 모델이 덜 가능성이 높다고 평가할 시작 표현을 포함해, 문장의 시작 방식을 다양하게 바꾼다 |
| 절 구조 | 한두 가지 선호되는 문법적 형태를 글 전체에서 반복한다 | 문장에 필요한 바에 따라 단순한 구조와 복합적인 구조를 섞는다 |
인간만이 하는 경향이 있는 선택
좁은 범위의 반대편에는 그 범위를 벗어나는 것들이 있다. 실제 사건을 묘사하는 사람은 정확한 수치를 반올림한 수치 대신 선택하고, 잘되지 않은 부분을 인정하며, 생각의 흐름 중간에 문장을 끊어 바로잡고, 전형적이기보다 옳은 단어를 고른다. 이러한 선택 하나하나는 언어 모델의 관점에서 낮은 확률의 토큰이며, 바로 그런 종류의 것을 디코딩은 피하도록 설계되어 있다.
이 모든 것은 구체적이거나 특이한 글쓰기가 모든 표시에서 안전하다는 뜻도 아니고, 유창하고 정확한 글쓰기가 기본적으로 의심스럽다는 뜻도 아니다. 방법론 절, 법률 조항, 또는 많이 편집된 최종 초안은 모델과는 무관한 이유로 좁은 범위에 들어갈 수 있으며, 그렇기 때문에 단일 점수는 그것을 누가 입력했는지에 대한 판정이 아니라 패턴에 대한 설명이다.
자신의 초안이 그 범위에서 어디에 위치하는지 보는 것은 추측하는 것보다 더 유용하다. TextPulse의 무료 perplexity checker와 burstiness checker는 단어 수준의 예측 가능성과 문장 간 리듬을 각각 측정하므로, 평탄한 어휘와 반복되는 문장 형태는 하나로 섞인 숫자가 아니라 서로 다른 두 신호로 드러난다.
이로부터 두 개의 더 좁은 페이지가 이어진다. Turnitin이 AI를 구체적으로 탐지하는 방식이 하나이고, 그 유사도 점수와 AI 점수의 차이가 다른 하나인데, 이 둘은 일상적으로 서로 혼동되기 때문이다.
둘 다 더 넓은 free tools collection 안에 있으며, 단일 숫자를 맹목적으로 믿기보다 그 패턴을 직접 보고 싶은 사람을 위한 것이다.
웹의 얼마만큼이 이제 AI 생성인가?
여러 지표에 따르면, 기계가 생성한 텍스트는 이제 온라인에서 인간이 쓴 텍스트를 능가한다. Amazon Web Services의 한 팀은 웹에서 6.4 billion 문장을 분석하여, 그중 57.1%가 3개 이상의 언어에서 기계 번역본으로 존재했다고 밝혔으며, 그 상당수는 품질이 낮았다. SEO 기업 Graphite의 2025년 분석은 새로 게시된 웹 기사의 절반을 조금 넘는 비율이 AI 생성이라고 밝혔다. Wikipedia도 예외가 아니다. 2024년 8월에 생성된 페이지를 대상으로 한 Princeton 연구는 새로운 영어 문서 약 20개 중 1개가 실질적으로 AI 생성이라고 측정했다.
이 비율은 증가하고 있는데, 이는 모델 출력의 비용이 인간의 글쓰기보다 수십 배에서 수백 배 더 적고 모든 상업적 유인이 같은 방향을 가리키기 때문이다. 이제 일부 플랫폼은 인간 작성자 없이도 운영된다. Chirper는 인간은 지켜보기만 할 수 있고 AI 계정만으로 구성된 소셜 네트워크이며, SocialAI는 모든 답글이 봇인 피드를 판매한다. 포럼, 리뷰 섹션, 댓글 스레드도 더 작은 규모에서 같은 패턴을 보인다.
탐지를 위해서는 이것이 기준 비율을 바꾼다. 2023년에 임의의 웹 텍스트를 읽는 분류기는 그 대부분이 인간이 쓴 것이라고 가정할 수 있었지만, 2026년의 분류기는 그렇게 할 수 없다. 또한 이는 모델 자체에도 되먹임된다. 각 새로운 세대는 선행 세대가 이미 써 놓은 웹을 학습하기 때문이며, 이것이 탐지기가 주목하는 어휘 습관이 사라지기보다 확산되는 한 가지 이유이다.
자신의 글쓰기에서 그 결과는 분명하다. 인간이 쓴 산문은 점점 소수 범주가 되고 있으며, 채점자, 편집자, 독자도 이를 알고 있다. 높아진 의심은 이제 기본값이며, 바로 그렇기 때문에 탐지기가 무엇을 측정할 수 있고 무엇을 측정할 수 없는지 이해하는 것이 중요하다.
상업용 탐지기가 추가로 제공하는 것
기관이 실제로 구매하는 도구는 교과서적인 perplexity를 실행하지 않는다. Turnitin, GPTZero, Originality.ai와 그 밖의 도구들은 인간 텍스트와 기계 텍스트로 라벨링된 대규모 집합에서 지도학습 분류기를 훈련하며, 통계적 특징과 문체적 특징을 함께 사용한다. 분류기가 학습하는 것은 훈련 데이터에서 그 두 묶음을 가르는 무엇이든지이며, 이는 일반적인 "AI writing"보다 더 좁고 더 역사적인 것이다.
훈련 의존성은 조용한 문제이다. 주로 한 세대의 모델 출력으로 훈련된 분류기는 더 새로운 모델, 익숙하지 않은 학문 분야, 그리고 영어가 그 훈련 분포와 닮지 않은 작성자에게 일반화해야 한다. 공급업체는 자체 평가에서 나온 정확도 수치를 공개하지만, 독립적인 벤치마크는 같은 도구에 대해 그 수치보다 훨씬 낮게 나오는 경우가 흔하다.
점수를 과도하게 해석하지 않고 읽기
탐지기 보고서는 보통 백분율로 제시되며, 그 백분율은 흔히 잘못 해석된다. 그것은 문서의 몇 퍼센트가 기계에 의해 작성되었는지를 뜻하지 않는다. 도구에 따라 그것은 분류기의 신뢰도일 수도 있고, 어떤 내부 임계값을 넘은 문장의 비율일 수도 있으며, 공급업체는 종종 어느 쪽인지 분명히 밝히지 않는다. 둘 다 60퍼센트를 보여 주는 두 보고서는 매우 다른 의미일 수 있다.
또한 점수에 영향을 주는 요인 가운데, 작성자와는 아무 관련이 없는 것들도 무엇인지 아는 것이 중요하다. 짧은 문서는 잡음이 더 크다, 평균이 안정될 만큼 텍스트가 충분하지 않기 때문이다. 500단어짜리 에세이는 두세 개의 특이한 문장만으로도 크게 흔들릴 수 있다. 인용된 자료도, 도구가 이를 제외하지 않는 한, 점수에 포함된다. 따라서 블록 인용이 많은 문헌 검토는 인용한 내용이 지닌 예측 가능성을 그대로 이어받는다. 표준 용어가 많이 들어간 기술적 문단도 마찬가지로 작동한다.
만약 경고를 받았다면, 유용한 대응은 지표 자체에 대한 논쟁이 아니라 증거를 제시하는 것이다. 버전 기록, 초안, 메모, 검색 기록은 모두 작성 과정을 보여 주며, 부정행위 심사위원회가 실제로 평가할 수 있는 것은 바로 그 과정이다. 신중하게 쓴 글과 모델을 가르는 기준점은 누구도 제시할 수 없다.
왜 탐지기는 어떤 모델도 생성하지 않은 글에 경고를 표시하는가
오탐은 드문 오작동이 아니다. 그것은 전형성을 측정하는 데서 직접적으로 비롯된다. 실제로 예측 가능한 글이라면, 누가 작성했는지와 무관하게 예측 가능하다고 점수가 매겨진다.
비원어민 영어 작성자가 가장 큰 영향을 받는다. Stanford 연구자들은 탐지기가 비원어민의 에세이 상당 부분을 기계 생성으로 잘못 분류한 반면, 원어민의 에세이는 올바르게 분류했다고 밝혔다. 그 이유는 악의적이라기보다 기계적이다. 제2언어로 글을 쓰는 작성자는 익숙한 표현과 더 흔한 어휘에 의존하는 경향이 있다. 이것이 바로 낮은 perplexity의 전형적인 양상이며, 그래서 ESL 작성자는 신중하게 쓴 글 때문에 경고를 받는다.
학술적 관습도 같은 문제를 일으킨다. 방법론 절은 정형화되어야 한다. 법률 문서, 기술 문서, 임상 보고는 모두 독창적인 표현보다 표준적인 표현을 더 높이 평가한다. 과도한 편집은 이를 더욱 심화시키는데, 초안을 다듬는다는 것은 대개 통계적 특징을 드러내던 불규칙성을 제거하는 것을 뜻하기 때문이다.
기관들도 이를 알아차렸다. Vanderbilt는 검증할 수 없는 점수에 근거해 조치하기보다 Turnitin의 AI 탐지 기능을 비활성화했으며, 다른 대학들도 부정행위 절차에서 이 수치가 사용될 수 있는 방식을 제한했다. 탐지기 점수는 판결이 아니라, 약한 증거 한 조각으로 취급해야 한다.
이것이 자신의 글쓰기에 의미하는 바
기계적 작동 원리에서 따라 나오는 실질적 조언은 특이하지 않으며, 그 어떤 것도 무언가를 속이는 일과는 관련이 없다. 문장 길이를 의도적으로 다양하게 하라, 왜냐하면 균일성이야말로 탐지기에 포착되기 때문이다. 구체적 세부사항을 유지하라, 실제 수치, 실제 한계, 6주차에 무엇이 잘못되었는지. 일반적인 유능함은 기계가 만든 것으로 점수화되며, 구체성은 더 나은 글쓰기이자 더 강한 신호다.
자신만의 표현 방식도 유지하라. 어떤 식으로 말을 풀어가는 습관이 있다면 그대로 두라. 초고를 다듬어 학문 분야의 다른 모든 논문처럼 들리게 만들려는 충동은 perplexity를 낮추는 충동이다.
피해야 할 한 가지가 있다. 일부 도구는 perplexity를 높이기 위해 의도적으로 문법 오류를 넣는다. 이는 지표상으로는 효과가 있지만, 채점되거나 동료 심사를 거치는 어떤 글에도 매우 나쁜 생각이다, 의심을 확실한 것으로 바꾸는 셈이기 때문이다. 목표는 당신의 글로 읽히는 글이지, 의도적으로 훼손된 글이 아니다. 이것이 사람 독자를 위해 다시 쓰는 것과 점수를 속이기 위해 텍스트를 망가뜨리는 것 사이의 전부인 차이다.
검은 상자의 말을 그대로 믿기보다 자신의 초고에서 이러한 수치를 직접 보고 싶다면, 기본 측정값은 비밀이 아니다. 무료 텍스트 분석 도구는 당신의 산문이 어느 위치에 있는지 보여줄 것이며, 평탄한 구간이 수정할 가치가 있는 문체상의 문제인지 스스로 판단할 수 있다.
자주 묻는 질문
그렇고, 그럴 수밖에 없다. 탐지기는 누가 썼는지가 아니라 텍스트가 통계적으로 얼마나 예측 가능한지를 측정하므로, 진정으로 공식적인 글쓰기는 모두 기계가 작성한 것으로 점수가 매겨질 수 있다. 독립적인 벤치마크는 일관되게 벤더의 주장보다 낮은 정확도를 보고하며, 여러 대학은 점수의 사용 방식을 제한했다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.