AI Humanization

AI 탐지 점수를 낮추는 방법

AI 탐지 점수에 실제로 변화를 주는 요소를 순서대로 살펴보는 안내로, 거의 변하지 않는 수정부터 가장 크게 바꾸는 수정까지 다루며, 숫자 자체를 쫓는 것이 잘못된 목표인 이유를 설명한다.

6 min
Ranked list showing how to lower ai score, from synonym swaps to sentence variety to original evidence

학생이 한 단락을 탐지기에 넣어 82퍼센트라는 점수를 보고, 문장의 형태는 하나도 건드리지 않은 채 열두 개의 단어를 동의어로 바꾼 뒤 다시 확인한다. 숫자는 거의 움직이지 않는다. 전체 이야기는 이렇다. 어떤 수정은 거의 아무것도 바꾸지 않고, 어떤 수정은 나머지를 모두 합친 것보다 더 많이 바뀌는데, 그 이유는 소프트웨어를 속이는 것과는 아무 관련이 없다.

이 글은 실제로 중요한 순서에 따라 AI 점수를 낮추는 방법을 다룬다. 어떤 수정은 거의 반응을 보이지 않는지, 어떤 수정은 숫자를 상당히 움직이는지, 그리고 어떤 수정이 가장 크게 움직이는지, 또 그 이유가 무엇인지 설명한다. 또한 이 숫자가 실제로 무엇을 측정하는지도 다룬다. 점수가 낮을수록 바랄 만한 이유는 분명하다. 더 명확하고 더 구체적인 글쓰기이기 때문이다. 그러나 그것 자체를 목표로 삼는 것은 좋지 않다.

Turnitin AI writing report showing 71% detected as AI, the combined share of likely AI-generated and AI-paraphrased text in a submission
이 안내문이 다루는 숫자, Turnitin의 AI writing overview가 제출물을 71% AI로 평가한 결과이며, 자체 경고에 따르면 어떤 판단을 내리기 전에 인간의 검토가 필요하다.

AI 점수는 실제로 무엇을 측정하는가

언어 모델은 다음에 올 가능성이 가장 높은 단어를 반복해서 예측하는 방식으로 글을 쓴다. 그 결과 특정한 통계적 지문이 생긴다. 문장 길이가 서로 비슷하게 모이고, 전환은 안전한 선택지의 작은 집합에서 나오며, 단어 선택은 해당 맥락에서 예상되는 것의 중심에 놓인다. AI 탐지 점수는 분류기가 그 지문과 얼마나 가깝게 일치하는지 추정한 값이지, 누가 그 문장을 입력했는지에 대한 사실이 아니다.

탐지 도구마다 이 수치를 정의하는 방식은 모두 같지 않다. Turnitin은 자사의 백분율이 "Turnitin의 AI writing detection model이 AI가 생성했을 가능성이 있다고 판단한 제출물 내 적격 텍스트의 양을 나타낸다"고 분명히 밝히며, 이것이 확률이나 신뢰도 점수가 아니라 표시된 텍스트의 비율임을 명시한다. 다른 탐지 도구들은 문장 자체에 대한 신뢰도 값에 더 가까운 출력을 내놓는다. 어느 경우든, 이러한 수치의 작동 원리에 대한 완전한 설명은 how AI detectors work에서 읽어볼 만하다. 여기서 중요한 것은 더 단순하다. 이 수치는 언제나 통계적 추정치이며, 아래의 모든 수정은 모델이 읽도록 만들어진 통계를 바꾸는 방식으로 작동할 뿐, 모델이 관여했다는 사실을 숨기는 방식으로 작동하지 않는다.

동의어를 바꿔도 AI 점수는 거의 변하지 않는다

단어를 덜 흔한 동의어로 바꾸어도 분류기가 점수를 매기는 패턴은 거의 달라지지 않는다. 이는 문장의 길이, 절 구조, 리듬을 그대로 유지하기 때문이다. 문장 형태의 균일성을 알아차리도록 학습된 모델은 문장이 enables라고 쓰였는지 allows라고 쓰였는지에 관심이 없다. 대신 연속된 세 문장이 거의 같은 길이로 이어지고 같은 방식으로 시작한다는 점에 주목한다.

평평한 문장은 다음과 같다. "The platform enables users to efficiently accomplish routine tasks without additional training." 이를 단어별로 바꾸면 다음과 같다. "The platform allows users to efficiently complete routine tasks without extra training." 길이도 같고, 절의 순서도 같고, 리듬도 같다. 독자는 약간 다른 단어를 알아차릴 수 있다. 그러나 문단 전체에서 문장 수준의 패턴을 점수화하는 분류기에게는 새로 쓸 만한 정보가 거의 없다.

이것은 고정된 어휘를 수정하는 것에 반대하는 주장이 아니다. facilitate, robust, myriad 같은 단어는 잘라낼 가치가 있는데, 주의 깊은 독자는 그것들을 알아차리고, 무료 AI word cleaner는 몇 초 안에 그 대부분을 찾아내기 때문이다. 이것은 그 작업이 핵심적인 역할을 하리라고 기대하는 것에 반대하는 주장이다. 어휘를 손본 뒤 점수가 거의 변하지 않는다면, 그것은 예상된 결과이지, 그 작업이 실패했다는 신호가 아니다.

자신의 논문을 인간적으로 다듬기

중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.

무료로 시작하기

문장 다양성은 그것을 더 멀리 이동시킨다

모델은 한 번에 하나의 토큰을 예측하며, 세 번째 문장이 두 번째 문장보다 더 짧아야 할 내재적 이유가 없으므로, 그대로 두면 문단은 길이와 형태가 좁은 범위 안에 자리 잡는다. 단일한 단어가 아니라 이러한 규칙성이 더 강한 신호인데, 기계 출력으로 학습된 분류기는 그 패턴을 수천 번 보았기 때문이다.

세 개의 평평한 문장은 다음과 같이 읽힌다. "The results were significant. The findings supported the hypothesis. The data was analyzed using standard methods." 다양성을 위해 재구성하면, 같은 내용은 다음과 같이 읽힌다. "The results were significant, and they supported the hypothesis, though the standard analysis needed a second pass once two of the outlying cases were removed." 이제 하나의 문장이 주장과 그 복잡성을 함께 담고 있으며, 문단 전체에 걸쳐 길이와 절 구조의 실제적인 변이가 나타난다. 이것이 burstiness checker가 불균등성을 점수화할 때 측정하는 것이며, 이 때문에 이 수정은 어휘 손질보다 점수를 더 크게 움직인다.

이 모든 것은 한두 쪽 분량에서는 손으로 하기 어렵지 않다. 문단을 소리 내어 읽고, 길이와 형태가 같은 두세 문장이 연속되는 부분에 표시한 뒤, 그중 하나를 나누거나 둘을 하나로 합치되 쉼표가 실제로 역할을 하도록 하라. 이 절 뒤의 문장 수준 수정은 더 많은 실제 예시와 함께 단계별로 다루어지며, AI text를 humanize하는 방법에 대한 전체 안내에서 확인할 수 있다.

자신의 증거가 AI 점수를 가장 크게 움직인다

언어 모델은 당신의 프로젝트에서 실제로 무슨 일이 일어났는지 알 수 없다. 어떤 연구에 대해 쓰라고 하면, 그것은 같은 주제의 거의 모든 연구에 들어맞는 가장 안전한 표현으로 기본 설정된다. 그것이 모델이 가진 유일한 자료이기 때문이다. 특정 출처에서 나온 특정 주장을 담은 문장은 모델이 프롬프트만으로 만들어 냈을 문장이 아니며, 바로 그 차이가 점수를 가장 크게 움직인다.

일반적인 문장: "The intervention had a positive effect on outcomes for participants." 이것은 수백 편의 연구를 설명할 수 있다. 작성자의 고유한 자료를 사용해 다시 쓴 문장: "출석 기록은 그 효과가 여섯 회를 넘게 참석한 학생들에게서만 유지되었음을 보여 주었고, 원래의 설계는 그 임계값을 예상하지 못했다." 더 길고, 더 구체적이며, 이 연구만을 설명할 수 있다. 같은 프롬프트를 이어 쓰도록 요청받은 기준 모델은 여섯 회 참석이라는 세부 사항을 추측하지 못했을 것이다. 프롬프트 안에는 그것이 존재한다는 संकेत이 전혀 없었기 때문이다.

이것은 또한 어떤 탐지기가 무엇을 보고하든 글쓰기를 가장 크게 개선하는 수정이며, 바로 그 점이 곰곰이 생각해 볼 가치가 있다. 구체적인 수치, 명시된 한계, 의역하지 않고 직접 인용한 출처, 이런 것들은 문단을 읽는 사람에게 더 설득력 있게 만들며, 그것들이 점수도 움직인다는 사실은 목표라기보다 부수 효과에 더 가깝다.

수정점수에 대한 전형적 영향이유
단어를 동의어로 바꾸기작거나 없음문장 길이, 구조, 리듬이 그대로 유지된다
문장 길이와 구조를 다양하게 하기중간에서 큼분류기가 알아차리도록 학습된 균일한 패턴을 깨뜨린다
자신의 증거 또는 주장을 추가하기가장 큼모델이 프롬프트만으로 만들어 낼 방법이 없었던 내용을 도입한다

잘못된 목표를 좇지 않고 AI 점수를 낮추는 방법

위의 모든 수치는 판정이 아니라 추정치이다. Turnitin도 자체 문서에서 이를 분명히 밝히며, AI writing detection이 "may not always be accurate"하고 "should not be used as the sole basis for adverse actions against a student."라고 설명한다. 점수는 저작과 무관한 이유로 변할 수 있고, 사람이 처음부터 쓴 글에서도 그대로 유지될 수 있다. 이 수치를 문장의 작성자가 누구인지에 대한 사실로 취급하는 데서 이 주제에 대한 대부분의 불안이 비롯되며, 그것은 이 수치가 스스로 주장하는 바도 아니다.

또한 점수를 낮추는 것만을 목표로 삼는 것은 그 자체로는 좋지 않다. 수치를 좇다 보면 작성자가 자동화하기 가장 쉬운 수정, 즉 어휘를 손보고 몇 개의 절을 재배열하는 데 치우치게 되고, 가장 중요한 수정은 건너뛰게 된다. 바로 작성자만이 실제로 가진 구체적 내용을 더하는 일이다. 그런 방식으로 얻은 더 낮은 점수라면 가질 만한 가치가 있다.

더 낮은 점수를 좇는 일은 문단을 문체적으로도 잘못된 방향으로 이끌 수 있다. 모든 주장을 지나치게 유보하고, 수식어를 겹겹이 쌓고, 리듬을 끊기 위해서만 존재하는 군더더기 문장을 덧붙이게 된다. 이런 것들은 근본적인 패턴을 고치지 못하며, 오히려 문단을 읽기 더 어렵게 만든다. 실제로 점수를 움직이는 수정, 즉 문장 다양성과 구체적 증거는 글 자체를 더 좋게 만드는 수정이기도 하다. 따라서 수정이 개선이 아니라 채우기처럼 느껴지기 시작할 때 이를 점검하는 데 유용하다.

TextPulse의 AI humanizer는 위의 문장 수준 및 구조적 수정을 전체 문서에 한 번에 적용하고, 그와 같은 신호들로 계산한 추정 Human Score를 보고한다. 이는 어떤 특정 detector도 통과할 것이라는 주장이 아니다. 잘 사용하면 긴 문서에 대한 빠른 1차 검토가 된다. 그러나 실제 작업이 이루어질 때 그 자리에 있지 않았으므로, 점수에 가장 큰 영향을 주는 단 한 가지를 여전히 더할 수는 없다. 그 부분은 여전히 작성자에게 남아 있다.

먼저 두 가지 선행 질문을 정리할 필요가 있다. AI humanizers가 실제로 작동하는지, 그리고 제출할 의도가 있는 작업에 사용해도 안전한지이다.

위의 순서는 마감 전에 제한된 시간을 어디에 쓸지에 대한 우선순위 목록이기도 합니다. 시간이 부족하면 동의어 점검은 건너뛰십시오. 다른 누구도 쓸 수 없었던 세부 사항을 다시 넣는 문단은 건너뛰지 마십시오. 그 편집은 어떤 재작성 소프트웨어도 대신해 줄 수 없는 유일한 수정이기 때문입니다.

XLinkedInFacebook

자주 묻는 질문

자신의 자료, 구체적인 수치, 명시된 한계, 실제로 읽은 출처에 연결된 주장 하나를 추가하는 것이 다른 어떤 단일 수정보다 점수를 더 크게 바꾼다. 이는 언어 모델이 프롬프트만으로는 그 세부 정보를 만들어낼 방법이 없기 때문이다. 그다음은 문장 길이의 다양성이다. 동의어 바꾸기는 가장 적게 변화를 주는데, 문장 구조는 그대로 남기 때문이다. 이 순서는 숫자를 단순히 조작하지 않고 ai score를 낮추는 방법의 핵심이다.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

AI 휴머니제이션 소식을 받아보세요

학술 글쓰기, AI 탐지, 휴머니제이션에 대한 팁을 받은편지함으로 받아보세요.

스팸은 없습니다. 언제든지 구독을 취소할 수 있습니다.