ZeroGPT는 정확한가?
ZeroGPT의 자체 FAQ는 내부 테스트에서 98퍼센트에 가까운 비율을 주장하며, 별도로 공식적 문체의 글은 누가 썼는지와 무관하게 AI로 읽힐 수 있다고 인정한다. 여기에는 회사가 그 방법에 대해 무엇을 밝히는지, 이 정확한 제품에 대한 독립적 테스트에서 무엇이 발견되었는지, 그리고 무료 점수가 실제로 무엇에 유용한지가 제시된다.
ZeroGPT 정확도는, 회사가 현재 스스로 주장하는 바에 따르면, "내부 평가에서 >98%를 향해 나아가는" 비율이며, 회사는 이 수치가 외부 연구소가 아니라 자신들이 자체적으로 수행한 시험에서 나온 것임을 인정한다. 이 단 하나의 단서, 내부라는 표현만으로도, 독자는 어떤 무료 탐지기의 백분율을 확정된 사실로 받아들이기 전에 필요한 대부분의 판단 근거를 얻게 된다.
ZeroGPT는 가장 많이 사용되는 무료 AI 탐지기 가운데 하나인데, 주된 이유는 비용이 들지 않고 몇 초 안에 답을 돌려주기 때문이다. AI 탐지기 전반에서 나타나는 공급업체의 주장과 독립적 시험 사이의 간극이 여기서도 그대로 나타난다. 이하에서는 회사가 현재 자사 정확도와 방법에 대해 무엇을 말하는지, 그 방법이 실제로 무엇을 측정하는 것처럼 보이는지, 그리고 이러한 도구가 학술 독자가 제출하는 유형의 글에서 왜 특정하고 예측 가능한 방식으로 오작동하는지 설명한다.

회사에 따르면 ZeroGPT 정확도는 무엇인가?
ZeroGPT의 자체 FAQ는 회사가 "업계 최고 수준의 정확도를 제공하며, 최고 수준의 성능을 유지하기 위해 지속적으로 개선되고 있고, 내부 평가에서 >98%를 향해 나아가고 있다"고 밝힌다. 이는 회사가 자사 제품에 대해 스스로 제기하는 주장으로, 회사 자신이 시험한 것이며, 문구 자체에 실제로 완곡한 표현이 포함되어 있다. "pushing toward"라는 표현은 어떤 수치에 도달해 유지하고 있다는 말과 같지 않으며, "internal evaluations"는 외부 제3자가 일치하는 수치를 발표하지 않았음을 뜻한다. 페이지 어디에도 그 내부 시험 집합의 규모, 포함된 내용, 또는 회사 외부의 누가 방법론을 검토했는지는 적혀 있지 않다.
회사는 안정적인 결과를 위해 최소 150에서 200단어의 텍스트를 권장하며, 500에서 1,000단어 이상이면 신뢰성이 더 향상된다고 말하고, 매우 짧거나 크게 편집된 발췌문은 "carry fewer signals."라고 직접 밝힌다. 이 단 하나의 고지는 헤드라인의 퍼센트보다 더 중요하다. 이는 점수가 입력이 얼마나 길고 손대지 않았는지에 따라 얼마나 신뢰할 수 있는지를 보여 주는 것일 뿐이라는, 공급자 자신의 인정이며, 실제 제출물은 항상 그 조건을 충족하지는 않는다.
ZeroGPT는 실제로 어떤 방법을 사용하고 있는가?
ZeroGPT는 그 기반 시스템을 DeepAnalyse라고 부르며, 자체 사이트에서는 이를 "multi-stage methodology designed to optimize accuracy while minimizing false positives and negatives"라고 설명하고, 텍스트를 "from the macro level to the micro one."으로 읽는다고 한다. FAQ는 그 브랜드명 아래에서 더 구체적인 내용을 설명하는데, "token patterns, burstiness, entropy, and ensemble classifier features trained on mixed datasets."의 분석이라고 적고 있다.
Burstiness와 entropy는 ZeroGPT에만 고유한 것이 아니다. 그것들은 같은 통계적 특성, 즉 문장 길이와 리듬이 얼마나 달라지는지, 그리고 다음 단어가 얼마나 예측 가능한지를 뜻하며, TextPulse의 how AI detectors work에 대한 자체 설명이 이 도구 범주 전체의 일반적 메커니즘으로 다루는 내용과 같다. free perplexity checker는 그 동일한 기반 수치를 직접 보여 주며, 작성자가 어떤 단일 공급자의 퍼센트를 먼저 신뢰해야 하는지 묻지 않는다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
왜 학술 글쓰기는 이러한 탐지기를 쉽게 혼란시키는가?
ZeroGPT FAQ는 이를 다음과 같이 설명한다. "highly polished, formulaic, or low-entropy writing can resemble AI." 학술 산문은 매우 다듬어지고, 정형화되며, low-entropy인 글쓰기를 위해 설계된다. 방법론 절, 문헌 검토, 형식적인 자기소개서는 모두 관습적인 표현을 창의적인 표현보다 더 선호하는데, 이는 관습이야말로 문서가 독자에게 우선적으로 유용하게 되는 조건이기 때문이다. 그리고 바로 그 관습이 공급자 자신의 고지에서 위험 요소로 지목한 low-entropy 패턴이다.
독립적인 동료 심사 검증 결과는 이 실패 양상이 왜 어떤 작성자들에게는 다른 작성자들보다 더 강하게 나타나는지 보여준다. 2023년 Stanford 연구는 널리 사용되는 탐지기 7개를, 그중 ZeroGPT를 포함하여, 비원어민 영어 화자가 작성한 실제 TOEFL 에세이 91편과 미국 8학년 학생이 작성한 에세이 88편에 적용했다. ZeroGPT는 TOEFL 에세이의 48 percent를 AI-generated로 표시했지만, 8학년 에세이는 0 percent를 표시했다. 이는 그 연구에서 모든 탐지기가 보인 것과 같은 방향의 오류이며, 다만 크기만 달랐다.
이 격차는 ZeroGPT에만 고유한 것이 아니며, 이에 대해 새로운 정보도 아니다. 이는 탐지기 산업 전반에서 문서화된 동일한 비원어민 작성자 편향 패턴이며, TextPulse의 AI detectors가 비원어민 화자에게 편향되는 이유에 대한 자체 페이지에서 더 자세히 다루고 있다. 이 격차가 무료 소비자 도구에 대해 구체적으로 보여주는 것은, 낮은 엔트로피의 글쓰기는 기계가 만든 것으로 읽힌다는 판매자의 자체 공개 한계가 가설이 아니라는 점이다. 동료 심사 검증은 회사의 현재 FAQ가 그 메커니즘을 자기 말로 명명하기 몇 년 전에, 바로 이 제품에서 그것이 실제로 일어나는 것을 포착했다.
무료 탐지기 점수는 하나의 문서에 대해 무엇인가를 증명할 수 있는가?
그 자체로는 그렇지 않다. ZeroGPT 퍼센티지는 어느 방향으로도 특정 문서에 관한 어떤 것의 증거도 아니다. 그것은 회사가 회사 밖의 누구도 확인할 수 있는 형식으로 공개하지 않은 내부 검증에 기반한 하나의 모델 추정치이며, 길이, 편집 이력, 장르가 모두 읽기 방식에 영향을 주는 글쓰기에 적용된다. 이 점은 판매자의 자체 FAQ도 이미 인정하고 있다. 하나의 무료 점수를 판정으로 취급하는 것은, 그 점수를 제공하는 회사가 그 점수에 대해 주장하는 것보다 더 많은 것을 요구하는 것이다.
점수가 진정으로 유용한 경우는 더 좁고 평범합니다. 즉, 초안이 현재 어디에 위치하는지에 대한 빠르고 비용이 들지 않는 읽기이며, 유료 기관용 도구도 수행하는 것과 같은 종류의 통계적 측정에 대한 것입니다, 다른 사람이 그것을 보기 전에 말입니다. TextPulse의 무료 도구는 그와 같은 영역을 직접 다루며, 작성자가 여러 무료 탐지기의 점수 중 어느 것을 먼저 신뢰해야 할지 추측하도록 요구하지 않습니다.
정확도 수치는 오류가 누구에게 돌아가는지와 무엇이 그것을 유발하는지를 가립니다. a, an and the를 언제 사용해야 하는지를 아는 것은 표시를 유발하는 패턴 중 하나를 제거하며, 거짓 양성이 실제로 무엇을 의미하는지는 별도로 설명됩니다.
이 모든 것이 ZeroGPT의 수치를 무의미하게 만들지는 않으며, 이 모든 것이 그 수치만으로 충분하게 만들지도 않습니다. 점수는 시작 추정치이며, 회사가 개요 수준으로만 설명했고 외부 테스트에 공개하지 않은 방법으로 산출된 것입니다. 또한 그 결과는 장르만으로도 관련된 누구도 잘못을 저지르기 전에 달라질 수 있는 글에 대한 것입니다. 그 FAQ 페이지에서 가장 많은 정보를 담고 있는 두 단어는 백분율이 아닙니다. 그것은 바로 옆에 붙어 있는 완화 표현들입니다. internal, and pushing toward. 무료 점수는 초안에 대한 대화를 시작하는 출발점이지, 그 대화의 종결 논거가 아닙니다.
우리 자체 연구가 밝혀낸 것
TextPulse Research의 탐지기 일치도 연구에서는 9개의 상용 AI 탐지기가 동일한 90개의 학술 텍스트를 평가했습니다. 그중 하나는 455단어짜리 하이브리드 텍스트로, 사람이 쓴 서두와 결말 사이에 168단어의 AI 생성 중간 부분이 끼어 있습니다. ZeroGPT는 이 텍스트를 7.6% AI로 판정했지만, 같은 문장에 대한 다른 도구들의 판정은 0%에서 95.7%까지 갈렸습니다. 전체 논문, 말뭉치, 도구별 점수 행렬은 TextPulse Research에서 공개되어 있습니다.

자주 묻는 질문
ZeroGPT 정확도는 회사의 현재 자체 주장에 따르면, "내부 평가에서 >98%를 향해 가는 비율"에 이른다. 그 수치는 외부 연구소가 아니라 회사가 자사 제품에 대해 수행한 테스트에서 나온 것이며, 판매자의 FAQ는 별도로 매우 다듬어졌거나 공식적인 글은 누가 썼는지와 무관하게 AI 생성으로 읽힐 수 있다고 밝힌다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.