Winston AI 리뷰: 99.98% 정확도 주장과 증거
Winston AI는 탐지기 업계에서 가장 높은 자체 주장 수치인 99.98% 정확도를 광고하며, 이는 회사가 공개한 적 없는 내부 테스트 세트에서 측정된 것이다. 동료 심사를 거친 RAID 벤치마크는 전체 정확도를 고정된 5% 오탐률에서 71%로 제시했으며, 이는 테스트된 4개의 상용 탐지기 중 여전히 2위였다. 여기서는 각 수치가 실제로 무엇을 측정하는지, 그리고 이 도구가 실제로 누구에게 적합한지를 살펴본다.
Winston AI는 99.98%의 정확도를 광고하며, 이는 주류 AI 탐지기 가운데 가장 높은 자체 주장 수치이다. 이 수치는 회사 홈페이지에서 "The Most Trusted AI Detector"라는 문구 옆에 제시되어 있으며, 외부 연구소가 아니라 회사 자체의 내부 테스트에서 나온 것이다. 그 수치와 함께 방법론, 테스트 세트 크기, 인간 대 AI 샘플 비율, 또는 작동 임계값은 공개되지 않는다. 주장과 그 문서화 사이의 이러한 간극은 이 도구에 대해 주의 깊은 독자가 가장 먼저 알아야 할 점이다.
두 번째로, Winston은 실제로 외부 기관에 의해 테스트되었으며, 이는 일부 탐지기들이 말할 수 없는 점보다 낫다. ACL 2024에서 발표된 동료 심사 연구인 RAID 벤치마크는 약 6.2 million개의 기계 생성 텍스트를 대상으로 Winston을 시험했고, 거짓 양성률을 5%로 고정했을 때 전체 정확도 71.0%를 측정했다. 이는 99.98%와는 매우 거리가 멀다. 또한 이는 테스트된 네 개의 상용 탐지기 가운데 Winston을 두 번째로 놓았으며, GPTZero와 ZeroGPT보다 앞섰다. 이 두 사실은 모두 중요하며, 어느 하나도 다른 하나를 무효화하지 않는다.
이어서 살펴볼 내용은 Winston이 무엇이며 누구를 위해 만들어졌는지, 판매자가 무엇을 주장하는지, 99.98%의 자체 벤치마크가 통계적으로 무엇을 의미할 수 있고 무엇을 의미할 수 없는지, 그리고 독립적인 수치가 실제로 무엇을 보여주는지이다.
Winston AI는 무엇이며 누가 사용하는가?
Winston AI는 교육자와 콘텐츠 출판사를 정면으로 겨냥한 유료 구독형 탐지기이다. 그 기능 목록은 교사의 작업 흐름처럼 읽힌다. 회사 사이트는 스캔한 문서, 사진, 필기에서 텍스트를 추출하는 OCR, 지원 플랫폼 가운데 하나로 나열된 Google Classroom 연동, AI 탐지와 함께 제공되는 표절 검사기, 그리고 제출물을 묶음으로 관리하기 위한 문서 정리를 설명한다. 판매자는 이것이 ChatGPT, Gemini, Claude, LLaMA "and much more"의 출력을 탐지한다고 밝힌다.
인터페이스에서 가장 두드러진 부분은 문장별 출력이다. Winston은 단일한 백분율만 반환하는 대신, AI prediction map이라고 부르는 것을 생성한다. 이는 문서의 어느 부분이 기계 생성으로 읽히는지를 문장 단위로 색상으로 구분해 평가한 것이다. 교육자에게는 이 지도가 단순한 점수보다 더 유용한데, 도구의 의심이 어디에 집중되어 있는지를 보여주기 때문이다. 또한 과도하게 해석하기 쉽다는 점도 있는데, 이는 아래에서 다룬다.

회사는 무엇을 주장하는가?
Winston AI의 홈페이지에 있는 핵심 주장은 "99.98% Accurate."이다. 이 글을 쓰는 시점에서, 그 수치를 제시하는 페이지는 시험 말뭉치가 어떻게 구성되었는지, 몇 개의 샘플을 포함했는지, 인간 텍스트와 AI 텍스트의 비율이 어떠했는지, 또는 그 수치를 측정할 때 탐지기의 결정 임계값이 무엇으로 설정되었는지를 공개하지 않는다. 이는 이 업계에서 특별한 일이 아니다. 벤더의 정확도 주장과 독립적 증거 사이의 같은 격차는 시장에 있는 거의 모든 탐지기에 걸쳐 나타난다. Winston의 주장은 그저 누구보다도 큰 숫자를 붙여 놓았다는 점이 다를 뿐이다.
99.98%의 자체 벤치마크는 실제로 무엇을 의미할 수 있는가?
잠시 산술을 진지하게 받아들여 보자. 99.98%의 정확도는 10,000개 샘플당 2개의 오류를 뜻한다. 이 수치를 측정하려면, 회사는 각 텍스트의 실제 출처가 확실하게 알려진, 적어도 수만 개의 문서로 이루어진 라벨링된 시험 집합이 필요하다. 그런 다음 그 수치는 오직 그 말뭉치에서의 성능만을 설명한다. 즉, 그 AI 모델들, 그 프롬프트들, 그 장르들, 그 텍스트 길이, 그리고 하나의 선택된 임계값에서의 성능이다.
그 중 어느 것도 악의적 의도를 요구하지 않는다. 인기 있는 chat models가 생성한 에세이로 학습된 detector를, 다시 인기 있는 chat models가 생성한 에세이로 이루어진 코퍼스에서 시험하면, 실제로 상한에 가까운 점수가 나올 수 있다. 문제는 전이 가능성이다. 입력 텍스트가 다른 model, 다른 샘플링 전략, 또는 자연스러운 문체가 유난히 균일한 작성자에게서 오는 순간, benchmark가 측정된 코퍼스는 더 이상 판단되는 텍스트를 설명하지 못한다. 내부 benchmark는 결과에 가장 강한 이해관계를 가진 당사자가 자기에게 유리한 조건을 스스로 정해 수행하는 통제된 실험이다. 그것은 증거이지만, 가장 약한 종류의 증거이며, 방법론이 빠져 있다는 것은 회사 밖의 누구도 그것을 확인할 수 없다는 뜻이다.
독립적 시험은 무엇을 보여 주는가?
Winston을 포함하는 가장 엄격한 공개 시험은 RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors이며, ACL 2024에서 발표된 Dugan과 동료들의 동료 심사 연구이다. RAID는 11개의 language models, 8개의 writing domains, 4개의 decoding strategies, 11개의 adversarial attacks에 걸친 약 6.2 million generations을 대상으로, 4개의 상용 제품을 포함한 12개의 detector를 평가했으며, 모든 detector를 동일한 5% false positive rate에 맞추어 보정하여 점수가 비교 가능하도록 했다.
| Detector | RAID에서의 전체 정확도, FPR 5%로 고정 |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
그 표에 대한 두 가지 해석은 동시에 정직하다. Winston의 71.0%는 99.98%와는 전혀 가깝지 않으며, 그럼에도 Winston은 가장 어려운 공개 벤치마크에서 세 개의 상업적 경쟁사 중 두 개를 여전히 앞섰다. 평균값은 또한 드러나는 분산을 가린다. RAID의 모델별 결과에서 Winston은 ChatGPT 출력에서 99.6%, GPT-4 출력에서 98.8%를 기록했는데, 이는 자사가 광고한 수치에 가깝지만, GPT-2 텍스트에서는 47.6%로, base MPT-30B 모델의 텍스트에서는 24.8%로 떨어졌다. 패러프레이즈된 기계 텍스트에서는 정확도가 52.6%로 하락했다.
그 분산이 바로 99.98% 주장 전체의 축소판이다. 탐지기가 아마도 맞춰졌을 법한 텍스트, 즉 최근의 채팅 모델이 평이한 산문을 쓰는 경우와 비슷한 텍스트에서는 Winston이 자사 마케팅에 가까운 성능을 보인다. 그러나 그 분포를 벗어나면 성능은 급격히 떨어진다. 분포 내 텍스트로 구성된 내부 벤치마크는 실제로 거의 완벽한 수치를 만들어낼 수 있지만, 실제 받은 편지함에 들어 있는 모델, 수정, 패러프레이즈의 복잡한 혼합에 대해서는 거의 아무것도 말해주지 않는다. 탐지기가 의존하는 통계적 신호는 AI 탐지기가 작동하는 방식에 대한 우리의 해설에서 더 자세히 다룬다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
거짓 양성, 누가 피해를 보는가?
RAID의 설계는 공급업체의 마케팅이 좀처럼 드러내지 않는 하나의 절충을 보이게 한다. 연구에서의 모든 정확도 점수는 거짓 양성 비율을 5%로 고정한 뒤 측정되었다. 그 보정에서 진짜 인간 문서 20개 중 1개가 표시된다. 탐지기는 임계값을 높여 이 비율을 낮출 수 있지만, 그 대가로 AI 텍스트를 덜 잡아낼 뿐이다. 두 수치는 함께 움직이며, 둘 중 하나만 제시하는 공급업체는 결과의 절반만 말하는 것이다.
그 오류의 부담은 고르게 분산되지 않는다. 공식적이고, 관습적이며, 변동성이 낮은 글쓰기는 모든 통계적 탐지기에서 기계적인 것으로 읽히며, 이러한 설명은 방법론 절, 문헌 검토, 그리고 제2언어로 작업하는 저자들의 신중한 산문에 들어맞는다. AI detectors가 비원어민 영어 화자를 더 높은 비율로 표시하는 패턴은 업계 전반에 걸쳐 문서화되어 있으며, Winston의 방법도 그 예외가 아니다. 문장별 예측 지도 역시 같은 주의가 필요하다. 빨간색으로 강조된 문장은 저자성에 대한 증거가 아니라 단어 패턴에 관한 통계적 관찰이다. 부당하게 표시된 학생은 자백이 아니라 문서화에서 출발해야 하며, AI를 사용하지 않았음을 증명하는 방법에 대한 우리의 가이드는 실제로 무엇이 설득력을 갖는지 다룬다.
가격과 접근성
Winston은 제한된 체험판이 있는 유료 제품이다. Winston은 2,000 크레딧이 포함된 14일 무료 체험판, 월 18달러의 Essential 요금제, 또는 연간 청구 시 월 10달러의 Essential 요금제, 월 100,000 크레딧이 포함된 월 29달러, 또는 연간 16달러의 Advanced 요금제, 팀 좌석과 더 큰 스캔을 추가하는 요금제, 그리고 그 위의 Elite 등급을 제시한다. 한 학급 분량의 제출물을 검토하는 개별 교사에게는 이것이 충동구매 수준의 가격대에 해당하며, 기관 계약보다 저렴하고 대부분의 무료 도구보다 더 유능하다.
탐지기 환경에서 Winston의 위치
독립적인 증거에 따르면, Winston은 시장의 무료 등급보다 더 잘 작동하고 자체 광고보다는 덜 잘 작동하는 중간 가격대의 상업용 탐지기이다. 이는 문장별 가시성, Classroom 통합, 표절 검사를 하나의 저렴한 도구에서 원하고, 모든 결과를 판정이 아니라 대화의 출발점으로 취급하는 교사에게 적합하다. 어떤 탐지기의 점수도 증거로 기능하지 않기 때문에, 그 점수가 증거로 기능해야 하는 사람에게는 적합하지 않다.
전체 비교
Winston은 경쟁이 치열한 분야의 여러 탐지기 중 하나이며, 71%와 99.98%의 격차는 업계 전반에 나타나는 패턴의 한 사례이다. Turnitin, GPTZero, Originality, ZeroGPT 및 그 밖의 도구들과 같은 증거 우선의 기준에서 어떻게 비교되는지에 대해서는, AI detectors compared에 대한 전체 가이드를 참고하라.
우리 자체 연구가 밝혀낸 것
TextPulse Research의 탐지기 일치도 연구에서는 9개의 상용 AI 탐지기가 동일한 90개의 학술 텍스트를 평가했습니다. 그중 하나는 455단어짜리 하이브리드 텍스트로, 사람이 쓴 서두와 결말 사이에 168단어의 AI 생성 중간 부분이 끼어 있습니다. Winston AI는 이 텍스트를 7% AI로 판정했지만, 같은 문장에 대한 다른 도구들의 판정은 0%에서 95.7%까지 갈렸습니다. 전체 논문, 말뭉치, 도구별 점수 행렬은 TextPulse Research에서 공개되어 있습니다.

자주 묻는 질문
99.98% 수치는 Winston AI 자체 주장으로, 회사가 공개하지 않은 내부 테스트 세트에서 측정된 것이다. ACL 2024에서 제시된 동료 심사 RAID 벤치마크에서 Winston은 오탐률을 5%로 고정했을 때 전체 정확도 71.0%를 기록했지만, ChatGPT 출력에 한정하면 99.6%에 도달했다. 이 주장은 실제 세계의 성능이 아니라 선택된 말뭉치를 설명한다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.