AI Detection

Pangram AI Detector 검토: 연구자들이 계속 검증하는 도구

Pangram은 약 1만 분의 1의 오탐률을 공표하며, 대부분의 detector 공급업체와 달리 최근의 독립 연구가 같은 방향을 가리킨다. Vrije Universiteit Brussel의 동료 심사 2026년 연구는 석사 수준 논문에서 만족스러운 결과를 낸 네 개 도구 중 유일한 도구라고 밝혔다. 여기서는 연구들이 무엇을 측정했는지, 근거가 아직 얼마나 빈약한지, 그리고 어떤 detector 점수도 무엇을 증명할 수 없는지를 살펴본다.

7 min
Pangram AI Detector Review: The Tool Researchers Keep Validating

Pangram은 독립 연구자들이 계속해서 주목하는 AI 탐지기이며, 그 때문에 일반적인 공급업체 성적표보다 더 면밀히 살펴볼 가치가 있다. 제작사인 Pangram Labs는 약 10,000분의 1의 false positive rate와 99.98 percent의 대표 정확도를 공표한다. 이는 회사가 자체 벤치마크에서 측정한 회사 자체 수치이다. Pangram이 대부분의 분야와 구별되는 점은, 이번에는 최근의 외부 연구가 같은 대체로의 방향을 가리킨다는 데 있다.

지난 1년 사이에 두 건의 독립적 평가가 나왔다. 하나는 2026년 6월 Springer가 출판한 Vrije Universiteit Brussel의 동료 심사 연구이고, 다른 하나는 2025년 12월 Chicago Booth Review가 다룬 University of Chicago Booth School의 working paper이다. 두 연구 모두 Pangram을 Turnitin, GPTZero, Copyleaks를 포함한 더 잘 알려진 경쟁자들보다 분명히 앞선 것으로 평가했다. 어느 연구도 어떤 탐지기의 점수가 특정 문서에 대해 무엇인가를 증명한다고 보지 않으며, 두 연구 모두 그렇게 명시한다.

이어서 살펴볼 내용은 Pangram이 스스로에 대해 주장하는 바, 두 연구가 실제로 측정한 것, 증거가 여전히 빈약한 지점, 그리고 이 도구의 부상이 나머지 탐지 분야에 대해 시사하는 바이다.

Pangram이란 무엇이며 누가 사용하는가

Pangram Labs는 2023년 Brooklyn에서 Tesla와 Google에서 일했던 AI 연구자들이 설립한 소규모 회사이다. 이 제품은 붙여넣거나 업로드한 텍스트를 검사하여 그중 얼마나 많은 부분이 AI generated인지 추정치를 반환하며, 유료 요금제에서는 문장 수준 강조 표시와 함께 이미지 탐지 및 표절 검사도 제공한다.

그 사용자층은 Turnitin과 다르게 보인다. Turnitin은 기관에 판매되며 learning management systems 안에서 작동하지만, Pangram은 무료 계정만 있으면 누구나 사용할 수 있어 학생, 편집자, 학술지 직원, 입학 심사자가 직접 사용한다. 이 시장에서 Pangram은 후발 주자이며, 기존 업체들이 테스트에서 보여주지 못하는 성능을 계속 보이기 때문에, 학문적 진실성 연구자들이 비교 기준이 필요할 때 점점 더 자주 찾는 도구이기도 하다.

공급업체의 주장

Pangram의 홈페이지는 99.98 percent의 정확도를 광고하며, 인간 문서가 AI로 잘못 표시되는 비율인 오탐률이 현재 10,000분의 1이라고 밝힌다. 오탐에 관한 회사 블로그 글은 CTO가 작성한 것으로, 이 전체 수치를 장르별로 나누어 제시한다. 학술 에세이에서는 0.004 percent, 과학 초록에서는 0.001 percent이며, 회사가 스스로 공개하는 취약한 영역으로는 시에서는 0.05 percent, 레시피에서는 0.23 percent가 있다. 회사는 또한 이 모델이 이른바 humanizer 도구로 처리된 뒤에도 AI 텍스트를 계속 탐지한다고 주장한다.

이 수치들은 모두 공급업체가 자체 시험 집합에서 보고한 자기 보고 수치이며, 같은 글에는 공급업체 자신의 유의사항도 함께 실려 있다. 모델은 완전한 문장으로 쓰인 더 긴 텍스트에서 가장 잘 작동하며, 회사는 짧은 글머리표 목록이나 매우 형식적인 텍스트를 판별하지 말라고 권고한다. 이 두 측면을 함께 보아야 한다. 이 주장들은 이례적으로 구체적이고 이례적으로 낮지만, 회사 밖의 누군가가 검증하기 전까지는 여전히 주장에 불과하다.

Pangram homepage: an AI detector that actually works, with a 99.98% accuracy claim credited to University of Maryland and University of Chicago researchers
홈페이지의 주장, 99.98% 정확도이며 University of Maryland and University of Chicago 연구자들에게 귀속된다. 이 주장을 뒷받침하는 연구가 바로 이 검토의 대상이다.

독립적 증거가 보여주는 것

현재까지 가장 강력한 검증은 Vrije Universiteit Brussel의 Van Vlasselaer, Van Droogenbroeck, and Spruyt가 수행한 동료 심사 연구로, 2026년 6월 International Journal for Educational Integrity에 게재되었다. 연구팀은 각각 최소 4,000단어로 이루어진 석사 수준 학술 논문 160편을 제작했다. 이 가운데 40편은 2019년 이전에 실제 학생이 작성한 것이고, 40편은 GPT-4o Deep Research로 완전히 생성했으며, 40편은 혼합형, 40편은 AI로 생성한 뒤 의도적으로 인간화한 것이었다. 이들은 이 모든 논문을 Turnitin, GPTZero, Copyleaks, 그리고 Pangram에 통과시켰다.

완전히 AI로 생성한 논문에 대해, 이 연구는 Turnitin, GPTZero, 그리고 Copyleaks가 "AI 생성 콘텐츠를 완전히 탐지하지 못했다"고 보고한다. Turnitin은 이 40편 각각에 대해 AI 비율을 0퍼센트에서 20퍼센트 사이로 평가했다. 100퍼센트 기계 작성된 논문에서 기존 세 도구의 중앙값 점수는 모두 20퍼센트 미만이었다. Pangram은 같은 집합에서 엄격 정확도 65퍼센트, 포괄 정확도 97.5퍼센트를 기록했으며, 논문 1편을 오분류했다. 인간화한 집합에서는 Pangram이 40건 중 37건에서 AI 콘텐츠를 올바르게 식별하여 엄격 정확도 92.5퍼센트를 보였고, GPTZero는 2.5퍼센트, Copyleaks는 22.5퍼센트, Turnitin은 50퍼센트를 기록했다.

도구완전히 AI로 작성된 논문, 엄격 정확도인간화한 AI 논문, 엄격 정확도인간 논문을 올바르게 무해로 판정한 비율
Pangram65%92.5%100%
Turnitin0%50%100%
GPTZero0%2.5%100%
Copyleaks0%22.5%100%

두 번째 데이터 포인트는 Chicago Booth의 Brian Jabarian과 Alex Imas가 작성한 워킹 페이퍼로, 2025년 12월 Chicago Booth Review에 요약되었다. 이들은 6개의 매체에 걸친 약 2,000개의 인간 작성 문단과 4개의 최첨단 모델에서 나온 AI 버전을 대상으로 탐지기를 시험했으며, Pangram의 오탐률은 대부분의 판정 임계값에서 사실상 0이었고, 그들의 코퍼스에서 정확도는 99.8 percent 아래로 한 번도 떨어지지 않았으며, 모델에 따라 위음성은 2와 4 percent 사이였다. 연구자들은 어떤 탐지기든 운영적으로 신뢰하기 전에, 예를 들어 인간 글쓰기의 0.5 percent 이하만 표시되도록 하는 엄격한 정책 상한을 기관이 채택해야 한다고 제안한다. 상태의 차이를 유의해야 한다, Booth 논문은 아직 동료 심사를 거치지 않은 워킹 페이퍼이며, 인간화된 학술 논문이 아니라 수정되지 않은 AI 텍스트를 시험했다.

오탐과 피해를 입는 사람들

오탐은 탐지기 피해가 가장 집중되는 지점이며, 이 업계 전반에 걸쳐 문서화된 양상은 표시가 비원어민 영어 사용자에게 불균형적으로 집중된다는 것이다. VUB 연구는 바로 이 점에서 읽을 가치가 있다, 그 40편의 인간 논문은 모두 비원어민 영어 사용자가 작성했으며, Pangram을 포함한 4개 도구 모두가 이를 100 percent 통과시켰다. 이는 진정으로 고무적인 결과이며, 동시에 40편의 논문이기도 하다. 그 정도 규모의 표본으로는 0.004 percent와 같은 비율을 확인할 수 없다, 그 정도로 정밀한 수치는 오직 공급업체 자체의 훨씬 더 큰 내부 시험에서만 나오며, 외부의 어느 당사자도 그 규모에서 이를 재현하지 못했다.

이 연구의 실제 세계 섹션은 왜 주의가 좋은 벤치마크가 있어도 여전히 필요한지를 보여준다. 연구자들이 2024년과 2025년의 실제 석사 논문 1,163편에 Pangram을 적용했을 때, 그중 45.5 percent를 어느 수준에서든 표시했으며, 표시된 사례들 가운데 추정 AI 비율의 중앙값은 30 percent였고, 그 논문들에 대해서는 어떤 경우에도 정답 자료가 존재하지 않는다. 저자들은 분명하게 말한다. 탐지 점수는 유용한 초기 신호이며, 중대한 결정에서 유일한 증거가 되어서는 절대 안 된다. 표절 의혹을 받는 학생은 어떤 탐지기가 그 수치를 산출했는지와 무관하게, 여전히 절차에 기반한 저자성 입증 방법이 필요하다.

자신의 논문을 인간적으로 다듬기

중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.

무료로 시작하기

가격과 접근성

Pangram의 사이트는 계정을 등록한 뒤 하루에 20회의 무료 검사를 제공하며, 유료 구독은 크레딧 용량과 표절 탐지와 같은 기능을 추가한다. 이러한 접근 모델은 정확도 수치만큼이나 중요하다. 기관이 실행한 검사를 당할 때만 접하게 되는 Turnitin과 달리, Pangram은 직접 검사할 수 있으므로, 작성자는 제출 전에 검토자가 볼 수 있는 것과 같은 종류의 신호를 확인할 수 있다.

Pangram이 탐지기 환경에서 차지하는 위치

VUB 저자들이 이 분야를 요약한 문장은 단호하다. "여기서 연구한 네 가지 AI 탐지 도구 중, 현재 시점에서 만족스러운 결과를 낸 것은 하나뿐이었다." 이 문장은 Pangram만큼이나 기존 도구들에 대해서도 많은 것을 말해준다. 대부분의 기관이 실제로 의존하는 도구인 Turnitin은 완전히 AI 생성된 집합에서 0점을 받았고, 별도로 문서화된 오탐 기록 때문에 대학들은 이미 그 점수를 신중하게 다루도록 강요받고 있다. 이들 도구는 모두 텍스트의 통계적 속성을 측정하며, 기본 작동 원리는 Pangram의 더 새로운 훈련 접근이 왜 앞설 수 있는지, 그리고 왜 이들 모두가 여전히 확률적일 수밖에 없는지를 설명한다.

솔직한 평가는 다음과 같습니다. Pangram은 현재 독립적 테스트에서 가장 잘 지원되는 탐지기이며, 최근의 근거를 기준으로 보면 상당한 차이로 앞서 있습니다. 다만 그 근거의 범위는 좁습니다. 두 개의 연구, 하나는 동료 심사를 거쳤고 하나는 그렇지 않으며, 둘 다 지난 1년 안에 나온 것이고, 대부분 영어이며, 대부분 장문 학술 및 웹 텍스트입니다. 탐지는 분기마다 변하는 모델과의 군비 경쟁이며, 2026년에 선두인 도구도 다음 세대의 텍스트가 나오기 전까지만 그 우위를 유지합니다. Pangram 점수는 경쟁 도구들이 산출하는 것보다 더 잘 보정된 추정치입니다. 그러나 그것은 여전히 추정치일 뿐이며, 특정 개인이 무엇을 했는지를 보여 주는 증거는 아닙니다.

전체 비교 보기

Pangram은 혼잡하고 고르지 않은 분야의 여러 도구 중 하나입니다. Turnitin, GPTZero, Copyleaks, ZeroGPT, 그리고 그 밖의 도구들과 같은 기준에서 어떻게 비교되는지 보려면, 전체 AI detectors compared 가이드를 참조하십시오.

우리 자체 연구가 밝혀낸 것

TextPulse Research의 탐지기 일치도 연구에서는 9개의 상용 AI 탐지기가 동일한 90개의 학술 텍스트를 평가했습니다. 그중 하나는 455단어짜리 하이브리드 텍스트로, 사람이 쓴 서두와 결말 사이에 168단어의 AI 생성 중간 부분이 끼어 있습니다. Pangram는 이 텍스트를 34% AI로 판정했지만, 같은 문장에 대한 다른 도구들의 판정은 0%에서 95.7%까지 갈렸습니다. 전체 논문, 말뭉치, 도구별 점수 행렬은 TextPulse Research에서 공개되어 있습니다.

연구 말뭉치의 하이브리드 텍스트에 대한 Pangram의 판정.
연구 말뭉치의 하이브리드 텍스트에 대한 Pangram의 판정.
XLinkedInFacebook

자주 묻는 질문

Pangram의 자체 주장은 내부 벤치마크를 기준으로 99.98 percent 정확도와 약 1만 분의 1의 오탐률이다. 이 업계에서는 드물게, 최근의 독립 연구도 같은 방향을 가리킨다. 동료 심사를 거친 2026년 6월 Vrije Universiteit Brussel 연구는 Pangram이 완전히 AI generated된 석사 수준 논문과 인간화된 석사 수준 논문을 신뢰성 있게 탐지한 네 개 도구 중 유일한 도구라고 밝혔고, Chicago Booth 작업 논문은 자체 말뭉치에서 거의 0에 가까운 오탐률을 보였다. 독립 근거는 강하지만 최근의 것이며 범위는 제한적이다.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI 휴머니제이션 소식을 받아보세요

학술 글쓰기, AI 탐지, 휴머니제이션에 대한 팁을 받은편지함으로 받아보세요.

스팸은 없습니다. 언제든지 구독을 취소할 수 있습니다.