AI Detection

2026년 학술 글쓰기를 위한 최고의 AI 탐지기: 10개 도구 비교

이 10개 탐지기 중 두 개는 같은 99.98%의 헤드라인 정확도 수치를 제시한다. 하나는 그 수치를 뒷받침한 연구자를 밝히고, 장르별 오탐률도 구분해 제시한다. 다른 하나는 어떤 시험도 밝히지 않는다. 10개 도구를 네 가지 축, 즉 누가 구매하는지, 무엇을 주장하는지, 그 주장 뒤에 어떤 증거가 있는지, 그리고 보고서가 실제로 무엇을 보여주는지에 따라 배치하고, 점수화 자체를 대체할 수 있는 과정 추적 모델도 함께 다룬다.

15 min
AI detectors compared by who each one is sold to and whether a named study sits behind its accuracy figure

여기에 있는 열 개 도구 가운데 두 개는 같은 표제 수치를 공표한다, 99.98% 정확도이다. 그중 하나는 그 수치의 근거가 된 연구자와 대학을 밝히고, 거짓 양성률을 콘텐츠 장르별로 나누어 제시한다. 다른 하나는 어떤 시험도 밝히지 않는다. 이러한 대비는 AI detector를 나란히 비교할 때 가장 유용한 점이며, 이들 각 페이지의 모든 가격이 바뀐 뒤에도 여전히 유용할 것이다.

이 가이드는 2026년 학술 글쓰기를 위한 최고의 AI detector를 비교한다, Turnitin, GPTZero, Copyleaks, Originality.ai, Pangram, Winston AI, ZeroGPT, Scribbr, Sapling and Compilatio이다. 이들은 학생, 연구자, 평가자 또는 편집자가 가장 자주 접하게 될 열 개이다. 이들은 서로 다른 구매자를 대상으로 판매되고, 서로 다른 모델로 가격이 책정되며, 서로 다른 내용을 되돌려 준다. 정확도만으로 비교하면, 어떤 도구에 텍스트가 입력되는지, 그리고 그 이후에 어떤 일이 일어나는지를 결정하는 거의 모든 요소를 놓치게 된다.

실제로 다른 네 가지

Detector의 마케팅 페이지는 하나의 수치에서는 수렴하고, 그 밖의 모든 것에서는 갈라진다. 이들 제품을 가르는 질문은 네 가지이며, 홈페이지의 백분율은 그중 하나에 불과하다.

  • 누구를 대상으로 판매되는가. 기관에 라이선스가 부여되고 강사에게만 보이는 도구는, 누구나 브라우저에서 가입할 수 있는 도구와는 다른 위치에 있으며, 이 차이가 누가 당신에 관한 결과를 보게 되는지를 결정한다.
  • 어떤 수치를 공표하는가. 여기의 모든 공급업체는 어떤 형태로든 주장을 공표하며, 단순한 백분율에서부터 소수 넷째 자리까지 제시된 거짓 양성률에 이르기까지 다양하다.
  • 그 수치 뒤에 명시된 시험이 있는가. 이것은 열 개를 가장 뚜렷하게 가르는 축이며, 어떤 공급업체 비교표도 사용하지 않는 축이다.
  • 보고서가 실제로 무엇을 반환하는가. 문서 수준의 백분율, 문장 수준의 강조 표시, 해석 가능성 보기, 그리고 공유 가능한 보고서는 서로 다른 네 가지 객체이며, 하나에 근거한 비난은 다른 하나에 근거한 비난과는 다른 논의이다.

세 번째 질문은 곰곰이 생각해 볼 만하다. 명명된 기관, 명명된 데이터셋, 그리고 그 뒤에 명시된 방법이 있는 백분율은 논박하거나, 재현하거나, 이의를 제기할 수 있다. 그 뒤에 아무것도 없는 백분율은 믿거나 무시할 수 있을 뿐이며, 믿음은 부정행위 심리의 근거가 아니다. 이전 세대의 탐지기가 가장 강하게 의존했던 통계적 속성인 perplexity는 충분히 측정 가능하므로, 무료 perplexity checker는 그것이 자신의 글에서 어떤 모습인지 보여줄 수 있지만, 아래의 어느 공급업체도 그 판정을 perplexity 점수로 보고하지는 않는다.

비교 표: 각 도구의 판매 대상과 주장하는 바

Detector판매 대상접근 방법주요 주장주장의 근거가 된 명시된 테스트
Turnitin인가된 기관의 교육자와 관리자기관 라이선스만 가능문서의 오탐률이 20% 임계값을 기준으로 1% 미만Turnitin 자체 검증 세트, 명시된 외부 연구 없음
GPTZero교사, 학생, 작가, 채용 담당자, 출판사직접 가입, 무료 등급99% 정확도, 혼합 문서에서 96.5%제3자 벤치마크인 RAID와 Penn State 파트너십을 지칭함
CopyleaksCanvas, Blackboard, Moodle 내부의 교육 및 기업용직접 가입 및 LMS 라이선스99%가 넘는 정확도와 0.03%의 오탐률독립적 데이터가 존재함, 아래의 2026 VUB 연구
Originality.ai작가, 편집자, 마케터, 에이전시, 기업직접 가입, 크레딧 기반최신 AI 모델에서 99% 정확도자체 정확도 연구와 제3자 동료 심사 연구
Pangram대학, 학교 및 기업직접 가입, 기관용 및 API 요금제99.98% 정확도, 10,000분의 1의 오탐률Chicago Booth와 University of Maryland 연구자들의 연구라고 자사에서 밝히는 연구
Winston AI개인, 팀, 웹사이트 인증 고객직접 가입, 크레딧 기반99.98% 정확도, 이를 달성한 유일한 탐지기라고 표기명시된 것 없음
ZeroGPT개인, 가입 없는 사전 점검무료, 15,000자, 계정 없음내부 평가에서 98% 초과명시된 것 없음, 수치는 공급업체 자체의 것임
Scribbr학생, 무료 검사기와 프리미엄 등급브라우저에서 무료시험 텍스트의 78%를 올바르게 식별Scribbr 자체가 수행한 Scribbr의 자체 비교
Sapling개발자와 지원 팀, API 우선직접 가입, 공개 API, 브라우저 확장 프로그램문장별 AI 확률명시된 것 없음, 독립적 검토들은 서로 크게 일치하지 않음
Compilatio유럽 기관과 학생, 프랑스어권 체계에서 가장 강함기관 라이선스, 또는 4.99 euros부터의 학생 직접 구매94 to 99% 신뢰도, 1% 미만의 오탐14개 도구 중 2위, Weber-Wulff et al. 2023

한 행은 나머지와 다르게 작동한다. Turnitin은 평가받는 사람이 구매할 수 없고, 제출 전에 그 사람이 직접 실행할 수도 없으며, 결과를 다른 사람에게 돌려준다. Compilatio는 같은 방식으로 기관에 라이선스되지만, 학생들에게도 동일한 검사를 직접 판매하므로, 자신의 초안을 먼저 직접 실행할 수 있는 유일한 기관용 탐지기이다. 여기의 다른 모든 탐지기는 학생, 작성자 또는 편집자가 오늘 오후에 브라우저에서 열어 자신의 텍스트에 적용할 수 있는 제품이다.

정확도 주장, 그리고 그 뒤에 이름이 붙은 검사가 있는 것

Winston AI와 Pangram은 같은 수치를 제시한다. Winston은 자신이 "The only AI detector with a 99.98% accuracy rate"라고 밝힌다. Pangram의 홈페이지에는 "Detect AI-generated content with 99.98% accuracy. Trusted by universities, schools, and enterprises worldwide."라고 적혀 있다. 수치는 동일하다. 그러나 그 근거는 전혀 그렇지 않다.

Pangram은 출처를 명시한다. 자사 페이지는 이 통계를 University of Chicago의 Booth School of Business와 University of Maryland의 연구자들이 수행한 비교 연구에 근거한 것이라고 밝히며, 콘텐츠 장르별 false positive 분포도 공개한다. 반면 Winston의 페이지에는 어떤 연구도 적혀 있지 않다. 99.98% 수치에 대한 데이터셋, 표본 크기, 방법도 없다. 그곳의 신뢰성 표시는 SOC 2와 GDPR 배지, 그리고 언론 로고들인데, 이는 탐지 성능이 아니라 보안 태세와 언론 보도를 말해줄 뿐이다. 각 주장에 대한 전체 해부는 전용 리뷰에 있다: Pangram reviewedWinston AI reviewed.

열 개 중 가장 구체적인 수치는 Turnitin이 공개한 것으로, 정확도율이 아니라 오류율이다. 즉, 20% 임계값을 넘는 문서 수준 false positive rate는 1% 미만이고, 문장 수준 오류 가능성은 대략 4%이며, 문서에서 AI 텍스트의 15%를 놓칠 가능성도 명시되어 있다. 이 공개된 누락률을 되받아 인용하는 사람은 거의 없다. How Turnitin's detector workswhat its false positive rate means in practice는 별도로 다룬다.

GPTZero는 99% 정확도를 공표하며, 제3자 벤치마크인 RAID와 Penn State 연구 파트너십을 근거로 제시하는데, 이는 단순한 수치보다는 한 단계 위이지만 인용문보다는 한 단계 아래에 놓인다. Originality.ai는 최신 AI 모델에서 99%를 공표하며, 자체 연구와 제3자 동료심사 연구를 인용하고, 또한 이 전체 절에 적용되어야 할 문장을 공표한다. "방법론, 벤치마크 데이터, 그리고 독립적이거나 재현 가능한 분석으로 투명하게 뒷받침되지 않는 모든 AI 탐지기 정확도 주장은 회의적으로 보아야 한다." 이 기준을 일관되게 적용하면, 이 페이지의 모든 수치에 같은 질문을 던지게 되며, 두 개의 99.98% 주장도 예외가 아니다. ZeroGPT의 수치는 내부 평가에서 98%를 넘는다고 하지만, 그 뒤에 이름이 붙은 시험도 없다. the ZeroGPT accuracy review는 그 수치가 어디에서 비롯되는지 추적한다. Scribbr의 78%는 적어도 그 규모에 대해 정직하지만, 그 시험은 Scribbr 자체의 것이다.

같은 기준은 우리 자신의 수치에도 적용되어야 한다. TextPulse는 academic AI humanizer에 대해 Turnitin AI에서 92.33%, Originality.ai에서 89.12%, GPTZero에서 87.91%의 측정된 통과율을 공표한다. 이것들은 Winston과 Pangram의 경우와 정확히 같은, 공급자 시험에서 나온 공급자 수치이며, 이 시장의 어느 쪽에 있는 어떤 도구도 특정 문서에 대해 탐지기가 무엇을 보고할지 약속할 수 없다.

학술 글쓰기를 위한 상위 10개 AI 탐지기

각 항목은 같은 네 가지 사항을 다룬다. 엔진이 어떻게 작동하는지, 공급자가 무엇을 주장하는지, 독립적 증거가 무엇을 보여주는지, 그리고 실제로 누가 그 도구를 사용하는지이다. 각 절에서 연결된 전용 리뷰는 더 깊이 들어간다.

1. Turnitin: 기관의 기본 선택

Turnitin homepage positioning AI writing detection inside its authentic learning and similarity workflow
Turnitin은 작성자가 아니라 기관에 판매된다. AI 탐지는 교원이 이미 사용하는 유사성 워크플로에 묶여 함께 제공된다.

Turnitin의 AI writing indicator는 학술 산문으로 학습된 딥러닝 분류기이다. 이 도구는 제출물을 수백 단어 정도의 서로 겹치는 구간으로 나누고, 각 구간을 모델이 생성한 텍스트의 통계적 패턴에 따라 점수화한 뒤, 그 결과를 교원이 보는 문서 백분율로 집계한다. 장문의 산문만이 적격 텍스트로 간주되며, 글머리표 목록, 인용문, 참고문헌은 제외된다.

Turnitin은 정확도율이 아니라 오류율을 공개한다. 20% 임계값을 넘는 논문에 대해 문서 수준의 거짓 양성률은 1% 미만이며, 강조 표시된 개별 문장 하나에 대해서는 대략 4%의 오류 가능성이 있고, 문서 내 AI 텍스트의 15%를 놓칠 수 있다고 밝힌다. 2026년 VUB 연구는 공급업체의 자체 수치보다 더 엄격했다. Turnitin은 시험 집합에 있는 40편의 완전 AI 생성 학위논문 각각에 대해 AI 0%를 보고했다. 이 도구가 기본값으로 남아 있는 이유는 이미 16,000개 이상의 기관이 라이선스를 보유한 표절 워크플로 안에 포함되어 있기 때문이며, 이는 Turnitin의 자체 집계에 따른 수치이고, 점수는 교원과 관리자만 볼 수 있다. 또한 이 페이지에서 가장 많이 철회된 도구이기도 하다. 여러 주요 대학이 거짓 양성 우려로 이를 비활성화했으며, 이는 Turnitin 사용을 중단한 대학들에 정리되어 있다. Turnitin이 AI를 탐지하는 방식유사도와 AI 점수의 차이가 그 작동 원리를 다룬다.

2. GPTZero: 학생 측에서 가장 큰 브랜드

GPTZero homepage: AI detector made to preserve what's human, claiming 99% accuracy with 17 million users and 1 million educators
GPTZero의 학생 측 규모, 무료 등급, 수백만 명의 사용자, 그리고 제3자 벤치마크를 가리키는 99% 정확도 주장.

GPTZero는 2023년 1월에 perplexity와 burstiness 검사기로 출시되었으며, 이후 엔진을 다층 분류기로 재구성했다. 스캔 결과는 문서 판정, AI, 인간, 혼합으로 나뉜 확률, 결과를 이끄는 구절에 대한 문장별 강조 표시, 그리고 AI 어휘 목록을 반환한다. 홈페이지는 99% 정확도, 17 million users, 1 million educators를 주장하며, 무료 등급은 스캔당 약 10,000 characters를 허용하고, 회사는 비원어민 영어 글쓰기에 대한 오탐을 줄이기 위한 ESL calibration을 공개한다.

근거 측면에서 보면 중간 수준에 있다. 이 도구는 제3자 RAID benchmark와 Penn State 연구 협력을 근거로 제시하는데, 이는 단순한 주장보다는 한 단계 위이지만, VUB 연구에서는 완전히 AI가 생성한 학위논문에 대한 중앙값 점수가 20% 미만이었고, 개별 논문 간 변동 폭은 컸다. 학생들이 제출 전에 자신의 초안을 미리 점검할 때 가장 자주 사용하는 도구이기도 하다. How GPTZero works는 보고서를 층별로 설명하고, GPTZero versus Turnitin은 같은 텍스트에 대해 두 도구가 왜 서로 다른 판단을 내리는지 설명한다.

3. Copyleaks: LMS 내부의 detector

Copyleaks homepage: content integrity and AI detection platform for enterprises and universities
Copyleaks는 자신을 교실의 상류에 위치한 도구로 제시한다. 즉, LMS 통합을 통해 학생들에게 도달하는 기업용 무결성 플랫폼이다.

Copyleaks는 AI detection과 plagiarism checking을 하나의 기업용 제품으로 판매하며, Canvas, Blackboard, Moodle에 연동되고, 10개 도구 중 언어 범위가 가장 넓다. 공급업체는 언어별 detection model과 함께 30개가 넘는 언어를 제시한다. 스캔 결과는 강조 표시된 구절과 함께 문서 백분율을 반환한다. 공급업체는 99%가 넘는 정확도와 0.03%의 false positive rate를 주장하며, 무료 스캐너는 약 25,000 characters를 허용한다.

독립적인 기록은 이 주장의 약한 절반이다. VUB 연구에서 Copyleaks는 완전히 AI로 생성된 40편의 논문 중 단 한 편도 완전히 AI가 작성한 것으로 분류하지 않았고, 40편 중 10편만 부분적으로라도 표시했으며, 100% 기계 생성된 논문들에 대해서도 보고된 AI 비율의 중앙값을 20% 미만으로 유지했다. 다만 인간이 작성한 40편의 논문은 모두 통과시켰는데, 그 모든 논문은 영어가 모국어가 아닌 저자가 쓴 것이었으므로, 이는 오탐에 관해 Copyleaks에 유리한 진정한 증거이다. Copyleaks 리뷰에 전체 내용이 있다.

4. Originality.ai: 출판사를 위해 만들어졌고, 교실을 위해 만들어진 것은 아니다

Originality.ai free AI detector page with the adjustable AI allowance slider and three free scans per day
Originality.ai의 보정은 설계상 조정 가능하다, 즉 편집자를 대상으로 한 AI 허용치 슬라이더로, 부정행위 심사위원회가 아니라 원고를 검토하는 편집자를 겨냥한다.

Originality.ai는 프리랜서 원고를 검토하는 출판사, SEO 대행사, 콘텐츠 팀을 대상으로 하며, 모든 설계 선택은 이러한 구매자를 기준으로 이루어진다. 즉, 100단어당 1크레딧의 크레딧 기반 가격 체계, API, Chrome 확장 프로그램, 표절 및 사실 확인 추가 기능, 그리고 편집자가 AI 보조 텍스트의 허용 범위를 설정할 수 있게 하는 조정 가능한 AI 허용치 슬라이더가 그것이다. 또한 새로운 세대의 언어 모델이 나올 때마다 탐지 모델을 재학습시키며, 자체 연구와 제3자 동료 심사 연구를 인용하면서 최신 모델들에 대해 99%의 정확도를 주장한다.

독립적인 테스트에서는 상당히 잘 수행되며, RAID 벤치마크에서 가장 강력한 상업용 도구들 가운데 하나이다. 또한 그 보정은 의도적으로 공격적이어서, 과소 표시하기보다 과대 표시하는 쪽을 택한다. 이는 출판사에는 적절한 절충이지만 부정행위 심사위원회에는 부적절하며, 사전 점검 점수가 대학 도구가 나중에 보여주는 결과와 다를 때 이해해야 할 가장 중요한 단일 사항이다. Originality.ai와 Turnitin의 비교는 그 차이를 보여준다.

5. Pangram: 독립 연구들이 계속 선호하는 도구

Pangram 홈페이지, 실제로 작동하는 AI 탐지기, University of Maryland와 University of Chicago 연구자들에게 귀속된 99.98% 정확도 주장
Pangram은 대부분의 공급업체가 갖추지 못한 것, 즉 명시된 대학 연구자들에게 귀속된 제3자 검증을 앞세운다.

Pangram은 여기서 가장 최근에 나온 도구이며, 연구자들이 계속 검증하고 있는 도구이기도 하다. 이 분류기는 거짓 양성을 거의 0에 가깝게 유지하도록 특별히 훈련되었고, 보고서에는 어떤 구절이 판정을 이끌었는지 보여 주는 해석 가능성 보기가 포함되어 있다. 기능은 20개가 넘는 언어, OCR이 포함된 파일 업로드, 브라우저 확장 프로그램, Google Docs 통합을 포괄하며, 무료 요금제는 하루 최대 2,000단어를 검사한다. 공급업체는 99.98% 정확도와 10,000분의 1의 거짓 양성률을 장르별 세부 내역과 함께 공개했다고 주장한다.

이례적으로, 독립적 증거는 마케팅과 같은 방향을 가리킨다. 2026년 VUB 연구는 완전히 AI가 생성한 논문에서 중앙값 점수가 실제 값에 가장 가까웠던 유일한 도구로 Pangram을 확인했으며, 하이브리드 논문과 인간화된 논문에서도 가장 근접하게 일치한다고 보았다. Chicago Booth와 Maryland 연구자들의 NBER 작업 논문은 재작성된 텍스트에서도 강한 성능을 유지하면서 거짓 양성을 0.5% 이하로 유지한 유일한 탐지기로 Pangram을 확인했다. 두 연구 모두 최근의 것이고 범위는 제한적이지만, 이 페이지의 다른 어떤 도구도 이만큼의 현재 증거를 유리하게 갖고 있지 않다. Pangram 리뷰는 두 연구를 면밀히 읽는다.

6. Winston AI: 가장 큰 주장, 가장 적은 증거

Winston AI 홈페이지, 가장 신뢰받는 AI 탐지기, 99.98% 정확 배지와 1,000만 사용자
Winston의 99.98% 배지는 홈페이지에 자리하지만, 그 뒤를 받치는 명시된 외부 연구는 없다.

Winston AI는 교육자와 콘텐츠 팀을 대상으로 하는 크레딧 기반 탐지기입니다. 기능 구성은 실용적입니다. 문장별 히트맵, 사진으로 찍은 페이지와 손글씨 페이지를 읽는 OCR, 표절 추가 기능, Google Classroom 통합이 포함됩니다. 홈페이지는 99.98% 정확도와 10 million명 이상의 사용자를 주장합니다. 정확도 수치는 내부 테스트에서 나온 것이며, 사이트 어디에도 방법론, 데이터셋, 표본 크기가 공개되어 있지 않습니다.

가장 적절한 독립적 기준점은 RAID 벤치마크(ACL 2024)입니다. 여기서 Winston은 5%의 고정 오탐률에서 전체 AI 텍스트의 71%를 탐지했습니다. ChatGPT 스타일 출력에서는 99.6%로 매우 우수했지만, 오래된 모델과 오픈 소스 모델에서는 훨씬 약했고, 패러프레이즈된 텍스트에서는 52.6%까지 떨어졌습니다. 과장된 제목을 가진 유능한 도구입니다. The Winston AI review는 이 주장을 자세히 검토합니다.

7. ZeroGPT: 무료 사전 점검

15,000자 무료 입력과 가입 불필요를 제공하는 ZeroGPT 홈페이지 탐지기
ZeroGPT의 제안은 마찰 없는 대용량입니다. 15,000자, 계정 없음, 그리고 10개 중 가장 약한 증거 기록입니다.

ZeroGPT는 가장 많은 트래픽을 가진 무료 사전 점검 도구입니다. 계정 없이 최대 15,000자를 붙여 넣으면 즉시 백분율과 함께, 이 도구가 DeepAnalyse 기술이라고 부르는 것에서 나온 강조 문장을 제공합니다. 공급업체는 내부 평가에서 98%를 넘는 정확도를 주장하지만, 외부 테스트는 하나도 제시하지 않습니다. 독립적 비교에서는 일관되게 상업용 분야의 하위권에 놓이며, 같은 텍스트에 대한 점수도 실행할 때마다 달라질 수 있습니다. 대략적인 첫 검토용으로는 무해하지만, 판정 도구로는 이 페이지에서 가장 방어하기 어렵습니다. The ZeroGPT accuracy review는 그 주장을 출처까지 추적합니다.

8. Scribbr: 라이선스 엔진을 사용하는 신뢰받는 브랜드

Scribbr 무료 AI 탐지기가 학술 단락을 100% AI 생성으로 채점한 결과, 결과 패널에 QuillBot 엔진 버전이 보임
Scribbr의 검사기가 작동하는 모습, 결과 패널의 QuillBot 버전 태그는 마케팅이 앞세우지 않는 기업 계열 정보이다.

Scribbr의 AI 검사기는 Scribbr 브랜드를 단 QuillBot 탐지 엔진이며, 결과 패널에는 엔진 버전이 표시되고, Scribbr의 소개 페이지는 두 회사를 Learneo 계열로 제시한다. 무료 등급은 브라우저에서 가입 없이 약 1,200단어를 검사하며 AI 생성, AI 수정, 인간 작성의 세 범주로 보고한다. Scribbr의 2026년 7월 자체 비교에서 무료 검사기는 시험 텍스트의 78%를, 프리미엄 버전은 84%를 식별했으며, 해당 표본에서는 거짓 양성이 0건이었다.

이 수치는 무료 등급에서 공개된 최선의 수치이며, Scribbr이 직접 설계하고 실행하고 채점한 시험에서 나온 것이다. 그 시험에서는 같은 기업 계열의 다른 회사가 공동 1위를 차지했다. 학생들이 이 검사기를 신뢰하는 이유는 Scribbr의 인용 및 논문 작성 안내서가 그 신뢰를 얻었기 때문이며, 탐지기는 그 신뢰를 이어받는다. Scribbr 리뷰는 무료와 프리미엄이 실제로 무엇을 측정하는지 다룬다.

9. Sapling: 개발자 도구

AI 문장을 빨간색으로 강조하고 73.6%의 가짜 확률을 표시하는 Sapling AI 탐지기 출력
Sapling의 문장별 보기, 빨간색 강조와 문서 확률을 제공하며 산업 워크플로 안에서 선별 작업을 위해 설계되었다.

Sapling의 탐지기는 고객 지원 팀을 위한 글쓰기 지원을 주된 사업으로 하는 NLP 회사에서 나왔으며, 그 점은 분명히 드러난다. 이 그룹에서 가장 접근하기 쉬운 API, 문장별 확률 점수와 perplexity 보기, 그리고 Google Docs, Gmail, Zendesk, Salesforce 안의 텍스트를 검사하는 브라우저 확장 기능을 제공한다. 무료 검사는 2,000자로 제한되며, 유료 요금제는 한도를 100,000자로 높인다.

독립적 기록은 열 개 중 가장 변동성이 크다. Scribbr의 비교에서는 거짓 양성이 0%인 68%였고, 2023년 arXiv 벤치마크에서는 거의 전부를 놓쳤으며, 적어도 한 건의 실사용 검토에서는 모든 것을 가짜로 표시했다. 단일 검토 점수는 모든 탐지기에 대해 일반화가 매우 잘 되지 않으며, Sapling이 이를 가장 분명하게 보여 준다. Sapling 리뷰에서는 그 이유를 살펴본다.

10. Compilatio: 유럽의 기관용 대응물

Compilatio 홈페이지: Compilatio, 표절 검사기 및 유럽 기관용 AI 탐지기로 AI 콘텐츠를 탐지
Compilatio의 제안은 Turnitin의 것과 유사하며, 프랑스어권 및 더 넓은 유럽의 교육 체계를 아우르는 교사와 기관을 대상으로 한다.

Compilatio는 미국 중심의 요약들이 Turnitin을 전제하는 자리에서 유럽 기관이 라이선스를 구매하는 표절 및 AI 통합 제품군이다. 프랑스어권 체계에서 가장 강하며, AI 탐지는 유사도 검사와 같은 교사용 작업 흐름에 통합되어 있고, 학생용 버전은 동일한 검사를 크레딧 단위로 판매한다. 이 도구는 94 to 99%의 신뢰도와 1% 미만의 거짓 양성을 주장하며, 동료 심사를 거친 시험에서 상위권에 든 이 목록의 유일한 도구이기도 하다. Weber-Wulff와 동료들의 연구에서 14개 중 2위였다. EU에서 공부한다면, 학위논문을 읽는 탐지기가 바로 이것일 가능성이 높다. Compilatio 리뷰에서는 그 순위가 무엇을 입증하고 무엇을 입증하지 못하는지 다룬다.

자신의 논문을 인간적으로 다듬기

중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.

무료로 시작하기

iThenticate: 출판사의 책상 위에 있는 탐지기

Turnitin의 또 하나의 제품도 여기서 다룰 필요가 있습니다. 대부분의 연구자는 그것을 직접 보지 못한 채 접하게 되기 때문입니다. iThenticate는 출판사, 학술지, 연구기관을 위한 Turnitin의 검사 도구로, 과제 채점이 아니라 출판 전 원고 점검을 위해 만들어졌습니다. 이 도구의 제안은 신뢰를 바탕으로 출판하는 것입니다. 즉, 중요한 문서를 외부로 내보내기 전에 잠재적 부정행위를 점검하라는 것입니다. 수천 개의 학술지가 Crossref의 Similarity Check 서비스를 통해 투고 논문을 이 도구로 검사하므로, 동료심사 학술지에 투고한 적이 있다면 누가 알려주었는지와 관계없이 귀하의 원고는 아마 iThenticate를 거쳤을 것입니다.

iThenticate homepage for publishers and researchers: publish with confidence by screening high-stakes documents for potential misconduct before publication, with log in and buy credits buttons
iThenticate는 문서별로 구매한 크레딧을 사용한 출판 전 점검을 판매하며, 저자가 기관 없이 실행할 수 있는 유일한 Turnitin 계열 도구입니다.

이 도구는 위의 Turnitin 항목과 두 가지 점에서 다릅니다. 첫째, 과정 중심이 아니라 문서 중심입니다. 수업도 없고, 과제도 없으며, 원고당 보고서 하나만 생성합니다. 둘째, Turnitin과 달리 평가받는 당사자가 직접 구매할 수 있습니다. 크레딧은 사이트에서 직접 판매되며, 문서별로 가격이 책정됩니다. 따라서 저자가 학술지에 제출되기 전에 자신의 원고에 대해 직접 실행할 수 있는 Turnitin 계열의 유일한 도구가 됩니다. 이 보고서는 우선 유사성 보고서이며, 출판된 문헌과 웹을 대조합니다. 또한 Turnitin은 적격 고객을 대상으로 AI writing detection을 제공하는 제품들 가운데 iThenticate를 포함한다고 밝히고 있습니다.

학술 저자에게 실질적 용도는 좁지만 분명하다. 즉, 최종 원고에 대해 제출 전에 독창성 검사를 실시하는 것이며, 이는 저널이 사용할 가능성이 높은 것과 같은 회사의 도구로 수행된다. 이 보고서가 하지 못하는 일은 무엇인가를 고치는 것이다. 그것은 중복과 AI 작성 가능성을 표시할 뿐이며, 표시된 문장을 수정하는 일은 여전히 저자의 몫이다. 이것이 바로 academic AI humanizer가 제출 점검표의 절반을 위해 만들어진 이유이다.

독립적 연구가 이 범주에 대해 말하는 것

업체 수치는 99% 부근에 모여 있다. 그러나 출판된 연구는 그렇지 않다. Weber-Wulff와 동료들은 2023년 International Journal for Educational Integrity에서 14개 시스템을 시험했으며, 그중에는 Turnitin도 포함되었다. 같은 해 Liang과 동료들은 Patterns에서 비원어민 영어 사용자의 TOEFL 에세이 91편 중 89편, 즉 97.8%가 7개 탐지기 중 적어도 하나에 의해 AI로 표시되었고, 18편은 7개 모두에 의해 표시되었다고 밝혔다.

위 도구들에 대한 가장 직접적인 학술적 검증은 2026년 VUB 연구, International Journal for Educational Integrity에 오픈 액세스로 출판된 연구이다. 실제 석사 논문, 4개의 상용 탐지기, 그리고 완전히 AI가 생성한 논문에서 4개 중 3개가 중앙값 20% 미만을 보였다. NBER working paper w34223에서 Jabarian과 Imas는 2020년 이전의 인간 텍스트 1,992개와 4개의 최첨단 모델에서 생성한 AI 텍스트 1,992개로 이루어진 말뭉치를 구축하고, Pangram, GPTZero, Originality.ai 및 오픈소스 기준선을 강도 높게 시험했다. 상용 탐지기들은 기준선을 능가했으며, 단 하나의 도구만이 재작성된 텍스트 전반에서 강한 성능을 유지하면서 위양성률을 0.5% 이하로 유지했다. 오픈소스 기준선은 인간 텍스트의 30%에서 69% 사이를 표시했으며, 이것이 위 표에 무료 GitHub 탐지기가 없는 이유이다.

OpenAI는 2023년 7월 20일 자체 AI Text Classifier를 철회하면서, 그것이 "정확도가 낮아 더 이상 사용할 수 없다"고 밝혔다. 2026년 3월 English Teaching: Practice & Critique에 게재된 Giray, Roe and Espiritu는 형평성 문제를 분명하게 제기했다. "이러한 도구는 다언어 학생들의 진정한 글쓰기를 불균형적으로 표시하며, 그 결과 거짓 비난을 피하기 위해 오히려 AI 사용을 조장하는 위축 효과를 낳는다." 이 발견의 배경이 되는 패턴은 검출기가 영어를 모국어로 하지 않는 글쓰기를 어떻게 다루는지에 정리되어 있다.

기관들은 거짓 양성 기록에 대응해 조치를 취해 왔다. Vanderbilt는 2023년 8월 Turnitin의 AI detector를 비활성화했는데, 2022년에 제출한 75,000편의 논문을 기준으로 1%의 거짓 양성률은 약 750편이 잘못 표시된다는 판단에 따른 것이었다. Michigan State의 문서에는 AI 탐지 도구가 학생에 대한 불리한 조치의 유일한 근거가 되어서는 안 된다고 명시되어 있으며, University of Texas at Austin은 AI 탐지 소프트웨어를 전혀 승인하지 않는다. AI detector가 실제로 얼마나 정확한지는 하나의 범주로서, 귀하의 기관이 어떤 제품을 라이선스하는지와는 별개의 문제이다.

채점을 우회하는 모델, 과정 추적

거짓 양성 문제에 대한 다른 해법이 기관의 관심을 얻고 있다. 완성된 텍스트를 채점하는 대신 문서가 어떻게 작성되었는지를 기록하는 방식이다. Grammarly의 Authorship 기능과 평가 플랫폼 Cadmus는 모두 이런 방식으로 작동하며, 글쓰기 과정, 타이핑, 붙여넣기, 수정 이력을 발생하는 대로 포착한다. 과정 기록은 실제로 타이핑된 에세이를 거짓 양성으로 판정할 수 없는데, 바로 그 실패 양상이 대학들이 detector를 끄게 만든 원인이었다. 절충점은 다르다. 감시의 문제는 통계의 문제를 대체하지만, 귀하의 기관이 이들 중 하나를 채택한다면 위의 detector 논쟁은 귀하에게 대체로 무의미해진다. 증거는 확률 점수가 아니라 과정 로그이기 때문이다.

귀하가 전달받은 detector 점수를 읽는 방법

맥락이 없는 수치는 거의 언제나 도착한다. 네 가지 질문이 그것을 충분히 복원하여 타당한 대화를 가능하게 한다.

  • 어떤 도구인지, 그리고 어떤 수치인지. 문서 수준의 백분율과 문장 수준의 하이라이트는 같은 공급업체에서 나온 서로 다른 공개 오류율을 가지며, Turnitin의 경우 각각 1%와 약 4%이다.
  • 공급업체가 오류에 대해 무엇을 공개했는지. 미탐률과 오탐률을 명시하는 도구는 그 한계를 어디에 두는지 알려 준다. 정확도 백분율만 공개하는 도구는 그렇지 않다.
  • 점수가 증거인지, 아니면 단지 검토를 촉발하는 신호인지. Michigan State의 표현, 즉 이러한 도구는 불리한 조치의 유일한 근거가 되어서는 안 된다는 문구는 흔한 기관의 입장이며, 항소에서 인용할 가치가 있다. 항소 서한 안내는 그 방법을 보여 준다.
  • 귀하의 기관 정책이 실제로 무엇이라고 말하는지. 탐지기가 라이선스를 받았는지, 그 출력이 부정행위 절차에서 사용될 수 있는지, 학생이 무엇을 요청할 수 있는지는 어딘가에 문서화되어 있으며, 대학마다 크게 다르다.

Turnitin이 humanized text를 어떻게 처리하는지는 별도로 설명되며, humanizer 대안에 대한 더 넓은 조사와 함께 제시된다.

탐지기 공급업체들은 계속해서 반올림된 수치를 공개할 것이며, 대부분은 그 수치가 어디에서 왔는지 밝히기를 계속 거부할 것이다. 당신의 작업이 이 열 가지 중 어느 것에 해당하는지는 그것을 읽는 사람이 결정하므로, 유용한 준비는 누군가가 당신에게 백분율을 제시하기 전에 그 도구가 자체 오류율에 대해 무엇을 공개하는지 아는 것이다. 현재 TextPulse 요금은 별도의 페이지에 있으며, 요약본이 아니라 그곳에서 갱신된다.

우리 자체 연구가 밝혀낸 것

TextPulse Research의 탐지기 일치도 연구에서는 9개의 상용 AI 탐지기가 동일한 90개의 학술 텍스트를 평가했습니다. 그중 하나는 455단어짜리 하이브리드 텍스트로, 사람이 쓴 서두와 결말 사이에 168단어의 AI 생성 중간 부분이 끼어 있습니다. Copyleaks는 이 텍스트를 0% AI로 판정했지만, 같은 문장에 대한 다른 도구들의 판정은 0%에서 95.7%까지 갈렸습니다. 전체 논문, 말뭉치, 도구별 점수 행렬은 TextPulse Research에서 공개되어 있습니다.

연구 말뭉치의 하이브리드 텍스트에 대한 Copyleaks의 판정.
연구 말뭉치의 하이브리드 텍스트에 대한 Copyleaks의 판정.
연구 말뭉치의 하이브리드 텍스트에 대한 Sapling의 판정.
연구 말뭉치의 하이브리드 텍스트에 대한 Sapling의 판정.
XLinkedInFacebook

자주 묻는 질문

어떤 판매자의 주장도 이를 확정하지는 않지만, 가장 최근의 독립적 증거는 Pangram을 지지한다. 2026년 Vrije Universiteit Brussel의 연구가 International Journal for Educational Integrity에 실렸으며, 완전히 AI가 생성한 학술 논문에서 중앙값 점수가 실제 값에 가장 가까웠던 도구가 Pangram뿐이라고 밝혔다. 반면 GPTZero, Copyleaks, Turnitin은 중앙값이 20% 미만이었다. 또한 NBER 워킹 페이퍼는 Pangram만이 오탐을 0.5% 이하로 유지했다고 밝혔다. 두 연구 모두 최근의 것이지만 범위는 제한적이며, 어떤 탐지기의 출력도 그것만으로는 증거가 되지 않는다.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

AI 휴머니제이션 소식을 받아보세요

학술 글쓰기, AI 탐지, 휴머니제이션에 대한 팁을 받은편지함으로 받아보세요.

스팸은 없습니다. 언제든지 구독을 취소할 수 있습니다.