Compilatio AI Detector 검토: 유럽의 기관용 탐지기
Compilatio는 미국식 개요에서 Turnitin을 전제하는 곳에서 유럽 대학이 라이선스를 부여하는 탐지기이다. 프랑스에서 개발되었고, 50개국 이상에서 1,100개가 넘는 학교가 사용하며, 학생이 제출 전에 자신의 과제에 대해 스스로 실행할 수 있는 유일한 주요 기관용 탐지기이다. 이 도구는 AI 텍스트를 잡아내는 신뢰성 비율이 94 to 99%이고 오탐은 1% 미만이라고 주장한다. 이를 포함한 유일한 동료심사 연구는 14개 도구 중 2위로 평가했으며, 시험한 도구들이 정확하지도 신뢰할 수도 없다고 결론지었다. 여기서는 근거가 무엇을 뒷받침하는지 살펴본다.
Compilatio는 유럽 대학들이 라이선스를 취득하는 AI detector이며, 미국의 개요 글에서는 Turnitin을 전제로 하는 경우가 많다. 이 도구는 프랑스에서 개발되었고, 20년이 넘도록 표절 분야에서 사업을 해 왔으며, 자체 사이트는 50개가 넘는 국가에서 1,100개가 넘는 학교가 도입되었다고 보고한다. 프랑스, 벨기에, 스위스 또는 스페인에서 논문을 작성하고 있다면, 이것이 종종 그 글을 읽는 소프트웨어다.
그 정확성 주장에는 구체성이 있다. AI가 생성한 문단을 탐지할 때 "94 to 99% reliability rate"를 보이며, "less than 1% false positives"라고 한다. Compilatio를 포함한 유일한 동료 심사 연구는 이를 14개 도구 중 2위로 평가했으며, Turnitin 다음이었고, 시험한 도구들이 "neither accurate nor reliable"하다고 결론지었다.
연구자들이 신뢰할 수 없다고 판단한 분야에서의 2위라는 점이 이 검토의 긴장이다. Compilatio는 또한 기관 차원의 경쟁자들이 하지 않는 일을 하나 더 한다. 평가받는 학생들에게도 같은 detector를 판매하며, 가격은 4.99 euros부터 시작한다.
Compilatio는 무엇이며, 실제로 누가 사용하는가?
Compilatio는 문서를 누가 들고 있느냐에 따라 나뉜 네 가지 제품을 판매한다. Magister는 교사용 유사성 검사기다. Magister+는 그 위에 AI 탐지, 심층 패러프레이징 탐지, 다국어 및 번역 탐지, 문법 검사를 추가한다. Studium은 학생용 버전으로, 크레딧 단위로 판매된다. Compilatio Copyright는 출판 전에 원고를 점검하는 전문 작가와 편집자를 대상으로 한다.

이 회사는 100만 명이 넘는 사용자, 50개국이 넘는 지역에서의 존재, 그리고 학교의 95%가 매년 재구독한다는 점을 보고한다. 서버는 프랑스에 있으며, 이는 학생 과제를 미국 처리업체로 보내기 전에 GDPR 의무를 검토하는 유럽 기관에 실제로 중요한 장점이고, Compilatio가 프랑스어권 시스템을 Turnitin이 영어권 시스템을 다루는 방식으로 다루는 이유의 일부이기도 하다.
Compilatio가 자사 정확성에 대해 주장하는 내용
이 공급업체의 AI detector page는 AI 생성 문단을 탐지하는 데 "94 to 99% reliability rate"와 "less than 1% false positives"를 제시하며, 이 범위는 문서 길이, 언어, 학술 콘텐츠 유형에 따라 달라진다고 밝힌다. 또한 이 탐지기는 35개 이상의 언어를 지원하고, ChatGPT의 출력은 GPT-5.2, GPT-5.1, GPT-5, GPT-4.5, GPT-4o, GPT-4o Mini 전반에서 인식하며, 더불어 Gemini, Claude, DeepSeek, Copilot의 출력도 인식한다고 말한다. 결과는 교사에게 0에서 100 사이의 백분율로 전달되며, 문서의 어느 정도가 기계 생성인지 추정한다.
자사 블로그에서 이 회사는 그 수치를 맥락 속에 놓는다. 2023년 탐지기의 정확도를 "over 70%"라고 보고하고, 이후 신뢰성이 "increased by more than 20%"라고 말한다. 이는 탐지기 웹사이트에서는 드문 일로, 공급업체가 자사 제품의 과거 성능을 공개하는 것이다.
면책 조항도 이례적으로 직접적이다. Compilatio는 "the percentage of AI-generated content should always be interpreted with caution and complemented by human analysis", "AI detectors can't pretend to be 100% accurate", 그리고 "the final judgment should always rest with educators and students"라고 명시한다. 이를 아무런 단서 없이 99%의 확실성을 광고하는 경쟁사들과 대비하면, 이 범주에서는 더 정직한 제시이다. 다만 이는 여전히 공급업체의 테스트이며, 제품을 판매하는 회사가 수행하고 보고한 것이다.
독립적 증거가 보여주는 것
중요한 연구는 Weber-Wulff and colleagues in the International Journal for Educational Integrity이며, 이 연구는 14개의 시스템을 시험했다. 즉, 공개적으로 이용 가능한 12개 도구와 상용 도구인 Turnitin 및 PlagiarismCheck를 포함한다. 정확도에 관해, 논문은 "Turnitin received the highest score using all approaches to accuracy classification, followed by Compilatio and GPT-2 Output Detector"라고 보고한다. 14개 중 2위는 Compilatio가 얻을 수 있는 가장 좋은 독립적 순위이다.
이 범주 전체에 대한 논문의 평가는 그 순위가 시사하는 것보다 더 엄격하다. 저자들은 "available detection tools are neither accurate nor reliable and have a main bias towards classifying the output as human-written rather than detecting AI-generated text"라고 결론지었고, 또한 "content obfuscation techniques significantly worsen the performance of tools"라고 밝혔다. 텍스트를 human-written으로 분류하는 쪽으로 기울어진 탐지기는 거짓 양성에서는 매우 우수해 보이지만, 잡아야 할 AI 텍스트를 놓치게 되며, 이것이 1% 미만의 거짓 양성 주장 뒤에 있는 절충이다.
| 질문 | Compilatio가 공개하는 내용 | 독립적 시험이 확인한 내용 |
|---|---|---|
| AI 구절에 대한 신뢰성 | 제공업체 자체 시험에 따르면 94 to 99% | 14개 도구 중 2위로 평가되었으며, 전체 결론은 이 범주가 신뢰할 수 없다는 것이었다 |
| 거짓 양성 | 1% 미만 | Compilatio에 대한 독립적 수치는 없다. 시험된 도구들은 텍스트를 human-written으로 분류하는 쪽으로 편향되어 있었다 |
| 패러프레이즈되거나 은폐된 AI | Magister+는 "deep rephrasing" 탐지를 마케팅한다 | 은폐는 시험된 도구 전반에서 성능을 "significantly worsened"시켰다 |
| 언어 | 35개 이상 | 언어별로 독립적인 벤치마크는 이루어지지 않았다 |
두 가지 유보 사항은 서로 반대 방향으로 작용하며, 둘 다 정직한 해석이라면 반드시 포함되어야 한다. 그 연구는 2023년대 모델을 대상으로 했으므로, 현재의 탐지기가 GPT-5 출력물을 어떻게 처리하는지에 대해서는 아무것도 말해 주지 않으며, 그 이후 Compilatio가 주장한 20포인트 개선도 그 안에는 나타나지 않는다. 반대로, 가장 최근의 대규모 기관 간 직접 비교인 2026년 Vrije Universiteit Brussel 연구는 Pangram, GPTZero, Copyleaks와 Turnitin을 160편의 긴 학술 논문에 적용했지만 Compilatio는 포함하지 않았다. 따라서 그 94 to 99%는 어느 쪽이든 현재의 외부 확인을 받지 못한 상태이다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
재표현 주장에 더 흥미로운 점이 있다
대부분의 탐지기는 하나의 수치를 판매한다. Magister+는 여러 수치를 판매하며, 추가 수치들은 회피를 직접 겨냥한다. 이 도구는 "deep rephrasing의 탐지"를 광고하며, 이를 의미적 표절로 규정하고, 한 언어로 초안을 작성한 뒤 다른 언어로 번역하여 다시 쓰는 작업을 위한 "다국어 유사성, 번역의 탐지"도 함께 제시한다. 또한 문서 안에 문자를 숨겨 육안으로는 텍스트를 읽을 수 없게 만드는 수법인 "인식되지 않은 언어" 구절의 비율과 위치도 보고한다.
이 기능 구성은 학생들이 유사성 검사를 통과하려 할 때 가장 흔히 쓰는 두 가지 방식, 즉 출처를 바꾸어 표현하는 것과 번역하는 것을 정면으로 겨냥한다. 그것이 주장된 비율대로 작동하는지는 바로 독립적으로 검증되지 않은 부분이며, 오브퍼스케이션이 탐지를 유의하게 악화시킨다는 Weber-Wulff의 발견은 이 특정 기능이 아니라 그 시대의 도구들에 적용되는 것이다. 어느 쪽이든 이해할 가치가 있는 점은, 패러프레이징과 AI 탐지는 서로 다른 문제이며, 이는 Turnitin이 패러프레이즈된 텍스트를 탐지하는지 여부에서 다루어지고, 분류기가 실제로 읽는 신호는 AI 탐지기가 작동하는 방식에서 설명된다는 것이다. 초안 자체의 문장 변이를 free burstiness checker로 확인하면, 공급업체의 표제 수치보다 탐지기가 무엇에 반응하는지 더 잘 알 수 있다.
가격과 접근성, Turnitin이 제공하지 않는 부분을 포함하여
Studium은 분석 크레딧으로 판매되며, 250단어당 1크레딧이 적용되고, 6개월 동안 유효하며 여러 문서에 걸쳐 사용할 수 있다. 패키지는 5,000단어에 4.99유로의 20크레딧, 20,000단어에 12.99유로의 80크레딧, 40,000단어에 19.99유로의 160크레딧, 100,000단어에 34.99유로의 400크레딧이다. 첫 부분 분석은 무료이며, 상위 세 개의 일치 출처를 미리 보여 준다. 소속 기관이 이미 구독 중인 학생은 연간 40개의 무료 크레딧을 받으며, 이는 대략 10,000단어에 해당한다.
Magister와 Magister+에는 공개 가격이 없다. 기관은 견적을 요청하며, 이는 이 시장의 절반에서는 표준적인 방식이다.
접근 지점은 가격보다 더 중요하다. Turnitin으로 평가받는 학생은 자신의 초안을 먼저 Turnitin으로 직접 실행할 수 없고, LMS를 통해 Copyleaks로 평가받는 학생은 보통 점수가 나온 전체 보고서를 볼 수 없다. Compilatio 기관에 속한 학생은 커피 한 잔 값으로 같은 AI 검사를 구매하고, 무엇인가를 제출하기 전에 결과를 읽을 수 있다. 이것이 이 검토에서 가장 실용적으로 유용한 사실이다.
Compilatio가 탐지기 환경에서 차지하는 위치
Compilatio는 신뢰할 수 있는 유럽의 기관용 선택지이며, 대부분의 경쟁사보다 더 신중하게 자신을 제시한다. 단일 수치가 아니라 범위를 제시하고, 점수 산정에 사용한 내용을 공개하며, 백분율이 판정이 아님을 명시적으로 안내한다. 이는 Compilatio에 유리한 점이다.
그러나 근거 기반은 여전히 배포 범위보다 얇다. 2023년 모델을 대상으로 한 연구에서 전체 범주를 신뢰할 수 없다고 판단한 가운데, 14개 중 2위였던 동료 심사 게재 1건이 그것에 대해 독립적으로 확인된 전부이다. 94에서 99%라는 수치는 공급업체 자체의 수치이며, Magister+를 특징짓는 재표현 및 번역 탐지는 외부 검증이 전혀 없다. 그렇다고 이 도구가 나쁘다는 뜻은 아니다. 그것은 Compilatio의 백분율이 무엇인가를 증명하는 것이 아니라 더 자세히 살펴볼 이유가 된다는 뜻이며, 바로 그것이 해당 문서 자체가 말하는 바이다.
공정성 문제는 여기서도 이 범주 전체에서와 마찬가지로 적용되며, 특히 제2언어로 글을 쓰는 학생들에게 가장 큰 영향을 미친다. 이는 AI 탐지기가 비원어민 영어 작성자에게 편향되는 이유에서 문서화된 양상이다. 점수가 자신이 직접 쓴 작업에 불리하게 사용된다면, 실질적인 대응은 AI를 사용하지 않았음을 입증하는 방법에 제시되어 있으며, 더 넓은 정확성의 관점은 AI 탐지기는 정확한가에서 다룬다.
전체 비교
Compilatio는 학생, 연구자 또는 채점자가 접할 가능성이 높은 10개 탐지기 중 하나이며, 이 리뷰가 발견한 패턴, 즉 전면에는 자신 있는 공급업체 수치가 있고 그 뒤에는 독립적 기록이 빈약하다는 점은 이들 모두에서 반복된다. Turnitin, GPTZero, Copyleaks, Pangram, Originality.ai 및 나머지 도구들과 같은 증거 우선 기준에서 어떻게 비교되는지는 전체 AI 탐지기 비교 가이드를 참조하라.
자주 묻는 질문
Compilatio는 자체 시험에 근거하여 AI 생성 구절을 탐지하는 신뢰성 비율이 94 to 99%이고 오탐은 1% 미만이라고 밝히며, 그 범위는 문서 길이, 언어, 내용 유형에 따라 달라진다고 설명한다. 독립적으로는, 이를 포함한 유일한 동료심사 연구인 International Journal for Educational Integrity의 Weber-Wulff와 동료들은 14개 도구 중 Turnitin 다음인 2위로 평가했지만, 시험한 도구들이 정확하지도 신뢰할 수도 없으며 텍스트를 인간이 쓴 것으로 분류하는 경향이 있다고 결론지었다. 그 연구는 2023년대 모델을 사용했으며, Compilatio에 대한 현재의 독립적 시험은 출판되지 않았다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.