Turnitin은 ChatGPT를 탐지할 수 있는가? 무엇을 잡고 무엇을 놓치는가
Turnitin의 AI 글쓰기 보고서와 표절 보고서는 서로 다른 대상과 서로 다른 정확도 기록을 가진 별개의 제품이다. 여기서는 AI 점수가 실제로 무엇을 측정하는지, 독립적 시험에서 어디서 한계가 드러나는지, 그리고 왜 당신의 보고서가 룸메이트의 보고서와 다를 수 있는지를 설명한다.
예, 하지만 그것은 특정한 종류의 AI 사용에 한정되며, 대부분의 학생은 보지 못하는 보고서 안에서만 그렇습니다. Turnitin의 AI writing indicator는 언어 모델에서 통계적으로 전형적으로 보이는 산문을 표시하며, 스캔하는 에세이 중 점점 더 많은 비율에서 그렇게 합니다. 2025년 10월부터 2026년 2월 사이에 약 15%가 80% 이상의 AI-generated writing을 보였고, 이는 도구가 2023년 4월에 출시되었을 때의 약 3%에서 증가한 것입니다. 그것이 특정 제출물을 표시할지 여부는 can Turnitin detect ChatGPT에 대한 대부분의 답변이 건너뛰는 세부 사항에 달려 있습니다. AI report가 plagiarism report와 어떻게 다른지, 실제로 누가 그 숫자를 보게 되는지, 그리고 그 숫자가 얼마나 자주 틀리는지입니다.
이 글은 일반적인 academic integrity가 아니라 이 하나의 제품의 작동 방식을 다룹니다. AI writing report가 무엇을 측정하는지, 독립적인 테스트에서 무엇을 맞히고 무엇을 틀렸는지, 그리고 동일한 과제를 제출한 두 학생이 어느 대학에 다니는지에 따라 왜 서로 다른 결과를 받을 수 있는지를 설명합니다. 이 모든 것은 귀하의 강의 안내서가 허용하는 AI 사용에 대해 말하는 내용을 바꾸지 않습니다. 그것은 블랙박스에 대한 추측을 그 안에 실제로 무엇이 들어 있는지에 대한 설명으로 바꿉니다.
Can Turnitin Detect ChatGPT? 보고서는 실제로 무엇을 보여 주는가
Turnitin AI writing report는 plagiarism을 확인하는 similarity report와는 별도의 제품입니다. 이 둘은 서로 다른 모델에서 작동하며 같은 인터페이스의 서로 다른 탭에 표시됩니다. similarity score는 제출물을 살펴보고 이전에 출판된 자료와 다른 학생 논문으로 이루어진 데이터베이스와 비교하여 일치하는 비율을 반환합니다. AI score는 전혀 다른 일을 합니다. 그것은 산문을 문장 단위로 읽는 분류기이며, 각 문장에 대해 AI-generated일 가능성을 할당한 다음, 그 문장 수준의 점수를 하나의 문서 비율로 합칩니다. 이들은 서로 다른 것을 측정하므로, 어떤 제출물은 similarity score가 2%이고 AI score가 60%일 수 있고, 반대로도 가능합니다.
이 비율은 실제로 들리는 것보다 더 좁다. 이는 모델이 AI가 작성했다고 예측한 적격 산문의 비율이며, 전체 문서가 아니다. 점수를 계산할 때 코드 블록, 글머리표, 제목, 짧은 형식의 글쓰기를 제거하기 때문이다. 이 탐지기는 최소 300단어의 장문 산문이 있는 문서에만 적용할 수 있으며, 이 글을 쓰는 시점에서 영어, 스페인어, 일본어 텍스트에만 적용된다. 예상할 수 있듯이, 일반적으로 AI 탐지기가 그 점수를 계산하는 방식과 나란히 놓고 보면, 여기서의 패턴은 익숙하다. 정밀해 보이는 문서 수준의 수치는 제목이 암시하는 것보다 더 좁은 텍스트 일부를 바탕으로 만들어진다.
AI로 표시되는 것, ChatGPT와 그 밖의 것들
Turnitin은 자사의 분류기가 브랜드명이 아니라 글쓰기 패턴을 찾는다고 말하며, 2023년 원래의 GPT-3.5와 GPT-4 출시 이후 적용 범위는 반복적으로 확장되어 왔다. 현재 안내에서는 GPT-5 계열, Gemini, Claude를 포함해 그것이 학습된 시스템들을 명시하며, 새로운 모델 출시가 지속적으로 추가되고 있다. 여기에는 ChatGPT를 전혀 거치지 않은 텍스트도 포함된다. 대신 Gemini, Claude 또는 DeepSeek를 사용한 학생도 단지 다른 회사를 선택했다고 해서 탐지기를 우회하는 것은 아니다. Turnitin의 모델 설명 자체는 어떤 공급자가 텍스트를 생성했는지가 아니라 텍스트가 어떻게 읽히는지만을 기준으로 삼는다고 분명히 밝히고 있다.
AI 텍스트를 바꿔 쓴 경우에도 별도의 범주로 분류되며, 그냥 통과되는 것은 아니다. Turnitin의 문서는 AI가 생성한 것으로 판단한 텍스트와, AI가 생성한 것으로 판단한 뒤 AI로 바꿔 쓴 텍스트를 구분한다. 또한 2025년 8월에는 기계 출력물을 탐지기를 통과하도록 다시 쓰기 위해 만들어진 AI 우회 도구를 겨냥한 탐지를 추가했다. 그렇다고 해서 바꿔 쓰기가 무의미하다는 뜻도 아니고, 다시 쓴 모든 구절이 적발된다는 뜻도 아니다. 이는 기본적으로 바꿔 쓰기가 Turnitin에 보이지 않는다는 가정이 이미 오래전에 구식이 되었다는 뜻이다.
Turnitin의 AI 점수는 얼마나 정확한가?
Turnitin의 정확성 주장은 하나의 핵심 수치로 귀결된다. 이 회사는 텍스트의 20% 이상이 표시된 문서에서 거짓 양성률을 1% 미만으로 유지한다고 말한다. 또한 이 정확성을 검증하기 위해 ChatGPT가 존재하기 전에 작성된 700,000편의 학술 논문을 대상으로 모델의 새 버전마다 시험한다고도 밝힌다. 이는 특정한 조건 집합에 관한 구체적이고 검증 가능한 주장이다. 그대로 그렇게 읽는 것이 타당하다. Turnitin은 출시 직후인 2023년에도 정확성에 관해 다른 주장을 한 바 있다. 회사의 최고 제품 책임자는 실험실 테스트가 실제 사용에서 얼마나 많은 거짓 양성이 나타날지를 예측하지 못했다고 공개적으로 인정했으며, 특히 짧은 제출물에서 그러했다고 말했다. 그는 거짓 양성의 비율이 시험 환경보다 실제 환경에서 더 높았다고 밝혔다. 그는 문장 수준의 거짓 양성률을 약 4%로 보고했고, 그 결과 점수 산정이 가능한 제출물의 최소 길이를 150에서 300 words로 늘렸다고 언급했다. 현재의 최소 길이도 여전히 300 words이다.
독립적 시험은 판매업체의 수치가 보여주지 않는 세부 사항을 더한다. Temple University's Center for the Advancement of Teaching은 이용 가능한 더 신중한 검증 중 하나를 수행했는데, 이는 실험실 조건과 실제 제출물 사이의 간극을 계속 드러내는 AI 탐지기의 독립적 시험과 같은 취지였다. 연구자들은 120개의 글쓰기 샘플을 제출했으며, 이를 완전히 인간이 작성한 글, 완전히 AI가 생성한 글, AI가 생성한 글을 패러프레이징 도구에 통과시킨 글, 그리고 인간과 AI의 기여를 결합한 하이브리드 텍스트로 균등하게 나누어 각 경우에 Turnitin이 반환한 결과를 기록했다. 이 도구는 순수하게 인간이 작성한 샘플의 93%와 순수하게 AI가 생성한 샘플의 77%를 정확히 식별했다.
더 어려운 질문에서는 정확도가 더 크게 떨어졌다. Turnitin은 바꿔쓴 AI 샘플의 63%만 AI 생성으로, 하이브리드 샘플의 43%만 완전히 인간도 완전히 AI도 아닌 것으로 정확하게 식별했는데, 이는 AI의 도움을 받은 글이 실제로 생성되는 방식에 가장 가까운 범주이다. 특히 하이브리드 텍스트는 연구자들의 관심 대상이었는데, 더 많은 강좌가 학생들에게 작업의 일부에 AI를 사용하도록 요구하는 과제를 부여함에 따라, 이것이 앞으로 실제 제출물의 큰 부분, 아마도 과반을 차지할 가능성이 있다고 그들은 믿기 때문이다.
| 무엇을 시험했는가 | Turnitin의 결과 |
|---|---|
| 100% 인간이 작성한 샘플 | 93%를 인간으로 정확하게 식별 |
| 100% AI 생성 샘플 | 77%를 AI로 정확하게 식별 |
| 바꿔쓰기 도구를 거친 AI 텍스트 | 63%를 AI로 정확하게 식별 |
| 하이브리드 샘플, 일부는 인간, 일부는 AI | 43%를 0%도 100%도 아닌 것으로 정확하게 식별 |
| 20%를 초과해 표시된 문서, Turnitin 자체 수치 | 1% 미만의 false positive rate |
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
수치가 맞아 보이더라도 어디서 무너지는가
문서 수준 점수만 교사가 볼 수 있는 것은 아니며, 다른 보기는 신뢰도가 더 낮다. 일부 인터페이스에서는 교사가 특정 문장을 AI가 작성한 것으로 보이는 부분으로 강조 표시한 flag report를 열 수 있다. Temple의 연구자들은 그 강조 표시를 하이브리드 샘플의 어떤 문장이 실제로 AI가 작성한 것인지와 대조했지만, 둘 사이에 아무런 관련성을 발견하지 못했다. 요약 비율 대신 강조 표시된 문단의 스크린샷을 교수가 당신에게 전달하는 경우, 이것은 중요하다. 전체 문서 점수는 문장 수준 강조 표시보다 훨씬 더 잘 작동했다.
낮은 점수는 다시 다르게, 그리고 예전보다 더 신중하게 처리된다. 2024년 7월 이후 Turnitin은 모델이 문서의 20% 미만이 AI-written이라고 추정할 때마다 숫자 대신 별표를 표시하는데, 그 구간이 도구가 어느 쪽으로든 가장 잘못 판단하기 쉬운 범위이기 때문이다. 가벼운 AI-assisted 편집, 즉 한 단락은 도움을 받아 다시 쓰고 나머지는 도움 없이 작성한 경우에는, 작은 비율이 아니라 아예 눈에 보이는 퍼센트가 전혀 나타나지 않는 일이 흔한데, 숫자가 없다는 사실을 어떤 증거로 받아들이기 전에 이것을 알아둘 필요가 있다.
누가 실제로 그 숫자를 보는가
AI 점수는 기본적으로 학생에게 보이는 보고서의 일부가 아니다. 그것은 별도의 탭에 있으며, 강사와 관리자에게만 보이고, 학생은 강사가 보고서를 공유하거나 직접 제시하기로 선택한 경우에만 그것을 본다. 이는 유사성 점수와는 실제로 구조적으로 다른데, 유사성 점수는 제출물이 처리된 뒤 학생이 보통 같은 시스템 안에서 직접 확인할 수 있기 때문이다.
같은 원리는 특정 강좌에 이 기능이 아예 존재하는지 여부에도 적용되며, 이는 강사보다 상위의 기관 차원 결정이다. 계정 수준의 관리자는 기관 전체에 대해 Turnitin의 AI detection을 켜거나 끌 수 있다. 한 강사는 자신의 대학이 이를 꺼 두었다면 켤 수 없을 수 있고, 그 반대도 마찬가지다. 한 대학의 학생이 다른 대학의 학생과 비슷한 과제를 제출하더라도, 두 사람이 쓴 내용과는 전혀 무관한 이유로 이 도구에 대해 매우 다른 경험을 할 수 있다.
왜 일부 대학은 이를 껐는가
University of Waterloo는 2025년 9월에 Turnitin의 AI 탐지 기능을 중단했으며, 그 공개된 이유는 이례적으로 직접적이다. 이 대학은 해당 도구의 문서화된 신뢰성 부족, 영어가 모국어가 아닌 학생들에 대한 편향, 그리고 적어도 하나의 사례에서 완전히 인간이 작성한 텍스트를 100% AI-generated로 판정한 자체 내부 시험을 근거로 들었다. 도구의 비용과 비교했을 때, 대학은 비용이 편익을 상회한다고 결론 내렸고, 대신 그 노력을 평가 재설계와 AI 리터러시 교육으로 돌렸다.
Waterloo는 예외적 사례라기보다 더 넓은 분화의 한 눈에 보이는 예이다. 해당 기능을 계속 켜 두는 대학들은 일반적으로 점수를 그 자체로 판정으로 취급하기보다 안전장치를 추가해 왔으며, 어떤 공식 절차가 시작되기 전에 학생과의 대화를 요구하고, 그 수치를 대화를 닫는 근거가 아니라 여는 근거로 취급한다. 대학들이 AI 정책을 어떻게 다루고 있는지를 더 넓게 살펴보면 이러한 양상이 더 분명해진다. 점수가 실제로 사용자에게 전달되는지 여부는 기술 자체의 고정된 속성이 아니라, 세미나실보다 훨씬 위에서 내려진 결정에 달려 있다.
높은 점수가 입증하는 것과 입증하지 못하는 것
높은 AI 점수는 증거이지, 판정이 아니다. Turnitin 자체도 이 백분율을 부정행위의 판단이 아니라 강사의 판단을 위한 하나의 데이터 포인트로 제시하며, 위의 정확도 수치가 왜 그런 틀이 중요한지를 설명한다. 문서 수준 점수는 어느 정도 잘 작동하더라도, 대폭 수정되었거나 패러프레이즈되었거나 혼합된 글쓰기의 상당 부분을 잘못 읽고, 문장 수준의 강조 표시는 요약 수치보다 훨씬 덜 신뢰할 수 있다. 그렇다고 해서 개별 점수가 틀렸다고 보장되는 것은 아니다. 이는 하나의 백분율이 곧바로 받아들일 판정이 아니라 질문을 던질 이유라는 뜻이다. 다른 사람이 점수를 매기기 전에 자신의 글이 어디에 위치하는지 보고 싶다면, 분류기가 반응하는 동일한 저변동성의 일반적 표현 패턴은 free perplexity checker로 직접 확인할 수 있다.
TextPulse의 학생용 AI humanizer는 같은 통계적 기반에서 작동하며, 같은 측정의 문장 리듬 절반을 위한 무료 burstiness checker도 마찬가지이다. 이는 Turnitin이 그것에 대해 무엇을 말할지에 대한 예측이 아니라, 사용자의 초안 자체를 바탕으로 한 추정 Human Score를 제공한다. 자신이 통제하지 않는 시스템에 대해 어떤 도구도 그것을 책임 있게 약속할 수는 없다. 이를 자신의 글을 다시 읽어 보는 두 번째 검토 정도로만 받아들여야 한다.
이들 질문 가운데 몇몇은 각자 별도의 페이지를 갖고 있다. 어떤 detector도 전혀 없이 교수가 사용자가 ChatGPT를 사용했는지 알아낼 수 있는지, 그리고 그보다 더 직접적인 표현인 적발될지 여부는 따로 답변되어 있다. 패러프레이즈된 텍스트에 대한 Turnitin의 동작과, 특히 Turnitin이 DeepSeek 출력물을 탐지하는지 여부도 마찬가지이다. 특정 상황에 대해서는 간호학 프로그램에서의 AI 탐지와 대학 입학처가 이러한 점검을 수행하는지 여부에 관한 글이 있다. 더 넓은 틀은 학문적 진실성과 AI에 관한 별도의 글에 담겨 있다.
이 중 어느 것도 최종판일 가능성은 낮다. Turnitin은 2023년 이후 임계값, 가시성 규칙, 모델 적용 범위를 한 번 이상 다시 작성했으며, 2026년 8월도 마지막 말이 되지는 않을 것이다. 변하지 않는 것은, 어떤 detector를 특정 강좌가 사용하든 상관없이 갖추어 둘 만한 습관이다. 분류기가 무엇을 생각하든 그 판단이 중요하지 않게 될 정도로, 충분히 구체적이고, 불균일하며, 진정으로 자신의 것인 세부사항을 담아 글을 써야 한다.
Frequently Asked Questions
Turnitin의 AI 글쓰기 지표는 바로 이 질문에 답하기 위해 존재한다. Turnitin은 ChatGPT를 탐지할 수 있는가? 일반적으로는 그렇다, 문서에 상당한 양의 AI 글쓰기가 포함되어 있을 때 그렇다. 분류기는 언어 모델에 통계적으로 전형적인 산문을 표시하며, Turnitin의 자체 데이터에 따르면 현재 스캔된 에세이의 약 15%가 AI가 많이 작성한 것으로 점수가 매겨진다. 또한 텍스트를 자주 놓치며, 독립적 시험에서는 정확도가 패러프레이즈된 AI 글쓰기에서 63%, 혼합 텍스트에서 43%로 떨어지는 것으로 나타났다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.