Turnitin이 AI를 탐지하는 방식, 단계별로
Turnitin의 AI 글쓰기 탐지기는 문서를 전체로 읽지 않는다. 제출물을 여러 구간으로 나누고, 각 구간을 채점한 뒤, 결과를 평균내고, 그 다음에야 보고서에 백분율을 제시한다. 이 글은 그 절차, ChatGPT, Claude, Gemini 전반에서 무엇을 표시하는지, 독립적 시험에서 무엇을 놓쳤는지, 그리고 실제로 그 수치를 볼 수 있는 사람이 누구인지 다룬다.
Turnitin 보고서는 하나의 숫자, 예를 들어 42퍼센트를 반환할 수 있으며, 누군가 그 메커니즘을 찾아보지 않는 한 그것이 어떻게 산출되었는지에 대해서는 거의 아무것도 말해 주지 않는다. 그 숫자는 문서 전체를 보고 읽어낸 것도 아니고, 추측도 아니다. 그것은 모든 제출물에 대해 같은 방식으로 실행되는, 특정하고 문서화된 파이프라인의 최종 결과이다.
그렇다면 Turnitin은 AI를 어떻게 탐지하는가? 제출물을 여러 부분으로 나누고, 각 부분이 AI 생성이거나 AI 생성 후 패러프레이즈된 것일 가능성에 따라 개별적으로 점수를 매긴 다음, 그 점수들을 평균하여 보고서에 표시되는 전체 퍼센트 점수를 결정한다. 이 파이프라인의 모든 단계는 Turnitin 자체 문서에 설명되어 있으며, 외부에서 역공학한 것이 아니다.
이 내용은 특히 Turnitin의 AI writing detection 기능에 관한 것으로, 제출물을 다른 문서들과 비교하는 기존의 유사도 또는 표절 검사와는 별개의 시스템이다. 아래의 작동 방식은 더 넓은 질문인 AI detectors가 실제로 어떻게 작동하는가 안에 포함되며, Turnitin은 다른 공급업체들보다 자체 방법을 더 많이 공개하기 때문에 특히 유용한 사례이다. 이어지는 내용은 먼저 파이프라인을 설명하고, 그다음 실제로 무엇을 표시하는지, 독립적 테스트에서 무엇을 놓치는 것으로 나타났는지, 그리고 기관 내부에서 누가 실제로 그 결과를 보게 되는지를 다룬다.

Turnitin은 AI를 어떻게 탐지하는가? 파이프라인 개요
Turnitin의 AI 글쓰기 탐지기는 고정된 순서로 네 단계를 거친다. 첫째, 문서에 점수를 매길 수 있을 만큼의 적격 산문 텍스트가 있는지 확인한다. 둘째, 그 텍스트를 각각 수백 단어 정도의 구간으로 나눈다. 셋째, 모델이 각 구간을 개별적으로 점수화한다. 넷째, 구간 점수들을 평균하여 독자가 실제로 보게 되는 단일 문서 수준의 백분율로 만든다.
AI 글쓰기 보고서는 유사도 보고서가 아니다
Turnitin의 AI 글쓰기 보고서는 표절 여부를 확인하는 유사도 보고서와는 별도의 제품이다. 두 보고서는 서로 다른 모델에서 작동하며, 같은 인터페이스의 서로 다른 탭에 표시된다. 유사도 점수는 제출물을 이전에 출판된 자료와 다른 학생 논문으로 이루어진 데이터베이스와 대조하여 일치하는 백분율을 반환한다. AI 점수는 전혀 다른 일을 한다. 분류기가 산문을 읽고, 점수가 매겨진 각 구간에 AI가 생성했을 가능성을 부여한 뒤, 그 점수들을 하나의 문서 백분율로 합산한다. 서로 다른 것을 측정하므로, 한 제출물은 유사도 점수 2 percent와 AI 점수 60 percent를 동시에 가질 수도 있고, 그 반대일 수도 있다.
AI 백분율은 또한 들리는 것보다 더 좁은 범위를 뜻한다. 이는 전체 문서가 아니라, 모델이 AI가 작성한 것으로 예측한 적격 산문의 비율을 설명한다. 코드 블록, 글머리표, 제목, 짧은 형식의 글쓰기는 점수가 계산되기 전에 제거되기 때문이다. 이 글을 쓰는 시점에서 탐지기는 영어, 스페인어, 일본어 텍스트에서만 작동한다.
첫 번째 단계, 문서를 구간으로 나누기
아무것도 점수화되기 전에, Turnitin의 모델은 제출물을 각각 수백 단어, 대략 구간당 다섯에서 열 문장 정도의 덩어리로 나눈다. 구간화가 먼저 이루어지는 이유는 모델이 그 정도 크기의 덩어리를 점수화하도록 설계되었지, 단일 문장이나 전체 논문을 한 번에 처리하도록 만들어진 것이 아니기 때문이다.
산문 텍스트만 청크에 포함된다. 이 모델은 장문의 글을 읽도록 설계되었다. 산문과 표 또는 코드를 모두 포함하는 문서는 산문 텍스트의 일부 비율을 가진 것으로 점수화되지만, 문서에 있는 모든 산문 텍스트를 설명하지는 못할 수 있다. 이는 탐지기가 코드 블록, 글머리표, 또는 단문 텍스트를 포함하지 않는 데이터 풀을 점수화하기 때문이다. 따라서 문서는 제출된 내용의 일부만을 설명하는 비율을 반환할 수 있다.
청크 수준 점수화에는 덜 눈에 띄지만 언급할 만한 결과가 있다. 본래 인간이 작성한 몇백 단어 분량의 청크 안에 AI가 작성한 문장 하나가 들어 있으면, 그 문장은 해당 청크의 다른 모든 내용과 함께 평균화되므로, 그 청크 자체 점수에 미치는 영향은 같은 청크를 공유하는 주변 인간 작성 텍스트의 양만큼 희석된다. 짧은 AI 작성 삽입문도 여전히 모델에 도달한다. 다만 첫 단어부터 마지막 단어까지 AI가 작성한 청크보다 가중치가 더 낮을 뿐이다.
2단계, 각 세그먼트 점수화
각 청크는 문서의 다른 모든 청크와 독립적으로, 각자 따로 점수화된다. 모델은 해당 텍스트 구간이 인간 작성인지, AI 생성인지, 또는 AI 생성 후 패러프레이즈된 것인지 예측하며, 이는 단순한 예 또는 아니오가 아니라 세 가지 구분이다.
이는 별도의 범주이며, 단순히 AI 생성의 연장선이 아니다. 이는 패러프레이징이 탐지를 약화시킨다는 점에 실제 문제가 있음을 시사한다. 2023년 연구가 이를 뒷받침하는데, AI 생성 텍스트를 전용 패러프레이징 모델에 통과시키면 연구용 탐지기 DetectGPT의 정확도가 70.3%에서 4.6%로 떨어졌고, 거짓 양성률은 1%로 일정하게 유지되었다. Turnitin이 자사 세 가지 구분 분류기가 같은 기법에 대해 얼마나 견고한지에 관해 무엇인가를 공개한 것으로는 보이지 않는다. 이 범주는 문서화된 이유 때문에 존재한다.
청크 수준에서 채점하는 것은 전체 문서 수준에서 채점하는 것보다 의도적인 설계 선택이다. 두 개의 AI 초안 문단이 포함된 90쪽 분량의 논문과 전체가 AI 초안으로 작성된 5쪽 분량의 에세이는 서로 다른 문제이며, 청크 전체에 걸쳐 평균을 내는 방식이야말로 문서 수준의 하나의 수치가 그 차이를 반영하게 하고, 이를 평탄화하지 않게 한다.
Turnitin은 파이프라인 단계와 같은 수준의 세부성으로 이 청크별 모델의 내부 구조를 공개하지 않았다. 이는 라벨이 붙은 예시로 학습된 지도 분류기이며, TextPulse의 AI 탐지에서 perplexity가 실제로 측정하는 것에 대한 안내에서 다루는 원시 다음 토큰 점수에 대한 단순한 임계값이 아니다. 다만 동일한 근본 아이디어, 즉 비정상적으로 예측 가능한 텍스트는 그러한 분류기가 알아차리도록 학습하는 대상의 일부일 가능성이 매우 높다.
3단계, 문서 수준 백분율로 평균화하기
청크 점수는 보고서에 표시되는 하나의 백분율로 평균화된다. 그 백분율은 장문 글쓰기만을 대상으로 하는, 자격을 갖춘 산문 텍스트의 비율을 나타내며, 모델이 AI 생성 또는 AI 생성 후 패러프레이즈된 것으로 예측하는 비율이다. 이는 채점된 세그먼트의 비율이지, 문서의 단어 중 정확히 어느 정도가 문자 그대로 기계에 의해 입력되었다는 주장과는 다르다.
보고서의 백분율은 평균값이다. 이것이 바로 둘 다 40%를 반환하는 두 문서가 가까이서 보면 다르게 보일 수 있는 이유다. 하나는 청크의 40%가 완전한 AI 생성으로 채점되었을 수 있다. 다른 하나는 모든 청크가 부분적으로 가능성이 있는 것으로 채점되어, 평균적으로 같은 표면상의 수치가 될 수 있다. 그것만으로는 어떤 패턴이 그 결과를 만들어냈는지 보여주지 않는다.

Turnitin은 ChatGPT, Claude 또는 Gemini를 탐지할 수 있는가?
대체로 그렇다. 문서에 상당한 양의 AI 작성이 포함되어 있고, 분류기가 그것을 어떤 공급자가 생성했는지는 중요하게 여기지 않을 때 그렇다. Turnitin은 자사의 모델이 브랜드명이 아니라 글쓰기 패턴을 찾는다고 밝히며, 2023년 원래의 GPT-3.5와 GPT-4 출시 이후 적용 범위를 반복적으로 확대해 왔다. 현재 안내는 GPT-5 시리즈, Gemini, Claude를 포함하여 학습 대상으로 삼는 시스템을 명시하고 있으며, 새로운 모델 출시가 지속적으로 추가되고 있다. Gemini, Claude 또는 DeepSeek를 사용한 학생이 있다고 해서 단지 다른 회사를 선택했다는 이유만으로 탐지기를 우회하는 것은 아니다.
이 영향이 미치는 제출물의 비율은 증가했다. Turnitin이 2025년 10월부터 2026년 2월 사이에 검사한 에세이의 약 15 percent가 80 percent 이상 AI-generated writing을 보였으며, 이는 도구가 2023년 4월에 출시되었을 때의 약 3 percent에서 증가한 것이다.
AI 텍스트의 패러프레이즈는 무조건 통과되는 것이 아니라 별도의 범주로 분류되며, 이것이 위에서 설명한 3분류 체계이다. Turnitin의 문서는 AI-generated only로 판단한 텍스트와 AI-generated and then AI-paraphrased로 판단한 텍스트를 구분하며, 2025년 8월에는 탐지기를 지나치도록 기계 출력을 다시 쓰기 위해 만들어진 AI bypasser tools를 겨냥한 탐지를 추가했다. 그렇다고 해서 패러프레이즈가 무의미하다거나, 다시 쓴 모든 구절이 적발된다는 뜻은 아니다. 이는 기본적으로 패러프레이즈가 Turnitin에 보이지 않는다는 가정이 이미 오래전에 시대에 뒤떨어졌음을 뜻한다. 이 도구가 특히 패러프레이즈된 텍스트와 DeepSeek 출력을 어떻게 처리하는지는 별도로 다룬다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
최소 단어 요건과 별표 임계값
Turnitin의 AI 탐지기가 점수를 생성하려면 제출물에 적격한 산문 텍스트가 최소 300 words 있어야 하며, 이는 이전의 150-word 최소치에서 상향된 것이다. 그보다 짧으면 segment-and-average process를 적용할 충분한 텍스트가 없다.
300단어의 하한선은 앞서 설명한 단일 채점 단위의 크기, 즉 수백 단어, 5개에서 10개의 문장과 맞닿아 있다. 최소치에 정확히 걸치는 문서는 실제로는 평균을 낼 수 있는 적격 텍스트를 여러 단위가 아니라 한 단위 분량만 파이프라인에 넘기는 셈이며, 이것이 바로 그 하한선 근처의 보고서가 다음 임계값이 표시하려는 덜 신뢰할 수 있는 범위에 들어갈 가능성이 더 높은 이유의 일부이다.
Turnitin도 20% 임계값 아래의 비율은 표시하지 않는다. 2024년 7월부터 보고서는 숫자 대신 퍼센트 기호 옆에 별표를 표시한다. 이러한 보고서 동작의 단일 요소는 파이프라인의 다른 어떤 부분보다 더 많은 혼란을 일으키므로, 아래에 별도의 절로 다룬다.
| 조건 | 보고서에 표시되는 내용 | 이유 |
|---|---|---|
| 적격 산문이 300단어 미만 | AI 점수 자체가 없음 | 분할 및 평균화 파이프라인이 신뢰성 있게 작동하기에 텍스트가 충분하지 않음 |
| 점수가 20% 미만으로 떨어질 경우 | 숫자 대신 퍼센트 기호 옆의 별표 | Turnitin의 자체 문서에 따르면 이 범위에서 거짓 양성 비율이 측정 가능하게 더 높음 |
| 점수가 20% 이상 | 구체적인 백분율 | Turnitin이 숫자로 표시할 만큼 신뢰할 수 있다고 간주함 |
Turnitin에서 별표 점수는 무엇을 의미하는가?
Turnitin AI writing report의 별표는 모델이 일부 AI writing을 감지했지만 문서의 20% 미만이었고, Turnitin이 그 범위에서는 숫자를 공개하지 않기로 했음을 의미한다. 일반적으로 백분율이 표시되는 자리에는 대신 퍼센트 기호 옆의 별표가 나타난다. Turnitin의 자체 제품 문서는 이를 직접적으로 다음과 같이 설명한다. "AI가 보고서에서 20% 임계값 아래로 감지되면, 이제 별표 (*%)로 표시되며 백분율은 부여되지 않는다."
따라서 별표는 오류도 아니고, 점수가 누락된 것도 아니며, 업로드 과정에서 무언가 잘못되었다는 신호도 아니다. 이는 공급업체가 신뢰할 만하다고 보지 않는 수치를 인쇄하지 않기로 한 의도적인 결정이다.
Turnitin이 20 percent 미만의 수치를 숨기는 이유
그 구간은 도구가 가장 잘못 판단할 가능성이 큰 영역이며, Turnitin의 자체 정확도 약속도 그 구간을 제외하도록 범위가 정해져 있기 때문이다. 이 회사는 "AI writing이 20%를 넘는 문서에 대해" 거짓 양성률을 "1% 미만"으로 유지하겠다고 약속한다. 범위를 주의 깊게 읽어야 한다. 이 약속에는 하한이 내장되어 있고, 그 하한이 바로 같은 20 percent이다. 그 선 아래에서는 회사가 같은 수준의 신뢰성을 주장하지 않으므로, 독자가 필연적으로 정밀한 수치로 받아들일 작은 숫자를 인쇄하는 대신 아예 아무것도 표시하지 않는다. 별표는 거짓 양성을 피하기 위해 존재하며, 다시 말해 교사에게 인간이 작성한 문서를 잘못 나타내는 수치를 넘기지 않기 위해 존재한다.
그 논리는 앞서 설명한 작동 방식과 일치한다. 문서 수준 점수는 수백 단어 단위의 조각들을 평균한 값이다. 그 조각들 가운데 AI로 판정되는 비율이 적을수록, 그 평균은 매우 약한 신호에 의존하게 되고, 처리 과정은 실제 8 percent와 허위의 8 percent를 신뢰성 있게 구분할 수 없다. 수치를 숨기는 것은 이에 대한 정직한 대응이며, 300단어 최소 기준 뒤에 있는 것과 같은 판단이다.
대학에서 별표가 실제로 의미하는 것
실무에서 대부분의 기관은 별표를 별도로 조치할 대상으로 보지 않으며, 인간이 작성한 글과 일치하는 낮은 점수로 읽는다. 이유는 분명하다. 탐지 도구를 만든 공급업체가 그 범위의 수치를 책임지지 않겠다고 한다면, 교사가 학생에게 제기할 실질적 사안은 없으며, 하물며 부정행위 심의위원회에 가져갈 사안도 없다. 대부분의 학문적 진실성 절차에서 별표가 표시된 보고서는 사실상 깨끗한 보고서와 같다.
이는 결과가 실제로 어떻게 사용되는지에 대한 설명이며, 별표를 보고 있는 상황이라면 알아둘 가치가 있다. 그러나 그것은 문서가 실제로 무엇인지에 대한 판단과는 같지 않으며, 이 구분은 양쪽 모두에서 중요하다.
별표가 의미하지 않는 것
- 이는 인간 저작의 증명서가 아니다. Turnitin은 문서를 자신 있게 채점하는 것을 보류하고 있으며, 이는 작성자에 관한 진술이 아니라 탐지기에 관한 진술이다.
- 이는 0과 같은 뜻이 아니다. AI 작성이 전혀 없는 문서와 AI의 도움을 받아 한 단락만 작성한 문서는 동일한 별표를 생성할 수 있으며, 바로 그렇기 때문에 수치가 제시되지 않는다.
- 이는 제출물 간에 비교 가능한 값이 아니다. 별표 두 개는 두 문서가 같은 기준선 아래에 놓였음을 알려 줄 뿐, 서로를 어떻게 비교하는지는 알려 주지 않는다.
- 이는 유사도 점수가 아니다. 표절 일치 검사는 별도의 탭에 있는 별도의 보고서이며, AI 표시기가 어떻게 작동하든 자체 백분율을 표시한다.
실무적으로 기억할 만한 결과는, 가벼운 AI 보조 편집, 즉 한 단락만 도움을 받아 다시 쓰고 나머지는 도움 없이 작성한 경우, 작은 백분율보다 별표가 나타나는 일이 흔하다는 점이다. 숫자의 존재도 부재도 그 자체로는 문제를 확정하지 못하며, 아래의 정확도 수치가 다른 방향에서 도달하는 결론도 바로 그것이다.
Turnitin이 정확도에 대해 주장하는 것, 그리고 이 수치가 누구의 것인지
Turnitin은 자체 정확도 수치를 공개하며, 이는 정확히 그 의미로 읽어야 한다. 즉, 독립적인 감사가 아니라 공급업체 자신의 검증 수치이다. 공개 자료는 모델이 20% AI writing을 넘게 채점한 문서에 대해 1% 미만의 false-positive rate를 제시하며, 이 기준은 위에서 설명한 별표 기준선과 일치한다. 같은 프로그램은 이후 탐지기 편향에 관한 연구에 대응하여 English Language Learner writing samples로 확장되었다.
Turnitin은 ChatGPT가 존재하기 전에 제출된 인간 작성 논문들의 큰 기준 집합과 비교하여 그 수치를 검증했다고 말한다. Turnitin의 자료는 그 기준 집합의 정확한 규모에 대해 일관되지 않다. FAQ 페이지는 700,000편의 논문을 인용하는 반면, Turnitin의 Chief Product Officer의 블로그 글은 800,000편을 인용하며, 두 경우 모두 동일한 1% 미만이라는 주장과 연결되어 있다. Turnitin의 자료는 또한 회사 자체 설명에 따르면 하나의 절충을 제시한다. AI 생성 콘텐츠를 더 공격적으로 포착할수록 그중 약 15%를 놓치게 된다는 것이다.
회사는 공개적으로 자신의 주장도 수정해 왔다. 2023년, 출시 직후, Turnitin의 chief product officer는 실험실 시험이 실제 사용에서 얼마나 많은 오탐이 나타날지를 예측하지 못했다고 인정했으며, 특히 짧은 제출물에서 그러했다고 밝혔다. 또한 문장 수준의 오탐률이 약 4 percent라고 보고했다. 최소 채점 가능 길이를 150단어에서 300단어로 높인 것은 그 격차에 대한 대응이었다.
이 수치들을 함께 읽으면, 단일한 정확도 수치가 아니라 특정한 절충이 드러난다. 1% 미만의 오탐률은 시스템을 통과하는 제출물의 수에 비추어 보면 거의 무시할 수 있는 것처럼 들리지만, 15%의 누락률은 AI 생성 콘텐츠의 상당한 비율이 고장 때문이 아니라 설계상 인간으로 채점된다는 뜻이다. Turnitin의 자체 자료는 이 두 수치를 도구가 단순히 맞거나 단순히 틀리다는 증거가 아니라, 시스템이 의도한 균형으로 제시한다.
독립적 시험이 발견한 것
독립적 시험은 공급업체의 수치가 보여주지 않는 세부를 더해 주며, 이는 AI 탐지기의 독립적 시험이 실험실 조건과 실제 제출물 사이의 간극을 계속 드러내는 더 넓은 맥락과도 같다. Temple University's Center for the Advancement of Teaching은 이용 가능한 것 중 비교적 신중한 검토 가운데 하나를 수행했다. 연구자들은 120개의 글쓰기 샘플을 제출했는데, 이는 완전히 인간이 쓴 글, 완전히 AI가 생성한 글, 패러프레이징 도구를 거친 AI 생성 글, 그리고 인간과 AI의 기여를 결합한 하이브리드 텍스트로 균등하게 나뉘어 있었으며, Turnitin이 각 샘플에 대해 무엇을 반환하는지 기록했다.
이 도구는 순수한 인간 작성 샘플의 93퍼센트와 순수하게 AI가 생성한 샘플의 77퍼센트를 정확하게 식별했다. 더 까다로운 질문에서는 정확도가 더 떨어졌다. Turnitin은 바꿔쓴 AI 샘플의 63퍼센트만을 AI가 생성한 것으로 정확하게 식별했고, 하이브리드 샘플의 43퍼센트만을 완전히 인간도 아니고 완전히 AI도 아닌 것으로 식별했다. 이 범주들은 AI의 도움을 받은 글쓰기가 실제로 생성되는 방식에 가장 가깝고, 연구자들은 특히 하이브리드 텍스트가 더 많은 과목이 과제의 일부에 AI를 사용하는 작업을 부여함에 따라 실제 제출물에서 크고 증가하는 비중을 차지할 가능성이 있다고 지적했다.
| 무엇이 시험되었는가 | Turnitin의 결과 |
|---|---|
| 100% 인간이 작성한 샘플 | 93%가 인간으로 정확하게 식별됨 |
| 100% AI가 생성한 샘플 | 77%가 AI로 정확하게 식별됨 |
| 바꿔쓰기 도구를 거친 AI 텍스트 | 63%가 AI로 정확하게 식별됨 |
| 인간과 AI가 일부씩 섞인 하이브리드 샘플 | 43%가 0%도 100%도 아닌 것으로 정확하게 식별됨 |
| 20%를 초과하여 표시된 문서, Turnitin의 자체 수치 | 1% 미만의 위양성률 |
이들 가운데 어느 것도 Turnitin 측의 독립적인 발견은 아니다. Turnitin의 자체 편향 연구에 대한 보도에서 인용된 회사 외부의 연구자들은, 특히 비원어민 영어 사용자와 크게 수정된 초안의 경우, 더 복잡한 양상을 다시 제시한다.
문장 수준 강조 표시가 왜 실패하는가
문서 수준 점수는 교사가 열 수 있는 유일한 보기가 아니며, 다른 보기는 신뢰성이 더 낮다. 일부 인터페이스는 특정 문장을 AI가 작성했을 가능성이 높은 것으로 강조 표시하는 플래그 보고서를 보여준다. Temple의 연구자들은 그 강조 표시를 하이브리드 샘플에서 실제로 AI가 작성한 문장과 대조했지만, 둘 사이에 아무런 관련성을 발견하지 못했다. 이는 교사가 요약 비율 대신 강조 표시된 문단의 스크린샷을 전달하는 경우에 중요하다. 전체 문서 점수는 문장 수준의 강조 표시보다 훨씬 더 나은 성과를 보였다.
누가 실제로 점수를 보는가
AI 점수는 기본적으로 학생에게 보이는 보고서의 일부가 아니다. 그것은 별도의 탭에 있으며, 교사와 관리자만 볼 수 있고, 학생은 교사가 보고서를 공유하거나 직접 제시하기로 선택한 경우에만 이를 본다. 이는 유사도 점수와는 실제로 구조적으로 다른데, 유사도 점수는 제출물이 처리된 뒤 학생이 보통 같은 시스템 안에서 직접 확인할 수 있기 때문이다.
이와 같은 점은 특정 강좌에서 해당 기능이 아예 존재하는지 여부에도 적용되며, 이는 교사와는 별개로 기관 차원에서 결정되는 사항이다. 계정 수준의 관리자는 Turnitin의 AI 탐지를 전체 기관 단위로 켜거나 끌 수 있다. 한 강사는 소속 대학이 이를 꺼 두었다면 켤 수 없을 수 있고, 그 반대도 마찬가지다. 서로 다른 대학의 두 학생은 비교 가능한 과제를 제출하더라도 이 도구를 매우 다르게 경험할 수 있는데, 그 이유는 두 학생이 무엇을 썼는지와는 전혀 관련이 없다.
일부 대학이 이를 끈 이유
University of Waterloo는 2025년 9월에 Turnitin의 AI 탐지 기능을 중단했으며, 그 공개된 이유는 이례적으로 직접적이다. 대학은 이 도구의 문서화된 신뢰성 부족, 영어가 모국어가 아닌 학생들에 대한 편향, 그리고 적어도 하나의 사례에서 완전히 인간이 작성한 텍스트가 100 percent AI-generated로 점수화된 자체 내부 시험 결과를 근거로 들었다. 이 도구의 비용과 비교했을 때, 대학은 비용이 편익을 상회한다고 결론지었고, 대신 그 노력을 평가 재설계와 AI 문해력 교육으로 돌렸다.
Waterloo는 더 넓은 분열의 한 가지 눈에 보이는 사례이지, 예외적 사례가 아니다. 이 기능을 켜 둔 대학들은 대체로 점수를 그 자체로 판정으로 취급하기보다 안전장치를 추가해 왔으며, 공식 절차가 시작되기 전에 학생과의 대화를 요구하고, 그 수치를 그 대화를 닫는 이유가 아니라 여는 이유로 다루어 왔다. 대학들이 AI 정책을 어떻게 다루고 있는지를 더 넓게 살펴보면 이러한 양상이 더 분명해진다. 점수가 실제로 사용자에게 전달되는지 여부는 기술 자체의 고정된 속성에 달린 것이 아니라, 세미나실보다 훨씬 위에서 내려진 결정에 달려 있다.
높은 점수가 입증하는 것과 입증하지 못하는 것
높은 AI 점수는 증거이지, 판정이 아니다. Turnitin 자체도 이 백분율을 부정행위의 발견이 아니라 강사의 판단을 위한 하나의 데이터 포인트로 제시하며, 앞서의 정확도 수치가 왜 그런 제시 방식이 중요한지를 설명한다. 상당히 잘 작동하는 문서 수준 점수조차도 대폭 수정되었거나, 바꿔 쓴 글, 또는 혼합된 글쓰기의 의미 있는 부분을 잘못 읽고, 문장 수준의 강조 표시는 요약 수치보다 훨씬 덜 신뢰할 만하다. 그렇다고 해서 개별 점수가 틀렸다는 보장은 없다. 그것은 하나의 백분율이 곧바로 받아들일 판정이 아니라 질문을 던질 이유라는 뜻이다.
문서 수준의 단일 백분율은 네 개의 별도 단계를 하나의 수치로 압축하며, 그 어느 단계도 의미를 읽거나 논증이 타당한지 확인하지 않는다. 짧은 구절이 이러한 파이프라인을 이루는 기초 통계 신호에서 어떻게 점수를 받는지 보는 것은, 백분율을 판정으로 취급하는 것보다 보고서를 이해하는 더 직접적인 방법이다. TextPulse의 free perplexity checker는 기관의 파이프라인 밖에서, 자신의 초안에 대해 그런 종류의 단어 수준 채점을 단순화한 버전을 실행하며, free burstiness checker는 같은 측정의 문장 리듬 부분을 다룬다. 두 도구 모두 자신의 글에 대한 읽기를 제공할 뿐, Turnitin이 그것에 대해 무엇을 말할지 예측하지는 않는다. 어떤 도구도 자신이 통제하지 않는 시스템에 대해 그런 약속을 책임 있게 할 수는 없다.
Turnitin은 두 개의 수치를 보고하며, 이들은 서로 관련이 없는 것을 측정한다. 어느 것이 무엇인지는 별도로 설명되어 있으며, 또한 퍼센트가 무엇을 가리키는지 알게 된 뒤 실제로 무엇이 좋은 Turnitin 점수에 해당하는지도 함께 제시된다. 이와 관련된 몇 가지 질문은 각각 별도의 페이지로 다뤄진다. 교수가 별도의 탐지기 없이도 사용자가 ChatGPT를 사용했는지 알아낼 수 있는지, 그보다 더 직접적인 표현인 적발될 것인지, 그리고 특정 환경에서는 간호학 프로그램에서의 AI 탐지와 대학 입학처가 이러한 검사를 수행하는지가 그것이다. 더 넓은 틀은 학문적 진실성과 AI에 관한 별도의 글에 있다.
이 모든 내용이 최종판일 가능성은 낮다. Turnitin은 2023년 이후 임계값, 가시성 규칙, 모델 적용 범위를 한 번 이상 다시 작성해 왔으며, 2026년 8월이 마지막 결론이 되지도 않을 것이다. 이는 TextPulse의 나머지 무료 도구 모음과 함께 제시되며, 어느 한 기관의 퍼센트를 최종 결론으로 받아들이기 전에 두 번째 신호를 확인하고자 하는 사람을 위한 것이다.
우리 자체 연구가 밝혀낸 것
TextPulse Research의 탐지기 일치도 연구에서는 9개의 상용 AI 탐지기가 동일한 90개의 학술 텍스트를 평가했습니다. 그중 하나는 455단어짜리 하이브리드 텍스트로, 사람이 쓴 서두와 결말 사이에 168단어의 AI 생성 중간 부분이 끼어 있습니다. Turnitin는 이 텍스트를 26.8% AI로 판정했지만, 같은 문장에 대한 다른 도구들의 판정은 0%에서 95.7%까지 갈렸습니다. 전체 논문, 말뭉치, 도구별 점수 행렬은 TextPulse Research에서 공개되어 있습니다.

자주 묻는 질문
Turnitin은 AI를 어떻게 탐지하는가? 제출물을 수백 단어 정도의 구간으로 나누고, 각 구간이 AI 생성인지 또는 AI 생성 후 패러프레이즈된 것인지 개별적으로 채점한 다음, 그 구간 점수들을 평균내어 보고서에 표시되는 단일 백분율로 만든다. 이 과정은 최소 단어 수를 충족하는 모든 제출물에서 동일하게 작동한다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.