Turnitin 오탐지율: 수치가 말하는 것
Turnitin은 하나가 아니라 두 개의 오탐지 수치를 제시하며, 어느 것도 특정 교수 앞에 놓인 논문을 설명하지 않는다. 여기서는 문서 수준과 문장 수준의 구분, 20% 미만에 붙는 별표, 그리고 소수점 이하의 비율이 실제 학생 수로 바뀌는 산술을 살펴본다.
Turnitin의 false positive rate는 하나의 숫자가 아니다. 회사는 두 가지 수치를 공개한다. 문서 수준에서는 1 percent 미만의 수치이고, 문장 수준에서는 4 percent에 가까운 수치이다. 둘 다 실제이며, 둘 다 공개되어 있지만, 어느 하나만으로는 눈앞의 특정 논문에 대해 많은 것을 말해 주지 못한다.
이 두 수치 사이의 간극, 그리고 어느 하나가 단일 문서가 아니라 실제 수업 전체에 적용될 때 어떤 일이 일어나는지, 이 글은 다음을 통해 검토한다. Turnitin이 실제로 무엇을 밝히는지, 두 숫자가 정확히 무엇을 포괄하는지, 그리고 분수의 percent가 학생 수의 실제 개수로 바뀌는 산술이 무엇인지이다.
Turnitin에 따르면, Turnitin의 false positive rate는 무엇인가?
문서 수준에서, 회사의 표현에 따르면, "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." 이 조건은 숫자만큼이나 중요하다. 1 percent 미만이라는 수치는 Turnitin이 채점하는 모든 논문에 대한 주장이 아니다. 그것은 모델의 자체 추정에서 이미 20 percent AI-written 기준을 넘긴 논문들의 하위 집합만을 설명한다.
문장 수준에서는, 전체 문서가 아니라 개별 행을 강조 표시하는 인터페이스에서, Turnitin의 자체 수치는 대략 네 배 더 높다. 회사는 "Our sentence-level false positive rate is around 4%,"라고 밝힌다. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin은 이러한 잘못된 문장들이 무작위로 흩어지지 않는다고 덧붙인다. 54 percent의 경우, 잘못 표시된 문장은 실제 AI writing 바로 옆에 놓여 있으며, 회사는 이를 전체 문서 점수가 단일 강조 표시된 행보다 더 잘 유지되는 이유의 일부로 제시한다.
문서 수준과 문장 수준은 같은 주장이 아니다
이 이중 구분은 수정된 메시지이며, Turnitin의 원래 입장이 아니다. 2023년 4월 출시 당시, 회사는 문서와 문장 간 구분 없이 1% 미만이라는 단일 수치만을 발표했다. 기관들이 그 수치를 인용하기 시작한 뒤, 그리고 교육 전문 매체가 실제 환경에서 예상보다 높은 오탐을 보도한 뒤, Turnitin의 최고 제품 책임자는 위에서 사용한 세부 구분을 공개했으며, 이에 대응해 두 가지 제품 변경도 함께 발표했다. 최소 채점 가능 문서 길이를 150단어에서 300단어로 높였고, 문서의 앞부분과 뒷부분 문장이 채점되는 방식을 변경했다.
300단어 하한은 관련된 이유에서 존재한다. Turnitin은 회사의 표현에 따르면, 더 많은 텍스트가 있을수록 정확도가 높아진다는 사실을 확인한 뒤, 원래의 150단어 최소 기준에서 이를 상향했다. 짧은 제출물, 한 페이지 분량의 성찰문, 일부 초안, 토론 게시글은, 위의 오탐 수치가 측정된 기준보다 모델이 활용할 수 있는 신호가 적다. 이것이 바로 그 하한 미만의 모든 항목에 대해 신뢰할 수 없는 AI 점수조차 표시하지 않고 아예 점수를 부여하지 않는 이유의 일부이다.
| 수준 | Turnitin이 제시한 비율 | 실제로 포함하는 범위 |
|---|---|---|
| 문서 수준 | 1% 미만 | 이미 20% 이상 AI 작성으로 표시된 문서만, 제출물 전체에 대한 총 비율 |
| 문장 수준 | 약 4% | AI writing report 안에서 강조 표시된 개별 문장 전체, 문서의 전체 점수와 무관함 |
| 20% 문서 기준 미만 | 숫자 표시 없음 | Turnitin은 백분율 대신 별표를 표시하며, 해당 범위에서는 결과가 덜 신뢰할 수 있음을 나타낸다 |
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
산술: 백분율의 일부가 실제 집단에서 의미하는 것
수학적 계산은 Vanderbilt University가 2023년 8월 Turnitin의 AI 탐지와 관련된 오류율을 산출했을 때 공개적으로 이루어졌다. 이 계산을 어떻게 해야 하는지 보여 주는 가장 좋은 예는 Vanderbilt가 직접 수치를 계산한 방식이다. Turnitin의 AI 탐지기를 끄기로 한 결정에 관한 블로그 글에서 그들은 다음과 같이 언급했다. "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
그 수치는 별도로 측정된 결과가 아니라, Vanderbilt가 자사 규모에 대해 공급업체가 공개한 수치를 외삽한 것이다. 이 산술의 구조는 한 대학의 학생 수를 넘어 일반화된다. 몇백 편의 논문에 1퍼센트 미만의 비율을 적용하면 잘못 표시된 학생이 몇 명에 그쳐 쉽게 간과될 수 있다. 같은 비율을 실제 대학이 매년 제출하는 규모인 수만 편의 논문에 적용하면, 작은 퍼센트와 큰 모집단이 각각 따로 고려되는 것이 아니라 함께 곱해지므로 몇 명이 아니라 수백 명이 나온다.
이 모든 것은 실제 환경의 비율이 실험실 수치와 정확히 일치함을 증명하지는 않는다. Turnitin의 최고 제품 책임자도 공개적으로 실제 결과가 실험실 시험과 다르다고 인정한 바 있으며, 이것이 바로 회사가 처음에 메시지를 수정한 이유의 일부이다. 위의 산술은 Turnitin이 제시한 수치를 실제로 진지하게 검토할 만한 입력값으로 취급할 뿐, 도구가 정제된 기준과 전혀 닮지 않은 제출물을 채점할 때 실제로 일어나는 일을 상한선으로 간주하지는 않는다.
이 비율이 포함하지 않는 것
20퍼센트 기준선 아래의 결과에는 작은 퍼센트가 붙지 않는다. 대신 숫자 대신 별표가 붙는데, Turnitin이 그렇게 정한 이유는 그 구간이 어느 방향으로든 도구의 신뢰성이 가장 낮은 범위이기 때문이며, 이는 독립적인 교육 언론 보도와 그 구간에 대한 회사의 낮은 신뢰도 표현으로도 뒷받침된다. 약간의 편집, 도움을 받아 한 단락을 수정하고 나머지는 도움 없이 작성한 경우, 작은 점수조차 아니라 아예 보이는 점수가 전혀 나타나지 않을 수 있다. 이는 숫자가 빠졌을 때 그것을 비난으로 읽을지, 아니면 문제없다는 판정으로 읽을지 판단하기 전에 알아둘 만하다. TextPulse의 좋은 Turnitin 점수로 간주되는 기준에 대한 안내는 보고서의 독자 측에서 본 바로 그 기준선을 다룬다.
그렇다면 공개된 위양성률은 어떻게 읽어야 하는가?
처음 보이는 것보다 더 좁은 조건에 관한 공급업체의 수치로 읽어야 하며, 특정 교수 앞에 놓인 논문 자체에 대한 진술로 읽어서는 안 된다. Turnitin도 자사의 결과를 같은 방식으로 설명한다. 회사는 자사의 AI writing detection technology가 "a determination of misconduct"를 제공하지 않으며, 오직 "data for educators to make an informed decision"만 제공한다고 분명히 밝힌다. AI detectors가 실제로 정확한지에 관한 더 넓은 증거도 같은 해석을 뒷받침한다. 공개된 비율은 기준점을 설명할 뿐, 현재 채점 중인 문서를 설명하는 것이 아니다.
자신의 초안이 같은 종류의 통계적 측정에서 어디에 위치하는지 추측이 아니라 직접 알고 싶은 작성자는, 기관의 detector에 제출되기 전에 무료 perplexity checker로 바로 확인할 수 있다. 이는 사후에 점수와 논쟁하려는 것과는 다른 기술의 사용이며, 작성자, 행정 담당자가 아니라 작성자가 먼저 숫자를 볼 수 있는 유일한 지점이다.
ZeroGPT의 정확도는 별도로 검토된다, 기관이 그것을 사용하는 경우를 위한 것이다. 이러한 오류의 영향을 가장 크게 받는 집단인 비원어민 영어 작성자는 별도의 페이지에서 다룬다.
이 산술의 영향을 가장 크게 받는 집단도 고르게 분포되어 있지 않다. 비원어민 영어 작성자는 이러한 비율들 가운데 어느 하나의 반대편에 놓일 가장 큰 문서화된 위험을 지니며, 바로 그 대상이 TextPulse의 ESL 학술 작성자를 위한 페이지가 중심으로 삼는 독자층이다. Turnitin은 모델을 재학습할 때마다 이 수치들을 계속 수정할 것이다. 변하지 않는 것은 산술 자체이다. 이처럼 작은 비율도 사라져 버릴 만큼 큰 집단이 있어야만 의미를 잃으며, 대부분의 실제 제출물은 그렇게 운이 좋지 않다.
자주 묻는 질문
Turnitin의 오탐지율은 회사가 자체적으로 공표한 수치에 따르면 하나의 숫자가 아니다. 문서 수준에서 Turnitin은 1% 미만의 비율을 제시하지만, 이는 이미 AI 작성 비율이 20% 이상으로 표시된 문서에만 적용된다. 개별 문장이 강조 표시되는 문장 수준에서는 회사의 자체 수치가 약 4%이다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.