AI Detection

Taxa de falso positivo do Turnitin: o que os números dizem

O Turnitin publica duas cifras de falso positivo, não uma, e nenhuma descreve o trabalho que está diante de um professor específico. Aqui está a divisão entre nível de documento e nível de sentença, o asterisco abaixo de 20%, e a aritmética que transforma uma fração de um por cento em uma contagem real de estudantes.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

A taxa de falso positivo do Turnitin não é um único número. A empresa publica dois: um valor abaixo de 1 por cento no nível do documento, e outro mais próximo de 4 por cento no nível da frase. Ambos são reais, ambos são publicados, e nenhum deles, isoladamente, diz muito sobre o artigo específico que está diante de um professor específico.

A diferença entre esses dois valores, e o que acontece quando qualquer um deles é aplicado a uma turma real em vez de a um único documento, é o que este texto examina: o que o próprio Turnitin afirma, o que os dois números realmente abrangem, e a aritmética que transforma uma fração de um por cento em uma contagem real de estudantes.

Qual é a taxa de falso positivo do Turnitin, segundo o Turnitin?

No nível do documento, nas palavras da própria empresa: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." Essa condição importa tanto quanto o número. O valor abaixo de 1 por cento não é uma afirmação sobre todo artigo que o Turnitin avalia. Ele descreve apenas o subconjunto de artigos que já ultrapassou um limiar de 20 por cento de texto escrito por IA na própria estimativa do modelo.

No nível da frase, em que uma interface destaca linhas individuais em vez de um documento inteiro, o valor do Turnitin é cerca de quatro vezes maior. "Our sentence-level false positive rate is around 4%," afirma a empresa. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." O Turnitin acrescenta que essas frases incorretamente sinalizadas não se distribuem ao acaso: em 54 percent das vezes, uma frase falsamente marcada fica imediatamente ao lado de texto genuinamente escrito por IA, o que a empresa apresenta como parte da razão pela qual uma pontuação no nível do documento tende a se sustentar melhor do que qualquer linha destacada isoladamente.

Nível do documento e nível da frase não são a mesma afirmação

Essa divisão em dois níveis é uma mensagem revisada, não a posição original da Turnitin. No lançamento, em abril de 2023, a empresa publicou um único valor inferior a 1%, sem qualquer distinção entre documento e frase. Depois que instituições passaram a citar esse número e depois que a imprensa educacional relatou falsos positivos no mundo real mais altos do que o esperado, o diretor de produto da Turnitin publicou a decomposição usada acima, juntamente com duas mudanças de produto feitas em resposta: elevar o comprimento mínimo do documento pontuável de 150 para 300 palavras, e alterar a forma como as frases iniciais e finais de um documento são pontuadas.

O limite de 300 palavras existe por um motivo relacionado. A Turnitin o elevou de um mínimo original de 150 palavras depois de constatar, nas palavras da própria empresa, que a precisão aumenta com mais texto. Uma submissão curta, uma reflexão de uma página, um rascunho parcial, uma publicação em fórum de discussão, oferece ao modelo menos sinal com que trabalhar do que aquele em relação ao qual foram medidos os números de falsos positivos acima, o que faz parte do motivo pelo qual qualquer texto abaixo desse limite não recebe nenhuma pontuação de IA, em vez de uma pontuação pouco confiável.

NívelTaxa declarada pela TurnitinO que ela realmente abrange
Nível do documentoInferior a 1%Apenas documentos já sinalizados com 20% ou mais de texto escrito por IA, a porcentagem total de toda a submissão
Nível da fraseCerca de 4%Qualquer frase individual destacada dentro do relatório de escrita por IA, independentemente da pontuação geral do documento
Abaixo do limite de 20% do documentoNenhum número exibidoA Turnitin exibe um asterisco em vez de uma porcentagem, marcando o resultado como menos confiável nessa faixa

Humanize seu próprio artigo

Transforme seu texto assistido por IA e faça-o soar humano, sem alterar palavras importantes ou citações.

Comece gratuitamente

A aritmética: o que uma fração de um por cento significa para uma coorte real

A matemática foi feita publicamente quando a Vanderbilt University calculou as taxas de erro associadas à detecção por IA do Turnitin em agosto de 2023. O melhor exemplo de como fazer essa matemática é o próprio cálculo dos números pela Vanderbilt. Em uma publicação de blog sobre a decisão de desativar o detector de IA do Turnitin, eles observaram: "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."

Esse número é a própria extrapolação da Vanderbilt a partir do número publicado pelo fornecedor, aplicada ao próprio volume da Vanderbilt, e não um resultado medido separadamente. A estrutura da aritmética se generaliza para além do número de alunos de uma universidade. Uma taxa inferior a 1 percent aplicada a algumas centenas de trabalhos produz um punhado de estudantes sinalizados incorretamente, algo fácil de passar despercebido. A mesma taxa aplicada a dezenas de milhares de trabalhos, a escala que uma universidade real submete todos os anos, produz centenas em vez de um punhado, porque uma pequena porcentagem e uma grande população estão sendo multiplicadas entre si, em vez de consideradas isoladamente.

Nada disso prova que a taxa no mundo real corresponda exatamente ao valor do laboratório. O próprio chief product officer do Turnitin reconheceu publicamente que os resultados no mundo real diferem dos testes de laboratório, o que em parte explica por que a empresa revisou sua mensagem desde o início. A aritmética acima trata o próprio número declarado pelo Turnitin como uma entrada que vale a pena levar a sério, e não como um teto para o que de fato acontece quando uma ferramenta está pontuando submissões que não se parecem em nada com um benchmark curado.

O que a Taxa Não Abrange

Um resultado abaixo do limite de 20 percent não recebe um pequeno percentual anexado a ele. Em vez disso, recebe um asterisco no lugar de um número, uma escolha que Turnitin fez porque essa faixa é onde a ferramenta é menos confiável em qualquer direção, corroborada por reportagens independentes da imprensa educacional, além da própria formulação de baixa confiança da empresa para essa faixa. Uma edição leve, um parágrafo revisado com ajuda e o restante escrito sem auxílio, pode produzir nenhum score visível, em vez de um pequeno, algo que vale a pena saber antes que um número ausente seja lido como uma acusação ou como um atestado de integridade. O guia da TextPulse sobre o que conta como um bom score do Turnitin cobre esse mesmo limite do lado do leitor do relatório.

Então, Como Deve Ser Lida Uma Taxa de Falso Positivo Publicada?

Como um número do fornecedor sobre uma condição mais restrita do que parece descrever à primeira vista, e não como uma afirmação sobre o texto que está diante de um professor específico. Turnitin enquadra sua própria saída da mesma forma: a empresa afirma claramente que sua tecnologia de detecção de escrita por IA não fornece "uma determinação de má conduta", apenas "dados para que educadores tomem uma decisão informada". O conjunto mais amplo de evidências sobre se os detectores de IA são precisos de fato sustenta a mesma leitura: uma taxa publicada descreve um parâmetro de referência, e não o documento que está sendo avaliado no momento.

Escritores que querem saber onde seu próprio rascunho se situa no mesmo tipo de medição estatística, em vez de adivinhar, podem verificá-lo diretamente com um verificador de perplexity gratuito antes que qualquer parte dele chegue ao detector de uma instituição. Isso é um uso diferente da tecnologia em comparação com tentar contestar um score depois do fato, e é o único momento em que um escritor, e não um administrador, vê o número primeiro.

A precisão do ZeroGPT é examinada separadamente para qualquer pessoa cuja instituição use esse sistema. O grupo sobre o qual esses erros recaem com mais força, escritores de inglês não nativos, é o tema de sua própria página.

A população mais exposta a essa aritmética também não está distribuída de forma uniforme. Autores de inglês não nativo carregam o maior risco documentado de ficar do lado errado de qualquer uma dessas porcentagens, que é exatamente o público em torno do qual a página da TextPulse para escritores acadêmicos de ESL foi construída. Turnitin continuará revisando esses números à medida que retreina seu modelo. O que não mudará é a própria aritmética: uma taxa tão pequena ainda precisa de uma população tão grande para desaparecer nela, e a maioria das submissões reais não tem essa sorte.

Perguntas frequentes

A taxa de falso positivo do Turnitin, segundo os próprios números publicados pela empresa, não é um único valor. No nível do documento, o Turnitin afirma uma taxa inferior a 1 por cento, mas apenas para documentos que já foram sinalizados com 20 por cento ou mais de texto escrito por IA. No nível da sentença, em que linhas individuais são destacadas, o número da própria empresa é de cerca de 4 por cento.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

Fique por dentro da humanização com AI

Receba dicas sobre escrita acadêmica, detecção de AI e humanização diretamente na sua caixa de entrada.

Sem spam. Cancele a inscrição a qualquer momento.