O Turnitin consegue detectar texto de IA humanizado?
O Turnitin afirma que seu indicador de escrita por IA já cobre texto passado por um humanizador. O que essa afirmação faz e não faz, por que um documento humanizado às vezes ainda recebe pontuação alta e às vezes não, e o que o número vale para um estudante em qualquer caso.
Turnitin responde a essa pergunta em seu próprio site de suporte, e a resposta é mais específica do que qualquer um dos lados do argumento usual. Seu indicador de escrita por IA, diz Turnitin, já inclui a detecção de conteúdo gerado por IA que pode ter sido humanizado ou passado por um bypasser para evitar a detecção. Trata-se de um fornecedor descrevendo seu próprio produto. Também é o ponto certo para começar, porque informa o que o modelo afirma abranger.
Então, o Turnitin consegue detectar texto humanizado? A pergunta tem uma forma mais restrita e mais útil. O modelo do Turnitin não procura a assinatura de um humanizer e não mantém uma lista de ferramentas. Ele atribui uma pontuação à prosa, frase por frase, conforme a escrita se aproxima dos padrões estatísticos do texto gerado por máquina, e depois faz a média dessas pontuações ao longo do documento. Se uma passagem humanizada ainda recebe pontuação alta depende de quanto desse padrão a reescrita alterou, e de quanto do documento foi reescrito de fato.
O Turnitin Consegue Detectar Texto Humanizado? O Que o Turnitin Afirma
Sua posição publicada é um sim direto. Ao responder se consegue detectar conteúdo que passou por um humanizer, sua orientação afirma: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been humanized or passed through a bypasser to avoid detection." A mesma página dá a mesma resposta para ferramentas de paráfrase por IA.
Essa afirmação não aparece como um segundo número em algum lugar do relatório. O Turnitin a incorpora em uma única porcentagem de escrita por IA, e a definição publicada dessa porcentagem diz isso diretamente: ela abrange texto que o modelo determina ter sido provavelmente gerado por IA, ou provavelmente gerado e depois modificado por um paraphraser de IA ou bypasser. Há uma única pontuação, e ela já leva em conta a reescrita na medida em que o modelo consegue fazê-lo.
Leia com atenção, isso é uma afirmação sobre cobertura, e não uma afirmação sobre precisão. Turnitin está dizendo que o texto humanizado estava dentro do escopo quando o modelo foi construído. Isso fica muito aquém de dizer que todo documento humanizado recebe pontuação alta, e seus próprios números publicados, mais adiante, descrevem um modelo que trata sentenças individuais como incertas.
O Que o Indicador de Escrita por IA Está Realmente Pontuando
Não é uma porcentagem. É uma fração do texto, portanto não é um nível de confiança. É uma medida de quanto texto dentro do seu documento nosso modelo considera provavelmente gerado por IA. Chamamos isso de texto qualificado, o que significa sentenças em prosa em um formato de escrita de texto longo. Isso não inclui listas com marcadores, código, tabelas ou fragmentos curtos. E é por isso que você pode ver números diferentes para o mesmo trabalho com base em quanto dele é prosa contínua.
O mecanismo por trás disso é simples o bastante para imaginar. Turnitin divide um documento em segmentos sobrepostos de cerca de algumas centenas de palavras, aproximadamente cinco a dez sentenças cada, sobrepostos de modo que cada sentença receba uma pontuação em contexto. Cada sentença recebe um valor entre 0 e 1. As pontuações dos segmentos são então calculadas pela média ao longo do documento para produzir o único número que um instrutor vê. Um relato passo a passo de como Turnitin detecta IA percorre cada etapa com mais detalhes.
Essa etapa de cálculo da média importa mais para texto humanizado do que qualquer outra coisa no pipeline, e é a parte que quase ninguém leva em conta. A cifra que um instrutor lê é uma média aritmética dos julgamentos no nível dos segmentos. Um documento pode ter metade do texto reescrito e cair em algum ponto intermediário por razões que têm pouco a ver com a qualidade da reescrita.
Por Que a Saída Humanizada Às Vezes Ainda Recebe Pontuação Alta
A razão mais comum é a cobertura. Um humanizador aplicado à introdução e à conclusão deixa a revisão de literatura e a discussão intocadas, e esses segmentos levam suas pontuações originais diretamente para a média. Em um capítulo longo, reescrever as páginas iniciais altera alguns poucos segmentos e deixa o restante exatamente como estava, o que produz um movimento menor do que o escritor espera de um trabalho que pareceu substancial.
A segunda razão é a profundidade da reescrita. Uma passagem que substitui o vocabulário, mantendo os comprimentos das frases, a ordem das orações e as escolhas de transição no lugar, deixa o padrão em que o classificador foi treinado amplamente intacto. O modelo atribui pontuação à forma da prosa, então mudar quais palavras preenchem essa forma faz menos do que a maioria das pessoas supõe. Um free perplexity checker mostrará o quão previsível uma passagem ainda parece após uma reescrita, o que é um sinal mais informativo do que uma comparação em nível de palavra entre antes e depois.
A terceira razão é que uma reescrita pode instalar sua própria regularidade. Um software que aplica a mesma transformação a cada parágrafo produzirá um novo padrão que é tão regular quanto o antigo. Se cada frase tiver o mesmo tipo de corte conjuntivo atravessando-a, ou se cada frase tiver o mesmo tipo de cláusula de atenuação adicionada no mesmo ponto, essas frases serão vistas de modo igualmente uniforme por um classificador, assim como teriam sido se todas tivessem começado com o mesmo comprimento.
| Situação | O que a pontuação de IA faz | Por quê |
|---|---|---|
| Apenas parte do documento foi reescrita | Cai menos do que o esperado | Trechos intocados mantêm suas pontuações originais na média |
| O vocabulário mudou, a estrutura das frases foi mantida | Muda muito pouco | O classificador pontua padrões no nível da frase que a troca deixou em seu lugar |
| As frases foram genuinamente reestruturadas em todo o texto | Muda mais | O ritmo uniforme que o modelo foi treinado para reconhecer é quebrado |
| Menos de 300 palavras de prosa foram enviadas | Nenhuma pontuação é gerada | Turnitin exige 300 palavras de prosa elegível antes de informar uma porcentagem |
| O resultado fica abaixo de 20 percent | Um asterisco em vez de um valor numérico | Turnitin sinaliza resultados nessa faixa como menos confiáveis |
Por que a mesma reescrita às vezes produz uma pontuação baixa
Um documento humanizado pode retornar com uma pontuação baixa por razões que não têm relação com a reescrita. Turnitin precisa de pelo menos 300 palavras de prosa elegível antes de gerar qualquer porcentagem de IA, um limite que elevou de 150 palavras originais com a justificativa declarada de que a precisão melhora com um pouco mais de texto. Um texto reflexivo curto não produz número algum, e a ausência de pontuação não é a mesma coisa que uma pontuação limpa.
Turnitin marca uma faixa abaixo de 20 percent com um asterisco em vez de fornecer uma porcentagem exata, porque há uma maior incidência de falsos positivos dentro dessa faixa. No momento do lançamento, a cobertura educacional também se referiu a esse comportamento, dizendo que resultados relatados como menos de 20 percent de texto escrito por IA tinham uma maior incidência de falsos positivos e, portanto, Turnitin acrescentou avisos. Um documento situado nessa faixa foi marcado como uma faixa que Turnitin se recusa a relatar com precisão, o que é diferente de ter sido aprovado.
Há também uma barreira institucional acima de tudo isso. Turnitin processa uma submissão para detecção de escrita por IA somente se a instituição tiver ativado o recurso, e os administradores podem desativá-lo para toda a conta. A Vanderbilt University fez exatamente isso em agosto de 2023, citando a então publicada taxa de falso positivo de 1 percent da Turnitin em relação a aproximadamente 75,000 submissões anuais, o viés contra escritores que não são falantes nativos de inglês, e a falta de transparência sobre como o modelo funciona. Um estudante em uma instituição com o recurso desativado não tem pontuação de IA em nenhuma submissão, humanizada ou não.
E, quando a reescrita foi genuinamente estrutural, a pontuação pode cair porque o padrão medido mudou. Turnitin informa uma estimativa calculada a partir de padrões de escrita, portanto, texto cujos padrões diferem recebe pontuação diferente. O mecanismo opera nos dois sentidos, e essa é a parte desconfortável: a escrita humana original às vezes recebe pontuação alta pelo mesmo motivo exato.
Humanize seu próprio artigo
Transforme seu texto assistido por IA e faça-o soar humano, sem alterar palavras importantes ou citações.
O que cada fornecedor de humanizador afirma, e o que está documentado
Uma regra rege a tabela. A coluna do meio é a própria linguagem de marketing do fornecedor, retirada do próprio site sempre que esse site servir como fonte. A coluna da direita registra o que de fato sustenta cada afirmação, o que, na maioria dos casos, não é nenhum conjunto de dados, data ou método. Não existe teste público lado a lado para essas marcas.
| Marca | O que o fornecedor afirma | O que está documentado |
|---|---|---|
| Undetectable.ai | Lista a aprovação em detectores de IA como um recurso do produto, sem apresentar um número, e oferece reembolsar o custo da humanização se a saída for sinalizada como não humana | O reembolso é um termo comercial, não há conjunto de dados, data ou resultado por detector que sustente a afirmação |
| QuillBot | Não faz nenhuma afirmação de detecção ou de bypass para o recurso de humanizer em suas próprias páginas. Seu detector de IA separado é descrito apenas como detectando conteúdo gerado por IA | QuillBot vende o humanizer dentro de um pacote geral de escrita e não faz nenhuma afirmação específica sobre Turnitin para ele |
| WriteHuman | Classificado em primeiro lugar em um Humanizer Leaderboard, e descrito como o humanizer de IA premium para escrita séria | O leaderboard não cita metodologia nem amostra, e WriteHuman não associa nenhuma cifra numérica de precisão à classificação |
| Walter Writes AI | Comercializa humanização ampla em mais de 80 idiomas, sem uma afirmação específica sobre Turnitin | Não há dados de teste em nenhum dos sentidos |
| HIX Bypass | Comercializa páginas de bypass por detector, sem uma cifra específica para Turnitin | HIX Bypass e BypassGPT são produtos separados em domínios separados, portanto confirme qual deles uma afirmação descreve |
| StealthGPT | Uma média de 98% humano em Turnitin e 95% em GPTZero, cada uma a partir de uma execução declarada de 30 amostras com zero detecções, além de uma garantia de devolução do dinheiro se um assinante for detectado | Autorrelatado. Nenhum conjunto de dados, seleção de amostra, data ou método é publicado ao lado das cifras, e 30 documentos é uma execução pequena para uma afirmação sobre um modelo que avalia milhões de submissões |
| Phrasly | Se posiciona como um removedor de detecção de IA, não publica dados de teste | Nenhuma afirmação pública em nenhum dos sentidos. As cifras que circulam em avaliações são de segunda mão e são excluídas aqui por princípio |
| Grammarly | Não comercializa sua reescrita como bypass de detecção de forma alguma. Sua página de detector de IA afirma 99% de precisão de detecção e uma classificação em primeiro lugar no benchmark independente da RAID | A mesma página da Grammarly afirma que nenhum detector de IA é 100% preciso. Seu recurso Authorship rotula o texto como digitado por um humano, criado com IA ou editado com Grammarly |
| TextPulse | Uma taxa de aprovação de 92.33% em Turnitin AI, 89.12% em Originality.ai e 87.91% em GPTZero, medida em um corpus acadêmico de 2,000 documentos | Medido e publicado por TextPulse, portanto autorrelatado como todas as cifras acima. O tamanho do corpus e os detectores são nomeados, não há promessa de resultado de detector para nenhum documento individual |
Três coisas decorrem dessa tabela. A maioria dessas ferramentas não publica nenhuma alegação de detector que possa ser verificada. Algumas associam um tamanho de amostra a um número, o que já é mais do que o restante da categoria consegue fazer. E nenhuma delas publica um conjunto de dados que alguém fora da empresa possa executar por conta própria. Ainda assim, é preciso reconhecer o mérito de cada marca onde ele existe. Undetectable.ai coloca um reembolso por trás de sua alegação, o que é um compromisso concreto, e não um adjetivo. WriteHuman publica limites exatos de solicitações e de palavras por nível, de modo que o comprador sabe o que está recebendo. Grammarly qualifica sua própria cifra de precisão na mesma página em que a apresenta, o que é mais do que a maioria dos fornecedores de detectores faz. E o fato de QuillBot se recusar a fazer qualquer alegação de bypass é a posição mais defensável da lista.
Por que ninguém fora do fornecedor pode verificar esses números
Um fornecedor de humanização que afirma uma taxa de aprovação no Turnitin está descrevendo execuções feitas por meio de uma conta que controla, em documentos que selecionou, em uma data que geralmente não informa, diante de um classificador que o Turnitin revisa à medida que novos modelos de linguagem são lançados. Isso é verdadeiro para a cifra de trinta amostras de StealthGPT e igualmente verdadeiro para a cifra de 2.000 documentos que este site publica. O tamanho do corpus altera a quantidade de ruído presente em um número. Ele não transforma um relato próprio em uma auditoria.
A outra metade do problema é que a própria lista de modelos que o Turnitin afirma detectar é editada à medida que novos lançamentos chegam. Essa taxa de aprovação medida em relação ao classificador do trimestre anterior descreve apenas o classificador do trimestre anterior, e nada mais. Por que isso significa que ninguém pode nomear um melhor humanizador de IA para burlar o Turnitin é explicado separadamente. Toda cifra na página inicial de todo humanizador, inclusive a deste site, é uma fotografia com uma data que o fornecedor talvez nunca tenha publicado.
Como ler uma alegação de bypass antes de pagar por ela
Quatro perguntas separam uma alegação que vale a pena considerar de uma alegação que vale a pena ignorar, e elas se aplicam a cada linha da tabela acima, inclusive a última.
- Quantos documentos foram testados, e quem os escolheu? Uma porcentagem sem tamanho de amostra por trás é um slogan usando um número.
- Em que data, e contra qual versão do detector? Os modelos de detecção são revisados à medida que novos modelos de linguagem são lançados, e uma taxa de acerto sem data envelhece rapidamente.
- A garantia é um reembolso ou um resultado? Uma promessa de devolução do dinheiro transfere um pequeno risco financeiro e não faz absolutamente nada em relação a uma comissão de integridade acadêmica.
- O que o fornecedor diz que acontece com uma citação, um termo técnico ou uma citação em bloco? A maioria das páginas de humanização não diz nada, o que por si só já é uma resposta.
Essa última pergunta decide mais do que a aritmética do detector para qualquer pessoa que submeta trabalho acadêmico. Uma reescrita que obtém boa pontuação e generaliza discretamente uma frase de métodos custou a você aquilo pelo qual estava sendo avaliado. O humanizador acadêmico da TextPulse documenta a preservação de citações em APA, MLA, IEEE, Chicago, Harvard e Vancouver, termos congelados para travar o vocabulário exato antes da execução de uma passagem, e treinamento em texto acadêmico revisado por pares com saída mantida no nível 13 a 18 do Flesch-Kincaid. Essas são afirmações sobre o que acontece com o texto, o que é um tipo diferente de afirmação de uma porcentagem sobre um detector, e um leitor pode verificá-las na saída em um minuto.
O que a Pontuação Significa para um Estudante em Qualquer dos Casos
Turnitin é claro ao afirmar que o indicador de escrita por IA não é uma constatação de má conduta. A página de produto da Turnitin afirma explicitamente que o Turnitin Originality "does not make a determination of misconduct through our AI writing detection (or similarity checking) technology." Ela também deixa claro que a Turnitin fornece informações para permitir que os professores tomem uma decisão informada com base nas políticas de sua instituição. Isso é reiterado pelo aviso de que o modelo "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."
Os estudantes não veem a pontuação por padrão. A Turnitin afirma claramente que o indicador e o relatório de detecção de escrita por IA não ficam visíveis para os estudantes, e a única forma de vê-los é um instrutor baixar o relatório em PDF e entregá-lo. Um estudante que verifica seu próprio rascunho está verificando uma ferramenta diferente, treinada com dados diferentes, e os dois números não têm obrigação de coincidir.
Isso deixa sem resposta a parte que nenhuma pontuação resolve. Se a assistência de IA era permitida em absoluto é uma questão do curso e da instituição, e uma política de uso de IA a responde de um modo que uma porcentagem nunca responde. Uma pontuação alta em uso permitido e divulgado é uma conversa com evidências por trás. Uma pontuação baixa em uso não divulgado que a política proíbe continua sendo uso não divulgado.
Para um autor que edita seu próprio rascunho, a leitura prática de tudo isso é que a pontuação acompanha a escrita. O modelo da Turnitin mede padrões em nível de frase ao longo de um documento inteiro, de modo que reescritas parciais produzem movimento parcial e substituições de vocabulário produzem muito pouco movimento, se é que produzem algum. O passo a passo completo de como humanizar texto de IA examina as edições estruturais que alteram o padrão, na ordem que mais o modifica.
O humanizador de IA da TextPulse aplica essas edições estruturais a um documento inteiro de uma só vez e informa um Human Score estimado calculado a partir do próprio texto, nunca uma previsão do que qualquer detector nomeado dirá. Nenhuma ferramenta pode prometer um resultado na Turnitin, porque nenhuma ferramenta pode ver dentro do modelo da Turnitin. Qualquer produto que afirme o contrário está descrevendo um resultado que não tem como observar.
A distinção entre um humanizador e um paraphraser importa aqui, assim como o motivo pelo qual texto parafraseado ainda é sinalizado.
O número é a parte menos interessante disso. O que decide o resultado são os vinte minutos depois que um avaliador o examina: se o trabalho pode mostrar seu processo, um histórico de rascunhos, um conjunto de notas, fontes sobre as quais o autor pode falar sem abri-las. Essa evidência está disponível para qualquer pessoa que tenha feito o trabalho, e ela sobrevive a uma nota que uma reescrita não conseguiu alterar.
Perguntas frequentes
A própria orientação do Turnitin diz que seu indicador de IA inclui a detecção de conteúdo que pode ter sido humanizado ou passado por um bypasser. O que o produto realmente apresenta é uma porcentagem de texto qualificado, não um veredito sobre a autoria. Portanto, a resposta prática para se o Turnitin consegue detectar texto humanizado é que a pontuação reflete quanto do padrão de escrita da máquina sobreviveu à reescrita.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.