AI Detection

Turnitin 能检测改写文本吗?

是的,Turnitin 会检测改写文本,而且它就是为此而设计的。其相似度引擎会捕捉与已发表和先前提交作品仍有重叠的改写段落,而其 AI 写作报告包含一个标注类别,用于经 paraphrasing tool 或 word spinner 修改的 AI 生成文本。以下说明各系统如何捕捉它,以及为什么把词语替换为同义词并不能绕过任何一个系统。

9 min
Diagram answering can Turnitin detect paraphrased text, comparing similarity matching against the AI writing indicator

是的。Turnitin 可以检测改写后的文本,而且它就是为此而设计的。同一份报告中的两个系统都会将其识别出来。Similarity Report 会标记那些在措辞改变后,仍然与已发表作品或先前提交的论文存在重叠的段落,这正是它在 AI 写作出现之前很久就一直承担的工作。AI Writing Report 还有一个单独标注的类别,用于识别经过改写工具或词语旋转器处理的 AI 生成文本。把词语替换成同义词,无法绕过这两个系统中的任何一个。

某一段文字会被哪个系统识别,取决于文本的来源。源自某个资料并经过改写的内容,是相似性问题。由 ChatGPT 生成并经过改写的内容,是 AI 写作问题。许多提交同时属于这两种情况,而且无论如何,这两个系统都会读取每一份提交。

Turnitin 将改写后的 AI 文本列为独立类别

这并不是根据检测器一般工作方式作出的推断。Turnitin 的 AI Writing Report 将其百分比拆分为两个带标签的类别,其中第二个类别就是改写后的 AI 文本。

Turnitin AI Writing Overview page listing two categories: AI-generated only, described as likely AI-generated text from a large-language model, and AI-generated text that was AI-paraphrased, described as likely AI-generated text that was likely revised using an AI-paraphrase tool or word spinner
Turnitin 的 AI Writing Overview,其中改写类别在其产品中单独列出。标题百分比合并了两条内容,而第二条涵盖经 AI 改写器或词语旋转器修订的文本。

该报告将其标题数字定义为“可能由 AI 生成的文本总量,以及也可能经过 AI 改写的可能由 AI 生成的文本总量之和”。第二个条目标注为“AI-generated text that was AI-paraphrased”,并描述为“likely AI-generated text that was likely revised using an AI-paraphrase tool or word spinner”。

Turnitin 的支持文档用明确的话回答了这个问题。针对是否能够检测用 AI 改写工具改写过的内容,Turnitin 直接说明: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been paraphrased using a word spinner/AI paraphrasing tool." 对于经过专门设计、用于将 AI 输出改写后绕过检测器的 bypasser 工具处理过的文本,也给出了几乎相同的回答。这两者都不会生成单独的分数。它们都计入教师看到的同一个百分比。

各系统分别检测什么

相似度报告AI 写作报告
它检查什么文本是否与 Turnitin 数据库中已有的网页内容、出版物和学生论文来源重叠散文是否在统计上呈现出机器生成写作的典型特征
可检测的改写对象他人已发表或已提交的作品AI 生成的草稿,包括经 paraphraser 或 bypasser 修改过的草稿
同义改写的影响会降低百分比,但仍会保留独特术语、引文和句子结构的匹配分数大体保持不变,因为分类器读取的是句子模式,而不是用词选择
显示位置一个百分比,以及标明每个来源的匹配组一个百分比,分为仅 AI 生成和 AI 改写

这两份报告是彼此独立的产品,具有各自的数值,一篇论文可能在其中一项上没有问题,却在另一项上被标记。TextPulse 在其 Turnitin 相似度分数与 AI 分数的比较 中完整说明了这种分化,也在 Turnitin 如何检测 AI 写作 中说明了分类器本身的机制。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

相似度侧面, 改写后的文本仍然会重叠

相似度检测是一种匹配练习。Turnitin 将提交内容与其网页内容、出版物以及先前提交的论文库进行比对,并报告其中有多少与已索引内容重叠。只要改动足够多的措辞,正在比较的精确字符串就会减少,因此百分比会下降。这是真实存在的,这也是改写工具存在的原因。

保留下来的,是学生常常低估的部分。技术术语、专有名词、引用的数据和直接引语会原样保留,因为它们没有同义词。句子结构也是如此,只要替换的是连接词。Turnitin 以匹配组的形式报告重叠,每个匹配组都会标明其来源,这正是正确引用的段落与改写段落之间的区别。

Turnitin 相似度报告显示总体相似度为 12%,并分解为匹配组: 115 个未注明出处或未加引号的匹配,占 9%,以及 41 个缺少引号的匹配,占 3%,顶部来源横跨互联网、出版物和学生论文
相似度报告会将其百分比分解为匹配组。那 115 个“未注明出处或未加引号”的匹配,读起来更像是改写或借用的材料,而不是有明确出处的引文。

在保留句子顺序和支撑细节的同时改写来源,称为 patchwriting,在大多数大学政策中都被视为抄袭的一种形式,无论相似度百分比是否下降。受过识别训练的评分者往往能凭肉眼发现,因为一篇论证如果逐段跟随某个来源展开,不论词汇如何变化,读起来都像那一来源。较低的数字并不等于干净的作业,这正是 TextPulse 关于什么才算好的 Turnitin 分数指南所要说明的重点。

AI 方面, 进行一次同义词替换并不会改变分数

AI 写作指标从未将你的段落与某个来源进行比对,因此不存在可供同义词替换打破的匹配。它按句子逐句对散文评分,判断其与机器生成文本的统计模式有多接近, 也就是词语可预测性、句子节奏,以及语言模型默认会采用的通用措辞。

替换词语几乎不会改变这些特征。句子的长度、顺序,以及分句之间相同的常见连接成分都会保留下来。这就是为什么把 AI 草稿交给改写工具处理后,看到 AI 分数保持不变,是如此常见的体验。词汇变了,分类器评分的模式没有变,因此文本仍然会被读作机器写作,这正是 Turnitin 的释义类别所说它应当呈现的样子。

句子长度分布在改写后仍然保留

机器起草的散文会收敛到一个狭窄的句子长度区间,因为一个逐个 token 进行预测的模型,没有理由让第四句比第三句更短。人类写作则更为分散, 一句十九个词,接着一句六个词,再接着一句三十二个词,把一个主张及其限定条件一起写出来。GPTZero 自己的说明文字直接指出了这一点,将 burstiness 定义为衡量一篇文档中写作模式和文本 perplexities 变化幅度的指标。

同义词替换只会让句子长度增加或减少一两个词,而且每个句子的变化幅度都差不多,因此分布的形状会保持不变。一段在改写前呈现十八、十九、十七和二十个词的平稳模式的文字,在改写后也会仍然保持在与这一平坦轮廓相差一两个词的范围内。

这一点无需接近检测器也能测量。一个free burstiness checker会报告一段文字在句子层面的变化程度,而在改写前后用同一段文字运行它,结果会显示数值几乎没有变化,尽管词汇已经完全改变。

分句顺序和过渡也同样会保留

从句顺序是改写工具保留不变的第二个结构特征,而且比句子长度更容易被读者察觉。机器生成的文字往往会先提出主题,再陈述主张,然后在末尾附加一个限定性从句,如此反复。"While the sample size was limited, the results suggest" 和 "Although further research is needed, the findings indicate" 是同一句话,只是换了不同的措辞。

改写工具会把 "while" 变成 "although",把 "suggest" 变成 "show"。它不会判断这个限定部分是否应该放在三行之后的另一句简短句子里,也不会决定是否应当完全删去这种缓和语气。这是关于段落在论证什么的编辑判断,而替换引擎对论证本身没有看法。

过渡词是第三个,也是最显眼的特征。模型在连接处会倾向于使用一小组稳定的连接词, however, additionally, furthermore, in addition。改写工具会把其中一个换成同一组中的另一个成员,因此分类器仍然会在预期位置看到来自预期分布的常见过渡词。这正是它在改写开始前所读取到的信号。

分类器读取的特征经过改写后是否改变原因
单个词语的选择是,且变化显著替换引擎唯一被设计来改变的特征
句子长度及其方差几乎没有替换后的词长度相近,因此整体轮廓保持不变
句子内部的从句顺序很少重排会改变强调,而意义约束会抑制这种变化
连接处的连接词在同一小集合内互换一个常见过渡词替换另一个常见过渡词
下一个词的可预测性略有变化较少见的同义词不那么符合预期,但其周围框架仍和以前一样可预测
具体证据和细节改写不能加入草稿中原本不存在的材料

真正改变结果的是什么

这两个系统都在响应同一种浅层改写的不同症状,因此修正方式对二者也是相同的, 改变写作,而不是更换词语。这意味着要重组句子,而不是重新排列其内容,有意识地变换句长,删去模型默认使用的通用连接词,并加入足够具体的支撑细节,使其只能来自你实际阅读过的源材料。相似度会下降,因为结构不再追踪原文。AI 分数会下降,因为评分器所依据的模式已经消失。

改写工具无法完成这项工作,在为任何一种工具付费之前,理解这两类工具之间的差异是值得的,TextPulse 在 AI humanizer versus paraphraser 中对此作了说明。用 free perplexity checker 检查草稿自身在词级上的可预测性,比单看一个分数更能显示分类器所响应的模式。

TextPulse 的 AI humanizer for students 从问题的结构层面入手,重建句子节奏、句长变化和从句顺序,而不是替换单个词语,这正是仅做同义词替换所留下的巨大缺口。就课程作业而言,humanizing an AI essay for college 逐步说明了整个流程,而 whether Turnitin detects DeepSeek 则针对不同模型回答了同样的问题。

这些都不会改变课程的 AI 使用政策允许什么,也没有任何改写方法能够在事后改变一个分数。在提交任何内容之前,值得检验的是,你是否能够逐句解释,为什么眼前这份作品会这样表述。

XLinkedInFacebook

常见问题

是。其相似度引擎会将提交内容与网页内容、出版物以及先前提交的论文进行比对,因此,与来源仍有重叠的改写段落会因独特术语、引文和句子结构而继续匹配。另一个方面,其 AI 写作报告包含一个标注类别,用于经 AI paraphrasing tool 或 word spinner 修改的 AI 生成文本,Turnitin 自己的文档也证实它就是为标记此类文本而设计的。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。