通过 Turnitin 的最佳 AI 人性化工具
TextPulse 是用于 Turnitin 会读取的作品的 AI 人性化工具, 它在 2,000 篇文档的学术语料库上公布了针对 Turnitin AI 的 92.33% 通过率, 并保留了重写通常会破坏的引文和术语。以下内容说明了哪些因素真正会影响 Turnitin AI 分数, 以及在将任何工具用于章节之前应检查什么。
对于 Turnitin 会读取的学术写作,请使用 TextPulse。在一个包含 2,000 篇文档的学术语料库上,其人性化输出通过 Turnitin 的 AI 写作检测的比例为 92.33%,通过 Originality.ai 的比例为 89.12%,通过 GPTZero 的比例为 87.91%。这些都是该供应商自行测量并明确标注的数据,它们比这一类别中几乎任何其他产品公布的数据都更有说服力。对于已提交的章节而言,同样重要的是,TextPulse 保留了重写通常会损害的学术文档部分, 即文内引文和参考文献条目,涵盖 APA、MLA、IEEE、Chicago、Harvard 和 Vancouver,使用 freeze terms 锁定的技术术语,以及原样保留的统计数据。
本页其余部分才是有用的内容, 即什么真正会影响 Turnitin 的 AI 分数,为什么改写工具往往会使分数变得更差而不是更好,以及在把章节交给任何工具之前应检查什么。
大学实际上允许什么
先从这里开始,因为这会改变你试图做的事情。大多数机构允许 AI 辅助,并要求披露。Oxford 的指导将 AI 视为合法的学习支持,而未声明的使用则构成违规。Elsevier 允许生成式 AI 用于提高可读性和语言质量,但必须在稿件中声明,而 COPE 的立场解释了其中的逻辑:工具不能对工作负责,因此必须由具名的人类作者负责,并说明该工具做了什么。
因此,目标不是隐藏 AI 辅助,而是披露它,在你的院系要求时引用该模型,并提交读起来像你自己的学术写作而不是原始模型输出的文字。我们的AI 披露声明模板以及引用 ChatGPT指南说明了具体措辞。humanizer 处理的是这项工作的后半部分。
什么真正影响 Turnitin 的 AI 分数
Turnitin 的 AI 写作指标不会寻找被禁止的短语,也不知道你的文本由哪种工具生成。它衡量的是写作的可预测性。该模型将文档按几百个词的重叠片段进行读取,把每个句子按从 0, 人类,到 1, AI 的尺度评分,然后对整篇文档的这些分数取平均。它真正提出的问题是,逐句来看,语言模型会多有把握地猜出下一个词。
生成的文字在这一指标上得分较高,因为模型在每一步都选择了一个很可能出现的词。由此会产生两个特征,而重写必须改变的正是这两个特征。
- 词语选择的可预测性。 模型会过度选择一种可识别的词汇:moreover, furthermore, delve, underscore, plays a crucial role。用你所在领域的研究者实际会使用的词替换这些词,可以逐词降低分数。我们的暴露 AI 写作的词语和短语清单就是具体的词汇表。
- 句子结构的同质性。 这一点常被人低估。模型输出的句子长度异常均匀,且从句结构重复。人类学术写作是在不同速度下、历时数日完成的,因此变化要大得多。打破这种同质性,拆分一些句子并合并另一些句子,使长度和节奏真正变化,比单纯替换词汇更能降低分数,因为方差是直接被测量的。
仅做这两件事中的第一件的工具是改写工具,而这种区别正是这一类别中大多数失望的来源。完整机制见AI 检测器如何工作。
为什么改写常常会让分数更差
Turnitin 的报告并不只有一个 AI 类别,而是有两个。除了被标记为 AI 生成的文本之外,Turnitin 的文档还会单独标记那些“很可能使用 AI 改写工具或换词器修改过”的文本,并说明其指标还包括检测那些“可能已经被人类化,或通过绕过器处理以避免检测”的内容。
把这两个事实放在一起看,失败模式就很明显了。将 AI 文本通过一个同义词替换式改写工具处理,会改变出现的词语,同时大致保留句子节奏和可预测性不变。草稿并没有离开被标记的区域,而是从一个被标记的类别转移到另一个被标记的类别,并且现在还叠加了机器改写的额外特征。这就是为什么改写后的文本仍然会被标记,以及为什么人类化工具与改写工具之间的区别是在选择工具之前最需要理解的一点。
Turnitin 的报告实际上显示了什么
报告本身有几个机制值得了解,因为它们会改变对一个数字的解读方式。
该百分比涵盖符合条件的文本,即长篇写作中的散文句子,而且文件在生成任何分数之前,至少需要包含 300 个词的此类文本。低于 20% 的分数会显示星号而不是数字,因为 Turnitin 报告在该范围内的错误率明显更高。AI 指标与相似度分数是分开的,两者彼此独立,这就是为什么知道哪一份报告对应哪一种指控很重要。学生默认看不到 AI 指标,教师和管理员可以看到。
关于准确性,Turnitin 公布的文档级假阳性率,对于 AI 写作占 20% 或以上的文档,低于 1%,而在单个高亮句子的层面约为 4%。它也明确表示,该模型“可能并不总是准确”,并且“不得作为对学生采取不利行动的唯一依据”。百分比是需要讨论的证据,不是裁决,而如果你被指控,应如何回应说明了这场对话。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
为什么引文决定改写是否能够保留
如果改写破坏了文档,那么更低的分数也毫无价值。这是大多数人直到事情发生在自己身上之前都不会考虑到的失败。
没有引文规则的 humanizer 会把“(Nguyen et al., 2024, p. 213)”当作可供改写的普通文本。姓氏会偏移,括号内容会并入句子,页码会消失。每一次编辑读起来都很流畅,而每一次都会破坏一条审阅者会对照你的参考文献列表核查的引文。术语也会以同样的方式失效, “randomly assigned” 悄悄变成 “randomly distributed” 描述的是不同的方法,而一个经过验证的工具名称只有一种正确形式。统计数据是第三种情况,其中小数点的移动会改变一项发现。
这些都不会被检测器捕捉到,但都会被监督者捕捉到。TextPulse 将每一种情况都作为一种命名行为来处理, 具体包括, 引文在六种参考文献格式中以括号式和叙述式两种形式逐字保留, freeze terms 在运行处理前锁定任何构念或工具名称, 统计量和效应量自动保留, 以及语体保持在 Flesch-Kincaid 13 到 18 年级区间内学术读者所期望的水平。文档也会整体处理,而不是分段处理,因此不会出现术语在不同处理轮次之间漂移的接缝。
为什么没有任何供应商能够承诺 Turnitin 结果
这一点需要明确说一次。Turnitin 的分类器在你的机构内部运行,在你提交的文件上,在你提交的当天运行,并且会随着新的语言模型发布而重新训练。没有任何改写工具能看到那份报告,而该工具的供应商也无法了解其中内容。任何承诺保证通过的产品,描述的都是它在自己的账户下、在它自行选择的文档上、针对一个后来已经变化的分类器版本所做的运行结果。
供应商能够有可信度地做到的,是在大规模范围内进行测量,并在注明语料库的情况下公布结果,这正是 TextPulse 的 2,000-document benchmark 旨在达到的标准,也是衡量其他一切主张时应当坚持的标准。
如何判断替代方案
如果你正在权衡其他工具,有四项检查可以迅速将它们区分开来,而且这四项检查与我们在AI humanizers 的完整比较中使用的标准相同。
- 在你自己的段落上测试。 粘贴包含两三个引文和几个已定义术语的真实文本,然后逐行阅读输出。姓氏、年份和页码是否仍然准确地保留在原处,任何技术术语是否被贴心地替换成了近义词。
- 检查每次处理的字数上限,而不是每月总量。 一个每次请求限制为 600 或 750 词的工具会把一章切成碎片,而把这些接缝重新对齐是价格说明里从未提到的人工工作。
- 问清楚目标语体是什么。 改写得更像人,通常意味着改写得更像对话,这对新闻通讯合适,对方法部分则不合适。
- 重视证据,而不是形容词。 一个有名称的语料库规模和有名称的检测器,是一项可以核查的主张。退款政策是一种客户服务流程,而且它是在一章已经提交之后才出现的。
结论
对于 Turnitin 会阅读的文档,TextPulse 是应当使用的工具。它公布的是经过测量的通过率,而不是口号,它是围绕学术文档构建的,而不是围绕击败某个有名称的检测器构建的,并且它会保护那些决定你的作品能否通过更重要的人类读者检验的引文、术语和统计数据,而这位人类读者比分数更重要。
请以诚实的方式使用它,这也是一种经得起检验的方式, 如果你的院系允许,就在 AI 协助下起草,按照你的机构要求的措辞披露这种协助,在需要时引用该模型,并通过 TextPulse 学术人性化工具 处理草稿,使行文读起来像你自己的写作,而不是某个模型的写作。然后在提交前自己再读一遍,因为没有任何工具可以替代最后这一遍检查。
常见问题
TextPulse, 适用于学术文档。它公布了来自 2,000 篇文档学术语料库的测量通过率, 对 Turnitin AI 为 92.33%, 对 Originality.ai 为 89.12%, 对 GPTZero 为 87.91%, 并且它跨六种参考文献格式保留引文, 用 freeze terms 锁定术语, 并保持学术语体。没有任何工具能够保证你的特定文件一定得到某种结果, 因此已公布的测量数据是目前最强的证据。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.