AI Detection

如何证明你没有使用 AI

没有任何单一事实能够证明一篇论文是如何写成的。取而代之的是相互印证, 即独立的、难以伪造的痕迹, 它们指向同一叙述。以下说明这种证据实际是什么样子, 以及如果你还没有被指控任何事情, 现在应当开始做什么。

6 min
How to prove you didn't use AI: a table of evidence types from version history to search logs and how hard each is to fake

假设你从未被指控任何事情。如何证明你没有使用 AI 这个问题,仍然值得提前回答,因为答案是在数周内建立起来的,而不是在指控出现后于一个下午内生成的。如果你现在就在现实压力下问这个问题,好消息是,你所需要的大部分内容也许已经存在于某个你还没有想到去查看的地方,散落在文档历史、浏览器,以及一个你以为从来不会有人追问的笔记文件夹中。

严格意义上,法庭能够认可的那种证明,并不存在于一篇文章是如何写成的这件事上。取而代之的是佐证, 即彼此独立、难以伪造、并且指向同一事件叙述的痕迹。这一区分在你理解AI 检测器实际上有多准确之后更为重要,也在你意识到被标记的分数往往反映的是工具本身,而不是执笔的人之后更为重要。审查者寻找的不是单一的决定性证据。他们要看的是,你对自己如何写出某些内容的说明,是否经得起与当时同时发生的其他一切事情的对照。

如何证明你没有使用 AI, 哪些证据实际上站得住脚

这里反复出现的证据有五类,按从最容易到最难事后伪造的顺序列出。它们没有任何一项本身就构成证明。但把它们放在一起,尤其是跨越数周而不是数小时,它们就很难在事后被制造出来,而且还能保持一致。考虑到一个构建良好的检测器仍然经常产生假阳性,这一点值得提前准备好。

证据它实际显示的内容事后伪造的难度
版本历史记录(Docs 或 Word)编辑时间线,而不只是一个完成的文件困难, 这意味着要把整份草稿分阶段伪造出来,按顺序进行,并分布在合适的天数里
文件和云端时间戳文件何时创建、保存和同步,与其中内容无关对于服务器端云日志来说很难,对于从未同步过的纯本地文件则更容易
搜索和资料库历史记录当你说你在查看相关来源时,你确实是在查看这些来源困难, 需要在被指控之后生成一条看似合理、持续多天的研究轨迹
手写笔记和打印草稿一份物理的、单独带有时间戳的你自己写作过程记录困难, 纸张不会继承数字化的撤销历史
围绕阅读内容进行口头说明你是否能够在没有提示的情况下解释你自己的来源和选择最难, 在真实质询下很难维持

Google Docs 或 Word 的版本历史记录能证明是你写的吗?

可以,但证明力明显有限。Google Docs 内置完整的版本历史记录,会自动保存你的工作,即使你自己忘记保存也一样。点击屏幕顶部的 Last edit,或者使用 File 菜单,可以查看文档随时间保存下来的所有先前版本,以及每次新增了多少文本。这是每个账户都免费的标准功能,不是额外付费项目。

当 Word 文件存储在 OneDrive 或 SharePoint 中,而不是只保存在本地磁盘上时,它的工作方式也类似, 在 File 菜单下查找 Version History,或者在文件所在位置右键单击该文件,就可以查看写作期间保存下来的各个版本。一个文件如果始终只是作为单个本地 .docx 存在,而且没有保存历史记录,这种情况相当常见。这确实意味着这种特定证据将不可用,在依赖它之前值得先了解这一点。

版本历史之所以强大,主要是因为,要把它伪造得令人信服,速度很慢。被指控后试图制造一段历史的人,需要把一篇完成的论文逐步粘贴进去,按一个看似合理的顺序,分散到一个看似合理的会话次数中,这几乎和一开始直接写这篇论文一样耗时,而且在检查下,往往也无法匹配真实起草时的编辑模式。真实草稿会停顿、回退,并且增长不均匀。粘贴进去的伪造内容往往会以大块、异常整洁的形式出现,这一点通常在版本列表本身中就能看出来。

文件和云端时间戳能证明什么吗?

能证明一些东西,但不如版本历史那么多。文件的创建日期和修改日期会告诉你它是什么时候创建的,以及最后一次修改是什么时候,即使其中没有任何内容。你的云服务对该文件的活动日志也会告诉你它是什么时候创建的,以及最后一次修改是什么时候,同样不管其中有什么内容。这就是为什么它比仅仅依靠本地文件系统上的时间戳更难伪造。Google Drive、OneDrive 和 Dropbox 都会把这类活动记录与文件本身分开保存,存放在它们自己的服务器上。

纯本地文件是这种证据中较弱的一种,因为只要具备基本技术知识并且有动机,任何人都可以更改计算机自身的文件时间戳。一个始终存在于同步云文件夹中的文件,如果还有独立的服务器端活动日志,那么证据要强得多,因为那份日志完全位于你自己的设备之外。如果你不确定某个文件属于哪一类,现在就检查它的共享或活动设置,而不是事后再看, 因为一个悄悄同步到云账户数周的文件,背后已经有这份记录,无论你自己是否曾打开活动日志。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

搜索和资料库历史能帮助你的案件吗?

是的,而且这是最容易被忽视的一类证据之一。浏览器历史记录会显示你在研究过程中访问过的搜索和页面,而且大多数浏览器默认会保留这些记录数周或数月。大学图书馆的数据库登录和检索记录则更进一步,它们存放在机构自己的服务器上,而不是你的设备上,因此没有人可以合理地声称你事后伪造了它们。

文献管理工具又增加了第三层记录。Zotero、Mendeley 和类似工具会为你添加的每一条来源以及附加的每一条笔记加上时间戳,形成一条研究轨迹,这条轨迹会随着你实际工作的进行而自动增长,而不是你有意构造出来的。撰写过程中使用的 citation generator 也会留下类似但更小的痕迹, 又多了一份在任何人提出要求之前就已经存在的独立记录。这些工具都不是为了让你在被指控时自我辩护而设计的。正因如此,它们留下的轨迹才具有说服力, 因为它从未被刻意摆拍。

手写笔记、打印稿,以及你可以讨论的阅读内容

纸质笔记有其独立的时间线,数字化指控无法触及。带批注的打印件、边缘潦草写着提纲的笔记本、图书馆书页上的便签,这些都独立于任何计算机而存在,也无法在事后通过编辑 Word 文件的元数据来生成。提交一篇写作后,应当保留这些材料,而不是回收处理,至少要保留到成绩最终确定为止。

而最有力的证据往往并不是某份文件。它是你能够围绕自己的论文进行说明, 为什么选择这份来源而不是那份,第三段实际上在论证什么,你几乎删掉了哪一项主张,以及为什么最后又保留了它。只要付出足够努力,你可以伪造一份完成的文档。

为什么这是佐证,而不是证明,以及现在该开始做什么

严格来说,这些都不是证明。它们是一组相互印证的材料,其力量在于,事后伪造它们,比最初写出这篇文章本身更困难。评审者把五个相互独立、彼此一致的信号与一个有争议的百分比进行权衡时,所权衡的内容远不止这个百分比本身。这才是大多数申诉和听证实际采用的标准,无论是否有人用这种方式表述它。

如果你还没有被指控任何事情,那么现在正是养成这种习惯的更容易时机。若版本历史尚未自动开启,就把它打开,保存逐步草稿,而不是覆盖同一个文件,并保留你原本会删除的搜索历史和笔记。你也可以先看看自己的写作目前读起来如何,使用TextPulse 的免费工具,在别人给它评分之前,这与检测器运行时所依据的同一底层测量方式只是另一种用途。

把这些证据转化为一份文件是另一项独立的技能,而撰写申诉信这一页正是为此而设。了解几所大学已经完全停止使用 Turnitin 的 AI 检测器也会有所帮助。

这些习惯都不需要很长时间就能开始。伪造它们却需要很长时间,这正是关键所在,也正是为什么在你真正需要它们之前就把它们建立起来是值得的。

XLinkedInFacebook

常见问题

如何证明你没有使用 AI 来写论文, 关键在于相互印证, 而不是某一条单独的证据。Google Docs 或 Word 的版本历史, 文件和云端时间戳, 搜索和图书馆历史, 以及纸质笔记或草稿都算。没有任何一项单独就能 निर्ण定。把它们放在一起, 并且覆盖真实时间而不是事后生成, 就比论文本身当初写出来还要难以伪造。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。