教授能看出你是否使用了ChatGPT吗?
在这里,检测软件的重要性往往低于多数学生的想象。本文将说明,一位已经读过你作品的教授在草稿不再像你本人时会实际注意到什么,从一项具有里程碑意义的阅卷者盲测研究,到在任何人运行扫描之前就会出现的具体、可核查迹象。
在雷丁大学进行的一项盲测将 63 份 ChatGPT 答案混入 1,134 份真实学生提交的本科心理学考试答卷中,并让通常的阅卷教师在不知道哪些答卷属于谁的情况下对全部内容评分。该研究于 2024 年 6 月发表在 PLOS ONE 上,结果显示,94 percent 的 AI 答案完全未被标记出来,而且它们的平均得分比真实学生高出大约半个等级边界,集中在 2:1 到一等成绩区间。
教授能看出你是否使用了 ChatGPT 吗?大多数时候,不能,至少不能仅凭一位从未见过作者作品的阅卷教师进行一次盲读来判断。另一种检验则是你自己的教授, 负责给你的特定论文评分的教授通常已经读过你的写作,曾在研讨课上与你面对面交流过,并且设定了你的论证应当回应的具体文本。雷丁研究中并不存在这些条件,而这正是真实课程与交到陌生人手中的考试答卷之间的区别所在。
教授能看出你是否使用了 ChatGPT 吗?先从他们已经知道的内容开始
Turnitin 的 AI 写作指示器是大多数学生在提出这个问题时会想到的软件,而它会标记什么,以及会漏掉什么,是一个具体且有记录可查的事实,而不是值得猜测的谜团。不过,大多数教师主要并不是依据仪表板上的一个百分比来判断。他们依据的是一份可以与你其他文档放在一起比较的材料, 例如第三周的一篇讨论帖,一份你附带问题发给他们的粗略草稿,或者两个月前你在研讨课上答不上来的即席提问。
教授对你写作的实际了解,才是“教授其实一眼就能看出来”背后的真正机制。它来自你句法的样本、你常犯的错误、你倾向于采用的论证方式,以及在没有人按文采给你评分时你通常写到的具体程度。润色程度突然提高之所以显眼,是因为它与这一基线不符。盲测中的首次评分者一开始根本没有可供比较的基线。
盲测考官所发现的结果,以及为什么这并不是全貌
Reading 的这项研究值得再多看一会儿,因为标题数字之下的细节,比标题本身更有用。只有 6.35 percent 的 AI 答案被标记为某种学术不端问题,而仅有 3.17 percent 被明确标记为 AI 写作。其余答案都像任何其他试卷一样,被标记、评分并退回。这与AI 检测软件中的误报和偏差是不同的问题,后者在其他地方获得了最多关注。这项研究测量的是人的原始辨别能力,双方都没有使用任何算法。
这并不意味着考官粗心。它意味着这项研究的设计是为了检验一个特定问题, 即一位评分者第一次看到一段文字时,在没有关于作者的任何其他信息的情况下,能否将它与同一问题的人类答案区分开来。这几乎是检测问题最困难的版本,而研究人员正是有意这样设计的。正如 Reading 的 Peter Scarfe 在研究发表时所说,'our research shows it is of international importance to understand how AI will affect the integrity of educational assessments,' 这是一项涉及整个行业的问题,而不是某个院系的好奇心。
将你自己的论文人性化
改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。
会暴露草稿的具体特征
在任何软件介入之前,通常会先浮现出四类证据,而且其中没有一类需要特殊训练才能察觉。这也是为什么已经熟悉你写作风格的教师,往往不用打开检测器就能发现它们。
| 信号 | 在实践中的表现 |
|---|---|
| 论文中途的语体转变 | 前两段是你平常的语气,接着出现一段读起来像是另一位更正式的作者接手写下的文字 |
| 模块从未布置过的来源 | 对从未出现在阅读清单上或在研讨课上提到过的文本的引用,与那些确实出现过的引用并列出现 |
| 没有研讨课痕迹的论证 | 一个忽略了课程在布置论文那一周花了二十分钟讨论的具体反驳点的主张 |
| 未编辑的输出留在文本中 | 一条多余的指令,一个重复的短语,或一行只有作为聊天文本残留才说得通的内容,而在提交前没有人重新阅读过 |
最终草稿中留下未编辑的 AI 输出,听起来像是一种罕见的迹象,直到你看到它在时间压力下出现得有多频繁。Alcorn State University 的历史教师 Jason Gibson 在 2026 年 7 月直接测试了这一点,他在考试提示中用白色文字隐藏了一条指令,页面上看不见, 在答案中以毫无意义的方式放入 Madagascar 这个词。35 名学生中有 32 名完全照做,在关于工业革命的答案里写出了诸如“Madagascar 在下午斜着漂浮”之类的句子。
这件事不需要检测器。他把自己的发现告诉了学生,并允许他们对成绩提出异议, 其中两人提出了异议,一人成功了,因为她读到了那一行隐藏文字, 她屏幕上的深色模式让白色文字变得可见。发现未编辑的 AI 输出很少需要取证软件。通常只需要有人读一读答案。
关于一篇实际上没人读过的文本的自信散文
有时,破绽是一条根本不存在的引文。2024年发表于 The American Economist 的一项研究将 GPT-3.5 和 GPT-4 与取自 Journal of Economic Literature 的提示进行测试,发现 GPT-3.5 生成的引文中有超过 30 percent 是完全捏造的,GPT-4 的这一比例也只略好一些。模型在写引文时并没有检索任何内容。它之所以生成看起来合理的作者、标题和年份,是因为这些模式在其训练数据中是一起出现的,而不是因为确实存在相应来源。
有时,来源是真实的,但从课程大纲来看却根本无法解释,这更接近于 University of Bolton 早期一个有充分记录的案例所暴露的问题。审查一篇领导力理论论文的调查人员发现,文章在不同部分之间文风发生了变化,陈述之间缺乏逻辑衔接,而且参考文献表只由通过课程自身 Moodle 系统可获得的两种期刊构成,完全没有使用指定阅读清单中的材料。
其中一条引文指向一篇真实但极其冷僻的2022年文章,该文将 Harry Potter 应用于领导力理论,这正是任何依据课程大纲写作的学生不可能偶然选中的来源。事实上,这篇论文是从第三方写作服务购买的,大学调查认定该服务在部分内容中使用了 ChatGPT,而该学生因此未通过该作业,并且必须重修。最终暴露问题的是一位评分者,他知道该模块实际布置了什么内容,并注意到这篇论文并不是据此写成的。
这并不意味着什么,以及更值得培养的习惯
这并不意味着任何不一致都会让你被指控,也不意味着润色过的写作本身就有风险。教授阅读的是整份提交中的整体模式,而不是某一句可疑的话,真正出现担忧后所启动的程序,也会先依据证据和沟通的规则运行,然后才会进入任何正式程序。
无论其他因素如何,更有用的习惯,是在提交之前而不是在别人指出之后,检查你自己的草稿,看看是否存在读者会注意到的那种语体漂移。免费语体检查器会标记出一段已经偏离你平常语体的文字,这种变化也是教授会凭眼睛注意到的。那是一种校对习惯,不是技巧,而且无论草稿中是否有任何一个词接触过聊天机器人,它都有效。
这个问题更直白的版本,我会因为使用 ChatGPT 而被发现吗,有单独的答案。更狭窄的那个问题,关于Turnitin 是否能检测改写文本,也是许多学生真正卡住的地方。
TextPulse 的面向学生的 AI humanizer基于同样的基本思路运作, 它报告一个估计的 Human Score,这个分数是根据你自己写作的统计形态构建的,而不是对任何特定教授的软件会说什么的断言,因为没有任何工具能够负责任地对它不控制的系统作出这样的承诺。将它用于你在提交前的草稿时,它起到的是对你自己声音的第二次、无偏见的阅读,而不是在事后与任何人争辩的一种方式。一篇文章逐行读起来越具体、越真正属于你自己,这一切就越不必被提起。
常见问题
通常可以,不过很少仅凭软件。教授能看出你是否使用了ChatGPT吗?关于盲评分的大学研究表明,单独阅卷的陌生人往往看不出来, 一项2024年的研究发现,阅卷者漏判了94 percent的AI写成的考试答案。你的任课教师通常掌握更多线索,包括你以往的写作,以及课程实际涵盖的具体材料,而现实中的大多数案例正取决于这些因素。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.