学术写作机制:审稿人注意到的语法与标点
审稿人对你论证的判断,与你的逗号拼接错误和撇号问题并不像你希望的那样彼此独立。以下说明受控研究对机制实际上会给论文带来什么代价的结论,以及在任何人阅读之前最值得先纠正的具体规则。
研究人员给成年读者同一封求职申请的求职信,并要求他们评价作者。唯一的差别是其中错误的数量, 每一百个词大约两个错误,属于用词错误和主谓一致缺失,而不是任何会改变意思的内容。带有错误的版本在七分量表上的写作质量评分低了整整两分。人们还认为,它的论证也更弱,尽管两个版本中的论证完全相同。关于学术写作机制的研究不断发现,读者对内容实质的判断,并不像大多数建议所假定的那样,与表层正确性完全分离。
支撑这一发现的研究针对的是求职申请,而不是手稿。对此需要准确说明,而不是把它延伸到超出其适用范围的程度。它所分离出的机制,即表层错误会改变读者对其可核实且未被改变的内容的评分,这一机制也同样作用于审稿人、导师或评分者阅读你的草稿时。本文将说明机制实际上包括什么,证据如何解释其重要性,以及那些即使在拼写检查显示文档干净之后仍然容易出错的具体规则究竟在哪里。
什么算作学术写作机制
学术写作机制是一套表层规范,包括语法、标点、拼写和大小写。读者在这些方面处理得当时几乎不会注意到,一旦处理不当就无法不注意。它位于文体之下,文体关乎用词和句子构造,也位于论证之下,论证关乎主张是否成立。一个句子可以在机制上毫无瑕疵,却论证糟糕, 一个有力的论证也可能通过这样的句子呈现出来, 以至于读者因为某处本该有逗号却缺失而不得不重读。审稿人、导师和评分者受过训练,去评价论证。下面的证据表明,他们无法把这一判断与其下方的机制完全分开。
为什么审稿人会先注意到机制
上文的求职信研究,是目前关于接下来会发生什么的最清晰示范。威斯康星大学欧克莱尔分校的研究人员让200名社区成年人阅读同一封求职信的三个版本之一, 这些版本分别是, 没有错误, 每100个词有2个错误的典型错误率, 或每100个词有4个错误的高错误率。随着错误率上升, 写作质量评分在七分制上从5.79降到3.61, 再降到2.95。值得细看的部分是, 还有什么也下降了, 信件的内容、资质和论证的评分, 从干净版本的5.85降到两个有错误版本的约4分, 尽管三者的内容逐字完全相同。
人物判断也发生了变化, 而且这些特质表面上与语法毫无关系。阅读有错误信件的参与者, 对同一位申请者的能力、勤奋程度和团队合作倾向评分都更低, 在五分制上几乎低了整整1分, 低于阅读干净版本的参与者。申请者的资格在不同版本之间没有任何变化。变化的只有错误率。
有一种解释可以同时说明这两项发现, 而不必诉诸任何关于语法本身的神秘之处。读者的注意力是有限的, 每一个错误都会迫使其稍作绕行, 重新解析句子, 猜测原本想写的词, 判断这个错误是否重要。这个绕行本身就是信息。读者会利用它, 往往甚至没有意识到, 把它当作关于整份文档投入了多少细致程度的证据, 而一份文档投入了多少细致程度, 作为其质量的替代指标并不差, 只是它并不完美, 而且被用在了页面上错误的部分。
这些问题会累积起来。2023年对八个国家的908名环境科学家进行的一项调查显示,在英语水平中等的国家,38.1%的研究人员,以及在英语水平较低的国家,35.9%的研究人员,曾因论文的英语写作而被拒稿,而英语母语者这一比例为14.4%。这种代价也体现在时间上。来自英语水平较低国家的研究人员表示,他们用英语写论文所花的时间比英语母语者多约30%。这一切都意味着,ESL作者需要尽可能多的帮助,这也是我们构建 TextPulse 的面向ESL作者的AI humanizer的原因。时间和结果上的差距有充分的文献记录,而不是凭空假设。机械层面只是其中一部分,作者可以在审稿人看到草稿之前直接处理。
拼写检查无法发现的标点错误
拼写检查可以发现拼写错误的单词,但它对逗号拼接句、用分号连接一个不能独立成句的分句,或错误位置的撇号都无能为力,因为这些都不是拼写错误。逗号问题和撇号误用在美国大学写作中最常见错误的列表中名列前茅,而一个免费的逗号检查器可以比人工校对更快地捕捉其中大多数错误的机械形式。这里值得快速提及的四种错误,而不是逐一作完整解释,因为每一种在别处都已有更详细的讨论。
| 错误类型 | 其实际含义 |
|---|---|
| 逗号拼接 | 两个独立分句只用一个逗号连接,没有连词或分号承担连接作用 |
| 分号误用 | 分号用于第二部分不能独立成句的地方 |
| 撇号错误 | 把 its 写成 it's,或者把普通复数写成所有格,却没有任何所属对象 |
| 序列逗号省略 | 三项或以上列表中 and 前面的逗号,APA 要求使用,而新闻写作风格通常省略 |
最后一行值得单独说明一下,因为它在两个方向上都会让人感到意外。APA 风格要求使用序列逗号,也就是三项或以上列表中最后一个 and 前面的那个逗号,理由正是逗号存在的清晰性功能。报纸风格指南通常会省略它。只有当手稿与读者被告知应当遵循的风格指南不一致时,它才算错误,这属于格式问题,而不是语法问题,审稿人往往无论实际适用哪一种标签,都会把它看作粗心。
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
同一篇论文中的美国和英国惯例
拼写惯例是最明显的机械性问题,也是最容易出现前后不一致而不是彻底错误的问题。一篇手稿如果在同一份文档中混用 colour 和 color,或者 organised 和 organized,即使每个词在世界某处都拼写正确,读起来也会像未经编辑。修正办法与其说是选择正确的变体,不如说是选定一种并在整篇文档中保持一致,包括标题和图注,而 free US to UK English converter 比逐行阅读检查要快得多。
-ize 和 -ise 的问题最容易让谨慎的写作者出错,因为它并不像人们以为的那样,能清楚地按美国英语和英国英语划分。美国英语始终使用 -ize。英国英语大多使用 -ise,但 Oxford University Press 和 Oxford English Dictionary 基于词源学理由使用 -ize,因为这些受影响的词源自一个拼写含 zeta 的希腊语后缀。决定某次投稿中哪一种正确的,不是国家层面的默认规则,而是期刊自身的体例,唯一可靠的做法是查阅该期刊的具体指南,而不是相信直觉。
语体:缩略形式与其他判断问题
缩略形式是学术写作中最清晰的语体信号,而这一规则比人们记得的那些例外更为确定。APA 体例要求将缩略形式完整拼写出来,而不是使用它们,因此,初稿中写成 it's important 的句子,在定稿中应写成 it is important,其理由是,正式语体在没有这些缩略形式时显得更为精确。每本体例指南都同意的唯一例外是直接引语。如果你引用的来源使用了缩略形式,就应当原样复现,而不是悄悄扩展它们,contraction expander 是在导师发现之前,快速找出草稿中遗漏项的有效方法。
第一人称比大多数体例指南所暗示的更少属于判断问题。APA 体例允许,而且其现行指南明确鼓励,使用 'I' 或 'we' 来描述你自己的行动和决定,目的正是让写作者采用这一表达,而不是笨拙的被动结构。围绕代词构成的句子之所以显得不够正式,不在于代词本身,而在于句子结构本身: 'I feel that the results are important' 与 'I analyzed the results using a mixed-effects model.' 的读感不同。前者是披着学术外衣的意见。后者是方法陈述,而没有任何体例指南会因为它使用了 'I.' 而对其加以惩罚。
为什么自动检测工具会漏掉其中一半
拼写检查器通过词典查找来工作, 它会标记出一串字母, 只要这串字母在其词表中找不到对应条目。正因如此, 美国大学写作全国研究中最常见的单一错误却能毫发无损地通过。Andrea Lunsford 领导的一项全国比较研究将 wrong word, 即一个真实存在、拼写正确, 但含义并非作者本意的词, 列为二十类常见错误之首, 排在同一列表中所有逗号和撇号问题之前。把 prescience 写成本应为 precedence, 或让拼写检查器的自动更正把 allergy 改成 allegory, 两者都会生成一个真实词。词典查找无法知道你的句子实际上需要的是哪个真实词。
语法检查器则更进一步, 它通过统计方式解析句子结构, 因而能够发现真正的主谓不一致, 或与先行词不一致的代词, 例如 'every worker must provide their own uniform' 将单数主语与复数代词混在一起。也正因为如此, 语法检查器彼此之间的分歧比拼写检查器更大, 训练于不同数据的两个统计解析器, 可能会以两种不同方式解读同一个有歧义的句子。在主管看到草稿之前, 先运行一次免费的语法检查器和一次免费的标点检查器, 可以发现这两类问题中的相当一部分。二者都无法发现那种在错误语境中恰好在语法上成立的 wrong-word 错误, 而这正是更慢的逐句阅读仍然能够发现、任何自动化检查都无法做到的。
AI 起草的文本仍然需要这一遍检查的地方
但一旦一份草稿经过 AI 工具处理,这些问题就不再无关紧要,实际上,它们变得更加重要。模型为你起草一个段落时,可能会在一段本来流畅的句子中产生主谓一致错误,而经过大量改写或人类化处理的段落,也可能出现疲惫的人类作者常见的同类失误, 例如省略撇号、在本该使用句号的地方出现逗号拼接,或者在某一部分中途出现不一致的拼写变体。AI 工具往往产生的写作模式本身就是一个独立主题,与这里所述的机械性检查不同,这种检查适用于某个段落是由你、模型,还是两者共同开始的情况。
TextPulse 的免费工具正是为这种检查而设计的,它们在同一份草稿上检查语法、标点和拼写规范,而不需要订阅多个不同的服务。进行这样的检查只需五分钟,这不是重写,而是那种会改变下一位读者在读到其中任何一页之前,对其他页面所作判断的五分钟。
上面的每一项机械性问题都在别处有详细讨论。逗号拼接、分号与逗号的比较、撇号以及APA 中的牛津逗号都分别单独处理,而最容易让国际学生出错的两项规范,美式拼写与英式拼写以及-ize 还是 -ise 的问题,也各有专页。缩略形式是否适用于学术写作另有回答,研究论文中最常反复出现的语法错误也是如此。从头到尾校对论文是一项独立工作,也有自己的指南。
这就是读者的做法。他们把自己能够核实的文本部分,逗号、主谓一致、拼写,视为关于那些他们尚无法核实部分的信号。如果你把这个信号处理正确,你的论证就会得到它应得的阅读评价。那些因为 2% 的错误率而把一封完全相同的求职信评分低 2 分的读者,并不是不公平。
Frequently Asked Questions
学术写作机制指的是表层规范,包括语法、标点、拼写和大小写。读者在这些方面正确时往往不会注意到,一旦不正确就无法忽视。它位于文体之下,也位于论证之下。论文即使论证充分,如果机制不一致,读起来仍可能显得粗心,而审稿人也常常会让这种印象影响他们对下文论证的细致程度。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.