학술 글쓰기의 기계적 요소: 검토자가 주목하는 문법과 구두점
당신의 논증에 대한 검토자의 판단은 당신이 바라는 것보다 쉼표 연결 오류와 아포스트로피와 더 분리되어 있지 않다. 통제된 연구가 기계적 요소가 실제로 논문에 어떤 비용을 치르게 하는지, 그리고 다른 사람이 읽기 전에 반드시 바로잡아야 할 구체적 규칙이 무엇인지 보여준다.
연구자들은 성인 독자들에게 같은 구직 지원서 자기소개서를 주고 작성자를 평가하게 했다. 유일한 차이는 그 안의 오류 수였는데, 대략 백 단어당 두 개 정도였고, 의미를 바꾸는 것이 아니라 잘못된 단어 선택과 주어 동사의 일치 누락이었다. 오류가 있는 버전은 글쓰기 품질에서 7점 척도 기준으로 정확히 2점 낮게 평가되었다. 또한 사람들은 두 버전에서 동일한 논지를 더 약하다고 보았다. 학술 글쓰기의 기계적 요소에 관한 연구는 독자의 내용 판단이 대부분의 조언이 가정하는 것만큼 표면적 정확성과 분리되어 있지 않다는 점을 계속 보여 준다.
그 발견의 근거가 된 연구는 원고가 아니라 구직 지원서에 관한 것이었다. 그것이 어디까지 적용되는지보다 더 멀리 확장하지 않도록, 그 점을 정확히 말하는 것이 중요하다. 그 연구가 분리해 낸 메커니즘, 즉 표면적 오류가 독자가 내용이 변하지 않았음을 확인할 수 있는 경우 그 내용을 어떻게 평가하는지 바꾸는 메커니즘은, 검토자, 지도교수 또는 채점자가 초안을 읽을 때도 같은 방식으로 작동한다. 이 글은 기계적 요소가 실제로 무엇을 포함하는지, 그것이 왜 중요한지에 대한 증거가 무엇인지, 그리고 맞춤법 검사에서 문서가 깨끗하다고 나와도 여전히 틀리기 쉬운 구체적 규칙들이 어디에 있는지를 설명한다.
학술 글쓰기의 기계적 요소에 해당하는 것
학술 글쓰기의 기계적 요소는 표면 수준의 관습, 문법, 구두점, 철자, 대문자 사용으로 이루어진 집합이며, 이것들은 올바르게 처리되면 독자가 거의 의식하지 않고 받아들이지만, 그렇지 않으면 곧바로 눈에 띈다. 이는 어휘 선택과 문장 구성에 관한 문체보다 아래에 있고, 주장들이 타당한지에 관한 논증보다도 아래에 있다. 문장은 기계적으로는 완벽하지만 논증은 형편없을 수 있고, 반대로 강한 논증도 쉼표가 필요한 곳에 쉼표가 없어 독자가 다시 읽어야 하는 문장들로 전달될 수 있다. 검토자, 지도교수, 채점자는 논증을 평가하도록 훈련받는다. 아래의 증거는 그들이 그 판단을 그 아래에 놓인 기계적 요소와 완전히 분리할 수 없다고 말한다.
검토자가 다른 무엇보다 먼저 기계적 요소를 알아차리는 이유
위의 cover letter 연구는 다음에 무슨 일이 일어나는지 보여 주는 가장 명확한 사례이다. University of Wisconsin-Eau Claire의 연구자들은 지역사회 성인 200명에게 동일한 cover letter의 세 가지 버전 중 하나를 읽게 했다. 오류가 없는 버전, 100단어당 2개의 오류라는 전형적인 오류율의 버전, 그리고 100단어당 4개의 오류라는 높은 오류율의 버전이었다. 글쓰기 품질 평가는 오류율이 높아질수록 7점 척도에서 5.79에서 3.61로, 다시 2.95로 떨어졌다. 더 주목할 부분은 무엇이 또 떨어졌는지이다. 편지의 내용, 자격, 논거에 대한 평가는, 세 버전 모두 내용이 단어 하나까지 동일했음에도, 깨끗한 버전의 5.85에서 두 오류 버전 모두 약 4 수준으로 내려갔다.
인물에 대한 판단도 움직였다. 표면적으로는 문법과 아무 관련이 없는 특성들에서 그러했다. 오류가 많은 편지를 읽은 참가자들은 깨끗한 버전을 읽은 참가자들보다 같은 지원자를 더 덜 유능하고, 덜 성실하며, 덜 팀 지향적이라고 평가했으며, 5점 척도에서 거의 1점에 가까운 차이가 있었다. 지원자의 자격은 버전 간에 전혀 변하지 않았다. 달라진 것은 오류율뿐이었다.
하나의 설명은 문법 자체에 대해 어떤 신비로운 것을 끌어올 필요 없이 두 결과를 모두 잘 설명한다. 독자는 주의력이 제한되어 있고, 모든 오류는 작은 우회로를 강요한다. 문장을 다시 분석하고, 의도된 단어를 추측하고, 그 실수가 중요한지 판단해야 한다. 그 우회로 자체가 정보이다. 독자는 종종 그것을 알아차리지 못한 채, 문서의 나머지 부분에 얼마나 많은 주의가 기울여졌는지를 보여 주는 증거로 사용한다. 그리고 문서에 얼마나 많은 주의가 기울여졌는지는 그 품질에 대한 나쁜 대리 지표가 아니다. 다만 페이지의 잘못된 부분에 적용된, 불완전한 지표일 뿐이다.
그 부담은 누적된다. 2023년, 8개국의 환경과학자 908명을 대상으로 한 조사에서, 중간 수준의 영어 능력을 가진 국가의 연구자 중 38.1퍼센트와 낮은 수준의 영어 능력을 가진 국가의 연구자 중 35.9퍼센트가 논문의 내용이 아니라 영어 글쓰기 때문에 논문이 거절된 경험이 있다고 답한 반면, 영어 원어민은 14.4퍼센트에 그쳤다. 비용은 시간에서도 드러난다. 영어 능력이 낮은 국가의 연구자들은 영어로 논문을 쓰는 데 원어민보다 약 30퍼센트 더 많은 시간을 쓴다고 보고했다. 이 모든 것은 ESL 작성자에게 가능한 한 많은 도움이 필요하다는 뜻이며, 그래서 우리는 TextPulse의 ESL 작성자를 위한 AI humanizer를 만들었다. 시간과 결과의 격차는 추정이 아니라 잘 문서화되어 있다. 그중 하나가 기계적 요소이며, 작성자는 검토자가 초안을 보기 훨씬 전에 이를 직접 다룰 수 있다.
맞춤법 검사로는 걸러지지 않는 문장부호 실수
맞춤법 검사는 철자가 틀린 단어를 찾아낸다. 그러나 쉼표 연결문, 독립적으로 성립할 수 없는 절을 세미콜론으로 잇는 경우, 또는 아포스트로피를 잘못 배치한 경우에 대해서는 아무 말도 하지 못한다. 이들 모두는 철자 오류가 아니기 때문이다. 쉼표 문제와 아포스트로피 오용은 미국 대학 글쓰기에서 가장 흔한 오류 목록의 상위에 나타나며, 무료 쉼표 검사기는 대부분의 기계적 형태를 눈으로 교정하는 것보다 더 빠르게 찾아낼 수 있다. 여기서 빠르게 참고할 만한 실수는 네 가지이며, 각각을 길게 설명하기보다는 간단히 짚고 넘어가겠다. 이미 각각에 대해 더 자세한 설명이 따로 있기 때문이다.
| 오류 | 실제로는 무엇인가 |
|---|---|
| Comma splice | 접속사나 세미콜론 없이 오직 쉼표만으로 연결된 두 개의 독립절 |
| Semicolon misuse | 뒤의 절이 독립된 문장으로 설 수 없는 곳에서 사용된 세미콜론 |
| Apostrophe error | it's를 its로 잘못 쓰거나, 소유 대상이 전혀 없는데도 단순 복수를 소유격처럼 쓴 경우 |
| Serial comma left out | 세 개 이상의 항목 목록에서 'and' 앞의 쉼표로, APA는 이를 요구하고 저널리즘 문체는 일반적으로 이를 생략함 |
마지막 행은 양쪽 모두에서 사람들을 놀라게 하므로 그 자체로 잠시 짚을 만하다. APA 문체는 serial comma, 즉 세 개 이상의 항목 목록에서 마지막 'and' 앞에 오는 쉼표를 요구하는데, 이는 쉼표가 존재하는 바로 그 명료성의 이유 때문이다. 신문 문체 지침은 보통 이를 생략한다. 원고가 잘못되는 경우는 독자가 기대하도록 안내받은 문체 지침과 일치하지 않을 때뿐이며, 이는 문법상의 오류라기보다 서식상의 실패이다. 그리고 검토자들은 실제로 어떤 분류가 적용되는지와 무관하게 이를 대체로 부주의로 읽는다.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
같은 논문에서의 US와 UK 관례
철자 관례는 가장 눈에 띄는 기계적 문제이자, 완전히 틀리기보다 일관되지 않게 맞히기 가장 쉬운 문제이다. 같은 문서에서 colour와 color, 또는 organised와 organized를 섞어 쓰는 원고는, 세계 어디에서든 각 단어가 올바르게 철자되더라도 편집되지 않은 것처럼 읽힌다. 해결책은 올바른 변종을 고르는 데 있다기보다 하나를 선택해 문서 전체, 제목과 그림 설명을 포함해 끝까지 유지하는 데 있으며, 이는 free US to UK English converter가 줄 단위로 읽으며 찾는 것보다 더 빠르게 처리한다.
-ize와 -ise의 문제는 세심한 글쓴이들을 가장 자주 혼란스럽게 만드는데, 사람들이 흔히 가정하듯 미국식과 영국식으로 깔끔하게 나뉘지 않기 때문이다. 미국 영어는 전반적으로 -ize를 사용한다. 영국 영어는 대체로 -ise를 사용하지만, Oxford University Press와 Oxford English Dictionary는 어원상의 근거로 -ize를 사용한다. 해당 단어들이 zeta로 표기된 그리스어 접미사에서 유래했기 때문이다. 어떤 제출물에서 어느 형태가 옳은지는 국가별 기본 규범이 아니라 해당 학술지의 내부 스타일이 결정하며, 이를 확인하는 유일하게 신뢰할 수 있는 방법은 직감에 의존하지 말고 그 학술지의 특정 안내문을 확인하는 것이다.
어조: 축약형과 기타 판단 문제
축약형은 학술 글쓰기에서 가장 분명한 어조 신호이며, 그 규칙은 사람들이 기억하는 예외들보다 더 확립되어 있다. APA 스타일은 축약형을 사용하지 말고 완전한 형태로 풀어 쓰라고 요구하므로, 초고에서 it's important라고 쓴 문장은 최종본에서는 it is important로 써야 한다. 그 이유는 축약형이 없을 때 보다 정밀한 형식적 어조로 읽히기 때문이다. 모든 스타일 가이드가 동의하는 유일한 예외는 직접 인용이다. 인용한 원문이 축약형을 사용했다면, 그것을 조용히 풀어 쓰지 말고 정확히 그대로 재현해야 하며, contraction expander는 초안에 남아 있는 축약형을 지도교수가 보기 전에 빠르게 찾아내는 방법이다.
1인칭 사용은 대부분의 스타일 가이드가 보이게 하는 것보다 더 작은 판단 문제이다. APA 스타일은 자신의 행동과 결정을 설명할 때 'I' 또는 'we'를 사용하는 것을 허용하며, 현재 지침은 이를 적극적으로 권장한다. 이는 글쓴이들이 어색한 수동태 구문 대신 그것을 선택하도록 하기 위해서이다. 대명사를 중심으로 구성된 문장이 비격식적으로 읽히는 것이지, 대명사 자체가 비격식적인 것은 아니다. 'I feel that the results are important'는 'I analyzed the results using a mixed-effects model.'과 다르게 읽힌다. 첫 번째는 학술적 옷을 입은 의견이다. 두 번째는 방법 진술이며, 어떤 스타일 가이드도 'I'를 사용했다는 이유로 이를 문제 삼지 않는다.
자동 검사 도구가 이 내용의 절반을 놓치는 이유
맞춤법 검사기는 사전 조회를 통해 작동합니다. 즉, 단어 목록의 어떤 항목과도 일치하지 않는 글자열을 표시합니다. 바로 그 이유 때문에 미국 대학 글쓰기에 대한 전국 연구에서 가장 흔한 단일 오류가 아무 문제 없이 그대로 통과합니다. Andrea Lunsford가 이끈 전국 비교 연구는 wrong word, 즉 실제로 존재하고 철자도 맞지만 작성자가 의도한 것과는 다른 뜻을 지닌 단어를 스무 가지 흔한 오류 유형 가운데 첫 번째로, 같은 목록의 모든 쉼표 문제와 아포스트로피 문제보다 앞에 둡니다. 문장에서 precedence가 필요했는데 prescience를 쓰거나, 맞춤법 검사기의 자동 수정이 allergy를 allegory로 바꾸도록 두는 경우, 둘 다 실제 단어를 만들어 냅니다. 사전 조회만으로는 문장이 실제로 어떤 실제 단어를 필요로 했는지 알 방법이 없습니다.
문법 검사기는 문장 구조를 통계적으로 분석함으로써 한 걸음 더 나아갑니다. 그래서 실제 주어와 동사의 불일치나 선행사와 일치하지 않는 대명사를 잡아냅니다. 예를 들어 'every worker must provide their own uniform'은 단수 주어와 복수 대명사를 섞고 있습니다. 또한 이것이 문법 검사기들이 맞춤법 검사기보다 서로 더 자주 의견이 다른 이유이기도 합니다. 서로 다른 데이터로 학습된 두 개의 통계적 파서는 같은 모호한 문장을 서로 다르게 읽을 수 있습니다. 초안이 상사에게 보이기 전에 무료 문법 검사기와 무료 구두점 검사기를 돌리면 두 종류의 문제를 상당 부분 잡아냅니다. 그러나 둘 다 잘못된 맥락에서 우연히 문법적으로는 성립하는 wrong-word 오류는 잡지 못합니다. 더 느린, 문장 단위의 읽기는 여전히 그것을 찾아내지만 자동화된 점검은 그렇지 못합니다.
AI가 작성한 텍스트가 여전히 이 점검을 필요로 하는 경우
하지만 초안이 AI 도구를 거친 뒤에는 이 모든 것이 더 이상 중요하지 않게 되는 것은 아니며, 오히려 더 중요해진다. 모델이 사용자를 위해 문단을 작성하면, 전반적으로는 유창한 문장 안에 주어와 동사의 일치 오류가 생길 수 있고, 지나치게 바꾸어 쓴 문장이나 인간화된 문장은 피곤한 인간 저자가 저지르는 것과 같은 실수를 담을 수 있다. 즉, 아포스트로피가 빠지거나, 마침표가 와야 할 자리에 콤마 스플라이스가 생기거나, 한 섹션의 중간에서 철자 변형이 일관되지 않게 나타날 수 있다. AI 도구가 만들어내는 경향이 있는 글쓰기 패턴은 여기서 설명하는 기계적 점검과는 구별되는 별도의 주제이며, 이 점검은 특정 문단이 사용자가 시작했든, 모델이 시작했든, 또는 둘 다가 시작했든 상관없이 적용된다.
TextPulse의 무료 도구는 바로 이런 종류의 점검을 위해 만들어졌으며, 여러 개의 다른 구독을 요구하지 않고도 같은 초안에서 문법, 구두점, 철자 규칙을 확인한다. 이와 같은 점검을 실행하는 일은 재작성 작업이 아니라 5분짜리 습관이며, 다음 독자가 아직 그중 어느 페이지도 한 장 읽지 않았을 때 다른 페이지들에 대해 무엇을 추정하게 되는지를 바꾸는, 바로 그런 5분이다.
위의 각 기계적 요소는 다른 곳에서 자세히 다루고 있다. 콤마 스플라이스, 콤마에 대한 세미콜론의 사용, 아포스트로피, 그리고 APA에서의 옥스퍼드 콤마는 하나씩 다루어지며, 국제 학생들이 자주 헷갈리는 두 가지 규칙인 US 철자와 UK 철자 및 -ize와 -ise의 문제는 각각 별도의 페이지를 갖고 있다. 학술 글쓰기에서 축약형을 사용해도 되는지는 별도로 답하며, 연구 논문에서 가장 자주 반복되는 문법 오류도 마찬가지다. 논문 전체를 처음부터 끝까지 교정하는 일은 그 자체로 하나의 작업이며, 별도의 가이드를 갖고 있다.
그것이 독자들이 하는 일이다. 그들은 텍스트에서 확인할 수 있는 부분, 즉 쉼표, 일치, 철자를 아직 확인할 수 없는 부분에 대한 신호로 받아들인다. 신호를 올바르게 보내면, 당신의 주장은 그에 걸맞은 평가를 받는다. 동일한 자기소개서를 2퍼센트의 오류율 때문에 2점 낮게 평가한 독자들은 불공정하게 행동한 것이 아니었다.
Frequently Asked Questions
학술 글쓰기의 기계적 요소는 표면 수준의 관례, 즉 문법, 구두점, 철자, 대문자 사용을 뜻하며, 읽는 사람이 그것이 올바를 때는 거의 의식하지 않지만 잘못되면 무시할 수 없는 요소이다. 이것은 문체보다 아래에 있고 논증보다도 아래에 있다. 논문은 논리적으로 타당하게 논증되었더라도 기계적 요소가 일관되지 않으면 부주의하게 읽힐 수 있으며, 검토자는 흔히 그 인상이 아래에 있는 논증을 얼마나 주의 깊게 읽는지에까지 영향을 주도록 둔다.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.