Bài viết của tôi có nghe như AI không? Tự kiểm tra
Một tự chẩn đoán cho những người viết đã tự làm phần việc của mình nhưng giờ không còn nghe được văn xuôi của chính họ. Vì sao bài viết học thuật có năng lực, được dạy dỗ, và chỉnh sửa nhiều lại phát ra cùng những tín hiệu như đầu ra của máy, năm điều nào đáng kiểm tra, và điều nào nên ngừng xin lỗi.
Bạn đã viết nó. Từng câu một, trong bốn buổi tối, với các nguồn mở trên bàn bên cạnh bạn. Rồi một công cụ kiểm tra trả về một con số, hoặc một người giám sát nói rằng cách diễn đạt nghe như được tạo ra, và bạn đọc lại đoạn văn của chính mình ba lần mà không còn phân biệt được nữa.
"Does my writing sound like AI?" là một câu hỏi hợp lý với một câu trả lời cụ thể, và với đa số người đặt câu hỏi này, câu trả lời là bài viết nghe có tổ chức. Văn xuôi học thuật có năng lực, được giảng dạy, được biên tập, chia sẻ rất nhiều bề mặt với đầu ra của máy, vì một mô hình ngôn ngữ đã được huấn luyện trên văn xuôi có năng lực, được giảng dạy, được biên tập. Phần sau là một tự kiểm tra, cần xem gì trong bản thảo do chính bạn viết, điều đó có nghĩa gì khi bạn phát hiện ra, và nên để lại bao nhiêu phần đúng nguyên vị trí của nó.
Tại sao bài viết của con người lại kích hoạt cùng những tín hiệu đó
Chúng ta có một mô hình ngôn ngữ đã học từ những bài viết mà người ta cho là tốt, các bài báo đã xuất bản, báo chí đã biên tập, sách giáo khoa, tài liệu hướng dẫn. Nó tạo ra giá trị trung bình của những thứ đó, gần như chính là điều bạn được học để làm trong một khóa học viết. Câu chủ đề đầu tiên. Một ý cho mỗi đoạn. Các chuyển đoạn có chỉ dẫn rõ ràng. Giữ nguyên một kiểu diễn đạt nhất quán trong toàn bộ văn bản. Mỗi yếu tố đó đều là một tiêu chí chấm điểm, và mỗi yếu tố đó đều làm giảm độ biến thiên thống kê mà bộ phát hiện đang đo lường.
Hai nhóm bị bắt gặp bởi điều này nhiều hơn bất kỳ ai khác. Những người viết bằng tiếng Anh như ngôn ngữ thứ hai hoặc thứ ba được dạy rằng kiểu diễn đạt trang trọng là kiểu an toàn, và trang trọng chính là kiểu mà một mô hình mặc định dùng. Những người biên tập cẩn thận lại bị bắt gặp vì lý do ngược lại, biên tập làm giảm độ biến thiên, vì vậy bản thảo lần thứ tám của một chương mang ít độ thô ráp mà người đọc xem là mang tính con người hơn so với bản thảo lần thứ hai. Cơ chế đằng sau tất cả điều này nằm trong full guide to AI writing patterns, và đáng đọc trước khi bạn thay đổi dù chỉ một câu.
Bài viết của tôi có nghe như AI không? Hãy thực hiện năm kiểm tra này
Năm kiểm tra, theo thứ tự, trên một bản thảo do chính bạn viết. Mỗi kiểm tra chỉ mất vài phút và không kiểm tra nào cần công cụ hay tài khoản.
- Độ phân tán độ dài câu. Đếm số từ trong mười câu liên tiếp. Nếu tám câu trong số đó nằm trong khoảng từ mười lăm đến hai mươi lăm từ, thì biên độ của bạn hẹp. Phần lớn bản thảo của con người đều có ít nhất một câu dưới tám từ ở đâu đó trên một trang.
- Dạng mở đầu đoạn văn. Chỉ đọc câu đầu tiên của mỗi đoạn, theo thứ tự. Nếu mỗi câu đều báo trước đoạn văn trước khi triển khai nó, thì hình thức là đồng nhất ngay cả khi nội dung hoàn toàn là của bạn.
- Tính cụ thể của động từ. Trong phần kết quả hoặc phát hiện của bạn, gạch chân mọi động từ chính. Đếm xem có bao nhiêu động từ gọi tên một thao tác mà bạn thực sự đã thực hiện, so với bao nhiêu động từ trình bày có thể xuất hiện trong bất kỳ bài viết nào về bất kỳ chủ đề nào.
- Mật độ từ vựng trang trọng. Lấy ba đoạn văn có mật độ cao nhất của bạn và đếm số từ trừu tượng trang trọng trên mỗi một trăm từ: underscores, showcases, multifaceted, comprehensive. Hai từ đang làm việc thực sự là văn xuôi học thuật thông thường. Năm từ không làm gì là mô thức.
- Bài kiểm tra tính cụ thể. Tìm mọi câu vẫn đúng nếu bạn thay chủ đề của mình bằng một chủ đề khác. Những câu đó đọc lên như được tạo ra bất kể ai gõ chúng, và đó là lý do khiến người đọc nói rằng một đoạn văn có cảm giác do máy viết.
Kiểm tra năm mục này là quan trọng nhất và không có bộ phát hiện nào thực hiện nó. Một câu vẫn tồn tại khi chủ ngữ của nó bị thay thế thì ngay từ đầu đã không mang thông tin nào về chủ đề của bạn. Đó là đặc tính mà người đọc phản ứng lại, và nó có thể được sửa theo một cách mà độ dài câu sẽ không bao giờ làm được.
Nhân hóa bài viết của bạn
Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.
Cần thay đổi gì, và cần giữ nguyên chính xác điều gì
Phần lớn những gì khiến người ta lo lắng về văn xuôi của chính mình nên được để nguyên. Tổ chức không phải là một khiếm khuyết, và bề mặt gọn gàng không phải là bằng chứng của bất cứ điều gì. Bảng dưới đây chia các tín hiệu phổ biến thành những tín hiệu đáng để can thiệp và những tín hiệu cần ngừng xin lỗi.
| Bạn nhận thấy gì | Vì sao bài viết của chính bạn lại như vậy | Giữ nguyên hay sửa |
|---|---|---|
| Các đoạn văn đều có độ dài tương tự nhau | Bạn đã soạn theo một cấu trúc, rồi chỉnh sửa theo giới hạn số từ | Giữ nguyên. Độ dài nên theo lập luận, và đôi khi lập luận có tính đều đặn |
| Các câu nằm trong một khoảng độ dài hẹp | Phong cách của tạp chí và số lượng từ đều đẩy bạn về phía một mệnh đề cho mỗi câu | Sửa ba hoặc bốn câu. Ghép những cặp mà logic vốn đã ghép, và rút một câu xuống còn sáu từ |
| Động từ Latinh trang trọng xuất hiện xuyên suốt | Các mẫu luận văn và học phần ngôn ngữ dạy rằng phong cách trang trọng là lựa chọn an toàn | Sửa những từ không làm việc gì. Giữ lại các thuật ngữ mà lĩnh vực của bạn đã định nghĩa |
| Đánh dấu dẫn hướng dày đặc, trước hết, thứ hai, cuối cùng | Các giảng viên yêu cầu dẫn hướng, nên bạn cố ý đưa nó vào | Giữ phần lớn. Cắt những chỗ báo hiệu một đoạn văn mà người đọc đã có thể thấy |
| Không có dạng rút gọn ở bất kỳ đâu | Phong cách học thuật loại trừ chúng trong hầu hết các tạp chí và hầu hết các khoa | Giữ nguyên. Dạng rút gọn là sai với thể loại này, bất kể một bộ phát hiện nào ưa thích gì |
| Danh sách ba phần ở nhiều chỗ | Ba mục vừa với một câu, và các tiêu chí chấm điểm thưởng cho hình thức đó | Sửa một hoặc hai chỗ. Tính đối xứng trong mọi danh sách nói lên nhiều hơn bất kỳ từ đơn lẻ nào |
| Không có lỗi chính tả, không có sơ suất, không có gì thô ráp | Bạn đã hiệu đính nó, hơn một lần | Giữ nguyên. Một bề mặt sạch sẽ không phải là tín hiệu về quyền tác giả |
Dòng cuối là dòng mà người ta hay tranh luận. Không ai nên thêm lỗi chính tả vào một luận văn để trông giống con người, và bất kỳ lời khuyên nào bảo bạn làm vậy đều đang yêu cầu bạn làm hỏng một bài nộp để thỏa mãn một con số.
Kiểm tra đọc to trong hai phút
Đọc to ba đoạn văn với tốc độ nói. Có hai điều hiện ra mà việc đọc thầm che khuất. Điều thứ nhất là nhịp thở: văn xuôi không có câu ngắn nào khiến bạn không có chỗ để dừng lại, và bạn nghe thấy điều đó trước khi có thể nhìn thấy nó. Điều thứ hai là sự nhấn mạnh. Một đoạn văn do người thực sự quan tâm đến lập luận viết ra sẽ có một câu mang sức nặng hơn phần còn lại, và bạn thấy mình tự nhiên nhấn vào câu đó mà không cần quyết định. Một đoạn văn không có câu như vậy thì phẳng, và chính sự phẳng ấy là điều mà người ta thực sự đang phát hiện.
Nếu nó đọc lên thấy phẳng, việc sửa chữa diễn ra ở cấp độ nội dung của câu. Cắt bỏ bất kỳ câu nào có thể thuộc về một bài khác. Đưa con số trở lại. Khi hai câu tạo thành một ý, hãy diễn đạt nó một lần. AI word cleaner của TextPulse sẽ đếm mật độ từ vựng cho bạn trên một chương dài, còn sự phẳng thì vẫn là thứ bạn phải tự sửa.
Nếu một Detector đã gắn cờ nó
Điểm số của detector là một ước lượng xác suất trên một đoạn văn bản. Nó không phải là một kết luận thực tế về việc ai đã gõ nó. Những người viết bị detector gắn cờ gồm hai nhóm đã nêu ở trên, người viết bằng ngôn ngữ thứ hai và người sửa bản thảo nhiều lần. Cách tốt nhất để phản hồi một văn bản đã bị gắn cờ là viết lại đoạn văn bị gắn cờ sau khi sự việc đã xảy ra. Tức là, thay đổi bằng chứng mà bạn dự định dựa vào. Viết lại đoạn văn bị gắn cờ sau khi sự việc đã xảy ra là phản ứng yếu nhất hiện có, vì nó thay đổi bằng chứng mà lẽ ra bạn sẽ dựa vào.
Thay vào đó, hãy giữ lại bằng chứng của quá trình, lịch sử phiên bản, các ghi chú có ngày tháng, danh mục tài liệu bạn đã làm việc từ đó, những bản nháp trước bản này. Điều đó trông như thế nào trong thực tế, và khoa nào thực sự chấp nhận điều gì, được trình bày trong bài viết về cách chứng minh bạn không dùng AI.
AI humanizer của TextPulse báo cáo một Human Score ước tính được tính từ văn bản, đây là một cách đọc văn xuôi chứ không phải là phán quyết về tác giả của nó, và không có công cụ nào trên trang này tuyên bố biết một detector cụ thể sẽ nói gì về một trang cụ thể.
Từ vựng cụ thể được liệt kê riêng, trong một trang về những từ ngữ làm lộ ChatGPT, và động từ đơn lẻ gây ra phần lớn thiệt hại được giải thích riêng.
Câu hỏi đáng thay thế cho câu này sắc hơn. Thay vì hỏi liệu một đoạn văn có nghe giống máy hay không, hãy hỏi câu nào trong đó chỉ bạn mới có thể đã viết. Nếu câu trả lời là không có câu nào, thì đó là đoạn văn cần chỉnh sửa, và việc chỉnh sửa sẽ đáng làm ngay cả trong một năm hoàn toàn không có công cụ phát hiện nào.
Câu hỏi thường gặp
Thường là có, và đó là nguyên nhân phổ biến nhất dẫn đến câu hỏi này. Những người hỏi "does my writing sound like AI" gần như luôn đang phản ứng với cấu trúc: câu chủ đề, các chuyển tiếp được đánh dấu và một giọng điệu nhất quán là các tiêu chí chấm điểm, và chúng cũng là thứ mà một mô hình ngôn ngữ tạo ra theo mặc định. Tổ chức không mang thông tin về ai đã viết một văn bản, và việc loại bỏ nó chỉ làm bài viết tệ hơn.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.