AI Humanization

Dấu hiệu của em dash: Vì sao ChatGPT lạm dụng nó

Điều gì thực sự gây ra thói quen của ChatGPT là dựa nhiều vào em dash, dấu này đang làm nhiệm vụ gì trong câu, và một biên tập viên con người sẽ chọn gì thay thế: dấu phẩy, dấu hai chấm, hoặc dấu chấm.

5 min
Table showing what a human writer uses instead of the chatgpt em dash habit, by sentence function

Đôi khi, một quản lý tuyển dụng sẽ gửi một thư xin việc cho một đồng nghiệp kèm theo một dòng bổ sung: hãy kiểm tra các dấu gạch ngang. Kiểu dài này xuất hiện ba lần trong hai câu, một lần như dấu phẩy, một lần như dấu hai chấm, và một lần như dấu chấm, tất cả đều trong cùng một đoạn văn. Thói quen nhỏ mà chatgpt có là thói quen mà bạn nhìn thấy dấu gạch ngang trước khi đọc ý chính. Điều quan trọng là phải hiểu đúng thói quen này trước khi đưa ra bất kỳ kết luận nào về ý nghĩa thực sự của nó. Phản xạ đó, nhận ra dấu hiệu trước khi đọc lập luận, chính là thói quen dấu gạch ngang dài của chatgpt ở dạng thu nhỏ, và đáng để hiểu đúng trước khi quyết định nó thực sự chứng minh điều gì.

Dấu gạch ngang dài là dấu gạch ngang dài, dài hơn dấu gạch nối và dài hơn dấu gạch ngang dùng trong một khoảng số, mà người viết đặt vào giữa câu để làm công việc của dấu phẩy, dấu hai chấm hoặc dấu chấm. ChatGPT dùng nó thường xuyên hơn so với phần lớn văn xuôi đã được biên tập, dù mức độ thường xuyên hơn chính xác đến đâu còn phụ thuộc vào phiên bản mô hình nào đã tạo ra đoạn văn trước mắt bạn. Bài viết này chỉ tập trung hẹp vào một dấu hiệu đó: điều gì gây ra thói quen này, nó thực sự đang làm công việc gì khi xuất hiện, và một biên tập viên con người sẽ thay nó bằng gì.

Điều gì gây ra thói quen dấu gạch ngang dài của ChatGPT?

Không ai ở OpenAI đã công bố một giải thích kỹ thuật, nhưng phần lớn những gì chúng ta biết là nhờ điều tra độc lập, không cần bài đăng trên blog của công ty. Một ví dụ tốt là một phân tích chuyên sâu do kỹ sư phần mềm Sean Goedecke viết vào tháng 10 năm 2025. Thay vì đoán, ông tự kiểm tra các giả thuyết dễ dàng. Ông thử một mô hình tiết kiệm token bằng cách dùng một dấu thay cho dấu phẩy. Nhưng dấu phẩy thì ngắn y hệt. Ông cũng thử một sở thích phương ngữ được tiếp nhận từ những người làm phản hồi của con người, và kiểm tra một mẫu lớn văn bản tiếng Anh Nigeria, một phương ngữ thường được gắn với lực lượng lao động đó. Thực tế, nó xuất hiện ít hơn ở đó so với trong tiếng Anh hiện đại thông thường, chứ không phải nhiều hơn.

Lý thuyết mà các thử nghiệm của chính Goedecke vẫn giữ vững cho thấy có sự thay đổi trong dữ liệu huấn luyện giữa các phiên bản mô hình. Ông nhận thấy thói quen này hầu như không xuất hiện trong đầu ra của GPT-3.5, rồi tăng lên khoảng mười lần sau khi GPT-4o được phát hành, điều này cho thấy cái đã thay đổi là bộ dữ liệu huấn luyện chứ không phải bản thân kiến trúc mô hình. Phỏng đoán tốt nhất của ông là các cuốn sách đã được số hóa từ cuối những năm 1800 và đầu những năm 1900, một giai đoạn khi dấu này xuất hiện với tần suất đặc biệt cao trong tiếng Anh in ấn, cao hơn nhiều so với mức của nó trong văn viết đương đại. Không ai ngoài các phòng thí nghiệm đã huấn luyện những mô hình này có thể xác nhận điều đó. Đây là lý thuyết được kiểm tra cẩn thận nhất hiện có, không phải là một факт đã được xác lập.

Một hướng nghiên cứu riêng được công bố vào tháng 3 năm 2026 chỉ ra một nguyên nhân liên quan đáng được nêu tên: phần nào trong văn bản huấn luyện của một mô hình được định dạng bằng markdown thay vì văn xuôi thông thường, với giả thuyết rằng việc tiếp xúc nhiều với kiểu định dạng này để lại dấu vết riêng lên các lựa chọn dấu câu nói chung. Tóm tắt trung thực là có vài cách giải thích đều hợp lý, một cách đã được kiểm tra khá tốt, và không cách nào được xác nhận bởi chính bên duy nhất có thể thực sự xác nhận nó.

Dấu này đang làm nhiệm vụ gì trong câu?

Trước khi chọn một dấu thay thế, việc gọi tên nhiệm vụ mà dấu này đang đảm nhiệm sẽ hữu ích, vì dấu phẩy, dấu hai chấm và dấu chấm không thể thay thế cho nhau, và các biến thể dấu gạch ngang dài của chúng cũng vậy. Bốn nhiệm vụ bao quát gần như mọi trường hợp mà người đọc có thể gặp phải.

Điều dấu này đang làmThay vào đó, người viết dùng gìVí dụ
Ngắt một lời bình phụ bên trong câuMột cặp dấu phẩy, hoặc dấu ngoặcPhát hiện này, được lặp lại hai lần, vẫn đúng trong cả hai điều kiện.
Đánh dấu một sự chuyển hướng đột ngột hoặc một sự ngắt quãng sắc nétMột dấu chấm và một câu mớiPhát hiện này vẫn đúng trong cả hai điều kiện. Nó không qua được điều kiện thứ ba.
Nối hai mệnh đề độc lập có liên hệ chặt chẽMột dấu chấm, hoặc một dấu chấm phẩy khi mối liên hệ có ý nghĩaMẫu quá nhỏ. Kích thước hiệu ứng thì không.
Giới thiệu một danh sách, một phần tóm tắt hoặc một lời giải thíchMột dấu hai chấmKết quả chỉ về một phía: việc sao chép thất bại.

Mỗi câu trong số đó đều là một câu lẽ ra có thể dùng dấu này nhưng đã không dùng. Bài viết này tự nó là một lập luận rằng dấu này là một dấu hiệu của máy, và nó tạo ra lập luận đó bằng cách không bao giờ dùng chính ký tự mà nó mô tả, dù chỉ một lần, trong bất kỳ câu nào ở trên hay ở dưới.

Nhân hóa bài viết của bạn

Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.

Bắt đầu miễn phí

Thói quen dùng Dấu gạch ngang dài của Mỗi Chatbot Có Giống Nhau Không?

Không, và khoảng cách giữa các hệ thống là rất lớn. Một thử nghiệm cùng prompt trên sáu chatbot vào giữa năm 2025, được trích dẫn trong hướng dẫn rộng hơn của TextPulse về các mẫu viết AI, cho thấy ba hệ thống tạo ra dấu này khoảng một lần mỗi bảy mươi từ và một hệ thống tạo ra nó khoảng một lần mỗi bốn trăm bảy mươi từ, trong khi hai hệ thống khác không tạo ra nó chút nào trong mẫu. Tần suất là thuộc tính của từng hệ thống và từng phiên bản đã tạo ra đoạn văn trước mắt bạn, chứ không phải là một đặc điểm cố định của văn viết AI nói chung.

OpenAI đã phát hành một bản sửa một phần vào tháng 11 năm 2025: một thiết lập chỉ dẫn tùy chỉnh mà khi người dùng bật lên, sẽ bảo mô hình dừng lại. Sam Altman tự mình công bố điều này, và mô tả nó như việc cuối cùng cũng lắng nghe một lời phàn nàn đã tồn tại từ lâu. Thiết lập này là tùy chọn, không phải mặc định, vì vậy một lượng rất lớn đầu ra ChatGPT hằng ngày chưa bao giờ bị nó chạm tới, và thói quen này vẫn tiếp diễn ở bất cứ nơi nào không ai bận tâm gạt công tắc.

Dấu hiệu này như một chỉ báo AI tự thân chỉ mới xuất hiện khá gần đây và phần nào bị nói quá. Theo các bình luận theo dõi hiện tượng này, phản ứng ngược bắt đầu vào khoảng tháng 2 năm 2025. Một bài viết phổ biến về xu hướng này lưu ý rằng chưa bao giờ có bằng chứng vững chắc cho thấy chatbot dùng dấu này nhiều hơn những gì các nhà văn cẩn trọng đã làm từ trước. Hai điều này có thể cùng đúng: thói quen này là có thật và có thể đo lường được trong đầu ra thô, còn sự tự tin của internet trong việc nhận ra nó từ một câu đơn lẻ thì đã đi trước rất xa so với bằng chứng thực tế.

Cách Kiểm Tra Bản Thảo Của Chính Bạn Về Thói Quen Này

Đọc to một đoạn văn và đánh dấu mọi vị trí xuất hiện của dấu gạch ngang dài. Một lần xuất hiện trong một trang là một lựa chọn phong cách, kiểu mà các nhà văn đã dùng trong nhiều thế kỷ. Nhiều lần trong cùng một đoạn, đặc biệt khi đảm nhiệm các chức năng khác nhau so với bảng ở trên, thì đáng để xem xét lại. Mật độ như vậy là bất thường ngoài đầu ra AI và ngoài một số ít cây bút cố ý dùng nhiều dấu gạch ngang.

công cụ xóa em dash miễn phí của TextPulse tự động kiểm tra mật độ đó và đề xuất dấu phẩy, dấu hai chấm, dấu chấm hoặc cách cấu trúc lại mà mỗi trường hợp đòi hỏi, nhanh hơn nhiều so với việc đếm thủ công trên một tài liệu dài. Bộ công cụ miễn phí tương tự cũng bao quát các mức độ khác mà một đoạn văn do máy soạn thảo thường đồng thời báo hiệu, lựa chọn từ ngữ, nhịp câu và cấu trúc, cho một phép kiểm tra vượt ra ngoài riêng dấu câu.

Các cụm từ đệm cũng làm cùng một việc ở cấp độ câu, và có một danh sách những cụm đáng loại bỏ trước tiên. Loại bỏ vốn từ này khỏi một bản thảo mà bạn đã viết lại là một cách tiếp cận khác.

Không điều nào trong số này đòi hỏi phần mềm đặc biệt để kiểm tra, chỉ cần chú ý và sẵn sàng đọc lại câu. Bài viết này cũng đã chọn cách tương tự trong toàn bộ quá trình soạn thảo của chính nó, hãy tìm đến dấu phẩy, dấu hai chấm hoặc dấu chấm, và không một lần nào dùng đến dấu mà nó đã dành một nghìn năm trăm từ để mô tả.

XLinkedInFacebook

Câu hỏi thường gặp

Thói quen dùng em dash của ChatGPT chủ yếu bắt nguồn từ những thay đổi trong dữ liệu huấn luyện giữa các phiên bản mô hình, chứ không phải một lựa chọn thiết kế có chủ ý. Kiểm tra độc lập cho thấy dấu này xuất hiện thường xuyên hơn nhiều trong đầu ra của GPT-4o so với GPT-3.5, và giả thuyết hàng đầu cho rằng nguyên nhân là do tiếp xúc mạnh với các sách in cũ từ một giai đoạn mà dấu này xuất hiện với tần suất bất thường cao. OpenAI chưa công bố lời giải thích của riêng mình, vì vậy đây vẫn là giả thuyết được ủng hộ tốt nhất hơn là một факт đã được xác nhận.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.