AI Humanization

نشانه em dash: چرا ChatGPT از آن بیش از حد استفاده می‌کند

چه چیزی واقعاً باعث عادت ChatGPT به تکیه بر em dash می‌شود، این نشانه چه کاری در جمله انجام می‌دهد، و یک ویراستار انسانی به جای آن سراغ چه چیزی می‌رود: ویرگول، دونقطه یا نقطه.

5 min
Table showing what a human writer uses instead of the chatgpt em dash habit, by sentence function

گاهی یک مدیر استخدام، نامه پوششی را برای یکی از همکاران می‌فرستد و یک خط اضافه می‌کند: خط تیره‌ها را بررسی کنید. این نوع بلند، سه بار در دو جمله ظاهر می‌شود, یک بار به صورت ویرگول، یک بار به صورت دونقطه، و یک بار به صورت نقطه، همه در همان بند. عادت کوچکی که chatgpt دارد همان حالتی است که پیش از خواندن نکته، خط تیره را می‌بینید. مهم است که این عادت را درست بفهمیم، پیش از آنکه درباره معنای واقعی آن به هر نتیجه‌ای برسیم. آن واکنش فوری، یعنی دیدن نشانه پیش از خواندن استدلال، نسخه کوچک‌شده عادت em dash در chatgpt است، و ارزش دارد که آن را درست بفهمیم پیش از آنکه تصمیم بگیریم واقعاً چه چیزی را ثابت می‌کند.

em dash همان خط تیره بلند است، بلندتر از یک خط پیوند و بلندتر از خط تیره‌ای که در بازه عددی به کار می‌رود، و نویسنده آن را در میانه جمله می‌گذارد تا کار یک ویرگول، یک دونقطه یا یک نقطه را انجام دهد. ChatGPT آن را بیشتر از آنچه در بیشتر نثرهای ویرایش‌شده دیده می‌شود به کار می‌برد، هرچند این که دقیقاً چقدر بیشتر است به این بستگی دارد که کدام نسخه از مدل، پاراگراف پیش روی شما را تولید کرده است. این متن فقط بر همان یک نشانه متمرکز می‌ماند: چه چیزی این عادت را ایجاد می‌کند، وقتی ظاهر می‌شود دقیقاً چه کاری انجام می‌دهد، و یک ویراستار انسانی به جای آن چه چیزی می‌گذارد.

چه چیزی باعث عادت em dash در ChatGPT می‌شود؟

هیچ‌کس در OpenAI توضیح فنی منتشر نکرده است، اما بخش زیادی از آنچه می‌دانیم حاصل بررسی مستقل است، و نیازی به نوشته وبلاگ شرکت نیست. یک نمونه خوب، تحلیل عمیقی است که مهندس نرم‌افزار Sean Goedecke در اکتبر 2025 نوشت. او به جای حدس زدن، نظریه‌های ساده را خودش آزمود. او مدلی را امتحان کرد که با استفاده از یک نشانه به جای ویرگول، توکن‌ها را ذخیره می‌کرد. اما یک ویرگول دقیقاً به همان اندازه کوتاه است. او همچنین ترجیح گویشی را که از کارگران بازخورد انسانی گرفته شده بود آزمود، و یک نمونه بزرگ از متن English نیجریه‌ای را بررسی کرد، گویشی که معمولاً با آن نیروی کار مرتبط دانسته می‌شود. در واقع، این نشانه در آنجا کمتر از English معمولیِ معاصر دیده شد، نه بیشتر.

نظریه‌ای که آزمون‌های خود Goedecke آن را پابرجا گذاشتند، به تغییری در داده‌های آموزشی میان نسخه‌های مدل اشاره می‌کند. او این عادت را در خروجی GPT-3.5 به‌سختی قابل مشاهده یافت، سپس پس از عرضه GPT-4o آن را حدود 10 برابر پرتکرارتر دید، و این به چیزی اشاره می‌کند که در مجموعه آموزشی تغییر کرده است، نه به خود معماری مدل. بهترین حدس او کتاب‌های دیجیتالی‌شده اواخر دهه 1800 و اوایل دهه 1900 است، دوره‌ای که این نشانه در انگلیسی چاپی به‌طور غیرعادی فراوان بود، بسیار بالاتر از جایگاهی که در نوشتار معاصر دارد. هیچ‌کس بیرون از آزمایشگاه‌هایی که این مدل‌ها را آموزش داده‌اند نمی‌تواند آن را تأیید کند. این محتاطانه‌ترین نظریه‌ای است که در دسترس است، نه یک واقعیت تثبیت‌شده.

یک خط پژوهشی جداگانه که در مارس 2026 منتشر شد، به علت مرتبط دیگری اشاره می‌کند که ارزش نام بردن دارد: این‌که چه مقدار از متن آموزشی یک مدل به‌صورت markdown قالب‌بندی شده بود، نه نثر ساده، بر این فرض که مواجهه سنگین با آن سبک قالب‌بندی، اثر انگشت خاص خود را بر انتخاب‌های نشانه‌گذاری به‌طور کلی برجا می‌گذارد. جمع‌بندی صادقانه این است که چند توضیح محتمل‌اند، یکی به‌نسبت خوب آزموده شده است، و هیچ‌کدام به‌وسیله تنها طرفی که واقعاً می‌تواند آن را تأیید کند، تأیید نشده‌اند.

این نشانه در جمله چه کاری انجام می‌دهد؟

پیش از انتخاب جایگزین، مفید است که کار این نشانه را نام ببریم، زیرا ویرگول، دونقطه و نقطه نهایی قابل جایگزینی با یکدیگر نیستند، و جانشین‌های خط تیره بلند آن‌ها نیز چنین نیستند. چهار کار تقریباً همه مواردی را پوشش می‌دهند که یک خواننده احتمالاً با آن‌ها روبه‌رو می‌شود.

این علامت چه کاری انجام می‌دهدیک نویسنده انسانی به جای آن از چه چیزی استفاده می‌کندنمونه
جدا کردن یک توضیح فرعی درون یک جملهیک جفت ویرگول، یا پرانتزیافته، که دو بار تکرار شد، در هر دو شرط برقرار ماند.
نشان دادن یک چرخش ناگهانی یا یک قطع شدن تندیک نقطه و یک جمله جدیدیافته در هر دو شرط برقرار ماند. در شرط سوم دوام نیاورد.
پیوند دادن دو گزاره مستقلِ نزدیک به همیک نقطه، یا در جایی که پیوند اهمیت دارد یک نقطه‌ویرگولنمونه کوچک بود. اندازه اثر هم همین‌طور نبود.
مقدمه‌چینی برای یک فهرست، یک خلاصه یا یک توضیحیک دونقطهنتیجه یک جهت را نشان می‌داد: بازتولید ناموفق بود.

هر یک از آن جمله‌ها جمله‌ای بود که می‌توانست از این علامت استفاده کند و نکرد. این بخش خود استدلالی است که این علامت نشانه‌ای از ماشین است، و این استدلال را با هرگز به کار نبردن همان نویسه‌ای که توصیف می‌کند، حتی یک بار، در هیچ یک از جمله‌های بالا یا پایین، پیش می‌برد.

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

آیا عادت استفاده از خط تیره بلند در همه چت‌بات‌ها یکسان است؟

خیر، و فاصله میان سامانه‌ها زیاد است. یک آزمون با یک پرامپت یکسان روی شش چت‌بات در میانه 2025، که در راهنمای گسترده‌تر TextPulse درباره الگوهای نوشتار هوش مصنوعی نقل شده است، نشان داد که سه سامانه این علامت را حدوداً هر هفتاد واژه یک بار تولید می‌کردند و یکی آن را حدوداً هر چهارصد و هفتاد واژه یک بار تولید می‌کرد، در حالی که دو تای دیگر در نمونه اصلاً آن را تولید نکردند. فراوانی، ویژگی هر سامانه و هر نسخه‌ای است که پاراگراف پیش روی شما را تولید کرده است، نه یک خصیصه ثابت برای نوشتار هوش مصنوعی به طور کلی.

OpenAI در نوامبر 2025 یک اصلاح جزئی منتشر کرد: یک تنظیم دستورهای سفارشی که وقتی کاربر آن را فعال کند، به مدل می‌گوید متوقف شود. Sam Altman خود این موضوع را اعلام کرد و آن را به منزله گوش دادن سرانجام به یک شکایت دیرینه صورت‌بندی کرد. این تنظیم اختیاری است، نه پیش‌فرض، بنابراین حجم بسیار زیادی از خروجی روزمره ChatGPT هرگز تحت تأثیر آن قرار نگرفت، و این عادت هر جا که کسی زحمت جابه‌جا کردن این کلید را به خود نداده باشد، ادامه دارد.

اعتبار این نشانه به‌عنوان یک علامت AI خود پدیده‌ای نسبتاً تازه و تا حدی اغراق‌آمیز است. بنا بر نوشته‌هایی که این روند را دنبال کرده‌اند، واکنش منفی از حدود فوریه 2025 آغاز شد. یک مطلب پرخواننده درباره این روند اشاره کرد که هرگز شواهد محکمی وجود نداشت که نشان دهد چت‌بات‌ها از این نشانه بیشتر از آنچه نویسندگان انسانی دقیق پیش‌تر انجام می‌دادند استفاده می‌کنند. هر دو نکته می‌توانند هم‌زمان درست باشند: این عادت در خروجی خام واقعی و قابل اندازه‌گیری است، و اطمینان اینترنت به تشخیص آن از یک جمله واحد بسیار جلوتر از شواهد واقعی حرکت می‌کند.

چگونه پیش‌نویس خود را از نظر این عادت بررسی کنید

یک بند را با صدای بلند بخوانید و هر جایی را که یک خط تیره بلند ظاهر می‌شود علامت بزنید. یک مورد در یک صفحه، یک انتخاب سبکی است، از همان نوعی که نویسندگان انسانی قرن‌ها انجام داده‌اند. چندین مورد در یک بند، به‌ویژه وقتی کارکردهای متفاوتی از جدول بالا دارند، ارزش بررسی دوباره دارد. این تراکم بیرون از خروجی AI و بیرون از شمار اندکی از سبک‌پردازان نثر که عمداً از خط تیره به‌وفور استفاده می‌کنند، غیرمعمول است.

حذف‌کننده رایگان em dash در TextPulse این تراکم را به‌صورت خودکار بررسی می‌کند و برای هر مورد، ویرایش مناسب، یعنی ویرگول، دونقطه، نقطه یا بازسازی جمله را پیشنهاد می‌دهد، که از شمارش دستی در یک متن بلند سریع‌تر است. همان مجموعه ابزارهای رایگان سطوح دیگر را نیز پوشش می‌دهد که یک بندِ پیش‌نویس‌شده توسط ماشین معمولاً هم‌زمان آن‌ها را نشان می‌دهد، یعنی واژه‌گزینی، آهنگ جمله و ساختار، برای بررسی‌ای فراتر از صرف نشانه‌گذاری.

عبارت‌های پرکننده همان کار را در سطح جمله انجام می‌دهند، و فهرستی از مواردی وجود دارد که حذف آن‌ها در وهله نخست ارزشمند است. حذف این واژگان از پیش‌نویسی که پیش‌تر نوشته‌اید رویکردی متفاوت را به کار می‌گیرد.

برای بررسی هیچ‌یک از این‌ها به نرم‌افزار ویژه‌ای نیاز نبود، فقط توجه و آمادگی برای خواندن دوباره جمله لازم بود. این مطلب نیز در سراسر نگارش خود همین انتخاب را دنبال کرد: دست به سوی ویرگول، دونقطه یا نقطه دراز کنید، و حتی یک بار هم به سوی نشانه‌ای نروید که در هزار و پانصد واژه درباره آن توضیح داده شد.

XLinkedInFacebook

سؤالات متداول

عادت ChatGPT به em dash عمدتاً از آنچه میان نسخه‌های مدل در داده‌های آموزشی آن تغییر کرده است ناشی می‌شود، نه از یک انتخاب طراحی عمدی. آزمون‌های مستقل نشان دادند که این نشانه در خروجی GPT-4o بسیار بیشتر از GPT-3.5 دیده می‌شود، و نظریه پیشرو به مواجهه گسترده با کتاب‌های چاپی قدیمی از دوره‌ای اشاره می‌کند که در آن این نشانه به‌طور غیرعادی فراوان بود. OpenAI توضیح خود را منتشر نکرده است، بنابراین این هنوز بهترین نظریه پشتیبانی‌شده است، نه یک واقعیت تأییدشده.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.