AI Humanization

Em Dash का संकेत: ChatGPT इसका अत्यधिक उपयोग क्यों करता है

ChatGPT की em dash पर निर्भर रहने की आदत वास्तव में किस कारण से पैदा होती है, यह चिह्न वाक्य में क्या काम कर रहा होता है, और एक मानव संपादक इसके बजाय क्या चुनता है: comma, colon, या full stop.

5 min
Table showing what a human writer uses instead of the chatgpt em dash habit, by sentence function

कभी-कभी, कोई hiring manager किसी सहकर्मी को एक cover letter भेजते समय एक अतिरिक्त पंक्ति जोड़ देता है: dashes की जाँच करें। यह लंबा प्रकार दो वाक्यों में तीन बार दिखाई देता है, एक बार comma के रूप में, एक बार colon के रूप में, और एक बार full stop के रूप में, और यह सब एक ही अनुच्छेद में होता है। chatgpt की जो छोटी आदत है, वह वही है जिसमें आप बिंदु पढ़ने से पहले dash देख लेते हैं। किसी भी निष्कर्ष पर पहुँचने से पहले इस आदत को ठीक से समझना महत्वपूर्ण है कि इसका वास्तव में क्या अर्थ है। वह सहज प्रतिक्रिया, तर्क पढ़ने से पहले चिह्न को पहचान लेना, chatgpt em dash habit का लघु रूप है, और यह समझना उचित है कि यह वास्तव में क्या सिद्ध करता है, यह तय करने से पहले इसे ठीक से समझा जाए।

em dash लंबा dash है, hyphen से लंबा और संख्या-सीमा में प्रयुक्त dash से भी लंबा, जिसे लेखक वाक्य के बीच में डालकर comma, colon या full stop का काम कराता है। ChatGPT इसका उपयोग अधिकांश संपादित गद्य की तुलना में अधिक बार करता है, हालांकि यह कितना अधिक है, यह इस बात पर निर्भर करता है कि आपके सामने मौजूद अनुच्छेद किस model version ने बनाया है। यह लेख केवल उसी एक चिह्न पर केंद्रित रहता है: यह आदत किस कारण उत्पन्न होती है, जब यह प्रकट होता है तो वास्तव में कौन-सा कार्य कर रहा होता है, और एक human editor इसके स्थान पर क्या रखता है।

ChatGPT Em Dash Habit का कारण क्या है?

OpenAI में किसी ने भी इसका तकनीकी स्पष्टीकरण प्रकाशित नहीं किया है, लेकिन जो कुछ हम जानते हैं उसका बड़ा भाग स्वतंत्र जाँच का परिणाम है, किसी company blog post की आवश्यकता नहीं पड़ी। एक अच्छा उदाहरण software engineer Sean Goedecke द्वारा October 2025 में लिखी गई एक गहन विश्लेषणात्मक रचना है। अनुमान लगाने के बजाय, उन्होंने स्वयं आसान सिद्धांतों का परीक्षण किया। उन्होंने एक model आजमाया जो comma के बजाय एक चिह्न का उपयोग करके tokens बचाता था। लेकिन comma उतना ही छोटा होता है। उन्होंने human feedback workers से प्राप्त एक dialect preference भी आजमाई, और Nigerian English text के एक बड़े sample की जाँच की, जो उस workforce से सामान्यतः जुड़ा हुआ एक dialect है। वास्तव में, वहाँ यह ordinary modern English की तुलना में कम बार दिखाई दिया, अधिक बार नहीं।

Goedecke की अपनी परीक्षण प्रक्रिया ने जिस सिद्धांत को यथावत छोड़ा, वह मॉडल संस्करणों के बीच प्रशिक्षण डेटा में परिवर्तन की ओर संकेत करता है। उन्होंने पाया कि GPT-3.5 के आउटपुट में यह प्रवृत्ति बहुत कम थी, फिर GPT-4o के जारी होने के बाद यह लगभग 10 गुना अधिक बार दिखाई दी, जो मॉडल की संरचना स्वयं की तुलना में प्रशिक्षण सेट में हुए परिवर्तन की ओर संकेत करता है। उनका सर्वोत्तम अनुमान 1800 के दशक के उत्तरार्ध और 1900 के दशक के प्रारंभ की डिजिटीकृत पुस्तकें हैं, वह अवधि जब मुद्रित अंग्रेज़ी में यह चिह्न असामान्य रूप से अधिक था, समकालीन लेखन की तुलना में कहीं ऊपर। इन मॉडलों को प्रशिक्षित करने वाली प्रयोगशालाओं के बाहर कोई भी इसे सत्यापित नहीं कर सकता। यह उपलब्ध सबसे सावधानीपूर्वक परीक्षण किया गया सिद्धांत है, कोई स्थापित तथ्य नहीं।

मार्च 2026 में प्रकाशित अनुसंधान की एक अलग धारा एक संबंधित कारण की ओर संकेत करती है, जिसका उल्लेख करना उचित है: किसी मॉडल के प्रशिक्षण पाठ का कितना भाग सादे गद्य के बजाय स्वरूपित markdown था, इस सिद्धांत पर कि उस स्वरूपण शैली के भारी संपर्क से विराम-चिह्न चयन पर सामान्यतः अपना अलग प्रभाव पड़ता है। ईमानदार सार यह है कि कई व्याख्याएँ संभव हैं, एक का पर्याप्त रूप से परीक्षण किया गया है, और उनमें से किसी की भी पुष्टि उस पक्ष द्वारा नहीं की गई है जो वास्तव में इसकी पुष्टि कर सकता है।

वाक्य में यह चिह्न क्या कार्य कर रहा है?

किसी विकल्प को चुनने से पहले यह नाम देना सहायक होता है कि यह चिह्न क्या कार्य कर रहा है, क्योंकि comma, colon और full stop परस्पर विनिमेय नहीं हैं, और उनके long-dash विकल्प भी नहीं। चार कार्य लगभग हर उस स्थिति को कवर करते हैं जिसका सामना पाठक कर सकता है।

चिह्न क्या कर रहा हैमानव लेखक इसके बजाय क्या उपयोग करता हैउदाहरण
वाक्य के भीतर एक पार्श्व टिप्पणी को अलग करनाअल्पविरामों का एक जोड़ा, या कोष्ठकनिष्कर्ष, जिसे दो बार दोहराया गया, दोनों स्थितियों में कायम रहा।
अचानक मोड़ या तीव्र व्यवधान को चिह्नित करनाएक पूर्ण विराम और एक नया वाक्यनिष्कर्ष दोनों स्थितियों में कायम रहा। यह तीसरी में टिक नहीं सका।
दो निकट से संबंधित स्वतंत्र कथनों को जोड़नाएक पूर्ण विराम, या जहाँ संबंध महत्वपूर्ण हो वहाँ एक अर्धविरामनमूना छोटा था। प्रभाव आकार भी छोटा था।
एक सूची, सारांश या व्याख्या का परिचय देनाएक कोलनपरिणाम ने एक दिशा की ओर संकेत किया: पुनरुत्पादन विफल रहा।

उनमें से हर एक वाक्य ऐसा था जिसमें इस चिह्न का उपयोग किया जा सकता था और नहीं किया गया। यह लेख स्वयं इस बात का तर्क है कि यह चिह्न मशीन का संकेत है, और यह उस तर्क को इस तरह प्रस्तुत करता है कि वह उस वर्ण का कभी उपयोग ही नहीं करता जिसे यह वर्णित करता है, एक बार भी नहीं, ऊपर या नीचे किसी भी वाक्य में।

अपने पेपर को मानवीय बनाइए

अपने AI-सहायता प्राप्त पाठ को रूपांतरित करें और उसे मानवीय ध्वनि दें, महत्वपूर्ण शब्दों या उद्धरणों को छेड़े बिना।

मुफ़्त में शुरू करें

क्या हर Chatbot की Em Dash आदत एक जैसी होती है?

नहीं, और प्रणालियों के बीच का अंतर बड़ा है। 2025 के मध्य में छह chatbots पर किए गए एक समान प्रॉम्प्ट परीक्षण, जिसे TextPulse की AI लेखन पैटर्नों के व्यापक मार्गदर्शक में उद्धृत किया गया है, में पाया गया कि तीन प्रणालियाँ इस चिह्न को लगभग हर सत्तर शब्दों में एक बार उत्पन्न कर रही थीं और एक इसे लगभग हर चार सौ सत्तर शब्दों में एक बार उत्पन्न कर रही थी, जबकि दो अन्य ने नमूने में इसे बिल्कुल उत्पन्न नहीं किया। आवृत्ति उस प्रणाली और संस्करण का गुण है जिसने आपके सामने रखा गया अनुच्छेद उत्पन्न किया है, न कि सामान्य रूप से AI लेखन का कोई स्थिर गुण।

OpenAI ने नवंबर 2025 में एक आंशिक सुधार जारी किया: एक कस्टम-निर्देश सेटिंग, जो एक बार उपयोगकर्ता इसे चालू कर देता है, मॉडल को रुकने के लिए कहती है। Sam Altman ने स्वयं इसकी घोषणा की, और इसे एक लंबे समय से चली आ रही शिकायत को आखिरकार सुनने के रूप में प्रस्तुत किया। यह सेटिंग वैकल्पिक है, डिफ़ॉल्ट नहीं, इसलिए रोज़मर्रा के ChatGPT आउटपुट का बहुत बड़ा हिस्सा इससे कभी प्रभावित ही नहीं हुआ, और जहाँ किसी ने स्विच पलटना ज़रूरी नहीं समझा, वहाँ यह आदत बनी रहती है।

इस चिह्न की AI संकेतक के रूप में प्रतिष्ठा स्वयं काफ़ी हाल की है और कुछ हद तक बढ़ा-चढ़ाकर कही गई है। इसके विरुद्ध प्रतिक्रिया, इसे ट्रैक करने वाली टिप्पणियों के अनुसार, लगभग February 2025 के आसपास शुरू हुई। इस प्रवृत्ति पर एक लोकप्रिय लेख ने उल्लेख किया कि कभी भी ऐसा ठोस प्रमाण नहीं था कि चैटबॉट्स इस चिह्न का उपयोग सावधान मानव लेखकों की तुलना में अधिक करते हैं। दोनों बातें साथ-साथ सही हो सकती हैं, यह आदत वास्तविक है और कच्चे आउटपुट में मापी जा सकती है, और इसे केवल एक वाक्य से पहचान लेने के बारे में इंटरनेट का आत्मविश्वास वास्तविक प्रमाण से बहुत आगे है।

अपना मसौदा इस आदत के लिए कैसे जाँचें

एक अनुच्छेद को ज़ोर से पढ़ें और हर उस स्थान को चिह्नित करें जहाँ लंबा डैश आता है। एक पृष्ठ में एक उदाहरण शैलीगत चयन है, उसी तरह जैसा मानव लेखक सदियों से करते आए हैं। एक ही अनुच्छेद में कई उदाहरण, विशेषकर जब वे ऊपर दी गई तालिका से अलग-अलग काम कर रहे हों, तो दोबारा देखने योग्य हैं। ऐसी घनता AI आउटपुट के बाहर और जानबूझकर डैश-प्रधान गद्य-शैलीकारों के कुछ ही उदाहरणों के बाहर असामान्य है।

TextPulse का free em dash remover इस घनता को स्वतः जाँचता है और प्रत्येक उदाहरण के लिए उपयुक्त कॉमा, कोलन, पूर्ण विराम या पुनर्गठन सुझाता है, जो लंबे दस्तावेज़ में हाथ से गिनने की तुलना में तेज़ है। वही free tools collection उन अन्य स्तरों को भी कवर करती है जिनका संकेत मशीन-निर्मित अनुच्छेद एक साथ देने लगता है, शब्द-चयन, वाक्य-लय और संरचना, ताकि केवल विराम-चिह्न से आगे की जाँच की जा सके।

भराव वाक्यांश वाक्य स्तर पर वही काम करते हैं, और उनमें से पहले हटाने योग्य वाक्यांशों की एक सूची भी है। आपके द्वारा पहले से लिखे गए मसौदे से इस शब्दावली को हटाना एक अलग दृष्टिकोण अपनाता है।

इस सब की जाँच के लिए किसी विशेष सॉफ़्टवेयर की आवश्यकता नहीं थी, केवल ध्यान और वाक्य को फिर से पढ़ने की तत्परता चाहिए थी। इस लेख ने अपने स्वयं के मसौदा-निर्माण में भी वही चयन पूरे समय किया, कॉमा, कोलन या पूर्ण विराम की ओर हाथ बढ़ाया, और उस चिह्न की ओर कभी नहीं, जिसका वर्णन करने में इसने पंद्रह सौ शब्द लगाए।

XLinkedInFacebook

अक्सर पूछे जाने वाले प्रश्न

ChatGPT की em dash की आदत मुख्यतः इस बात से आती है कि मॉडल संस्करणों के बीच उसके प्रशिक्षण डेटा में क्या बदला, न कि किसी जानबूझकर किए गए डिज़ाइन निर्णय से। स्वतंत्र परीक्षणों में GPT-4o के आउटपुट में यह चिह्न GPT-3.5 की तुलना में कहीं अधिक सामान्य पाया गया, और प्रमुख सिद्धांत पुराने मुद्रित पुस्तकों के भारी संपर्क की ओर संकेत करता है, उस अवधि की पुस्तकों की ओर जब यह चिह्न असामान्य रूप से अधिक था। OpenAI ने अपना कोई स्पष्टीकरण प्रकाशित नहीं किया है, इसलिए यह अभी भी पुष्टि किए गए तथ्य के बजाय सबसे अधिक समर्थित सिद्धांत है।

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.