AI Humanization

এম ড্যাশের ইঙ্গিত: কেন ChatGPT এটি অতিরিক্ত ব্যবহার করে

আসলে কী কারণে ChatGPT-এর এম ড্যাশের ওপর নির্ভর করার অভ্যাস তৈরি হয়, একটি বাক্যে এই চিহ্নটি কী কাজ করছে, এবং একজন মানব সম্পাদক তার বদলে কী বেছে নেন: কমা, কোলন, বা পূর্ণচ্ছেদ।

5 min
Table showing what a human writer uses instead of the chatgpt em dash habit, by sentence function

কখনও কখনও, একজন নিয়োগ ব্যবস্থাপক একজন সহকর্মীর কাছে একটি কভার লেটার পাঠান, সঙ্গে একটি অতিরিক্ত লাইন যোগ করে: ড্যাশগুলো পরীক্ষা করুন। এই দীর্ঘ ধরনেরটি দুইটি বাক্যে তিনবার দেখা যায়, একবার কমা হিসেবে, একবার কোলন হিসেবে, এবং একবার পূর্ণচ্ছেদ হিসেবে, সবই একই অনুচ্ছেদে। chatgpt-এর যে ছোট অভ্যাসটি আছে, তা হলো আপনি বক্তব্যটি পড়ার আগে ড্যাশটি দেখে ফেলেন। কোনো সিদ্ধান্তে পৌঁছানোর আগে এই অভ্যাসটি সঠিকভাবে বোঝা গুরুত্বপূর্ণ, কারণ এটি আসলে কী বোঝায়। সেই প্রতিফল, অর্থাৎ যুক্তি পড়ার আগে চিহ্নটি শনাক্ত করা, হলো chatgpt em dash habit-এর ক্ষুদ্র রূপ, এবং এটি আসলে কী প্রমাণ করে তা নির্ধারণের আগে এটি সঠিকভাবে বোঝা মূল্যবান।

em dash হলো দীর্ঘ ড্যাশ, hyphen-এর চেয়ে দীর্ঘ এবং সংখ্যা-পরিসরে ব্যবহৃত ড্যাশের চেয়েও দীর্ঘ, যা একজন লেখক বাক্যের মাঝখানে বসিয়ে কমা, কোলন বা পূর্ণচ্ছেদের কাজ করান। ChatGPT এটি অধিকাংশ সম্পাদিত গদ্যের তুলনায় বেশি ব্যবহার করে, যদিও ঠিক কতটা বেশি, তা নির্ভর করে আপনার সামনে থাকা অনুচ্ছেদটি মডেলের কোন সংস্করণ তৈরি করেছে তার ওপর। এই লেখাটি কেবল সেই একটি চিহ্নের মধ্যেই সীমিত থাকে: এই অভ্যাসের কারণ কী, এটি দেখা দিলে আসলে কী কাজ করছে, এবং একজন মানব সম্পাদক এর বদলে কী বসান।

ChatGPT Em Dash Habit-এর কারণ কী?

OpenAI-এ কেউ কোনো প্রযুক্তিগত ব্যাখ্যা প্রকাশ করেননি, কিন্তু আমরা যা জানি তার অনেকটাই স্বাধীন অনুসন্ধানের ফল, কোনো কোম্পানির ব্লগ পোস্টের প্রয়োজন হয়নি। একটি ভালো উদাহরণ হলো সফটওয়্যার প্রকৌশলী Sean Goedecke-এর লেখা 2025 সালের October মাসের একটি গভীর বিশ্লেষণ। অনুমান করার বদলে, তিনি সহজ তত্ত্বগুলো নিজেই পরীক্ষা করেন। তিনি এমন একটি মডেল পরীক্ষা করেন যা কমার বদলে একটি চিহ্ন ব্যবহার করে টোকেন সাশ্রয় করত। কিন্তু একটি কমা ঠিক ততটাই ছোট। তিনি মানব প্রতিক্রিয়া কর্মীদের কাছ থেকে পাওয়া একটি উপভাষাগত পছন্দও পরীক্ষা করেন, এবং Nigerian English-এর একটি বড় নমুনা যাচাই করেন, যা সেই কর্মীবাহিনীর সঙ্গে সাধারণত যুক্ত একটি উপভাষা। বাস্তবে, সেখানে এটি সাধারণ আধুনিক English-এর তুলনায় কমই দেখা যায়, বেশি নয়।

Goedecke-এর নিজস্ব পরীক্ষায় যে তত্ত্বটি টিকে ছিল, তা মডেল সংস্করণগুলোর মধ্যে প্রশিক্ষণ ডেটায় পরিবর্তনের দিকে ইঙ্গিত করে। তিনি দেখেন, GPT-3.5 আউটপুটে এই অভ্যাসটি প্রায় অনুপস্থিত, কিন্তু GPT-4o প্রকাশের পর এটি প্রায় 10 গুণ বেশি ঘন ঘন দেখা যায়, যা মডেল স্থাপত্যের চেয়ে প্রশিক্ষণ সেটে কী বদলেছে, তার দিকেই ইঙ্গিত করে। তাঁর সেরা অনুমান হলো 1800-এর দশকের শেষভাগ এবং 1900-এর দশকের শুরুর দিকের ডিজিটাইজড বই, এমন এক সময় যখন এই চিহ্নটি মুদ্রিত ইংরেজিতে অস্বাভাবিকভাবে বেশি ছিল, সমকালীন লেখার তুলনায় অনেক উপরে। এই মডেলগুলো প্রশিক্ষণ দেওয়া ল্যাবগুলোর বাইরে কেউই এটি নিশ্চিত করতে পারে না। এটি বর্তমানে পাওয়া সবচেয়ে সতর্কভাবে পরীক্ষিত তত্ত্ব, কোনো স্থির সত্য নয়।

March 2026-এ প্রকাশিত গবেষণার আরেকটি ধারা একটি সম্পর্কিত কারণের দিকে ইঙ্গিত করে, যা উল্লেখ করা প্রয়োজন: একটি মডেলের প্রশিক্ষণ পাঠ্যের কতটা অংশ plain prose-এর বদলে formatted markdown ছিল, এই তত্ত্বে যে সেই formatting style-এর সঙ্গে ব্যাপক সংস্পর্শ punctuation choices-এ সামগ্রিকভাবে নিজস্ব ছাপ রেখে যায়। সৎ সারসংক্ষেপ হলো, কয়েকটি ব্যাখ্যা যুক্তিসঙ্গত, একটি যথেষ্ট ভালোভাবে পরীক্ষিত, এবং যিনি বাস্তবে এটি নিশ্চিত করতে পারতেন, সেই এক পক্ষের দ্বারা কোনোটিই নিশ্চিত নয়।

বাক্যে চিহ্নটি কী কাজ করছে?

একটি বিকল্প বেছে নেওয়ার আগে, চিহ্নটি কী কাজ করছে তা নামকরণ করা সহায়ক, কারণ একটি comma, একটি colon এবং একটি full stop পরস্পরের বিনিময়যোগ্য নয়, এবং তাদের long-dash বিকল্পও নয়। চারটি কাজ প্রায় প্রতিটি এমন ক্ষেত্রকে আচ্ছাদিত করে, যার মুখোমুখি একজন পাঠক হওয়ার সম্ভাবনা রাখেন।

চিহ্নটি কী করছেএকজন মানব লেখক এর বদলে কী ব্যবহার করেনউদাহরণ
একটি বাক্যের মধ্যে একটি পার্শ্ব মন্তব্য আলাদা করে দেখানোদুটি কমা, অথবা বন্ধনীThe finding, replicated twice, held under both conditions.
একটি আকস্মিক মোড় বা তীক্ষ্ণ বিঘ্ন চিহ্নিত করাএকটি পূর্ণচ্ছেদ এবং একটি নতুন বাক্যThe finding held under both conditions. It did not survive a third.
দুটি ঘনিষ্ঠভাবে সম্পর্কিত স্বতন্ত্র বক্তব্যকে যুক্ত করাএকটি পূর্ণচ্ছেদ, অথবা সংযোগটি গুরুত্বপূর্ণ হলে একটি সেমিকোলনThe sample was small. The effect size was not.
একটি তালিকা, একটি সারসংক্ষেপ বা একটি ব্যাখ্যা উপস্থাপন করাএকটি কোলনThe result pointed one way: replication failed.

এই বাক্যগুলোর প্রতিটিই এমন ছিল, যেখানে চিহ্নটি ব্যবহার করা যেত, কিন্তু করা হয়নি। এই অংশটি নিজেই একটি যুক্তি যে চিহ্নটি একটি যন্ত্রগত সংকেত, এবং এটি সেই যুক্তি তৈরি করে এমন চিহ্নটি একবারও ব্যবহার না করে, উপরের বা নিচের কোনো বাক্যেই নয়, একবারও নয়।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

প্রতিটি Chatbot-এর Em Dash অভ্যাস কি একই?

না, এবং সিস্টেমগুলোর মধ্যে ফারাক বড়। 2025 সালের মাঝামাঝি ছয়টি chatbot জুড়ে একটি একই প্রম্পটের পরীক্ষা, যা TextPulse-এর AI লেখার ধরন সম্পর্কে বিস্তৃত নির্দেশিকায় উদ্ধৃত হয়েছে, দেখায় যে তিনটি সিস্টেম প্রতি প্রায় 70 শব্দে একবার করে চিহ্নটি তৈরি করছিল এবং একটি প্রতি প্রায় 470 শব্দে একবার করে, আর অন্য দুটি নমুনায় একেবারেই তা তৈরি করেনি। ঘনত্ব হলো আপনার সামনে থাকা অনুচ্ছেদটি যে সিস্টেম এবং সংস্করণ তৈরি করেছে তার একটি বৈশিষ্ট্য, সামগ্রিকভাবে AI লেখার কোনো স্থির বৈশিষ্ট্য নয়।

OpenAI 2025 সালের November-এ একটি আংশিক সংশোধন প্রকাশ করে: একটি custom-instructions সেটিং, যা ব্যবহারকারী একবার এটি চালু করলে, মডেলকে থামতে বলে। Sam Altman নিজেই এটি ঘোষণা করেন, এবং এটিকে দীর্ঘদিনের একটি অভিযোগ অবশেষে শোনা হিসেবে উপস্থাপন করেন। এই সেটিংটি opt-in, default নয়, তাই দৈনন্দিন ChatGPT আউটপুটের বিপুল অংশ এতে কখনোই স্পর্শ পায়নি, এবং যেখানে কেউ সুইচটি উল্টাতে বিরক্ত হয়নি, সেখানে এই অভ্যাস চলতেই থাকে।

এই চিহ্নের AI-সংকেত হিসেবে খ্যাতি নিজেই তুলনামূলকভাবে সাম্প্রতিক এবং কিছুটা অতিরঞ্জিত। 2025 সালের February-এর দিকে এর বিরুদ্ধে প্রতিক্রিয়া শুরু হয়, এমনটাই এটিকে অনুসরণকারী মন্তব্যে বলা হয়েছে। এই প্রবণতা সম্পর্কে একটি জনপ্রিয় লেখায় উল্লেখ করা হয়েছিল যে chatbots এই চিহ্নটি careful human writers-এর তুলনায় বেশি ব্যবহার করে, এমন দৃঢ় প্রমাণ কখনও ছিল না। এই দুইটি কথা একসঙ্গে সত্য হতে পারে, অভ্যাসটি বাস্তব এবং কাঁচা আউটপুটে পরিমাপযোগ্য, আর একটি মাত্র বাক্য দেখে তা শনাক্ত করার বিষয়ে internet-এর আত্মবিশ্বাস প্রকৃত প্রমাণের চেয়ে অনেক এগিয়ে আছে।

নিজের খসড়ায় এই অভ্যাসটি কীভাবে পরীক্ষা করবেন

একটি অনুচ্ছেদ জোরে পড়ুন এবং long dash যেখানে যেখানে এসেছে, সব চিহ্নিত করুন। একটি পাতায় একবার এলে তা একটি শৈলীগত পছন্দ, শতাব্দীর পর শতাব্দী ধরে human writers যে ধরনের পছন্দ করে এসেছে। একটি অনুচ্ছেদে কয়েকবার এলে, বিশেষ করে উপরের সারণির থেকে ভিন্ন ভিন্ন কাজ করলে, তা আবার দেখে নেওয়ার মতো। এই ঘনত্ব AI output-এর বাইরে এবং ইচ্ছাকৃতভাবে dash-সমৃদ্ধ গদ্যশৈলীর অল্প কয়েকজন লেখকের বাইরে অস্বাভাবিক।

TextPulse-এর free em dash remover এই ঘনত্ব স্বয়ংক্রিয়ভাবে পরীক্ষা করে এবং প্রতিটি ক্ষেত্রে comma, colon, full stop বা পুনর্গঠনের প্রস্তাব দেয়, যা একটি দীর্ঘ নথি জুড়ে হাতে গুনে দেখার চেয়ে দ্রুত। একই free tools collection machine-drafted অনুচ্ছেদ যে অন্যান্য স্তরগুলো একসঙ্গে নির্দেশ করতে থাকে, সেগুলিও আচ্ছাদন করে, word choice, sentence rhythm এবং structure, যাতে punctuation-এর বাইরেও একটি পরীক্ষা করা যায়।

Filler phrases বাক্যস্তরেও একই কাজ করে, এবং যেগুলো আগে বাদ দেওয়া উচিত, সেগুলোর একটি তালিকা আছেআপনি ইতিমধ্যে যে খসড়া লিখে ফেলেছেন, সেখান থেকে এই শব্দভাণ্ডার সরিয়ে ফেলা আবার ভিন্ন একটি পদ্ধতি গ্রহণ করে।

এটি পরীক্ষা করতে বিশেষ সফটওয়্যার প্রয়োজন হয়নি, শুধু মনোযোগ এবং বাক্যটি আবার পড়ার ইচ্ছা দরকার ছিল। এই লেখাটিও নিজের খসড়া তৈরির পুরো সময় একই পছন্দ করেছে, comma, colon বা full stop-এর দিকে হাত বাড়িয়েছে, এবং যে চিহ্নটি নিয়ে এটি পনেরোশো শব্দ ধরে বর্ণনা করেছে, তার দিকে একবারও নয়।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

ChatGPT-এর এম ড্যাশ অভ্যাস মূলত মডেল সংস্করণগুলোর মধ্যে প্রশিক্ষণ ডেটায় কী পরিবর্তন হয়েছে, তার ফল, এটি কোনো ইচ্ছাকৃত নকশাগত সিদ্ধান্ত নয়। স্বাধীন পরীক্ষায় দেখা গেছে GPT-4o আউটপুটে এই চিহ্ন GPT-3.5-এর তুলনায় অনেক বেশি সাধারণ, এবং প্রধান তত্ত্বটি ইঙ্গিত করে পুরোনো মুদ্রিত বইয়ের ব্যাপক সংস্পর্শের দিকে, এমন এক সময়ের বই, যখন এই চিহ্ন অস্বাভাবিকভাবে বেশি ব্যবহৃত হতো। OpenAI নিজের কোনো ব্যাখ্যা প্রকাশ করেনি, তাই এটি এখনো নিশ্চিত তথ্য নয়, বরং সবচেয়ে শক্তিশালীভাবে সমর্থিত তত্ত্ব।

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.