AI Humanization

AI লেখার ধরন: যে শব্দ, ছন্দ এবং যতিচিহ্ন তা ফাঁস করে

যন্ত্র-লিখিত গদ্যের একটি স্বাক্ষর আছে, পূর্বানুমেয় শব্দ, একরূপ বাক্যছন্দ, একটি কমার কাজ করা একটি dash, এবং এমন একটি যুক্তির কাঠামো যা নিজের শিরোনামকেই পুনরুক্তি করে। এখানে প্রতিটি স্তর আসলে কেমন দেখায়, তার উৎসসহ উদাহরণ দেওয়া হলো, কোনো অনুভূতির বদলে।

সর্বশেষ আপডেট করা হয়েছে 13 min
Table of AI writing patterns, overused words such as "delve" and "underscore", next to plainer human alternatives

এই বাক্যটি একবার পড়ুন এবং দেখুন আপনি কি ইতিমধ্যে জানেন এটি কোথা থেকে এসেছে: গবেষকেরা প্রেরণা এবং অর্জনের মধ্যে জটিল পারস্পরিক ক্রিয়াকে ক্রমাগত গুরুত্ব দিচ্ছেন, এবং ক্রমবর্ধমান গবেষণাসমষ্টি দেখাচ্ছে যে আত্মনিয়ন্ত্রণ একাডেমিক সাফল্যে একটি প্রধান ভূমিকা পালন করে। এতে ভুল কিছু নেই। প্রতিটি উপবাক্য ব্যাকরণগত, প্রতিটি শব্দই বাস্তব শব্দ, এবং কোনো মূল্যায়নকারী একটি পয়েন্টও কেটে নিতেন না। কিন্তু তবু এটি এমন শোনায় যেন এটি কোনো যন্ত্র থেকে বেরিয়ে এসেছে, কারণ সেটাই হয়েছে। এই অংশটি সেই বিষয় নিয়েই।

AI লেখার ধরন হলো শব্দ নির্বাচন, বাক্যের ছন্দ, যতিচিহ্ন এবং গঠনে পুনরাবৃত্তিযোগ্য অভ্যাস, যা যন্ত্রে খসড়া করা গদ্যকে চোখে দেখেই শনাক্তযোগ্য করে তোলে। এগুলো চারটি স্তরে গুচ্ছবদ্ধ হয়, একটি মডেল যে শব্দগুলোর দিকে হাত বাড়ায়, তার বাক্যগুলোর গঠন, যে যতিচিহ্নের ওপর এটি নির্ভর করে, এবং সামগ্রিকভাবে এটি কীভাবে একটি যুক্তি গঠন করে। এদের কোনোটিই একা কিছু প্রমাণ করে না। কিন্তু একসঙ্গে, একটি অনুচ্ছেদের ভেতরে, এগুলো উপেক্ষা করা কঠিন।

যে যন্ত্র এটি করে তাকে একটি পরিসংখ্যানগত শনাক্তকারী বলা হয়। এটি একটি ভাষা মডেল যা প্রত্যাশা করে তার ভিত্তিতে প্রতিটি শব্দ কতটা পূর্বানুমানযোগ্য, তা স্কোর করে। একটি প্রতিবেদনে সেই স্কোরের অন্তর্নিহিত perplexity এবং burstiness গণিত থাকে, যা how AI detectors work বিষয়ক আরেকটি লেখায় আরও বিস্তারিতভাবে আলোচিত হয়েছে। এই প্রবন্ধের বাকি অংশটি AI লেখার এমন সব লক্ষণের তালিকা, যেগুলো পাঠক পৃষ্ঠায় শুনতে, গুনতে বা দেখিয়ে বলতে পারেন। এটি গুরুত্বপূর্ণ হতে পারে, এমনকি যদি কোনো শনাক্তকারী ভুল হয়, অনুপলব্ধ হয়, বা প্রসঙ্গের বাইরে হয়। এখানে যা বলা হবে, তার জন্য কোনো মডেল বা কোনো সাবস্ক্রিপশন দরকার নেই।

AI লেখার ধরন কেন যান্ত্রিক শোনায়?

একটি ভাষা মডেল বাক্যস্তরে একজন মানুষের থেকে ভিন্ন কিছু করছে, এটি বারবার পরিসংখ্যানগতভাবে সম্ভাব্য পরবর্তী শব্দটি বেছে নিচ্ছে, এমন একটি ব্যবস্থার ভেতরে যা স্বতন্ত্র শোনার চেয়ে সক্ষম শোনার জন্য প্রশিক্ষিত। সেই মাত্রায় সক্ষমতা মসৃণ, সঠিক, সহজে ভুলে যাওয়া গদ্য তৈরি করে, আর সেটাই যান্ত্রিক অনুভূতির মূল। একজন পাঠক প্রায়ই এমন একটি অনুচ্ছেদে কী ভুল আছে তা বলতে পারেন না, শুধু বলতে পারেন যে এটি সমতল শোনায়, আর নিচের চারটি স্তরেই সেই সমতলতা বাস করে।

শব্দচয়ন হলো সেই স্তর, যা পাঠকেরা প্রথমে লক্ষ করেন, এমন আনুষ্ঠানিক, নাটকীয় শব্দ, যা যেখানে থাকার কথা নয়, সেখানে উপস্থিত হয়। বাক্যের ছন্দ আরও নীরব, এমন একটি অনুচ্ছেদ, যেখানে প্রতিটি বাক্য প্রায় একই দৈর্ঘ্যে চলে। যতিচিহ্ন এবং বিন্যাসেরও নিজস্ব স্বাক্ষর আছে, একটি ড্যাশকে সর্বজনীন সংযোগকারী হিসেবে ব্যবহার করা, এমন একটি বুলেট তালিকা যা এমন পাঠ্যকে ভেঙে দেয়, যা লেখকের মনে কখনও তালিকা ছিল না। গঠন সবচেয়ে কম দৃশ্যমান, এমন একটি অংশ, যা নিজের শিরোনামই পুনরুক্তি করে, ঠিক তিনটি বিষয় আচ্ছাদন করে, তারপর নিজেকেই সংক্ষেপে উপসংহার টানে।

শুরু করুন শব্দগুলো দিয়ে, এগুলোই সবচেয়ে সহজে চিহ্নিত করা যায়, এবং সবচেয়ে ভালোভাবে নথিভুক্ত।

AI কোন শব্দগুলো অতিরিক্ত ব্যবহার করে?

আপনি এই আনুষ্ঠানিক, সামান্য নাটকীয় শব্দগুলো বারবার দেখেন, "delve", "underscore", "showcase" এবং "pivotal" সবচেয়ে বেশি নথিভুক্তগুলোর মধ্যে আছে। Dmitry Kobak এবং তিনজন সহলেখক ভাষাটি শনাক্ত করার উদ্দেশ্যে কাজ শুরু করেন। তাঁরা 2010 থেকে 2024 পর্যন্ত 15.1 million PubMed abstracts বিশ্লেষণ করেন এবং এমন একদল শব্দ শনাক্ত করেন, যেগুলোর ব্যবহারের হার ChatGPT প্রকাশের পর দ্রুত বেড়ে যায়। "delve" সবচেয়ে দূর পর্যন্ত এগোয়, Science Advances-এ July 2025-এ প্রকাশিত গবেষণাটি 2024 সালে এর ব্যবহারের হারকে 2023-এর আগের সময়ের তুলনায় প্রায় 28 গুণ বেশি বলে অনুমান করে। পরের অবস্থানে ছিল "underscore" এবং "showcase"। লেখকদের অনুমান, 2024-এর অন্তত 13.5 percent abstracts-এ AI সহায়তার চিহ্ন আছে, এবং কিছু দেশ ও প্রকাশকের ক্ষেত্রে এই হার 40 percent-এরও বেশি।

মডেলগুলো কেন এই নির্দিষ্ট শব্দগুলোর দিকে ঝোঁকে, তা নিজস্ব প্যাটার্নের তুলনায় কম নিশ্চিত। COLING 2025-এর একটি গবেষণায় একুশটি অতিরিক্ত প্রতিনিধিত্বশীল শব্দকে model architecture, training data এবং chatbots fine-tune করতে ব্যবহৃত human feedback-এর বিরুদ্ধে পরীক্ষা করা হয়, এবং feedback পর্যায়টিকেই সবচেয়ে সম্ভাব্য অবদানকারী হিসেবে পাওয়া যায়, যদিও প্রভাবটি পুরোপুরি ব্যাখ্যা করা যায়নি। ব্যাখ্যাটি নিয়েও মতভেদ আছে, PNAS জার্নালে 2026-এর একটি exchange word-frequency-এর পরিবর্তন AI ব্যবহারের মাত্রা কতটা সরাসরি মাপে, সে বিষয়ে আপত্তি তোলে, এবং এখানে কোনো একক সংখ্যাকে চূড়ান্ত সত্য হিসেবে ধরার আগে এটি মনে রাখা উচিত।

এটি শুধু জার্নাল সারসংক্ষেপের ক্ষেত্রেই সত্য নয়। অর্ধ মিলিয়ন ছাত্র-লিখিত এবং AI-উৎপাদিত প্রবন্ধের তুলনামূলক এক গবেষণায়, গবেষকেরা প্রবন্ধগুলোর দৈর্ঘ্য এবং শব্দচয়ন তুলনা করে দেখেন যে মানব-লিখিত প্রবন্ধগুলো সামগ্রিকভাবে বেশি দীর্ঘ ছিল এবং আরও বিস্তৃত শব্দভান্ডার ব্যবহার করেছিল। ICLR 2024 এবং NeurIPS 2023 সহ চারটি machine learning সম্মেলনে জমা দেওয়া peer review-এর এক গবেষণায়, গবেষকেরা একই কৌশল ব্যবহার করে অনুমান করেন যে review পাঠ্যের 6 থেকে 15 শতাংশ পর্যন্ত একটি LLM দ্বারা উল্লেখযোগ্যভাবে পরিবর্তিত হয়েছিল। এটি deadline-এর কাছাকাছি জমা দেওয়া হলে LLM দ্বারা প্রভাবিত হওয়ার সম্ভাবনা বেশি ছিল।

AI যে শব্দ বা বাক্যাংশ অতিরিক্ত ব্যবহার করেএকজন সতর্ক লেখক এর বদলে যা ব্যবহার করেন
delve (into)look at, examine
underscoreshow, stress
showcasepresent, demonstrate
pivotalmain, deciding
robustsolid, reliable
intricatecomplex, detailed
meticulouscareful, thorough
tapestrymix, range
testamentsign, evidence
boastshas, includes
fosterencourage, support
garnergain, attract
multifacetedmany-sided, complex
holisticwhole, overall
nuancedcareful, precise
invaluableuseful, valuable
realmfield, area
embark onbegin, start
unlockopen up, make possible
interplayrelationship, link

এই শব্দগুলোর কোনোটিই নিজে নিজে ভুল নয়। একটি methods section যদি কোনো finding-কে robust বলে, তবে সেটি শব্দটি সঠিকভাবেই ব্যবহার করছে, আর কোনো historian যদি একটি জটিল legal argument বর্ণনা করেন, তবে তিনি কোনো chatbot-এর কাছে স্বীকারোক্তি দিচ্ছেন না। যা machine-made বলে শোনায় তা হলো ঘনত্ব, এক অনুচ্ছেদে এই শব্দগুলোর তিন বা চারটি, কোনো নির্দিষ্ট কাজ না করে, এমনভাবে স্তূপীকৃত যে একটি model যেভাবে সেগুলো স্তূপ করে, কারণ প্রতিটিই স্বাধীনভাবে পরের জন্য সবচেয়ে নিরাপদ পছন্দ ছিল। TextPulse-এর free AI word cleaner দিয়ে দ্রুত একবার দেখে নিলে সেই ঘনত্ব সরাসরি চিহ্নিত হয়।

AI বাক্যগুলো কেন সব একই দৈর্ঘ্যের মতো শোনায়?

একটি model প্রতিটি বাক্যকে আগের বাক্যের মতোই গড়ে তোলে, কোনো এক জায়গায় ছয়টি শব্দে একটি বক্তব্য সংকুচিত করার বদলে অন্য কোথাও তা ত্রিশটি শব্দজুড়ে খুলে না দিয়ে, ফলে আউটপুটটি সাধারণত সর্বত্র প্রায় একই দৈর্ঘ্যে থাকে। এই তারতম্য, বা তার অনুপস্থিতি, আপনি একটি অনুচ্ছেদ জোরে পড়ে শুনে টের পেতে পারেন, যা detector একই অন্তর্নিহিত বৈশিষ্ট্য থেকে গণনা করা burstiness score-এর থেকে ভিন্ন একটি অনুশীলন।

দুটি ছোট অভ্যাস কাছ থেকে দেখলে এই ছন্দ ফাঁস করে দেয়। একটি model এমন একটি dangling participle দিয়ে বাক্য শেষ করতে পছন্দ করে, যা তথ্য না বাড়িয়ে গুরুত্বের ইঙ্গিত দেয়, যেমন একটি দাবি, তারপর আরও গবেষণার প্রয়োজনীয়তা তুলে ধরা, অথবা ক্ষেত্রের একটি বৃহত্তর পরিবর্তন প্রতিফলিত করা। এটি ভারসাম্যপূর্ণ শোনাতে জোড়া গঠনও ব্যবহার করে, যেমন method is not only efficient but also scalable। একবার বলা হলে, এই গঠনটি অস্বাভাবিক নয়। প্রতিটি অনুচ্ছেদে বলা হলে, এটি এমন শোনায় যেন noun গুলো বদলে দেওয়া একটি template।

তিনের নিয়ম

phrase স্তরেও, তিনের দল model-এর স্বাভাবিক ছন্দ: একটি noun-এর আগে তিনটি adjective, একটি তালিকায় তিনটি example, পরপর একইভাবে গঠিত তিনটি clause। মাঝে মাঝে তিনের দল ইংরেজির অংশ সবসময়ই ছিল। যথাস্থানে বসানো তিনের দল কোনো কিছুরই লক্ষণ নয়। আসল ইঙ্গিত হলো ঘনত্ব। তিন সমস্যা নয়। প্রায় প্রতিটি অনুচ্ছেদে তিনের উপস্থিতিই সমস্যা।

গণনা করাই বিশেষ কোনো প্রশিক্ষণ ছাড়াই এর বেশির ভাগ ধরতে যথেষ্ট। একটি অনুচ্ছেদ পড়ুন এবং প্রতিটি বাক্যের শব্দসংখ্যা চিহ্নিত করুন। যদি আপনার সব চিহ্ন শেষটির থেকে কয়েকটি শব্দের মধ্যেই থাকে, তবে সেই ছন্দই হলো সংকেত। গণনা স্বয়ংক্রিয় করতে এবং তা চিত্রায়িত করতে TextPulse-এর free burstiness checker ব্যবহার করুন, যা এমন একটি অংশের জন্য উপকারী, যা একবারে একটি বাক্য করে চোখে মেপে দেখা খুব দীর্ঘ।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

এম ড্যাশ এবং অন্যান্য যতিচিহ্নগত সংকেত

কেন এই চিহ্নটি প্রধান পছন্দ হয়ে উঠল

এম ড্যাশ সম্ভবত যন্ত্র-লিখিত লেখায় সবচেয়ে বেশি দোষারোপ করা যতিচিহ্ন। আপনি এটিকে সেই দীর্ঘ ড্যাশ হিসেবে জানেন, যা একটি বাক্যের দুই অংশকে যুক্ত করতে কমা, কোলন বা পূর্ণচ্ছেদকে প্রতিস্থাপন করে। এম ড্যাশ নতুন নয়, এবং এটি AI উদ্ভাবিত কিছু নয়। Chicago থেকে AP পর্যন্ত, যতদিন থেকে শৈলী নির্দেশিকা আছে, ততদিন থেকেই তারা জোর বা বিরতির জন্য এটি ব্যবহার করতে দিয়েছে। আর অনেক পেশাদার লেখক এটি ইচ্ছাকৃতভাবে ব্যবহার করেন।

এটি যন্ত্র-উৎপাদিত লেখায় এত ঘন ঘন দেখা যাওয়ার সম্ভাব্য কারণটি সাধারণ: ভাষা মডেল যেসব সম্পাদিত, পেশাগতভাবে বিন্যস্ত গদ্যে প্রশিক্ষিত হয়, সেখানে এই চিহ্নটি প্রচলিত, এবং এটি একটি বাক্যকে পূর্ণচ্ছেদে থামিয়ে না দিয়ে এগিয়ে যেতে দেয়। সাবলীল, সংযুক্ত পাঠ্য উৎপাদনের জন্য নির্মিত একটি মডেল প্রায়ই এই নমনীয়তার দিকে ঝোঁকে, হাতে খসড়া করার সময় অধিকাংশ মানুষের তুলনায় আরও বেশি বার।

এটি কত ঘন ঘন দেখা যায়, তা কোন সিস্টেম পাঠ্যটি তৈরি করেছে তার ওপর ব্যাপকভাবে নির্ভর করে। 2025 সালের মাঝামাঝি একটি পাশাপাশি পরীক্ষায় ছয়টি চ্যাটবটকে একই প্রম্পট দেওয়া হয়েছিল এবং চিহ্নটি গণনা করা হয়েছিল: তিনটি সিস্টেম ছয়শোর কম শব্দে এটি আট বা নয় বার ফিরিয়ে দেয়, একটি প্রায় এক হাজার শব্দে এটি দুই বার ব্যবহার করে, এবং দুটি একেবারেই ব্যবহার করেনি। ঘনত্ব হলো আপনার সামনে থাকা অনুচ্ছেদটি যে মডেল তৈরি করেছে তার বৈশিষ্ট্য, AI লেখার কোনো স্থির বৈশিষ্ট্য নয়। OpenAI November 2025-এ একটি সেটিং যোগ করে, যা ব্যবহারকারীকে ChatGPT-কে এই চিহ্ন ব্যবহার না করতে বলতে এবং বাস্তবে তা মানতে দেয়, ফলে এই সংকেতটিও এখন আংশিকভাবে ঐচ্ছিক।

এর কোনোটিই চিহ্নটিকেই কোনো কিছুর প্রমাণ করে না। অনেক সতর্ক লেখক এটি ইচ্ছাকৃতভাবে ব্যবহার করেন, এবং অনেক ছাত্রের প্রবন্ধেও এটি থাকে, যেগুলো কখনও কোনো chatbot স্পর্শ করেনি, কখনও কখনও কারণ একজন শিক্ষক তাদের তা শিখিয়েছেন। যে বিষয়টি যাচাই করা মূল্যবান, তা হলো ঘনত্ব, একটি পৃষ্ঠা যদি প্রতি দ্বিতীয় বাক্যে এই চিহ্নের ওপর নির্ভর করে, তবে তা ভিন্নভাবে পড়া যায়, তুলনায় এমন একটি পৃষ্ঠার, যা ইচ্ছাকৃতভাবে এটি দুবার ব্যবহার করে। TextPulse-এর free em dash remover এই ঘনত্ব পরীক্ষা করে এবং প্রতিটি ক্ষেত্রে যে comma, colon, full stop বা hyphen প্রযোজ্য, তা প্রস্তাব করে।

বুলেট, বোল্ড টেক্সট এবং হেডার

একই স্তর বাক্যের নিচের ফরম্যাটিং সিদ্ধান্তগুলোকেও অন্তর্ভুক্ত করে। গদ্যের মাঝখানে একটি bulleted list, যা লেখকের মনে কখনও list ছিল না। বাকি নথি sentence case-এ থাকলেও title case-এ headings। প্রতিটি bullet point-এর শুরুতে mini headline-এর মতো একটি bolded phrase। এগুলোর কোনোটিই punctuation mark নয়, কিন্তু সবই একই জায়গা থেকে আসে, একটি model chat window-এর জন্য formatting করছে, যেখানে visual structure সেই transitions-এর বিকল্প হয়ে দাঁড়ায়, যা prose সাধারণত বহন করে।

গঠন এবং যুক্তির আকৃতি

শেষ স্তরটি বাক্যের উপরে অবস্থান করে এবং একটি word swap দিয়ে এটি ঠিক করা সবচেয়ে কঠিন, কারণ এটি নিজেই যুক্তির আকৃতি। machine-written একটি section প্রায়ই নিজের heading-টিকেই সামান্য ভিন্ন শব্দে পুনরায় বলে শুরু হয়, তারপর দুই বা তিনটি supporting point-এর মধ্য দিয়ে যায়, যেগুলো প্রত্যেকটির প্রকৃত গুরুত্ব যাই হোক না কেন, মোটামুটি সমান ওজন পায়, তারপর নতুন কিছু যোগ করার বদলে সে যা刚刚 বলেছে, তারই সারসংক্ষেপ দিয়ে শেষ করে।

একটি সম্পর্কিত অভ্যাস দীর্ঘতর লেখায় নিয়মিত দেখা যায়, একটি section বলে কোনো কিছু কী ভালোভাবে করে, however-এর মতো একটি শব্দে মোড় নেয়, একই সুশৃঙ্খল তিনটি পয়েন্টে challenges তালিকাভুক্ত করে, তারপর এমন এক ভবিষ্যতের দিকে ইঙ্গিত করে, যা সম্ভবত সেগুলো সমাধান করবে। বাস্তব যুক্তি এর চেয়ে বেশি খাপছাড়া। একজন মানব লেখক সাধারণত অন্য দুইটির তুলনায় একটি পয়েন্টকে বেশি গুরুত্ব দেন, তাকে বেশি জায়গা দেন, এবং পাঠকের কাছে একটি সমমিত সমাপ্তির ঋণী নন।

এটিও সেই স্তর, যেখানে সূত্রবদ্ধ একাডেমিক লেখা যান্ত্রিক লেখার সঙ্গে প্রতারণামূলকভাবে সাদৃশ্যপূর্ণ দেখাতে পারে, কারণ একটি methods section বা একটি literature review নির্দিষ্ট একটি কাঠামো অনুসরণ করার কথা। পার্থক্যটি সেই কাঠামোর ভেতরেই থাকে। যন্ত্র-লিখিত একটি literature review ক্ষেত্রটির প্রচলিত বিষয়গুলোকে প্রচলিত ক্রমে নামমাত্র উল্লেখ করে। মানব-লিখিত একটি review কোন বিষয়গুলো গুরুত্বপূর্ণ এবং কেন, তা নিয়ে যুক্তি দেয়, এমনকি কঠোর একটি template-এর মধ্যেও, কারণ সেখানে একটি বাস্তব অবস্থান রক্ষা করা হচ্ছে।

আপনি যে Text লিখেননি, সেটি বিচার করা

সবচেয়ে গুরুত্বপূর্ণ চারটি লক্ষণ

নির্দিষ্টতার ফাঁক হলো এমন পাঠকের জন্য সবচেয়ে শক্তিশালী লক্ষণ, যার হাতে কোনো tool-ই নেই। যন্ত্র-প্রণীত গদ্য এমন দাবি করে যা সাধারণতার প্রতিটি স্তরে সত্য বলে মনে হয় এবং কোনো নির্দিষ্ট স্তরের সঙ্গেই বাঁধা থাকে না। এটি জানায় যে গবেষণা প্রশ্নটি পরীক্ষা করেছে, কিন্তু কোনো study-এর নাম দেয় না, প্রভাবটি significant, কিন্তু কোনো size দেয় না, অনুশীলনটি sector-এ common, কিন্তু কোনো firm বা year-এর নাম দেয় না। একই word limit-এর মধ্যে কাজ করা একজন মানব লেখক সাধারণত সেই শব্দগুলো একটি নির্দিষ্ট বিষয়ের ওপর ব্যয় করেন, কারণ তার কাছে একটি নির্দিষ্ট বিষয় ছিল এবং তিনি সেটিকে অন্তর্ভুক্ত করতে চেয়েছিলেন।

যে citations resolve হয় না, সেগুলোই তালিকার একমাত্র লক্ষণ যা evidence-এর কাছাকাছি পৌঁছায়, এবং সেগুলোই সবচেয়ে বিরল। একটি reference নিখুঁতভাবে formatted, একটি বাস্তব journal-এর নামে attributed, এবং এমন একটি identifier বহনকারী যা কোনো record ফেরত দেয় না, তা দুর্ঘটনাবশত তৈরি করা খুবই কঠিন। আপনি যে submission নিয়ে নিশ্চিত নন, তাতে অন্য কিছুর আগে তিনটি reference পরীক্ষা করুন। এতে দুই মিনিট লাগে, এবং এটি হয় প্রশ্নটির অবসান ঘটায়, নয়তো table থেকে সবচেয়ে শক্তিশালী signal সরিয়ে দেয়।

Vocabulary density হলো সেই লক্ষণ, যা অধিকাংশ পাঠক প্রথমে খোঁজেন, এবং এটিই সবচেয়ে বেশি ভুল সংকেত দেয়। signal হলো density, কোনো একক word নয়। একটি formal verb একা থাকলে তা সাধারণ academic register, কিন্তু একটি paragraph-এর মধ্যে পাঁচটি verb, যেগুলো কোনো নির্দিষ্ট কাজ করছে না, তা একটি pattern। দীর্ঘ submission জুড়ে হাতে গুনে দেখা ধীর, এবং TextPulse-এর free AI word cleaner স্বয়ংক্রিয়ভাবে cluster চিহ্নিত করে, যা অস্পষ্ট ধারণাকে এমন কিছুর মধ্যে রূপ দেয়, যেটির দিকে আপনি page-এ আঙুল দিয়ে দেখাতে পারেন।

চারটির মধ্যে সবচেয়ে সূক্ষ্মটি হলো এমন একটি রেজিস্টার, যা কখনও ভাঙে না। একজন মানব লেখক প্রায় সব সময়ই দুই হাজার শব্দের মধ্যে কোথাও না কোথাও সামান্য সুরচ্যুতি ঘটান, তিনটি দীর্ঘ বাক্যের পরে একটি সংক্ষিপ্ত বাক্য, বন্ধনীর মধ্যে একটি পার্শ্ব মন্তব্য, এমন একটি বিচার যা তাকে করতে হতো না, এমন একটি শব্দ যা তিনি পছন্দ করেছিলেন বলে বেছে নেওয়া। যন্ত্র-প্রণীত গদ্য প্রথম লাইন থেকে শেষ লাইন পর্যন্ত একটিই রেজিস্টার ধরে রাখে। এমন ঘরানা আছে যা এসব কিছুর সবই নিষিদ্ধ করে, তাই এই লক্ষণটি একটি methods section এর তুলনায় personal statement এ অনেক কম মূল্যবান।

যে লক্ষণগুলো শক্তিশালী মনে হয়, কিন্তু নয়

নিখুঁত ব্যাকরণ কিছুই প্রমাণ করে না। বানান ও যতিচিহ্ন গত দুই দশক ধরে স্বয়ংক্রিয় করা হয়েছে, এবং যে কোনো যত্নবান লেখক checker চালালে একই রকম পরিচ্ছন্ন পৃষ্ঠতল পান। আনুষ্ঠানিক রেজিস্টারও কিছু প্রমাণ করে না, কারণ অধিকাংশ academic ও professional ঘরানার নীতিগত প্রয়োজনই হলো আনুষ্ঠানিকতা। heading, bold text এবং bullet lists এর ব্যাপক ব্যবহার house-style এর অভ্যাস, অন্য যেকোনো কিছুর আগে, এবং বহু লেখককে এর সঙ্গে বহু বছর আগে থেকেই প্রশিক্ষিত করা হয়েছিল, কোনো chatbot তা কাউকে দেখানোর অনেক আগেই। যতিচিহ্নের অভ্যাসও একইভাবে কম গুরুত্ব বহন করে, এবং বিশেষ করে em dash এর ওপর একটিমাত্র চিহ্নের পক্ষে যতটা বহন করা সম্ভব তার চেয়ে অনেক বেশি দায় চাপানো হয়েছে।

Detector score-ও এই গোষ্ঠীর অন্তর্ভুক্ত, যা মানুষকে প্রায়ই বিস্মিত করে। একটি score হলো পাঠ্যটি কতটা পূর্বানুমেয়, সে সম্পর্কে একটি পরিসংখ্যানগত বিচার, এবং পূর্বানুমেয় গদ্যই হলো যা যত্নবান মানুষ প্রতিদিন তৈরি করে, আর এই কারণেই false positive একেবারেই ঘটে। Detector output হলো এমন একটি সিদ্ধান্তের একটি input, যা একজন মানুষকে এখনও নিতে হয়, এবং TextPulse এর AI detector কীভাবে কাজ করে, সে বিষয়ে explainer সংখ্যাটি কী মাপছে তা ব্যাখ্যা করে, তারপরই কেউ সেটিকে verdict হিসেবে বিবেচনা করে।

যখন একটি পাঠ্য একাধিক লক্ষণ প্রকাশ করে, তখন কী করতে হবে

প্রথমে যাচাইযোগ্য অংশটি যাচাই করুন। তিনটি উদ্ধৃতি, একটি সংখ্যা এবং একটি নামযুক্ত তথ্য নিন, এবং প্রতিটিকে আলাদাভাবে যাচাই করুন। এই একবারের পর্যালোচনাই পাতলা একটি পাঠ্যকে কৃত্রিমভাবে নির্মিত একটি পাঠ্য থেকে আলাদা করে, এবং এই দুইটির জন্য খুব ভিন্ন প্রতিক্রিয়া প্রয়োজন। এরপর, জমাটি একই ব্যক্তি তত্ত্বাবধানে আগে যা লিখেছিলেন তার সঙ্গে তুলনা করুন, কারণ একজন লেখকের মধ্যে হঠাৎ রেজিস্টারের পরিবর্তন একক নথির কোনো নিরপেক্ষ পাঠের চেয়ে বেশি গুরুত্ব বহন করে। তারপর লেখকের নিজের পাঠ্য সম্পর্কে এমন একটি প্রশ্ন করুন, যার উত্তর কেবল লেখকই দিতে পারেন, এই উৎসটি কেন স্পষ্ট বিকল্পটির বদলে নেওয়া হয়েছে, তৃতীয় অংশটি শুরুতে কী যুক্তি দিতে যাচ্ছিল, কোন অনুচ্ছেদটি তাদের সবচেয়ে বেশি সমস্যায় ফেলেছিল। যে ব্যক্তি এটি লিখেছেন, তিনি সঙ্গে সঙ্গেই উত্তর দেন।

যে নীতি বিদ্যমান, সেটিই অনুসরণ করুন, আপনি যে নীতি লিখতেন তা নয়। অধিকাংশ প্রতিষ্ঠান এখন নির্দিষ্ট করে দেয় কে উদ্বেগ উত্থাপন করতে পারে, কোন প্রমাণ গ্রহণযোগ্য, এবং লেখককে কী জানানো হবে, আর সেই ক্রম এড়িয়ে যাওয়াই একটি যুক্তিসঙ্গত প্রশ্নকে অভিযোগে পরিণত করে। এই সমস্যার অন্য পাশে থাকা লেখকদের, যাদের বলা হয় তাদের নিজস্ব কাজ যন্ত্রে খসড়া করা মনে হচ্ছে, ভিন্ন কাজ করতে হয়, এবং TextPulse's AI humanizer পাঠ্য থেকে গণনা করা একটি আনুমানিক Human Score জানায়, কোনো detector থেকে আসা রায় নয়।

একই পরীক্ষাটি নিজের খসড়ার ওপর প্রয়োগ করা আরও কঠিন, এবং আপনার লেখা AI-এর মতো শোনায় কি না এর জন্য আলাদা পৃষ্ঠা আছে। শব্দভান্ডারটিও আলাদাভাবে তালিকাভুক্ত, ChatGPT-কে ধরে ফেলা শব্দ ও বাক্যাংশের একটি তালিকায়।

এই নয়টি লক্ষণ একটি প্রশ্ন করার কারণ, এবং প্রশ্নটি সব সময় একই: এই পাঠ্য এমন কী জানে, যা একটি সাবলীল অনুমান জানত না? প্রথমে এটি উদ্ধৃতিগুলোর ক্ষেত্রে জিজ্ঞাসা করুন। সেটিই যেকোনো জমার একমাত্র অংশ, যা নিজে থেকেই উত্তর দেয়, কাউকে কোনো কিছুর জন্য অভিযুক্ত করতে না হয়েই।

এই লক্ষণগুলো কি প্রমাণ করে যে একটি পাঠ্য AI-লিখিত?

একটিও একক লক্ষণ কিছুই প্রমাণ করে না, এবং সবগুলো একসঙ্গেও না। কোনো সম্পাদক বা অধ্যাপকের চাপের মুখে, একজন সতর্ক একাডেমিক লেখক চ্যাটবটের সাহায্য ছাড়াই এই বৈশিষ্ট্যগুলোর কয়েকটি, যেমন সর্বনামের অভাব, থাকা অনুচ্ছেদ তৈরি করতে পারেন। অ-স্থানীয় ইংরেজি লেখকেরা শ্রেণিতে শেখানো নিরাপদ শব্দও ব্যবহার করতে পারেন, এবং যেসব শিক্ষার্থীকে আনুষ্ঠানিক সংযোজক ব্যবহার করতে শেখানো হয়, তারাও এই বৈশিষ্ট্যগুলোর অনেকগুলো ব্যবহার করতে পারেন। শব্দের একটি তালিকা অসদাচরণের প্রমাণ নয়, এটি এমন একটি ভুল যা সতর্ক লেখকদের মিথ্যা অভিযোগের মুখে ফেলতে পারে। আমাদের এই ভুলটিকে চিহ্নিত করা উচিত, নীরবে তা পুনরাবৃত্তি করা নয়।

কোনো টুল দায়িত্বশীলভাবে যা করতে পারে তা হলো ধারা দেখানো, লেখাকে বিচার করা নয়। TextPulse-এর AI humanizer দিয়ে আমরা যা দিতে পারি তা হলো সামনে থাকা পাঠ্যের ভিত্তিতে একটি Human Score-এর আনুমানিক মান। এটি হলো কোনো খসড়া এই পৃষ্ঠতলগত ধরণগুলোর তুলনায় কোথায় অবস্থান করছে তার একটি পাঠ, কোনো detector-এর রায় নয় এবং আগামীকাল অন্য কোনো টুল কী বলে তার কোনো প্রতিশ্রুতিও নয়। এটি এমন একটি সংখ্যা, যা আপনি সিদ্ধান্তের প্রারম্ভিক বিন্দু হিসেবে ব্যবহার করতে পারেন, যেমন spellchecker কোনো শব্দকে চিহ্নিত করে, কিন্তু তার চারপাশের বাক্যটি আদৌ ভালো কি না তা নির্ধারণ করে না।

উপরে উল্লিখিত প্রতিটি লক্ষণের নিজস্ব একটি পৃষ্ঠা আছে। শব্দভান্ডারটিকেই ChatGPT-কে ফাঁস করে দেয় এমন শব্দ বিষয়ক একটি লেখায় তালিকাভুক্ত করা হয়েছে, যেখানে em dash ব্যবহারের অভ্যাস এবং মডেল কেন বিশেষভাবে একটি ক্রিয়াপদের দিকে ঝোঁকে বিষয়েও পৃথক আলোচনা আছে। বৃহত্তর শ্রেণিগুলিও আলোচিত হয়েছে, AI slop কী বোঝায়, AI fluff কী বোঝায়, এবং কোনো কিছু AI লিখেছে কি না তা নির্ণয়ের একটি ব্যবহারিক নির্দেশিকা। যদি উদ্বেগটি অন্য কারও নয়, আপনার নিজের খসড়া নিয়ে হয়, তবে আপনার লেখালেখি থেকে AI শব্দ সরানো বিষয়েও একটি লেখা আছে।

পরের বার আপনি যখন আপনার গদ্য পড়ছেন এবং তাতে কিছু একটা ঠিকঠাক লাগছে না, তখন শুধু সেটি বদলানোর জন্য একটি সমার্থক শব্দ খুঁজবেন না। তার বদলে জোরে পড়ে দেখুন। প্রতিটি বাক্যে শব্দের সংখ্যা গুনুন। নিজেকে জিজ্ঞাসা করুন, প্রতিটি শব্দ সেখানে ঠিক কী করছে। এটাই সেই একই পাঠ, যা এই সবকিছুর কোনো নাম হওয়ার অনেক আগেই একজন সতর্ক সম্পাদক করে যাচ্ছিলেন।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

কারণ পৃষ্ঠতলের কয়েকটি ধরন, যা যন্ত্র-নির্মিত বলে মনে হয়, যেমন আনুষ্ঠানিক শব্দভান্ডার, একরূপ বাক্যদৈর্ঘ্য, একটি পরিপাটি তিন-অংশের কাঠামো, এগুলো সময়সীমার চাপে বা ভারী সম্পাদনার অধীনে করা সতর্ক মানব লেখাতেও দেখা যায়। এগুলো ইঙ্গিত, উৎসের প্রমাণ নয়। একটি অনুচ্ছেদে এগুলোর প্রতিটি থাকতে পারে, তবু তা সম্পূর্ণভাবে আপনার নিজের কাজ হতে পারে।

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।