AI Detection

কেন AI টেক্সট শনাক্ত হয়? প্রকৃত কারণগুলো

AI লেখার পেছনের ডিকোডিং প্রক্রিয়া প্রতিটি ধাপে সম্ভাব্য শব্দ এবং সম্ভাব্য বাক্যগঠনকে অগ্রাধিকার দেয়, এ কারণেই AI টেক্সট শনাক্ত হয়, এমনকি তা সাবলীলভাবে পড়া গেলেও। এই পোস্টে শব্দভান্ডারের সমতলতা, বাক্যগঠনের একরূপতা, এবং মানব লেখকেরা যে নির্দিষ্ট পছন্দগুলো সাধারণত করেন, সেগুলো আলোচনা করা হয়েছে, অন্তর্নিহিত গণিত বাদ দিয়ে।

5 min
Why does ai text get detected: illustration of AI-generated writing sitting in a narrow band of a language model's probability distribution

আপনি যদি একটি ভাষা মডেলকে "The weather today is," বাক্যটি সম্পূর্ণ করতে বলেন, এটি "cerulean" বা "apocalyptic" এর মতো কোনো রং বেছে নেওয়ার চেষ্টা করবে না। বরং, এটি "sunny," "cloudy," বা "nice," বলার চেষ্টা করবে, কারণ প্রশিক্ষণের সময় যে উপাদানের ওপর এটি শেখানো হয়েছে, সেখানে ওই বাক্যাংশের পরে এই শব্দগুলোই সবচেয়ে বেশি এসেছে। বাক্যে পরের শব্দটি বেছে নেওয়ার জন্য যে সফটওয়্যার ব্যবহৃত হয়, সেটি ঠিক এই ধরনের উত্তরকে অগ্রাধিকার দেওয়ার জন্য নকশা করা হয়েছে।

AI টেক্সট কেন শনাক্ত হয়? কারণ "cerulean" এর ওপর "sunny" বেছে নেওয়ার যে একই প্রবণতা, তা একটি সম্পূর্ণ নথির ভেতর দিয়ে, শব্দের পর শব্দে, চলতে থাকে, এবং এর ফলাফল মানুষের প্রকৃত লেখার তুলনায় সম্ভাব্য লেখার একটি সংকীর্ণ পরিসরের মধ্যে অবস্থান করে। একটি ডিটেক্টরকে মিথ্যা ধরতে হয় না। তাকে শুধু লক্ষ্য করতে হয় যে একটি অংশ বারবার সেই সংকীর্ণ পরিসরের মধ্যেই এসে পড়ছে।

এর পর যা বলা হবে, তার জন্য কোনো সূত্রের প্রয়োজন নেই। প্রক্রিয়াটি একটি ধারণার মধ্যে নিহিত, যা তিনটি ভিন্ন স্তরে পুনরাবৃত্ত হয়, শব্দ নির্বাচন, বাক্যের গঠন, এবং সেই নির্দিষ্ট বিবরণ, যার দিকে একজন লেখক না ভেবেই হাত বাড়ান। এই প্রতিটি স্তর how AI detectors actually work এই বৃহত্তর প্রশ্নের সঙ্গে যুক্ত, এবং মূল কারণটির নাম দেওয়া হলে এগুলো বোঝা আরও সহজ হয়।

AI টেক্সট কেন শনাক্ত হয়? সংক্ষিপ্ত উত্তর

AI টেক্সট শনাক্ত হয় কারণ একটি মডেলের পূর্বাভাসকে সম্পূর্ণ বাক্যে রূপান্তর করার decoding প্রক্রিয়াটি প্রতিটি ধাপে সম্ভাব্য শব্দকে অগ্রাধিকার দেওয়ার জন্য নির্মিত, এবং হাজার হাজার শব্দ ধরে ধারাবাহিকভাবে তা করলে এমন লেখা তৈরি হয় যা মানুষের তুলনায় ভাষার একটি সংকীর্ণ অংশ দখল করে। একটি পরিসংখ্যানগত টুল এই সংকীর্ণতা খুঁজে পেতে পারে, এমনকি যখন প্রতিটি বাক্য ব্যাকরণগতভাবে নিখুঁত এবং তথ্যগতভাবে সঠিক হয়।

এই একটিমাত্র কারণ থেকে তিনটি লক্ষণ দেখা দেয়। শব্দভান্ডার সবচেয়ে নিরাপদ সাধারণ শব্দের দিকে সংকুচিত হয়। বাক্যগঠন কয়েকটি পছন্দের কাঠামোর দিকে সংকুচিত হয়। আর যে নির্দিষ্ট, সামান্য অস্বাভাবিক নির্বাচন একজন মানুষ প্রায় স্বতঃস্ফূর্তভাবে করেন, সেই অদ্ভুত শব্দ, সেই পাশের মন্তব্য, সেই বিবরণ যা যোগ করতে কিছুই খরচ হয় না কিন্তু অনুমান করতে অনেক কিছু লাগে, তা প্রায়ই একেবারেই দেখা যায় না।

একটি ভাষা মডেল কীভাবে তার পরের শব্দ বেছে নেয়

একটি ভাষা মডেলকে নিজের মতো চলতে দিলে, তা কেবল সম্ভাব্য পরবর্তী শব্দগুলোর সম্পূর্ণ র‌্যাঙ্ককৃত তালিকা জানাত এবং অন্য কিছুকে নির্বাচন করতে দিত। বাস্তবে, একটি decoding strategy সেই নির্বাচনটি স্বয়ংক্রিয়ভাবে, শব্দের পর শব্দ করে, এবং কোন strategy চালু আছে তা আউটপুটের চেহারা বদলে দেয়, এমনকি অন্তর্নিহিত model কখনও না বদলালেও।

Greedy decoding সর্বদা একক সর্বাধিক সম্ভাব্য শব্দটি নির্বাচন করে। nucleus sampling কে একটি সমাধান হিসেবে প্রবর্তন করা paper এ, Ari Holtzman এবং coauthors লক্ষ্য করেছিলেন যে এই strategy অনুসরণ করলে এমন text তৈরি হয় যা, তাঁদের নিজের কথায়, 'bland and strangely repetitive.' Beam search, যা একসঙ্গে কয়েকটি সম্ভাব্য continuation অনুসরণ করে এবং তারপর একটিতে স্থির হয়, একই সমস্যার অনুরূপ একটি রূপের মুখোমুখি হয়।

Sampling strategies কিছু randomness পুনরায় আনে, তবে নিয়ন্ত্রিত উপায়ে। Temperature নির্ধারণ করে, একটি word drawn হওয়ার আগে model তার নিজের শীর্ষ পছন্দগুলোকে কতটা তীব্রভাবে অগ্রাধিকার দেয়। Nucleus sampling, যাকে কখনও top-p বলা হয়, distribution কে সেই ক্ষুদ্রতম শব্দসমষ্টিতে সীমিত করে, য deren সম্মিলিত probability একটি threshold অতিক্রম করে, এবং কেবল সেই সেট থেকেই draw করে, যা original paper এ unreliable tail এর বদলে distribution এর dynamic nucleus থেকে sampling হিসেবে বর্ণিত হয়েছে।

এই settings গুলোর মধ্যে সবচেয়ে কম deterministic হলেও এখনও model ইতিমধ্যে যেগুলোকে likely মনে করে, সেগুলোর চারপাশে গঠিত একটি shortlist থেকে draw করে। Human writing কখনও একটি vocabulary কে rank করে তার শীর্ষ থেকে draw করে তৈরি হয়নি, তাই তা নিয়মিতভাবে সেই shortlist এর বাইরে পৌঁছে যায়। Meaning কখনও কখনও সেই শব্দে বাস করে, যা তালিকায় কখনও ছিল না।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

শব্দভান্ডারের সমতলতা, কম, নিরাপদ শব্দ

শব্দভান্ডারের সমতলতা একই অভ্যাসের word-level সংস্করণ। একটি বাক্যের প্রতিটি পর্যায়ে, ডজন ডজন শব্দ তা plausibly এগিয়ে নিতে পারে, কিন্তু কয়েকটি শব্দ model এর ranking এ বাকি সবার অনেক উপরে থাকে, এবং decoding বারবার সেই কয়েকটির ওপরেই গিয়ে থামে। একটি document এর প্রতিটি বাক্যে এই নির্বাচন প্রয়োগ করলে, ব্যবহৃত প্রকৃত শব্দের পরিসর একই দৈর্ঘ্যের human writing এর তুলনায় পরিমাপযোগ্যভাবে সংকুচিত হয়।

এর প্রভাব স্থির থাকে না, বরং ক্রমে সঞ্চিত হয়। একটি মডেল যদি প্রথম বাক্যে সর্বোচ্চ-র‌্যাঙ্কের শব্দটি বেছে নেয়, তবে দ্বিতীয় বাক্যে সর্বোচ্চ-র‌্যাঙ্কের শব্দটিও সাধারণ হওয়ার জন্য এমন একটি প্রেক্ষাপট গড়ে তোলার সম্ভাবনা বেশি থাকে, কারণ সাধারণ শব্দ সাধারণ শব্দের পরেই আসতে প্রবণ। একজন মানব লেখক এই সরে যাওয়াকে ক্রমাগত ব্যাহত করেন, নির্দিষ্ট প্রযুক্তিগত পরিভাষা, সামান্য অস্বাভাবিক ক্রিয়া, এমন শব্দ বেছে নেন যা নিরাপদ আনুমানিক রূপের বদলে প্রকৃত বস্তুর নাম দেয়। এই পার্থক্যটি উৎপন্ন সংস্করণে পরিমাপযোগ্যভাবে ছোট কর্মভাণ্ডার হিসেবে দেখা যায়, এমনকি উভয় সংস্করণ একই অন্তর্নিহিত তথ্য বর্ণনা করলেও।

এটি সমগ্র অনুচ্ছেদের একটি বৈশিষ্ট্য, কোনো একক শব্দচয়নের নয়। একটি নিরাপদ শব্দ কিছুই প্রমাণ করে না। এমন শব্দের একটি পৃষ্ঠা, যেখানে বাক্য থেকে বাক্যে একই স্তরের সাধারণ শব্দভাণ্ডারের দিকে হাত বাড়ানো হয়, সেটিই সেই জিনিস যা একটি detector-এর শব্দ-স্তরের সংকেত আসলে শনাক্ত করার জন্য নির্মিত।

বাক্যগঠনগত একরূপতা: একই আকৃতি, পুনরাবৃত্ত

বাক্যগঠনগত একরূপতা হলো বাক্য-স্তরের রূপ। এটি কোনো বাক্য কত দীর্ঘ, সে বিষয়ে নয়। এটি একটি অনুচ্ছেদ কতগুলো স্বতন্ত্র ব্যাকরণগত আকৃতি ব্যবহার করে, সে বিষয়ে: বাক্য কীভাবে শুরু হয়, উপবাক্য কীভাবে একে অপরের সঙ্গে যুক্ত হয়, একটি ধারণাকে পরেরটির সঙ্গে যুক্ত করার কাজটি কত ঘন ঘন কোনো সংযোগসূচক শব্দ করে। একটি মডেল যা পরিসংখ্যানগতভাবে সম্ভাব্য পরবর্তী গঠনটিই বারবার অনুমান করতে থাকে, তা অল্প কয়েকটি আকৃতির ঘূর্ণনে স্থির হয়ে যায় এবং সেটিই পুনরাবৃত্তি করে।

একটি অনুচ্ছেদ তার বাক্যের দৈর্ঘ্যে বৈচিত্র্য আনতে পারে, তবু যদি প্রতিটি বাক্য একই subject-verb-complement আকৃতি অনুসরণ করে, একই ধরনের transition দিয়ে শুরু হয়, বা একইভাবে সমাপ্ত হয়, তবে সেটি বাক্যগঠনগতভাবে সমতল শোনাতে পারে। পূর্বানুমেয়তা থাকে সেই বিন্যাসে, শব্দসংখ্যায় নয়, এবং এই পার্থক্যটি burstiness আসলে কী পরিমাপ করে শীর্ষক নির্দেশিকায় আরও বিস্তারিতভাবে আলোচিত হয়েছে।

কী সংকুচিত করেডিকোডিং-অপ্টিমাইজড পাঠ্য সাধারণত কী করেমানব রচনা সাধারণত কী করে
শব্দ নির্বাচনপ্রতিটি ধাপে সবচেয়ে সম্ভাব্য সাধারণ শব্দটি বেছে নেয়নির্দিষ্ট বা কম প্রচলিত সেই শব্দটির দিকে যায়, যা প্রকৃত বস্তুকে নাম দেয়
বাক্যের সূচনানিরাপদ সংযোগমূলক সূচনার একটি ছোট আবর্তন পুনরাবৃত্তি করেবাক্য কীভাবে শুরু হয় তা বৈচিত্র্যপূর্ণ করে, এমন সূচনাও অন্তর্ভুক্ত করে যেগুলিকে একটি মডেল কম সম্ভাব্য বলে র‌্যাঙ্ক করত
উপবাক্যের গঠনএকটি অনুচ্ছেদ জুড়ে এক বা দুইটি পছন্দের ব্যাকরণগত বিন্যাস পুনরাবৃত্তি করেএকটি বাক্যের প্রয়োজন অনুযায়ী সরল ও জটিল গঠন মিশিয়ে দেয়

যে পছন্দগুলো কেবল একজন মানুষই সাধারণত করে

সংকীর্ণ পরিসরের উল্টো দিকটি হলো, তার বাইরে যা পড়ে। বাস্তব ঘটনা বর্ণনা করা একজন ব্যক্তি গোলাকার সংখ্যার বদলে নির্ভুল সংখ্যাটির দিকে যায়, যে অংশটি কাজ করেনি তা স্বীকার করে, চিন্তার মাঝপথে সংশোধনের জন্য একটি বাক্য থামিয়ে দেয়, অথবা এমন একটি শব্দ বেছে নেয় যা সাধারণের চেয়ে সঠিক। ভাষা মডেলের দৃষ্টিকোণ থেকে, এই প্রতিটি পছন্দই নিম্ন-সম্ভাব্যতার টোকেন, ঠিক সেই ধরনের জিনিস যা ডিকোডিং এড়াতে নির্মিত।

এর কোনোটিই এই অর্থ দেয় না যে নির্দিষ্ট বা অস্বাভাবিক লেখা প্রতিটি চিহ্নিতকরণ থেকে নিরাপদ, অথবা সাবলীল, সঠিক লেখা ডিফল্টভাবে সন্দেহজনক। একটি পদ্ধতি-সংক্রান্ত অংশ, একটি আইনি ধারা, বা অত্যন্ত সম্পাদিত চূড়ান্ত খসড়া এমন কারণে সংকীর্ণ পরিসরে পড়তে পারে, যার সঙ্গে কোনো মডেলের সম্পর্ক নেই, আর সেই কারণেই একটি একক স্কোর হলো কোনো প্যাটার্নের বর্ণনা, এটি কে টাইপ করেছে সে সম্পর্কে কোনো রায় নয়।

আপনার নিজের খসড়া সেই পরিসরের কোথায় অবস্থান করছে তা দেখা অনুমান করার চেয়ে বেশি কার্যকর। TextPulse-এর free perplexity checker এবং burstiness checker শব্দ-স্তরের পূর্বানুমেয়তা এবং বাক্য থেকে বাক্যে ছন্দ আলাদাভাবে পরিমাপ করে, ফলে সমতল শব্দভান্ডার এবং পুনরাবৃত্ত বাক্যগঠন দুটি ভিন্ন সংকেত হিসেবে দেখা যায়, একটিমাত্র মিশ্র সংখ্যার বদলে।

এ থেকে দুটি আরও সংকীর্ণ পৃষ্ঠা পাওয়া যায়। Turnitin কীভাবে AI নির্দিষ্টভাবে শনাক্ত করে একটি, এবং এর similarity score এবং এর AI score এর মধ্যে পার্থক্য অন্যটি, কারণ এই দুটি প্রায়ই একে অপরের সঙ্গে গুলিয়ে ফেলা হয়।

দুটিই বৃহত্তর free tools collection এর অন্তর্ভুক্ত, তাদের জন্য যারা একটি মাত্র সংখ্যাকে অন্ধভাবে বিশ্বাস করার বদলে নিজেরাই ধরনটি দেখতে চান।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

কেন AI টেক্সট শনাক্ত হয়? কারণ এটি যে ডিকোডিং প্রক্রিয়ায় তৈরি হয়, তা প্রতিটি ধাপে সম্ভাব্য শব্দ এবং সম্ভাব্য বাক্যগঠনকে অগ্রাধিকার দেয়, ফলে লেখাটি ভাষার এমন এক সংকীর্ণ পরিসরে থাকে, যা সাধারণ মানব লেখার তুলনায় ছোট। একটি detector অর্থ না পড়ে এই সংকীর্ণতাই মাপে, তাই সাবলীল, সঠিক গদ্যেও এই ধরনটি দেখা যেতে পারে।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।