AI Detection

AI ডিটেক্টর কীভাবে কাজ করে? Perplexity, Burstiness এবং টোকেন সম্ভাবনা

AI ডিটেক্টর পাঠকের মতো করে যন্ত্রলিখন চিনতে পারে না। তারা দেখে আপনার লেখা কতটা পূর্বানুমানযোগ্য, তারপর সেটিকে একটি স্কোরে রূপ দেয়। এটি বোঝা গেলে, প্রযুক্তি এবং এর ব্যর্থতা, দুটিই বেশি অর্থবহ হয়ে ওঠে।

সর্বশেষ আপডেট করা হয়েছে 12 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

আপনার বিশ্ববিদ্যালয় AI detector ব্যবহার করে জমা দেওয়া কাজগুলো পরীক্ষা করা শুরু করেছে, এবং একটি রিপোর্টে এমন একটি সংখ্যা এসেছে, যা আপনি আশা করেননি। সেটি নিয়ে আপত্তি তোলার আগে, ওই সংখ্যার অর্থ কী, তা জানা উপকারী। AI detector কীভাবে কাজ করে? এটি যেভাবে একজন মানুষ যন্ত্রে লেখা পড়ে, সেভাবে পড়ে না। এটি মাপে আপনার লেখা একটি language model-এর কাছে কতটা পূর্বানুমেয়, তারপর সেই পূর্বানুমেয়তাকে একটি স্কোরে রূপান্তর করে। সেই প্রক্রিয়ার কোথাও আপনার বক্তব্য, আপনার যুক্তি, বা আপনি সত্যিই কাজটি লিখেছেন কি না, তা দেখা হয় না।

আমি বহু বছর ধরে এমন সরঞ্জাম তৈরি করেছি, যা পরিসংখ্যানগতভাবে লেখা বিশ্লেষণ করে আলাদা করে, এবং detection সম্পর্কে বোঝার জন্য সবচেয়ে উপকারী একক বিষয়টি হলো, এটি উৎসের নয়, সাধারণতার একটি পরিমাপ। একবার এটি পরিষ্কার হলে, প্রযুক্তি এবং তার ব্যর্থতা, দুটিই অনেক বেশি অর্থবহ মনে হয়।

একটি detector আসলে কী মাপছে

একটি detector জানে না কিছুই কে লিখেছে। তার কাছে আছে একটি language model এবং একটি scoring function। modelটি আপনার লেখা বাম থেকে ডানে পড়ে, এবং প্রতিটি পর্যায়ে এটি পরবর্তী কোন শব্দ আসা উচিত, তার একটি probability distribution তৈরি করে। আপনি যদি তাকে "the results of the" শব্দগুলো দেন, তাহলে এটি "study" কে সর্বোচ্চ স্থানে রাখবে, "experiment" কে কিছুটা নিচে, এবং "marmalade" কে প্রায় শূন্যের কাছাকাছি কোথাও রাখবে।

তাই detector আপনার নথিকে একটি প্রশ্ন করে, এই লেখা কতবার model যে শব্দ আশা করেছিল, সেটি বেছে নিয়েছে? যে লেখা বারবার উচ্চ probability-র শব্দে গিয়ে থামে, তা যন্ত্রে তৈরি বলে মনে হয়, কারণ text generator ঠিক সেটাই করে। modelটি তার নিজের distribution-এর শীর্ষ থেকে বারবার, হাজার হাজার token জুড়ে, sample করে।

এই কারণেই পুরো শ্রেণিটি marketing যা বলে, তার চেয়ে অনেক বেশি নড়বড়ে ভিত্তির ওপর দাঁড়িয়ে আছে। একটি detector কোনো watermark বা fingerprint খুঁজে বের করছে না। এটি শুধু লক্ষ্য করছে যে আপনার গদ্য পরিসংখ্যানগতভাবে অপ্রত্যাশিত নয়, এবং chatbot ছাড়াও এমন অপ্রত্যাশিত না হওয়া গদ্যের অনেক কারণ আছে।

Perplexity, modelটি কতটা বিস্মিত হয়

মূল পরিমাপকটিকে perplexity বলা হয়, যা শোনার চেয়ে সহজ। মডেলটি যে প্রতিটি শব্দ বাস্তবে উপস্থিত ছিল তার জন্য যে সম্ভাবনা নির্ধারণ করেছে তা নিন, সেই সম্ভাবনাগুলোর লগারিদমের গড় বের করুন, এবং ফলটিকে exponentiate করুন। এতে যে একক সংখ্যা পাওয়া যায়, তা আপনার নথি দেখে মডেলটি কতটা বিস্মিত হয়েছিল তা বর্ণনা করে। অনুমান করার বদলে আপনি নিজের খসড়ার perplexity পরীক্ষা করতে পারেন

কম perplexity মানে পাঠ্যটি সেই পথে গেছে, যেটি মডেল প্রত্যাশা করেছিল। বেশি perplexity মানে এটি এমন মোড় নিয়েছে, যা মডেল প্রত্যাশা করেনি। মানব রচনা সাধারণত বেশি থাকে, কারণ মানুষ অদ্ভুত নির্দিষ্ট বিশেষ্য, অস্বাভাবিক গঠন, এমন বাক্য বেছে নেয় যা অপ্রত্যাশিত জায়গা থেকে শুরু হয়। উৎপন্ন পাঠ্য সাধারণত কম থাকে, কারণ decoding প্রক্রিয়াটি ঠিক এই ধরনের পদক্ষেপ এড়ানোর জন্য নির্মিত।

methods section শুরু করার দুটি উপায় তুলনা করুন। "The results of the study were statistically significant" এমন একটি অনুক্রম, যা প্রায় যেকোনো model উচ্চ confidence সহ পূর্বানুমান করতে পারত, কারণ এতে কোনো অপ্রত্যাশিত তথ্য নেই। "Two of the three cohorts drifted before week six, which we had not planned for" অনেক কম পূর্বানুমেয়, কারণ এতে নির্দিষ্ট, অস্বস্তিকর তথ্য আছে, যা paper-এর বাকি অংশ থেকে অনুমান করা যেত না। দ্বিতীয়টি detector-এর কাছে বাস্তব বিস্ময়ের খরচ তৈরি করে, এবং সেই বিস্ময়ই human হিসেবে নিবন্ধিত হয়।

Burstiness: গড় নয়, বিচ্যুতি

শুধু perplexity যথেষ্ট নয়, কারণ একটি নথির গড় একটি সম্পূর্ণ যুক্তিসংগত সংখ্যায় পৌঁছাতে পারে, অথচ ভেতরে সন্দেহজনকভাবে সমানধর্মী থাকতে পারে। গুরুত্বপূর্ণ হলো আপনার পাঠ্যের মধ্যে পরিবর্তন, এবং burstiness সেটিই মাপে, অর্থাৎ লেখার অগ্রগতির সঙ্গে সঙ্গে বাক্যের দৈর্ঘ্য এবং বাক্যস্তরের perplexity কতটা ওঠানামা করে। একটি burstiness checker আপনাকে সেই বিস্তার সরাসরি দেখাবে।

আমরা আত্মবিশ্বাসী হলে গতি বাড়াই এবং সতর্কতা অবলম্বন করলে ধীরে চলি, এবং সেই ছন্দ গদ্যের মধ্যেও থেকে যায়। মানুষ খণ্ডে খণ্ডে লেখে। একটি অনুচ্ছেদ আট শব্দের একটি সংক্ষিপ্ত ঘোষণামূলক বাক্য দিয়ে শুরু হতে পারে, তারপর তিনটি clause এবং একটি parenthetical বহনকারী চৌত্রিশ শব্দের একটি বাক্যে পৌঁছাতে পারে, তারপর আবার সংক্ষিপ্ত কিছুর দিকে নেমে আসতে পারে।

মডেল আউটপুট এটি নির্ভরযোগ্যভাবে করে না। বাক্যগুলো গড় দৈর্ঘ্যের কাছাকাছি জটলা বাঁধে। অনুচ্ছেদগুলো পরিপাটি গুচ্ছে আসে। প্রতিটি অংশ নিজের শিরোনাম পুনরুক্তি করে শুরু হয়। এটি মসৃণভাবে পড়া যায় এবং খারাপ স্কোর করে, কারণ বাক্যগুলোর মধ্যে কম বৈচিত্র্য একটি ডিটেক্টরের কাছে সবচেয়ে শক্তিশালী সংকেতগুলোর একটি। এটি কোনো একক বাক্য নয় যা একে প্রকাশ করে। এটি একরূপতা।

সংকেতএটি কী পরিমাপ করেকেন যন্ত্র-উৎপাদিত পাঠ্য কম স্কোর করে
Perplexityআপনার শব্দ নির্বাচনে মডেল কতটা বিস্মিত হয়, পুরো নথি জুড়ে গড় করানকশাগতভাবে উচ্চ-সম্ভাব্যতার টোকেন থেকে ডিকোডিং নমুনা নেয়
Burstinessপাঠ্য জুড়ে বাক্যের দৈর্ঘ্য এবং পূর্বানুমেয়তা কতটা পরিবর্তিত হয়আউটপুট দোলার বদলে গড়ের কাছাকাছি জটলা বাঁধে
Token probabilityপ্রতি-শব্দ সম্ভাবনা, যেখান থেকে অন্য দুইটি গণনা করা হয়স্বতন্ত্রভাবে তেমন উল্লেখযোগ্য নয় এমন নির্বাচনের দীর্ঘ ধারাবাহিকতা

Token probability এবং স্কোর কোথা থেকে আসে

এই দুইটি সংখ্যাই তৃতীয় একটি সংখ্যা থেকে তৈরি হয়, সেটি হলো প্রতি-টোকেন log-likelihood, অর্থাৎ সেই কাঁচামাল যেখান থেকে বাকি সবকিছু গণনা করা হয়। কিছু টুল এটি সরাসরি দেখায়, আপনার পাঠ্যের যে অংশগুলো সবচেয়ে পূর্বানুমেয় ছিল সেগুলো হাইলাইট করে। ওই হাইলাইটগুলো নির্দিষ্ট বাক্য সম্পর্কে অভিযোগ নয়, ইন্টারফেস যা-ই ইঙ্গিত করুক না কেন। এগুলো সেই অংশ, যা একটি নথি-স্তরের সংখ্যায় সবচেয়ে বেশি অবদান রেখেছে।

গবেষণাভিত্তিক পদ্ধতিগুলো সরল threshold-এর সীমা অতিক্রম করেছে। DetectGPT এবং এর উত্তরসূরিরা curvature দেখে, তারা আপনার পাঠ্য সামান্য perturb করে এবং পরীক্ষা করে likelihood কি সেই pattern অনুযায়ী কমে, যা generated text সাধারণত দেখায়। অন্যরা একই অনুচ্ছেদকে দুইটি ভিন্ন model-এর অধীনে তুলনা করে এবং সেই disagreement-কে একটি সংকেত হিসেবে ব্যবহার করে।

একটি পরিণতি যে কারও মূল্যায়নের ক্ষেত্রে গুরুত্বপূর্ণ। যেহেতু মেট্রিকগুলো একটি নির্দিষ্ট রেফারেন্স মডেলের বিরুদ্ধে গণনা করা হয়, তাই একটি স্কোর সবসময় সেই মডেলের তুলনামূলক। দুটি ডিটেক্টর একই অনুচ্ছেদ পড়ে সম্পূর্ণ ভিন্ন মত দিতে পারে, এবং তাদের কোনোটিই বিকল নয়। তারা ভিন্ন রেফারেন্স পয়েন্ট ব্যবহার করে একই প্রশ্নের উত্তর দিচ্ছে।

দ্বিতীয় পরিণতিটি কমই উল্লেখ করা হয়। একটি মডেল কেবল তখনই কোনো অংশকে পূর্বানুমেয় হিসেবে শনাক্ত করতে পারে, যখন সেই অংশটি তার প্রশিক্ষণকৃত উপাদানের সঙ্গে সাদৃশ্যপূর্ণ হয়, তাই রেফারেন্স মডেল এবং যে কিছু পাঠ্যটি তৈরি করেছে তার মধ্যে ব্যবধান যত বাড়ে, শনাক্তকরণের মান তত অবনতি ঘটে। নতুনতর জেনারেটর, অস্বাভাবিক শাখা এবং English ছাড়া অন্যান্য ভাষা, সবই সেই ব্যবধান খুলে দেয়। এ কারণগুলোর একটি হলো, নিয়ন্ত্রিত বেঞ্চমার্কে মাপা নির্ভুলতা বাস্তব জমা দেওয়া কাজের স্তূপের সংস্পর্শে খুব কমই টিকে থাকে।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

AI পাঠ্য আদৌ কেন শনাক্ত হয়

একটি Language Model কীভাবে তার পরের শব্দ বেছে নেয়

নিজের মতো চলতে দিলে, একটি language model কেবল সম্ভাব্য পরবর্তী শব্দগুলোর সম্পূর্ণ ক্রমবদ্ধ তালিকা জানাত এবং অন্য কিছুকে নির্বাচন করতে দিত। বাস্তবে, একটি decoding strategy শব্দের পর শব্দ সেই নির্বাচন স্বয়ংক্রিয়ভাবে করে, এবং কোন strategy চালু আছে তা আউটপুটের চেহারা বদলে দেয়, এমনকি অন্তর্নিহিত model কখনও না বদলালেও।

Greedy decoding সবসময় একক সর্বাধিক সম্ভাব্য শব্দটি নির্বাচন করে। nucleus sampling-কে একটি সমাধান হিসেবে প্রবর্তন করা প্রবন্ধে, Ari Holtzman এবং সহলেখকেরা লক্ষ্য করেছিলেন যে এই strategy অনুসরণ করলে এমন পাঠ্য তৈরি হয় যা, তাদের নিজের কথায়, 'bland and strangely repetitive.' Beam search, যা একসঙ্গে কয়েকটি সম্ভাব্য ধারাবাহিকতা অনুসরণ করে এবং তারপর একটিতে স্থির হয়, একই সমস্যার অনুরূপ একটি রূপের মুখোমুখি হয়।

Sampling strategies কিছুটা randomness পুনরায় আনে, তবে নিয়ন্ত্রিত উপায়ে। Temperature নির্ধারণ করে, একটি শব্দ বাছাইয়ের আগে model তার নিজস্ব শীর্ষ পছন্দগুলোকে কতটা তীব্রভাবে অগ্রাধিকার দেবে। Nucleus sampling, যাকে কখনও top-p বলা হয়, distribution-কে এমন ক্ষুদ্রতম শব্দসমষ্টিতে সীমিত করে, য deren সম্মিলিত probability একটি threshold অতিক্রম করে, এবং কেবল সেই সেট থেকেই নির্বাচন করে, যা মূল প্রবন্ধে distribution-এর অবিশ্বস্ত tail-এর বদলে তার dynamic nucleus থেকে sampling হিসেবে বর্ণিত হয়েছে।

এই সেটিংগুলোর মধ্যে সবচেয়ে কম নির্ধারকগুলোও এখনও এমন একটি সংক্ষিপ্ত তালিকা থেকে বেছে নেয়, যা মডেল ইতিমধ্যে সম্ভাব্য বলে মনে করে এমন কিছুর চারপাশে গঠিত। মানব লেখা কখনও শব্দভান্ডারকে র‌্যাঙ্ক করে তার শীর্ষ থেকে বেছে নিয়ে তৈরি হয়নি, তাই এটি ক্রমাগত সেই সংক্ষিপ্ত তালিকার বাইরে চলে যায়। অর্থ কখনও কখনও সেই শব্দে বাস করে, যা তালিকায় কখনও ছিল না।

শব্দভান্ডারের সমতলতা: কম, বেশি নিরাপদ শব্দ

শব্দভান্ডারের সমতলতা একই অভ্যাসের শব্দ-স্তরের রূপ। একটি বাক্যের প্রতিটি পর্যায়ে, ডজনখানেক শব্দ যুক্তিসঙ্গতভাবে সেটিকে এগিয়ে নিতে পারে, কিন্তু মডেলের র‌্যাঙ্কিংয়ে কয়েকটি শব্দ বাকিগুলোর অনেক ওপরে থাকে, এবং ডিকোডিং বারবার সেই কয়েকটির দিকেই গিয়ে পড়ে। একটি নথির প্রতিটি বাক্যে এই নির্বাচন প্রয়োগ করলে, মানব লেখার অনুরূপ দৈর্ঘ্যের তুলনায় বাস্তবে ব্যবহৃত শব্দের পরিসর পরিমাপযোগ্যভাবে সংকুচিত হয়।

এই প্রভাব স্থির থাকে না, বরং একটির পর একটি যোগ হতে থাকে। প্রথম বাক্যে শীর্ষ-র‌্যাঙ্কের শব্দটি বেছে নেওয়া একটি মডেল দ্বিতীয় বাক্যে শীর্ষ-র‌্যাঙ্কের শব্দটিও সাধারণ হওয়ার মতো একটি প্রেক্ষাপট তৈরি করার সম্ভাবনা বেশি রাখে, কারণ সাধারণ শব্দ সাধারণ শব্দের পরেই আসতে প্রবণ। মানব লেখক এই প্রবাহকে ক্রমাগত ভেঙে দেন, নির্দিষ্ট প্রযুক্তিগত শব্দ, সামান্য অস্বাভাবিক ক্রিয়া, বা এমন শব্দ বেছে নেন যা প্রকৃত বস্তুকে নাম দেয়, তার নিরাপদ আনুমানিক রূপকে নয়। এই পার্থক্যটি উৎপন্ন সংস্করণে পরিমাপযোগ্যভাবে ছোট একটি কার্যকর শব্দভান্ডার হিসেবে দেখা যায়, এমনকি যখন উভয় সংস্করণ একই অন্তর্নিহিত তথ্য বর্ণনা করে।

এটি পুরো অনুচ্ছেদের একটি বৈশিষ্ট্য, কোনো একক শব্দ নির্বাচনের নয়। একটি নিরাপদ শব্দ কিছুই প্রমাণ করে না। কিন্তু একের পর এক বাক্যে একই স্তরের সাধারণ শব্দভান্ডারের দিকে হাত বাড়ানো এমন একটি পৃষ্ঠা, সেটিই শব্দ-স্তরের সংকেত হিসেবে একটি ডিটেক্টর আসলে শনাক্ত করতে নির্মিত।

বাক্যগঠনগত একরূপতা: একই রূপ, বারবার

বাক্যগঠনগত একরূপতা হলো বাক্য-স্তরের রূপ। এটি কোনো বাক্য কত দীর্ঘ, সে বিষয়ে নয়। এটি একটি অনুচ্ছেদ কতগুলো স্বতন্ত্র ব্যাকরণগত রূপ ব্যবহার করে, সে বিষয়ে: বাক্য কীভাবে শুরু হয়, উপবাক্যগুলো কীভাবে একে অপরের সঙ্গে যুক্ত হয়, একটি ধারণা থেকে পরের ধারণায় সংযোগ ঘটাতে রূপান্তরসূচক শব্দ কত ঘন ঘন কাজ করে। একটি মডেল যা পরিসংখ্যানগতভাবে সম্ভাব্য পরবর্তী গঠনটিই বারবার অনুমান করতে থাকে, তা অল্প কয়েকটি রূপের ঘূর্ণনে স্থির হয়ে যায় এবং সেটিই পুনরাবৃত্তি করে।

একটি অনুচ্ছেদ তার বাক্যের দৈর্ঘ্যে বৈচিত্র্য আনতে পারে, তবু যদি প্রতিটি বাক্য একই subject-verb-complement কাঠামো অনুসরণ করে, একই ধরনের transition দিয়ে শুরু করে, বা একইভাবে শেষ হয়, তবে তা syntactically flat হিসেবেই পড়তে পারে। পূর্বানুমানযোগ্যতা থাকে pattern-এ, word count-এ নয়, এবং এই পার্থক্যটি burstiness আসলে কী মাপে শীর্ষক নির্দেশিকায় আরও বিস্তারিতভাবে আলোচনা করা হয়েছে।

কী সংকুচিত করেdecoding-optimized text সাধারণত কী করেমানব লেখন সাধারণত কী করে
শব্দ নির্বাচনপ্রতিটি ধাপে সবচেয়ে সম্ভাব্য সাধারণ শব্দটি বেছে নেয়নির্দিষ্ট বা তুলনামূলকভাবে কম প্রচলিত সেই শব্দটির দিকে যায়, যা প্রকৃত বস্তুকে নাম দেয়
বাক্য-প্রারম্ভনিরাপদ transitional opening-এর একটি ছোট ঘূর্ণন বারবার ব্যবহার করেএকটি বাক্য কীভাবে শুরু হয় তা বৈচিত্র্যপূর্ণ করে, এমন opening-ও অন্তর্ভুক্ত করে যাকে একটি model তুলনামূলকভাবে কম সম্ভাব্য বলে rank করত
উপবাক্য কাঠামোএকটি অনুচ্ছেদ জুড়ে এক বা দুইটি পছন্দের ব্যাকরণিক কাঠামো পুনরাবৃত্তি করেএকটি বাক্যের প্রয়োজন অনুযায়ী সরল ও জটিল কাঠামো মিশিয়ে দেয়

যে পছন্দগুলো কেবল একজন মানুষই সাধারণত করে

একটি সংকীর্ণ পরিসরের উল্টো দিক হলো, তার বাইরে যা পড়ে। বাস্তব ঘটনা বর্ণনা করা একজন ব্যক্তি গোলাকার সংখ্যার বদলে নির্দিষ্ট সংখ্যাটিই বেছে নেন, যে অংশটি কাজ করেনি তা স্বীকার করেন, মাঝপথে চিন্তা সংশোধন করতে বাক্য থামিয়ে দেন, অথবা এমন একটি শব্দ নেন যা সঠিক, যদিও তা সাধারণ নয়। ভাষা model-এর দৃষ্টিকোণ থেকে, এই প্রতিটি পছন্দই একটি low-probability token, ঠিক সেই ধরনের জিনিস যা decoding এড়িয়ে চলার জন্য তৈরি করা হয়েছে।

এর কোনোটিই এই অর্থ দেয় না যে নির্দিষ্ট বা অস্বাভাবিক লেখা প্রতিটি flag থেকে নিরাপদ, অথবা সাবলীল, সঠিক লেখা ডিফল্টভাবে সন্দেহজনক। একটি methods section, একটি legal clause, বা অত্যন্ত সম্পাদিত চূড়ান্ত draft এমন কারণে একটি সংকীর্ণ পরিসরে পড়তে পারে, যার সঙ্গে model-এর কোনো সম্পর্ক নেই, এবং এই কারণেই একটি একক score হলো pattern-এর বর্ণনা, কে এটি টাইপ করেছে সে বিষয়ে কোনো verdict নয়।

আপনার নিজের খসড়া সেই পরিসরের কোথায় পড়ে, তা অনুমান করার চেয়ে জানা বেশি উপযোগী। TextPulse-এর free perplexity checker এবং burstiness checker শব্দ-স্তরের পূর্বানুমেয়তা এবং বাক্য থেকে বাক্যে ছন্দকে আলাদাভাবে মাপে, ফলে একটি সমতল শব্দভান্ডার এবং পুনরাবৃত্ত বাক্যগঠন একটিমাত্র মিশ্র সংখ্যার বদলে দুটি পৃথক সংকেত হিসেবে দেখা যায়।

এ থেকে দুটি আরও নির্দিষ্ট পৃষ্ঠা অনুসরণ করে। How Turnitin detects AI specifically একটি, এবং এর similarity score এবং AI score-এর মধ্যে পার্থক্য অন্যটি, কারণ এই দুটিকে নিয়মিতভাবে একে অপরের সঙ্গে গুলিয়ে ফেলা হয়।

উভয়ই বৃহত্তর free tools collection-এর অংশ, তাদের জন্য যারা কেবল একটি সংখ্যার ওপর অন্ধভাবে নির্ভর না করে নিজে থেকেই ধরনটি দেখতে চান।

ওয়েবের কতটা অংশ এখন AI-generated?

বিভিন্ন পরিমাপে, এখন অনলাইনে machine-produced text, human-written text-এর চেয়ে বেশি। Amazon Web Services-এর একটি দল ওয়েব থেকে 6.4 billion sentences বিশ্লেষণ করে দেখেছে যে 57.1% existed as machine translations তিন বা তার বেশি ভাষাজুড়ে, যার অনেকটাই নিম্নমানের। SEO firm Graphite-এর 2025 সালের একটি বিশ্লেষণে দেখা গেছে, সদ্য প্রকাশিত web articles-এর অর্ধেকের সামান্য বেশি AI generated ছিল। Wikipedia-ও এর বাইরে নয়: August 2024-এ তৈরি pages-এর Princeton study-তে around one in twenty new English articles-কে উল্লেখযোগ্যভাবে AI-generated হিসেবে মাপা হয়েছে।

এই অংশ বাড়ছে, কারণ model output-এর খরচ human writing-এর তুলনায় orders of magnitude কম, এবং প্রতিটি commercial incentive একই দিকে ইঙ্গিত করে। এখন পুরো platform human writers ছাড়াই চলছে: Chirper একটি social network, যা সম্পূর্ণভাবে AI accounts দ্বারা পূর্ণ, যেখানে humans কেবল দেখতে পারেন, এবং SocialAI এমন একটি feed বিক্রি করে, যেখানে আপনার প্রতি প্রতিটি reply-ই একটি bot। Forum, review section এবং comment thread-এ ছোট পরিসরে একই pattern দেখা যায়।

সনাক্তকরণের ক্ষেত্রে এটি base rate পরিবর্তন করে। 2023 সালে যেকোনো web text পড়া একটি classifier ধরে নিতে পারত যে তার বেশির ভাগই human-written; 2026 সালে একটি classifier তা পারে না। এটি models-গুলোর মধ্যেও প্রতিক্রিয়া সৃষ্টি করে, কারণ প্রতিটি নতুন generation এমন একটি web-এর ওপর train করে, যেখানে তার পূর্বসূরিরা আগেই লিখে রেখেছিল, আর এটাই একটি কারণ যে detectors যে vocabulary habits-এর ওপর key করে সেগুলো fade না হয়ে spread করে।

আপনার নিজের লেখার ক্ষেত্রে এর ফল স্পষ্ট: human-written prose এখন minority class হয়ে যাচ্ছে, এবং markers, editors ও readers তা জানে। Raised suspicion এখন default, আর ঠিক এই কারণেই একটি detector কী measure করতে পারে আর কী পারে না, তা বোঝা উপকারী।

Commercial detectors উপরে কী যোগ করে

প্রতিষ্ঠানগুলো বাস্তবে যে tools কেনে, সেগুলো textbook perplexity চালায় না। Turnitin, GPTZero, Originality এবং বাকিরা human ও machine text-এর বড় labelled set-এর ওপর supervised classifiers train করে, statistical features-এর পাশাপাশি stylistic ones ব্যবহার করে। classifier যা শেখে, তা হলো তার training data-তে এই দুই pile-কে যা আলাদা করে, আর এটি সাধারণভাবে "AI writing" থেকে বেশি সংকীর্ণ এবং বেশি historical একটি বিষয়।

Training dependency হলো নীরব সমস্যা। প্রধানত model output-এর একটি generation-এর ওপর train করা একটি classifier-কে newer models, unfamiliar disciplines, এবং এমন writers-এর ক্ষেত্রে generalize করতে হয় যাদের English তার training distribution-এর সঙ্গে মেলে না। Vendors নিজেদের evaluations থেকে accuracy figures প্রকাশ করে, এবং independent benchmarks একই tools-এর ক্ষেত্রে নিয়মিতভাবে সেই numbers-এর অনেক নিচে নেমে আসে।

একটি score অতিরিক্ত না পড়ে কীভাবে পড়তে হয়

একটি detector report সাধারণত একটি percentage হিসেবে আসে, এবং সেই percentage প্রায়ই ভুলভাবে পড়া হয়। এটি আপনার document-এর machine-written অংশের proportion নয়। tool অনুযায়ী এটি classifier confidence হতে পারে, অথবা কিছু internal threshold অতিক্রম করা sentences-এর share হতে পারে, আর vendors প্রায়ই কোনটি তা নিয়ে অস্পষ্ট থাকে। একই সঙ্গে sixty percent দেখানো দুটি report-এর অর্থ খুব ভিন্ন হতে পারে।

এটিও জানা মূল্যবান যে কোন কোন কারণে একটি স্কোর বদলে যায়, যার লেখকের পরিচয়ের সঙ্গে কোনো সম্পর্ক নেই। ছোট নথি বেশি শব্দযুক্ত, কারণ গড় মান স্থির হওয়ার জন্য সেখানে কম পাঠ্য থাকে, এবং 500 শব্দের একটি প্রবন্ধ দুই বা তিনটি অস্বাভাবিক বাক্যের জোরে অনেকটা ওঠানামা করতে পারে। উদ্ধৃত উপাদানও গণনায় ধরা হয়, যদি না টুলটি তা বাদ দেয়, তাই block quotes-এ ভরা একটি literature review তার উদ্ধৃত যেকোনো কিছুর পূর্বানুমেয়তা উত্তরাধিকারসূত্রে পায়। মানক পরিভাষায় ভরা একটি প্রযুক্তিগত অনুচ্ছেদও একইভাবে আচরণ করে।

যদি আপনার কাছে একটি flag আসে, তবে কার্যকর প্রতিক্রিয়া হলো মেট্রিক নিয়ে তর্ক নয়, প্রমাণ। version history, drafts, notes এবং search records সবই প্রক্রিয়ার কথা বলে, আর প্রক্রিয়াই হলো এমন কিছু যা একটি misconduct panel বাস্তবে মূল্যায়ন করতে পারে। কেউ এমন কোনো threshold দেখাতে পারে না যা একজন সতর্ক লেখককে একটি model থেকে পৃথক করে।

কেন detectors এমন লেখা flag করে যা কোনো model তৈরি করেনি

False positives কোনো বিরল ত্রুটি নয়। এগুলো typicality মাপার সরাসরি ফল। যে কোনো লেখা যদি সত্যিই পূর্বানুমেয় হয়, তবে তা পূর্বানুমেয় হিসেবেই স্কোর করবে, তা কে তৈরি করেছে তা নির্বিশেষে।

Non-native English writers সবচেয়ে বেশি প্রভাবিত হন। Stanford-এর গবেষকেরা দেখেছেন যে detectors non-native বক্তাদের বহু প্রবন্ধকে machine-generated হিসেবে ভুল শ্রেণিবদ্ধ করেছে, অথচ native-speaker প্রবন্ধগুলোকে সঠিকভাবে শ্রেণিবদ্ধ করেছে। কারণটি যান্ত্রিক, বিদ্বেষপূর্ণ নয়, দ্বিতীয় ভাষায় কাজ করা লেখকেরা সাধারণত বহুল ব্যবহৃত গঠন এবং তুলনামূলকভাবে প্রচলিত শব্দভান্ডারের ওপর নির্ভর করেন। এটিই low perplexity-এর সঠিক প্রোফাইল, আর সে কারণেই ESL writers get flagged for writing carefully.

Academic conventions একই সমস্যা সৃষ্টি করে। একটি methods section-এর সূত্রবদ্ধ হওয়াই প্রত্যাশিত। Legal writing, technical documentation এবং clinical reporting, সবই উদ্ভাবনী বাক্যগঠনের চেয়ে মানক phrasing-কে বেশি পুরস্কৃত করে। অতিরিক্ত সম্পাদনা এটিকে আরও বাড়িয়ে তোলে, কারণ একটি draft পরিমার্জন করার অর্থ সাধারণত সেই অনিয়মগুলো সরিয়ে ফেলা, যেগুলো আপনার statistical signature বহন করছিল।

প্রতিষ্ঠানগুলো বিষয়টি লক্ষ্য করেছে। Vanderbilt Turnitin-এর AI detection feature নিষ্ক্রিয় করেছে, এমন স্কোরের ওপর নির্ভর না করে যেগুলো তারা যাচাই করতে পারেনি, এবং অন্য বিশ্ববিদ্যালয়গুলো misconduct proceedings-এ এই সংখ্যাগুলো কীভাবে ব্যবহার করা যাবে তা সীমিত করেছে। detector score-কে একটি দুর্বল প্রমাণ হিসেবে দেখুন, verdict হিসেবে নয়।

এটি আপনার নিজের লেখার জন্য কী অর্থ বহন করে

mechanics থেকে যে ব্যবহারিক পরামর্শ পাওয়া যায়, তা অদ্ভুত কিছু নয়, এবং এর কোনোটিই কিছু নিয়ে gaming করার সঙ্গে সম্পর্কিত নয়। ইচ্ছাকৃতভাবে আপনার sentence length পরিবর্তন করুন, কারণ uniformity-ই registers করে। নির্দিষ্ট বিবরণ ধরে রাখুন, প্রকৃত figure, প্রকৃত limitation, week six-এ কী ভুল হয়েছিল। সাধারণ competence-ই machine-made হিসেবে scores করে, আর specificity একই সঙ্গে ভালো লেখা এবং আরও শক্তিশালী signal।

আপনার নিজের idiom-ও বজায় রাখুন। যদি আপনার কথা বলার বা লেখার নিজস্ব ভঙ্গি থাকে, তা রেখে দিন। কোনো draft-কে এমনভাবে ঘষেমেজে মসৃণ করে তোলার প্রবণতা, যাতে তা ক্ষেত্রের অন্য সব paper-এর মতো শোনায়, সেই প্রবণতাই আপনার perplexity কমায়।

এড়িয়ে চলার মতো একটি বিষয় আছে, কিছু tool ইচ্ছাকৃতভাবে grammatical errors ঢুকিয়ে perplexity বাড়ায়। metric-এর ক্ষেত্রে এটি কাজ করে, কিন্তু graded বা peer-reviewed যেকোনো কিছুর জন্য এটি খুবই খারাপ ধারণা, কারণ এতে আপনি একটি suspicion-এর বদলে একটি certainty বিনিময় করছেন। লক্ষ্য হলো এমন লেখা যা আপনার লেখা বলে পড়ে, এমন লেখা নয় যা ইচ্ছাকৃতভাবে ক্ষতিগ্রস্ত করা হয়েছে। এটিই rewriting for a human reader এবং scorer-কে ফাঁকি দিতে text ভেঙে ফেলার মধ্যে পুরো পার্থক্য।

আপনি যদি black box-এর কথায় ভরসা না করে নিজের draft-এর জন্য এই সংখ্যাগুলো দেখতে চান, তাহলে underlying measurements গোপন নয়। free text analysis tools আপনাকে দেখাবে আপনার prose কোথায় অবস্থান করছে, এবং flat stretches-গুলো ঠিক করার মতো stylistic problem কি না, তা আপনি নিজেই সিদ্ধান্ত নিতে পারবেন।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

হ্যাঁ, এবং তা প্রত্যাশিতই। ডিটেক্টর দেখে পাঠ্যটি পরিসংখ্যানগতভাবে কতটা পূর্বানুমানযোগ্য, কে লিখেছে তা নয়, তাই যেকোনো সত্যিকারের সূত্রবদ্ধ লেখা যন্ত্রনির্মিত হিসেবে স্কোর পায়। স্বাধীন বেঞ্চমার্কগুলো ধারাবাহিকভাবে বিক্রেতাদের দাবির চেয়ে কম নির্ভুলতা দেখায়, এবং কয়েকটি বিশ্ববিদ্যালয় স্কোর কীভাবে ব্যবহার করা যাবে তা সীমিত করেছে।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।