AI Detection

বার্স্টিনেস কী? কেন সমানধর্মী বাক্যগুলো চিহ্নিত হয়

বার্স্টিনেস একটি অনুচ্ছেদ জুড়ে বাক্যের দৈর্ঘ্য কতটা বিস্তৃতভাবে ওঠানামা করে তা পরিমাপ করে, গড় বাক্য কতটা দীর্ঘ হয় তা নয়। এই পোস্টে ব্যাখ্যা করা হয়েছে, শব্দটির উৎস কোথায়, বিস্তারটি আসলে কীভাবে গণনা করা হয়, এবং কেন একটি language model-এর আউটপুট সাধারণত দৈর্ঘ্যের একটি সংকীর্ণ পরিসরে স্থির হয়ে যায়।

6 min
What is burstiness? A chart comparing uniform AI-generated sentence lengths to varied human sentence lengths.

একটি অনুচ্ছেদ উচ্চস্বরে পড়লে এক ধরনের সমতলতা আগে শোনা যায়, পরে তার নামকরণ করা যায়: প্রতিটি বাক্য প্রায় একই সংখ্যক শ্বাসে শেষ হয়, যেন এমন একটি মেট্রোনোম, যেটি বন্ধ করতে কেউ ভুলে গেছে। পাঠকেরা কী ভুল তা বলতে পারার আগেই এই ধরনটি লক্ষ করেন, এবং উৎপন্ন পাঠ শনাক্ত করার জন্য নির্মিত ডিটেক্টরগুলিও এটি লক্ষ্য করার জন্যই নকশা করা হয়েছিল। এই ধরনের ধরনটির নাম burstiness, যা কোনো AI detector-এর চেয়েও পুরোনো একটি শব্দ।

তাহলে burstiness কী, detector যে নির্দিষ্ট অর্থে শব্দটি ব্যবহার করে? এটি একটি পরিমাপ, যা দেখে বোঝা যায় একটি অংশজুড়ে বাক্যের দৈর্ঘ্য কতটা বিস্তৃতভাবে ওঠানামা করে, এবং এটি কোনো স্থির সংখ্যার সঙ্গে তুলনা না করে সেই অংশের নিজস্ব গড়ের সাপেক্ষে গণনা করা হয়। একটি অনুচ্ছেদ bursty হয় যখন ছোট, সংক্ষিপ্ত বাক্যের পাশে দীর্ঘ, বাঁকানো বাক্য থাকে। একটি অনুচ্ছেদে burstiness কম হয় যখন প্রতিটি বাক্য প্রায় একই দৈর্ঘ্যের কাছাকাছি এসে পড়ে, সেই দৈর্ঘ্য ছয়টি শব্দ হোক বা 26টি।

এই পরিসংখ্যানটি ছোট একটি অনুচ্ছেদে হাতে গণনা করার জন্য যথেষ্ট সরল, এবং একবার এটি দৃশ্যমান হলে, সমতল একটি পৃষ্ঠা আর অস্পষ্ট ধারণা থাকে না, বরং এমন একটি সংখ্যা হয়ে ওঠে, যেটি নির্দিষ্ট করে দেখানো যায়। এর সঙ্গে আরও একটি পুরোনো, সম্পর্কহীন পরিসংখ্যানের প্রায় কোনো সম্পর্কই নেই, যদিও কাকতালীয়ভাবে তার নামও একই।

burstiness কী?

একটি AI detector-কে bursty বলা হয় যদি একটি নথিজুড়ে বাক্যের দৈর্ঘ্যে পরিবর্তনশীলতা থাকে। AI detector যে অর্থে burstiness শব্দটি ব্যবহার করে, তা হলো একটি নথিজুড়ে বাক্যের দৈর্ঘ্যের বিস্তার, যা একটি একক সংখ্যা হিসেবে প্রকাশ করা হয়, সেই দৈর্ঘ্যগুলোর standard deviation কে তাদের mean দিয়ে ভাগ করে। একটি উচ্চ সংখ্যা মানে বাক্যগুলো গড়ের চারপাশে ব্যাপকভাবে ভিন্ন হয়। একটি নিম্ন সংখ্যা মানে, সেই গড় যা-ই হোক না কেন, বাক্যগুলো তার চারপাশে ঘনভাবে জমা হয়।

শব্দটি নিজেই অনেক পুরোনো একটি পরিসংখ্যানগত শব্দভাণ্ডারের অন্তর্ভুক্ত। গবেষকেরা burstiness ব্যবহার করেন ভূমিকম্প, রোগের প্রাদুর্ভাব এবং নেটওয়ার্ক ট্র্যাফিক বর্ণনা করতে, অর্থাৎ এমন যেকোনো কিছু যা সমানভাবে ছড়িয়ে না পড়ে সময়ের মধ্যে গুচ্ছাকারে জমা হয়, এবং এই ক্ষেত্রগুলোতে এটি মাপার একটি প্রচলিত উপায় হলো Fano factor, যা কোনো গণনার variance এবং mean-এর অনুপাত।

প্রাকৃতিক ভাষা প্রক্রিয়াকরণের মধ্যেও একটি দ্বিতীয়, পুরোনো অর্থ আছে, যা এই পোস্টে আলোচিত বাক্যদৈর্ঘ্য পরিসংখ্যানের সঙ্গে গুলিয়ে ফেলা সহজ। 1990-এর দশকে কর্পাস ভাষাবিদরা burstiness ব্যবহার করতেন পৃথক শব্দ কীভাবে গুচ্ছবদ্ধ হয় তা বর্ণনা করতে: কোনো নথিতে একটি অপ্রচলিত শব্দ একবার উল্লেখ হলে, প্রথম, স্বতন্ত্র উপস্থিতি যা ইঙ্গিত করত তার চেয়ে সেটি আবার উল্লেখ হওয়ার সম্ভাবনা অনেক বেশি হয়ে যায়। Kenneth Church এবং William Gale 1995 সালে Poisson mixtures-এ এই ধরণটির পরিসংখ্যানগত বিশ্লেষণ দেন, এবং তথ্য পুনরুদ্ধার ব্যবস্থা এখনও পুনরাবৃত্ত শব্দের ওজন নির্ধারণের সময় এটি অনুযায়ী সমন্বয় করে। সেই পরিসংখ্যান একটি শব্দের পুনরাবৃত্তি অনুসরণ করে। এই পোস্টে যে পরিমাপটি আলোচিত হয়েছে, তা অন্য কিছু অনুসরণ করে, সম্পূর্ণ বাক্যের আকৃতি, কোন শব্দগুলো সেগুলো পূরণ করছে তার থেকে স্বাধীনভাবে।

এই পোস্টের বাকি অংশে শব্দটি কেবল সেই দ্বিতীয় অর্থেই ব্যবহৃত হয়েছে, বাক্যের আকৃতি, শব্দের পুনরাবৃত্তি নয়।

গড়ের চেয়ে বিস্তার কেন বেশি গুরুত্বপূর্ণ

দুটি নথির গড় বাক্যদৈর্ঘ্য একেবারে একই হতে পারে, অথচ পড়তে একেবারেই একরকম নাও লাগতে পারে। 12 শব্দের একটি গড় এমন একটি অনুচ্ছেদের হতে পারে যেখানে প্রতিটি বাক্য প্রায় 12 শব্দের কাছাকাছি, অথবা এমন একটির হতে পারে যেখানে 6 শব্দের বাক্য 18 শব্দের বাক্যের সঙ্গে পালাক্রমে আসে, এবং গড় এই দুই অনুচ্ছেদের মধ্যে পার্থক্য করতে পারে না। কেবল গড়ের চারপাশের বিস্তারই তা করতে পারে।

পরিসংখ্যানবিদরা গড়-নির্ভর এই তুলনাকে বণ্টনের প্রথম মুহূর্তের বাইরে না দেখার ব্যর্থতা বলতেন। একটি শনাক্তকারী, বা একজন সতর্ক পাঠক, পরোক্ষভাবে দ্বিতীয় মুহূর্তটিও পরীক্ষা করছে, কেন্দ্রের চারপাশের আকৃতি, যা কেবল গড় কখনও প্রকাশ করতে পারে না।

একই ফলাফল জানানোর দুটি উপায় বিবেচনা করুন। 'The intervention reduced symptoms in most participants. The effect was consistent across age groups. The finding supports further investigation into the mechanism.' তিনটি বাক্য, প্রতিটিতে 8 থেকে 9টি শব্দ, এমন একটি ছন্দ যার বিস্তার প্রায় নেই বললেই চলে। এখন তুলনা করুন: 'Symptoms dropped in most participants. That held up whether the person was twenty-two or sixty-eight, which nobody on the team expected going in, and it is the reason the next study needs to look at mechanism rather than outcome alone.' দাবি একই। কিন্তু যে ছন্দ সেটিকে বহন করছে, তা নয়।

গড় উভয় অনুচ্ছেদকে অভিন্ন বলে ধরে। একজন পাঠক, এবং দৃশ্যত একটি শনাক্তকারীও, তা ধরে না।

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

বিস্ফোরণমাত্রা কীভাবে গণনা করা হয়

গণনাটি সংক্ষিপ্ত। প্রতিটি বাক্যে শব্দের সংখ্যা গণনা করুন, সেই তালিকার মানক বিচ্যুতি নিন, তারপর গড় দিয়ে ভাগ করুন। উদাহরণস্বরূপ, যদি আপনি এমন একটি অংশ দেখেন যেখানে বাক্যগুলির দৈর্ঘ্য আট, একত্রিশ, এগারো, চব্বিশ এবং নয়টি শব্দ, তাহলে আপনি গড়ের প্রায় ছাপ্পান্ন শতাংশ বিস্তার পাবেন, একটি প্রশস্ত বিস্ফোরণ। যদি আপনি এমন একটি অংশ দেখেন যেখানে বাক্যগুলির দৈর্ঘ্য পনেরো, ষোলো, চৌদ্দ, সতেরো এবং পনেরো শব্দ, তাহলে আপনি প্রায় সাত শতাংশ বিস্তার পাবেন, যদিও দুই অংশের গড় দৈর্ঘ্য প্রায় একই।

শুধু কাঁচা মানক বিচ্যুতি একই কাজ করত না। বারো শব্দ প্রতি বাক্য গড়ের একটি অংশে আট শব্দের বিস্তার, চল্লিশ শব্দ গড়ের একটি অংশে আট শব্দের বিস্তারের থেকে ভিন্ন কিছু বোঝায়, তাই গড় দিয়ে ভাগ করাই সংখ্যাটিকে এক অংশ থেকে আরেক অংশে তুলনাযোগ্য করে।

এই আপেক্ষিক কাঠামোই কারণ যে পরিসংখ্যানটি সংক্ষিপ্ত সংবাদশৈলী এবং ঘন তাত্ত্বিক শৈলীতে একইভাবে কাজ করে। ছোট, সমান বাক্য দিয়ে গঠিত একটি প্রযুক্তিগত অংশ এবং ছোট, সমান বাক্য দিয়ে গঠিত একটি অনানুষ্ঠানিক অনুচ্ছেদ, উভয়ই নিম্ন বিস্ফোরণমাত্রা হিসেবে চিহ্নিত হতে পারে, কারণ পরিমাপটি কখনও জিজ্ঞাসা করে না একটি বাক্য পরম অর্থে কত দীর্ঘ, কেবল প্রতিটি বাক্য তার প্রতিবেশীদের গড় থেকে কত দূরে অবস্থান করে।

এই সাইটের free burstiness checker একটি পেস্ট করা খসড়ার ওপর যে একই গণনা চালায়, তা-ই এখানে প্রয়োগ করা হয়, পুরো অংশটিকে একটিমাত্র মানে সংকুচিত না করে প্রতিটি বাক্যকে একটি বিন্দু হিসেবে চিত্রিত করে। সেই স্কেলে, প্রায় বিশ শতাংশের নিচে যেকোনো কিছু ঘন, সমান বিস্তার হিসেবে পড়ে, এবং প্রায় পঁয়তাল্লিশ শতাংশের উপরে যেকোনো কিছু প্রশস্ত হিসেবে পড়ে, আর অধিকাংশ সম্পাদিত একাডেমিক গদ্য এর মাঝামাঝি কোথাও অবস্থান করে।

পাতায় নিম্ন-বিচ্যুতি অনুচ্ছেদ কেমন দেখায়

দুটি ধরনকে পাশাপাশি রাখলে, কী খুঁজতে হবে তা জানলে তাদের আলাদা করা সহজ।

বৈশিষ্ট্যকম-বৈচিত্র্যপূর্ণ অনুচ্ছেদউচ্চ-বৈচিত্র্যপূর্ণ অনুচ্ছেদ
বাক্যের দৈর্ঘ্যের ধরনপ্রায় প্রতিটি বাক্যই অনুচ্ছেদের গড় দৈর্ঘ্য থেকে মাত্র কয়েকটি শব্দের মধ্যে থাকেছোট, খণ্ডিত বাক্যের পাশে দীর্ঘ, বহু-উপবাক্যযুক্ত বাক্য থাকে
উচ্চস্বরে পড়লেএকটি স্থির, সমান গতি, জোর দেওয়ার জন্য স্বাভাবিক কোনো বিরতির জায়গা নেইএকটি ছন্দ, যা দ্রুত হয় এবং ধীর হয়, যেখানে প্রকৃত জোর পড়ে তা অনুসরণ করে
সাধারণ কারণএকটি মডেল থেকে সম্পাদনাহীন আউটপুট, যা একবারে একটি সম্ভাব্য পরবর্তী বাক্য অনুমান করছে, অথবা এমন একটি প্রথম খসড়া, যা কেউ উচ্চস্বরে পড়ে দেখেনিপ্রভাবের জন্য কোনো বাক্য ইচ্ছাকৃতভাবে ছোট করে কাটা, অথবা দুটি পাতলা বাক্যকে একটিতে গেঁথে দেওয়া, যাতে তার দৈর্ঘ্য ন্যায্য হয়

কোনো কলামই স্বভাবতই ভালো লেখা নয়। পাঁচটি ধাপকে পাঁচটি ছোট বাক্যে তালিকাভুক্ত করা একটি পদ্ধতি-সংক্রান্ত অংশের ক্ষেত্রে বাম কলামের মতো দেখানোই স্বাভাবিক, এবং একটি দীর্ঘ, বাঁকানো বাক্যকে নম্বরযুক্ত প্রক্রিয়ার মধ্যে ঢুকিয়ে দিলে তা উন্নত হবে না। কোনো অনুচ্ছেদ কী ধরনের অংশ তা জানা গেলে তবেই এই ধরনটি তথ্যবহুল হয়ে ওঠে।

কেন একরূপ বাক্যগুলো চিহ্নিত হয়

ডিটেক্টররা সমতল ছন্দকে একটি সংকেত হিসেবে বিবেচনা করে, কারণ পাঠ্য সৃষ্টির কাজটি যেভাবে হয়, তার জন্য, একরূপ বাক্যগুলো নিজে থেকে স্বভাবতই সন্দেহজনক বলে নয়। AI detectors আসলে কীভাবে কাজ করে তার বিস্তৃত প্রক্রিয়া আলাদাভাবে আলোচনা করা হয়েছে, সংক্ষিপ্ত রূপটি হলো, একটি মডেল একবারে একটি টোকেন অনুমান করে, এর মধ্যে, পরোক্ষভাবে, একটি বাক্য কখন শেষ হওয়ার সম্ভাবনা বেশি তাও অন্তর্ভুক্ত থাকে। এখন পর্যন্ত যে পাঠ্য আছে, তার ভিত্তিতে যেকোনো নির্দিষ্ট মুহূর্তে কিছু বাক্যের দৈর্ঘ্য অন্যগুলোর তুলনায় পরিসংখ্যানগতভাবে বেশি সম্ভাব্য, এবং যে মডেল সবচেয়ে সম্ভাব্য ধারাবাহিকতাই বেছে নিতে থাকে, সেটি পুরো নথিজুড়ে বাক্য-পর-বাক্য প্রায় সেই একই সম্ভাব্য দৈর্ঘ্যের কাছাকাছি পৌঁছাতে থাকে।

একটি একক সমতল অনুচ্ছেদ নিজে থেকে কিছুই প্রমাণ করে না, সংক্ষিপ্ত প্রক্রিয়াগত অংশগুলো এমন দেখানোরই কথা। একটি ডিটেক্টর আসলে যা মূল্যায়ন করছে, তা হলো পুরো নথিজুড়ে থাকা ধরন, একটি অনুচ্ছেদের সমতলতা স্থানীয়, উদ্দেশ্যপূর্ণ পছন্দ কি না, নাকি পুরো লেখাজুড়ে প্রতিটি অনুচ্ছেদের ছন্দই সেই একই।

শব্দে শব্দে পূর্বানুমেয়তা একটি সম্পর্কিত কিন্তু পৃথক পরিমাপ, যা এই সাইটের অন্যত্র নিজস্ব প্রেক্ষিতে আলোচিত হয়েছে, এবং এটি বাক্যের বিন্যাসের বদলে পৃথক শব্দ নির্বাচনের দিকে নজর দেয়।

এর কোনোটিই প্রমাণ করে না যে কোনো নথি একটি মডেল দ্বারা তৈরি হয়েছে, এবং একটি সমতল ছন্দকে নিজে থেকেই নির্ণায়ক বলে ধরা হলে তা হবে একক perplexity সংখ্যাকে নির্ণায়ক বলে ধরার একই ভুলের পুনরাবৃত্তি। কেউ যদি তাড়াহুড়ো করে এমন একটি প্রথম খসড়া লেখে যা কেউ উচ্চস্বরে পড়ে শোনায়নি, সেটিও generated text-এর মতোই সহজে সমতল হয়ে যেতে পারে। এ কারণেই TextPulse-এর নিজস্ব আনুমানিক Human Score বাক্য-স্তরের বৈচিত্র্যকে আরও কয়েকটি সংকেতের সঙ্গে একত্র করে, এবং কোনো একটির ওপর নির্ভর করে না, আর এই সাইটের free diagnostic tools গুলি এমনভাবে তৈরি যে সেগুলি আলাদাভাবে নয়, একসঙ্গে পড়তে হয়।

সংজ্ঞার চেয়ে দুটি অনুসরণমূলক প্রশ্ন বেশি গুরুত্বপূর্ণ। detectors এখনও burstiness-কে 2023 সালে যেভাবে ওজন দিত, সেভাবেই কি ওজন দেয় একটি প্রশ্ন, আর নিজের খসড়ায় prose নষ্ট না করে কীভাবে এটি বাড়ানো যায় অন্যটি।

এর অন্তর্নিহিত প্রক্রিয়া দৃশ্যমান হলে একটি সমতল অনুচ্ছেদ আর রহস্য থাকে না। এটি তখনই ঘটে, যখন প্রতিটি বাক্য একইভাবে গঠিত হয়, যেমন একটি একক পরবর্তী শব্দ গঠিত হয়, অর্থাৎ সবচেয়ে কম প্রতিরোধের পথে পরের যা আসে তার দিকেই হাত বাড়িয়ে। সেই চাপ জয়ী হবে কি না, তা নির্ভর করে লেখক বা মডেল বাক্য ধরে বাক্য তার বিরুদ্ধে প্রতিরোধ গড়ে তুলছে কি না তার ওপর।

Frequently Asked Questions

লেখায় বার্স্টিনেস কী? এটি একটি অনুচ্ছেদ জুড়ে বাক্যের দৈর্ঘ্য কতটা পরিবর্তিত হয় তার পরিমাণ, যা বাক্যের দৈর্ঘ্যের standard deviation কে তাদের mean দিয়ে ভাগ করে মাপা হয়। ছোট ও বড় বাক্যের মধ্যে ব্যাপক ওঠানামা থাকা একটি অনুচ্ছেদের বার্স্টিনেস বেশি। যেখানে প্রতিটি বাক্যের দৈর্ঘ্য প্রায় একই রকম, সেখানে বার্স্টিনেস কম, সেই দৈর্ঘ্য ছোট হোক বা বড় হোক।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

বার্স্টিনেস কী? কেন সমানধর্মী বাক্যগুলো চিহ্নিত হয় | TextPulse.ai