AI সনাক্তকরণে Perplexity কী?
Perplexity হলো সেই সংখ্যা, যা একটি ভাষা মডেল আপনার শব্দচয়ন দেখে কতটা বিস্মিত হয়েছে তা বর্ণনা করতে তৈরি করে। এই লেখায় 1977 সালের উৎস থেকে শুরু করে মেট্রিকটি অনুসরণ করা হয়েছে, সূত্রটি ব্যাখ্যা করা হয়েছে, এবং দেখানো হয়েছে কেন একই অনুচ্ছেদ ভিন্ন মডেলের ক্ষেত্রে ভিন্ন স্কোর পেতে পারে।
perplexity এবং AI সনাক্তকরণ একসঙ্গে খুঁজলে, শীর্ষ ফলাফলের কয়েকটি দেখা যায় একটি সম্পর্কহীন পণ্যের বিষয়ে, একটি AI-চালিত সার্চ ইঞ্জিন, যার নামও Perplexity। একটি detector বাস্তবে যে মেট্রিক জানায়, সেই কোম্পানির সঙ্গে শব্দটি ছাড়া আর কিছুই ভাগ করে না। এটি GPTZero বা সার্চ ইঞ্জিনের চেয়ে কয়েক দশক পুরোনো speech recognition গবেষণা থেকে এসেছে, এবং এটি এদের যেকোনোটির চেয়ে আরও সংকীর্ণ কিছু মাপে, ভাষা মডেলটি পৃষ্ঠায় ইতিমধ্যে থাকা শব্দগুলো দেখে কতটা বিস্মিত হয়।
তাহলে AI সনাক্তকরণে perplexity কী? Perplexity হলো এমন একটি স্কোর, যা বর্ণনা করে একটি ভাষা মডেল কোনো অনুচ্ছেদের নির্দিষ্ট শব্দগুলো কতটা ভালোভাবে পূর্বানুমান করেছে, যা মডেলের নিজস্ব সম্ভাবনাগুলোর গড় নিয়ে এবং ফলটিকে একটি একক সংখ্যায় রূপান্তর করে তৈরি হয়। কম স্কোর মানে মডেলটি সঠিকভাবে অনুমান করতে পেরেছে। বেশি স্কোর মানে এটি বারবার বিস্মিত হয়েছে।
এই ধারণা বাজারের যেকোনো AI detector-এর চেয়েও পুরোনো, এবং একা এটি কোনো নথি কে লিখেছে সে সম্পর্কে কিছুই বলে না। সংখ্যাটির পেছনের গাণিতিক হিসাব একবার দৃশ্যমান হলে, একটি রিপোর্টের স্কোর আর রায়ের মতো দেখায় না, বরং যা আসলে তা-ই দেখায়, শব্দ নির্বাচনের একটি বর্ণনা।

AI সনাক্তকরণে perplexity কী?
Perplexity হলো ভাষা মডেলিং থেকে ধার করা একটি পরিমাপ। এটি মূল্যায়ন করে যে একটি মডেল কোনো অনুচ্ছেদে উপস্থিত নির্দিষ্ট শব্দগুলো কতটা ভালোভাবে পূর্বানুমান করেছিল, এবং সেই স্কোরকে একটি একক সংখ্যা হিসেবে প্রকাশ করে। ডিটেক্টররা একই পরিমাপ একটি জমা দেওয়া নথির ওপর প্রয়োগ করে: একটি কম সংখ্যা, যার অর্থ মডেলের অনুমানগুলো প্রকৃত শব্দগুলোর সঙ্গে ঘনিষ্ঠভাবে মিলে গেছে, তা যন্ত্র-রচনার চিহ্ন হিসেবে পড়া হয়, আর একটি বেশি সংখ্যা মানব-রচনার চিহ্ন হিসেবে পড়া হয়। এই গণনার মধ্যে নথির যুক্তি, তার উদ্ধৃতি, বা তার বিষয়বস্তুর কিছুই পড়া হয় না। এটি কেবল একেকটি শব্দ কতটা প্রত্যাশিত ছিল, তা এক সময়ে একটিকে করে পড়ে।
ডিটেক্টররা এই পরিমাপ উদ্ভাবন করেনি। তারা এমন একটি সরঞ্জাম ধার নিয়েছিল, যা speech recognition এবং machine translation সিস্টেম বহু দশক ধরে ব্যবহার করে আসছিল, একটি মডেল সাধারণ ভাষা কতটা ভালোভাবে পূর্বানুমান করেছিল তা বিচার করার জন্য, এবং সেটিকে authorship-এর একটি প্রক্সি হিসেবে পুনঃব্যবহার করেছে, যা করার জন্য এটি মূলত কখনও নির্মিত হয়নি।
এর কোনোটিরই আগেই উল্লেখ করা অসংশ্লিষ্ট search engine-এর সঙ্গে কোনো সম্পর্ক নেই। একটি ডিটেক্টর যে perplexity রিপোর্ট করে, তা কখনও একটি company নয় এবং কখনও বড় হাতের অক্ষরে লেখা হয় না: এটি শব্দের একটি ধারার একটি সাধারণ পরিসংখ্যানগত বৈশিষ্ট্য, যা যে কোনো পাঠ্যকে দেওয়া হয় তার ভিত্তিতে নতুন করে গণনা করা হয়।
Perplexity আসলে কীভাবে গণনা করা হয়
এই গণনা কোনো AI product-এর চেয়েও আরও পেছনে গিয়ে পৌঁছায়। Frederick Jelinek, Robert Mercer, Lalit Bahl এবং James Baker 1977 সালে perplexity প্রবর্তন করেন, একটি statistical model-এর জন্য speech recognition task কতটা কঠিন ছিল তা পরিমাপ করার জন্য, কোনো essay বা lab report-এর ক্ষেত্রে এই শব্দ প্রয়োগ করার বহু দশক আগে। তখন থেকে সংজ্ঞাটি বদলায়নি।
একটি নথির প্রতিটি অবস্থানে, model সেই শব্দটির জন্য একটি probability output করে, যা বাস্তবে পরেরটি হিসেবে আসে, যেমন একটি সাধারণ transition-এর জন্য 0.72 বা একটি অস্বাভাবিকটির জন্য 0.03। Perplexity পুরো অনুচ্ছেদ জুড়ে এই probabilities-এর logarithm-এর গড় নেয়, তারপর exponent দিয়ে সেই গড়কে উল্টে দেয়।
there's-এ থাকা exponentটি যতটা মনে হয়, তার চেয়ে বেশি কাজ করছে। log probabilities-এর গড় নেওয়াই ঠিক সেটাই, যা আমরা cross-entropy গণনা করার সময় করি, আর এটি তথ্য-তাত্ত্বিক ভাষায় বলে, একটি model যে predictions দেয়, সেগুলোর ভিত্তিতে একটি sequence encode করতে আপনার কত bits দরকার। কিন্তু perplexity bits-এর সেই গণনাকে এমন কিছুর মধ্যে ফিরিয়ে আনে, যা আমরা আরও ভালোভাবে বুঝতে পারি, একটি abstract bits-এর গণনার বদলে একটি effective number of choices।
সেই arithmetic থেকে যা টিকে থাকে, তার একটি স্বচ্ছ, প্রায় ভৌত পাঠ আছে। একটি model যা প্রতিবার সম্পূর্ণ নিশ্চিত, তা 1 perplexity উৎপন্ন করে, scale-এর floor। একটি model যা প্রতিটি position-কে eighty equally likely words-এর মধ্যে সমান সম্ভাবনার একটি toss-up হিসেবে ধরে, তা 80 perplexity উৎপন্ন করে।
বেশিরভাগ বাস্তব document এই দুই extrem-এর মাঝামাঝি কোথাও পড়ে, এবং ঠিক কোথায় পড়বে তা writer, subject, এবং কোন model reading করছে, তার ওপর নির্ভর করে।
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
মানব লেখায় কেন ভিন্ন score দেখা যায়
একটি model-এর expectations সম্পূর্ণভাবে তার আগে যা এসেছে, সেখান থেকেই গড়ে ওঠে, একবারে এক word করে। 'the treatment group showed a statistically' বাক্যাংশের পরে, well-formed continuation-এর overwhelming majority হলো 'significant', এবং scientific writing-এর বড় volume-এ trained একটি model hesitation ছাড়াই সেই word-কে high probability দেয়। একই phrase-এ পৌঁছানো একজন human writer-ও 'significant' বেছে নিতে পারেন, কারণ phraseটি নিজেই genre-এর একটি স্থায়ী অংশ। gapটি অন্য জায়গায় তৈরি হয়, দুই sentence পরে বেছে নেওয়া noun-এ, parentheses-এ যোগ করা aside-এ, round one-এর বদলে odd decimal place-এ reported number-এ।
এর কোনোটাই trick নয়। বাস্তব data নিয়ে লেখেন এমন একজন person যখন exact number, precise qualifier, slightly narrower word-এর দিকে হাত বাড়ান, তখন তারা genre-এর সত্য নয়, কাজটির সত্য এমন জিনিসের দিকে হাত বাড়ান। আর এই প্রতিটি choice model-এর জন্য একটু বেশি surprise তৈরি করে। surprise-ই হলো সেই score, যা যোগ করে মোট করা হয়।
অনুমানটি পরিমাপ যতটা সমর্থন করতে পারে, তার চেয়ে বেশি কাজ করছে। Perplexity সরাসরি পূর্বানুমেয়তা পরিমাপ করে। এটি কেবল এই ধরে নিয়ে লেখকত্ব অনুমান করে যে মানুষের মধ্যে পূর্বানুমেয় লেখা বিরল এবং মডেলগুলির মধ্যে সাধারণ, একটি ধারণা যা সাধারণত যুক্তিসঙ্গত এবং কখনও কখনও নির্দিষ্ট, শনাক্তযোগ্য উপায়ে ভুল, কারণ পূর্বানুমেয়তা এমন একটি বৈশিষ্ট্য যা পাঠ্যের থাকতে পারে এমন কারণে, যাদের সঙ্গে এটি কে টাইপ করেছে তার কোনো সম্পর্ক নেই।
কেন একই অনুচ্ছেদ ভিন্নভাবে স্কোর করতে পারে
স্কোরটি দেখতেও যতটা বহনযোগ্য মনে হয়, বাস্তবে ততটা নয়, কারণ এটি কখনও শূন্যে পরিমাপ করা হয় না। Perplexity সর্বদা একটি নির্দিষ্ট রেফারেন্স মডেলের প্রশিক্ষণের বিরুদ্ধে গণনা করা হয়, এবং সেই নির্ভরতা এমন সমস্যা তৈরি করে যা কোনো একক সংজ্ঞা একা দেখাতে পারে না।
| Factor | What changes | Why it happens |
|---|---|---|
| Which model is doing the reading | The same paragraph can score low on one model and high on another | Perplexity is only ever measured against one model's training data, and different models were trained on different text |
| Whether the passage is widely reproduced text | A famous historical document or a textbook definition can score as low-perplexity even when a person typed every word of it into the detector | Pangram Labs points to the Declaration of Independence as an example: it is quoted so often in training data that a model finds every sentence of it unsurprising |
| Whether the detector can see token probabilities at all | Closed commercial models such as ChatGPT, Gemini and Claude do not expose the per-word probabilities perplexity needs | Detectors approximate the score with a stand-in open model instead of computing perplexity against the model that actually produced the text |
এর কোনোটিই সংখ্যাটিকে অর্থহীন করে না, কেবল একে একক সিদ্ধান্ত হিসেবে বিশ্বাস করা আরও ঝুঁকিপূর্ণ করে তোলে। GPTZero-এর নিজস্ব ডকুমেন্টেশন একসময় একটি আনুমানিক নিয়ম প্রকাশ করেছিল, যেখানে 85-এর বেশি perplexity মানব-রচিত হওয়ার সম্ভাবনা বেশি বলে ধরা হতো, কিন্তু একটি মডেলে এক বিক্রেতার নির্ধারিত সীমা অন্য একটি টুলে, যা ভিন্ন একটি মডেলের বিরুদ্ধে মাপা হয়েছে, সেখানে প্রযোজ্য হয় না। একটি detector যখন একটি মাত্র score জানায়, তখন সেটি উপরের সব উপাদানকে একটিমাত্র সংখ্যায় সংকুচিত করছে, কিন্তু এর মধ্যে কোনটি আসলে কাজ করেছে তা বলছে না।
একটি perplexity score আসলে আপনাকে কী বলে
বাণিজ্যিক detector গুলি একটি মাত্র সংখ্যা রিপোর্টে ছাপার আগেই perplexity-কে sentence-level pattern, classifier training এবং আরও কয়েকটি signal-এর সঙ্গে একত্র করে। AI detector কীভাবে আসলে কাজ করে তার আরও পূর্ণাঙ্গ চিত্র আলাদাভাবে আলোচিত হয়েছে, এবং সেখানে ব্যাখ্যা করা হয়েছে এই সংখ্যার বাকি অংশ কোথা থেকে আসে।
বাক্য থেকে বাক্যে ছন্দ একটি সম্পর্কিত কিন্তু পৃথক signal, যা burstiness checker নিজস্বভাবে বিবেচনা করে, এবং এটি কোনো একক শব্দের বদলে একটি অনুচ্ছেদের মধ্যে কতটা বৈচিত্র্য আছে তা দেখে।
এই সংখ্যাগুলোর কোনোটিই প্রমাণ করতে পারে না কে একটি নথি লিখেছে, এর মধ্যে TextPulse জমা দেওয়া খসড়া থেকে যে আনুমানিক Human Score গণনা করে সেটিও আছে, যা পাঠ্যকে বর্ণনা করে, কিন্তু তার ওপর কোনো সিদ্ধান্ত দেয় না। একই ধারণার একটি সরলীকৃত রূপ, পূর্ণ model probability নয় বরং শব্দভান্ডারের বৈচিত্র্য, এই সাইটের free perplexity checker-কে চালিত করে, এবং অন্য কারও সম্পর্কে একটি report কী বলছে তা বিশ্বাস করার আগে এমন একটি অনুচ্ছেদের বিরুদ্ধে এটি পরীক্ষা করে দেখা মূল্যবান, যার উৎস ইতিমধ্যেই জানা।
perplexity checker, TextPulse-এর বাকি free tools-এর সঙ্গে রয়েছে, তাই একটি খসড়া, শব্দভান্ডার, ছন্দ এবং বাকি সবকিছুর ওপর পূর্ণ পরীক্ষা চালাতে একসঙ্গে ডজনখানেক আলাদা tab খোলা রাখার প্রয়োজন হয় না।
পারপ্লেক্সিটি এই সিস্টেমগুলো যে 2টি পরিসংখ্যানের ওপর নির্ভর করে, তার একটি। অন্যটি হলো বার্স্টিনেস, বাক্যের দৈর্ঘ্য ও গঠনের তারতম্য একটি অনুচ্ছেদ জুড়ে, এবং এই দুটির নিচে নিহিত আছে টোকেন সম্ভাবনা-ভিত্তিক গণিত, যা প্রথমেই স্কোরটি তৈরি করে।
একটি প্রতিবেদনে থাকা একটি সংখ্যা হলো দীর্ঘ এক ধারাবাহিক গণনার শেষ, কারা কিছু লিখেছে তা নিয়ে তর্কের শুরু নয়। গণিতটি আর রহস্যময় না থাকলে, আরও আকর্ষণীয় প্রশ্ন হলো, ঠিক কী কারণে একটি নথি প্রথমে বিস্ময়কর বা পূর্বানুমেয় হয়ে উঠল, এবং সেটি হলো লেখাটির নিজের সম্পর্কে একটি প্রশ্ন।
সচরাচর জিজ্ঞাসিত প্রশ্ন
না। AI সনাক্তকরণে perplexity হলো ভাষা মডেলিং থেকে আসা কয়েক দশক পুরোনো একটি পরিসংখ্যানগত পরিমাপ, যা একটি পাঠ্যাংশ মডেলের কাছে কতটা পূর্বানুমেয় তা বর্ণনা করে। Perplexity AI একটি সম্পর্কহীন কোম্পানি, যা একটি AI-চালিত অনুসন্ধান পণ্য তৈরি করে। এই দুটির মধ্যে শুধু নামের মিল আছে, আর কিছু নয়, এবং এদের গুলিয়ে ফেললে একটি ডিটেক্টরের প্রতিবেদন বোঝা সহজ হবে না।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.