AI Detection

AI সনাক্তকরণে Perplexity কী?

Perplexity হলো সেই সংখ্যা, যা একটি ভাষা মডেল আপনার শব্দচয়ন দেখে কতটা বিস্মিত হয়েছে তা বর্ণনা করতে তৈরি করে। এই লেখায় 1977 সালের উৎস থেকে শুরু করে মেট্রিকটি অনুসরণ করা হয়েছে, সূত্রটি ব্যাখ্যা করা হয়েছে, এবং দেখানো হয়েছে কেন একই অনুচ্ছেদ ভিন্ন মডেলের ক্ষেত্রে ভিন্ন স্কোর পেতে পারে।

সর্বশেষ আপডেট করা হয়েছে 6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

perplexity এবং AI সনাক্তকরণ একসঙ্গে খুঁজলে, শীর্ষ ফলাফলের কয়েকটি দেখা যায় একটি সম্পর্কহীন পণ্যের বিষয়ে, একটি AI-চালিত সার্চ ইঞ্জিন, যার নামও Perplexity। একটি detector বাস্তবে যে মেট্রিক জানায়, সেই কোম্পানির সঙ্গে শব্দটি ছাড়া আর কিছুই ভাগ করে না। এটি GPTZero বা সার্চ ইঞ্জিনের চেয়ে কয়েক দশক পুরোনো speech recognition গবেষণা থেকে এসেছে, এবং এটি এদের যেকোনোটির চেয়ে আরও সংকীর্ণ কিছু মাপে, ভাষা মডেলটি পৃষ্ঠায় ইতিমধ্যে থাকা শব্দগুলো দেখে কতটা বিস্মিত হয়।

তাহলে AI সনাক্তকরণে perplexity কী? Perplexity হলো এমন একটি স্কোর, যা বর্ণনা করে একটি ভাষা মডেল কোনো অনুচ্ছেদের নির্দিষ্ট শব্দগুলো কতটা ভালোভাবে পূর্বানুমান করেছে, যা মডেলের নিজস্ব সম্ভাবনাগুলোর গড় নিয়ে এবং ফলটিকে একটি একক সংখ্যায় রূপান্তর করে তৈরি হয়। কম স্কোর মানে মডেলটি সঠিকভাবে অনুমান করতে পেরেছে। বেশি স্কোর মানে এটি বারবার বিস্মিত হয়েছে।

এই ধারণা বাজারের যেকোনো AI detector-এর চেয়েও পুরোনো, এবং একা এটি কোনো নথি কে লিখেছে সে সম্পর্কে কিছুই বলে না। সংখ্যাটির পেছনের গাণিতিক হিসাব একবার দৃশ্যমান হলে, একটি রিপোর্টের স্কোর আর রায়ের মতো দেখায় না, বরং যা আসলে তা-ই দেখায়, শব্দ নির্বাচনের একটি বর্ণনা।

Free perplexity checker scoring word-level predictability: a repetitive paragraph scores 62 of 100 estimated word variation with a 51% type-token ratio
perplexity checker-এ কম শব্দগত বৈচিত্র্য, 87টির মধ্যে 44টি অনন্য শব্দ, তাই একই শব্দগুলো পাঠ্যের খুব বেশি অংশ বহন করছে। এই পূর্বানুমেয়তাই ঠিক তা, যা perplexity-ভিত্তিক detector-রা পড়ে।

AI সনাক্তকরণে perplexity কী?

Perplexity হলো ভাষা মডেলিং থেকে ধার করা একটি পরিমাপ। এটি মূল্যায়ন করে যে একটি মডেল কোনো অনুচ্ছেদে উপস্থিত নির্দিষ্ট শব্দগুলো কতটা ভালোভাবে পূর্বানুমান করেছিল, এবং সেই স্কোরকে একটি একক সংখ্যা হিসেবে প্রকাশ করে। ডিটেক্টররা একই পরিমাপ একটি জমা দেওয়া নথির ওপর প্রয়োগ করে: একটি কম সংখ্যা, যার অর্থ মডেলের অনুমানগুলো প্রকৃত শব্দগুলোর সঙ্গে ঘনিষ্ঠভাবে মিলে গেছে, তা যন্ত্র-রচনার চিহ্ন হিসেবে পড়া হয়, আর একটি বেশি সংখ্যা মানব-রচনার চিহ্ন হিসেবে পড়া হয়। এই গণনার মধ্যে নথির যুক্তি, তার উদ্ধৃতি, বা তার বিষয়বস্তুর কিছুই পড়া হয় না। এটি কেবল একেকটি শব্দ কতটা প্রত্যাশিত ছিল, তা এক সময়ে একটিকে করে পড়ে।

ডিটেক্টররা এই পরিমাপ উদ্ভাবন করেনি। তারা এমন একটি সরঞ্জাম ধার নিয়েছিল, যা speech recognition এবং machine translation সিস্টেম বহু দশক ধরে ব্যবহার করে আসছিল, একটি মডেল সাধারণ ভাষা কতটা ভালোভাবে পূর্বানুমান করেছিল তা বিচার করার জন্য, এবং সেটিকে authorship-এর একটি প্রক্সি হিসেবে পুনঃব্যবহার করেছে, যা করার জন্য এটি মূলত কখনও নির্মিত হয়নি।

এর কোনোটিরই আগেই উল্লেখ করা অসংশ্লিষ্ট search engine-এর সঙ্গে কোনো সম্পর্ক নেই। একটি ডিটেক্টর যে perplexity রিপোর্ট করে, তা কখনও একটি company নয় এবং কখনও বড় হাতের অক্ষরে লেখা হয় না: এটি শব্দের একটি ধারার একটি সাধারণ পরিসংখ্যানগত বৈশিষ্ট্য, যা যে কোনো পাঠ্যকে দেওয়া হয় তার ভিত্তিতে নতুন করে গণনা করা হয়।

Perplexity আসলে কীভাবে গণনা করা হয়

এই গণনা কোনো AI product-এর চেয়েও আরও পেছনে গিয়ে পৌঁছায়। Frederick Jelinek, Robert Mercer, Lalit Bahl এবং James Baker 1977 সালে perplexity প্রবর্তন করেন, একটি statistical model-এর জন্য speech recognition task কতটা কঠিন ছিল তা পরিমাপ করার জন্য, কোনো essay বা lab report-এর ক্ষেত্রে এই শব্দ প্রয়োগ করার বহু দশক আগে। তখন থেকে সংজ্ঞাটি বদলায়নি।

একটি নথির প্রতিটি অবস্থানে, model সেই শব্দটির জন্য একটি probability output করে, যা বাস্তবে পরেরটি হিসেবে আসে, যেমন একটি সাধারণ transition-এর জন্য 0.72 বা একটি অস্বাভাবিকটির জন্য 0.03। Perplexity পুরো অনুচ্ছেদ জুড়ে এই probabilities-এর logarithm-এর গড় নেয়, তারপর exponent দিয়ে সেই গড়কে উল্টে দেয়।

there's-এ থাকা exponentটি যতটা মনে হয়, তার চেয়ে বেশি কাজ করছে। log probabilities-এর গড় নেওয়াই ঠিক সেটাই, যা আমরা cross-entropy গণনা করার সময় করি, আর এটি তথ্য-তাত্ত্বিক ভাষায় বলে, একটি model যে predictions দেয়, সেগুলোর ভিত্তিতে একটি sequence encode করতে আপনার কত bits দরকার। কিন্তু perplexity bits-এর সেই গণনাকে এমন কিছুর মধ্যে ফিরিয়ে আনে, যা আমরা আরও ভালোভাবে বুঝতে পারি, একটি abstract bits-এর গণনার বদলে একটি effective number of choices।

সেই arithmetic থেকে যা টিকে থাকে, তার একটি স্বচ্ছ, প্রায় ভৌত পাঠ আছে। একটি model যা প্রতিবার সম্পূর্ণ নিশ্চিত, তা 1 perplexity উৎপন্ন করে, scale-এর floor। একটি model যা প্রতিটি position-কে eighty equally likely words-এর মধ্যে সমান সম্ভাবনার একটি toss-up হিসেবে ধরে, তা 80 perplexity উৎপন্ন করে।

বেশিরভাগ বাস্তব document এই দুই extrem-এর মাঝামাঝি কোথাও পড়ে, এবং ঠিক কোথায় পড়বে তা writer, subject, এবং কোন model reading করছে, তার ওপর নির্ভর করে।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

মানব লেখায় কেন ভিন্ন score দেখা যায়

একটি model-এর expectations সম্পূর্ণভাবে তার আগে যা এসেছে, সেখান থেকেই গড়ে ওঠে, একবারে এক word করে। 'the treatment group showed a statistically' বাক্যাংশের পরে, well-formed continuation-এর overwhelming majority হলো 'significant', এবং scientific writing-এর বড় volume-এ trained একটি model hesitation ছাড়াই সেই word-কে high probability দেয়। একই phrase-এ পৌঁছানো একজন human writer-ও 'significant' বেছে নিতে পারেন, কারণ phraseটি নিজেই genre-এর একটি স্থায়ী অংশ। gapটি অন্য জায়গায় তৈরি হয়, দুই sentence পরে বেছে নেওয়া noun-এ, parentheses-এ যোগ করা aside-এ, round one-এর বদলে odd decimal place-এ reported number-এ।

এর কোনোটাই trick নয়। বাস্তব data নিয়ে লেখেন এমন একজন person যখন exact number, precise qualifier, slightly narrower word-এর দিকে হাত বাড়ান, তখন তারা genre-এর সত্য নয়, কাজটির সত্য এমন জিনিসের দিকে হাত বাড়ান। আর এই প্রতিটি choice model-এর জন্য একটু বেশি surprise তৈরি করে। surprise-ই হলো সেই score, যা যোগ করে মোট করা হয়।

অনুমানটি পরিমাপ যতটা সমর্থন করতে পারে, তার চেয়ে বেশি কাজ করছে। Perplexity সরাসরি পূর্বানুমেয়তা পরিমাপ করে। এটি কেবল এই ধরে নিয়ে লেখকত্ব অনুমান করে যে মানুষের মধ্যে পূর্বানুমেয় লেখা বিরল এবং মডেলগুলির মধ্যে সাধারণ, একটি ধারণা যা সাধারণত যুক্তিসঙ্গত এবং কখনও কখনও নির্দিষ্ট, শনাক্তযোগ্য উপায়ে ভুল, কারণ পূর্বানুমেয়তা এমন একটি বৈশিষ্ট্য যা পাঠ্যের থাকতে পারে এমন কারণে, যাদের সঙ্গে এটি কে টাইপ করেছে তার কোনো সম্পর্ক নেই।

কেন একই অনুচ্ছেদ ভিন্নভাবে স্কোর করতে পারে

স্কোরটি দেখতেও যতটা বহনযোগ্য মনে হয়, বাস্তবে ততটা নয়, কারণ এটি কখনও শূন্যে পরিমাপ করা হয় না। Perplexity সর্বদা একটি নির্দিষ্ট রেফারেন্স মডেলের প্রশিক্ষণের বিরুদ্ধে গণনা করা হয়, এবং সেই নির্ভরতা এমন সমস্যা তৈরি করে যা কোনো একক সংজ্ঞা একা দেখাতে পারে না।

FactorWhat changesWhy it happens
Which model is doing the readingThe same paragraph can score low on one model and high on anotherPerplexity is only ever measured against one model's training data, and different models were trained on different text
Whether the passage is widely reproduced textA famous historical document or a textbook definition can score as low-perplexity even when a person typed every word of it into the detectorPangram Labs points to the Declaration of Independence as an example: it is quoted so often in training data that a model finds every sentence of it unsurprising
Whether the detector can see token probabilities at allClosed commercial models such as ChatGPT, Gemini and Claude do not expose the per-word probabilities perplexity needsDetectors approximate the score with a stand-in open model instead of computing perplexity against the model that actually produced the text

এর কোনোটিই সংখ্যাটিকে অর্থহীন করে না, কেবল একে একক সিদ্ধান্ত হিসেবে বিশ্বাস করা আরও ঝুঁকিপূর্ণ করে তোলে। GPTZero-এর নিজস্ব ডকুমেন্টেশন একসময় একটি আনুমানিক নিয়ম প্রকাশ করেছিল, যেখানে 85-এর বেশি perplexity মানব-রচিত হওয়ার সম্ভাবনা বেশি বলে ধরা হতো, কিন্তু একটি মডেলে এক বিক্রেতার নির্ধারিত সীমা অন্য একটি টুলে, যা ভিন্ন একটি মডেলের বিরুদ্ধে মাপা হয়েছে, সেখানে প্রযোজ্য হয় না। একটি detector যখন একটি মাত্র score জানায়, তখন সেটি উপরের সব উপাদানকে একটিমাত্র সংখ্যায় সংকুচিত করছে, কিন্তু এর মধ্যে কোনটি আসলে কাজ করেছে তা বলছে না।

একটি perplexity score আসলে আপনাকে কী বলে

বাণিজ্যিক detector গুলি একটি মাত্র সংখ্যা রিপোর্টে ছাপার আগেই perplexity-কে sentence-level pattern, classifier training এবং আরও কয়েকটি signal-এর সঙ্গে একত্র করে। AI detector কীভাবে আসলে কাজ করে তার আরও পূর্ণাঙ্গ চিত্র আলাদাভাবে আলোচিত হয়েছে, এবং সেখানে ব্যাখ্যা করা হয়েছে এই সংখ্যার বাকি অংশ কোথা থেকে আসে।

বাক্য থেকে বাক্যে ছন্দ একটি সম্পর্কিত কিন্তু পৃথক signal, যা burstiness checker নিজস্বভাবে বিবেচনা করে, এবং এটি কোনো একক শব্দের বদলে একটি অনুচ্ছেদের মধ্যে কতটা বৈচিত্র্য আছে তা দেখে।

এই সংখ্যাগুলোর কোনোটিই প্রমাণ করতে পারে না কে একটি নথি লিখেছে, এর মধ্যে TextPulse জমা দেওয়া খসড়া থেকে যে আনুমানিক Human Score গণনা করে সেটিও আছে, যা পাঠ্যকে বর্ণনা করে, কিন্তু তার ওপর কোনো সিদ্ধান্ত দেয় না। একই ধারণার একটি সরলীকৃত রূপ, পূর্ণ model probability নয় বরং শব্দভান্ডারের বৈচিত্র্য, এই সাইটের free perplexity checker-কে চালিত করে, এবং অন্য কারও সম্পর্কে একটি report কী বলছে তা বিশ্বাস করার আগে এমন একটি অনুচ্ছেদের বিরুদ্ধে এটি পরীক্ষা করে দেখা মূল্যবান, যার উৎস ইতিমধ্যেই জানা।

perplexity checker, TextPulse-এর বাকি free tools-এর সঙ্গে রয়েছে, তাই একটি খসড়া, শব্দভান্ডার, ছন্দ এবং বাকি সবকিছুর ওপর পূর্ণ পরীক্ষা চালাতে একসঙ্গে ডজনখানেক আলাদা tab খোলা রাখার প্রয়োজন হয় না।

পারপ্লেক্সিটি এই সিস্টেমগুলো যে 2টি পরিসংখ্যানের ওপর নির্ভর করে, তার একটি। অন্যটি হলো বার্স্টিনেস, বাক্যের দৈর্ঘ্য ও গঠনের তারতম্য একটি অনুচ্ছেদ জুড়ে, এবং এই দুটির নিচে নিহিত আছে টোকেন সম্ভাবনা-ভিত্তিক গণিত, যা প্রথমেই স্কোরটি তৈরি করে।

একটি প্রতিবেদনে থাকা একটি সংখ্যা হলো দীর্ঘ এক ধারাবাহিক গণনার শেষ, কারা কিছু লিখেছে তা নিয়ে তর্কের শুরু নয়। গণিতটি আর রহস্যময় না থাকলে, আরও আকর্ষণীয় প্রশ্ন হলো, ঠিক কী কারণে একটি নথি প্রথমে বিস্ময়কর বা পূর্বানুমেয় হয়ে উঠল, এবং সেটি হলো লেখাটির নিজের সম্পর্কে একটি প্রশ্ন।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

না। AI সনাক্তকরণে perplexity হলো ভাষা মডেলিং থেকে আসা কয়েক দশক পুরোনো একটি পরিসংখ্যানগত পরিমাপ, যা একটি পাঠ্যাংশ মডেলের কাছে কতটা পূর্বানুমেয় তা বর্ণনা করে। Perplexity AI একটি সম্পর্কহীন কোম্পানি, যা একটি AI-চালিত অনুসন্ধান পণ্য তৈরি করে। এই দুটির মধ্যে শুধু নামের মিল আছে, আর কিছু নয়, এবং এদের গুলিয়ে ফেললে একটি ডিটেক্টরের প্রতিবেদন বোঝা সহজ হবে না।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।