AI ডিটেক্টররা কি এখনও Perplexity এবং Burstiness-এর ওপর নির্ভর করে?
GPTZero perplexity এবং burstiness-কে পরিচিত করেছিল, তারপর 2023 সালের শরতে নীরবে উভয়কেই একটি deep-learning classifier-এর পক্ষে বাদ দেয়। এই পোস্টে কী বদলাল, GPTZero এবং Turnitin আজ আসলে কী নথিভুক্ত করে, এবং কেন এই দুই পরিসংখ্যান এখনও ব্যাখ্যা করে যে machine text কেন শনাক্তযোগ্য, যদিও কোনো vendor আর সেগুলো সরাসরি গণনা করে না।
আজ GPTZero কীভাবে AI লেখা শনাক্ত করে তা খুঁজলে, ফিরে আসা অধিকাংশ ফলাফল এখনও দুটি পরিসংখ্যান, perplexity এবং burstiness, কে কেন্দ্র করে, এই জোড়া যা 2023 সালের জানুয়ারিতে চালু হওয়ার কয়েক সপ্তাহের মধ্যেই টুলটিকে পরিচিত করে তুলেছিল। GPTZero-এর নিজস্ব সহায়তা নথি এখন ভিন্ন কিছু বলছে: একই বছরের শরতে এটি এই দুটিই ব্যবহার করা বন্ধ করেছে।
তাহলে কি AI detector-গুলোতে burstiness এখনও ব্যবহৃত হয়? যে টুলটি একাডেমিক মহলে এই শব্দটিকে বহুল পরিচিত করেছিল, সেটিতে নয়। GPTZero-এর support center স্পষ্টভাবে জানায় যে এটি আর perplexity বা burstiness ব্যবহার করে না, বরং deep-learning architecture-এ সরে গেছে। Turnitin, যে টুলটির মুখোমুখি বাস্তবে অধিকাংশ শিক্ষার্থী হয়, শুরু থেকেই তার পদ্ধতির অংশ হিসেবে এই দুই শব্দের কোনোটিই প্রকাশ করেনি। ধারণাগুলো আলোচনার বাইরে চলে যায়নি। সেগুলো সেই পণ্যগুলো থেকে চলে গেছে, যেগুলো প্রকৃত শনাক্তকরণ কাজটি করে।
AI detector-গুলোতে কি এখনও Burstiness ব্যবহৃত হয়?
না, GPTZero-তে নয়, এবং নাম ধরে তো নয়ই। GPTZero-এর নিজস্ব support documentation সরাসরি তা বলে: "As of autumn 2023, GPTZero no longer uses perplexity and burstiness for its AI detection because we migrated to a deep-learning based architecture." Turnitin-এর নিজস্ব guides আবার ভিন্ন একটি পদ্ধতি বর্ণনা করে, যেখানে একটি trained classifier দিয়ে submission-এর অংশগুলোকে স্কোর করা হয়, এবং সেই নথিতেও এই দুই শব্দের কোনোটিই কোথাও নেই। AI detection-এর প্রথম ঢেউকে সংজ্ঞায়িত করা এই দুটি পরিসংখ্যান বর্তমানে শীর্ষস্থানীয় টুলগুলো যা চালায়, তা নয়। এর মানে এই নয় যে সেগুলো ফেলে দেওয়া হয়েছে: GPTZero-এর নিজস্ব ব্যাখ্যামূলক নথি এখনও সেগুলোকে তার model-এ তথ্য জোগানো সাতটি indicator-এর মধ্যে গণ্য করে। সেগুলো method হিসেবে ব্যবহার বন্ধ করেছে, কিন্তু measurement হিসেবে নয়, এবং এই দুই দাবির পার্থক্যই এই প্রশ্নের মূল বিষয়ের অধিকাংশ।
2023 সালের শরতে কী বদলাল
দুটি শব্দই কখনও দুর্বোধ্য ছিল না। GPTZero-এর নিজস্ব প্রাথমিক ব্যাখ্যায় perplexity-কে সংজ্ঞায়িত করা হয়েছিল "একটি পরিমাপ হিসেবে, যা নির্দেশ করে একটি AI model নথিতে পাওয়া শব্দগুলোর ঠিক একই সেট বেছে নেওয়ার কতটা সম্ভাবনা ছিল", এবং burstiness-কে সংজ্ঞায়িত করা হয়েছিল "একটি পরিমাপ হিসেবে, যা নির্দেশ করে সমগ্র নথিজুড়ে লেখার ধরন এবং text perplexities কতটা পরিবর্তিত হয়", অর্থাৎ এটি একটি document-level statistic, কোনো সরল sentence-length count নয়। এই দুই সংজ্ঞাই এখনও GPTZero-এর সাইটে প্রকাশিত আছে। যা বদলেছে, তা হলো detector বাস্তবে এদের কোনটিকে চালায়।
"Migrated to a deep-learning based architecture" একটি নির্দিষ্ট দাবি, কোনো marketing phrase নয়, এবং এটি প্রকৃতপক্ষে ধরনের একটি বাস্তব পরিবর্তনকে বর্ণনা করে। একটি perplexity score সরাসরি একটি formula থেকে গণনা করা হয়: text-টিকে একটি reference language model-এর মধ্য দিয়ে চালান, log probabilities-এর গড় নিন, তারপর ফলাফলকে exponentiate করুন। এর বদলে একটি deep-learning classifier প্রশিক্ষিত হয়, যেখানে তাকে বিপুল সংখ্যক human এবং AI-written উদাহরণ দেখানো হয়, যতক্ষণ না এটি নিজে থেকেই training data-র মধ্যে দুই স্তূপকে আলাদা করে এমন features-এর যেকোনো সমন্বয় শিখে নেয়। দ্বিতীয় পদ্ধতিতে নিয়মটি কেউ হাতে লিখে দেয় না। model সেটি খুঁজে বের করে।
এই সাইটের অন্যত্র এই দুই অবসরপ্রাপ্ত শব্দের পূর্ণ ব্যাখ্যা আছে: perplexity আসলে কী পরিমাপ করে এবং burstiness আসলে কী পরিমাপ করে, উভয়ই তাদের নিজস্ব mechanics গভীরভাবে ব্যাখ্যা করে, তাদের পেছনের formulas-সহ। এই অংশটি কেবল এই প্রশ্নে সীমাবদ্ধ থাকে যে আজ কোনো detector কি সত্যিই এদের কোনো একটিকে চালায় কিনা।
GPTZero এবং Turnitin আজ আসলে কী নথিভুক্ত করে
বর্তমান GPTZero technology page, যা product-এ কী সরবরাহ করা হয় তা বর্ণনা করে, জানায় যে company "an end-to-end deep learning approach, trained on text datasets from the web, education, and AI-generated from a range of LLMs" ব্যবহার করে, যেখানে "a sentence-by-sentence classification model determines the probability and confidence that a text was created by AI". Perplexity এবং burstiness এই page-এ কোথাও নেই, component হিসেবে নয়, legacy feature হিসেবেও নয়, footnote-এও নয়।
Turnitin-এর ডকুমেন্টেশন শুরু থেকেই এই দুইটি শব্দের কোনোটিকেই ভিত্তি করে তৈরি হয়নি। এর নির্দেশিকাগুলোতে কয়েকশো শব্দের কয়েকটি খণ্ডে ভাগ করা একটি জমা দেওয়ার কথা বলা হয়, যেখানে প্রতিটি খণ্ডকে একটি প্রশিক্ষিত মডেল স্কোর করে, এবং খণ্ডগুলোর স্কোর গড় করে প্রতিবেদনে দেখানো একক শতাংশে রূপান্তর করা হয়। এটি পাঠ্যের খণ্ডের ওপর কাজ করা একটি supervised classifier, GPTZero যে ধরনের পদ্ধতির দিকে গেছে সেই একই পরিবারের পদ্ধতি, এটি perplexity গণনা নয় এবং burstiness গণনাও নয়, অন্য নামে তো নয়ই।
এই পরিবর্তনটি পাশাপাশি দেখলে সবচেয়ে সহজে বোঝা যায়।
| প্রারম্ভিক ব্যাখ্যাকারীরা যা বর্ণনা করেছিলেন (2023) | বর্তমান ডকুমেন্টেশন যা বর্ণনা করে | |
|---|---|---|
| GPTZero | Perplexity এবং burstiness, একটি reference model-এর বিপরীতে স্কোর করা | বাক্য-প্রতি-বাক্য deep-learning classifier, যা একটি probability এবং confidence score আউটপুট করে |
| Turnitin | কখনও প্রকাশিত হয়নি, Turnitin-এর নিজস্ব উপকরণে এই শব্দগুলো কোনো সময়েই দেখা যায় না | কয়েকশো শব্দের খণ্ড, একটি প্রশিক্ষিত classifier দ্বারা স্কোর করা, এবং তা গড়ে এক শতাংশে রূপান্তরিত |
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
কেন এই ধারণাগুলো এখনও Detectability ব্যাখ্যা করে
এতে perplexity এবং burstiness ভুল হয়ে যায় না, কেবল বর্তমান প্রক্রিয়ার বর্ণনা হিসেবে সেগুলো পুরোনো হয়ে যায়। এই দুইটি ধারণাই সবসময় একটি বাস্তব বিষয়কে বর্ণনা করছিল, model-এর নিজস্ব সর্বোচ্চ সম্ভাব্য continuations-এর দিকে sampling করে তৈরি পাঠ্য সাধারণত একজন মানুষ শুরু থেকে যে পাঠ্য লেখে তার তুলনায় শব্দে শব্দে বেশি পূর্বানুমানযোগ্য হয়, এবং এক বাক্য থেকে পরের বাক্যে তার পরিবর্তনও কম হয়। অন্তর্নিহিত regularity বদলায়নি, কারণ কোনো vendor তার detector-এর architecture বদলেছে। বদলেছে কেবল detector কীভাবে সেটিকে খুঁজে দেখে।
প্রশিক্ষিত শ্রেণিবিন্যাসককে স্পষ্টভাবে perplexity বা burstiness খুঁজতে বলা হয় না। বরং, তাকে মানব ও যন্ত্র-উৎপাদিত পাঠ্যের মধ্যে সেই একই মৌলিক পার্থক্যের ওপর প্রশিক্ষণ দেওয়া হয়, যেটি এই দুই পরিসংখ্যান ধরার জন্য নকশা করা হয়েছিল। এবং খুবই অসম্ভব বলে মনে হয় যে, দুইটি স্তূপকে আলাদা করতে প্রশিক্ষিত একটি শ্রেণিবিন্যাসক ঠিক সেই নিয়মিততার ওপরও নির্ভর করবে না, যা এই দুইয়ের মধ্যে সবচেয়ে নির্ভরযোগ্য পার্থক্যগুলির একটি। এটি একটি অনুমান, কেন শ্রেণিবিন্যাসকটি সম্ভবত কাজ করে, তার ব্যাখ্যা, প্রকাশিত বৈশিষ্ট্য তালিকা সম্পর্কে কোনো দাবি নয়, এবং এই দুই বিষয়কে আলাদা রেখেই দেখা উচিত।
স্বাধীন গবেষণা এই ধারণাকে সমর্থন করে যে অন্তর্নিহিত পরিসংখ্যানটি এখনও কার্যকর, এমনকি কোনো একক বিক্রেতার পণ্যের বাইরেও। DetectGPT, 2023 সালে প্রকাশিত একটি একাডেমিক zero-shot পদ্ধতি, perplexity-এর একটি ঘনিষ্ঠ সমগোত্রীয় বিষয়, অর্থাৎ কোনো অনুচ্ছেদের চারপাশে একটি মডেলের log-probability function কতটা তীব্রভাবে বক্র হয়, তা দেখে এবং কোনো লেবেলযুক্ত উদাহরণে classifier প্রশিক্ষণ না দিয়েই একটি benchmark-এ 0.95 AUROC অর্জন করে, যেখানে সেরা পূর্ববর্তী zero-shot baseline-এর মান ছিল 0.81। মূল ধারণাটি, অর্থাৎ যন্ত্র-উৎপাদিত পাঠ্য একটি মডেলের নিজস্ব probability space-এর পরিসংখ্যানগতভাবে পৃথক অঞ্চলে অবস্থান করে, এখনও সক্রিয় গবেষণার বিষয়। এটি কেবল GPTZero ব্যবহারকারীদের কাছে যা সরবরাহ করে, তা নয়।
কেন ইন্টারনেটের এত বড় অংশ এখনও এটি ভুল বোঝে
AI detection কীভাবে কাজ করে, সে বিষয়ে প্রকাশিত অধিকাংশ ব্যাখ্যা GPTZero-এর 2023 সালের জানুয়ারির launch-এর সময় বা তার অল্প পরেই লেখা হয়েছিল, যখন perplexity এবং burstiness-ই ছিল কোম্পানির নিজস্ব একমাত্র প্রকাশ্য ব্যাখ্যামূলক কাঠামো। সেই মূল explainer পৃষ্ঠাগুলি আজও সক্রিয় আছে। 2023 সালের শরতের retirement notice একটি পৃথক support page-এ রয়েছে, সেগুলির মধ্যে একীভূত করা হয়নি, তাই যে লেখক প্রথম পৃষ্ঠাটি পড়ে গবেষণা থামিয়ে দিয়েছিলেন, তাঁর কাছে জানার কোনো কারণ থাকত না যে পদ্ধতিটি এক বছরেরও কম সময় পরে বদলে গিয়েছিল।
2026 সালে প্রচারিত একটি তৃতীয় পক্ষের ডিটেক্টর পর্যালোচনা দাবি করে যে GPTZero এখনও perplexity এবং burstiness কে একটি বৃহত্তর সিস্টেমের ভেতরে কয়েকটি স্তরের একটি হিসেবে চালায়। সেই দাবি GPTZero-এর নিজস্ব বর্তমান প্রযুক্তি পৃষ্ঠা এবং তার নিজস্ব সহায়তা নথির সঙ্গে সরাসরি বিরোধী, এবং GPTZero-এর নিজস্ব সাইটে এমন দাবির কোনো সমর্থন নেই। কোনো কোম্পানি যখন নিজের প্রকাশিত পণ্য সম্পর্কে বর্ণনা দেয়, তখন একই পণ্যের বিষয়ে অসংগতিপূর্ণ তৃতীয় পক্ষের দাবির চেয়ে সেটিই অগ্রাধিকার পায়, যদিও বিক্রেতার নথিও ভুল হতে পারে। এই লেখাটি পর্যালোচনাটির বদলে GPTZero-এর নিজস্ব পৃষ্ঠাগুলিকে অনুসরণ করে, যেখানে পুরোনো গল্পটি পুনরাবৃত্তি করা হয়েছে।
এটি আপনার লেখার পদ্ধতির জন্য কী অর্থ বহন করে
burstiness ঘিরে গড়ে ওঠা ব্যবহারিক নির্দেশনা কেবল GPTZero-এর নিজস্ব উপকরণ থেকে শব্দটি অদৃশ্য হয়ে গেছে বলেই অকার্যকর হয়ে যায়নি। বাক্যের দৈর্ঘ্য ইচ্ছাকৃতভাবে পরিবর্তন করা এখনও, যান্ত্রিকভাবে, সেই একই পরিসংখ্যানগত একরূপতা এড়ানোর প্রশ্ন, যা একটি classifier খুব সম্ভবত শনাক্ত করার জন্য প্রশিক্ষিত, ভেতরে সে সংকেতকে যা-ই বলুক না কেন। বিক্রেতার স্থাপত্য পরিবর্তিত হলেও তার অন্তর্নিহিত পরামর্শ টিকে আছে, যদিও সেটিকে বর্ণনা করার শব্দভাণ্ডার বদলে গেছে।
এর কোনোটির জন্যই কারও কথাকে অন্ধভাবে মেনে নেওয়ার প্রয়োজন নেই, এই পোস্টেরটিও নয়। TextPulse-এর free perplexity checker এবং বিস্তৃত free tools collection আপনাকে দেখতে দেয়, কোনো detector, যে প্রজন্মেরই হোক না কেন, কখনও তা বিচার করার আগে আপনার নিজের খসড়া কোথায় দাঁড়িয়ে আছে।
যদি উত্তর আপনাকে আবার আপনার নিজের লেখার দিকে ফিরিয়ে নিয়ে যায়, তবে ব্যবহারিক পরবর্তী পদক্ষেপ হলো ইচ্ছাকৃতভাবে burstiness বাড়ানো এবং একটি academic paragraph জুড়ে বাক্যের দৈর্ঘ্য পরিবর্তন করা, যা মেট্রিক ছাড়াই একই কাজের বর্ণনা।
একটি detector যে প্রক্রিয়া চালায় তা বদলাতেই থাকবে, GPTZero ইতিমধ্যে একবার তা বদলেছে। যা স্থির থাকে তা হলো প্রকৃত প্রশ্ন, যা এই সাইটের AI detectors আসলে কীভাবে কাজ করে তার নির্দেশিকা-তে সম্পূর্ণভাবে আলোচিত হয়েছে: পূর্বানুমেয় লেখা কি machine-written লেখারই সমার্থক, কোনো বছরে কোন সূত্রটি প্রচলিত তা নির্বিশেষে।
সচরাচর জিজ্ঞাসিত প্রশ্ন
AI ডিটেক্টররা কি এখনও burstiness ব্যবহার করে? GPTZero-এর ক্ষেত্রে নয়, এবং সেই নামেও নয়। GPTZero-এর নিজস্ব support documentation জানায় যে এটি 2023 সালের শরতে detection-এর জন্য perplexity এবং burstiness ব্যবহার বন্ধ করেছে, deep-learning based architecture-এ স্থানান্তরের পর। Turnitin কখনও তার method-এর অংশ হিসেবে এই দুই term প্রকাশ করেনি, এবং এখন উভয় কোম্পানিই trained classifiers-এর কথা বলে।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.