AI ডিটেক্টররা কি এখনও perplexity এবং burstiness-এর ওপর নির্ভর করে?
GPTZero perplexity এবং burstiness-কে বিখ্যাত করেছিল, তারপর autumn 2023-এ নীরবে উভয়কেই একটি deep-learning classifier-এর পক্ষে অবসর দেয়। এই পোস্টটি কী বদলেছে, GPTZero এবং Turnitin আজ আসলে কী নথিভুক্ত করে, এবং কেন এই দুই পরিসংখ্যান এখনও ব্যাখ্যা করে যে machine text কেন detectable, যদিও কোনো vendor-ই আর সেগুলো সরাসরি গণনা করে না, তা অনুসরণ করে।
আজ GPTZero কীভাবে AI লেখা শনাক্ত করে তা খুঁজলে, যে উত্তরগুলো বেশি দেখা যায় সেগুলোর বেশিরভাগই এখনও দুটি পরিসংখ্যান, perplexity এবং burstiness, এর ওপর কেন্দ্রীভূত থাকে, এই জুটি GPTZero-কে 2023 সালের January মাসে চালু হওয়ার কয়েক সপ্তাহের মধ্যেই পরিচিত করে তুলেছিল। কিন্তু GPTZero-এর নিজস্ব support documentation এখন ভিন্ন কথা বলে, এটি সেই একই বছরের autumn-এ এই দুটিই ব্যবহার করা বন্ধ করেছে।
তাহলে কি AI detector-গুলোতে burstiness এখনও ব্যবহৃত হয়? যে tool এই শব্দটিকে academic circles-এ বহুল পরিচিত করেছিল, তার ক্ষেত্রে নয়। GPTZero-এর support center স্পষ্টভাবে বলে যে এটি আর perplexity বা burstiness ব্যবহার করে না, বরং deep-learning architecture-এ সরে গেছে। Turnitin, যে tool-এর মুখোমুখি অধিকাংশ student বাস্তবে হয়, তার method-এর অংশ হিসেবে শুরু থেকেই এই দুই term-এর কোনোটিই প্রকাশ করেনি। এই ধারণাগুলো conversation থেকে হারিয়ে যায়নি। এগুলো হারিয়ে গেছে সেই product-গুলো থেকে, যেগুলো আসল detection করে।
AI Detector-গুলোতে কি Burstiness এখনও ব্যবহৃত হয়?
না, GPTZero-এর ক্ষেত্রে নয়, এবং নাম ধরে তো নয়ই। GPTZero-এর নিজস্ব support documentation সরাসরি তা বলে: "As of autumn 2023, GPTZero no longer uses perplexity and burstiness for its AI detection because we migrated to a deep-learning based architecture." Turnitin-এর নিজস্ব guide-গুলো আবার ভিন্ন একটি method বর্ণনা করে, যেখানে trained classifier দিয়ে একটি submission-এর অংশগুলোকে score করা হয়, এবং সেই documentation-এও এই দুই term-এর কোনোটিই কোথাও নেই। AI detection-এর প্রথম wave-কে সংজ্ঞায়িত করা এই দুটি পরিসংখ্যান বর্তমানে leading tool-গুলো যা চালায়, তা নয়। তবে এর মানে এই নয় যে এগুলো পুরোপুরি বাদ দেওয়া হয়েছে: GPTZero-এর নিজস্ব explainer এখনও এগুলোকে তার model-এ input দেওয়া সাতটি indicator-এর মধ্যে গণ্য করে। এগুলো measurement হিসেবে থেকে গেছে, method হিসেবে নয়, এবং এই দুই দাবির পার্থক্যই এই প্রশ্নের মূল বিষয়গুলোর বেশিরভাগ নির্ধারণ করে।
Autumn 2023-এ কী বদলাল
এই দুইটি শব্দ কখনোই অস্পষ্ট ছিল না। GPTZero-এর নিজস্ব প্রাথমিক ব্যাখ্যায় perplexity-কে সংজ্ঞায়িত করা হয়েছিল "একটি পরিমাপ, যা দেখায় যে একটি AI model নথিতে পাওয়া শব্দগুলোর ঠিক একই সেট বেছে নেওয়ার কতটা সম্ভাবনা ছিল," এবং burstiness-কে সংজ্ঞায়িত করা হয়েছিল "একটি পরিমাপ, যা দেখায় যে লেখার ধরন এবং পাঠ্যের perplexity পুরো নথিজুড়ে কতটা পরিবর্তিত হয়," এটি একটি নথি-স্তরের পরিসংখ্যান, কোনো সরল বাক্য-দৈর্ঘ্য গণনা নয়। এই দুইটি সংজ্ঞাই এখনও GPTZero-এর সাইটে প্রকাশিত আছে। যা বদলেছে, তা হলো detector আসলে এদের মধ্যে কোনটিকে চালায়।
"Migrated to a deep-learning based architecture" একটি নির্দিষ্ট দাবি, কোনো marketing phrase নয়, এবং এটি প্রকৃত ধরনের পরিবর্তনকে বর্ণনা করে। একটি perplexity score সরাসরি একটি সূত্র থেকে গণনা করা হয়: পাঠ্যটিকে একটি reference language model-এর মধ্য দিয়ে চালান, log probabilities-এর গড় নিন, ফলাফলকে exponentiate করুন। এর বদলে একটি deep-learning classifier প্রশিক্ষিত হয়, যেখানে তাকে বিপুল সংখ্যক মানব-লিখিত এবং AI-written উদাহরণ দেখানো হয়, যতক্ষণ না এটি নিজে থেকেই training data-তে দুইটি স্তূপকে আলাদা করে এমন বৈশিষ্ট্যের যেকোনো সমন্বয় শিখে নেয়। দ্বিতীয় পদ্ধতিতে নিয়মটি কেউ হাতে লিখে দেয় না। model সেটি খুঁজে বের করে।
এই সাইটের অন্যত্র retired হওয়া দুইটি শব্দের পূর্ণ ব্যাখ্যা দেওয়া আছে: perplexity আসলে কী পরিমাপ করে এবং burstiness আসলে কী পরিমাপ করে শিরোনামের অংশগুলো তাদের নিজস্ব কার্যপ্রণালী গভীরভাবে ব্যাখ্যা করে, এর মধ্যে তাদের পেছনের সূত্রও রয়েছে। এই অংশটি কেবল এই প্রশ্নে সীমিত থাকে যে আজও detector যা চালায়, তা কি এদের যেকোনো একটি।
GPTZero এবং Turnitin আজ আসলে কী নথিভুক্ত করে
বর্তমান GPTZero technology page, যা product-এ কী সরবরাহ করা হয় তা বর্ণনা করে, বলে যে তাদের detector একটি "end-to-end deep learning approach", যেখানে একটি "sentence-by-sentence classification model" আছে, যা confidence score-সহ একটি probability output তৈরি করে। Perplexity এবং burstiness ওই page-এর কোথাও নেই, component হিসেবে নয়, legacy feature হিসেবেও নয়, footnote-এও নয়।
Turnitin-এর ডকুমেন্টেশন শুরু থেকেই এই দুইটি শব্দকে কেন্দ্র করে তৈরি হয়নি। এর নির্দেশিকাগুলোতে জমা দেওয়া লেখা কয়েকশো শব্দের খণ্ডে ভাগ করা হয়, প্রতিটি খণ্ডকে একটি প্রশিক্ষিত মডেল দিয়ে স্কোর করা হয়, এবং সেই খণ্ডগুলোর স্কোর গড় করে প্রতিবেদনে দেখানো একক শতাংশ নির্ধারণ করা হয়। এটি পাঠ্যের অংশগুলোর ওপর কাজ করা একটি supervised classifier, GPTZero যে ধরনের পদ্ধতিতে গেছে সেই একই পরিবারের পদ্ধতি, এটি perplexity গণনা নয়, এবং ভিন্ন নামে burstiness গণনাও নয়।
এই পরিবর্তনটি পাশাপাশি দেখলে সবচেয়ে সহজে বোঝা যায়।
| প্রাথমিক ব্যাখ্যাগুলো যা বর্ণনা করেছিল (2023) | বর্তমান ডকুমেন্টেশন যা বর্ণনা করে | |
|---|---|---|
| GPTZero | Perplexity এবং burstiness, একটি reference model-এর বিপরীতে স্কোর করা | বাক্য থেকে বাক্যে কাজ করা একটি deep-learning classifier, যা একটি probability এবং confidence score আউটপুট করে |
| Turnitin | কখনও প্রকাশিত হয়নি, Turnitin-এর নিজস্ব উপকরণে এই শব্দগুলো কোনো সময়েই দেখা যায় না | কয়েকশো শব্দের খণ্ড, একটি প্রশিক্ষিত classifier দিয়ে স্কোর করা, এবং তা এক শতাংশে গড় করা |
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
ধারণাগুলো এখনো কেন শনাক্তযোগ্যতা ব্যাখ্যা করে
এর কোনোটাই perplexity এবং burstiness-কে ভুল করে না, কেবল বর্তমান প্রক্রিয়ার বর্ণনা হিসেবে সেগুলোকে পুরোনো করে তোলে। উভয় ধারণাই সবসময়ই একটি বাস্তব বিষয় বর্ণনা করছিল: কোনো model-এর নিজস্ব সর্বোচ্চ সম্ভাব্য continuations-এর দিকে sampling করে তৈরি লেখা, একজন মানুষ শুরু থেকে যে লেখা লেখে তার তুলনায়, শব্দে শব্দে বেশি পূর্বানুমানযোগ্য হতে থাকে; এটি এক বাক্য থেকে পরের বাক্যে কম পরিবর্তিত হতে থাকে। অন্তর্নিহিত নিয়মিততা বদলায়নি, কারণ কোনো vendor তার detector-এর স্থাপত্য বদলেছে। বদলেছে কেবল detector কীভাবে সেটির খোঁজ করে।
প্রশিক্ষিত শ্রেণিবিন্যাসককে স্পষ্টভাবে perplexity বা burstiness খুঁজতে বলা হয় না। বরং, এটি মানব ও যন্ত্র-উৎপন্ন পাঠ্যের মধ্যে সেই একই মৌলিক পার্থক্যের ওপর প্রশিক্ষিত, যেটি এই দুই পরিসংখ্যান ধরার জন্য নকশা করা হয়েছিল। এবং এটি অত্যন্ত অসম্ভব বলে মনে হয় যে, দুইটি স্তূপকে আলাদা করতে প্রশিক্ষিত একটি শ্রেণিবিন্যাসক ঠিক সেই নিয়মিততার ওপরও নির্ভর করবে না, যা এই দুইয়ের মধ্যে সবচেয়ে নির্ভরযোগ্য পার্থক্যগুলির একটি। এটি ব্যাখ্যা করে কেন শ্রেণিবিন্যাসকটি সম্ভবত কাজ করে, তার প্রকাশিত বৈশিষ্ট্য তালিকা সম্পর্কে কোনো দাবি নয়, এবং এই দুই বিষয়কে পৃথক রাখা উচিত।
স্বাধীন গবেষণা এই ধারণাকে সমর্থন করে যে অন্তর্নিহিত পরিসংখ্যানটি এখনও কার্যকর, এমনকি কোনো একক বিক্রেতার পণ্যের বাইরেও। DetectGPT, 2023 সালে প্রকাশিত একটি একাডেমিক zero-shot পদ্ধতি, perplexity-এর একটি ঘনিষ্ঠ আত্মীয়ের দিকে তাকায়, অর্থাৎ একটি মডেলের log-probability function কোনো অনুচ্ছেদের চারপাশে কতটা তীব্রভাবে বেঁকে যায়, এবং একটি benchmark-এ 0.95 AUROC অর্জন করে, যেখানে সেরা পূর্ববর্তী zero-shot baseline-এর মান ছিল 0.81, এবং তা কোনো labeled example-এর ওপর classifier প্রশিক্ষণ না দিয়েই। মূল ধারণাটি, যে machine-generated text একটি মডেলের নিজস্ব probability space-এর পরিসংখ্যানগতভাবে পৃথক অঞ্চলে অবস্থান করে, এখনও সক্রিয় গবেষণার বিষয়। এটি কেবল GPTZero ব্যবহারকারীদের কাছে যা সরবরাহ করে, তা নয়।
কেন ইন্টারনেটের এত বড় অংশ এখনও এটি ভুল বোঝে
AI detection কীভাবে কাজ করে, সে বিষয়ে প্রকাশিত অধিকাংশ ব্যাখ্যা GPTZero-এর 2023 সালের জানুয়ারির launch-এর সময় বা তার কিছু পরেই লেখা হয়েছিল, যখন perplexity এবং burstiness-ই ছিল কোম্পানির নিজস্ব একমাত্র প্রকাশ্য ব্যাখ্যামূলক কাঠামো। সেই মূল explainer page-গুলি আজও live আছে। 2023 সালের শরতের retirement notice একটি পৃথক support page-এ রয়েছে, সেগুলোর মধ্যে অন্তর্ভুক্ত করা হয়নি, তাই যে লেখক প্রথম page পড়ে গবেষণা থামিয়ে দিয়েছিলেন, তার method এক বছরেরও কম সময় পরে বদলে গিয়েছিল, তা জানার কোনো কারণ থাকত না।
2026 সালে প্রচারিত একটি তৃতীয় পক্ষের ডিটেক্টর পর্যালোচনা দাবি করে যে GPTZero এখনও perplexity এবং burstiness কে একটি বৃহত্তর ব্যবস্থার ভেতরে কয়েকটি স্তরের মধ্যে এক স্তর হিসেবে চালায়। সেই দাবি GPTZero-এর নিজস্ব বর্তমান প্রযুক্তি পৃষ্ঠা এবং তার নিজস্ব সহায়তা নথির সঙ্গে সরাসরি বিরোধী, এবং GPTZero-এর নিজস্ব সাইটে এমন কিছু নেই যা সেটিকে সমর্থন করে। কোনো কোম্পানি যখন নিজের প্রকাশিত পণ্যকে বর্ণনা করে, তখন একই পণ্যের বিষয়ে অসংগতিপূর্ণ তৃতীয় পক্ষের দাবির চেয়ে সেটিই অগ্রাধিকার পায়, যদিও বিক্রেতার নথিও ভুল হতে পারে। এই লেখাটি পর্যালোচনাটির বদলে GPTZero-এর নিজস্ব পৃষ্ঠাগুলিকে অনুসরণ করে, কারণ পর্যালোচনাটি পুরোনো গল্পটিই পুনরাবৃত্তি করছে।
এটি আপনার লেখার পদ্ধতির জন্য কী অর্থ বহন করে
burstiness ঘিরে গড়ে ওঠা ব্যবহারিক নির্দেশনা কেবল এই কারণে অকার্যকর হয়ে যায়নি যে শব্দটি GPTZero-এর নিজস্ব উপকরণ থেকে অদৃশ্য হয়ে গেছে। বাক্যের দৈর্ঘ্য ইচ্ছাকৃতভাবে পরিবর্তন করা এখনও, যান্ত্রিকভাবে, সেই একই পরিসংখ্যানগত একরূপতা এড়ানোর বিষয়ে একটি যুক্তি, যেটি একটি classifier খুব সম্ভবত শনাক্ত করার জন্য প্রশিক্ষিত, ভেতরে সেটি যে নামই দিক না কেন। বিক্রেতার স্থাপত্যগত পরিবর্তন সত্ত্বেও অন্তর্নিহিত পরামর্শটি টিকে আছে, যদিও সেটিকে বর্ণনা করার শব্দভাণ্ডার টেকেনি।
এর কোনোটির জন্যই কারও কথাকে মেনে নেওয়ার প্রয়োজন নেই, এই পোস্টটিরও নয়। TextPulse-এর free perplexity checker এবং বিস্তৃত free tools collection আপনাকে দেখতে দেয়, কোনো detector, যে প্রজন্মেরই হোক না কেন, তা করার আগেই আপনার নিজের খসড়া কোথায় দাঁড়িয়ে আছে।
যদি উত্তর আপনাকে আবার আপনার নিজের লেখার দিকে ফিরিয়ে নিয়ে যায়, তবে পরবর্তী ব্যবহারিক পদক্ষেপ হলো ইচ্ছাকৃতভাবে burstiness বৃদ্ধি করা এবং একটি academic paragraph জুড়ে বাক্যের দৈর্ঘ্য পরিবর্তন করা, যা metric ছাড়া একই কাজেরই বর্ণনা।
একটি detector যে mechanism চালায় তা বদলাতেই থাকবে, GPTZero ইতিমধ্যে একবার তা বদলেছে। যা স্থির থাকে তা হলো প্রকৃত প্রশ্ন, যা এই সাইটের AI detectors actually work কীভাবে কাজ করে তার guide-এ সম্পূর্ণভাবে আলোচিত হয়েছে: পূর্বানুমেয় লেখা কি machine-written লেখারই সমার্থক, কোনো নির্দিষ্ট বছরে যে formula-ই জনপ্রিয় হোক না কেন।
সচরাচর জিজ্ঞাসিত প্রশ্ন
AI ডিটেক্টররা কি এখনও burstiness ব্যবহার করে? GPTZero-এর ক্ষেত্রে নয়, এবং সেই নামেও নয়। GPTZero-এর নিজস্ব support documentation জানায় যে autumn 2023 থেকে, deep-learning based architecture-এ স্থানান্তরের পর, এটি detection-এর জন্য perplexity এবং burstiness ব্যবহার করা বন্ধ করেছে। Turnitin কখনও তার method-এর অংশ হিসেবে এই দুই term-এর কোনোটিই প্রকাশ করেনি, এবং এখন উভয় কোম্পানিই trained classifiers-এর কথা বলে।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.