AI Detection

AI ডিটেক্টর কি সঠিক? মিথ্যা পজিটিভ এবং পক্ষপাত

বিক্রেতারা 1 শতাংশের নিচে মিথ্যা পজিটিভ হার প্রকাশ করে। একই ডিটেক্টরগুলোকে অ-স্থানীয় ইংরেজি লেখার ওপর পরীক্ষা করা স্বাধীন গবেষকেরা 60 শতাংশেরও বেশি হার পেয়েছেন। প্রমাণ কী দেখায়, এখানে তা আছে।

সর্বশেষ আপডেট করা হয়েছে 13 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin দাবি করে যে তাদের false positive হার 1% এর কম। একদল স্বাধীন গবেষক non-native English speakers এর লেখা থেকে নেওয়া আরও বিস্তৃত পরিসরের নমুনায় একাধিক detector পরীক্ষা করেন। তারা দেখতে পান, একই ধরনের লেখায় গড় false positive হার 60% এরও বেশি ছিল। এই দুইটি সংখ্যাই বাস্তব, দুটিই প্রকাশিত হয়েছে, এবং দুটিই একই বাজারে বিক্রি হওয়া detector এর সঙ্গে সম্পর্কিত। AI detector কি নির্ভুল? তা নির্ভর করে আপনি কোন জনসংখ্যা পরীক্ষা করেছেন, কোন detector ব্যবহার করেছেন, এবং আপনার vendor শুরুতেই সেটিকে কীভাবে সংজ্ঞায়িত করেছে তার ওপর।

এই পোস্টে detector কীভাবে সেই score গণনা করে, তা আবার ব্যাখ্যা করা হবে না। mechanism, perplexity, token probability, classifier কীভাবে প্রশিক্ষিত হয়, তা অন্যত্র বিস্তারিতভাবে আলোচিত হয়েছে, এবং যদি আপনি না পড়ে থাকেন, তবে আগে তা পড়া মূল্যবান। এখানে গুরুত্বপূর্ণ হলো score তৈরি হওয়ার পর কী ঘটে, তা কত ঘন ঘন ভুল হয়, কার লেখার ক্ষেত্রে এটি সবচেয়ে বেশি ভুল হয়, এবং কোনো নির্দোষ ব্যক্তির বিরুদ্ধে false accusation আসলে কী খরচ ডেকে আনে।

AI detector কি নির্ভুল?

সর্বদা নয়, এবং marketing claim ও স্বাধীন পরীক্ষার মধ্যে ব্যবধান সুপ্রমাণিত। Debora Weber-Wulff নেতৃত্বাধীন একদল গবেষক 2023 সালে মানব ও ChatGPT text এর মিশ্রণের বিরুদ্ধে পরীক্ষা করা 14টি detection tool, যার মধ্যে 12টি free এবং 2টি commercial ছিল, সেগুলোর ফল প্রকাশ করেন। তারা দেখতে পান, এই tool গুলোর কোনোটিই নির্ভুল বা নির্ভরযোগ্য নয়, এবং machine text কে human হিসেবে চিহ্নিত করার একটি অন্তর্নিহিত পক্ষপাত আছে, উল্টোটা নয়। এই পরীক্ষায় অন্তর্ভুক্ত 2টি commercial tool ছিল Turnitin এবং PlagiarismCheck। text paraphrase করা হলে এই পরীক্ষার সব tool আরও খারাপ ফল করেছে।

কিন্তু দুই বছর পরেও, পরিস্থিতি স্থবির নয়। University of Chicago-এর Booth School-এর Brian Jabarian এবং Alex Imas-এর একটি working paper, Pangram, GPTZero এবং Originality.ai, এই তিনটি নতুন প্রবেশকারীকে, এবং একটি open-source প্রতিযোগীকে, ব্লগ, সংবাদ, পর্যালোচনা এবং কল্পকাহিনি থেকে নেওয়া প্রায় 2,000টি মানব-লিখিত রচনার মাধ্যমে পরীক্ষা করেছে। নিয়ন্ত্রিত পরীক্ষার শর্তে, এই সমষ্টির সেরা tool কখনও 99.8 percent accuracy-এর নিচে নামেনি এবং তার false positive rate নিম্ন স্তরে ধরে রেখেছে। open-source model-টি একটি random guesser-এর মতোই কাজ করেছে। পরিস্থিতি সত্যিই উন্নত হয়েছে। কিছুটা। সামান্য।

কিন্তু এখানে মূল ফাঁদটি হলো controlled শব্দটি। benchmark passage-গুলো পরিষ্কার, সম্পূর্ণ এবং পরিচিত শর্তে তৈরি। জমা দেওয়া essay নির্ভরযোগ্যভাবে এদের কোনোটিই নয়। বাস্তব জগতের ফলাফল lab ফলাফলের সঙ্গে অভিন্ন নাও হতে পারে, যেমন Turnitin-এর নিজস্ব chief product officer প্রকাশ্যে বলেছেন, যদিও এটি কোনো vendor-এর কাছ থেকে বিরল এবং উপকারী স্বীকারোক্তি। পরের অংশে vendor-এর সংখ্যাগুলোকে independent সংখ্যাগুলোর পাশে রাখা হয়েছে, যাতে ব্যবধানটি অনুমান না হয়ে দৃশ্যমান হয়।

Vendor-এর দাবি বনাম independent testing

নিচের table-টি চারটি detector নিজেদের সম্পর্কে যা দাবি করে, তার সঙ্গে independent researchers সরাসরি tool-গুলো পরীক্ষা করার সময় যা মেপেছেন, তা পাশাপাশি সাজিয়েছে। কেবল vendor column নয়, মাঝের দুইটি column একসঙ্গে পড়ুন।

ডিটেক্টরবিক্রেতা-দাবিকৃত নির্ভুলতাস্বতন্ত্রভাবে পর্যবেক্ষিতমিথ্যা পজিটিভ সম্পর্কে বিক্রেতা যা বলে
Turnitinফ্ল্যাগ করার আগে 98% আস্থার সীমা; নথি-স্তরে 1% এর কম মিথ্যা পজিটিভপ্রায় 80% নির্ভুলতা, 2023 সালের তুলনায় 12টি টুলের মধ্যে সেরা, টুলটির আগের সংস্করণে20% AI-written সীমার উপরে নথি-স্তরে 1% এর কম; বাক্য-স্তরে প্রায় 4%
GPTZeroস্বতন্ত্র RAID benchmark-এ 1% মিথ্যা পজিটিভ হারে 95.7% AI-text সনাক্তকরণসংক্ষিপ্ত অনুচ্ছেদে 96% নির্ভুলতা; 2025 সালের University of Chicago Booth গবেষণায় মিথ্যা পজিটিভ হার 1% এর নিচেRAID benchmark-এ 1% মিথ্যা পজিটিভ হার রিপোর্ট করে
Originality.ai99% নির্ভুলতা; 0.5% মিথ্যা পজিটিভ হার (Lite model), 1.5% (Turbo model)মিথ্যা পজিটিভ হার 1% এর নিচে, কিন্তু একই Booth গবেষণায় AI-written পাঠ্যের 10% থেকে 40% মিস করেছেmodel tier অনুযায়ী পৃথক মিথ্যা-পজিটিভ পরিসংখ্যান প্রকাশ করে
Pangramএটি বলে যে ত্রুটির হার প্রতিযোগী টুলগুলোর তুলনায় 38 গুণেরও বেশি কম; অ-স্থানীয় ইংরেজি লেখকদের বিরুদ্ধে কোনো পক্ষপাত নেই বলে জানায়Booth গবেষণায় নির্ভুলতা কখনও 99.8% এর নিচে নয়, মিথ্যা পজিটিভ হার প্রায় শূন্য10টি পাঠ্য ডোমেইন এবং 8টি ভাষা মডেল জুড়ে প্রায়-শূন্য মিথ্যা পজিটিভ হার দাবি করে

দুটি বিষয় স্পষ্টভাবে চোখে পড়ে। প্রথমত, সব বিক্রেতা-সংখ্যা এমন একটি ল্যাব থেকে এসেছে যা বিক্রেতার নিয়ন্ত্রণে, আর Booth-এর সংখ্যা এসেছে এমন গবেষকদের কাছ থেকে যাদের বিক্রির কিছু নেই। দ্বিতীয়ত, Turnitin ওই মধ্যবর্তী কলামে একেবারেই নেই, কারণ 2025 সালের গবেষণাটি এটিকে পরীক্ষা করেনি। সারণিতে এর স্বতন্ত্র সংখ্যা 2023 সালের আগের একটি তুলনার ওপর ভিত্তি করে, কিন্তু তা টুলটির পুরোনো সংস্করণে করা হয়েছিল, তাই সারণিটিকে সরাসরি তুলনাযোগ্য হিসেবে দেখার সময় এটি মনে রাখুন।

Turnitin-এর AI সনাক্তকরণ কতটা নির্ভুল?

Turnitin একক কোনো নির্ভুলতার সংখ্যা প্রকাশ করে না। এটি বরং একটি সীমা এবং একটি সমঝোতা প্রকাশ করে। কোম্পানিটি বলেছে, এটি কেবল তখনই একটি নথিকে চিহ্নিত করে যখন এটি 98 শতাংশ নিশ্চিত থাকে যে চিহ্নিত অংশটি AI-লিখিত, এবং এই সীমাই নথি-স্তরের false positive হারকে 1 শতাংশের নিচে রাখে। Turnitin অনুমান করেছে যে এটি AI-সহায়তাপ্রাপ্ত লেখার প্রায় 85 শতাংশ ধরতে পারে, আর বাকি অংশ ইচ্ছাকৃতভাবে ছেড়ে দেয়, ভুল অভিযোগের ঝুঁকি এড়াতে।

Turnitin sentence স্তরে যে প্রকৃত false positive শতাংশ ফেরত দেয়, যেখানে একটি interface পুরো নথির বদলে নির্দিষ্ট লাইনগুলো highlight করে, তা আসলে 4 শতাংশের কাছাকাছি। কোনো professor যদি পুরো নথির score-এর বদলে একটি চিহ্নিত paragraph-এর screenshot নেন, তাহলে এই সংখ্যাটি জানা গুরুত্বপূর্ণ, কারণ highlighted sentence-এর ভুল হওয়ার সম্ভাবনা তার পাশের document score-এর তুলনায় অর্থপূর্ণভাবে বেশি।

এটিও উল্লেখযোগ্য যে Turnitin এই ব্যবধানটি সরাসরি স্বীকার করেছে। তারা দেখেছে যে তাদের প্রথম বাস্তব-জগতের ফলাফল, বিশেষ করে ছোট নথির ক্ষেত্রে, তাদের lab test-এর ভিত্তিতে প্রত্যাশিত false positive হারের চেয়ে বেশি ছিল। তাই তারা scoring-এর জন্য ন্যূনতম নথির দৈর্ঘ্য 150 থেকে 300 শব্দে সমন্বয় করেছে। এটি এমন এক vendor, যে নিজের product সমন্বয় করছে, কারণ প্রকাশিত সংখ্যা lab-এর বাইরে টেকেনি, এবং এটি কোনো independent study যতটা বলে, ততটাই বলে।

একটি false positive বাস্তবে একজন শিক্ষার্থীর কতটা ক্ষতি করে

Yale's School of Management-এর একজন executive MBA শিক্ষার্থীর সঙ্গে এমনটাই ঘটেছিল। সবচেয়ে আক্ষরিক অর্থে, ওই শিক্ষার্থীর বিরুদ্ধে একটি violation আনা হয়েছিল। সংশ্লিষ্ট detector ছিল GPTZero। finance course-এর ওই শিক্ষার্থীর final exam একটি teaching assistant চিহ্নিত করেছিলেন, যিনি ভেবেছিলেন লেখাটি দীর্ঘ এবং জটিল, প্রায় নিখুঁত punctuation এবং grammar সহ। আর এই নির্দিষ্ট professor সেটিকে GPTZero-এর মাধ্যমে চালাচ্ছিলেন, যা উত্তরগুলোকে সম্ভবত AI-generated হিসেবে score করেছিল।

তিনি কোর্সে অকৃতকার্য হন এবং এক বছরের জন্য বরখাস্ত হন। 2025 সালের ফেব্রুয়ারিতে ফেডারেল আদালতে দায়ের করা তাঁর মামলায় দাবি করা হয়েছে যে Yale-এর নিজস্ব নীতি ঠিক এই কারণেই GPTZero-এর মতো সরঞ্জামের ব্যবহার সীমিত করে, অর্থাৎ অ-স্থানীয় ইংরেজি বক্তাদের বিরুদ্ধে এর নথিভুক্ত মিথ্যা পজিটিভ হার, এবং তিনি সেই নীতির বিরুদ্ধে এটি ব্যবহার করেছিলেন। তাঁর দাখিলপত্রে আরও উল্লেখ করা হয়েছে যে GPTZero Yale-এর নিজস্ব প্রাক্তন বিশ্ববিদ্যালয় সভাপতি এবং বিজনেস স্কুলের ডিনের একাডেমিক লেখায় 100 শতাংশ AI-generated স্কোর দিয়েছিল।

বিচারক 2025 সালের মে মাসে প্রাথমিক নিষেধাজ্ঞা জারি করতে অস্বীকার করেন। মামলাটি এখনও নিষ্পত্তি হয়নি, আমি যখন লিখছি তখনও। বাদী, একজন ফরাসি নাগরিক, দাবি করেন যে অ-স্থানীয় ইংরেজি বক্তাদের বিরুদ্ধে একই পরিচিত পক্ষপাত তাঁর লেখাকে এভাবে কাজ করতে বাধ্য করেছে। পরবর্তী অংশে আমরা সেটিই দেখি। বিতর্কের বিষয় নয় যা, তা হলো মূল্য, একটি ডিগ্রি প্রোগ্রাম থেকে এক বছর হারানো, একটি অকৃতকার্য গ্রেড, আইনি ব্যয়, এবং একটি স্কোর নিয়ে লড়াই করতে করতে কয়েক মাস, ডিগ্রি অর্জনের বদলে। 1 শতাংশ মিথ্যা পজিটিভ হার সামান্য শোনায়, যতক্ষণ না একটি বড় জনসংখ্যা সেটিকে কারও নির্দিষ্ট সমস্যায় পরিণত করে।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

কোন লেখন বৈশিষ্ট্য মানব পাঠ্যকে যন্ত্রনির্মিত বলে মনে করায়

সাধারণ লেখার চার ধরনের রূপ সবচেয়ে বেশি ঝুঁকি বহন করে, এবং এর কোনোটিতেই কেউ কিছু ভুল করছে এমন নয়। সংক্ষিপ্ত নথি, অত্যন্ত সূত্রবদ্ধ লেখা, উদ্ধৃত বা টেমপ্লেটভিত্তিক উপাদান, এবং কঠোরভাবে প্রুফরিড করা লেখা, এগুলো সবই মুক্তভাবে রচিত গদ্যের তুলনায় বেশি পূর্বানুমেয় বলে স্কোর করার প্রবণতা রাখে, আর সেটিই একমাত্র বৈশিষ্ট্য যা প্রতিটি detector আসলে মাপে। একটি free burstiness checker সেই একই তারতম্য সরাসরি মাপে, যা এর বর্ণনা পড়ার তুলনায় ধরণটি দেখার দ্রুততর উপায়।

কিছু genre নকশাগতভাবেই সূত্রনির্ভর। একটি methods section, একটি lab report, একটি standard cover letter এবং একটি literature review, সবই সৃজনশীল বাক্যের চেয়ে প্রচলিত বাক্যাংশকে বেশি গুরুত্ব দেয়, কারণ এই convention-ই document-টিকে তার পাঠকের কাছে ব্যবহারযোগ্য করে তোলে। গবেষকেরা এটি সরাসরি বাস্তব লেখায় পরীক্ষা করেছেন, তারা 1980 থেকে 2023 সালের মধ্যে প্রকাশিত 14,400টি journal abstract, অর্থাৎ এমন বছরগুলোতে যখন কোনো বড় language model ছিল না, একটি publicly available detector-এর মধ্যে চালান। প্রকাশনার বছর নির্বিশেষে সর্বোচ্চ 8 percent পর্যন্তকে AI-generated হিসেবে চিহ্নিত করা হয়েছিল, এবং New England Journal of Medicine-এর abstract-গুলোকে 10.24 percent হারে চিহ্নিত করা হয়েছিল, যা পরীক্ষিত 5টি journal-এর মধ্যে সর্বোচ্চ false positive rate।

এই test, ChatGPT সম্পর্কে কিছুই শনাক্ত করতে পারত না, কারণ এটি যে বছরগুলো নমুনা হিসেবে নিয়েছিল, তার বেশির ভাগ সময়ে ChatGPT-এর অস্তিত্বই ছিল না। এটি genre শনাক্ত করেছে। আরও আনুষ্ঠানিকভাবে বললে, detection problem সম্পর্কে 2026 সালের statistical analysis যেমন বলবে, এমন কোনো detector তৈরি করার উপায় নেই যা software দ্বারা লেখা বলে পূর্বানুমেয় একটি sentence এবং genre-র স্বভাব অনুযায়ী আপনি লেখেন বলে পূর্বানুমেয় একটি sentence, এই দুটির মধ্যে পার্থক্য করতে পারবে। বাইরে থেকে তারা একেবারে একই দেখায়।

অতিরিক্ত সম্পাদনাও অনুরূপ দিকে ঠেলে দেয়। একটি first draft-এ লেখকের নির্দিষ্ট অনিয়ম থাকে, অদ্ভুত word order, এমন sentence যা দীর্ঘ হয়ে যায় কারণ ভাবনাটিও দীর্ঘ হয়েছিল। একটি thorough proofreading pass, বিশেষ করে অন্য কোনো tool-এর মাধ্যমে চালানো হলে, ঠিক সেই অনিয়মগুলো মসৃণ করে সরিয়ে দিতে চায়। এখন পর্যন্ত detection tool-গুলোর সবচেয়ে বড় independent comparison 14টি tool পরীক্ষা করে দেখেছে, এবং পেয়েছে যে sample text paraphrase করা হলে বা machine-translated হলে, প্রতিটি tool-এর ক্ষেত্রেই accuracy আরও কমে যায়।

লেখন বৈশিষ্ট্যকেন এটি একটি নথির আপাত অনিশ্চয়তা কমায়প্রমাণ কী দেখায়
সংক্ষিপ্ত জমাকম পাঠ্য থাকলে মানবিক ছন্দকে যান্ত্রিক ছন্দ থেকে পৃথক করা স্বাভাবিক বৈচিত্র্যের জন্য কম জায়গা থাকেসংক্ষিপ্ত নথির স্কোর কয়েকটি অস্বাভাবিক বাক্যের প্রভাবে বেশি ওঠানামা করে
সূত্রবদ্ধ বা শাস্ত্র-নির্দিষ্ট লেখাধরনগত রীতি উদ্ভাবনী বাক্যের চেয়ে প্রত্যাশিত বাক্যাংশকেই পুরস্কৃত করেChatGPT-এর আগে প্রকাশিত 14,400টি জার্নাল সারসংক্ষেপ (1980 থেকে 2023) তবু 8% পর্যন্ত false positives সৃষ্টি করেছে, একটি জার্নালের সারসংক্ষেপে তা 10.24% এ পৌঁছেছে
প্রচুর সম্পাদিত বা paraphrased খসড়াএকটি পরিমার্জন পর্যায় সেই ব্যক্তিগত অনিয়মগুলো মসৃণ করে দেয়, যেগুলো একটি detector মানবিক বলে পড়েএকটি স্বাধীন 14-tool তুলনায় দেখা গেছে paraphrasing বা machine translation-এর পরে নির্ভুলতা আরও কমেছে
উদ্ধৃত বা টেমপ্লেটভিত্তিক উপাদানউদ্ধৃত অংশটি তার উৎসের পরিসংখ্যানগত স্বাক্ষর বহন করে, উদ্ধৃতিকারী লেখকের নয়যে detectors উদ্ধৃতি বাদ দেয় না, তারা আশপাশের নথিকে ধার করা পাঠ্যের ভিত্তিতে স্কোর করে

AI detectors কেন non-native English speakers-দের ভুলভাবে শ্রেণিবদ্ধ করে?

খারাপভাবে, এবং বড় ব্যবধানে। এটিই ছিল সেই গবেষণার উপসংহার, যা প্রথম এ বিষয়ে একটি সংখ্যা দিয়েছিল। Stanford-এর গবেষকেরা non-native English speakers-দের লেখা 91টি TOEFL essay এবং US অষ্টম-শ্রেণির শিক্ষার্থীদের লেখা 88টি essay-এর বিরুদ্ধে বহুল ব্যবহৃত সাতটি GPT detector চালান। detectorগুলো অষ্টম-শ্রেণির essayগুলো প্রায় সব সময়ই সঠিকভাবে পড়ে। কিন্তু TOEFL essayগুলোর ক্ষেত্রে, যেগুলো এমন প্রাপ্তবয়স্করা লিখেছিলেন যারা স্নাতকোত্তর-স্তরের English test দেওয়ার মতো যথেষ্ট সাবলীল ছিলেন, detectorগুলোর গড় false positive rate ছিল 61.3 percent। 91টি essay-এর মধ্যে 89টিকে অন্তত সাতটি detector-এর একটি GPT দ্বারা তৈরি বলে চিহ্নিত করেছে; ওই 18টি essay-কে সাতটি detector-ই চিহ্নিত করেছে।

যে প্রক্রিয়াটি বাকি সনাক্তকরণ ব্যবস্থাকে নিয়ন্ত্রণ করে, সেটিই এখানে কাজ করে, পূর্বানুমেয় শব্দভান্ডার এবং সহজতর বাক্যগঠন কম perplexity হিসেবে পড়া হয়, আর কম perplexity যান্ত্রিকভাবে তৈরি বলে ধরা হয়, কলম কার হাতে আছে তা নির্বিশেষে। দ্বিতীয় ভাষায় কাজ করা লেখকেরা সুপ্রতিষ্ঠিত বাক্যপ্রয়োগের ওপর নির্ভর করেন, কারণ অতিরিক্ত ভাষায় সাবলীলতা বাস্তবে এমনই দেখায়, এবং ঠিক এই প্রোফাইলটিই একটি detector চিহ্নিত করার জন্য তৈরি করা হয়েছে।

এই অবস্থানে থাকা লেখকেরা কেবল আরও স্বাভাবিকভাবে লেখার পরামর্শে উপকৃত হন না, কারণ স্বাভাবিক বলেই তো সেটি চিহ্নিত হয়েছিল। TextPulse's ESL academic writers-এর জন্য পৃষ্ঠা এই ঝুঁকির পেছনের বাক্যপ্রয়োগের ধরনগুলো আরও বিস্তারিতভাবে ব্যাখ্যা করে, যার মধ্যে রয়েছে কোন পরিবর্তনগুলো বাক্যের অর্থ না বদলে সেগুলোকে প্রভাবিত করে।

এটি কোনো বিচ্ছিন্ন ঘটনা ছিল না। 2025 সালের December মাসে একটি নতুন benchmark প্রকাশিত হয়, যা স্পষ্টভাবে এই detectors-এ পক্ষপাত মূল্যায়নের জন্য নকশা করা হয়েছিল। এতে একাধিক জনতাত্ত্বিক গোষ্ঠী ও ভাষাজুড়ে 200,000-এরও বেশি নমুনা অন্তর্ভুক্ত ছিল। Stanford-এর প্রথম গবেষণা থেকে দুই বছর পর প্রকাশিত হওয়া সত্ত্বেও এবং একই detectors-এর বহু ভিন্ন model version অন্তর্ভুক্ত করেও, এই benchmark প্রকাশ করে যে English language learners-এর প্রতি পক্ষপাত এখনও বিদ্যমান।

সব vendor-এর ক্ষেত্রে এমন নয়। Pangram-এর নিজস্ব technical documentation-এ বলা হয়েছে যে এর classifier অ-স্থানীয় English বক্তাদের বিরুদ্ধে পক্ষপাতদুষ্ট নয়। Chicago Booth-এর গবেষকেরা স্বাধীনভাবে এই দাবিটি পরীক্ষা করেননি, তবে এটি দেখায় যে detectors-এর নতুন প্রজন্ম সমস্যাটিকে উপেক্ষা না করে মাথায় রেখেই তৈরি করা হচ্ছে।

আপনি যদি দেখতে চান অন্য কেউ স্কোর করার আগে আপনার নিজের লেখা কোথায় দাঁড়ায়, তাহলে একটি free perplexity checker আপনাকে detector যে একই অন্তর্নিহিত সংখ্যা গণনা করত, সেটিই দেয়, কোনো কিছু আগে কোনো প্রতিষ্ঠানে জমা না দিয়েই।

আর কারা চিহ্নিত হয়, এবং কেন

অ-স্থানীয় ইংরেজি বক্তারা নথিভুক্ত ঝুঁকির মধ্যে সবচেয়ে বড় ঝুঁকি বহন করেন, কিন্তু একই পরিসংখ্যানগত যুক্তি অন্য লেখাকেও ধরে ফেলে। Weber-Wulff-এর দল দেখেছেন যে তারা যে 14টি টুল পরীক্ষা করেছিলেন, paraphrased পাঠ্যের ওপর চালালে সেগুলোর সবকটিই কম নির্ভুল ছিল, এটি একাডেমিক লেখার একটি উল্লেখযোগ্য অংশকে নির্দেশ করে, যা কোনো detector চালানোর আগে proofreader, editor, বা supervisor-এর লাল কলমের মধ্য দিয়ে গেছে।

এর কোনোটাই এই সংখ্যা অর্থহীন বোঝায় না, শুধু বোঝায় যে এটি কোনো নির্দিষ্ট ব্যক্তির সম্পর্কে কিছু বোঝানোর আগে corroboration দরকার। যদি আপনার কাছে এমন একটি text থাকে যা uniform, similar sentence lengths, similar rhythm throughout বলে মনে হয়, তবে তা কে লিখেছে বা কেন লিখেছে তা নির্বিশেষে বেশি machine-like হিসেবে score করবে। এটি অনুমান না করে সরাসরি free burstiness checker ব্যবহার করে যাচাই করা যেতে পারে।

দ্বিতীয়, কম আলোচিত একটি গোষ্ঠী সম্পর্কিত একটি সমস্যা মুখোমুখি হয়। গবেষকেরা প্রায় 60,000টি Reddit post তুলনা করেছেন, যেগুলোকে likely written by autistic authors হিসেবে চিহ্নিত একটি subset এবং একটি general sample-এ ভাগ করা হয়েছিল, এবং উভয়কেই GPT-2-based detector-এর মাধ্যমে চালিয়েছেন। উভয় গোষ্ঠীই সামগ্রিকভাবে 2 percent-এর নিচে flagged ছিল, কিন্তু likely-autistic subset-টি general sample-এর তুলনায় উল্লেখযোগ্যভাবে বেশি হারে flagged হয়েছিল। যে writing literal, repetitive, tightly patterned phrasing-এর দিকে ঝোঁকে, যা কিছু autistic communication style-এর একটি নথিভুক্ত বৈশিষ্ট্য, তা ঠিক সেই low-variation text তৈরি করে যা একটি detector ধরার জন্য নির্মিত।

কেন একটি আত্মবিশ্বাসী score, আত্মবিশ্বাসী অভিযোগ নয়

False positive rate শুনলে মনে হয় এটি এমন সম্ভাবনাকে বোঝায় যে problem হিসেবে flagged হওয়া কোনো এক student নির্দোষ। কিন্তু না। এটি বর্ণনা করে testটি প্রত্যেকের জন্য কীভাবে কাজ করে। আর এগুলো ভিন্ন প্রশ্ন, ভিন্ন উত্তরের সঙ্গে, ঠিক medicine বা security-তে যেকোনো screening test-এর মতো।

গ্রিফিথ বিশ্ববিদ্যালয়ের এক গবেষকের মার্চ 2026 সালের একটি পরিসংখ্যানগত বিশ্লেষণ অন্তর্নিহিত গণিতকে স্পষ্ট করে। AI সনাক্তকরণকে একক কোনো বিচ্ছিন্ন নথির ওপর নয়, বরং শিক্ষার্থী লেখকদের একটি জনসমষ্টির ওপর প্রয়োগ করা একটি পরীক্ষা হিসেবে ধরলে একটি বিনিময় সম্পর্ক দেখা দেয়: যখনই সেই জনসমষ্টির কিছু অংশ এমনভাবে লেখে যা স্বাভাবিকভাবে সাধারণ AI আউটপুটের সঙ্গে মিলে যায়, ঘরানাগত রীতির কাছাকাছি, দ্বিতীয় ভাষা শিক্ষার্থীর পরিসরের কাছাকাছি, তখন AI-লিখিত কাজ ধরতে বাস্তব ক্ষমতাসম্পন্ন যেকোনো ডিটেক্টরকে সেই ওভারল্যাপিং অংশের কিছু ক্ষেত্রে ভুল করতে হবে। এটি কোনো নির্দিষ্ট ডিটেক্টর খারাপভাবে নির্মিত হওয়ার দাবি নয়। এটি হলো একক নথি এবং অন্য কোনো প্রমাণ ছাড়া একটি বৈচিত্র্যময় জনসমষ্টিকে পরীক্ষা করার একটি বৈশিষ্ট্য।

পেপারের নিজস্ব উদাহরণটি সংশ্লিষ্ট মাত্রা দেখায়। ধরুন, একটি শিক্ষার্থী জনসমষ্টির 10 শতাংশ এমনভাবে লেখে যা সাধারণ AI আউটপুটের যথেষ্ট কাছাকাছি, এবং একটি ডিটেক্টরকে প্রকৃত AI-লিখিত কাজের 80 শতাংশ ধরার জন্য সমন্বয় করা হয়েছে। তখন গণিত অনুযায়ী সেই জনসমষ্টি জুড়ে গড় false positive হার অন্তত 7.5 শতাংশ হতে হবে। এটি ডিটেক্টরের প্রকৌশলগত ত্রুটি নয়, এটি সেই গোষ্ঠীর লেখার সঙ্গে সনাক্ত করা বস্তুর পরিসংখ্যানগত ওভারল্যাপের পরিমাণের সরাসরি ফল।

10,000 শিক্ষার্থীর একটি বিশ্ববিদ্যালয়ে এটি প্রয়োগ করলে, কেবল এই নিম্নসীমাই জনসমষ্টি জুড়ে আনুমানিক 750টি false flag নির্দেশ করে, যা অন্য কোনো প্রমাণ বিবেচনা না করে একক নথির বিরুদ্ধে বৈচিত্র্যময় জনসমষ্টিকে পরীক্ষা করার একটি গাণিতিক পরিণতি। পেপারের লেখক স্পষ্ট করেছেন যে এই নির্দিষ্ট সংখ্যাগুলি বাস্তব কোনো প্রতিষ্ঠানে মাপা নয়, বরং উদাহরণমূলক। উদাহরণটি কোনো একটি ক্যাম্পাসের জন্য নির্দিষ্ট পূর্বাভাস নয়, বরং সমস্যাটির কাঠামো দেখায়।

একটি প্রতিরক্ষাযোগ্য AI সনাক্তকরণ নীতি কেমন দেখায়

Yale ইতিমধ্যেই এমন একটি নীতি ছিল যা reportedly GPTZero-এর মতো টুল সীমিত করে, এই নিবন্ধে যে কারণগুলি তুলে ধরা হয়েছে তার কাছাকাছি কারণেই, একটি নথিভুক্ত false positive হার এবং স্থানীয় ভাষাভাষী নন এমন ইংরেজি লেখকদের বিরুদ্ধে নথিভুক্ত পক্ষপাত। তাই এটি এতটা কোনো এক দুর্ভাগা শিক্ষার্থীর গল্প নয়, যতটা বিদ্যমান একটি নিয়ম অনুসরণ না করার গল্প। যখন কোনো নীতি সত্যিই একটি স্কোর এবং একটি রায়ের মধ্যে পার্থক্যটি কার্যকর করে, তখন একটি স্কোর রায় না হয়ে কেবল একটি ইনপুট হয়ে ওঠে।

  • স্কোরটিকে একটি ইনপুট হিসেবে বিবেচনা করুন, কখনওই অসদাচরণের সিদ্ধান্তের একমাত্র ভিত্তি হিসেবে নয়
  • এটি শিক্ষার্থীদের বিরুদ্ধে ব্যবহার করার আগে টুলটির প্রকাশিত false positive rate প্রকাশ করুন
  • সংক্ষিপ্ত জমা এবং non-native English লেখার ক্ষেত্রে অতিরিক্ত সতর্কতা প্রয়োগ করুন, উভয়ই নথিভুক্ত দুর্বল দিক
  • আপিলের এমন একটি পথ নিশ্চিত করুন, যা একটি পরিসংখ্যানকে অপ্রমাণিত করতে দাবি করে না

এর কোনোটিই অদ্ভুত নয়। এটি অন্য যেকোনো স্থানে একক forensic evidence-এর সঙ্গে যেভাবে আচরণ করা উচিত, তারই কাছাকাছি, উপযোগী, যাচাইযোগ্য, এবং নিজে থেকে কখনওই যথেষ্ট নয়।

একজন ব্যক্তিগত লেখকের ক্ষেত্রে, একই নীতি স্কোর অস্তিত্বে আসার আগেই প্রযোজ্য, পরে নয়। যেকোনো টুলের একটি একক সংখ্যা একটি অনুমান, রায় নয়, এবং এটিকে উভয় দিকেই নিশ্চিত সত্য হিসেবে, নিরাপদ বা ধরা পড়েছে, বিবেচনা করা সংখ্যাটির সামর্থ্যের চেয়ে বেশি কিছু দাবি করে।

TextPulse-এর নিজস্ব AI humanizer tool একই যুক্তিতে একটি Human Score জানায়, আপনার নিজের পাঠ্য থেকে গণনা করা একটি অনুমান, এটির ওপর detector-এর রায় নয়, একটি খসড়া বর্তমানে কীভাবে পড়া হচ্ছে তার সংকেত হিসেবে উপযোগী, কোনো নির্দিষ্ট detector কী বলবে সে সম্পর্কে প্রতিশ্রুতি নয়।

নির্ভুলতার প্রশ্নটি আরও সংকীর্ণ প্রশ্নে বিভক্ত হয়, প্রতিটির জন্য আলাদা একটি পৃষ্ঠা আছে। Turnitin-এর false positive rate এবং ZeroGPT-এর accuracy সম্পর্কে নির্দিষ্ট প্রমাণ আলাদাভাবে আলোচিত হয়েছে। যদি কোনো স্কোর ইতিমধ্যে আপনার বিরুদ্ধে ব্যবহার করা হয়ে থাকে, তবে AI ব্যবহার করার অভিযোগ উঠলে কী করতে হবে, আপনি AI ব্যবহার করেননি তা প্রমাণ করার জন্য যে প্রমাণ সংগ্রহ করতে পারেন, এবং একটি আপিল পত্র লেখা সম্পর্কে ব্যবহারিক অংশ রয়েছে, যা স্কোরের নিজস্ব শর্তে তার উত্তর দেয়।

যেকোনো প্রতিবেদনের সংখ্যা বিক্রেতারা তাদের মডেল পুনঃপ্রশিক্ষণ করতে থাকলে এবং গবেষকেরা সেগুলোকে আরও কঠিন কেসের বিরুদ্ধে পরীক্ষা করতে থাকলে পরিবর্তিত হতে থাকবে। কিন্তু যা পরিবর্তিত হওয়া উচিত নয় তা হলো এর নিচের অভ্যাস, একটি স্কোরকে কয়েকটির মধ্যে একটি পরিমাপ হিসেবে পড়ুন, এটি কোন জনসংখ্যার ওপর যাচাই করা হয়েছিল তা জিজ্ঞাসা করুন, এবং বিক্রেতা সেই কেসগুলো সম্পর্কে কী বলছে না, যেগুলোতে এটি এখনও ভুল করে, তা জিজ্ঞাসা করুন।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

হ্যাঁ। Weber-Wulff এবং সহকর্মীরা 2023 সালের একটি তুলনামূলক গবেষণায় AI-সনাক্তকরণ সরঞ্জামকে 'neither accurate nor reliable' বলে পেয়েছিলেন, এবং অ-স্থানীয় ইংরেজি লেখকেরা সর্বোচ্চ নথিভুক্ত ঝুঁকির মুখে পড়েন, একটি গবেষণায় TOEFL প্রবন্ধে গড় মিথ্যা পজিটিভ হার 60 শতাংশেরও বেশি পাওয়া গেছে। একটি একক স্কোর নিজে থেকে কোনো কিছুর প্রমাণ নয়, তাই অভিযোগের ভিত্তি হিসেবে এটিকে কখনোই একমাত্র প্রমাণ হওয়া উচিত নয়।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।