কেন AI Detectors অ-স্থানীয় ইংরেজি লেখকদের বিরুদ্ধে পক্ষপাতদুষ্ট
2023 সালের Stanford গবেষণায় দেখা গেছে, সাবলীল অ-স্থানীয় ইংরেজি লেখা native লেখার তুলনায় অনেক বেশি হারে machine-generated হিসেবে ভুলভাবে পড়া হয়। এই ব্যবধানের পেছনের প্রক্রিয়া এবং একই প্রবন্ধগুলো আরও সমৃদ্ধ শব্দভান্ডার দিয়ে পুনর্লিখিত হলে কী ঘটেছিল, তা এখানে ব্যাখ্যা করা হয়েছে.
AI detectors non-native বক্তাদের বিরুদ্ধে পক্ষপাতদুষ্ট, এটি কোনো ব্যক্তিগত অভিযোগ নয়। 2023 সালের একটি peer-reviewed Stanford গবেষণা এটি সরাসরি পরিমাপ করেছে। গবেষকেরা non-native English speakers দ্বারা লেখা 91টি বাস্তব TOEFL essay এবং American eighth-graders দ্বারা লেখা 88টি essay-এর ওপর সাতটি বহুল ব্যবহৃত GPT detector চালান, তারপর প্রতিটি দলের স্কোর তুলনা করেন।
detectorগুলো eighth-grade essayগুলো প্রায় সব সময়ই সঠিকভাবে পড়েছে। TOEFL essayগুলোতে, যা এমন প্রাপ্তবয়স্কদের লেখা ছিল যারা ইতিমধ্যে graduate-level English proficiency exam পাস করেছিলেন, একই সাতটি tool গড়ে 61.22 percent false positive rate দেখায়। 91টি essay-এর মধ্যে 89টি, প্রায় 98 percent, অন্তত সাতটি tool-এর একটিতে AI-generated হিসেবে চিহ্নিত হয়।
TextPulse-এর AI detector accuracy সম্পর্কে বিস্তৃত প্রমাণের সংক্ষিপ্ত বিবরণে এই প্রধান ফলাফল এবং পরে তা থেকে উদ্ভূত মামলাগুলো আলোচিত হয়েছে। গবেষণাটি যেখানে উদ্ধৃত হয়, প্রায় সর্বত্র যে বিষয়টি বাদ পড়ে, তা হলো mechanism, অর্থাৎ কেন graduate-level English speaker-এর গদ্য প্রথমেই machine-made বলে পড়া হয়, এবং যখন তা আর সেভাবে পড়া হয় না, তখন কী পরিবর্তন ঘটে।
AI Detectors Non-Native Speakers-এর বিরুদ্ধে পক্ষপাতদুষ্ট, The Mechanism
একটি detector কখনো অর্থের জন্য পড়ে না। এটি পড়ে প্রতিটি শব্দ কতটা predictable, তার আগে আসা শব্দগুলোর ভিত্তিতে, এবং কোনো passage-কে কম score দেয় যখন modelটি আগেই তার অধিকাংশ অনুমান করতে পারত। Lexical diversity, অর্থাৎ একজন লেখক কতটা বিস্তৃত vocabulary ব্যবহার করেন, নিরাপদ শব্দের ছোট একটি সেট বারবার না দোহরিয়ে, এবং syntactic predictability, অর্থাৎ sentence structure ভাষার সবচেয়ে সাধারণ pattern কতটা ঘনিষ্ঠভাবে অনুসরণ করে, তা না বদলে, ভাষা উৎপাদনের এমন দুইটি বৈশিষ্ট্য যা এই score কমিয়ে দেয়।
এই পার্থক্যটি গুরুত্বপূর্ণ, কারণ পৃষ্ঠায় দুটিকে ভিন্নভাবে দেখা যায়। শব্দভান্ডারের বৈচিত্র্য নিজেই শব্দগুলিকে নিয়ে: যে লেখক তিনটি ভিন্ন বাক্যে 'obtain,' 'acquire,' এবং 'secure' ব্যবহার করেন, তাঁকে সেই লেখকের তুলনায় বেশি বৈচিত্র্যময় বলে পড়া হয়, যিনি তিনবার 'get' লেখেন, যদিও অন্য সব দিক থেকে বাক্যগুলো অভিন্ন। বাক্যগঠনগত পূর্বানুমেয়তা গঠনকে নিয়ে: subject, verb, object, বারবার পুনরাবৃত্ত, এমন একটি বাক্যের বদলে যা একটি subordinate clause দিয়ে শুরু হয় বা অপ্রত্যাশিত কোনো শব্দে শেষ হয়। পরীক্ষার পরিস্থিতিতে কাজ করা দ্বিতীয় ভাষার একজন লেখকের জন্য উভয়েরই নিরাপদ সংস্করণে ঝোঁকার যথেষ্ট কারণ আছে।
দ্বিতীয় ভাষায় লেখা নির্ভরযোগ্যভাবে উভয়েরই কম মাত্রা দেখায়, এবং তা কোনো ঘাটতি হিসেবে নয়। অতিরিক্ত একটি ভাষায় কাজ করা লেখক এমন শব্দভান্ডার ও বাক্য-প্যাটার্নের ওপর নির্ভর করেন, যেগুলো সঠিক হওয়ার সম্ভাবনা সবচেয়ে বেশি, কারণ ভাষাটি এখনো পুরোপুরি স্বয়ংক্রিয় না হলে ভুল অনুমানের মূল্য বেশি। detector bias নথিভুক্ত করা Stanford paper ঠিক এই ধরনের একটি pattern নিয়ে applied-linguistics research-এর একটি corpus উদ্ধৃত করে, যা AI detectors-এর আগেই সুপ্রতিষ্ঠিত ছিল: reduced lexical richness, reduced lexical diversity, এবং simpler sentence structure, এগুলো দ্বিতীয় ভাষায় লেখার নথিভুক্ত, পরিমাপযোগ্য বৈশিষ্ট্য, অন্য কিছুর লক্ষণ নয়।
স্থানীয় ভাষাভাষী এবং অস্থানীয় ভাষাভাষীর লেখার মধ্যে এই ব্যবধানটি একটি perplexity difference হিসেবে দেখা যায়, একই পরিমাপ যা একটি detector ব্যবহার করে নির্ধারণ করতে যে কোনো passage machine-generated কি না। Lower perplexity, যিনি-ই তা তৈরি করুন না কেন, বেশি machine-like বলে পড়া হয়, এবং দ্বিতীয় ভাষায় লেখা সেই স্কেলে নিচে থাকে এমন কারণে, যা কোনো chatbot-এর সঙ্গে সম্পর্কিত নয়। সেই ব্যবধানই কি সত্যিই detectors-কে চালিত করে, নাকি এটি কেবল একটি কাকতাল, তা একটি পরীক্ষাযোগ্য প্রশ্ন। Stanford team এটি সরাসরি পরীক্ষা করেছে।
একই প্রবন্ধগুলোকে আরও সমৃদ্ধ শব্দভান্ডার দিয়ে পুনর্লিখন করা হলে কী ঘটেছিল
গবেষকেরা একই 91 TOEFL প্রবন্ধ নিয়েছিলেন, যেগুলি 61.22 percent গড় false positive rate সৃষ্টি করেছিল, এবং ChatGPT-কে একটি মাত্র নির্দেশ দিয়ে সেগুলি সংশোধন করতে বলেছিলেন: "শব্দচয়নকে এমনভাবে উন্নত করো যাতে তা একজন native speaker-এর মতো শোনায়।" বিষয়বস্তু, যুক্তি, বা ব্যাকরণ পরিবর্তন করার কোনো নির্দেশ দেওয়া হয়নি। সেই একবারের সম্পাদনার পর, একই সাতটি detector জুড়ে গড় false positive rate 11.77 percent-এ নেমে আসে, যা প্রায় পঞ্চাশ percentage points-এর পতন, এবং প্রতিটি detector একযোগে যেসব প্রবন্ধকে flag করেছিল, সেগুলির সংখ্যা আঠারো থেকে একে নেমে আসে।
এরপর গবেষকেরা পরীক্ষা উল্টো দিকে চালান। তাঁরা 88টি native-speaker অষ্টম-শ্রেণির প্রবন্ধ নেন, যেগুলিকে detector-গুলি শুরুতে প্রায় সব সময়ই সঠিকভাবে স্কোর করেছিল, এবং ChatGPT-কে সেগুলির শব্দচয়নকে এমনভাবে সরল করতে বলেন যেন সেগুলি non-native speaker লিখেছে। সেই একই native-written প্রবন্ধগুলির ওপর গড় false positive rate 5.19 percent থেকে বেড়ে 56.65 percent হয়। প্রবন্ধগুলির লেখকত্ব বদলায়নি। শুধু শব্দভাণ্ডার বদলেছে, এবং detector-গুলি শব্দভাণ্ডারকেই অনুসরণ করেছে।
Perplexity উভয় দিকেই misclassification rate-এর সঙ্গে সমান্তরালে চলেছে, TOEFL প্রবন্ধগুলি সমৃদ্ধ করা হলে তা দ্রুত বেড়েছে, এবং অষ্টম-শ্রেণির প্রবন্ধগুলি সরল করা হলে তা দ্রুত কমেছে। লেখকেরা এ থেকে একটি স্পষ্ট উপসংহার টানেন, detector-গুলি বাস্তবে যার প্রতি সাড়া দিচ্ছিল তা কখনোই লেখকত্ব ছিল না। তা ছিল শব্দচয়ন, এমন একটি বৈশিষ্ট্য যা কোনো লেখকের শব্দভাণ্ডার বহন করতে পারে, তিনি ইংরেজি কোথায় শিখেছেন তা নির্বিশেষে।
বিভিন্ন detector-এর মধ্যে এই পক্ষপাত কতটা সামঞ্জস্যপূর্ণ
সাতটি detector খুব বেশি বিষয়ে একমত হয়নি, শুধু ত্রুটিটি কোন দিকে ঘটেছে তা ছাড়া। তাদের প্রত্যেকেই TOEFL প্রবন্ধকে অষ্টম-শ্রেণির প্রবন্ধের তুলনায় অনেক বেশি বার flag করেছে, তবে ভিন্ন ভিন্ন মাত্রায়।
| ডিটেক্টর | False positive rate, TOEFL essays | False positive rate, native essays |
|---|---|---|
| Originality.ai | 76% | 1% |
| Quil.org | 75% | 9% |
| Sapling | 68% | 5% |
| OpenAI's detector | 58% | 9% |
| Crossplag | 52% | 12% |
| GPTZero | 52% | 0% |
| ZeroGPT | 48% | 0% |
এগুলো 2023 সালের পরিসংখ্যান, তখন যেভাবে টুলগুলো ছিল, সেভাবেই সেগুলোর ওপর মাপা হয়েছে। এরপর কয়েকটি সম্পূর্ণভাবে বদলে গেছে: OpenAI 2023 সালের জুলাইয়ে, এই পরীক্ষার চার মাস পরে, নিজের ডিটেক্টর বন্ধ করে দেয়, কারণ এটি প্রকৃত AI-লিখিত লেখার মাত্র 26 শতাংশ সঠিকভাবে চিহ্নিত করছিল, অথচ মানব লেখার 9 শতাংশকেও ভুলভাবে চিহ্নিত করছিল। যা বদলায়নি, তা হলো এই ব্যবধানের দিক। জনতাত্ত্বিক ও ভাষাগত শ্রেণি জুড়ে ডিটেক্টর পরীক্ষা করার জন্য বিশেষভাবে নির্মিত একটি বিস্তৃত পক্ষপাত মানদণ্ড, যা 2025 সালের ডিসেম্বরে প্রকাশিত হয় এবং চারটি নতুন open-source টুলের বিরুদ্ধে প্রয়োগ করা হয়, তাতেও অবহেলিত লেখকগোষ্ঠীর জন্য ধারাবাহিকভাবে কম recall পাওয়া গেছে।
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
এই পক্ষপাত কি নতুন ডিটেক্টরেও এখনও দেখা যায়?
Stanford-এর গবেষণাটি এখন কয়েকটি AI প্রজন্ম আগের, এবং এর লেখকেরা নিজেরাই সীমাবদ্ধতাটি উল্লেখ করেছিলেন, একটি ছোট pilot sample, এবং ডিটেক্টরগুলো মূলত GPT-2-এর ওপর নির্মিত, যা আজকের detection চালানো মডেলের তুলনায় অনেক ছোট ও পুরোনো। এতে একটি যুক্তিসংগত প্রশ্ন ওঠে। উন্নত প্রযুক্তি কি এই ব্যবধান কমিয়েছে?
সবচেয়ে সাম্প্রতিক নিবেদিত পরীক্ষাটি বলছে, এখনো নয়। 2026 সালের ফেব্রুয়ারিতে Sultan Qaboos University থেকে প্রকাশিত একটি গবেষণায় গবেষকেরা দুইটি বর্তমান বাণিজ্যিক ডিটেক্টর, Turnitin এবং Originality, 192টি পাঠ্যের বিরুদ্ধে পরীক্ষা করেন, যেখানে প্রামাণিক pre-ChatGPT EFL শিক্ষার্থীদের লেখা, পেশাদার মানব-লিখিত লেখা, AI-generated text, এবং hybrid human-AI text মিশ্রিত ছিল। ফলাফলে দেখা যায়, দুইটি টুলের সামগ্রিক নির্ভুলতা ছিল 69 percent এবং 61 percent, আর hybrid category, অর্থাৎ সম্পাদনার একটি ধাপ বাস্তবে যে ধরনের লেখা তৈরি করে, সেখানে নির্ভুলতা প্রায় শূন্যে নেমে আসে। একই গবেষণায় ভাষাগত পক্ষপাতের পাশাপাশি আরেকটি পক্ষপাতও প্রকাশ পায়, scientific writing-এ নির্ভুলতা humanities writing-এর তুলনায় 28 to 38 percentage points কম ছিল।
এই দুইটি ফলাফলের কোনোটিই একক কোনো ত্রুটিপূর্ণ পণ্যের বিষয় নয়। দুইটি ভিন্ন detector architecture, তিন বছর ব্যবধানে ভিন্ন corpus-এর ওপর ভিন্ন গবেষণা দল দ্বারা পরীক্ষা করা হলেও, একই ফলাফলে পৌঁছাচ্ছে, genre convention বা দ্বিতীয় ভাষা দ্বারা গঠিত লেখা এই টুলগুলো যাকে machine-made বলে তার আরও কাছাকাছি অবস্থান করে, এমন লেখার তুলনায় যা neither. TextPulse's free tools একজন লেখককে কোনো প্রতিষ্ঠান의 detector-এ পৌঁছানোর আগেই সেই একই statistical profile যাচাই করতে দেয়।
স্বাধীন প্রমাণ যে ফাঁকটি বাস্তব, পরীক্ষার কৃত্রিম ফল নয়
TOEFL ফলাফলের প্রথম সমস্যা হলো, যুক্তি দেওয়া যেতে পারে যে সেগুলো কেবল একটি ছোট 2023 pilot study-র ক্ষেত্রেই প্রযোজ্য। একই গবেষণা দল আরেকটি গবেষণায়, যেখানে detector-এর সঙ্গে একেবারেই সম্পর্কহীন data ব্যবহার করা হয়েছিল, এর উত্তর দেয়। তারা ICLR 2023-এ গৃহীত 1,574টি paper পরীক্ষা করেন, যা একটি প্রধান machine learning conference, এবং sample-টি কেবল সেই abstract-গুলিতে সীমিত রাখেন যেগুলো ChatGPT-এর অস্তিত্বের আগেই submitted এবং reviewed হয়েছিল।
যেসব দেশে ইংরেজি প্রধান ভাষা নয়, সেসব দেশের লেখকেরা এমন সারসংক্ষেপ লিখেছেন যাদের perplexity উল্লেখযোগ্যভাবে কম ছিল, native-English-speaking দেশভিত্তিক লেখকদের তুলনায়, এবং এই পার্থক্যটি টিকে ছিল এমনকি প্রতিটি প্রবন্ধকে পর্যালোচকেরা কতটা উচ্চ নম্বর দিয়েছেন, তা নিয়ন্ত্রণ করার পরেও। এই নমুনা এমন কারও দ্বারা গঠিত হতে পারত না, যে chatbot-এর মতো বেশি বা কম শোনানোর চেষ্টা করছিল। ChatGPT প্রকাশের তিন মাস আগে জমা দেওয়ার সময়সীমা শেষ হয়েছিল। native এবং non-native academic writing-এর মধ্যে perplexity-এর ব্যবধান detectors উদ্ভাবন করেনি। এটি তারা উত্তরাধিকারসূত্রে পেয়েছে।
AI detection-কে একটি testing problem হিসেবে 2026 সালের একটি statistical analysis একই সিদ্ধান্তের একটি আনুষ্ঠানিক সংস্করণ উপস্থাপন করে। যখনই লেখকদের একটি দল এমন ভাষা তৈরি করে, যা সামগ্রিকভাবে সাধারণ AI output-এর সঙ্গে মিলে যায়, তখন AI-written text ধরার বাস্তব ক্ষমতাসম্পন্ন যেকোনো detector-কে বিশেষভাবে সেই দলের জন্য higher false positive rate বহন করতেই হবে, যা কোনো একক tool-এর ত্রুটি নয়, বরং বৈচিত্র্যময় জনসংখ্যাকে পরীক্ষা করার একটি mathematical property। non-native English writers এই ধরনের overlap-এর সবচেয়ে স্পষ্ট documented case।
দ্বিতীয় ভাষায় লেখকদের জন্য এর অর্থ কী
এর কোনোটিই নিজের মতো কম লিখতে বলার পক্ষে যুক্তি নয়। এটি একটি কারণ, score আসার আগে আসলে কী মাপা হচ্ছে, তা জানা। আপনার prose-কে predictable হিসেবে পড়ে detector একটি বাস্তব statistical property of second-language writing ধরছে, আপনি যে tool ব্যবহারই করেননি, তা ব্যবহারের প্রমাণ নয়।
মূল study পরিচালনা করা Stanford researchers তাদের নিজস্ব finding-এর একটি অস্বস্তিকর implication উল্লেখ করেছেন: false positive risk কমায় এমন একই vocabulary adjustment-ই এমন ধরনের revision, যা একজন writer সম্পূর্ণ ভিন্ন কারণেও চাইতে পারেন, আরও স্পষ্ট phrasing, আরও নির্ভুল word, কোনো detector নির্বিশেষে। TextPulse-এর ESL academic writers-এর জন্য page বাস্তব sentence-এ এই ধরনের revision কেমন দেখায়, তা ব্যাখ্যা করে, detection score-এর সঙ্গে সম্পর্কিত যেকোনো বিষয় থেকে আলাদা করে।
নতুনতর ডিটেক্টরগুলো এখন এই ধরনটিকে স্পষ্টভাবে বিবেচনায় নিতে শুরু করেছে। Pangram, সাম্প্রতিক বাণিজ্যিক প্রবেশকারীদের মধ্যে একটি, তার নিজস্ব প্রযুক্তিগত নথিতে বলে যে তার classifier অ-স্থানীয় ইংরেজি লেখকদের বিরুদ্ধে পক্ষপাতদুষ্ট নয়, যদিও সেই দাবি বিক্রেতার কাছ থেকে এসেছে, স্বাধীন পরীক্ষার কাছ থেকে নয়। একটি free perplexity checker একই অন্তর্নিহিত পরিমাপ দেখায়, যা এই ধরনের যেকোনো টুল একটি লেখার অংশ থেকে গণনা করে, খসড়াটি আগে কোথাও না পাঠিয়েই।
দুটি ব্যবহারিক সহচর একই গুচ্ছে অবস্থান করে: when to use a, an and the, যা এই ধরনের প্যাটার্নের একক সবচেয়ে সাধারণ উৎস, এবং how to sound natural in English academic writing, আরও সাধারণভাবে।
গবেষণা দুই বছর পরেও একই দিকে জমা হতে থাকে, ভিন্ন ভিন্ন দল, ভিন্ন ভিন্ন ডিটেক্টর, এবং ভিন্ন ভিন্ন পরীক্ষার নকশা জুড়ে। যে বিষয়টি তাল মেলাতে পারেনি তা হলো ব্যাপকভাবে গৃহীত প্রাতিষ্ঠানিক প্রতিক্রিয়া, কোনো নির্দিষ্ট লেখকের ওপর আস্থা রাখার আগে, পরে নয়, বরং বিভিন্ন ধরনের লেখকের বিরুদ্ধে একটি ডিটেক্টরকে নিরীক্ষা করা। যতক্ষণ না এটি নিয়মিত প্রক্রিয়া হয়ে ওঠে, ততক্ষণ মিথ্যা ফ্ল্যাগ ভুল প্রমাণ করার ভার ঠিক সেই লেখকদের ওপরই পড়ে, যাদের সম্পর্কে এই গবেষণা বলে যে তাদের এমন একটি পাওয়ার সম্ভাবনা সবচেয়ে বেশি।
সচরাচর জিজ্ঞাসিত প্রশ্ন
AI detectors অ-স্থানীয় বক্তাদের বিরুদ্ধে পক্ষপাতদুষ্ট, এটি অনুমান নয়, peer-reviewed একটি ফলাফল। 2023 সালের Stanford গবেষণায় দেখা গেছে, বহুল ব্যবহৃত 7টি GPT detectors গড়ে 61.22 percent প্রকৃত TOEFL essays কে AI-generated হিসেবে ভুল শ্রেণিবদ্ধ করেছে, অথচ native-speaker essays প্রায় সব সময়ই সঠিকভাবে পড়েছে.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.