AI Detection

কেন AI Detectors অ-স্থানীয় ইংরেজি লেখকদের বিরুদ্ধে পক্ষপাতদুষ্ট

2023 সালের Stanford গবেষণায় দেখা গেছে, সাবলীল অ-স্থানীয় ইংরেজি লেখা native লেখার তুলনায় অনেক বেশি হারে machine-generated হিসেবে ভুলভাবে পড়া হচ্ছে। এই ব্যবধানের পেছনের প্রক্রিয়া এখানে ব্যাখ্যা করা হয়েছে, এবং একই essays আরও সমৃদ্ধ শব্দভান্ডার দিয়ে পুনর্লিখন করা হলে কী ঘটেছিল তাও দেখানো হয়েছে.

সর্বশেষ আপডেট করা হয়েছে 7 min
AI detectors biased against non-native speakers: bar chart of false positive rates for seven detectors on TOEFL versus native-speaker essays

AI detectors biased against non-native speakers is not a subjective complaint. একটি peer-reviewed 2023 Stanford study এটি সরাসরি পরিমাপ করেছে। গবেষকেরা বহুল ব্যবহৃত 7টি GPT detector 91টি বাস্তব TOEFL essay, যা non-native English speakers লিখেছিলেন, এবং American eighth-graders লেখা 88টি essay এর বিরুদ্ধে চালান, তারপর প্রতিটি গোষ্ঠীর স্কোর কীভাবে হলো তা তুলনা করেন।

Detector গুলো eighth-grade essay গুলো প্রায় প্রতিবারই সঠিকভাবে পড়েছিল। TOEFL essay গুলোতে, যা এমন প্রাপ্তবয়স্করা লিখেছিলেন যারা ইতিমধ্যে graduate-level English proficiency exam পাস করেছিলেন, একই 7টি tool গড় false positive rate 61.22 percent দেখায়। 91টি essay এর মধ্যে 89টি, প্রায় 98 percent, অন্তত 1টি 7টি tool এর মধ্যে AI-generated হিসেবে চিহ্নিত হয়।

AI detector accuracy সম্পর্কে বিস্তৃত প্রমাণের ওপর TextPulse এর overview এই headline finding এবং পরে যে lawsuits এ এটি যুক্ত হয়েছে তা আলোচনা করে। Study টি উদ্ধৃত হওয়ার প্রায় সব জায়গায় যে বিষয়টি বাদ পড়ে যায়, তা হলো mechanism, অর্থাৎ কেন graduate-level English speaker এর prose শুরুতেই machine-made বলে পড়ে, এবং যখন তা আর সেভাবে পড়ে না তখন কী বদলায়।

Non-Native Speakers এর বিরুদ্ধে পক্ষপাতদুষ্ট AI Detector: Mechanism

একটি detector কখনও meaning পড়ে না। এটি পড়ে প্রতিটি word কতটা predictable, তার আগে আসা word গুলোর ভিত্তিতে, এবং passage কে low score দেয় যখন model এর অধিকাংশ আগেই অনুমান করা সম্ভব হতো। Lexical diversity, অর্থাৎ একজন writer কতটা বিস্তৃত vocabulary ব্যবহার করেন, ছোট একটি নিরাপদ word set বারবার না দোহরিয়ে, এবং syntactic predictability, অর্থাৎ sentence structure ভাষার সবচেয়ে সাধারণ pattern কতটা ঘনিষ্ঠভাবে অনুসরণ করে, তা না বদলে, language production এর এমন দুটি property যা এই score কমিয়ে দেয়।

এই পার্থক্যটি গুরুত্বপূর্ণ, কারণ পৃষ্ঠায় দুটির উপস্থিতি ভিন্নভাবে দেখা যায়। শব্দভান্ডারের বৈচিত্র্য শব্দগুলোর নিজেদের সম্পর্কে: যে লেখক তিনটি ভিন্ন বাক্যে 'obtain,' 'acquire,' এবং 'secure' ব্যবহার করেন, তিনি সেই লেখকের তুলনায় বেশি বৈচিত্র্যময় বলে পড়া যায়, যিনি তিনবার 'get' লেখেন, যদিও অন্যথায় বাক্যগুলো অভিন্ন। বাক্যগঠনগত পূর্বানুমেয়তা গঠন সম্পর্কে: subject, verb, object, বারবার পুনরাবৃত্ত, এমন একটি বাক্যের বদলে যা একটি subordinate clause দিয়ে শুরু হয় বা অপ্রত্যাশিত শব্দে শেষ হয়। পরীক্ষার পরিস্থিতিতে কাজ করা দ্বিতীয় ভাষার একজন লেখকের জন্য উভয়েরই নিরাপদ সংস্করণে ঝোঁকার যথেষ্ট কারণ আছে।

দ্বিতীয় ভাষায় লেখা নির্ভরযোগ্যভাবে উভয়েরই কম মাত্রা দেখায়, এবং তা কোনো ঘাটতি হিসেবে নয়। অতিরিক্ত একটি ভাষায় কাজ করা একজন লেখক এমন শব্দভান্ডার এবং বাক্যরীতির ওপর নির্ভর করেন, যেগুলো সঠিক হওয়ার সম্ভাবনা সবচেয়ে বেশি, কারণ ভাষাটি এখনও সম্পূর্ণ স্বয়ংক্রিয় না হলে ভুল অনুমানের মূল্য বেশি। detector bias নথিভুক্ত করা Stanford প্রবন্ধটি এই নির্দিষ্ট ধরণ নিয়ে প্রয়োগভিত্তিক ভাষাবিজ্ঞানের গবেষণার একটি সংকলনের উল্লেখ করে, যা AI detectors অস্তিত্বে আসার অনেক আগেই প্রতিষ্ঠিত হয়েছিল: হ্রাসপ্রাপ্ত lexical richness, হ্রাসপ্রাপ্ত lexical diversity, এবং সহজতর বাক্যগঠন দ্বিতীয় ভাষায় লেখার নথিভুক্ত, পরিমাপযোগ্য বৈশিষ্ট্য, অন্য কিছুর লক্ষণ নয়।

স্থানীয় ভাষাভাষী এবং অস্থানীয় ভাষাভাষীর লেখার মধ্যে সেই ফাঁকটি perplexity পার্থক্য হিসেবে দেখা যায়, detector যে একই পরিমাপ ব্যবহার করে নির্ধারণ করতে যে কোনো অংশ machine-generated ছিল কি না। কম perplexity, তা যেই তৈরি করুক না কেন, বেশি machine-like বলে পড়া যায়, এবং দ্বিতীয় ভাষায় লেখা সেই স্কেলে নিচে থাকে এমন কারণে, যার সঙ্গে chatbot-এর কোনো সম্পর্ক নেই। সেই ফাঁকটি সত্যিই detectors চালিত করে কি না, নাকি তা কেবল একটি কাকতাল, তা একটি পরীক্ষাযোগ্য প্রশ্ন। Stanford দলটি এটি সরাসরি পরীক্ষা করেছিল।

একই প্রবন্ধগুলোকে আরও সমৃদ্ধ শব্দভান্ডার দিয়ে পুনর্লিখন করা হলে কী ঘটেছিল

গবেষকেরা একই 91টি TOEFL প্রবন্ধ নেন, যেগুলি 61.22 percent গড় false positive rate সৃষ্টি করেছিল, এবং ChatGPT-কে একটি মাত্র নির্দেশনা দিয়ে সেগুলি সংশোধন করতে বলেন: "শব্দচয়ন এমনভাবে উন্নত করো যাতে তা একজন native speaker-এর মতো শোনায়।" বিষয়বস্তু, যুক্তি, বা ব্যাকরণে পরিবর্তন আনার কোনো নির্দেশ দেওয়া হয়নি। সেই একবারের সম্পাদনার পর, একই সাতটি detector জুড়ে গড় false positive rate 11.77 percent-এ নেমে আসে, যা প্রায় পঞ্চাশ শতাংশ পয়েন্টের পতন, এবং প্রতিটি detector একমত হয়ে যে প্রবন্ধগুলিকে flag করেছিল, তাদের সংখ্যা আঠারো থেকে এক-এ নেমে আসে।

এরপর গবেষকেরা পরীক্ষাটি উল্টোভাবে চালান। তাঁরা 88টি native-speaker অষ্টম-শ্রেণির প্রবন্ধ নেন, যেগুলিকে detector-গুলি শুরুতে প্রায় সব সময়ই সঠিকভাবে স্কোর করেছিল, এবং ChatGPT-কে সেগুলির শব্দচয়ন এমনভাবে সরল করতে বলেন যেন সেগুলি একজন non-native speaker লিখেছেন। সেই একই native-written প্রবন্ধগুলির ওপর গড় false positive rate 5.19 percent থেকে বেড়ে 56.65 percent হয়। প্রবন্ধগুলির লেখকত্ব বদলায়নি। কেবল শব্দভান্ডার বদলায়, এবং detector-গুলি শব্দভান্ডারের অনুসরণ করে।

Perplexity উভয় দিকেই misclassification rate-এর সঙ্গে সমান্তরালে চলেছে: TOEFL প্রবন্ধগুলি সমৃদ্ধ করা হলে এটি তীব্রভাবে বেড়েছে, এবং অষ্টম-শ্রেণির প্রবন্ধগুলি সরল করা হলে তীব্রভাবে কমেছে। লেখকেরা এ থেকে একটি স্পষ্ট উপসংহার টানেন: detector-গুলি বাস্তবে যার প্রতি সাড়া দিচ্ছিল, তা কখনোই লেখকত্ব ছিল না। তা ছিল শব্দচয়ন, এমন একটি বৈশিষ্ট্য যা যেকোনো লেখকের শব্দভান্ডারে থাকতে পারে, তিনি ইংরেজি যেখানে শিখুন না কেন।

বিভিন্ন detector-এর মধ্যে এই পক্ষপাত কতটা সামঞ্জস্যপূর্ণ

সাতটি detector খুব বেশি বিষয়ে একমত হয়নি, শুধু এই বিষয়ে ছাড়া যে ত্রুটিটি কোন দিকে ঘটছে। তাদের প্রত্যেকেই TOEFL প্রবন্ধকে অষ্টম-শ্রেণির প্রবন্ধের তুলনায় অনেক বেশি বার flag করেছে, তবে পার্থক্যের মাত্রা ছিল ভিন্ন ভিন্ন।

ডিটেক্টরFalse positive rate, TOEFL essaysFalse positive rate, native essays
Originality.ai76%1%
Quil.org75%9%
Sapling68%5%
OpenAI's detector58%9%
Crossplag52%12%
GPTZero52%0%
ZeroGPT48%0%

এগুলো 2023 সালের পরিসংখ্যান, তখন যেভাবে টুলগুলো ছিল, সেভাবেই মাপা হয়েছে। এরপর অনেকগুলিই সম্পূর্ণ বদলে গেছে: OpenAI 2023 সালের জুলাইয়ে, এই পরীক্ষার চার মাস পরে, নিজের ডিটেক্টর বন্ধ করে দেয়, কারণ এটি প্রকৃত AI-লিখিত লেখার মাত্র 26 শতাংশ সঠিকভাবে চিহ্নিত করছিল, অথচ মানব লেখার 9 শতাংশকেও ভুলভাবে চিহ্নিত করছিল। যা বদলায়নি, তা হলো এই ব্যবধানের দিক। জনসংখ্যাগত ও ভাষাগত শ্রেণি জুড়ে ডিটেক্টর পরীক্ষা করার জন্য বিশেষভাবে তৈরি একটি বিস্তৃত পক্ষপাত বেঞ্চমার্ক, যা 2025 সালের ডিসেম্বরে প্রকাশিত হয় এবং চারটি নতুন open-source টুলের বিরুদ্ধে চালানো হয়, তাতেও প্রতিনিধিত্বহীন লেখকগোষ্ঠীর জন্য ধারাবাহিকভাবে কম recall পাওয়া গেছে।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

এই পক্ষপাত কি নতুনতর ডিটেক্টরেও এখনও দেখা যায়?

Stanford-এর গবেষণাটি এখন কয়েকটি AI প্রজন্ম পুরোনো, এবং এর নিজস্ব লেখকেরাই সীমাবদ্ধতাটি উল্লেখ করেছেন, একটি ছোট pilot sample, এবং এমন ডিটেক্টর যা মূলত GPT-2-এর ওপর নির্মিত, যা আজকের detection চালানো মডেলের তুলনায় অনেক ছোট এবং পুরোনো। এতে একটি যুক্তিসংগত প্রশ্ন ওঠে। উন্নত প্রযুক্তি কি এই ব্যবধান কমিয়েছে?

সবচেয়ে সাম্প্রতিক নিবেদিত পরীক্ষাটি বলছে, এখনো নয়। 2026 সালের ফেব্রুয়ারিতে Sultan Qaboos University থেকে প্রকাশিত একটি গবেষণায় গবেষকেরা দুটি বর্তমান বাণিজ্যিক ডিটেক্টর, Turnitin এবং Originality, 192টি পাঠ্যের বিরুদ্ধে পরীক্ষা করেন, যেখানে ছিল প্রামাণিক pre-ChatGPT EFL শিক্ষার্থীদের লেখা, পেশাদার মানব-লেখা, AI-generated text, এবং সংকর মানব-AI text। ফলাফলে দেখা যায়, দুইটি টুলের সামগ্রিক নির্ভুলতা ছিল 69 percent এবং 61 percent, আর সংকর শ্রেণিতে, অর্থাৎ সম্পাদনার একটি ধাপ বাস্তবে যে ধরনের লেখা তৈরি করে, নির্ভুলতা প্রায় শূন্যে নেমে আসে। একই গবেষণায় ভাষাগত পক্ষপাতের পাশাপাশি আরেকটি পক্ষপাতও প্রকাশ পায়, বৈজ্ঞানিক লেখায় নির্ভুলতা মানবিকবিদ্যার লেখার তুলনায় 28 to 38 percentage points কম ছিল।

এই দুইটি পর্যবেক্ষণই কোনো একক ত্রুটিপূর্ণ পণ্যের কথা বলে না। ভিন্ন গবেষণা দল দ্বারা, ভিন্ন corpus-এর ওপর, তিন বছর ব্যবধানে পরীক্ষা করা দুটি ভিন্ন detector architecture একই ফলেই পৌঁছাচ্ছে, genre convention বা দ্বিতীয় ভাষা দ্বারা গঠিত লেখা, এমন লেখার আরও কাছাকাছি থাকে যাকে এই টুলগুলো machine-made বলে, তুলনায় এমন লেখার যা neither. TextPulse's free tools একজন লেখককে কোনো প্রতিষ্ঠান의 detector-এ পৌঁছানোর আগেই সেই একই statistical profile পরীক্ষা করতে দেয়।

স্বাধীন প্রমাণ যে ফারাকটি বাস্তব, পরীক্ষার কৃত্রিম ফল নয়

TOEFL ফলাফলের প্রথম সমস্যা হলো, যুক্তি দেওয়া যেতে পারে যে সেগুলো কেবল একটি ছোট 2023 pilot study-র ক্ষেত্রেই প্রযোজ্য। একই গবেষণা দল পরে আরেকটি গবেষণায় এর উত্তর দেয়, যেখানে detector-এর সঙ্গে একেবারেই সম্পর্ক নেই এমন data ব্যবহার করা হয়। তারা ICLR 2023-এ গৃহীত 1,574টি paper পরীক্ষা করেন, যা একটি প্রধান machine learning conference, এবং sample-টি সীমিত করেন সেই abstract-গুলিতে, যেগুলো ChatGPT অস্তিত্বে আসার আগে জমা দেওয়া ও পর্যালোচনা করা হয়েছিল।

যেসব দেশে ইংরেজি প্রধান ভাষা নয়, সেসব দেশের লেখকেরা এমন সারসংক্ষেপ লিখেছেন যাদের perplexity উল্লেখযোগ্যভাবে কম ছিল, native-English-speaking দেশগুলোর লেখকদের তুলনায়, এবং এই পার্থক্যটি বজায় ছিল এমনকি প্রতিটি প্রবন্ধকে পর্যালোচকেরা কতটা উচ্চভাবে মূল্যায়ন করেছেন, তা নিয়ন্ত্রণ করার পরেও। এই নমুনা এমনভাবে গঠিত হতে পারেনি যে কেউ ইচ্ছাকৃতভাবে chatbot-এর মতো বেশি বা কম শোনাতে চেয়েছিল। ChatGPT প্রকাশের তিন মাস আগে জমাদানের সময়সীমা শেষ হয়েছিল। native এবং non-native academic writing-এর মধ্যে perplexity-এর ব্যবধান detectors উদ্ভাবন করেনি। এটি তারা উত্তরাধিকারসূত্রে পেয়েছে।

AI detection-কে একটি testing problem হিসেবে 2026 সালের একটি statistical analysis একই সিদ্ধান্তের একটি আনুষ্ঠানিক সংস্করণ উপস্থাপন করে। যখন কোনো লেখকগোষ্ঠী এমন ভাষা তৈরি করে যা সামগ্রিকভাবে সাধারণ AI output-এর সঙ্গে আংশিকভাবে মিলে যায়, তখন AI-written text ধরতে প্রকৃত ক্ষমতাসম্পন্ন যেকোনো detector-কে বিশেষভাবে সেই গোষ্ঠীর জন্য higher false positive rate বহন করতেই হবে, যা কোনো একক tool-এর ত্রুটি নয়, বরং বৈচিত্র্যময় জনসংখ্যা পরীক্ষা করার একটি গাণিতিক বৈশিষ্ট্য। Non-native English লেখকেরাই এই ধরনের overlap-এর সবচেয়ে স্পষ্ট নথিভুক্ত উদাহরণ।

দ্বিতীয় ভাষায় লেখকদের জন্য এর অর্থ কী

এর কোনোটিই নিজের মতো কম লিখতে বলার যুক্তি নয়। এটি একটি কারণ, score আসার আগে আসলে কী মাপা হচ্ছে তা জানা। আপনার গদ্যকে predictable হিসেবে পড়ে detector দ্বিতীয় ভাষায় লেখার একটি বাস্তব statistical property ধরছে, আপনি যে tool ব্যবহার করেননি তা ব্যবহার করেছেন, এমন প্রমাণ নয়।

মূল study পরিচালনাকারী Stanford গবেষকেরা নিজেদের ফলাফলের একটি অস্বস্তিকর তাৎপর্য উল্লেখ করেছেন, একই vocabulary adjustment যা false positive risk কমায়, সেটিই এমন ধরনের revision, যা একজন লেখক সম্পূর্ণ ভিন্ন কারণেও চাইতে পারেন, আরও স্পষ্ট phrasing, আরও নির্ভুল শব্দ, কোনো detector থাকুক বা না থাকুক। TextPulse-এর ESL academic writers-এর জন্য page বাস্তব বাক্যে এই ধরনের revision কেমন দেখায় তা ব্যাখ্যা করে, detection score-এর সঙ্গে সম্পর্কিত যেকোনো বিষয় থেকে আলাদা করে।

নতুনতর ডিটেক্টরগুলো এখন এই ধরনটিকে স্পষ্টভাবে বিবেচনায় নিতে শুরু করেছে। Pangram, সাম্প্রতিক বাণিজ্যিক প্রবেশকারীদের মধ্যে একটি, তার নিজস্ব প্রযুক্তিগত নথিতে বলে যে তার শ্রেণিবিন্যাসকটি অ-স্থানীয় ইংরেজি লেখকদের বিরুদ্ধে পক্ষপাতদুষ্ট নয়, যদিও সেই দাবি স্বাধীন পরীক্ষার বদলে বিক্রেতার কাছ থেকেই এসেছে। একটি free perplexity checker এই একই অন্তর্নিহিত পরিমাপ দেখায়, যা এ ধরনের যেকোনো টুল একটি লেখার অংশ থেকে গণনা করে, খসড়াটি আগে কোথাও না পাঠিয়েই।

একই গুচ্ছে দুটি ব্যবহারিক সহচর রয়েছে: when to use a, an and the, যা এই ধরনটির একক সর্বাধিক সাধারণ উৎস, এবং আরও সাধারণভাবে how to sound natural in English academic writing

দুই বছর পরেও গবেষণা একই দিকে জমা হতে থাকছে, ভিন্ন ভিন্ন দল, ভিন্ন ভিন্ন ডিটেক্টর, এবং ভিন্ন ভিন্ন পরীক্ষার নকশা জুড়ে। যে বিষয়টি তাল মেলাতে পারেনি তা হলো ব্যাপকভাবে গৃহীত প্রাতিষ্ঠানিক প্রতিক্রিয়া, কোনো এক নির্দিষ্ট লেখকের ওপর আস্থা রাখার আগে বিভিন্ন ধরনের লেখকের বিরুদ্ধে একটি ডিটেক্টরের নিরীক্ষা করা, কোনো নির্দিষ্ট শিক্ষার্থীকে ইতিমধ্যে অভিযুক্ত করার পরে নয়। যতক্ষণ না এটি নিয়মিত প্রক্রিয়া হয়ে ওঠে, ততক্ষণ একটি মিথ্যা সংকেতকে ভুল প্রমাণ করার দায় ঠিক সেই লেখকদের ওপরই পড়ে, যাদের সম্পর্কে এই গবেষণা বলে যে তাদের এমন সংকেত পাওয়ার সম্ভাবনা সবচেয়ে বেশি।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

AI detectors অ-স্থানীয় বক্তাদের বিরুদ্ধে পক্ষপাতদুষ্ট, এটি অনুমান নয়, peer-reviewed একটি ফলাফল। 2023 সালের Stanford গবেষণায় দেখা গেছে, বহুল ব্যবহৃত 7টি GPT detectors গড়ে 61.22 percent বাস্তব TOEFL essays-কে AI-generated হিসেবে ভুল শ্রেণিবদ্ধ করেছে, অথচ native-speaker essays প্রায় সব সময়ই সঠিকভাবে পড়েছে.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।