AI Detection

AI Detector False Positives: কেন মানব লেখা চিহ্নিত হয়

Vendors false positive rates প্রায় one percent-এর কাছাকাছি প্রকাশ করে। একই tools-এর independent tests, ভিন্ন writing-এ, নিয়মিত অন্য কিছু খুঁজে পায়। এখানে দেখা যাবে, আসলে কী false flag trigger করে, এবং numberটি একবার থাকলে তা কী বোঝায় আর কী বোঝায় না।

7 min
AI detector false positive: table comparing writing traits, from short documents to heavy editing, that trigger false flags in human text

1982 সালে, New England Journal of Medicine সাইটোমেগালোভাইরাস বিষয়ে অস্থিমজ্জা প্রতিস্থাপন রোগীদের উপর একটি প্রবন্ধ প্রকাশ করে। এটি peer review পেরিয়ে চার দশক ধরে আর্কাইভে পড়ে ছিল। 2023 সালে, গবেষকেরা এটিকে OpenAI যে AI লেখন শনাক্তকারী সর্বজনীনভাবে প্রকাশ করেছিল, তার মধ্যে চালান, এবং টুলটি এটিকে 99.96 percent সম্ভাব্য AI-generated হিসেবে মূল্যায়ন করে, যে মডেল দ্বারা এটি supposedly লেখা হয়েছিল তার অস্তিত্বের 37 বছর আগে। এটি AI detector false positive-এর সবচেয়ে বিশুদ্ধ রূপ, এমন একটি নথি যা machine-written হিসেবে চিহ্নিত হয়েছে অথচ machine-written হওয়া সম্ভবই নয়।

এই উদাহরণটি কেবল তার সময়গত অবস্থানের দিক থেকে চরম। অন্তর্নিহিত ধারা, অর্থাৎ কে লিখেছে বা কখন লিখেছে তা নির্বিশেষে সূত্রবদ্ধ, পূর্বানুমেয় গদ্যকে detector machine-made হিসেবে পড়া, সাধারণ জমাদানে নিয়মিত দেখা যায়, যেমন প্রবন্ধ, cover letter, lab report, personal statement। এই অংশে false positive কী কারণে ঘটে, কোন ধরনের লেখা সবচেয়ে বেশি ঝুঁকিতে থাকে, এবং কেন একটি flagged score সেই প্রমাণ নয় যা তা দেখায়, তা আলোচনা করা হয়েছে।

AI Detector False Positive কী?

AI detector false positive হলো মানব-লিখিত পাঠ্যের এমন একটি অংশ, যাকে একটি detection tool AI-generated হিসেবে স্কোর করে। লেখকের প্রক্রিয়া, সততা, বা দক্ষতার কিছুই এখানে মাপা হচ্ছে না। টুলটি বাক্যের statistical shape, শব্দচয়ন ও গঠনের পূর্বানুমেয়তা কতটা, তা machine output-এর সঙ্গে যে shape সে শিখেছে তার সঙ্গে তুলনা করে।

Vendors false positive rate-কে একটি ছোট একক percentage হিসেবে জানায়, সাধারণত one or two percent-এর নিচে। এই সংখ্যা vendor যে benchmark তৈরি করেছে তার উপর একটি নিয়ন্ত্রিত test-এর বর্ণনা, কোনো নির্দিষ্ট নথি সম্পর্কে নিশ্চয়তা নয়। AI detectors আদৌ accurate কি না এই বৃহত্তর প্রশ্নটি ইতিমধ্যে স্বাধীনভাবে পরীক্ষা করা হয়েছে, এবং ফলাফল সম্পূর্ণ ভিন্ন দিকে গেছে, কখনও কখনও vendor-এর যেকোনো সংখ্যার চেয়েও অনেক বেশি। এই অংশটি আরও সংকীর্ণ, কোন ধরনের লেখা সেই ঝুঁকি বাড়ায়, এবং একটি flagged score কাউকে কী বলতে পারে আর কী বলতে পারে না।

কোন লেখন বৈশিষ্ট্য মানব পাঠ্যকে machine-made দেখায়

সাধারণ লেখার চার ধরনের রূপ সবচেয়ে বেশি ঝুঁকি বহন করে, এবং এর কোনোটিতেই কোনো ব্যক্তি ভুল কিছু করছে এমন বিষয় জড়িত নয়। সংক্ষিপ্ত নথি, অত্যন্ত সূত্রবদ্ধ লেখা, উদ্ধৃত বা টেমপ্লেটভিত্তিক উপাদান, এবং কঠোরভাবে প্রুফরিড করা লেখা, সবই মুক্তভাবে রচিত গদ্যের তুলনায় বেশি পূর্বানুমানযোগ্য বলে স্কোর করার প্রবণতা রাখে, আর এটাই একমাত্র বৈশিষ্ট্য যা প্রতিটি ডিটেক্টর আসলে মাপছে। একটি free burstiness checker সেই একই পরিবর্তনশীলতাকে সরাসরি মাপে, যা এর বর্ণনা পড়ার তুলনায় ধরণটি দেখার দ্রুততর উপায়।

কিছু ধারা নকশাগতভাবেই সূত্রবদ্ধ। একটি methods section, একটি lab report, একটি standard cover letter এবং একটি literature review, সবই প্রচলিত বাক্যাংশকে উদ্ভাবনী বাক্যাংশের চেয়ে বেশি গুরুত্ব দেয়, কারণ প্রচলনই নথিটিকে তার পাঠকের কাছে ব্যবহারযোগ্য করে তোলে। গবেষকেরা এটি বাস্তব লেখায় সরাসরি পরীক্ষা করেছেন, তারা 1980 এবং 2023 সালের মধ্যে প্রকাশিত 14,400টি journal abstracts, অর্থাৎ কোনো large language model অস্তিত্বে আসার বহু বছর আগের লেখা, একটি সর্বসাধারণের জন্য উপলব্ধ detector-এর মধ্য দিয়ে চালান। 8 percent পর্যন্ত লেখা AI-generated হিসেবে চিহ্নিত হয়, প্রকাশনার বছর নির্বিশেষে, এবং New England Journal of Medicine-এর abstracts 10.24 percent-এ চিহ্নিত হয়, যা পরীক্ষিত পাঁচটি journal-এর মধ্যে সর্বোচ্চ false positive rate।

এই test ChatGPT সম্পর্কে কিছুই শনাক্ত করতে পারত না, কারণ ChatGPT তার নমুনায় নেওয়া বছরের অধিকাংশ সময়েই অস্তিত্বে ছিল না। এটি genre শনাক্ত করেছে। আরও আনুষ্ঠানিকভাবে বললে, detection problem-এর 2026 সালের statistical analysis যেমনটি বলবে, software দ্বারা লেখা বলে পূর্বানুমানযোগ্য একটি sentence এবং এমন একটি sentence, যা পূর্বানুমানযোগ্য কারণ এটি তার genre-তে আপনি যে ধরনের জিনিস লেখেন, এদের মধ্যে পার্থক্য করার মতো detector তৈরি করার কোনো উপায় নেই। বাইরে থেকে এরা একেবারে একই দেখায়।

অতিরিক্ত সম্পাদনা একই দিকে ঠেলে দেয়। একটি প্রথম খসড়ায় লেখকের নির্দিষ্ট অনিয়ম থাকে, অদ্ভুত শব্দক্রম, এমন বাক্য যা দীর্ঘ হয়ে যায় কারণ ভাবনাটিও তেমনই ছিল। একটি বিস্তৃত প্রুফরিডিং ধাপ, বিশেষ করে অন্য কোনো টুলের মাধ্যমে চালানো হলে, ঠিক এই অনিয়মগুলোই মসৃণ করে সরিয়ে দেয়। এখন পর্যন্ত সনাক্তকরণ টুলগুলোর সবচেয়ে বড় স্বতন্ত্র তুলনায় 14টি টুল পরীক্ষা করা হয়েছিল এবং দেখা যায়, নমুনা পাঠ্যকে প্যারাফ্রেজ করা হলে বা মেশিন অনুবাদ করা হলে, প্রতিটি টুলের ক্ষেত্রেই নির্ভুলতা আরও কমে যায়।

লেখার বৈশিষ্ট্যএটি কেন একটি নথির আপাত অনিশ্চয়তা কমায়প্রমাণ কী দেখায়
সংক্ষিপ্ত জমাকম পাঠ্য থাকলে মানবিক ছন্দকে যান্ত্রিক ছন্দ থেকে আলাদা করে এমন স্বাভাবিক বৈচিত্র্যের জন্য কম জায়গা থাকেসংক্ষিপ্ত নথির স্কোর কয়েকটি অস্বাভাবিক বাক্যের প্রভাবে বেশি ওঠানামা করে
সূত্রবদ্ধ বা শাস্ত্র-নির্দিষ্ট লেখাধরনগত রীতি উদ্ভাবনী বাক্যের চেয়ে প্রত্যাশিত বাক্যাংশকে পুরস্কৃত করেChatGPT-এর আগের 14,400টি জার্নাল সারসংক্ষেপ (1980 থেকে 2023) এখনো 8% পর্যন্ত false positives সৃষ্টি করেছে, একটি জার্নালের সারসংক্ষেপে 10.24% পর্যন্ত পৌঁছেছে
অত্যধিক সম্পাদিত বা প্যারাফ্রেজ করা খসড়াএকটি পরিমার্জন ধাপ সেই ব্যক্তিগত অনিয়মগুলো মসৃণ করে দেয়, যেগুলো একটি detector মানবিক বলে পড়েএকটি স্বতন্ত্র 14-tool তুলনায় দেখা গেছে, প্যারাফ্রেজিং বা মেশিন অনুবাদের পরে নির্ভুলতা আরও কমেছে
উদ্ধৃত বা টেমপ্লেটভিত্তিক উপাদানউদ্ধৃত অংশটি তার উৎসের পরিসংখ্যানগত স্বাক্ষর বহন করে, উদ্ধৃতিকারী লেখকের নয়যে detectors উদ্ধৃতি বাদ দেয় না, তারা ধার করা পাঠ্যের ভিত্তিতে আশপাশের নথিকে স্কোর করে

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

কেন প্রকাশিত হার এবং বাস্তব জগতের হার মেলে না

প্রতিটি প্রধান detector প্রায় এক শতাংশ বা তার কম false positive rate প্রকাশ করে। একই টুলগুলোর স্বাধীন পরীক্ষা, ভিন্ন নথিতে ভিন্ন পরিস্থিতিতে চালানো হলে, নিয়মিতভাবে এর চেয়ে অনেক বেশি হার জানায়, কখনও কখনও দশ গুণ বা তারও বেশি। উভয় সংখ্যাই সঠিক হতে পারে এবং তবু প্রায় কিছুই সাধারণভাবে বর্ণনা না-ও করতে পারে, কারণ তারা একই জিনিস মাপছে না।

Turnitin একটি উপযোগী উদাহরণ, ঠিক এই কারণে যে এটি অধিকাংশ প্রতিদ্বন্দ্বীর তুলনায় বেশি বিশদ প্রকাশ করে: নথি স্তরে 1 percent-এর নিচে false positive rate, শর্ত হলো একটি জমাদানের 20 percent-এর বেশি অংশকে AI-written হিসেবে চিহ্নিত হতে হবে, এবং এর সঙ্গে কোম্পানির এই বক্তব্যও থাকে যে বাস্তব জগতের ফলাফল তার নিজস্ব ল্যাব পরীক্ষার ফলের থেকে ভিন্ন। The Washington Post 2023 সালে একই টুলের মধ্যে 16টি বাস্তব নথি চালিয়ে দেখেছিল, এবং পেয়েছিল যে অর্ধেকেরও বেশি অন্তত আংশিকভাবে ভুল শনাক্ত হয়েছে, যার মধ্যে একটি সম্পূর্ণ মানব-রচিত প্রবন্ধকে আংশিক AI-generated হিসেবে চিহ্নিত করা হয়েছিল। কোনো সংখ্যাই বানানো নয়। সেগুলি এসেছে ভিন্ন নমুনা, ভিন্ন threshold, এবং কীকে flag ধরা হবে তার ভিন্ন সংজ্ঞা থেকে।

একই ফাঁক পুরো শিল্পজুড়ে দেখা যায়, শুধু একটি কোম্পানিতে নয়। 14টি টুলের সেই তুলনায় দেখা গেছে, সামগ্রিকভাবে তাদের প্রত্যেকটিই 80 percent accuracy-এর নিচে ছিল, এবং 14টির মধ্যে 6টি কোনো paraphrasing আসার আগেই অপরিবর্তিত মানব-লিখিত লেখায় false positive দিয়েছিল। প্রকাশিত একটি সংখ্যা একটি benchmark বর্ণনা করে। এটি সেই নথিকে বর্ণনা করে না, যা বর্তমানে একজন অধ্যাপকের সামনে পড়ে আছে।

কেন একটি আত্মবিশ্বাসী স্কোর আত্মবিশ্বাসী অভিযোগ নয়

False positive rate শুনলে মনে হতে পারে, এটি বোঝায় যে সমস্যাজনক হিসেবে চিহ্নিত কোনো এক শিক্ষার্থী নির্দোষ হওয়ার সম্ভাবনা কত। কিন্তু না। এটি বর্ণনা করে, একটি test কীভাবে সেটি নেওয়া সবার জন্য কাজ করে। আর এগুলি ভিন্ন প্রশ্ন, ভিন্ন উত্তরসহ, ঠিক যেমন চিকিৎসা বা নিরাপত্তার যেকোনো screening test-এর ক্ষেত্রে হয়।

Griffith University-এর একজন গবেষকের March 2026-এর একটি statistical analysis অন্তর্নিহিত গণিতকে স্পষ্ট করে। AI detection-কে একক, বিচ্ছিন্ন নথির ওপর নয়, বরং শিক্ষার্থী লেখকদের একটি population-এর ওপর প্রয়োগ করা test হিসেবে ধরলে একটি trade-off দেখা দেয়: যখনই সেই population-এর কিছু অংশ এমনভাবে লেখে যা স্বাভাবিকভাবেই সাধারণ AI output-এর সঙ্গে মিলে যায়, genre convention-এর কাছাকাছি, second-language learner-এর range-এর কাছাকাছি, তখন AI-written কাজ ধরার বাস্তব ক্ষমতাসম্পন্ন যেকোনো detector-কে সেই overlapping অংশের কিছু ক্ষেত্রে ভুল করতে হবে। এটি কোনো নির্দিষ্ট detector খারাপভাবে তৈরি হয়েছে, এমন দাবি নয়। এটি একটি single document এবং অন্য কোনো প্রমাণ ছাড়া বৈচিত্র্যময় population পরীক্ষা করার একটি বৈশিষ্ট্য।

পেপারের নিজস্ব ব্যাখ্যামূলক উদাহরণই এতে জড়িত মাত্রা দেখায়। ধরুন, একটি ছাত্রসমষ্টির 10 percent সদস্য এমনভাবে লেখে যা সাধারণ AI আউটপুটের যথেষ্ট কাছাকাছি, এবং একটি ডিটেক্টরকে প্রকৃত AI-লিখিত কাজের 80 percent ধরার জন্য সমন্বয় করা হয়েছে। তখন গণিত অনুযায়ী সেই সমষ্টিজুড়ে গড় false positive rate অন্তত 7.5 percent হতে হবে। এটি ডিটেক্টরের প্রকৌশলগত ত্রুটি নয়, এটি এই কারণে সরাসরি উদ্ভূত যে সেই গোষ্ঠীর লেখা পরিসংখ্যানগতভাবে যে জিনিসটি শনাক্ত করা হচ্ছে তার সঙ্গে কতটা ওভারল্যাপ করে।

10,000 শিক্ষার্থীর একটি বিশ্ববিদ্যালয়ে এটি প্রয়োগ করলে, শুধু এই নিম্নসীমাই সমগ্র জনসমষ্টিতে প্রায় 750টি false flag নির্দেশ করে, কারণ কোনো অতিরিক্ত প্রমাণ বিবেচনা না করে একটি একক নথির বিরুদ্ধে বৈচিত্র্যময় জনসমষ্টিকে পরীক্ষা করার একটি গাণিতিক ফল। পেপারের লেখক স্পষ্টভাবে বলেন যে এই নির্দিষ্ট সংখ্যাগুলি বাস্তব কোনো প্রতিষ্ঠানে মাপা নয়, কেবল উদাহরণমূলক। উদাহরণটি কোনো একটি ক্যাম্পাসের জন্য নির্দিষ্ট পূর্বাভাস নয়, বরং সমস্যাটির রূপটি দেখায়।

এর কোনোটাই এই অর্থ দেয় না যে flagged score অর্থহীন। এর অর্থ হলো, score হলো একটি দুর্বল, জনসমষ্টি-স্তরের সংকেত, যাকে একটি একক ব্যক্তির সম্পর্কে প্রশ্নের উত্তর দিতে বলা হচ্ছে, এবং এই অমিল vendor polish-এর কোনো পরিমাণেই একা পুরোপুরি দূর করা যায় না। দায়িত্বশীল পাঠ এই সংখ্যাকে আরও ভালো প্রমাণ সংগ্রহের আহ্বান হিসেবে দেখে, drafts, version history, এবং বাস্তবে কেউ কিছু লিখছে তার সাধারণ paper trail। TextPulse's free tools একজন লেখককে অন্য কেউ করার আগে এই একই পরিমাপে একটি draft বর্তমানে কোথায় দাঁড়িয়ে আছে তা যাচাই করতে দেয়, যা কোনো নির্দিষ্ট detector-কে পরাস্ত করার চেষ্টার থেকে প্রযুক্তিটির ভিন্ন ব্যবহার।

কোন লেখকেরা সর্বোচ্চ ঝুঁকির মুখে পড়েন

গবেষণাটি এমন দুইটি গোষ্ঠী দেখায় যারা অন্য সবার তুলনায় বেশি চোখে পড়ে, দ্বিতীয় ভাষায় লিখছেন এমন মানুষ এবং এমন মানুষ যারা তাদের essay কীভাবে লিখেছেন তার সঙ্গে সম্পর্কহীন কারণে স্বভাবতই খুব কাঠামোবদ্ধ বা পুনরাবৃত্তিমূলকভাবে লেখেন। এই দুই ধরনের লেখকই সেই একই পরিসংখ্যানগত স্বাক্ষরে ধরা পড়ে, যেটি ধরার জন্য একটি detector তৈরি করা হয়েছে।

অ-স্থানীয় ইংরেজি বক্তারা নথিভুক্ত ঝুঁকির মধ্যে সবচেয়ে বড় ঝুঁকি বহন করেন। স্বাধীন পরীক্ষায় বারবার দেখা গেছে যে ডিটেক্টরগুলি সাবলীল দ্বিতীয় ভাষার একাডেমিক লেখাকে নেটিভ লেখার তুলনায় অনেক বেশি হারে মেশিন-উৎপাদিত বলে ভুলভাবে পড়ে। TextPulse-এর ESL একাডেমিক লেখকদের জন্য পৃষ্ঠা এই ঝুঁকির পেছনের প্রক্রিয়াটি আরও বিস্তারিতভাবে ব্যাখ্যা করে, যার মধ্যে কোন ধরনের বাক্যগঠনগত ধরণ এর জন্য দায়ী তাও রয়েছে।

দ্বিতীয়, কম আলোচিত একটি গোষ্ঠী সম্পর্কিত একটি সমস্যা মোকাবিলা করে। গবেষকেরা প্রায় 60,000টি Reddit পোস্ট তুলনা করেছেন, যেগুলি একটি উপসেটের মধ্যে ভাগ করা ছিল যা সম্ভবত অটিস্টিক লেখকদের লেখা বলে শনাক্ত করা হয়েছিল এবং একটি সাধারণ নমুনা, এবং উভয়কেই GPT-2-ভিত্তিক একটি ডিটেক্টরের মাধ্যমে চালিয়েছেন। উভয় গোষ্ঠীই সামগ্রিকভাবে 2 শতাংশের নিচে ফ্ল্যাগড ছিল, কিন্তু সম্ভবত-অটিস্টিক উপসেটটি সাধারণ নমুনার তুলনায় উল্লেখযোগ্যভাবে বেশি হারে ফ্ল্যাগড হয়েছিল। যে লেখা আক্ষরিক, পুনরাবৃত্তিমূলক, কঠোরভাবে বিন্যস্ত বাক্যগঠনের দিকে ঝোঁকে, যা কিছু অটিস্টিক যোগাযোগ শৈলীর একটি নথিভুক্ত বৈশিষ্ট্য, তা ঠিক সেই কম-বৈচিত্র্যের পাঠ্য তৈরি করে যা একটি ডিটেক্টর ধরার জন্য নির্মিত।

দুই বিক্রেতা দাবি যাচাই করার মতো যথেষ্ট তথ্য প্রকাশ করে। Turnitin-এর নিজস্ব false positive rate আলাদাভাবে উপস্থাপিত হয়েছে, এবং ZeroGPT-এর accuracy তার নিজস্ব পাতায় বিশ্লেষণ করা হয়েছে। এই ভুলগুলো সবচেয়ে বেশি কাদের ওপর পড়ে, তা আবার একটি পৃথক প্রশ্ন, এবং কেন অ-স্থানীয় ইংরেজি লেখকদের বেশি বার ফ্ল্যাগ করা হয় তারও নিজস্ব উত্তর আছে।

এর কোনোটিই শিগগির সহজ হয়ে উঠবে বলে মনে হয় না। ডিটেক্টরগুলি প্রকৃতপক্ষে মেশিন-লিখিত পাঠ্য ধরতে আরও উন্নত হতে থাকবে, এবং জনসংখ্যাগত বৈচিত্র্য এমন কিছু false accusation হার তৈরি করতে থাকবে যা কেবল উন্নত প্রকৌশল দিয়েই পুরোপুরি দূর করা যায় না। আরও উপযোগী পরিবর্তনটি ইতিমধ্যেই কিছু প্রতিষ্ঠানে ঘটছে, একটি স্কোরকে একটি কথোপকথনের শুরু হিসেবে দেখা, শেষ হিসেবে নয়, এবং তাদের সামনে থাকা নথিতে তা প্রয়োগ হয় কি না তা বিশ্বাস করার আগে প্রকাশিত হারটি আসলে কোন জনসংখ্যার ওপর পরীক্ষা করা হয়েছিল তা জিজ্ঞাসা করা।

Frequently Asked Questions

একটি AI detector false positive হলো human-written text, যা একটি detection tool ভুলভাবে AI-generated হিসেবে score করে। এটি ঘটে কারণ detectors passage কতটা predictable তা মাপে, কে লিখেছে তা নয়। Short, formulaic, heavily edited, বা second language-এ লেখা writing প্রায়ই predictable বলে পড়ে, এমন কারণে যা authorship-এর সঙ্গে সম্পর্কিত নয়, এবং সেটাই flag trigger করার জন্য যথেষ্ট।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI Detector False Positives: কেন এটি ঘটে | TextPulse.ai