AI Detection

AI ডিটেক্টরগুলো কি নির্ভুল? মিথ্যা পজিটিভ এবং পক্ষপাত

বিক্রেতারা 1 শতাংশের নিচে মিথ্যা পজিটিভ হার প্রকাশ করে। একই ডিটেক্টরগুলোকে অ-স্থানীয় ইংরেজি লেখার ওপর পরীক্ষা করা স্বাধীন গবেষকেরা 60 শতাংশের বেশি হার পেয়েছেন। প্রমাণ যা দেখায়, এখানে তা দেওয়া হলো।

9 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitin দাবি করে যে তাদের false positive rate 1% এর কম। একদল স্বাধীন গবেষক non-native English speakers-এর লেখার একটি বিস্তৃত পরিসর থেকে একাধিক detector পরীক্ষা করেন। তারা দেখতে পান, একই ধরনের লেখার ক্ষেত্রে গড় false positive rate 60% এর বেশি ছিল। এই দুইটি সংখ্যাই বাস্তব, উভয়ই প্রকাশিত হয়েছে, এবং উভয়ই একই বাজারে বিক্রি হওয়া detector-এর সঙ্গে সম্পর্কিত। AI detector কি নির্ভুল? এটি নির্ভর করে আপনি কোন জনসংখ্যা পরীক্ষা করেছেন, কোন detector ব্যবহার করেছেন, এবং আপনার vendor শুরুতেই এটিকে কীভাবে সংজ্ঞায়িত করেছে তার ওপর।

এই পোস্টে detector কীভাবে সেই score গণনা করে, তা আবার ব্যাখ্যা করা হবে না। mechanism, perplexity, token probability, classifier কীভাবে প্রশিক্ষিত হয়, তা অন্যত্র বিস্তারিতভাবে আলোচিত হয়েছে, এবং যদি আপনি আগে না পড়ে থাকেন, তবে তা পড়া মূল্যবান। এখানে গুরুত্বপূর্ণ বিষয় হলো score একবার তৈরি হলে কী ঘটে, এটি কতবার ভুল হয়, কার লেখার ক্ষেত্রে এটি সবচেয়ে বেশি ভুল হয়, এবং একটি false accusation আসলে এমন কারও জন্য কী খরচ ডেকে আনে, যে কিছুই ভুল করেনি।

AI detector কি নির্ভুল?

সামঞ্জস্যপূর্ণভাবে নয়, এবং marketing claims ও independent testing-এর মধ্যে ব্যবধান সুপ্রামাণিত। Debora Weber-Wulff-এর নেতৃত্বাধীন একদল গবেষক 2023 সালে মানব-লিখিত ও ChatGPT পাঠ্যের মিশ্রণের বিরুদ্ধে পরীক্ষা করা 14টি detection tool-এর ওপর তাদের ফলাফল প্রকাশ করেন, যার মধ্যে 12টি free এবং দুটি commercial ছিল। তারা দেখতে পান যে এই toolগুলোর কোনোটিই নির্ভুল বা নির্ভরযোগ্য নয়, এবং machine text-কে human হিসেবে চিহ্নিত করার একটি অন্তর্নির্মিত পক্ষপাত রয়েছে, উল্টোটা নয়। এই পরীক্ষায় অন্তর্ভুক্ত দুটি commercial tool ছিল Turnitin এবং PlagiarismCheck। এই পরীক্ষার সব tool-ই পাঠ্য paraphrase করা হলে আরও খারাপ ফল করেছে।

কিন্তু দুই বছর পরেও, পরিস্থিতি স্থবির নয়। University of Chicago-এর Booth School-এর Brian Jabarian এবং Alex Imas-এর একটি working paper, Pangram, GPTZero এবং Originality.ai, এই তিনটি নতুন প্রবেশকারী এবং একটি open-source প্রতিযোগীকে প্রায় 2,000টি মানব-লিখিত লেখা, যা blog, news, review এবং fiction থেকে নেওয়া হয়েছিল, সেগুলোর ওপর পরীক্ষা করেছে। নিয়ন্ত্রিত test condition-এর অধীনে, এই সমষ্টির মধ্যে সেরা tool কখনও 99.8 percent accuracy-এর নিচে নামেনি এবং তার false positive rate-ও নিম্ন স্তরে বজায় রেখেছিল। open-source modelটি একটি random guesser-এর মতোই কাজ করেছে। পরিস্থিতি সত্যিই উন্নত হয়েছে। কিছুটা। সামান্য।

কিন্তু মূল বিষয়টি হলো controlled শব্দটি। benchmark passage-গুলো পরিষ্কার, সম্পূর্ণ এবং পরিচিত condition-এর অধীনে তৈরি। জমা দেওয়া essay নির্ভরযোগ্যভাবে এইগুলোর কোনোটিই নয়। বাস্তব জগতের ফলাফল laboratory ফলাফলের সঙ্গে অভিন্ন নাও হতে পারে, যেমন Turnitin-এর নিজস্ব chief product officer প্রকাশ্যে বলেছেন, যদিও এটি কোনো vendor-এর কাছ থেকে বিরল এবং উপকারী স্বীকারোক্তি। পরবর্তী section-এ vendor-এর সংখ্যা independent সংখ্যার পাশে রাখা হয়েছে, যাতে ব্যবধানটি দাবি করা নয়, দৃশ্যমান হয়।

Vendor-এর দাবি বনাম independent testing

নিচের table-টি চারটি detector নিজেদের সম্পর্কে যা দাবি করে, তা সরাসরি tool-গুলো পরীক্ষা করার সময় independent researcher-রা যা মেপেছেন, তার সঙ্গে পাশাপাশি সাজিয়েছে। vendor column-টি একা নয়, মাঝের দুইটি column একসঙ্গে পড়ুন।

ডিটেক্টরবিক্রেতার দাবি করা নির্ভুলতাস্বতন্ত্রভাবে পর্যবেক্ষিতমিথ্যা পজিটিভ সম্পর্কে বিক্রেতা যা বলে
Turnitinচিহ্নিত করার আগে 98% আস্থার সীমা, নথি-স্তরে 1% এর কম মিথ্যা পজিটিভপ্রায় 80% নির্ভুলতা, 2023 সালের একটি তুলনায় 12টি টুলের মধ্যে সেরা, টুলটির আগের সংস্করণে20% AI-written সীমার উপরে নথি-স্তরে 1% এর কম, বাক্য-স্তরে প্রায় 4%
GPTZeroস্বতন্ত্র RAID বেঞ্চমার্কে 1% মিথ্যা পজিটিভ হারে 95.7% AI-text সনাক্তকরণসংক্ষিপ্ত অংশে 96% নির্ভুলতা, 2025 সালের University of Chicago Booth গবেষণায় মিথ্যা পজিটিভ হার 1% এর কমRAID বেঞ্চমার্কে 1% মিথ্যা পজিটিভ হার রিপোর্ট করে
Originality.ai99% নির্ভুলতা, 0.5% মিথ্যা পজিটিভ হার (Lite model), 1.5% (Turbo model)মিথ্যা পজিটিভ হার 1% এর কম, কিন্তু একই Booth গবেষণায় AI-written পাঠ্যের 10% থেকে 40% মিস করেছেমডেল স্তর অনুযায়ী পৃথক মিথ্যা-পজিটিভ পরিসংখ্যান প্রকাশ করে
Pangramএটি যে ত্রুটি হার দাবি করে তা প্রতিযোগী টুলগুলোর তুলনায় 38 গুণেরও বেশি কম, অ-স্থানীয় ইংরেজি লেখকদের বিরুদ্ধে কোনো পক্ষপাত নেই বলে জানায়Booth গবেষণায় নির্ভুলতা কখনও 99.8% এর নিচে নয়, মিথ্যা পজিটিভ হার প্রায় শূন্য10টি পাঠ্য ডোমেইন এবং 8টি language models জুড়ে প্রায়-শূন্য মিথ্যা পজিটিভ হার দাবি করে

দুটি বিষয় স্পষ্টভাবে চোখে পড়ে। প্রথমত, বিক্রেতার সব পরিসংখ্যান এমন একটি ল্যাব থেকে এসেছে যা বিক্রেতার নিয়ন্ত্রণে, আর Booth-এর পরিসংখ্যান এসেছে এমন গবেষকদের কাছ থেকে যাদের বিক্রির কিছু নেই। দ্বিতীয়ত, Turnitin ওই মধ্যবর্তী কলামে একেবারেই নেই, কারণ 2025 সালের গবেষণাটি এটিকে পরীক্ষা করেনি। সারণিতে এর স্বতন্ত্র পরিসংখ্যান 2023 সালের আগের একটি তুলনার ওপর ভিত্তি করে, তবে তা টুলটির পুরোনো সংস্করণে করা হয়েছিল, তাই সারণিটিকে সরাসরি তুলনা হিসেবে দেখার সময় এটি মনে রাখা উচিত।

Turnitin-এর AI detection কতটা নির্ভুল?

Turnitin একক কোনো নির্ভুলতার সংখ্যা প্রকাশ করে না। বরং এটি একটি সীমা এবং একটি সমঝোতা প্রকাশ করে। কোম্পানিটি বলেছে, এটি কেবল তখনই একটি নথিকে চিহ্নিত করে যখন এটি 98 percent নিশ্চিত থাকে যে চিহ্নিত অংশটি AI-লিখিত, এবং এই সীমাই নথি-স্তরের false positive হারকে 1 percent-এর নিচে রাখে। Turnitin অনুমান করেছে যে এটি AI-সহায়তাপ্রাপ্ত লেখার প্রায় 85 percent ধরে ফেলে, আর বাকি অংশ ইচ্ছাকৃতভাবে পার হতে দেয়, ভুল অভিযোগের ঝুঁকি না নিতে।

Turnitin sentence স্তরে যে প্রকৃত false positive শতাংশ ফেরত দেয়, যেখানে একটি interface পুরো নথির বদলে নির্দিষ্ট লাইনগুলো highlight করে, তা আসলে 4 percent-এর কাছাকাছি। যদি কোনো অধ্যাপক পুরো নথির score-এর বদলে কেবল একটি চিহ্নিত অনুচ্ছেদের screenshot নেন, তবে এই সংখ্যাটি জানা গুরুত্বপূর্ণ, কারণ highlighted sentence-এর ভুল হওয়ার সম্ভাবনা তার পাশের document score-এর তুলনায় অর্থপূর্ণভাবে বেশি।

এটিও উল্লেখযোগ্য যে Turnitin এই ব্যবধানটি সরাসরি স্বীকার করেছে। তারা দেখেছে যে তাদের প্রথম বাস্তব-জগতের ফলাফল, বিশেষ করে ছোট নথির ক্ষেত্রে, তাদের laboratory test-এর ভিত্তিতে প্রত্যাশিত তুলনায় বেশি false positive হার দেখিয়েছিল। তাই তারা scored হওয়ার জন্য ন্যূনতম নথির দৈর্ঘ্য 150 থেকে 300 words-এ সমন্বয় করেছে। এটি এমন এক vendor, যে নিজের product-ই সমন্বয় করছে, কারণ প্রকাশিত সংখ্যা laboratory-এর বাইরে টেকেনি, এবং এটি যেকোনো independent study-এর মতোই অনেক কিছু বলে।

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

একটি false positive বাস্তবে একজন শিক্ষার্থীর কতটা ক্ষতি করে

Yale's School of Management-এর একজন executive MBA student-এর ক্ষেত্রে এমনটাই ঘটেছিল। সবচেয়ে আক্ষরিক অর্থেই, ওই শিক্ষার্থীর বিরুদ্ধে একটি violation আনা হয়েছিল। এতে যে detector ব্যবহৃত হয়েছিল, তা ছিল GPTZero। finance course-এর ওই শিক্ষার্থীর final exam একটি teaching assistant চিহ্নিত করেছিলেন, যিনি ভেবেছিলেন লেখাটি দীর্ঘ ও জটিল, এবং তাতে প্রায় নিখুঁত punctuation ও grammar আছে। আর এই নির্দিষ্ট professor সেটিকে GPTZero-এর মধ্য দিয়ে চালিয়েছিলেন, যা উত্তরগুলোকে AI-generated হওয়ার সম্ভাবনাময় বলে score করেছিল।

তিনি কোর্সে অকৃতকার্য হন এবং এক বছরের জন্য স্থগিত হন। 2025 সালের ফেব্রুয়ারিতে ফেডারেল আদালতে দায়ের করা তাঁর মামলায় দাবি করা হয়েছে যে Yale-এর নিজস্ব নীতি ঠিক এই কারণেই GPTZero-এর মতো সরঞ্জামের ব্যবহার সীমিত করে, অর্থাৎ অ-স্থানীয় ইংরেজিভাষীদের বিরুদ্ধে এর নথিভুক্ত false positive হার, এবং তিনি সেই নীতির বিরুদ্ধে এটি ব্যবহার করেছিলেন। তাঁর দাখিলপত্রে আরও উল্লেখ করা হয়েছে যে GPTZero Yale-এর নিজস্ব প্রাক্তন বিশ্ববিদ্যালয় সভাপতি এবং ব্যবসা স্কুলের ডিনের একাডেমিক লেখার ওপর 100 percent AI-generated স্কোর দিয়েছিল।

বিচারক 2025 সালের May মাসে প্রাথমিক injunction জারি করতে অস্বীকার করেন। মামলাটি এখনও নিষ্পত্তি হয়নি, আমি যখন লিখছি তখনও। বাদী, একজন French নাগরিক, দাবি করেন যে অ-স্থানীয় ইংরেজিভাষীদের বিরুদ্ধে একই পরিচিত পক্ষপাত তাঁর লেখাকে সেইভাবে কাজ করতে বাধ্য করেছে যেভাবে তা করেছে। পরবর্তী অংশে আমরা সেটিই দেখব। বিতর্কের বাইরে যা আছে তা হলো মূল্য, একটি ডিগ্রি প্রোগ্রাম থেকে এক বছর হারানো, একটি failing grade, আইনি ব্যয়, এবং একটি স্কোর নিয়ে কয়েক মাস ধরে লড়াই করা, ডিগ্রি অর্জনের বদলে। 1 percent false positive rate ছোট শোনায়, যতক্ষণ না একটি বড় জনসংখ্যা এটিকে কারও নির্দিষ্ট সমস্যায় পরিণত করে।

AI detector-রা কেন অ-স্থানীয় ইংরেজিভাষীদের ভুলভাবে শ্রেণিবদ্ধ করে?

খারাপভাবে, এবং বড় ব্যবধানে। এটিই সেই গবেষণার উপসংহার, যা প্রথম এ বিষয়ে একটি সংখ্যা নির্ধারণ করেছিল। Stanford-এর গবেষকেরা 91টি TOEFL প্রবন্ধ, যা অ-স্থানীয় ইংরেজিভাষীরা লিখেছিলেন, এবং US-এর অষ্টম শ্রেণির শিক্ষার্থীদের লেখা 88টি প্রবন্ধের বিরুদ্ধে বহুল ব্যবহৃত সাতটি GPT detector চালান। detector-গুলো অষ্টম শ্রেণির প্রবন্ধগুলো প্রায় সব সময়ই সঠিকভাবে পড়েছিল। কিন্তু TOEFL প্রবন্ধগুলোর ক্ষেত্রে, যেগুলো এমন প্রাপ্তবয়স্করা লিখেছিলেন যারা স্নাতকোত্তর স্তরের ইংরেজি পরীক্ষা দিতে যথেষ্ট সাবলীল ছিলেন, detector-গুলোর গড় false positive হার ছিল 61.3 percent। 91টি প্রবন্ধের মধ্যে 89টিকে অন্তত সাতটি detector-এর একটি GPT দ্বারা তৈরি বলে চিহ্নিত করেছিল; ওই 18টি প্রবন্ধকে সাতটি detector-ই চিহ্নিত করেছিল।

এই প্রক্রিয়াটি বাকি শনাক্তকরণের ক্ষেত্রেও একই, অনুমানযোগ্য শব্দভান্ডার এবং সহজতর বাক্যগঠন কম perplexity হিসেবে পড়া হয়, এবং কম perplexity যান্ত্রিকভাবে তৈরি বলে পড়া হয়, কলম কার হাতে আছে তা নির্বিশেষে। দ্বিতীয় ভাষায় কাজ করা লেখকেরা সুপ্রতিষ্ঠিত বাক্যাংশের ওপর নির্ভর করেন, কারণ অতিরিক্ত ভাষায় সাবলীলতা বাস্তবে এমনই দেখায়, এবং ঠিক এই প্রোফাইলটিকেই একটি detector চিহ্নিত করার জন্য তৈরি করা হয়েছে।

এই অবস্থানে থাকা লেখকদের কেবল আরও স্বাভাবিকভাবে লেখার পরামর্শ খুব একটা কাজে আসে না, কারণ natural-ই ঠিক সেই জিনিস যা চিহ্নিত হয়েছে। TextPulse-এর ESL academic writers-এর জন্য পৃষ্ঠা এই ঝুঁকির পেছনের বাক্যগঠনগত ধরনগুলো আরও বিশদে আলোচনা করে, যার মধ্যে আছে কোন পরিবর্তনগুলো বাক্যের অর্থ না বদলে সেগুলোকে বদলে দেয়।

এটি কোনো বিচ্ছিন্ন ঘটনা ছিল না। 2025 সালের December মাসে একটি নতুন benchmark প্রকাশিত হয়, যা স্পষ্টভাবে এই detectors-এ পক্ষপাত মূল্যায়নের জন্য নকশা করা হয়েছিল। এতে একাধিক জনতাত্ত্বিক গোষ্ঠী এবং ভাষাজুড়ে 200,000-এরও বেশি নমুনা অন্তর্ভুক্ত ছিল। Stanford-এর প্রথম গবেষণা থেকে দুই বছর পরে প্রকাশিত হওয়া সত্ত্বেও এবং একই detectors-এর বহু ভিন্ন model version অন্তর্ভুক্ত করেও, এই benchmark প্রকাশ করে যে English language learners-এর প্রতি পক্ষপাত এখনও বিদ্যমান।

সব vendor-এর ক্ষেত্রে এমন নয়। Pangram-এর নিজস্ব technical documentation বলছে যে এর classifier non-native English speakers-এর বিরুদ্ধে পক্ষপাতদুষ্ট নয়। Chicago Booth-এর গবেষকেরা স্বাধীনভাবে এই দাবিটি পরীক্ষা করেননি, তবে এটি দেখায় যে detector-এর নতুন প্রজন্ম সমস্যাটিকে উপেক্ষা না করে সেটিকে মাথায় রেখেই তৈরি করা হচ্ছে।

আপনি যদি চান অন্য কেউ স্কোর করার আগে আপনার নিজের লেখা কোথায় দাঁড়িয়ে আছে তা দেখতে, একটি free perplexity checker আপনাকে detector যে অন্তর্নিহিত সংখ্যা গণনা করত, সেটিই দেয়, কোনো কিছু প্রথমে কোনো প্রতিষ্ঠানে জমা না দিয়েই।

আর কাদের চিহ্নিত করা হয়, এবং কেন

অ-স্থানীয় ইংরেজি বক্তারা নথিভুক্ত ঝুঁকির দিক থেকে সর্বাধিক ঝুঁকিতে থাকেন, কিন্তু একই পরিসংখ্যানগত যুক্তি অন্য লেখাকেও ধরতে পারে। Weber-Wulff-এর দল দেখেছে যে তারা যেসব 14টি টুল পরীক্ষা করেছে, সেগুলো paraphrased পাঠ্যের ওপর চালালে কম নির্ভুল ছিল, এটি এক অর্থপূর্ণ অংশের একাডেমিক লেখাকে নির্দেশ করে, যা কোনো detector চালানোর আগে proofreader, editor, বা supervisor-এর লাল কলমের মধ্য দিয়ে গেছে।

এর কোনোটাই এই সংখ্যা অর্থহীন বলে না, কেবল বলে যে এটি কোনো নির্দিষ্ট ব্যক্তির সম্পর্কে কিছু বোঝানোর আগে corroboration দরকার। যদি আপনার কাছে এমন একটি লেখা থাকে যা সমানধর্মী, অনুরূপ বাক্যদৈর্ঘ্য, সর্বত্র অনুরূপ ছন্দযুক্ত বলে পড়ে, তবে তা কে লিখেছে বা কেন লিখেছে তা নির্বিশেষে আরও machine-like হিসেবে স্কোর করবে। এটি অনুমান না করে সরাসরি free burstiness checker ব্যবহার করে যাচাই করা যেতে পারে।

একটি প্রতিরক্ষাযোগ্য AI detection policy কেমন দেখায়

Yale-এর ইতিমধ্যেই এমন একটি policy ছিল যা reportedly GPTZero-এর মতো টুলকে সীমিত করে, এই article যে কারণগুলো ব্যাখ্যা করেছে তার কাছাকাছি কারণেই, একটি নথিভুক্ত false positive rate এবং non-native English লেখকদের বিরুদ্ধে নথিভুক্ত bias। তাই এটি এতটা এক দুর্ভাগা student-এর গল্প নয়, যতটা একটি বিদ্যমান rule অনুসরণ না করার ঘটনা। যখন একটি policy সত্যিই score এবং verdict-এর মধ্যে পার্থক্যটি কার্যকর করে, তখন score verdict না হয়ে একটি input হয়ে ওঠে।

  • score-কে একটি input হিসেবে বিবেচনা করুন, misconduct finding-এর একমাত্র ভিত্তি হিসেবে কখনও নয়
  • ব্যবহারের আগে tool-এর প্রকাশিত false positive rate studentদের জানিয়ে দিন
  • ছোট submission এবং non-native English writing-এর ক্ষেত্রে অতিরিক্ত সতর্কতা প্রয়োগ করুন, উভয়ই নথিভুক্ত দুর্বলতা
  • একটি appeal-এর পথ নিশ্চিত করুন, যাতে একটি statistic খণ্ডন করতে না হয়

এর কোনোটাই অদ্ভুত নয়। এটি অন্য যেকোনো স্থানে forensic evidence-এর একটি একক অংশকে যেভাবে বিবেচনা করা উচিত, তারই কাছাকাছি, উপযোগী, যাচাইযোগ্য, এবং নিজে নিজে কখনও যথেষ্ট নয়।

একজন individual writer-এর ক্ষেত্রে, একই নীতি score থাকার আগে যেমন প্রযোজ্য, পরে তেমনই প্রযোজ্য। যেকোনো tool-এর একটি একক number একটি estimate, verdict নয়, এবং এটিকে উভয় দিকেই, safe বা caught, নিশ্চিত সত্য হিসেবে বিবেচনা করা numberটির সামর্থ্যের চেয়ে বেশি দাবি করে।

TextPulse-এর নিজস্ব AI humanizer tool একই যুক্তির ভিত্তিতে একটি Human Score দেখায়: এটি আপনার নিজের লেখার থেকে গণনা করা একটি অনুমান, কোনো detector-এর রায় নয়, এবং এটি একটি খসড়া বর্তমানে কীভাবে পড়া যাচ্ছে তার সংকেত হিসেবে উপযোগী, কোনো নির্দিষ্ট detector কী বলবে সে বিষয়ে কোনো প্রতিশ্রুতি নয়।

accuracy প্রশ্নটি আরও সংকীর্ণ কয়েকটি প্রশ্নে ভাগ হয়, যাদের প্রত্যেকটির জন্য আলাদা পৃষ্ঠা আছে। detector-রা যে হারে মানব-লেখা চিহ্নিত করে তা আলাদাভাবে আলোচিত হয়েছে, যেমন Turnitin-এর false positive rate এবং ZeroGPT-এর accuracy সম্পর্কিত নির্দিষ্ট প্রমাণও। যদি কোনো score ইতিমধ্যে আপনার বিরুদ্ধে ব্যবহার করা হয়ে থাকে, তাহলে AI ব্যবহার করার অভিযোগ এলে কী করতে হবে, আপনি AI ব্যবহার করেননি তা প্রমাণ করার জন্য আপনি যে প্রমাণ সংগ্রহ করতে পারেন, এবং score-এর নিজস্ব শর্তে তার জবাব দেয় এমন একটি appeal letter লেখা নিয়ে ব্যবহারিক লেখা আছে।

যেকোনো report-এর সংখ্যা vendors তাদের model পুনঃপ্রশিক্ষণ করলে এবং researchers সেগুলোকে আরও কঠিন case-এর বিরুদ্ধে পরীক্ষা করতে থাকলে পরিবর্তিত হতে থাকবে। কিন্তু যা পরিবর্তিত হওয়া উচিত নয়, তা হলো এর অন্তর্নিহিত অভ্যাস, একটি score-কে কয়েকটির মধ্যে একটি measurement হিসেবে পড়ুন, এটি কোন population-এর ওপর validated হয়েছিল তা জিজ্ঞাসা করুন, এবং vendor যে case-গুলোতে এখনও ভুল করে সেগুলো সম্পর্কে কী বলছে না, তা জিজ্ঞাসা করুন।

Frequently Asked Questions

হ্যাঁ। Weber-Wulff এবং সহকর্মীরা 2023 সালের একটি তুলনামূলক গবেষণায় AI-সনাক্তকরণ সরঞ্জামগুলোকে 'neither accurate nor reliable' বলে পেয়েছিলেন, এবং অ-স্থানীয় ইংরেজি লেখকেরা সর্বোচ্চ নথিভুক্ত ঝুঁকির মুখে পড়েন, একটি গবেষণায় TOEFL প্রবন্ধে গড় মিথ্যা পজিটিভ হার 60 শতাংশের বেশি পাওয়া গেছে। একটি একক স্কোর নিজে নিজে কোনো কিছুর প্রমাণ নয়, তাই অভিযোগের ভিত্তি হিসেবে এটিকে কখনোই একমাত্র প্রমাণ হওয়া উচিত নয়।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI ডিটেক্টরগুলো কি নির্ভুল? মিথ্যা পজিটিভ ব্যাখ্যা | TextPulse.ai