AI Detection

Winston AI পর্যালোচনা: 99.98% নির্ভুলতার দাবি বনাম প্রমাণ

Winston AI 99.98% নির্ভুলতার দাবি করে, detector শিল্পে এটি সর্বোচ্চ স্বঘোষিত সংখ্যা, যা কোম্পানি কখনও প্রকাশ না করা একটি অভ্যন্তরীণ test set-এ মাপা হয়েছে। peer-reviewed RAID benchmark, fixed 5% false positive rate-এ এর সামগ্রিক নির্ভুলতা 71% নির্ধারণ করেছে, যা পরীক্ষিত চারটি commercial detector-এর মধ্যে এখনও দ্বিতীয়। এখানে প্রতিটি সংখ্যা আসলে কী মাপে, এবং এই tool কার জন্য সত্যিই উপযোগী, তা ব্যাখ্যা করা হয়েছে।

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI 99.98% নির্ভুলতার দাবি করে, যা প্রধানধারার যেকোনো AI detector-এর মধ্যে তার নিজস্বভাবে ঘোষিত সর্বোচ্চ সংখ্যা। এই সংখ্যাটি কোম্পানির হোমপেজে "The Most Trusted AI Detector" কথাগুলোর পাশে প্রদর্শিত হয়, এবং এটি কোনো বাইরের ল্যাব নয়, বরং কোম্পানির নিজস্ব অভ্যন্তরীণ পরীক্ষার ফল থেকে এসেছে। এর সঙ্গে কোনো পদ্ধতিবিদ্যা, পরীক্ষাসেটের আকার, মানব থেকে AI নমুনার অনুপাত, বা কার্যকরী threshold প্রকাশ করা হয়নি। দাবি এবং তার নথিভুক্তির মধ্যে এই ফাঁকটাই হলো এই tool সম্পর্কে একজন সতর্ক পাঠকের প্রথমে জানা প্রয়োজন।

দ্বিতীয় বিষয়টি হলো, Winston-কে বাস্তবে বাইরের পক্ষও পরীক্ষা করেছে, যা কিছু detector-এর পক্ষে বলা যায় না। RAID benchmark, ACL 2024-এ উপস্থাপিত একটি peer-reviewed study, প্রায় 6.2 million machine-generated texts-এর বিরুদ্ধে Winston-কে পরীক্ষা করে এবং false positive rate 5% নির্দিষ্ট রেখে 71.0% overall accuracy মাপে। এটি 99.98% থেকে অনেক দূরের ফল। এটি আরও দেখায় যে পরীক্ষিত চারটি commercial detector-এর মধ্যে Winston দ্বিতীয় স্থানে ছিল, GPTZero এবং ZeroGPT-এর আগে। এই দুই তথ্যই গুরুত্বপূর্ণ, এবং একটিও অন্যটিকে বাতিল করে না।

এরপর যা আসছে তা হলো Winston কী, এবং কার জন্য এটি তৈরি, vendor কী দাবি করে, 99.98% self-benchmark পরিসংখ্যানগতভাবে কী বোঝাতে পারে এবং কী বোঝাতে পারে না, এবং স্বাধীন সংখ্যাগুলো আসলে কী দেখায়।

Winston AI কী, এবং এটি কে ব্যবহার করে?

Winston AI একটি paid, subscription-based detector, যা সরাসরি শিক্ষাবিদ এবং content publisher-দের লক্ষ্য করে তৈরি। এর feature list একজন শিক্ষকের workflow-এর মতো শোনায়: কোম্পানির site-এ এমন OCR-এর বর্ণনা আছে যা scanned documents, photos, এবং handwriting থেকে text বের করে, supported platforms-এর মধ্যে Google Classroom integration তালিকাভুক্ত আছে, AI detection-এর পাশাপাশি plagiarism checker আছে, এবং submission-এর batch পরিচালনার জন্য document organization আছে। vendor-এর বক্তব্য, এটি ChatGPT, Gemini, Claude, LLaMA "and much more" থেকে output শনাক্ত করে।

ইন্টারফেসের সবচেয়ে স্বতন্ত্র অংশটি হলো প্রতি-বাক্য আউটপুট। কেবল একটি একক শতাংশ ফেরত দেওয়ার বদলে, Winston যাকে AI prediction map বলে, তা তৈরি করে, অর্থাৎ রঙ-সংকেতযুক্ত, বাক্যভিত্তিক একটি মূল্যায়ন, যেখানে দেখানো হয় নথির কোন অংশগুলো যন্ত্র-উৎপাদিত বলে পড়া যায়। একজন শিক্ষাবিদের জন্য, সেই মানচিত্রটি একটি খালি স্কোরের চেয়ে বেশি উপযোগী, কারণ এটি দেখায় সন্দেহটি কোথায় কেন্দ্রীভূত। তবে এটিকে অতিরিক্তভাবে ব্যাখ্যা করাও সহজ, নিচে যে বিষয়টি আলোচিত হয়েছে।

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
উক্ত ব্যাজটি: 99.98% accurate, হোমপেজে, এবং এর পেছনে কোনো নামকরা গবেষণা নেই।

কোম্পানিটি কী দাবি করছে?

Winston AI's homepage-এ শিরোনাম-দাবি হলো "99.98% Accurate." এই লেখার সময় পর্যন্ত, যে পৃষ্ঠায় এই সংখ্যাটি আছে, সেখানে প্রকাশ করা হয়নি পরীক্ষার corpus কীভাবে তৈরি করা হয়েছে, এতে কতটি নমুনা ছিল, এতে মানব ও AI পাঠ্যের কী অনুপাত ব্যবহৃত হয়েছে, অথবা এই সংখ্যা মাপার সময় detector-এর decision threshold কীভাবে নির্ধারণ করা হয়েছিল। এটি এই শিল্পে অস্বাভাবিক নয়, বাজারের প্রায় প্রতিটি detector জুড়েই vendor accuracy claims এবং independent evidence-এর মধ্যে একই ফাঁক দেখা যায়। Winston-এর দাবির সংস্করণটি কেবল এটির ওপর আরোপিত সবচেয়ে বড় সংখ্যা।

99.98% Self-Benchmark আসলে কী বোঝাতে পারে?

এক মুহূর্তের জন্য এই গণিতকে গুরুত্বের সঙ্গে নিন। 99.98% accuracy rate মানে প্রতি 10,000 নমুনায় 2টি error। এই সংখ্যা আদৌ মাপতে হলে, একটি কোম্পানির অন্তত কয়েক দশ হাজার নথির একটি labeled test set দরকার, যেখানে প্রতিটি পাঠ্যের প্রকৃত উৎস নিশ্চিতভাবে জানা থাকে। তারপর এই সংখ্যা কেবল সেই corpus-এর কর্মক্ষমতা বর্ণনা করে, সেই AI models, সেই prompts, সেই genres, সেই text length, এবং একটি নির্বাচিত threshold-এ।

এর কোনোটিই অসৎ উদ্দেশ্য দাবি করে না। জনপ্রিয় chat models দ্বারা উৎপন্ন প্রবন্ধের ওপর প্রশিক্ষিত একটি detector, তারপর জনপ্রিয় chat models দ্বারা উৎপন্ন প্রবন্ধের একটি corpus-এর ওপর পরীক্ষা করা হলে, সত্যিই প্রায় সর্বোচ্চ মানের কাছাকাছি score করবে। সমস্যা হলো transferability। incoming text যখনই ভিন্ন কোনো model, ভিন্ন কোনো sampling strategy, অথবা এমন কোনো লেখকের কাছ থেকে আসে যার স্বাভাবিক style অস্বাভাবিকভাবে uniform, তখন benchmark যে corpus-এর ওপর মাপা হয়েছিল তা আর বিচারাধীন text-টিকে বর্ণনা করে না। একটি internal benchmark হলো এমন একটি controlled experiment, যা ফলাফলে সবচেয়ে বেশি স্বার্থ থাকা পক্ষ নিজেই, নিজের পছন্দের শর্তে চালায়। এটি evidence, কিন্তু এটি সবচেয়ে দুর্বল ধরনের evidence, এবং methodology অনুপস্থিত থাকায় company-র বাইরে কেউ তা যাচাইও করতে পারে না।

Independent Testing কী দেখায়?

Winston-কে অন্তর্ভুক্ত করে এমন সবচেয়ে rigorous public test হলো RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, Dugan এবং সহকর্মীদের একটি peer-reviewed study, যা ACL 2024-এ উপস্থাপিত হয়েছিল। RAID 12টি detector মূল্যায়ন করে, যার মধ্যে 4টি commercial product ছিল, প্রায় 6.2 million generation-এর বিরুদ্ধে, যা 11টি language model, 8টি writing domain, 4টি decoding strategy, এবং 11টি adversarial attack জুড়ে বিস্তৃত ছিল, এবং প্রতিটি detector-কে একই 5% false positive rate-এ calibrated করা হয়েছিল, যাতে score-গুলো তুলনাযোগ্য হয়।

DetectorRAID-এ overall accuracy (FPR 5% এ fixed)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

সেই সারণির দুটি পাঠ একই সঙ্গে সৎ। Winston-এর 71.0% কোনোভাবেই 99.98% এর কাছাকাছি নয়, এবং Winston তবু উপলব্ধ সবচেয়ে কঠিন জনসম্মুখ মানদণ্ডে তার তিনটি বাণিজ্যিক প্রতিদ্বন্দ্বীর মধ্যে দুটিকে ছাড়িয়ে গেছে। গড় মানও একটি তাৎপর্যপূর্ণ বিস্তার আড়াল করে। RAID-এর প্রতি-মডেল ফলাফলে, Winston ChatGPT আউটপুটে 99.6% এবং GPT-4 আউটপুটে 98.8% পেয়েছে, যা তার নিজস্ব প্রচারিত সংখ্যার কাছাকাছি, কিন্তু GPT-2 পাঠ্যে 47.6% এবং বেস MPT-30B মডেলের পাঠ্যে 24.8% এ নেমে গেছে। প্যারাফ্রেজ করা যন্ত্র-উৎপাদিত পাঠ্যে, এর নির্ভুলতা 52.6% এ নেমে আসে।

এই বিস্তারই 99.98% দাবির ক্ষুদ্র রূপে সম্পূর্ণ কাহিনি। যে পাঠ সম্ভবত ডিটেক্টরটির জন্য সূক্ষ্মভাবে সমন্বয় করা হয়েছিল, অর্থাৎ সাম্প্রতিক চ্যাট মডেলগুলির সরল গদ্য, তার সঙ্গে সাদৃশ্যপূর্ণ পাঠে Winston তার বিপণন দাবির কাছাকাছি কাজ করে। সেই বণ্টনের বাইরে গেলে, কর্মক্ষমতা দ্রুত নেমে যায়। বণ্টনের ভেতরের পাঠ থেকে তৈরি একটি অভ্যন্তরীণ মানদণ্ড সত্যিই প্রায় নিখুঁত একটি সংখ্যা দিতে পারে, অথচ একটি বাস্তব ইনবক্সে থাকা মডেল, সম্পাদনা, এবং প্যারাফ্রেজের জটিল মিশ্রণ সম্পর্কে প্রায় কিছুই না বলতে পারে। ডিটেক্টর যে পরিসংখ্যানগত সংকেতের ওপর নির্ভর করে, তা আমাদের AI detectors work বিষয়ক ব্যাখ্যায় আরও বিস্তারিতভাবে আলোচিত হয়েছে।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

মিথ্যা ধনাত্মক ফল, কারা ক্ষতিগ্রস্ত হয়?

RAID-এর নকশা এমন একটি বিনিময়কে দৃশ্যমান করে, যা বিক্রেতাদের বিপণনে খুব কমই দেখা যায়, এই গবেষণার প্রতিটি নির্ভুলতার স্কোর মিথ্যা ধনাত্মক হার 5% এ স্থির করার পর মাপা হয়েছে। সেই ক্যালিব্রেশনে, 20 জনের মধ্যে 1 জন প্রকৃত মানব-রচিত নথি চিহ্নিত হয়। একটি ডিটেক্টর তার থ্রেশহোল্ড বাড়িয়ে এই হার কমাতে পারে, কিন্তু তা কেবল কম AI পাঠ ধরার বিনিময়ে, দুটি সংখ্যা একসঙ্গে নড়ে, এবং একটি বিক্রেতা যদি একটিকে অন্যটি ছাড়া উদ্ধৃত করে, তবে তা ফলাফলের অর্ধেকই উদ্ধৃত করা।

সেই ত্রুটিগুলোর ভার সমানভাবে বণ্টিত নয়। সূত্রবদ্ধ, প্রচলিত, এবং কম-প্রসারণশীল লেখা প্রতিটি পরিসংখ্যানগত শনাক্তকারীর কাছে যন্ত্রসদৃশ শোনায়, এবং এই বর্ণনা পদ্ধতি-সংক্রান্ত অংশ, সাহিত্য পর্যালোচনা, এবং দ্বিতীয় ভাষায় কাজ করা লেখকদের সতর্ক গদ্যের ক্ষেত্রে প্রযোজ্য। AI detectors non-native English speakers-দের উচ্চ হারে চিহ্নিত করছে এই ধরণটি শিল্পজুড়ে নথিভুক্ত, এবং Winston-এর পদ্ধতিতে এমন কিছু নেই যা তাকে এর বাইরে রাখে। প্রতি-বাক্য পূর্বাভাস মানচিত্র একই সতর্কতা দাবি করে, লালচিহ্নিত একটি বাক্য শব্দ-ধরনের একটি পরিসংখ্যানগত পর্যবেক্ষণ, লেখকত্ব সম্পর্কে প্রমাণ নয়। অন্যায়ভাবে চিহ্নিত হওয়া শিক্ষার্থীদের উচিত স্বীকারোক্তি নয়, নথিপত্র থেকে শুরু করা, আমাদের how to prove you did not use AI নির্দেশিকায় কী সত্যিই প্রভাব ফেলে তা ব্যাখ্যা করা হয়েছে।

মূল্য নির্ধারণ এবং প্রবেশাধিকার

Winston একটি সীমিত ট্রায়ালসহ অর্থপ্রদ পণ্য। Winston 14-day free trial with 2,000 credits, Essential plan at $18 per month (or $10 per month billed annually) with 100,000 monthly credits, Advanced plan at $29 per month (or $16 annually) that adds team seats and larger scans, and an Elite tier above that তালিকাভুক্ত করে। একজন একক শিক্ষকের জন্য, যিনি একটি শ্রেণির সমান জমা পর্যালোচনা করছেন, এটি Winston-কে তাৎক্ষণিক ক্রয়ের পর্যায়ে ফেলে, প্রাতিষ্ঠানিক চুক্তির তুলনায় সস্তা, অধিকাংশ বিনামূল্যের সরঞ্জামের তুলনায় বেশি সক্ষম।

শনাক্তকারী পরিসরে Winston কোথায় অবস্থান করে

স্বাধীন প্রমাণ অনুযায়ী, Winston একটি মধ্যমূল্যের বাণিজ্যিক শনাক্তকারী, যা বাজারের বিনামূল্য স্তরের চেয়ে ভালো কাজ করে এবং নিজের প্রচারের চেয়ে খারাপ। এটি এমন একজন শিক্ষকের জন্য উপযুক্ত, যিনি প্রতি-বাক্য দৃশ্যমানতা, Classroom সংযোগ, এবং plagiarism checking একটিমাত্র সাশ্রয়ী সরঞ্জামে চান, এবং যিনি প্রতিটি ফলাফলকে রায় নয়, বরং আলোচনার সূচনা হিসেবে দেখেন। এটি এমন কারও জন্য উপযুক্ত নয়, যাঁর score-কে প্রমাণ হিসেবে কাজ করতে হবে, কারণ কোনো detector-এর score-ই তা করে না।

সম্পূর্ণ তুলনা

Winston একটি ভিড়ভাট্টা ক্ষেত্রে থাকা একটি ডিটেক্টর, এবং এর 71% বনাম 99.98% ব্যবধানটি শিল্পজুড়ে বিদ্যমান একটি ধাঁচের একটি উদাহরণ। একই প্রমাণ-প্রথম মানদণ্ডে Turnitin, GPTZero, Originality, ZeroGPT, এবং অন্যদের তুলনায় এটি কেমন দাঁড়ায়, তা জানতে আমাদের AI detectors compared বিষয়ে পূর্ণ নির্দেশিকা দেখুন।

আমাদের নিজস্ব গবেষণা যা পেয়েছে

TextPulse Research-এর ডিটেক্টর সম্মতি গবেষণায় নয়টি বাণিজ্যিক AI ডিটেক্টর একই 90টি একাডেমিক লেখা মূল্যায়ন করেছে। এর একটি ছিল 455 শব্দের একটি হাইব্রিড লেখা: মানুষের লেখা শুরু ও শেষ, মাঝখানে 168 শব্দের AI-লেখা অংশ। Winston AI এই লেখাটিকে 7% AI স্কোর দিয়েছে, অথচ একই শব্দে অন্য টুলগুলোর রায় 0% থেকে 95.7% পর্যন্ত ছড়িয়ে ছিল। সম্পূর্ণ গবেষণাপত্র, করপাস ও প্রতিটি টুলের স্কোর ম্যাট্রিক্স উন্মুক্তভাবে পাওয়া যাবে TextPulse Research-এ।

গবেষণার করপাস থেকে নেওয়া হাইব্রিড লেখায় Winston AI।
গবেষণার করপাস থেকে নেওয়া হাইব্রিড লেখায় Winston AI।
XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

99.98% সংখ্যাটি Winston AI-এর নিজস্ব দাবি, যা কোম্পানি প্রকাশ না করা একটি অভ্যন্তরীণ test set-এ মাপা হয়েছে। ACL 2024-এ উপস্থাপিত peer-reviewed RAID benchmark-এ Winston সামগ্রিক নির্ভুলতায় 71.0% পেয়েছে, false positive rate 5%-এ স্থির রেখে, যদিও ChatGPT output-এর ক্ষেত্রে এটি 99.6% অর্জন করেছে। এই দাবি একটি নির্বাচিত corpus বর্ণনা করে, বাস্তব জগতের কর্মক্ষমতা নয়।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।