Pangram AI Detector পর্যালোচনা: গবেষকেরা যে টুলটি যাচাই করে চলেছেন
Pangram প্রায় 1 in 10,000 false positive rate প্রকাশ করে, এবং অধিকাংশ detector vendor-এর বিপরীতে এর পক্ষে এখন সাম্প্রতিক স্বাধীন গবেষণাও একই দিক নির্দেশ করছে। Vrije Universiteit Brussel-এর একটি peer-reviewed 2026 study দেখায়, master's level papers-এ সন্তোষজনক ফল দেওয়া চারটির মধ্যে এটি ছিল একমাত্র tool। এখানে studies কী মেপেছে, প্রমাণ কোথায় এখনও দুর্বল, এবং কোনো detector score কী প্রমাণ করতে পারে না, তা বলা হয়েছে।
Pangram হলো সেই AI detector, যাকে স্বাধীন গবেষকেরা বারবার আলাদা করে উল্লেখ করছেন, আর সেই কারণেই এটিকে সাধারণ vendor scorecard-এর চেয়ে একটু গভীরভাবে দেখা প্রয়োজন। এর নির্মাতা Pangram Labs প্রায় 1 in 10,000 false positive rate এবং 99.98 percent headline accuracy প্রকাশ করে। এগুলো কোম্পানির নিজস্ব সংখ্যা, যা তাদের নিজস্ব benchmark-এর ওপর মাপা। Pangram-কে ক্ষেত্রের অধিকাংশ টুল থেকে আলাদা করে যে বিষয়টি, তা হলো, এই ক্ষেত্রে প্রথমবারের মতো সাম্প্রতিক বাইরের গবেষণা একই সাধারণ দিকেই ইঙ্গিত করছে।
গত 1 বছরে দুটি স্বাধীন মূল্যায়ন প্রকাশিত হয়েছে, একটি হলো Vrije Universiteit Brussel-এর peer-reviewed study, যা Springer June 2026-এ প্রকাশ করেছে, এবং আরেকটি হলো University of Chicago Booth School-এর working paper, যা Chicago Booth Review-এ December 2025-এ আলোচিত হয়েছে। উভয়টিই Pangram-কে Turnitin, GPTZero, এবং Copyleaks-সহ বেশি পরিচিত প্রতিদ্বন্দ্বীদের চেয়ে স্পষ্টভাবে এগিয়ে রেখেছে। কোনো study-ই কোনো detector-এর score-কে নির্দিষ্ট একটি document সম্পর্কে কিছু প্রমাণ হিসেবে ধরে না, এবং উভয় study-ই তা স্পষ্টভাবে বলে।
এরপর যা আসছে, তা হলো Pangram নিজের সম্পর্কে কী দাবি করে, দুটি study আসলে কী মেপেছে, প্রমাণ কোথায় এখনও দুর্বল, এবং এই tool-এর উত্থান detection field-এর বাকি অংশ সম্পর্কে কী ইঙ্গিত দেয়।
Pangram কী এবং কারা এটি ব্যবহার করে
Pangram Labs হলো একটি ছোট company, যা 2023 সালে Brooklyn-এ AI researcher-দের দ্বারা প্রতিষ্ঠিত হয়, যাঁরা আগে Tesla এবং Google-এ কাজ করতেন। এই product pasted বা uploaded text পরীক্ষা করে এবং তার কতটা AI generated, তার একটি estimate দেয়, sentence level highlighting-এর সঙ্গে, আর paid plan-এ image detection এবং plagiarism checking-ও থাকে।
এর user base Turnitin-এর তুলনায় ভিন্ন। Turnitin প্রতিষ্ঠানগুলোর কাছে বিক্রি হয় এবং learning management system-এর ভেতরে চলে, কিন্তু Pangram free account থাকা যে কেউ ব্যবহার করতে পারে, অর্থাৎ student, editor, journal staff, এবং admissions reader-রা সরাসরি এটি ব্যবহার করেন। এটি এই market-এর newcomer, এবং academic integrity researcher-রা comparison point চাইলে ক্রমশ এই tool-ই বেছে নিচ্ছেন, ঠিক এই কারণে যে এটি সেই test-গুলোতে ভালো করছে, যেখানে incumbents তা পারছে না।
Vendor কী দাবি করে
Pangram-এর হোমপেজে 99.98 percent নির্ভুলতার দাবি করা হয়েছে এবং বলা হয়েছে যে এর false positive rate, অর্থাৎ যে হারে মানব-রচিত নথিকে ভুলভাবে AI হিসেবে চিহ্নিত করা হয়, বর্তমানে 10,000 এ 1। false positives সম্পর্কে কোম্পানির একটি blog post, যা এর CTO লিখেছেন, এই সামগ্রিক সংখ্যাটিকে genre অনুযায়ী ভাগ করে দেখায়: academic essays এ 0.004 percent, scientific abstracts এ 0.001 percent, এবং কোম্পানি নিজেই যে দুর্বল দিকগুলো প্রকাশ করে, যেমন poetry তে 0.05 percent এবং recipes এ 0.23 percent। কোম্পানিটি আরও দাবি করে যে এর model তথাকথিত humanizer tools দ্বারা প্রক্রিয়াকরণের পরেও AI text শনাক্ত করতে পারে।
এগুলোর সবই vendor-এর নিজস্ব test sets থেকে নেওয়া self-reported সংখ্যা, এবং একই post-এ vendor-এর নিজস্ব caveats-ও রয়েছে: modelটি complete sentences-এ লেখা দীর্ঘ text-এ সবচেয়ে ভালো কাজ করে, এবং company short bullet lists বা অত্যন্ত formulaic text screening না করার পরামর্শ দেয়। এই দুই দিকই মনে রাখতে হবে। দাবিগুলো অস্বাভাবিকভাবে নির্দিষ্ট এবং অস্বাভাবিকভাবে কম, এবং company-এর বাইরে কেউ সেগুলো যাচাই না করা পর্যন্ত সেগুলো কেবল দাবি হিসেবেই থাকে।

স্বাধীন প্রমাণ কী দেখায়
এ পর্যন্ত সবচেয়ে শক্তিশালী পরীক্ষা হলো Van Vlasselaer, Van Droogenbroeck, এবং Spruyt-এর একটি peer-reviewed গবেষণা, যা Vrije Universiteit Brussel-এ পরিচালিত হয় এবং 2026 সালের জুনে International Journal for Educational Integrity-এ প্রকাশিত হয়। দলটি অন্তত 4,000 শব্দের 160টি master's level academic papers তৈরি করে, এর মধ্যে 40টি 2019 সালের আগে বাস্তব শিক্ষার্থীদের লেখা, 40টি GPT-4o Deep Research দিয়ে সম্পূর্ণভাবে তৈরি, 40টি hybrid, এবং 40টি AI generated হয়ে পরে ইচ্ছাকৃতভাবে humanized। তারা সবকটিকে Turnitin, GPTZero, Copyleaks, এবং Pangram-এর মধ্য দিয়ে চালায়।
সম্পূর্ণ AI generated প্রবন্ধগুলোর ক্ষেত্রে, গবেষণাটি জানায় যে Turnitin, GPTZero, এবং Copyleaks "AI-generated content সনাক্ত করতে সম্পূর্ণভাবে ব্যর্থ হয়েছে।" Turnitin ওই 40টি প্রবন্ধের প্রতিটিতে 0 থেকে 20 percent AI স্কোর দিয়েছে, আর তিনটি incumbent-এর median score-ই 100 percent machine written প্রবন্ধে 20 percent-এর নিচে ছিল। Pangram একই সেটে strict accuracy 65 percent এবং inclusive accuracy 97.5 percent অর্জন করে, এবং একটি প্রবন্ধকে ভুলভাবে শ্রেণিবদ্ধ করে। humanized সেটে Pangram 40টির মধ্যে 37টি ক্ষেত্রে AI content সঠিকভাবে শনাক্ত করে, strict accuracy 92.5 percent, যেখানে GPTZero 2.5 percent, Copyleaks 22.5 percent, এবং Turnitin 50 percent অর্জন করে।
| Tool | Fully AI papers (strict accuracy) | Humanized AI papers (strict accuracy) | Human papers correctly cleared |
|---|---|---|---|
| Pangram | 65% | 92.5% | 100% |
| Turnitin | 0% | 50% | 100% |
| GPTZero | 0% | 2.5% | 100% |
| Copyleaks | 0% | 22.5% | 100% |
দ্বিতীয় তথ্যবিন্দুটি হলো Brian Jabarian এবং Alex Imas-এর Chicago Booth-এর একটি working paper, যা December 2025-এ Chicago Booth Review-এ সংক্ষেপে উপস্থাপিত হয়েছে। প্রায় 2,000টি মানব-রচিত অনুচ্ছেদের ওপর, ছয়টি মাধ্যম জুড়ে, এবং চারটি frontier model-এর AI সংস্করণের ওপর detector পরীক্ষা করে, তারা দেখেছেন যে Pangram-এর false positive rate অধিকাংশ সিদ্ধান্তসীমাজুড়ে কার্যত শূন্য ছিল, তাদের corpus-এ accuracy কখনো 99.8 percent-এর নিচে নামেনি, এবং model অনুযায়ী false negative 2 থেকে 4 percent-এর মধ্যে ছিল। গবেষকেরা প্রস্তাব করেন যে প্রতিষ্ঠানগুলো কোনো detector-কে operationalভাবে বিশ্বাস করার আগে একটি কঠোর policy cap গ্রহণ করুক, উদাহরণস্বরূপ, 0.5 percent-এর বেশি human writing flagged না হওয়া। status-এর পার্থক্যটি লক্ষ করুন, Booth paperটি একটি working paper, এখনো peer reviewed নয়, এবং এটি humanized academic paper নয়, বরং অপরিবর্তিত AI text পরীক্ষা করেছে।
False Positives এবং কারা ক্ষতিগ্রস্ত হন
False positive-ই হলো সেই ক্ষেত্র যেখানে detector-এর ক্ষতি সবচেয়ে বেশি কেন্দ্রীভূত হয়, এবং এই শিল্পজুড়ে নথিভুক্ত pattern হলো flags অসামঞ্জস্যপূর্ণভাবে non-native English writers-দের ওপর পড়ে। VUB studyটি ঠিক এই বিষয়েই পড়ার মতো: এর 40টি human paper-ই non-native English speakers দ্বারা লেখা ছিল, এবং Pangram-সহ চারটি tool-ই সেগুলোর 100 percent-এ clear করেছে। এটি সত্যিই উৎসাহজনক একটি ফল, এবং একই সঙ্গে এটি 40টি paper। এই আকারের sample 0.004 percent-এর মতো একটি rate নিশ্চিত করতে পারে না; কেবল vendor-এর নিজস্ব অনেক বড় internal testing-ই এমন সূক্ষ্ম সংখ্যা দেয়, এবং সেই মাত্রায় কোনো বাইরের পক্ষ তা পুনরাবৃত্তি করেনি।
গবেষণাটির বাস্তব জগতের অংশটি দেখায় কেন ভালো বেঞ্চমার্ক থাকলেও সতর্কতা বজায় থাকে। গবেষকেরা 2024 এবং 2025 সালের 1,163টি প্রকৃত মাস্টার্স থিসিসের ওপর Pangram চালিয়ে দেখেন, এবং এটি সেগুলোর 45.5 শতাংশকে কোনো না কোনো স্তরে চিহ্নিত করে, চিহ্নিত মামলাগুলোর মধ্যে মধ্যম অনুমিত AI অংশ 30 শতাংশ, এবং ওই থিসিসগুলোর কোনোটির জন্যই ground truth নেই। লেখকেরা স্পষ্টভাবে বলেন, detection score প্রাথমিক সংকেত হিসেবে উপকারী, কিন্তু উচ্চ ঝুঁকির সিদ্ধান্তে কখনোই একমাত্র প্রমাণ হওয়া উচিত নয়। অভিযোগের মুখে পড়া একজন শিক্ষার্থীর তখনও process based ways to demonstrate authorship দরকার, যে detector-ই সংখ্যা তৈরি করুক না কেন।
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
মূল্য নির্ধারণ এবং প্রবেশাধিকার
Pangram-এর সাইটে একটি অ্যাকাউন্টে সাইন আপ করার পর দিনে 20টি বিনামূল্যের check দেওয়া হয়, আর paid subscription credit volume এবং plagiarism detection-এর মতো feature যোগ করে। এই access model-এর গুরুত্ব accuracy number-এর মতোই: Turnitin-এর বিপরীতে, যা একজন লেখক কেবল তখনই দেখেন যখন কোনো প্রতিষ্ঠান সেটি তার বিরুদ্ধে চালায়, Pangram সরাসরি check করা যায়, ফলে একজন লেখক submission-এর আগে একজন reviewer যে ধরনের signal দেখতে পারেন, সেই একই শ্রেণির signal দেখতে পারেন।
Detector Landscape-এ Pangram কোথায় অবস্থান করে
VUB লেখকদের field-সংক্রান্ত সারসংক্ষেপটি স্পষ্ট: "From the four AI detection tools studied here, at this moment only one produced satisfactory results." এই বাক্যটি Pangram-এর মতোই বিদ্যমান প্রতিষ্ঠিত tool-গুলোর সম্পর্কেও অনেক কিছু বলে। Turnitin, যে tool-এর ওপর অধিকাংশ প্রতিষ্ঠান বাস্তবে নির্ভর করে, সম্পূর্ণ AI generated set-এ শূন্য score পেয়েছে, এবং এর separately documented false positive record ইতিমধ্যে বিশ্ববিদ্যালয়গুলোকে এর score সতর্কতার সঙ্গে বিবেচনা করতে বাধ্য করেছে। এই সব tool-ই text-এর statistical property মাপে, এবং the underlying mechanics ব্যাখ্যা করে কেন Pangram-এর নতুন training approach এগিয়ে যেতে পারে এবং কেন এদের প্রত্যেকটিই এখনও probabilistic রয়ে গেছে।
সৎ মূল্যায়নটি হলো, সাম্প্রতিক প্রমাণের ভিত্তিতে, Pangram বর্তমানে স্বাধীন পরীক্ষায় সবচেয়ে ভালোভাবে সমর্থিত ডিটেক্টর, এবং ব্যবধানটি অনেক বড়। সেই প্রমাণও সীমিত। দুটি গবেষণা, একটি পিয়ার-রিভিউড, একটি নয়, উভয়ই গত এক বছরের, প্রধানত ইংরেজি, প্রধানত দীর্ঘ-রূপের একাডেমিক ও ওয়েব টেক্সট। ডিটেকশন হলো মডেলের সঙ্গে এক অস্ত্র প্রতিযোগিতা, যা প্রতি ত্রৈমাসিকে বদলে যায়, এবং 2026 সালে যে টুল এগিয়ে থাকে, সেই অগ্রগতি ধরে রাখে কেবল পরবর্তী প্রজন্মের টেক্সট আসা পর্যন্ত। Pangram স্কোর তার প্রতিদ্বন্দ্বীদের তুলনায় আরও ভালোভাবে ক্যালিব্রেট করা একটি অনুমান। এটি তবু একটি অনুমানই, কোনো নির্দিষ্ট ব্যক্তি কী করেছে তার প্রমাণ নয়।
সম্পূর্ণ তুলনা দেখুন
Pangram হলো একটি ভিড়াক্রান্ত, অসম ক্ষেত্রের একটি টুল। একই মানদণ্ডে Turnitin, GPTZero, Copyleaks, ZeroGPT, এবং বাকি সবার তুলনায় এটি কেমন অবস্থানে আছে, তা দেখতে সম্পূর্ণ AI detectors compared নির্দেশিকাটি দেখুন।
আমাদের নিজস্ব গবেষণা যা পেয়েছে
TextPulse Research-এর ডিটেক্টর সম্মতি গবেষণায় নয়টি বাণিজ্যিক AI ডিটেক্টর একই 90টি একাডেমিক লেখা মূল্যায়ন করেছে। এর একটি ছিল 455 শব্দের একটি হাইব্রিড লেখা: মানুষের লেখা শুরু ও শেষ, মাঝখানে 168 শব্দের AI-লেখা অংশ। Pangram এই লেখাটিকে 34% AI স্কোর দিয়েছে, অথচ একই শব্দে অন্য টুলগুলোর রায় 0% থেকে 95.7% পর্যন্ত ছড়িয়ে ছিল। সম্পূর্ণ গবেষণাপত্র, করপাস ও প্রতিটি টুলের স্কোর ম্যাট্রিক্স উন্মুক্তভাবে পাওয়া যাবে TextPulse Research-এ।

সচরাচর জিজ্ঞাসিত প্রশ্ন
Pangram-এর নিজস্ব দাবি হলো 99.98 percent accuracy এবং প্রায় 1 in 10,000 false positive rate, যা internal benchmarks-এ মাপা হয়েছে। এই industry-তে অস্বাভাবিকভাবে, সাম্প্রতিক স্বাধীন গবেষণাও একই দিকে ইঙ্গিত করে: peer-reviewed June 2026 Vrije Universiteit Brussel study দেখায়, fully AI generated এবং humanized master's level papers নির্ভরযোগ্যভাবে শনাক্ত করতে সক্ষম চারটির মধ্যে এটি ছিল একমাত্র tool, এবং Chicago Booth working paper তার corpus-এ প্রায় zero false positive rate পেয়েছে। স্বাধীন প্রমাণ শক্তিশালী, তবে সাম্প্রতিক এবং পরিসরে সীমিত।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.