Turnitin মিথ্যা ধনাত্মক হারের হার: সংখ্যাগুলি কী বলে
Turnitin দুটি মিথ্যা ধনাত্মক পরিসংখ্যান প্রকাশ করে, একটি নয়, এবং কোনোটিই নির্দিষ্ট এক অধ্যাপকের সামনে থাকা পত্রটিকে বর্ণনা করে না। এখানে নথি-স্তর বনাম বাক্য-স্তরের বিভাজন, 20 শতাংশের নিচের তারকা চিহ্ন, এবং যে গণনা একটি ভগ্নাংশ শতাংশকে শিক্ষার্থীদের বাস্তব সংখ্যায় রূপান্তর করে, তা দেওয়া হলো।
Turnitin-এর false positive rate একটি একক সংখ্যা নয়। কোম্পানি দুটি সংখ্যা প্রকাশ করে: document level-এ 1 percent-এর নিচে একটি মান, এবং sentence level-এ প্রায় 4 percent-এর কাছাকাছি একটি মান। উভয়ই বাস্তব, উভয়ই প্রকাশিত, এবং এককভাবে কোনোটিই সামনের নির্দিষ্ট অধ্যাপকের সামনে থাকা নির্দিষ্ট পেপার সম্পর্কে খুব বেশি কিছু বলে না।
এই দুই সংখ্যার মধ্যকার ব্যবধান, এবং একটি প্রকৃত শ্রেণিতে একক document-এর বদলে যেকোনো একটি প্রয়োগ করলে কী ঘটে, সেটিই এই অংশে বিশ্লেষণ করা হয়েছে: Turnitin নিজে কী বলে, দুটি সংখ্যা আসলে কী কী অন্তর্ভুক্ত করে, এবং কোন গণনা একটি ভগ্নাংশ শতাংশকে শিক্ষার্থীদের বাস্তব সংখ্যায় রূপান্তর করে।
Turnitin-এর মতে, Turnitin-এর False Positive Rate কী?
document level-এ, কোম্পানির নিজের ভাষায়: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." এই শর্তটি সংখ্যাটির মতোই গুরুত্বপূর্ণ। 1 percent-এর নিচের এই মানটি Turnitin যে প্রতিটি পেপার স্কোর করে, সেগুলোর সবকটির সম্পর্কে কোনো দাবি নয়। এটি কেবল সেই পেপারগুলোর উপসেটকে বর্ণনা করে, যেগুলো মডেলের নিজস্ব অনুমানে ইতিমধ্যে 20 percent AI-written threshold অতিক্রম করেছে।
sentence level-এ, যেখানে একটি interface পুরো document-এর বদলে পৃথক লাইন highlight করে, Turnitin-এর নিজস্ব মান প্রায় চার গুণ বেশি। "Our sentence-level false positive rate is around 4%," কোম্পানি জানায়। "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin আরও যোগ করে যে এই ভুল sentence-গুলো এলোমেলোভাবে ছড়ায় না: 54 percent সময়ে, ভুলভাবে flagged করা একটি sentence প্রকৃত AI writing-এর ঠিক পাশে থাকে, এবং কোম্পানি এটিকে এই কারণের অংশ হিসেবে উপস্থাপন করে যে পুরো document-এর score কোনো একক highlighted line-এর তুলনায় বেশি স্থিতিশীল থাকে।
Document-Level এবং Sentence-Level একই দাবি নয়
এই দুই-স্তরীয় বিভাজনটি সংশোধিত বার্তা, Turnitin-এর মূল অবস্থান নয়। 2023 সালের April মাসে চালুর সময়, কোম্পানিটি document বনাম sentence এর কোনো পার্থক্য ছাড়াই 1 শতাংশের নিচে একটি একক সংখ্যা প্রকাশ করেছিল। প্রতিষ্ঠানগুলো যখন সেই সংখ্যাটিকে উদ্ধৃত করতে শুরু করে এবং শিক্ষা-সংবাদমাধ্যম যখন প্রত্যাশার চেয়ে বেশি বাস্তব false positive-এর কথা জানায়, তখন Turnitin-এর chief product officer উপরে ব্যবহৃত বিভাজনটি প্রকাশ করেন, সঙ্গে প্রতিক্রিয়ায় করা দুটি product change: score করা যায় এমন document-এর ন্যূনতম দৈর্ঘ্য 150 থেকে 300 words-এ উন্নীত করা, এবং document-এর শুরু ও শেষের sentence কীভাবে score হবে তা পরিবর্তন করা।
300-word-এর ন্যূনতম সীমাটি একটি সম্পর্কিত কারণে আছে। Turnitin কোম্পানির নিজস্ব ভাষায়, বেশি text থাকলে accuracy বাড়ে, এই পর্যবেক্ষণের পর এটি মূল 150-word minimum থেকে বাড়িয়েছে। একটি ছোট submission, এক পৃষ্ঠার reflection, একটি আংশিক draft, একটি discussion post, model-কে কাজ করার জন্য false positive-এর উপরের সংখ্যাগুলো যে ভিত্তির বিপরীতে মাপা হয়েছিল তার তুলনায় কম signal দেয়, আর এটাই আংশিকভাবে ব্যাখ্যা করে কেন সেই সীমার নিচে থাকা কোনো কিছুতেই কোনো AI score দেখানো হয় না, বরং একটি অবিশ্বস্ত score-ও দেওয়া হয় না।
| স্তর | Turnitin-এর ঘোষিত হার | এটি আসলে কী কভার করে |
|---|---|---|
| Document-level | 1% এর নিচে | শুধু সেই documentগুলো, যেগুলো ইতিমধ্যে 20% বা তার বেশি AI-written হিসেবে চিহ্নিত হয়েছে, পুরো submission-এর সামগ্রিক percentage |
| Sentence-level | প্রায় 4% | AI writing report-এর মধ্যে চিহ্নিত যেকোনো পৃথক sentence, document-এর সামগ্রিক score যাই হোক না কেন |
| 20% document threshold-এর নিচে | কোনো সংখ্যা দেখানো হয় না | Turnitin percentage-এর বদলে একটি asterisk দেখায়, যা সেই পরিসরে ফলাফলকে কম নির্ভরযোগ্য হিসেবে চিহ্নিত করে |
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
গাণিতিক হিসাব, একটি শতাংশের ভগ্নাংশ একটি বাস্তব cohort-এর জন্য কী বোঝায়
গণনাটি প্রকাশ্যে করা হয়েছিল, যখন Vanderbilt University 2023 সালের August মাসে Turnitin-এর AI detection-এর সঙ্গে সম্পর্কিত error rates হিসাব করেছিল। এই গণনাটি কীভাবে করতে হয় তার সবচেয়ে ভালো উদাহরণ হলো Vanderbilt-এর নিজস্ব সংখ্যাগণনা। Turnitin-এর AI detector বন্ধ করার সিদ্ধান্ত সম্পর্কে একটি blog post-এ তারা উল্লেখ করেছিল, "[i]n 2022 we submitted around 75,000 papers to Turnitin, which means that Turnitin's stated 1 percent false positive rate means around 750 student papers could have been incorrectly labeled as having some of it written by AI."
এই figureটি Vanderbilt-এর নিজস্ব extrapolation, vendor-এর published number-টি Vanderbilt-এর নিজস্ব volume-এর ওপর প্রয়োগ করা হয়েছে, এটি আলাদাভাবে মাপা কোনো result নয়। এই arithmetic-এর গঠন একটি university-এর headcount-এর সীমা ছাড়িয়ে generalize করে। কয়েকশো paper-এর ওপর প্রয়োগ করা sub-1-percent rate কয়েকজন ভুলভাবে flag হওয়া student তৈরি করে, যা সহজেই চোখ এড়িয়ে যেতে পারে। একই rate যখন tens of thousands of papers-এর ওপর প্রয়োগ করা হয়, যা একটি বাস্তব university প্রতি বছর জমা দেয়, তখন কয়েকজনের বদলে শত শত result তৈরি হয়, কারণ একটি ছোট percentage এবং একটি বড় population একসঙ্গে multiply করা হচ্ছে, আলাদাভাবে বিবেচনা করা হচ্ছে না।
এর কোনোটিই প্রমাণ করে না যে বাস্তব জগতের rate lab figure-এর সঙ্গে হুবহু মেলে। Turnitin-এর নিজস্ব chief product officer প্রকাশ্যে স্বীকার করেছেন যে বাস্তব জগতের result lab testing থেকে ভিন্ন হয়, এবং এটাই আংশিকভাবে কারণ যে company প্রথমেই তার messaging revise করেছিল। উপরের arithmetic Turnitin-এর নিজস্ব stated number-কে একটি input হিসেবে বিবেচনা করে, যাকে গুরুত্বের সঙ্গে নেওয়া উচিত, কিন্তু এমন কোনো ceiling হিসেবে নয় যা বলে দেয় একটি tool যখন এমন submission score করছে যা curated benchmark-এর মতো একেবারেই নয়, তখন বাস্তবে কী ঘটে।
Rateটি কী কভার করে না
20 শতাংশের সীমার নিচের একটি ফলাফলের সঙ্গে ছোট কোনো শতাংশ যুক্ত থাকে না। তার বদলে সেখানে সংখ্যার জায়গায় একটি তারকা চিহ্ন থাকে, Turnitin এই সিদ্ধান্ত নিয়েছে কারণ ওই পরিসরেই টুলটি উভয় দিকেই সবচেয়ে কম নির্ভরযোগ্য, এবং স্বাধীন শিক্ষা-সংবাদমাধ্যমের প্রতিবেদন, সঙ্গে ওই পরিসরে কোম্পানির নিজস্ব নিম্ন-আত্মবিশ্বাসী উপস্থাপন, তা সমর্থন করে। সামান্য সম্পাদনা, একটি অনুচ্ছেদ সাহায্য নিয়ে সংশোধন করা এবং বাকি অংশ সহায়তা ছাড়া লেখা, একেবারেই কোনো দৃশ্যমান স্কোর না-ও দিতে পারে, ছোট একটি স্কোরের বদলে, যা জানা দরকার, যাতে অনুপস্থিত একটি সংখ্যা ভুল করে অভিযোগ বা সম্পূর্ণ সুস্থতার প্রমাণ হিসেবে না পড়া হয়। TextPulse-এর একটি ভালো Turnitin স্কোর কী হিসেবে গণ্য হয়, তার নির্দেশিকা প্রতিবেদনের পাঠকের দিক থেকে সেই একই সীমা ব্যাখ্যা করে।
তাহলে প্রকাশিত false positive rate কীভাবে পড়া উচিত?
এটিকে একটি বিক্রেতার এমন একটি সংখ্যা হিসেবে পড়তে হবে, যা প্রথমে যতটা বিস্তৃত বলে মনে হয়, আসলে তার চেয়ে সংকীর্ণ একটি অবস্থার কথা বলে, কোনো নির্দিষ্ট অধ্যাপকের সামনে থাকা কাগজটির সম্পর্কে কোনো বক্তব্য হিসেবে নয়। Turnitin নিজের আউটপুটও একইভাবে ব্যাখ্যা করে, কোম্পানি স্পষ্টভাবে বলে যে তাদের AI writing detection technology "a determination of misconduct" দেয় না, শুধু "data for educators to make an informed decision" দেয়। AI detectors আদৌ accurate কি না বিষয়ে বিস্তৃত প্রমাণও একই পাঠকে সমর্থন করে, প্রকাশিত rate একটি benchmark বর্ণনা করে, বর্তমানে মূল্যায়নাধীন নথিটিকে নয়।
যেসব লেখক অনুমান না করে জানতে চান, তাদের নিজের খসড়া একই ধরনের পরিসংখ্যানগত পরিমাপের কোথায় দাঁড়িয়ে আছে, তারা কোনো প্রতিষ্ঠানের detector-এ পৌঁছানোর আগেই একটি free perplexity checker দিয়ে সরাসরি তা পরীক্ষা করতে পারেন। এটি প্রযুক্তির একটি ভিন্ন ব্যবহার, পরে গিয়ে স্কোরের সঙ্গে তর্ক করার চেয়ে, এবং এটিই সেই একমাত্র জায়গা যেখানে একজন লেখক, প্রশাসক নয়, আগে সংখ্যাটি দেখতে পান।
ZeroGPT-এর accuracy আলাদাভাবে পরীক্ষা করা হয়েছে তাদের জন্য, যাদের প্রতিষ্ঠান সেটি ব্যবহার করে। এই ভুলগুলোর সবচেয়ে বেশি প্রভাব পড়ে যে গোষ্ঠীর ওপর, non-native English writers, তাদের জন্য একটি পৃথক পৃষ্ঠা আছে।
এই গাণিতিক হিসাবের সবচেয়ে বেশি ঝুঁকিতে থাকা জনগোষ্ঠীও সমানভাবে ছড়িয়ে নেই। Non-native English writers যে কোনো এই শতাংশগুলোর ভুল পাশে পড়ে যাওয়ার নথিভুক্ত ঝুঁকি সবচেয়ে বেশি বহন করেন, আর এটাই ঠিক সেই পাঠকগোষ্ঠী যাকে TextPulse's page for ESL academic writers ঘিরে তৈরি করা হয়েছে। Turnitin তার মডেল পুনঃপ্রশিক্ষণ করার সঙ্গে সঙ্গে এই সংখ্যাগুলো সংশোধন করতে থাকবে। যা বদলাবে না, তা হলো এই গাণিতিক হিসাব নিজেই, এত ছোট একটি হারকে অদৃশ্য হয়ে যাওয়ার জন্য এত বড় একটি জনগোষ্ঠীর ভেতরে আশ্রয় নিতে হয়, এবং অধিকাংশ বাস্তব জমা দেওয়া লেখা এতটা সৌভাগ্যবান নয়।
সচরাচর জিজ্ঞাসিত প্রশ্ন
Turnitin-এর মিথ্যা ধনাত্মক হার, কোম্পানির নিজস্ব প্রকাশিত পরিসংখ্যান অনুযায়ী, একটি একক সংখ্যা নয়। নথি-স্তরে, Turnitin 1 শতাংশের নিচে একটি হার উল্লেখ করে, তবে কেবল সেই নথিগুলির জন্য যেগুলি ইতিমধ্যে 20 শতাংশ বা তার বেশি AI-written হিসেবে চিহ্নিত হয়েছে। বাক্য-স্তরে, যেখানে পৃথক পংক্তি হাইলাইট করা হয়, কোম্পানির নিজস্ব সংখ্যা প্রায় 4 শতাংশ।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.