AI Detection

Turnitin কীভাবে AI শনাক্ত করে, ধাপে ধাপে

Turnitin-এর AI writing detector একটি নথিকে সমগ্র হিসেবে পড়ে না। এটি একটি submission-কে chunks-এ ভাগ করে, প্রতিটি chunk-কে স্কোর করে, ফলাফলগুলোর গড় নির্ণয় করে, এবং তারপরই report-এ percentage দেখায়। এখানে সেই pipeline, ChatGPT, Claude ও Gemini জুড়ে এটি কী flag করে, স্বাধীন পরীক্ষায় কী miss করেছে, এবং সংখ্যাটি আসলে কে দেখতে পারে, তা আলোচনা করা হয়েছে।

18 min
How does Turnitin detect AI: diagram of the segment, score and average pipeline behind a Turnitin AI writing report

একটি Turnitin রিপোর্ট একটি একক সংখ্যা ফিরিয়ে দিতে পারে, ধরুন 42 শতাংশ, এবং সেই সংখ্যাটি কীভাবে এসেছে সে সম্পর্কে প্রায় কিছুই না বলতে পারে, যদি না কেউ তার পেছনের প্রক্রিয়াটি খুঁজতে যায়। সেই সংখ্যা পুরো নথি থেকে সরাসরি পড়া হয় না, এবং এটি অনুমানও নয়। এটি একটি নির্দিষ্ট, নথিভুক্ত পাইপলাইনের শেষ ফল, যা প্রতিটি জমায় একইভাবে চলে।

তাহলে Turnitin কীভাবে AI শনাক্ত করে? একটি জমাকে অংশে ভাগ করে, প্রতিটি অংশকে আলাদাভাবে স্কোর করে, এই ভিত্তিতে যে সেগুলি AI generated হওয়ার সম্ভাবনা আছে কি না বা AI generated হয়ে পরে paraphrased হয়েছে কি না, এবং সেই স্কোরগুলির গড় নিয়ে রিপোর্টে দেখানো সামগ্রিক শতাংশ স্কোর নির্ধারণ করে। সেই পাইপলাইনের প্রতিটি ধাপ Turnitin-এর নিজস্ব ডকুমেন্টেশনে বর্ণিত, বাইরে থেকে reverse-engineered করা নয়।

এটি বিশেষভাবে Turnitin-এর AI writing detection feature সম্পর্কে, যা পুরোনো similarity বা plagiarism check থেকে আলাদা একটি system, এবং যা একটি জমাকে অন্য নথির সঙ্গে তুলনা করে। নিচের mechanics বৃহত্তর প্রশ্নের মধ্যে বসে আছে, AI detectors আসলে কীভাবে কাজ করে, এবং Turnitin একটি উপযোগী worked example, কারণ এটি অধিকাংশ vendor-এর তুলনায় নিজের method-এর বেশি অংশ প্রকাশ করে। এরপর যা আছে, তা প্রথমে pipeline, তারপর বাস্তবে এটি কী flag করে, independent testing কীভাবে দেখেছে এটি কী miss করে, এবং একটি institution-এর ভেতরে কারা আসলে result দেখতে পায়।

Turnitin homepage positioning the product for authentic learning in an AI world, with AI writing detection and Turnitin Clarity featured
Turnitin-এর নিজস্ব framing, বিদ্যমান similarity workflow-এর মধ্যে AI-generated writing শনাক্ত করা, যেখানে Clarity হলো AI-focused product line।

Turnitin কীভাবে AI শনাক্ত করে? সংক্ষেপে পাইপলাইন

Turnitin-এর AI লেখন শনাক্তকারী নির্দিষ্ট ক্রমে 4টি ধাপে কাজ করে। প্রথমে, এটি পরীক্ষা করে কোনো নথিতে আদৌ স্কোর করার মতো পর্যাপ্ত যোগ্য গদ্য পাঠ আছে কি না। দ্বিতীয়ত, এটি সেই পাঠকে কয়েকশো শব্দের পৃথক অংশে ভাগ করে। তৃতীয়ত, একটি মডেল প্রতিটি অংশকে আলাদাভাবে স্কোর করে। চতুর্থত, অংশগুলোর স্কোর গড় করে সেই একক নথি-স্তরের শতাংশে রূপান্তর করা হয়, যা পাঠক বাস্তবে দেখেন।

AI লেখন প্রতিবেদনটি Similarity Report নয়

Turnitin-এর AI লেখন প্রতিবেদনটি plagiarism পরীক্ষা করা similarity report থেকে পৃথক একটি পণ্য। এগুলি ভিন্ন মডেলে চলে এবং একই ইন্টারফেসের ভিন্ন ট্যাবে প্রদর্শিত হয়। similarity score একটি জমা দেওয়া কাজকে পূর্বে প্রকাশিত উৎস এবং অন্যান্য ছাত্রের পত্রের ডাটাবেসের সঙ্গে তুলনা করে, এবং যে শতাংশ মেলে তা ফেরত দেয়। AI score সম্পূর্ণ ভিন্ন কিছু করে, একটি classifier গদ্য পাঠ পড়ে, প্রতিটি স্কোরকৃত অংশকে AI-generated হওয়ার একটি সম্ভাবনা নির্ধারণ করে, এবং সেই স্কোরগুলোকে একক নথি শতাংশে একত্র করে। যেহেতু তারা ভিন্ন জিনিস পরিমাপ করে, একটি জমা দেওয়া কাজে 2 percent similarity score এবং 60 percent AI score থাকতে পারে, অথবা উল্টোও হতে পারে।

AI percentage-টিও শোনার তুলনায় আরও সীমিত। এটি যোগ্য গদ্যের সেই অনুপাত বর্ণনা করে, যা মডেল অনুমান করে AI দ্বারা লেখা হয়েছে, পুরো নথিকে নয়, কারণ code blocks, bullet points, headings এবং short-form writing স্কোর গণনার আগে সরিয়ে ফেলা হয়। এই লেখার সময় পর্যন্ত detector কেবল English, Spanish এবং Japanese পাঠে কাজ করে।

ধাপ 1: নথিটিকে অংশে ভাগ করা

কিছুই স্কোর করার আগে, Turnitin-এর মডেল জমা দেওয়া কাজটিকে কয়েকশো শব্দের অংশে ভাগ করে, প্রতিটি অংশে আনুমানিক 5 থেকে 10টি বাক্য থাকে। segmentation প্রথমে ঘটে, কারণ মডেলটি এমন আকারের একটি অংশ স্কোর করার জন্য তৈরি করা হয়েছে, একটি একক বাক্য বা একবারে একটি সম্পূর্ণ dissertation স্কোর করার জন্য নয়।

শুধু গদ্য পাঠ্যই একটি chunk-এর জন্য গণ্য হয়। model-টি দীর্ঘ-রূপের লেখন পড়ার জন্য নকশা করা হয়েছিল। যে document-এ গদ্য এবং table বা code উভয়ই আছে, সেটিকে গদ্য পাঠ্যের কিছু শতাংশ আছে বলে score করা হবে, কিন্তু document-এর সব গদ্য পাঠ্য বর্ণনা নাও করতে পারে। এর কারণ হলো detector এমন একটি data pool score করছে, যাতে code block, bullet point, বা short-form text অন্তর্ভুক্ত নয়। এই কারণেই document এমন একটি percentage ফেরত দিতে পারে, যা কেবল জমা দেওয়া বিষয়ের একটি অংশই বর্ণনা করে।

chunk-level scoring-এর একটি নীরব পরিণতি আছে, যা উল্লেখ করা উচিত। কয়েকশো শব্দের একটি অন্যথায় human-written chunk-এর মধ্যে থাকা একটি একক AI-drafted sentence, সেই chunk-এর বাকি সব কিছুর সঙ্গে গড় করা হয়, ফলে সেই chunk-এর নিজস্ব score-এর ওপর তার প্রভাব কমে যায়, কারণ আশপাশের যত human-written text একই chunk ভাগ করে, ততটাই তার ওজন হ্রাস পায়। একটি সংক্ষিপ্ত AI-drafted insertion এখনও model-এ পৌঁছে যায়। এটি কেবল সেই chunk-এর তুলনায় কম ওজন বহন করে, যা প্রথম শব্দ থেকে শেষ শব্দ পর্যন্ত AI-drafted।

ধাপ দুই: প্রতিটি segment-এর scoring

প্রতিটি chunk আলাদাভাবে score করা হয়, document-এর অন্য সব chunk থেকে স্বাধীনভাবে। model-টি অনুমান করে যে text-এর সেই নির্দিষ্ট অংশ human-written, AI-generated, নাকি AI-generated হয়ে পরে paraphrased, অর্থাৎ এটি একটি সরল yes বা no-এর বদলে তিন-মুখী পার্থক্য।

এটি একটি পৃথক category, এবং কেবল AI-generated-এর একটি সম্প্রসারণ নয়, যা ইঙ্গিত করে যে paraphrasing detection দুর্বল করে এমন একটি বাস্তব সমস্যা আছে। 2023 সালের একটি study-তে এটি সমর্থিত হয়েছে, যেখানে দেখা গেছে যে AI-generated text-কে একটি dedicated paraphrasing model-এর মধ্য দিয়ে চালালে গবেষণা detector DetectGPT-এর accuracy 70.3% থেকে 4.6%-এ নেমে আসে, এবং false-positive rate 1% স্থির ছিল। Turnitin তাদের নিজস্ব three-way classifier একই technique-এর বিরুদ্ধে কতটা resistant, সে বিষয়ে কিছু প্রকাশ করেছে বলে মনে হয় না। এই category একটি নথিভুক্ত কারণে বিদ্যমান।

সম্পূর্ণ নথি-স্তরের বদলে খণ্ড-স্তরে স্কোর করা একটি সচেতন নকশাগত সিদ্ধান্ত। দুইটি AI-প্রণীত অনুচ্ছেদসহ নব্বই-পৃষ্ঠার একটি থিসিস এবং সম্পূর্ণভাবে AI-প্রণীত পাঁচ-পৃষ্ঠার একটি প্রবন্ধ ভিন্ন সমস্যা, আর খণ্ডগুলির ওপর গড় নেওয়াই একটি নথি-স্তরের একক সংখ্যা দিয়ে সেই পার্থক্য প্রতিফলিত করতে দেয়, সেটিকে সমতল করে না।

Turnitin তার পাইপলাইন ধাপগুলির মতো একই বিশদে এই প্রতি-খণ্ড মডেলের অভ্যন্তরীণ স্থাপত্য প্রকাশ করেনি। এটি একটি তত্ত্বাবধায়ক শ্রেণিবিন্যাসকারী, যা লেবেলযুক্ত উদাহরণে প্রশিক্ষিত, TextPulse-এর AI detection-এ perplexity আসলে কী পরিমাপ করে শীর্ষক নির্দেশিকায় আলোচিত কাঁচা next-token স্কোরের ধরনের ওপর কোনো সরল threshold নয়, যদিও একই অন্তর্নিহিত ধারণা, অস্বাভাবিকভাবে পূর্বানুমানযোগ্য পাঠ, এমন একটি শ্রেণিবিন্যাসকারী যা লক্ষ্য করতে শেখে তার অংশ হওয়া প্রায় নিশ্চিত।

ধাপ তিন: নথি-স্তরের শতাংশে গড় নির্ণয়

খণ্ডগুলির স্কোর গড়ে একটি একক শতাংশে রূপান্তরিত হয়, যা একটি প্রতিবেদন প্রদর্শন করে। সেই শতাংশটি যোগ্য গদ্য পাঠ্যের অনুপাতকে নির্দেশ করে, কেবল দীর্ঘ-রূপের লেখাকে, যা মডেল AI-generated বা AI-generated-and-then-paraphrased বলে পূর্বানুমান করে। এটি স্কোর করা খণ্ডগুলির একটি অনুপাত, এই দাবি নয় যে নথির শব্দগুলির একটি নির্দিষ্ট অংশ আক্ষরিক অর্থে একটি যন্ত্র দ্বারা টাইপ করা হয়েছিল।

প্রতিবেদনের শতাংশটি গড়। এই কারণেই দুইটি নথি, যেগুলি উভয়ই চল্লিশ শতাংশ ফেরত দেয়, কাছ থেকে দেখলে ভিন্ন মনে হতে পারে। একটিতে তার খণ্ডগুলির চল্লিশ শতাংশকে সম্পূর্ণ AI-generated হিসেবে স্কোর করা হতে পারে। অন্যটিতে প্রতিটি খণ্ডকে আংশিকভাবে সম্ভাব্য হিসেবে স্কোর করা হতে পারে, যা গড়ে একই শিরোনামসংখ্যায় পৌঁছায়। এটি দেখায় না কোন ধরনটি তা উৎপন্ন করেছে।

Turnitin AI writing overview reporting 71% detected as AI, listing 18 segments as AI-generated only at 71% and zero segments as AI-paraphrased at 0%
সেই গড় নির্ণয় ধাপের ফলাফল, একটি একক শিরোনাম শতাংশ, তার নিচে দুইটি শ্রেণি। এখানে 71% AI হিসেবে শনাক্ত, এর সবটাই AI-generated only শ্রেণিতে এবং AI-paraphrased-এ কিছুই নেই।

Turnitin কি ChatGPT, Claude বা Gemini শনাক্ত করতে পারে?

সাধারণত হ্যাঁ, যখন কোনো নথিতে উল্লেখযোগ্য AI লেখা থাকে, এবং শ্রেণিবিন্যাসকারীটি কোন বিক্রেতা তা নিয়ে মাথা ঘামায় না। Turnitin বলেছে, তাদের মডেল কোনো ব্র্যান্ড নামের বদলে একটি লেখন-প্যাটার্ন খোঁজে, এবং 2023 সালে মূল GPT-3.5 ও GPT-4 চালুর পর থেকে এর আওতা বারবার সম্প্রসারিত হয়েছে। বর্তমান নির্দেশিকায় GPT-5 সিরিজ, Gemini এবং Claude কে সেই সিস্টেমগুলোর মধ্যে নাম করা হয়েছে যেগুলোর বিরুদ্ধে এটি প্রশিক্ষিত, এবং নতুন মডেল প্রকাশগুলো ধারাবাহিকভাবে যোগ করা হচ্ছে। যে শিক্ষার্থী Gemini, Claude বা DeepSeek ব্যবহার করেছে, সে কেবল ভিন্ন একটি কোম্পানি বেছে নিয়েছে বলেই শনাক্তকারীকে এড়িয়ে যাচ্ছে না।

এতে প্রভাবিত জমাদানের অংশ বেড়েছে। 2025 সালের অক্টোবর থেকে 2026 সালের ফেব্রুয়ারি পর্যন্ত Turnitin যে প্রবন্ধগুলো স্ক্যান করেছে, সেগুলোর প্রায় 15 শতাংশে 80 শতাংশ বা তার বেশি AI-উৎপন্ন লেখা দেখা গেছে, যা 2023 সালের এপ্রিল মাসে টুলটি চালু হওয়ার সময় প্রায় 3 শতাংশ ছিল।

প্যারাফ্রেজ করা AI পাঠ্যকে বিনা বাধায় ছেড়ে দেওয়ার বদলে আলাদা একটি শ্রেণি দেওয়া হয়, এবং এটাই উপরে বর্ণিত তিন-স্তরীয় শ্রেণিবিন্যাস। Turnitin-এর ডকুমেন্টেশনে কেবল AI-উৎপন্ন বলে বিচার করা পাঠ্যকে, এবং AI-উৎপন্ন বলে বিচার করার পর AI-প্যারাফ্রেজ করা পাঠ্যকে আলাদা করা হয়েছে, আর 2025 সালের আগস্টে এটি এমন শনাক্তকরণ যোগ করেছে যা বিশেষভাবে AI bypasser টুলগুলিকে লক্ষ্য করে, যেগুলো যন্ত্র-উৎপাদিত আউটপুটকে পুনর্লিখন করে শনাক্তকারীকে ফাঁকি দিতে তৈরি। এর মানে এই নয় যে প্যারাফ্রেজ করা অর্থহীন, বা প্রতিটি পুনর্লিখিত অংশ ধরা পড়ে। এর মানে হলো, ডিফল্টভাবে প্যারাফ্রেজিং Turnitin-এর কাছে অদৃশ্য, এই ধারণাটি কিছু সময় ধরেই পুরোনো হয়ে গেছে। বিশেষভাবে প্যারাফ্রেজ করা পাঠ্য এবং DeepSeek আউটপুট নিয়ে টুলটি কী করে, তা আলাদাভাবে আলোচিত হয়েছে।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

ন্যূনতম শব্দ-প্রয়োজনীয়তা এবং তারকা-সীমা

Turnitin-এর AI শনাক্তকারী কোনো স্কোর তৈরি করার আগে একটি জমাদানে যোগ্য গদ্য-পাঠ্যের অন্তত 300 শব্দ থাকতে হবে, যা আগের 150-শব্দের ন্যূনতম সীমা থেকে বাড়ানো হয়েছে। এর চেয়ে কম দৈর্ঘ্যে, segment-and-average প্রক্রিয়া চালানোর মতো যথেষ্ট পাঠ্য থাকে না।

300 শব্দের ন্যূনতম সীমা আগেই বর্ণিত একক স্কোরিং অংশের আকারের সঙ্গে মিলে যায়, অর্থাৎ কয়েকশো শব্দ, পাঁচ থেকে দশটি বাক্য। ন্যূনতম সীমার ঠিক কাছাকাছি থাকা একটি নথি আসলে পাইপলাইনকে গড় করার জন্য কেবল এক অংশের সমান যোগ্য পাঠ্যই দেয়, কয়েকটি অংশ নয়, আর এটাই একটি কারণ যে সেই ন্যূনতম সীমার কাছে থাকা একটি প্রতিবেদন পরের যে সীমা আছে, তা যে কম নির্ভরযোগ্য পরিসর চিহ্নিত করতে চায়, সেখানে পড়ার সম্ভাবনা বেশি।

Turnitin 20% সীমার নিচে কোনো শতাংশও দেখায় না। 2024 সালের July থেকে, প্রতিবেদনে সংখ্যার বদলে শতাংশ চিহ্নের পাশে একটি তারকা চিহ্ন দেখানো হয়। প্রতিবেদনের আচরণের এই একটিমাত্র দিক পাইপলাইনের অন্য যেকোনো অংশের তুলনায় বেশি বিভ্রান্তি সৃষ্টি করে, তাই নিচে এর জন্য আলাদা একটি অংশ রাখা হয়েছে।

শর্তপ্রতিবেদন কী দেখায়কেন
যোগ্য গদ্যের 300 শব্দের কমকোনো AI স্কোরই নয়নির্ভরযোগ্যভাবে segment-and-average পাইপলাইন চালানোর জন্য যথেষ্ট পাঠ্য নেই
স্কোর 20% এর নিচে নেমে যেতসংখ্যার বদলে শতাংশ চিহ্নের পাশে একটি তারকা চিহ্নTurnitin-এর নিজস্ব নথিপত্র সেই পরিসরে পরিমাপযোগ্যভাবে বেশি false-positive হার জানায়
স্কোর 20% বা তার বেশিএকটি নির্দিষ্ট শতাংশসংখ্যা হিসেবে দেখানোর জন্য Turnitin এটিকে যথেষ্ট নির্ভরযোগ্য বলে বিবেচনা করে

Turnitin-এ তারকা চিহ্নযুক্ত স্কোরের অর্থ কী?

Turnitin AI writing report-এ একটি তারকা চিহ্নের অর্থ হলো model কিছু AI writing শনাক্ত করেছে, কিন্তু নথির 20 percent-এর কম, এবং Turnitin সেই পরিসরে কোনো সংখ্যা প্রকাশ করে না। যেখানে সাধারণত একটি শতাংশ থাকত, সেখানে প্রতিবেদনে সংখ্যার বদলে শতাংশ চিহ্নের পাশে একটি তারকা চিহ্ন দেখানো হয়। Turnitin-এর নিজস্ব product documentation এটি সরাসরি বলে: "When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed."

অতএব, একটি অ্যাস্টেরিস্ক কোনো ত্রুটি নয়, কোনো অনুপস্থিত স্কোর নয়, এবং আপলোডে কিছু ভুল হয়েছে তারও কোনো চিহ্ন নয়। এটি বিক্রেতার একটি ইচ্ছাকৃত সিদ্ধান্ত, যেখানে এমন একটি সংখ্যা গোপন রাখা হয়, যাকে সে মুদ্রণের জন্য যথেষ্ট নির্ভরযোগ্য বলে মনে করে না।

Turnitin কেন 20 percent-এর নিচের সংখ্যা লুকায়

কারণ সেই পরিসরেই টুলটি ভুল হওয়ার সম্ভাবনা সবচেয়ে বেশি, এবং Turnitin-এর নিজস্ব নির্ভুলতার প্রতিশ্রুতি সেটিকে বাদ দিয়ে নির্ধারিত। কোম্পানি প্রতিশ্রুতি দেয় যে "over 20% of AI writing" থাকা নথির ক্ষেত্রে তার false positive rate "under 1%" রাখবে। পরিসরটি সতর্কভাবে পড়ুন, এই প্রতিশ্রুতির মধ্যে একটি নিম্নসীমা অন্তর্ভুক্ত আছে, এবং সেই নিম্নসীমাটিও একই 20 percent। সেই সীমার নিচে কোম্পানি একই নির্ভরযোগ্যতার দাবি করে না, তাই পাঠক যে ছোট সংখ্যাকে অনিবার্যভাবে নির্ভুল বলে ধরে নেবে, তা মুদ্রণ করার বদলে এটি একেবারেই কিছু মুদ্রণ করে না। অ্যাস্টেরিস্কের অস্তিত্ব false positive এড়ানোর জন্য, অর্থাৎ এমন একটি সংখ্যা শিক্ষকের হাতে না দেওয়ার জন্য, যা মানব-রচিত নথিকে ভুলভাবে উপস্থাপন করবে।

এই যুক্তি আগেই বর্ণিত প্রক্রিয়ার সঙ্গে সামঞ্জস্যপূর্ণ। document-level score হলো কয়েকশো শব্দের chunk জুড়ে একটি গড়। যখন সেই chunkগুলোর মাত্র অল্প অংশ AI হিসেবে স্কোর করে, তখন প্রাপ্ত গড়ের ভিত্তি খুব সামান্য সংকেতে দাঁড়ায়, এবং pipeline নির্ভরযোগ্যভাবে একটি প্রকৃত 8 percent ও একটি ভুয়া 8 percent-এর মধ্যে পার্থক্য করতে পারে না। এ ক্ষেত্রে সংখ্যা গোপন রাখা সৎ প্রতিক্রিয়া, এবং 300-word minimum-এর পেছনেও একই প্রবৃত্তি কাজ করে।

বিশ্ববিদ্যালয়ে বাস্তবে অ্যাস্টেরিস্কের অর্থ কী

বাস্তবে, অধিকাংশ প্রতিষ্ঠান অ্যাস্টেরিস্ককে এমন কিছু হিসেবে দেখে না যার ওপর পদক্ষেপ নিতে হবে, এবং এটিকে মানব-রচিত কাজের সঙ্গে সামঞ্জস্যপূর্ণ একটি নিম্ন স্কোর হিসেবে পড়ে। যুক্তিটি সরল। যে বিক্রেতা detector তৈরি করেছে, সে যদি ওই পরিসরের কোনো সংখ্যার পক্ষে দাঁড়াতে না চায়, তবে একজন শিক্ষকের কাছে শিক্ষার্থীর সঙ্গে তোলার মতো কোনো বাস্তব বিষয় থাকে না, misconduct panel-এ নেওয়ার মতো কিছু তো আরও নয়। অধিকাংশ academic integrity প্রক্রিয়ার ক্ষেত্রে অ্যাস্টেরিস্কসহ একটি report কার্যত একটি clean report-এর সমতুল্য।

এটি হলো ফলাফলটি কীভাবে ব্যবহৃত হয় তার বর্ণনা, এবং আপনি যদি এমন একটি report-এর দিকে তাকিয়ে থাকেন, তবে এটি জানা গুরুত্বপূর্ণ। এটি নথিটি আসলে কী, সে বিষয়ে কোনো সিদ্ধান্তের সমান নয়, এবং এই পার্থক্য উভয় দিক থেকেই গুরুত্বপূর্ণ।

একটি তারকা চিহ্ন কী বোঝায় না

  • এটি মানব-রচনার কোনো সনদ নয়। Turnitin নথিটিকে আত্মবিশ্বাসের সঙ্গে স্কোর করতে না পেরে স্কোর দিচ্ছে না, যা লেখকের সম্পর্কে নয়, বরং ডিটেক্টরের সম্পর্কে একটি বক্তব্য।
  • এটি শূন্যের সমান নয়। একেবারেই কোনো AI লেখা নেই এমন একটি নথি এবং একটি AI-সহায়তাপ্রাপ্ত অনুচ্ছেদ আছে এমন একটি নথি, উভয়ই একই তারকা চিহ্ন তৈরি করতে পারে, আর ঠিক এই কারণেই সংখ্যাটি গোপন রাখা হয়।
  • এটি জমাগুলোর মধ্যে তুলনাযোগ্য নয়। দুটি তারকা চিহ্ন কেবল জানায় যে উভয় নথিই একই সীমার নিচে পড়েছে, একে অপরের সঙ্গে তাদের তুলনা কেমন তা নয়।
  • এটি similarity score নয়। Plagiarism matching একটি পৃথক ট্যাবে থাকা পৃথক প্রতিবেদন, এবং AI indicator যা-ই করুক না কেন, এটি নিজস্ব শতাংশ দেখায়।

এখান থেকে যে ব্যবহারিক ফলটি মনে রাখা উচিত, তা হলো হালকা AI-সহায়তাপ্রাপ্ত সম্পাদনা, অর্থাৎ একটি অনুচ্ছেদ সাহায্য নিয়ে পুনর্লিখিত হলে এবং বাকি অংশ সহায়তা ছাড়া লেখা হলে, প্রায়ই ছোট শতাংশের বদলে একটি তারকা চিহ্ন তৈরি করবে। সংখ্যার উপস্থিতি বা অনুপস্থিতি একা কোনো সিদ্ধান্ত দেয় না, আর নিচের নির্ভুলতার পরিসংখ্যানও অন্য দিক থেকে একই সিদ্ধান্তে পৌঁছায়।

Turnitin নির্ভুলতা সম্পর্কে কী দাবি করে, এবং এই সংখ্যাগুলো কার

Turnitin নিজস্ব নির্ভুলতার পরিসংখ্যান প্রকাশ করে, এবং সেগুলোকে ঠিক সেইভাবেই পড়া উচিত, অর্থাৎ বিক্রেতার নিজস্ব যাচাইকরণ সংখ্যা হিসেবে, কোনো স্বাধীন নিরীক্ষা হিসেবে নয়। এর প্রকাশিত উপকরণ জানায় যে 20% AI writing-এর উপরে স্কোর করা নথির ক্ষেত্রে false-positive rate 1% এর নিচে, যা উপরে বর্ণিত তারকা চিহ্নের সীমার সঙ্গে মিলে যায়। detector bias নিয়ে গবেষণার প্রতিক্রিয়ায় পরে একই programme English Language Learner writing samples-এর জন্যও সম্প্রসারিত হয়।

Turnitin বলেছে যে এটি সেই সংখ্যাটিকে ChatGPT-এর অস্তিত্বের আগের মানব-লিখিত প্রবন্ধের একটি বৃহৎ ভিত্তিমানের সঙ্গে যাচাই করেছে। Turnitin-এর উপকরণে সেই ভিত্তিমানের সঠিক আকার সম্পর্কে অসংগতি আছে, FAQ পাতায় 700,000 প্রবন্ধের উল্লেখ করা হয়েছে, আর Turnitin-এর Chief Product Officer-এর একটি ব্লগ পোস্টে 800,000-এর উল্লেখ আছে, এবং উভয়ের সঙ্গেই 1% এর নিচে একই দাবি যুক্ত করা হয়েছে। Turnitin-এর উপকরণে কোম্পানির নিজস্ব বিবরণ অনুযায়ী একটি বিনিময়-সমঝোতাও বর্ণনা করা হয়েছে, AI-উৎপাদিত বিষয়বস্তু আরও আক্রমণাত্মকভাবে ধরতে গেলে তার প্রায় 15% মিস হয়।

কোম্পানি প্রকাশ্যে নিজেদের দাবিও সংশোধন করেছে। 2023 সালে, চালুর অল্প সময় পরেই, Turnitin-এর chief product officer স্বীকার করেন যে ল্যাব পরীক্ষায় বাস্তব ব্যবহারে কতগুলো false positive দেখা দেবে তা পূর্বাভাস করা যায়নি, বিশেষ করে সংক্ষিপ্ত জমাদানের ক্ষেত্রে, এবং তিনি প্রায় 4 percent-এর একটি বাক্য-স্তরের false-positive হার জানান। এই ফাঁকের প্রতিক্রিয়া ছিল ন্যূনতম scoreable দৈর্ঘ্য 150 থেকে 300 words-এ উন্নীত করা।

একসঙ্গে পড়লে, এই সংখ্যাগুলি একটি একক নির্ভুলতার সংখ্যা নয়, বরং একটি নির্দিষ্ট বিনিময়-সমঝোতা বর্ণনা করে। 1% এর নিচে false-positive হার শুনতে প্রায় নগণ্য মনে হয়, যতক্ষণ না তা সিস্টেমের মধ্য দিয়ে যাওয়া জমাদানের সংখ্যার সঙ্গে মাপা হয়, আর 15% miss rate মানে AI-উৎপাদিত বিষয়বস্তুর একটি উল্লেখযোগ্য অংশ নকশাগতভাবেই human হিসেবে স্কোর করা হয়, ত্রুটির কারণে নয়। Turnitin-এর নিজস্ব উপকরণ এই দুই সংখ্যাকে সিস্টেমের উদ্দেশ্যপ্রণোদিত ভারসাম্য হিসেবে উপস্থাপন করে, কেবল টুলটি ঠিক বা ভুল, তার প্রমাণ হিসেবে নয়।

স্বাধীন পরীক্ষায় কী পাওয়া গেছে

স্বাধীন পরীক্ষা বিক্রেতার সংখ্যাগুলিতে যে বিশদ অনুপস্থিত, তা যোগ করে, একইভাবে AI detectors-এর স্বাধীন পরীক্ষায়ও বারবার ল্যাবের শর্ত আর প্রকৃত জমাদানের মধ্যে ফারাক ধরা পড়ে। Temple University's Center for the Advancement of Teaching উপলব্ধ আরও সতর্ক পরীক্ষাগুলির একটি পরিচালনা করেছে। গবেষকেরা 120টি লেখার নমুনা জমা দেন, যেগুলি সমানভাবে ভাগ করা ছিল সম্পূর্ণ human লেখা, সম্পূর্ণ AI-উৎপাদিত লেখা, paraphrasing tool-এর মধ্য দিয়ে চালানো AI-উৎপাদিত লেখা, এবং human ও AI অবদানের সমন্বয়ে গঠিত hybrid text-এর মধ্যে, এবং Turnitin প্রতিটির জন্য কী ফেরত দেয় তা নথিভুক্ত করেন।

এই টুলটি 93 শতাংশ সম্পূর্ণ মানব-রচিত নমুনা এবং 77 শতাংশ সম্পূর্ণ AI-উৎপন্ন নমুনা সঠিকভাবে শনাক্ত করেছে। আরও কঠিন প্রশ্নগুলিতে, নির্ভুলতা আরও কমে গেছে। Turnitin প্যারাফ্রেজ করা AI নমুনার মাত্র 63 শতাংশকে AI-উৎপন্ন হিসেবে সঠিকভাবে শনাক্ত করেছে, এবং হাইব্রিড নমুনার মাত্র 43 শতাংশকে সম্পূর্ণ মানব বা সম্পূর্ণ AI, কোনোটিই নয়, হিসেবে শনাক্ত করেছে। এগুলি সেই শ্রেণিগুলি, যা AI-সহায়তায় লেখা বাস্তবে কীভাবে তৈরি হয় তার সবচেয়ে কাছাকাছি, এবং গবেষকেরা বিশেষভাবে হাইব্রিড পাঠ্যকে এমন কিছু হিসেবে চিহ্নিত করেছেন, যা আরও বেশি কোর্সে কাজের একটি অংশে AI ব্যবহার করা হলে বাস্তব জমাদানের একটি বড় এবং ক্রমবর্ধমান অংশের জন্য দায়ী হতে পারে।

কি পরীক্ষা করা হয়েছিলTurnitin-এর ফলাফল
100% মানব-রচিত নমুনা93% সঠিকভাবে মানব হিসেবে শনাক্ত
100% AI-উৎপন্ন নমুনা77% সঠিকভাবে AI হিসেবে শনাক্ত
প্যারাফ্রেজিং টুলের মাধ্যমে চালানো AI পাঠ্য63% সঠিকভাবে AI হিসেবে শনাক্ত
হাইব্রিড নমুনা, আংশিক মানব এবং আংশিক AI43% সঠিকভাবে 0% বা 100% নয়, এমন হিসেবে শনাক্ত
20% এর বেশি চিহ্নিত করা নথি, (Turnitin-এর নিজস্ব সংখ্যা)1% এর নিচে false positive হার

এর কোনোটিই Turnitin-এর পক্ষ থেকে স্বাধীন অনুসন্ধান নয়। কোম্পানির বাইরের গবেষকেরা, যাদের Turnitin-এর নিজস্ব পক্ষপাত-সংক্রান্ত গবেষণার প্রতিবেদনে উদ্ধৃত করা হয়েছে, আরও জটিল একটি চিত্র বর্ণনা করেন, বিশেষ করে non-native English writers এবং ব্যাপকভাবে সম্পাদিত খসড়ার ক্ষেত্রে।

বাক্য-স্তরের হাইলাইটগুলি কোথায় ভেঙে পড়ে

ডকুমেন্ট-স্তরের স্কোরই একমাত্র দৃশ্য নয় যা একজন শিক্ষক খুলতে পারেন, এবং অন্যটি কম নির্ভরযোগ্য। কিছু ইন্টারফেসে একটি ফ্ল্যাগ রিপোর্ট দেখানো হয়, যা নির্দিষ্ট বাক্যগুলোকে সম্ভাব্য AI-লিখিত হিসেবে চিহ্নিত করে। Temple-এর গবেষকেরা সেই হাইলাইটগুলোকে তাদের হাইব্রিড নমুনায় কোন বাক্যগুলো আসলে AI-লিখিত ছিল তার সঙ্গে মিলিয়ে দেখেন এবং দুটির মধ্যে কোনো সম্পর্ক পাননি। এটি গুরুত্বপূর্ণ, যদি কোনো শিক্ষক সারসংক্ষেপ শতাংশের বদলে হাইলাইট করা অনুচ্ছেদের একটি স্ক্রিনশট ফরোয়ার্ড করেন, কারণ সামগ্রিক ডকুমেন্ট স্কোর বাক্য-স্তরের হাইলাইটগুলোর তুলনায় উল্লেখযোগ্যভাবে ভালো কাজ করেছে।

স্কোরটি আসলে কে দেখে

AI স্কোরটি ডিফল্টভাবে শিক্ষার্থী-সম্মুখীন প্রতিবেদনের অংশ নয়। এটি নিজস্ব একটি ট্যাবে থাকে, যা শিক্ষক ও প্রশাসকদের কাছে দৃশ্যমান, এবং শিক্ষার্থী এটি কেবল তখনই দেখে যদি শিক্ষক প্রতিবেদনটি ভাগ করে দেওয়ার বা সরাসরি তা দেখানোর সিদ্ধান্ত নেন। এটি similarity score-এর তুলনায় একটি বাস্তব কাঠামোগত পার্থক্য, কারণ একটি জমা প্রক্রিয়াকৃত হওয়ার পর শিক্ষার্থীরা সাধারণত একই সিস্টেমের ভেতরেই সেটি নিজেরা দেখতে পারে।

একই কথা প্রযোজ্য এই বিষয়ে যে, কোনো নির্দিষ্ট কোর্সের জন্য এই বৈশিষ্ট্যটি আদৌ আছে কি না, যা শিক্ষকের ঊর্ধ্বে একটি প্রাতিষ্ঠানিক সিদ্ধান্ত। অ্যাকাউন্ট-স্তরের প্রশাসকেরা পুরো প্রতিষ্ঠানের জন্য Turnitin-এর AI detection চালু বা বন্ধ করতে পারেন। কোনো বিশ্ববিদ্যালয় যদি এটি বন্ধ করে রাখে, তবে একজন প্রভাষক তা চালু করতে নাও পারেন, এবং উল্টোটাও সত্য। ভিন্ন বিশ্ববিদ্যালয়ের দুই শিক্ষার্থী তুলনীয় কাজ জমা দিতে পারে এবং এই টুলের অভিজ্ঞতা তাদের ক্ষেত্রে খুব ভিন্ন হতে পারে, এমন কারণে যা তাদের কারও লেখার সঙ্গে সম্পর্কিত নয়।

কেন কিছু বিশ্ববিদ্যালয় এটি বন্ধ করে দিয়েছে

University of Waterloo 2025 সালের September মাসে Turnitin-এর AI detection বৈশিষ্ট্যটি বন্ধ করে দেয়, এবং তাদের প্রকাশিত ব্যাখ্যা অস্বাভাবিকভাবে সরাসরি। বিশ্ববিদ্যালয়টি টুলটির নথিভুক্ত অনির্ভরযোগ্যতা, যেসব শিক্ষার্থীর প্রথম ভাষা English নয় তাদের বিরুদ্ধে এর পক্ষপাত, এবং তাদের নিজস্ব অভ্যন্তরীণ পরীক্ষার কথা উল্লেখ করে, যেখানে অন্তত একটি ক্ষেত্রে সম্পূর্ণ মানব-লিখিত পাঠ্যকে 100 percent AI-generated হিসেবে স্কোর করা হয়েছিল। টুলটির ব্যয়ের সঙ্গে তুলনা করে বিশ্ববিদ্যালয়টি সিদ্ধান্তে পৌঁছায় যে খরচ সুবিধার চেয়ে বেশি, এবং পরিবর্তে প্রচেষ্টা assessment redesign এবং AI literacy training-এর দিকে পুনর্নির্দেশ করে।

Waterloo বৃহত্তর বিভাজনের একটি দৃশ্যমান উদাহরণ, ব্যতিক্রম নয়। যেসব বিশ্ববিদ্যালয় এই বৈশিষ্ট্যটি চালু রাখে, তারা সাধারণত এটিকে এককভাবে চূড়ান্ত রায় হিসেবে না দেখে অতিরিক্ত নিয়ন্ত্রণব্যবস্থা যোগ করেছে, আনুষ্ঠানিক কিছু শুরু হওয়ার আগে শিক্ষার্থীর সঙ্গে আলাপের শর্ত রেখেছে, এবং সংখ্যাটিকে আলাপ শুরু করার কারণ হিসেবে দেখেছে, তা বন্ধ করার কারণ হিসেবে নয়। বিশ্ববিদ্যালয়গুলো কীভাবে AI নীতি সামলাচ্ছে সে বিষয়ে আরও বিস্তৃতভাবে পড়লে এই ধরণটি আরও স্পষ্ট হয়, স্কোরটি আদৌ আপনার কাছে পৌঁছাবে কি না, তা নির্ভর করে আপনার সেমিনার কক্ষের অনেক উপরের স্তরে নেওয়া একটি সিদ্ধান্তের ওপর, প্রযুক্তিটির নিজস্ব কোনো স্থির বৈশিষ্ট্যের ওপর নয়।

উচ্চ স্কোর কী প্রমাণ করে, আর কী প্রমাণ করে না

উচ্চ AI স্কোর প্রমাণ নয়, এটি একটি ইঙ্গিতমাত্র। Turnitin নিজেই এই শতাংশকে অসদাচরণের অনুসন্ধান নয়, বরং একজন শিক্ষকের বিচারবোধের জন্য একটি তথ্যবিন্দু হিসেবে উপস্থাপন করে, এবং উপরের নির্ভুলতার পরিসংখ্যান ব্যাখ্যা করে কেন এই উপস্থাপনাটি গুরুত্বপূর্ণ, কারণ এমনকি তুলনামূলকভাবে ভালো কাজ করা একটি নথি-স্তরের স্কোরও ব্যাপকভাবে সম্পাদিত, পুনর্বাক্যায়িত বা সংকর লেখার একটি উল্লেখযোগ্য অংশ ভুলভাবে পড়ে, এবং বাক্য-স্তরের হাইলাইটগুলো সারসংক্ষেপ সংখ্যার তুলনায় অনেক কম নির্ভরযোগ্য। এর কোনোটিই কোনো নির্দিষ্ট স্কোর ভুল, তা নিশ্চিত করে না। এর মানে হলো, একটি শতাংশ প্রশ্ন করার কারণ, চোখ বুজে মেনে নেওয়ার মতো কোনো সিদ্ধান্ত নয়।

একটি একক নথি-স্তরের শতাংশ চারটি পৃথক ধাপকে এক সংখ্যায় সংকুচিত করে, এবং ওই ধাপগুলোর কোনোটিই অর্থ অনুধাবন করে না বা কোনো যুক্তি সঙ্গত কি না তা পরীক্ষা করে না। এই ধরনের একটি পাইপলাইন যে অন্তর্নিহিত পরিসংখ্যানগত সংকেত থেকে গঠিত, তার ওপর একটি ছোট অংশ কীভাবে স্কোর পায় তা দেখা, শতাংশটিকে চূড়ান্ত রায় হিসেবে দেখার চেয়ে প্রতিবেদনটি বোঝার আরও সরাসরি উপায়। TextPulse-এর free perplexity checker আপনার নিজের খসড়ার বিরুদ্ধে, কোনো প্রাতিষ্ঠানিক পাইপলাইনের বাইরে, শব্দ-স্তরের এই ধরনের স্কোরিংয়ের একটি সরলীকৃত সংস্করণ চালায়, এবং এর free burstiness checker একই পরিমাপের বাক্য-ছন্দ অংশটি কভার করে। উভয়ই আপনার নিজের লেখার একটি পাঠ দেয়, Turnitin সেটি সম্পর্কে কী বলবে তার পূর্বাভাস নয়। যে সিস্টেমের ওপর তার নিয়ন্ত্রণ নেই, সে সম্পর্কে কোনো টুল দায়িত্বশীলভাবে এমন প্রতিশ্রুতি দিতে পারে না।

Turnitin দুটি সংখ্যা প্রতিবেদন করে এবং সেগুলি সম্পর্কহীন বিষয় পরিমাপ করে। কোনটি কোনটি, তা আলাদাভাবে ব্যাখ্যা করা হয়েছে, সঙ্গে একটি Turnitin স্কোরকে আসলে ভালো বলতে কী বোঝায়, যখন আপনি জানেন শতাংশটি কী বোঝাচ্ছে। কয়েকটি সম্পর্কিত প্রশ্নের নিজস্ব পৃষ্ঠা আছে: কোনো detector ছাড়াই একজন professor কি বুঝতে পারেন যে আপনি ChatGPT ব্যবহার করেছেন, এর আরও সরাসরি রূপ, আমি কি ধরা পড়ব, এবং নির্দিষ্ট প্রেক্ষাপটে, নার্সিং প্রোগ্রামে AI detection এবং college admissions offices কি এই checks চালায়। বৃহত্তর কাঠামোটি academic integrity and AI বিষয়ে একটি পৃথক লেখায় রয়েছে।

এর কোনোটিই সম্ভবত চূড়ান্ত সংস্করণ নয়। 2023 থেকে Turnitin একাধিকবার তার thresholds, visibility rules এবং model coverage পুনর্লিখন করেছে, এবং August 2026-ও শেষ কথা হবে না। এটি TextPulse-এর বাকি free tools collection-এর পাশে অবস্থান করে, তাদের জন্য যারা কোনো একটি institution-এর percentage-কে চূড়ান্ত কথা হিসেবে ধরার আগে একটি দ্বিতীয় signal চান।

আমাদের নিজস্ব গবেষণা যা পেয়েছে

TextPulse Research-এর ডিটেক্টর সম্মতি গবেষণায় নয়টি বাণিজ্যিক AI ডিটেক্টর একই 90টি একাডেমিক লেখা মূল্যায়ন করেছে। এর একটি ছিল 455 শব্দের একটি হাইব্রিড লেখা: মানুষের লেখা শুরু ও শেষ, মাঝখানে 168 শব্দের AI-লেখা অংশ। Turnitin এই লেখাটিকে 26.8% AI স্কোর দিয়েছে, অথচ একই শব্দে অন্য টুলগুলোর রায় 0% থেকে 95.7% পর্যন্ত ছড়িয়ে ছিল। সম্পূর্ণ গবেষণাপত্র, করপাস ও প্রতিটি টুলের স্কোর ম্যাট্রিক্স উন্মুক্তভাবে পাওয়া যাবে TextPulse Research-এ।

গবেষণার করপাস থেকে নেওয়া হাইব্রিড লেখায় Turnitin।
গবেষণার করপাস থেকে নেওয়া হাইব্রিড লেখায় Turnitin।
XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

Turnitin কীভাবে AI শনাক্ত করে? এটি একটি submission-কে কয়েকশো শব্দের segments-এ ভাগ করে, প্রতিটি segment আলাদাভাবে স্কোর করে যে সেটি AI-generated নাকি AI-generated-and-then-paraphrased বলে মনে হয়, তারপর সেই segment score-গুলোর গড় নিয়ে report-এ দেখানো একক percentage তৈরি করে। minimum word count পূরণ করা প্রতিটি submission-এ এই process একইভাবে চলে।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।