Turnitin কি ChatGPT শনাক্ত করতে পারে? এটি কী ধরে আর কী মিস করে
Turnitin-এর AI লেখার রিপোর্ট এবং এর plagiarism রিপোর্ট ভিন্ন পণ্য, ভিন্ন পাঠকগোষ্ঠী এবং ভিন্ন নির্ভুলতার ইতিহাসসহ। এখানে বলা হয়েছে AI স্কোর আসলে কী মাপে, স্বাধীন পরীক্ষায় এটি কোথায় ভেঙে পড়ে, এবং কেন আপনার রিপোর্ট আপনার রুমমেটের রিপোর্টের মতো নাও হতে পারে।
হ্যাঁ, তবে কেবল AI ব্যবহারের একটি নির্দিষ্ট ধরনের ক্ষেত্রে, এবং এমন একটি প্রতিবেদনের ভেতরে যা অধিকাংশ শিক্ষার্থী কখনও দেখে না। Turnitin-এর AI writing indicator এমন গদ্য চিহ্নিত করে যা পরিসংখ্যানগতভাবে একটি language model-এর সাধারণ লেখার মতো শোনায়, এবং এটি যে প্রবন্ধগুলো স্ক্যান করে সেগুলোর ক্রমবর্ধমান অংশে তা করে: October 2025 থেকে February 2026-এর মধ্যে প্রায় 15 percent প্রবন্ধে 80 percent বা তার বেশি AI-generated writing দেখা গেছে, যা toolটি April 2023-এ চালু হওয়ার সময় প্রায় 3 percent ছিল। এটি আপনার নির্দিষ্ট submission চিহ্নিত করবে কি না, তা নির্ভর করে এমন কিছু বিবরণের ওপর, যা can Turnitin detect ChatGPT ধরনের প্রশ্নের অধিকাংশ উত্তরে এড়িয়ে যাওয়া হয়: AI report কীভাবে plagiarism report থেকে আলাদা, আসলে কাকে সংখ্যাটি দেখানো হয়, এবং সেই সংখ্যাটি কত ঘন ঘন ভুল প্রমাণিত হয়।
এই postটি সাধারণভাবে academic integrity নয়, বরং ওই এক product-এর কার্যপ্রণালী নিয়ে আলোচনা করে। এতে ব্যাখ্যা করা হয়েছে AI writing report কী মাপে, independent testing কী সঠিক ও কী ভুল পেয়েছে, এবং কেন একই কাজ জমা দেওয়া দুই শিক্ষার্থী ভিন্ন outcome পেতে পারে, তারা কোন university-তে পড়ে তার ওপর নির্ভর করে। এর কোনোটিই আপনার নিজের course handbook-এ acceptable AI use সম্পর্কে যা বলা আছে তা বদলায় না। এটি black box সম্পর্কে একটি অনুমানের বদলে, তার ভেতরে আসলে কী আছে তার বর্ণনা দেয়।
Can Turnitin Detect ChatGPT? Reportটি আসলে কী দেখায়
Turnitin AI writing report হলো plagiarism পরীক্ষা করা similarity report থেকে আলাদা একটি product। এগুলো ভিন্ন model-এ চলে এবং একই interface-এর ভিন্ন tab-এ প্রদর্শিত হয়। similarity score আপনার submission দেখে এবং সেটিকে পূর্বে প্রকাশিত source ও অন্যান্য student paper-এর database-এর সঙ্গে তুলনা করে, যাতে কত শতাংশ মিলে তা ফেরত দেয়। AI score সম্পূর্ণ ভিন্ন কিছু করে: এটি একটি classifier, যা আপনার গদ্য sentence by sentence পড়ে, প্রতিটি sentence-এর AI-generated হওয়ার সম্ভাবনা নির্ধারণ করে, এবং তারপর সেই sentence-level scoreগুলোকে একত্র করে একটি single document percentage-এ রূপ দেয়। যেহেতু এগুলো ভিন্ন জিনিস মাপে, একটি submission-এর similarity score 2 percent এবং AI score 60 percent হতে পারে, অথবা উল্টোও হতে পারে।
এই শতাংশটি আসলে যতটা শোনায়, তার চেয়ে বেশি সংকীর্ণ। এটি সেই যোগ্য গদ্যের অনুপাত, যা মডেলটি AI দ্বারা লেখা বলে পূর্বাভাস দেয়, পুরো নথি নয়, কারণ স্কোর গণনার সময় তারা কোড ব্লক, বুলেট পয়েন্ট, শিরোনাম এবং সংক্ষিপ্ত-রূপের লেখাকে বাদ দেয়। এই ডিটেক্টর কেবল এমন নথিতে প্রয়োগ করা যায়, যেগুলিতে অন্তত 300 শব্দের দীর্ঘ-রূপ গদ্য আছে, এবং এই লেখার সময় পর্যন্ত এটি শুধু ইংরেজি, স্প্যানিশ এবং জাপানি পাঠ্যের জন্য। যেমনটি আশা করা যায়, সাধারণভাবে AI ডিটেক্টর কীভাবে সেই স্কোর গণনা করে এর পাশে রাখলে, এখানে ধরণটি পরিচিত: একটি নথি-স্তরের সংখ্যা, যা নির্ভুল বলে মনে হয়, তা শিরোনাম-সংখ্যাটি যা বোঝায় তার চেয়ে বেশি সংকীর্ণ পাঠ্যাংশ থেকে তৈরি।
AI হিসেবে কী দেখা যায়: ChatGPT এবং বাকি সব
Turnitin বলে, তার শ্রেণিবিন্যাসকারী একটি ব্র্যান্ড নামের বদলে একটি লেখার ধরণ খোঁজে, এবং 2023 সালে মূল GPT-3.5 ও GPT-4 উন্মোচনের পর থেকে এর কভারেজ বারবার বিস্তৃত হয়েছে। বর্তমান নির্দেশিকায় GPT-5 সিরিজ, Gemini এবং Claude কে সেই সিস্টেমগুলোর মধ্যে নাম করা হয়েছে, যাদের বিরুদ্ধে এটি প্রশিক্ষিত, এবং নতুন মডেল প্রকাশগুলো চলমান ভিত্তিতে যোগ করা হচ্ছে। এর মধ্যে এমন পাঠ্যও আছে, যা কখনও বিশেষভাবে ChatGPT-কে স্পর্শ করেনি। যে ছাত্র Gemini, Claude বা DeepSeek ব্যবহার করেছে, সে কেবল ভিন্ন একটি কোম্পানি বেছে নিয়ে ডিটেক্টরকে এড়িয়ে যাচ্ছে না, Turnitin-এর মডেলের নিজস্ব বর্ণনা স্পষ্ট যে এটি কোন বিক্রেতা পাঠ্যটি তৈরি করেছে, সেটির ওপর নির্ভর করে না, কেবল পাঠ্যটি কেমন পড়া যায়, তার ওপর নির্ভর করে।
প্যারাফ্রেজ করা AI পাঠ্য আলাদা শ্রেণি পায়, বিনা প্রশ্নে ছাড় পায় না। Turnitin-এর ডকুমেন্টেশন কেবল AI-উৎপন্ন বলে বিচার করা পাঠ্যকে, এবং AI-উৎপন্ন বলে বিচার করা, তারপর AI-প্যারাফ্রেজ করা পাঠ্যকে পৃথক করে, এবং 2025 সালের August-এ এটি এমন সনাক্তকরণ যোগ করেছে, যা বিশেষভাবে AI bypasser টুলের দিকে লক্ষ্য করে, যেগুলো মেশিন-উৎপাদিত আউটপুটকে ডিটেক্টরের পাশ কাটিয়ে পুনর্লিখনের জন্য তৈরি। এর মানে এই নয় যে প্যারাফ্রেজ করা অর্থহীন, বা প্রতিটি পুনর্লিখিত অনুচ্ছেদ ধরা পড়ে। এর মানে হলো, ডিফল্টভাবে Turnitin-এর কাছে প্যারাফ্রেজিং অদৃশ্য, এই ধারণাটি কিছু সময় ধরে পুরোনো হয়ে গেছে।
Turnitin-এর AI স্কোর কতটা সঠিক?
Turnitin-এর নির্ভুলতার দাবি একটি প্রধান সংখ্যার ওপর নির্ভর করে, এটি বলে যে 20 শতাংশের বেশি পাঠ্য চিহ্নিত হওয়া নথিতে এটি 1 শতাংশের নিচে false positive rate বজায় রাখে। কোম্পানিটি আরও বলে যে এই নির্ভুলতা যাচাই করার জন্য এটি তার মডেলের প্রতিটি নতুন সংস্করণকে ChatGPT-এর অস্তিত্বের আগের 700,000টি একাডেমিক পেপারের বিরুদ্ধে পরীক্ষা করে। এটি একটি নির্দিষ্ট, পরীক্ষাযোগ্য দাবি, যা নির্দিষ্ট কিছু পরিস্থিতির সঙ্গে সম্পর্কিত। এটিকে ঠিক সেইভাবেই পড়া উচিত। Turnitin 2023 সালে, তার চালুর অল্প সময় পরেই, নির্ভুলতা সম্পর্কে আরও কিছু দাবি করেছিল। কোম্পানির chief product officer প্রকাশ্যে স্বীকার করেন যে ল্যাব পরীক্ষায় বাস্তব ব্যবহারে কতগুলো false positive দেখা দেবে তা পূর্বাভাস করা যায়নি, বিশেষ করে সংক্ষিপ্ত জমায়, এবং তিনি বলেন যে false positive-এর শতাংশ পরীক্ষার তুলনায় বাস্তব ব্যবহারে বেশি ছিল। তিনি sentence-level false positive rate প্রায় 4 শতাংশ বলে জানান এবং উল্লেখ করেন যে এর ফলে Turnitin যে জমাগুলোর স্কোর নির্ধারণ করতে পারে, সেগুলোর ন্যূনতম দৈর্ঘ্য 150 থেকে 300 words-এ বাড়ানো হয়েছে। বর্তমান ন্যূনতম সীমা এখনও 300 words।
স্বাধীন পরীক্ষা বিক্রেতার দেওয়া সংখ্যার বাইরে অতিরিক্ত বিশদ যোগ করে। Temple University's Center for the Advancement of Teaching উপলব্ধ আরও যত্নশীল পরীক্ষাগুলোর একটি পরিচালনা করে, একই মনোভাব নিয়ে যেমন AI detectors-এর স্বাধীন পরীক্ষা বারবার ল্যাবের পরিস্থিতি এবং প্রকৃত জমার মধ্যে ফাঁক খুঁজে পায়। গবেষকেরা 120টি লেখার নমুনা জমা দেন, যেগুলো সমানভাবে ভাগ করা ছিল সম্পূর্ণ মানব-লিখিত লেখা, সম্পূর্ণ AI-generated লেখা, paraphrasing tool-এর মধ্য দিয়ে চালানো AI-generated লেখা, এবং মানব ও AI অবদানের সমন্বয়ে গঠিত hybrid text-এর মধ্যে, এবং Turnitin প্রতিটির জন্য কী ফেরত দেয় তা নথিভুক্ত করেন। টুলটি সম্পূর্ণ মানব নমুনার 93 শতাংশ এবং সম্পূর্ণ AI-generated নমুনার 77 শতাংশ সঠিকভাবে শনাক্ত করে।
কঠিনতর প্রশ্নগুলিতে, নির্ভুলতা আরও কমে যায়। Turnitin সঠিকভাবে মাত্র 63 শতাংশ paraphrased AI নমুনাকে AI-generated হিসেবে এবং মাত্র 43 শতাংশ hybrid নমুনাকে সম্পূর্ণ মানবসৃষ্টও নয়, সম্পূর্ণ AI-ও নয় হিসেবে শনাক্ত করেছে, যা সেই শ্রেণিগুলির সবচেয়ে কাছাকাছি, যেভাবে AI-helped লেখা বাস্তবে তৈরি হয়। বিশেষভাবে hybrid পাঠ্য গবেষকদের আগ্রহের বিষয় ছিল, কারণ তাঁদের ধারণা, আরও বেশি কোর্সে যখন শিক্ষার্থীদের কাজের একটি অংশে AI ব্যবহার করতে বলা হবে, তখন ভবিষ্যতে বাস্তব জমাদানের একটি বড় অংশ, সম্ভবত সংখ্যাগরিষ্ঠ অংশ, এটি গঠন করবে।
| কি পরীক্ষা করা হয়েছিল | Turnitin's result |
|---|---|
| 100% মানব-লিখিত নমুনা | 93% সঠিকভাবে মানব হিসেবে শনাক্ত |
| 100% AI-generated নমুনা | 77% সঠিকভাবে AI হিসেবে শনাক্ত |
| paraphrasing tool-এর মাধ্যমে চালানো AI পাঠ্য | 63% সঠিকভাবে AI হিসেবে শনাক্ত |
| Hybrid নমুনা, আংশিক মানব এবং আংশিক AI | 43% সঠিকভাবে 0% বা 100% নয় হিসেবে শনাক্ত |
| 20% এর বেশি চিহ্নিত নথি, Turnitin's own figure | 1% এর নিচে false positive হার |
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
সংখ্যা ঠিক দেখালেও এটি কোথায় ভেঙে পড়ে
নথি-স্তরের স্কোরই একজন শিক্ষক যা দেখতে পারেন তা নয়, এবং অন্য দৃষ্টিভঙ্গিটি কম নির্ভরযোগ্য। কিছু ইন্টারফেসে শিক্ষক একটি flag report খুলতে পারেন, যেখানে নির্দিষ্ট বাক্যগুলোকে সম্ভাব্য AI-written হিসেবে চিহ্নিত করা হয়। Temple-এর গবেষকেরা তাঁদের hybrid নমুনার কোন কোন বাক্য বাস্তবে AI-written ছিল, তার সঙ্গে ওই চিহ্নগুলোর তুলনা করেছেন, এবং দুটির মধ্যে কোনো সম্পর্ক পাননি। যদি কোনো অধ্যাপক আপনাকে সারসংক্ষেপ শতাংশের বদলে চিহ্নিত অনুচ্ছেদের একটি screenshot পাঠান, তবে এটি গুরুত্বপূর্ণ: সামগ্রিক নথি স্কোর বাক্য-স্তরের চিহ্নগুলোর তুলনায় উল্লেখযোগ্যভাবে ভালো কাজ করেছে।
নিম্ন স্কোরগুলো আবার ভিন্নভাবে, এবং আগের তুলনায় আরও সতর্কতার সঙ্গে, পরিচালিত হয়। 2024 সালের July থেকে, Turnitin তার মডেল যখন অনুমান করে যে কোনো নথির 20 percent-এর কম অংশ AI-written, তখন সংখ্যার বদলে একটি তারকা চিহ্ন দেখায়, কারণ এই পরিসরেই টুলটি উভয় দিকেই ভুল করার সবচেয়ে বেশি সম্ভাবনা থাকে। হালকা AI-assisted সম্পাদনা, যেখানে একটি অনুচ্ছেদ সাহায্য নিয়ে পুনর্লিখিত হয় এবং বাকি অংশ সহায়তা ছাড়াই লেখা হয়, প্রায়ই কোনো দৃশ্যমান শতাংশই দেখায় না, ছোট একটি সংখ্যা নয়, যা কোনো সংখ্যার অনুপস্থিতিকে কোনো কিছুর প্রমাণ হিসেবে ধরার আগে জানা দরকার।
সংখ্যাটি আসলে কে দেখে
AI score ডিফল্টভাবে student-facing report-এর অংশ নয়। এটি নিজস্ব tab-এ থাকে, যা instructors এবং administrators-এর কাছে দৃশ্যমান, এবং একজন student এটি কেবল তখনই দেখে যদি instructor reportটি share করতে বা সরাসরি দেখাতে চান। এটি similarity score-এর তুলনায় একটি বাস্তব কাঠামোগত পার্থক্য, কারণ submission process হওয়ার পর সাধারণত students একই system-এর মধ্যে সেটি নিজেরাই দেখতে পারে।
একই কথা প্রযোজ্য কোনো নির্দিষ্ট course-এর জন্য featureটি আদৌ আছে কি না, সেই বিষয়ে, যা instructor-এর ঊর্ধ্বে একটি institutional সিদ্ধান্ত। Account-level administrators পুরো institution-এর জন্য Turnitin-এর AI detection on বা off করতে পারেন। কোনো university যদি এটি off করে থাকে, তবে একজন lecturer এটি on করতে নাও পারেন, এবং উল্টোটাও সত্য। এক university-এর একজন student যখন অন্য university-এর আরেক student-এর অনুরূপ কাজ জমা দেয়, তখন তাদের এই tool-এর অভিজ্ঞতা খুব ভিন্ন হতে পারে, এমন কারণে যার সঙ্গে তাদের কারও লেখা কিছুরই সম্পর্ক নেই।
কেন কিছু বিশ্ববিদ্যালয় এটি বন্ধ করে দিয়েছে
University of Waterloo 2025 সালের September মাসে Turnitin-এর AI detection feature বন্ধ করে দেয়, এবং তাদের প্রকাশিত যুক্তি অস্বাভাবিকভাবে সরাসরি। বিশ্ববিদ্যালয়টি টুলটির নথিভুক্ত অনির্ভরযোগ্যতা, যেসব শিক্ষার্থীর প্রথম ভাষা English নয় তাদের বিরুদ্ধে এর পক্ষপাত, এবং তাদের নিজস্ব অভ্যন্তরীণ পরীক্ষার কথা উল্লেখ করে, যেখানে অন্তত একটি ক্ষেত্রে সম্পূর্ণ মানব-লিখিত পাঠ্যকে 100 percent AI-generated হিসেবে স্কোর করা হয়েছিল। টুলটির ব্যয়ের সঙ্গে তুলনা করে বিশ্ববিদ্যালয়টি সিদ্ধান্তে পৌঁছায় যে খরচ সুবিধার চেয়ে বেশি, এবং তার বদলে প্রচেষ্টা assessment redesign এবং AI literacy training-এর দিকে সরিয়ে দেয়।
Waterloo একটি বৃহত্তর বিভাজনের একটি দৃশ্যমান উদাহরণ, ব্যতিক্রম নয়। যেসব বিশ্ববিদ্যালয় featureটি চালু রাখে, তারা সাধারণত scoreটিকে একা চূড়ান্ত রায় হিসেবে না ধরে guardrails যোগ করেছে, কোনো আনুষ্ঠানিক প্রক্রিয়া শুরু হওয়ার আগে শিক্ষার্থীর সঙ্গে একটি conversation বাধ্যতামূলক করেছে, এবং numberটিকে সেই conversation শুরু করার কারণ হিসেবে দেখেছে, শেষ করার কারণ হিসেবে নয়। how universities are handling AI policy সম্পর্কে আরও পড়লে patternটি আরও স্পষ্ট হয়: একটি score আপনার কাছে আদৌ পৌঁছাবে কি না, তা নির্ভর করে আপনার seminar room-এর অনেক উপরে নেওয়া একটি সিদ্ধান্তের ওপর, technologyটির নিজস্ব কোনো স্থির বৈশিষ্ট্যের ওপর নয়।
একটি উচ্চ score কী প্রমাণ করে, এবং কী প্রমাণ করে না
একটি উচ্চ AI score হলো evidence, verdict নয়। Turnitin নিজেই percentageটিকে instructor-এর judgment-এর জন্য একটি data point হিসেবে উপস্থাপন করে, misconduct-এর finding হিসেবে নয়, এবং উপরের accuracy figures ব্যাখ্যা করে কেন এই framing গুরুত্বপূর্ণ: এমনকি document-level score, যা তুলনামূলকভাবে ভালো কাজ করে, তবু ব্যাপকভাবে edited, paraphrased বা hybrid writing-এর একটি উল্লেখযোগ্য অংশ ভুলভাবে পড়ে, এবং sentence-level highlights summary number-এর তুলনায় অনেক কম reliable। এর কোনোটিই নিশ্চিত করে না যে কোনো নির্দিষ্ট score ভুল। এর মানে হলো, একটি percentage প্রশ্ন করার কারণ, চোখের সামনে মেনে নেওয়ার মতো finding নয়। আপনি যদি অন্য কেউ score করার আগে নিজের writing কোথায় দাঁড়িয়ে আছে তা দেখতে চান, classifier যে low-variation, generic-phrasing patterns-এর প্রতি প্রতিক্রিয়া দেখায়, সেগুলো সরাসরি একটি free perplexity checker দিয়ে যাচাই করা যায়।
TextPulse-এর শিক্ষার্থীদের জন্য AI humanizer একই পরিসংখ্যানগত ভিত্তিতে কাজ করে, এবং একই পরিমাপের বাক্য-ছন্দ অংশের জন্য এর free burstiness checkerও তাই করে। এটি আপনার নিজের খসড়ার ভিত্তিতে একটি আনুমানিক Human Score দেয়, Turnitin এ সম্পর্কে কী বলবে তার কোনো পূর্বাভাস নয়। যে কোনো টুল এমন একটি সিস্টেম সম্পর্কে, যেটি তার নিয়ন্ত্রণে নেই, এ ধরনের প্রতিশ্রুতি দায়িত্বশীলভাবে দিতে পারে না। এটিকে আপনার নিজের লেখার একটি দ্বিতীয় পাঠ হিসেবে বিবেচনা করুন, এর বেশি কিছু নয়।
এই প্রশ্নগুলোর কয়েকটির নিজস্ব পৃষ্ঠা আছে। কোনো detector ছাড়াই একজন অধ্যাপক বুঝতে পারেন কি না যে আপনি ChatGPT ব্যবহার করেছেন, এবং এর আরও সরাসরি রূপ, আমি কি ধরা পড়ব, আলাদাভাবে উত্তর দেওয়া হয়েছে। প্যারাফ্রেজ করা লেখার ক্ষেত্রে Turnitin-এর আচরণ এবং বিশেষভাবে Turnitin DeepSeek output শনাক্ত করে কি না সম্পর্কেও আলাদা আলোচনা আছে। নির্দিষ্ট প্রেক্ষাপটের জন্য নার্সিং প্রোগ্রামে AI detection এবং কলেজ ভর্তি অফিসগুলো এই পরীক্ষা চালায় কি না বিষয়ে লেখা আছে। বৃহত্তর কাঠামোটি academic integrity and AI নিয়ে একটি পৃথক লেখায় উপস্থাপিত হয়েছে।
এর কোনোটিই সম্ভবত চূড়ান্ত সংস্করণ নয়। 2023 থেকে Turnitin একাধিকবার তার threshold, visibility rules এবং model coverage পুনর্লিখন করেছে, এবং August 2026-ও শেষ কথা হবে না। যা স্থির থাকে তা হলো, যে detector-ই কোনো নির্দিষ্ট course ব্যবহার করুক না কেন, অনুসরণ করার মতো অভ্যাসটি: যথেষ্ট নির্দিষ্ট, অসম, সত্যিই আপনার নিজের এমন বিবরণসহ লিখুন, যাতে কোনো classifier কী ভাবল তা গুরুত্বহীন হয়ে যায়।
Frequently Asked Questions
Turnitin-এর AI লেখার indicator ঠিক এই প্রশ্নের উত্তর দেওয়ার জন্যই আছে। Turnitin কি ChatGPT শনাক্ত করতে পারে? সাধারণত, হ্যাঁ, যখন কোনো নথিতে উল্লেখযোগ্য AI লেখা থাকে, classifier এমন গদ্য চিহ্নিত করে যা ভাষা মডেলের পরিসংখ্যানগতভাবে সাধারণ লেখার মতো দেখায়, এবং Turnitin-এর নিজস্ব তথ্য দেখায় যে এখন স্ক্যান করা প্রবন্ধের প্রায় 15 শতাংশকে ব্যাপকভাবে AI-লিখিত হিসেবে স্কোর করা হয়। এটি নিয়মিতভাবেও লেখা মিস করে, এবং স্বাধীন পরীক্ষায় দেখা গেছে paraphrased AI লেখায় নির্ভুলতা 63 শতাংশে নেমে এসেছে এবং hybrid text-এ 43 শতাংশে নেমে এসেছে।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.