AI Detection

একটি ভালো Turnitin স্কোর কী?

Turnitin কোনো গ্রহণযোগ্য similarity percentage প্রকাশ করে না, এবং প্রতিষ্ঠানগুলো নিজেদের নির্দেশনা নির্ধারণ করে। এই পোস্টে ব্যাখ্যা করা হয়েছে কোন বিষয়গুলো আসলে উচ্চ বা নিম্ন স্কোর তৈরি করে, কেন উদ্ধৃত উপাদান এবং reference list কোনো ভুল না থাকলেও স্কোর বাড়িয়ে দেয়, এবং সংখ্যাটির বদলে সংখ্যার পেছনের match breakdown কীভাবে পড়তে হয়।

6 min
What is a good Turnitin score? A similarity report broken into matched sources rather than one number.

একজন শিক্ষার্থীকে একজন সুপারভাইজার বলেন যে পনেরো শতাংশের নিচে যেকোনো কিছুই ঠিক আছে। একই বিভাগে থাকা আরেকজন শিক্ষার্থীর পেপার করিডোরের শেষে বারো শতাংশে চিহ্নিত হয়, কারণ সেই অংশের তিনটি পয়েন্ট একটি অবিচ্ছিন্ন অনুচ্ছেদের মধ্যে পড়ে, আর তার কাছে কোনো উদ্ধৃতি চিহ্ন নেই। উভয়েই Turnitin-এর similarity score সঠিকভাবে পড়ে। এই টুলটি শুরু থেকেই একক pass বা fail সংখ্যা দেওয়ার জন্য তৈরি করা হয়নি।

তাহলে একটি ভালো Turnitin score কী? এমন কোনো সংখ্যা নেই। Turnitin কোনো গ্রহণযোগ্য শতাংশ প্রকাশ করে না, কোনো জমা দেওয়া কাজকে গ্রেড করে না, এবং স্পষ্টভাবে বলে যে এই সংখ্যা একা plagiarism-এর পরিমাপ নয়। প্রতিটি প্রতিষ্ঠান নিজের নির্দেশনা নির্ধারণ করে, এবং অনেক সময় তার ভেতরের প্রতিটি supervisor-ও তাই করে, এ কারণেই একই report এক অফিসে তেমন কিছু মনে না হলেও পরের অফিসে উদ্বেগজনক দেখাতে পারে। শেখার মতো সংখ্যা হলো এর পেছনে কী আছে, তা কীভাবে পড়তে হয়।

একটি ভালো Turnitin score কী?

Turnitin কখনো এমন কোনো সংখ্যা প্রকাশ করেনি যা good, safe বা acceptable হিসেবে গণ্য হয়, এবং এর একটি নির্দিষ্ট কারণ আছে: similarity score মাপে একটি submission-এর কতটা text Turnitin-এর databases-এর ভেতরে আগে থেকেই থাকা text-এর সঙ্গে মেলে, overlapটি অনুচিতভাবে ব্যবহার করা হয়েছিল কি না, তা নয়। একটি উচ্চ score পুরোপুরি এমন material থেকেও আসতে পারে যা সঠিকভাবে উদ্ধৃত এবং cited করা হয়েছে। একটি নিম্ন score এমন একটি paper-এর চেয়েও বেশি হতে পারে যা একটি source-কে এত কাছ থেকে paraphrase করেছে যে একজন examiner-এর কাছে তা সমস্যাজনক মনে হতে পারে, অথচ matching engine একেবারেই সক্রিয় হয় না। সংখ্যাটিকে grade হিসেবে পড়লে toolটির উদ্দেশ্য উল্টে যায়।

দশ থেকে বিশ শতাংশের মতো একটি figure অনানুষ্ঠানিক thumb rule হিসেবে ব্যাপকভাবে প্রচলিত, forum এবং study guide জুড়ে তা বারবার বলা হয়, যতক্ষণ না এটি official শোনাতে শুরু করে। এটি official নয়। Turnitin এমন কোনো figure নির্ধারণ করে না, এবং document length, citation density এবং field convention উপেক্ষা করা একটি thumb rule বাস্তব paper-এর মুখোমুখি হলেই ভেঙে পড়ে। ত্রিশটি সঠিকভাবে উদ্ধৃত source থেকে তৈরি একটি literature review কেবল quotation-এর ভিত্তিতেই বিশ শতাংশের বেশি হতে পারে। quotation marks ছাড়া একটি মাত্র ঘনিষ্ঠভাবে paraphrase করা অনুচ্ছেদ পাঁচ শতাংশের নিচে থাকতে পারে, তবু সেটিই বেশি গুরুতর সমস্যা হতে পারে।

similarity score আসলে কী মাপে

Turnitin নিজস্ব টুলটিকে প্রায় ঠিক এই শব্দেই বর্ণনা করে। Boise State University-এর নির্দেশনা, Turnitin-এর নিজস্ব ভাষার ওপর ভিত্তি করে, ব্যাখ্যা করে যে similarity score হলো এমন একটি শতাংশ, যা কোনো প্রবন্ধের বিষয়বস্তুর কতটা অংশ Turnitin-এর ডাটাবেসে ইতিমধ্যে থাকা উপাদানের সঙ্গে মিলে যায় তা দেখায়, এবং এই শতাংশ নিজে থেকে প্রবন্ধটিতে plagiarized উপাদান আছে কি না, তার কোনো মূল্যায়ন নয়। এই পার্থক্যটি বাস্তব কাজ করছে, মিল খোঁজা একটি যান্ত্রিক প্রক্রিয়া, যেখানে শব্দের একটি সারি অন্য কোথাও শব্দের আরেকটি সারির সঙ্গে মিলে যায়, আর সেই ওভারল্যাপ যথাযথভাবে স্বীকৃত হয়েছে কি না তা নির্ধারণ করতে একজন মানুষ লাগে, কোনো algorithm নয়।

মিলের পেছনের ডাটাবেসগুলো ইচ্ছাকৃতভাবেই বিস্তৃত, বর্তমান ও সংরক্ষিত student submissions, open web, এবং academic publications-এর একটি বড় ভাণ্ডার। এই কোনো বিষয়বস্তুকেই অর্থের জন্য পড়া হয় না। systemটি ওভারল্যাপ করা শব্দের সারি খুঁজে বের করে এবং submission-এর কতটা অংশ সেগুলো আচ্ছাদন করে তা জানায়, এ কারণেই উদ্ধৃত একটি বাক্য এবং নীরবে কপি করা একটি বাক্য একই ধরনের match তৈরি করতে পারে। শুধু report-এর detail view-ই দেখায় কোনটি কোনটি।

কেন একটি উচ্চ score সম্পূর্ণভাবে বৈধ হতে পারে

academic writing-এর দুটি সাধারণ বৈশিষ্ট্য এর বেশির ভাগ ব্যাখ্যা করে। উদ্ধৃত অংশগুলো উদ্দেশ্য অনুযায়ী match করে, কারণ শব্দগুলো ইচ্ছাকৃতভাবে কপি করা হয় এবং পাতায় অন্য কারও বলে চিহ্নিত করা হয়। reference list-ও একইভাবে নির্ভরযোগ্যভাবে match করে, কারণ author names, journal titles এবং citation formats একই sources উদ্ধৃত করা হাজার হাজার অন্য প্রবন্ধে বারবার দেখা যায়। দুটিই হলো সঠিক academic writing-এর প্রত্যাশিত রূপ।

পাশাপাশি রাখলে, একটি inflated score এবং একটি প্রকৃত সমস্যা এক নজরেই আলাদা দেখায়।

কী মিলে গেছেকেন এমন হয়েছেআরও কাছ থেকে দেখার মতো?
উদ্ধৃতি চিহ্নসহ একটি উদ্ধৃত অংশ এবং একটি উদ্ধৃতিশব্দগুলো ইচ্ছাকৃতভাবে অনুলিপি করা হয়েছিল এবং পাতায় স্বীকৃতি দেওয়া হয়েছিলনা, সঠিক উদ্ধৃতি এমনই দেখায়
একটি রেফারেন্স তালিকা বা গ্রন্থপঞ্জিলেখকের নাম, জার্নালের শিরোনাম এবং উদ্ধৃতি বিন্যাস বহু অন্য প্রবন্ধে পুনরাবৃত্ত হয়না, যদি না বর্জন সেটিং প্রয়োগ করা না হয়ে থাকে
মানক পদ্ধতি বা প্রক্রিয়াগত বাক্যবিন্যাসএকটি ক্ষেত্রের অভিন্ন শব্দভান্ডার একই প্রক্রিয়াকে বিভিন্ন প্রবন্ধে একইভাবে বর্ণনা করেবিরলভাবে, যদি না পুরো অংশটি নতুন করে লেখা না হয়ে তুলে নেওয়া হয়
উদ্ধৃতি চিহ্ন ছাড়া একটি দীর্ঘ, অবিচ্ছিন্ন অনুচ্ছেদ, যা একটি একক উৎসের সঙ্গে মিলে যায়বাক্যগঠনটি অন্য লেখকের বাক্যের সঙ্গে যথেষ্ট ঘনিষ্ঠভাবে মিলে যায়, যাতে matching engine তা ধরতে পারেহ্যাঁ, এটি সেই ধরন, যা যাচাই করতে উৎসটি খুলে দেখা উচিত

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

কেন একটি নিম্ন স্কোর তবু একটি সমস্যা আড়াল করতে পারে

একটি নিম্ন সংখ্যা যতটা মনে হয়, তার চেয়ে সংকীর্ণ একটি প্রশ্নের উত্তর দেয়, তা হলো, সামান্য পাঠ্য Turnitin-এর ডেটাবেসের সঙ্গে শব্দে শব্দে মিলে যায় কি না, এর বেশি কিছু নয়। এমন একটি paraphrase, যা অন্য লেখকের কাঠামো ও যুক্তি অক্ষুণ্ণ রেখে যথেষ্ট শব্দ পরিবর্তন করে, প্রায় শূন্যের কাছাকাছি স্কোর পেতে পারে এবং তবু একটি গুরুতর integrity সমস্যা হতে পারে, কারণ engine শব্দের string-এর ওপর কাজ করে, ধার করা ধারণার ওপর নয়। অনূদিত বিষয়বস্তু, অথবা Turnitin-এর indexed databases-এর বাইরে থেকে আসা উপাদান, একইভাবে আচরণ করে, মেলানোর মতো কিছু নেই, flag করার মতোও কিছু নেই।

জাল উৎস ভিন্ন দিক থেকে একই blind spot তৈরি করে। যে reference অস্তিত্বই নেই, তা কোনো কিছুর সঙ্গেই মেলাতে পারে না, কারণ তার সঙ্গে মেলানোর মতো কোথাও কিছুই নেই, এবং একটি similarity score-এর পক্ষে এমন একটি citation flag করার কোনো উপায় নেই, যা প্রথম স্থানেই কখনো বাস্তব ছিল না। TextPulse-এর free AI citation checker ঠিক এই ফাঁকটির জন্যই আছে: এটি একটি reference list-এর প্রতিটি entry-কে সেই প্রকৃত registries-এর সঙ্গে মেলায়, যেখানে ওই sources-গুলোর থাকা উচিত, তার আগে পাঠককে কঠিন উপায়ে সেই ফাঁক খুঁজে বের করতে হয়।

সংখ্যাটিকে সম্পূর্ণভাবে অতিক্রম করার আগে আরেকটি পার্থক্য উল্লেখ করা প্রয়োজন। কম similarity score থাকা একটি submission-এ Turnitin-এর পৃথক AI writing indicator-ও থাকতে পারে, যা ভিন্ন ধরনের সমস্যা ধরার জন্য তৈরি ভিন্ন একটি পরিমাপ, এবং এটি এই সাইটের guide to whether Turnitin can actually detect ChatGPT-এ আলোচিত হয়েছে। দুটি percentage একইভাবে গণনা করা হয় না, এবং এই অংশটি কেবল similarity score সম্পর্কেই।

রিপোর্টটি সংখ্যার বদলে কীভাবে পড়তে হবে

মোট সংখ্যার প্রতি প্রতিক্রিয়া দেখানোর আগে match breakdown খুলুন। Turnitin person sources, যা একটি score গঠন করে, সেগুলিকে তাদের অবদানের ক্রমানুসারে সাজাবে। এগারোটি source থেকে প্রত্যেকটি 2 percent করে অবদান রেখে গঠিত 22 percent মোট, একটিমাত্র source থেকে গঠিত মোটের মতো পড়ে না। প্রথম ধরনটি সাধারণত বহু প্রচলিত phrase জুড়ে overlap প্রতিফলিত করে। দ্বিতীয় ক্ষেত্রে সরাসরি দেখা দরকার যে sourceটি আসলে কী বলছে।

Turnitin একই percentage-কে একটি color band-এও সাজায়, যা Loughborough College-এর শিক্ষার্থীদের জন্য নিজস্ব guidance-এ পুনরুত্পাদিত হয়েছে: blue, কোনো matching text না থাকলে, green, one word থেকে 24 percent পর্যন্ত, yellow, 25 থেকে 49, orange, 50 থেকে 74, red, 75 এবং তার উপরে। college-এর নিজস্ব guidance colors কী নয়, সে বিষয়ে স্পষ্ট: similarity checks-এর অর্থ এই নয় যে একটি submission-এ plagiarized material আছে। color একটি report-কে মনোযোগের জন্য সাজায়, রায়ের জন্য নয়।

কোনো institution-এর নিজস্ব settings-এ quotations এবং bibliography count থেকে বাদ দেওয়া হয় কি না, সেটিও যাচাই করা মূল্যবান, কারণ একই submission-এ সেই toggle কীভাবে সেট করা হয়েছে তার ওপর নির্ভর করে 2টি ভিন্ন number পাওয়া যেতে পারে। দৃশ্যমান হলে এর কিছুই জটিল নয়। এটি কেবল তখনই অদৃশ্য থাকে, যখন কেউ report-টি তার প্রথম page-এর পর আর খোলে না।

আপনার score আপনাকে বিস্মিত করলে কী করবেন

প্রতিটি চিহ্নিত উৎসকে সম্মিলিত মোটের প্রতিক্রিয়া না দেখিয়ে আলাদাভাবে আবার খুলুন। যাচাই করুন যে মূল্যায়নাধীন সংস্করণে উদ্ধৃতি এবং গ্রন্থপঞ্জি বাদ দেওয়া হয়েছে কি না, কারণ খসড়া তৈরির সময় একজন শিক্ষার্থী যে সংখ্যা দেখে তা সব সময় সেই একইভাবে কনফিগার করা থাকে না যেভাবে জমা দেওয়ার সময় একজন প্রশিক্ষক দেখেন। যেখানে একটি প্রকৃত অননুমোদিত মিল পাওয়া যায়, সেখানে বাক্যগুলোকে পুনর্লিখন করে matching engine এড়িয়ে যাওয়ার চেষ্টা না করে সরাসরি উদ্ধৃতিটি সংশোধন করুন, কারণ তা কেবল উপসর্গটি সামলায় এবং সমস্যাটিকে জায়গায় রেখেই দেয়।

যদি সংখ্যাটি এখনও একজন তত্ত্বাবধায়ক যা আশা করেন তার সঙ্গে সামঞ্জস্যহীন মনে হয়, তবে সরাসরি জিজ্ঞাসা করুন সেই বিভাগের নিজস্ব রীতি কী। উপরের অংশগুলো ইতিমধ্যেই দেখায় যে পৌঁছানোর জন্য কোনো একক সীমারেখা নেই, তাই উত্তরটি এমন কারও কাছে থাকে যার অ্যাসাইনমেন্টের ওপর স্থানীয় কর্তৃত্ব আছে, আগেভাগে যে শতাংশ কেউ দেখে নিতে পারত তার কাছে নয়। TextPulse-এর free tools collection এমন উদ্ধৃতি ও খসড়া যাচাইগুলো অন্তর্ভুক্ত করে, যা অন্য কারও inbox-এ একটি report পৌঁছানোর আগে চালানো উচিত।

বিভিন্ন tool-এর score পরস্পর বিনিময়যোগ্য নয়, এবং GPTZero কীভাবে কাজ করে তা নিজস্ব পৃষ্ঠায় ব্যাখ্যা করা হয়েছে, সঙ্গে উভয়ের নিচে থাকা perplexity statistic

scoreটি যেমন আচরণ করে, তার কারণ হলো এর নিচে চলা matching-এর ধরন, এবং একই report-এ এর পাশে এখন যে নতুন numberটি রয়েছে, তা ভিন্ন mechanism-এর ওপর কাজ করে, যেটি এই site-এর AI detectors আসলে কীভাবে কাজ করে তার guide সম্পূর্ণভাবে ব্যাখ্যা করে। যেকোনো একটি number-কে verdict হিসেবে পড়া report-এর সেই একমাত্র অংশটি এড়িয়ে যায়, যা পড়ার যোগ্য।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

একটি ভালো Turnitin স্কোর কী? এমন কোনো সংখ্যা নেই। Turnitin কোনো গ্রহণযোগ্য percentage প্রকাশ করে না, এবং similarity score মাপে তার databases-এর সঙ্গে কতটা text মেলে, কতটা plagiarized হয়েছে তা নয়। যথাযথভাবে cited একটি literature review কেবল quotations-এর কারণেই twenty percent-এর বেশি হতে পারে, আর একটি একক unattributed paraphrase five-এর নিচে থাকতে পারে। headline figure নয়, matched sources পড়ুন।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।