AI Detection

একটি ভালো Turnitin স্কোর কী?

Turnitin কোনো গ্রহণযোগ্য similarity percentage প্রকাশ করে না, এবং প্রতিষ্ঠানগুলো তার বদলে নিজেদের নির্দেশনা নির্ধারণ করে। এই পোস্টে ব্যাখ্যা করা হয়েছে, আসলে কী কারণে স্কোর বেশি বা কম হয়, কেন উদ্ধৃত উপাদান এবং reference list কোনো সমস্যা না থাকলেও তা বাড়িয়ে দেয়, এবং সংখ্যাটির বদলে match breakdown কীভাবে পড়তে হয়।

সর্বশেষ আপডেট করা হয়েছে 6 min
What is a good Turnitin score? A similarity report broken into matched sources rather than one number.

একজন শিক্ষার্থীকে একজন সুপারভাইজার বলেন যে পনেরো শতাংশের নিচে যেকোনো কিছুই ঠিক আছে। একই বিভাগে থাকা আরেকজন শিক্ষার্থীর পেপার বারো শতাংশে করিডোরের শেষে চিহ্নিত হয়, কারণ সেই পয়েন্টগুলোর মধ্যে তিনটি একটি একটানা অনুচ্ছেদের মধ্যে পড়ে, যার কাছে কোনো উদ্ধৃতি চিহ্ন নেই। উভয়েই Turnitin-এর similarity score সঠিকভাবে বোঝে। এই টুলটি শুরু থেকেই একক পাস বা ফেল নম্বর দেওয়ার জন্য তৈরি করা হয়নি।

তাহলে একটি ভালো Turnitin score কী? এমন কোনো সংখ্যা নেই। Turnitin কোনো গ্রহণযোগ্য শতাংশ প্রকাশ করে না, কোনো জমা দেওয়া কাজকে নম্বর দেয় না, এবং স্পষ্টভাবে বলে যে এই পরিসংখ্যানটি একা plagiarism-এর পরিমাপ নয়। প্রতিটি প্রতিষ্ঠান নিজের নির্দেশনা নির্ধারণ করে, এবং অনেক সময় তার ভেতরের প্রতিটি সুপারভাইজারও তাই করে, তাই একই রিপোর্ট এক অফিসে তেমন কিছু মনে না হলেও পাশের অফিসে উদ্বেগজনক লাগতে পারে। শেখার মতো সংখ্যা হলো এর পেছনে কী আছে, তা কীভাবে পড়তে হয়।

Turnitin similarity report showing 12% overall similarity with match groups for uncited matches and missing quotations, and top sources split across internet, publications and student papers
12% similarity report match group-এ ভাগ করা হয়েছে, এখানে গুরুত্বপূর্ণ হলো শিরোনামের সংখ্যা নয়, বরং এর কতটা উদ্ধৃতিহীন মেলানো লেখা বনাম উদ্ধৃত ও সূত্রসহ উপাদান।

একটি ভালো Turnitin score কী?

Turnitin কখনোই এমন কোনো সংখ্যা প্রকাশ করেনি যা ভালো, নিরাপদ বা গ্রহণযোগ্য হিসেবে গণ্য হয়, এবং এর একটি নির্দিষ্ট কারণ আছে, similarity score জমা দেওয়া কাজের কতটা লেখা Turnitin-এর ডেটাবেসে আগে থেকেই থাকা লেখার সঙ্গে মেলে তা মাপে, সেই মিলটি অনুচিতভাবে ব্যবহার করা হয়েছিল কি না তা নয়। একটি উচ্চ score পুরোপুরি এমন উপাদান থেকেও আসতে পারে যা সঠিকভাবে উদ্ধৃত ও সূত্রায়িত। একটি নিম্ন score এমন একটি পেপারের চেয়েও বেশি হতে পারে যা একটি উৎসকে এতটাই ঘনিষ্ঠভাবে paraphrase করে যে তা পরীক্ষকের জন্য সমস্যা তৈরি করতে পারে, অথচ matching engine-কে একেবারেই সক্রিয় না-ও করতে পারে। সংখ্যাটিকে grade হিসেবে পড়া টুলটিকে উল্টোভাবে বোঝা।

দশ থেকে বিশ শতাংশের মতো একটি সংখ্যা অনানুষ্ঠানিক thumb rule হিসেবে ব্যাপকভাবে প্রচলিত, ফোরাম ও study guide জুড়ে তা বারবার উদ্ধৃত হয়, যতক্ষণ না তা আনুষ্ঠানিক শোনাতে শুরু করে। এটি আনুষ্ঠানিক নয়। Turnitin এমন কোনো সংখ্যা নির্ধারণ করে না, এবং document length, citation density ও field convention উপেক্ষা করা একটি thumb rule বাস্তব কোনো paper-এর মুখোমুখি হলেই ভেঙে পড়ে। ত্রিশটি যথাযথভাবে উদ্ধৃত source থেকে তৈরি একটি literature review কেবল quotation-এর কারণেই বিশ শতাংশের বেশি যেতে পারে। quotation mark ছাড়া একটি মাত্র ঘনিষ্ঠভাবে paraphrase করা paragraph পাঁচ শতাংশের নিচে থাকতে পারে, তবু সেটিই আরও গুরুতর সমস্যা হতে পারে।

Similarity Score আসলে কী পরিমাপ করে

Turnitin নিজস্ব tool-কে প্রায় ঠিক এই শব্দেই বর্ণনা করে। Boise State University-এর guidance, যা Turnitin-এর নিজস্ব ভাষার ওপর নির্ভর করে, ব্যাখ্যা করে যে similarity score হলো Turnitin-এর database-এ ইতিমধ্যে থাকা material-এর সঙ্গে একটি paper-এর content-এর যে শতাংশ মিলে যায়, এবং এই percentage নিজে থেকে paper-এ plagiarized material আছে কি না তার মূল্যায়ন নয়। এই পার্থক্যটি বাস্তব কাজ করছে, matching হলো যান্ত্রিক, শব্দের একটি string-এর সঙ্গে অন্য কোথাও শব্দের আরেকটি string-এর মিল, আর সেই overlap যথাযথভাবে স্বীকৃত ছিল কি না তা নির্ধারণ করতে algorithm নয়, একজন মানুষ লাগে।

মিল নির্ণয়ের পেছনের database-গুলো ইচ্ছাকৃতভাবেই বিস্তৃত, current ও archived student submission, open web, এবং academic publication-এর একটি বড় corpus। এই content-এর কোনোটিই অর্থের জন্য পড়া হয় না। system overlapping শব্দের string খুঁজে বের করে এবং জানায় যে সেগুলো submission-এর কতটা অংশ জুড়ে আছে, তাই একটি উদ্ধৃত sentence এবং নীরবে কপি করা একটি sentence একই রকম match তৈরি করতে পারে। report-এর detail view-ই কেবল দেখায় কোনটি কোনটি।

উচ্চ score কেন সম্পূর্ণ বৈধ হতে পারে

Academic writing-এর দুটি সাধারণ বৈশিষ্ট্য এর বেশির ভাগ ব্যাখ্যা করে। উদ্ধৃত passage-গুলো নকশাগতভাবেই মিলে যায়, কারণ শব্দগুলো ইচ্ছাকৃতভাবে কপি করা হয় এবং page-এ অন্য কারও বলে চিহ্নিত থাকে। Reference list-ও একইভাবে নির্ভরযোগ্যভাবে মিলে যায়, কারণ author name, journal title এবং citation format একই source উদ্ধৃত করা হাজার হাজার অন্য paper জুড়ে পুনরাবৃত্ত হয়। দুটিই হলো সঠিক academic writing-এর প্রত্যাশিত রূপ।

পাশাপাশি রাখলে, একটি ফুলে ওঠা স্কোর এবং একটি প্রকৃত সমস্যা এক নজরে আলাদা দেখায়।

কী মিলে গেছেকেন এটি ঘটেছেআরও কাছ থেকে দেখার মতো কি?
উদ্ধৃতি চিহ্নসহ একটি উদ্ধৃত অংশ এবং একটি citationশব্দগুলো ইচ্ছাকৃতভাবে কপি করা হয়েছিল এবং পৃষ্ঠায় স্বীকৃতি দেওয়া হয়েছিলনা, সঠিক উদ্ধৃতি এভাবেই দেখায়
একটি reference list বা bibliographyলেখকের নাম, journal titles এবং citation formats বহু অন্য paper জুড়ে পুনরাবৃত্ত হয়না, যদি না exclusion setting প্রয়োগ করা না হয়ে থাকে
মানক methods বা procedural phrasingএকটি field's shared vocabulary একই process-কে paper জুড়ে একইভাবে বর্ণনা করেবিরলভাবে, যদি না পুরো section fresh করে লেখা না হয়ে তুলে নেওয়া হয়
উদ্ধৃতি চিহ্ন ছাড়া একটি দীর্ঘ, অবিচ্ছিন্ন paragraph, যা একটি একক source-এর সঙ্গে মিলে যায়শব্দচয়ন অন্য লেখকের sentence-এর সঙ্গে এতটাই ঘনিষ্ঠভাবে মেলে যে matching engine তা ধরতে পারেহ্যাঁ, source খুলে পরীক্ষা করার মতো pattern এটি

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

কেন একটি কম স্কোরেও সমস্যা লুকিয়ে থাকতে পারে

একটি কম সংখ্যা যতটা মনে হয়, তার চেয়ে সংকীর্ণ একটি প্রশ্নের উত্তর দেয়, তা হলো অল্প text কি Turnitin-এর databases-এর সঙ্গে শব্দে শব্দে মেলে কি না, এর বেশি কিছু নয়। এমন একটি paraphrase, যা অন্য লেখকের structure এবং argument অক্ষুণ্ণ রেখে যথেষ্ট wording বদলে দেয়, প্রায় শূন্য score পেতে পারে এবং তবু একটি গুরুতর integrity problem হতে পারে, কারণ engine words-এর strings-এর ওপর কাজ করে, ধার করা ideas-এর ওপর নয়। translated content, বা Turnitin-এর indexed databases-এর বাইরে থাকা material, একইভাবে আচরণ করে, মেলানোর মতো কিছু নেই, flag করার মতোও কিছু নেই।

কৃত্রিমভাবে তৈরি উৎসগুলো ভিন্ন দিক থেকে একই অন্ধস্থান তৈরি করে। যে রেফারেন্সের অস্তিত্বই নেই, তা কিছুর সঙ্গেই মেলানো যায় না, কারণ তার সঙ্গে মেলানোর মতো কোথাও কিছুই নেই, এবং similarity score-এর পক্ষে এমন একটি উদ্ধৃতি চিহ্নিত করার কোনো উপায় নেই, যা শুরু থেকেই বাস্তব ছিল না। TextPulse-এর free AI citation checker ঠিক এই ফাঁকটির জন্যই আছে, এটি পাঠককে সেই ফাঁকটি কঠিন উপায়ে খুঁজে বের করতে হওয়ার আগে, reference list-এর প্রতিটি entry-কে সেই প্রকৃত registry-এর সঙ্গে মিলিয়ে দেখে, যেখানে ওই source-গুলো থাকার কথা।

সংখ্যাটিকে পুরোপুরি অতিক্রম করার আগে আরেকটি পার্থক্য স্পষ্ট করা প্রয়োজন। কম similarity score থাকা একটি submission-এ Turnitin-এর পৃথক AI writing indicator-ও থাকতে পারে, এটি ভিন্ন ধরনের সমস্যা ধরার জন্য তৈরি ভিন্ন একটি পরিমাপ, যা এই সাইটের guide to whether Turnitin can actually detect ChatGPT-এ আলোচিত হয়েছে। এই দুই শতাংশ একইভাবে গণনা করা হয় না, এবং এই অংশটি কেবল similarity score নিয়েই।

সংখ্যার বদলে প্রতিবেদনটি কীভাবে পড়তে হবে

match breakdown খুলে দেখার আগে মোট সংখ্যার প্রতি প্রতিক্রিয়া দেখাবেন না। Turnitin person sources-গুলোকে, যা একটি score তৈরি করে, এতে তাদের অবদানের ক্রমানুসারে সাজাবে। এগারোটি source থেকে প্রতিটি 2 percent করে অবদান নিয়ে তৈরি 22 percent মোট, একটিমাত্র source থেকে তৈরি মোটের মতো পড়ে না। প্রথম ধরনটি সাধারণত বহু প্রচলিত বাক্যাংশের মধ্যে overlap প্রতিফলিত করে। দ্বিতীয়টির ক্ষেত্রে সেই source আসলে কী বলছে, তা সরাসরি দেখা মূল্যবান।

Turnitin একই percentage-কে একটি color band-এও সাজায়, যা Loughborough College-এর শিক্ষার্থীদের জন্য নিজস্ব নির্দেশনায় পুনরুত্পাদিত হয়েছে: কোনো matching text না থাকলে blue, one word থেকে 24 percent পর্যন্ত green, 25 থেকে 49-এ yellow, 50 থেকে 74-এ orange, 75 এবং তার উপরে red। college-এর নিজস্ব নির্দেশনা colors-গুলো কী নয়, সে বিষয়ে স্পষ্ট: similarity checks-এর অর্থ এই নয় যে একটি submission-এ plagiarized material আছে। color একটি report-কে মনোযোগের জন্য সাজায়, রায়ের জন্য নয়।

কোনো প্রতিষ্ঠানের নিজস্ব সেটিংসে উদ্ধৃতি এবং গ্রন্থপঞ্জি গণনার বাইরে রাখা হয় কি না, সেটিও যাচাই করা উচিত, কারণ একই জমা দেওয়া কাজ টগলটি কীভাবে সেট করা আছে তার ওপর নির্ভর করে দুটি ভিন্ন সংখ্যা দিতে পারে। এগুলোর কোনোটিই জটিল নয়, একবার দৃশ্যমান হলে। এটি কেবল তখনই অদৃশ্য থাকে, যখন কেউ প্রতিবেদনটি তার প্রথম পৃষ্ঠার পর পর্যন্ত খোলে না।

আপনার স্কোর আপনাকে অবাক করলে কী করবেন

সমষ্টিগত মোটের প্রতি প্রতিক্রিয়া দেখানোর বদলে, চিহ্নিত প্রতিটি উৎস আলাদাভাবে আবার খুলুন। যাচাই করুন, মূল্যায়নাধীন সংস্করণে উদ্ধৃতি এবং গ্রন্থপঞ্জি বাদ দেওয়া হয়েছে কি না, কারণ খসড়া তৈরির সময় একজন শিক্ষার্থী যে সংখ্যা দেখে, তা জমা দেওয়ার সময় একজন শিক্ষক যে সংখ্যা দেখেন তার সঙ্গে সবসময় একইভাবে কনফিগার করা থাকে না। যেখানে সত্যিকারের অননুমোদিত মিল পাওয়া যায়, সেখানে বাক্য পুনর্লিখন করে matching engine এড়িয়ে যাওয়ার চেষ্টা না করে সরাসরি উদ্ধৃতিটি সংশোধন করুন, কারণ তা উপসর্গটি সামলায়, কিন্তু সমস্যাটি রেখে দেয়।

সংখ্যাটি যদি এখনও কোনো তত্ত্বাবধায়কের প্রত্যাশার সঙ্গে অসামঞ্জস্য মনে হয়, তাহলে সরাসরি জিজ্ঞাসা করুন, সেই বিভাগের নিজস্ব রীতি কী। উপরের অংশগুলো ইতিমধ্যেই দেখিয়েছে যে পৌঁছানোর জন্য কোনো একক সীমারেখা নেই, তাই উত্তরটি থাকে এমন কারও কাছে, যার কাছে অ্যাসাইনমেন্ট সম্পর্কে স্থানীয় কর্তৃত্ব আছে, আগেভাগে দেখে নেওয়া যেত এমন কোনো শতাংশের কাছে নয়। TextPulse-এর free tools collection উদ্ধৃতি এবং খসড়া তৈরির সেই যাচাইগুলো অন্তর্ভুক্ত করে, যা কোনো প্রতিবেদন অন্য কারও ইনবক্সে পৌঁছানোর আগে চালানো উচিত।

বিভিন্ন টুলের স্কোর পরস্পরের সঙ্গে বিনিময়যোগ্য নয়, এবং GPTZero কীভাবে কাজ করে তা নিজস্ব পাতায় ব্যাখ্যা করা হয়েছে, সঙ্গে আছে উভয়ের নিচে থাকা perplexity পরিসংখ্যান

স্কোরটি যেভাবে আচরণ করে, তা তার নিচে চলা matching-এর পদ্ধতির কারণে, এবং একই প্রতিবেদনে তার পাশে এখন যে নতুন সংখ্যা বসানো আছে, তা ভিন্ন একটি প্রক্রিয়ায় কাজ করে, যেটি এই সাইটের AI detectors আসলে কীভাবে কাজ করে, সে বিষয়ে নির্দেশিকা সম্পূর্ণভাবে ব্যাখ্যা করে। এই দুই সংখ্যার যেকোনো একটিকে রায় হিসেবে পড়া মানে প্রতিবেদনের যে অংশটি পড়ার মতো, সেটিকেই এড়িয়ে যাওয়া।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

একটি ভালো Turnitin স্কোর কী? এমন কোনো সংখ্যা নেই। Turnitin কোনো গ্রহণযোগ্য percentage প্রকাশ করে না, এবং similarity score মাপে তার databases এর সঙ্গে কতটা লেখা মিলে, কতটা plagiarized হয়েছে তা নয়। সঠিকভাবে cited একটি literature review কেবল quotations থেকেই twenty percent ছাড়িয়ে যেতে পারে, আর একটি মাত্র unattributed paraphrase five percent এর নিচে থাকতে পারে। headline figure নয়, matched sources পড়ুন।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।