AI Detection

Turnitin কি paraphrased text শনাক্ত করতে পারে?

হ্যাঁ, Turnitin paraphrased text শনাক্ত করে, এবং এটি সেই উদ্দেশ্যেই তৈরি। এর similarity engine reworded passages শনাক্ত করে যেগুলো published এবং previously submitted work-এর সঙ্গে এখনও overlap করে, এবং এর AI writing report-এ AI-generated text-এর জন্য একটি labelled category আছে, যা paraphrasing tool বা word spinner দিয়ে সংশোধিত। এখানে দেখানো হলো প্রতিটি system কীভাবে এটি শনাক্ত করে, এবং কেন synonyms দিয়ে শব্দ বদলালে কোনোটিই এড়ানো যায় না.

9 min
Diagram answering can Turnitin detect paraphrased text, comparing similarity matching against the AI writing indicator

হ্যাঁ। Turnitin paraphrased text শনাক্ত করে, এবং সেটি করার জন্যই এটি তৈরি করা হয়েছে। একই প্রতিবেদনের ভেতরে থাকা দুটি সিস্টেম এটি ধরে। Similarity Report এমন অংশ চিহ্নিত করে যেগুলি শব্দচয়ন বদলানোর পরও প্রকাশিত কাজ বা আগে জমা দেওয়া পত্রের সঙ্গে এখনও ওভারল্যাপ করে, এবং AI লেখা অস্তিত্বে আসার অনেক আগ থেকেই এটি তার কাজ। AI Writing Report-এর নিজস্ব লেবেলযুক্ত শ্রেণি আছে AI-generated text-এর জন্য, যা paraphrasing tool বা word spinner-এর মাধ্যমে চালানো হয়েছে। সমার্থক শব্দ বসিয়ে শব্দ বদলালে কোনোটিই পরিষ্কার হয় না।

কোন সিস্টেম একটি নির্দিষ্ট অংশ ধরবে, তা নির্ভর করে লেখাটি কোথা থেকে এসেছে তার উপর। কোনো উৎস থেকে তুলে এনে পুনর্লিখিত উপাদান একটি similarity সমস্যা। ChatGPT দ্বারা তৈরি পুনর্লিখিত উপাদান একটি AI writing সমস্যা। অনেক জমা দেওয়া কাজ একসঙ্গে দুটিই হয়, এবং যাই হোক, উভয় সিস্টেমই প্রতিটি জমা পড়া কাজ পড়ে।

Turnitin Paraphrased AI Text-কে নিজস্ব শ্রেণি হিসেবে চিহ্নিত করে

এটি detectors কীভাবে কাজ করে, সে বিষয়ে সাধারণ কোনো অনুমান নয়। Turnitin-এর AI Writing Report তার শতাংশকে দুটি লেবেলযুক্ত শ্রেণিতে ভাগ করে, এবং দ্বিতীয়টি হলো paraphrased AI text।

Turnitin AI Writing Overview page listing two categories: AI-generated only, described as likely AI-generated text from a large-language model, and AI-generated text that was AI-paraphrased, described as likely AI-generated text that was likely revised using an AI-paraphrase tool or word spinner
Turnitin-এর AI Writing Overview, যেখানে paraphrase শ্রেণিটি নিজস্ব product-এ মুদ্রিত আছে। শিরোনামের শতাংশটি উভয় লাইনকে একত্র করে, এবং দ্বিতীয়টি AI paraphraser বা word spinner দিয়ে সংশোধিত লেখাকে অন্তর্ভুক্ত করে।

প্রতিবেদনটি তার শিরোনামসংখ্যাকে সংজ্ঞায়িত করে "the combined amount of likely AI-generated text as well as likely AI-generated text that was also likely AI-paraphrased" হিসেবে। দ্বিতীয় line item-টি "AI-generated text that was AI-paraphrased" নামে লেবেল করা, এবং এটিকে "likely AI-generated text that was likely revised using an AI-paraphrase tool or word spinner" হিসেবে বর্ণনা করা হয়েছে।

Turnitin-এর support documentation প্রশ্নটির উত্তর স্পষ্টভাবে দেয়। সরাসরি জিজ্ঞাসা করা হলে, এটি কি AI paraphrasing tool দিয়ে paraphrase করা বিষয়বস্তু শনাক্ত করতে পারে, তার নির্দেশনায় বলা হয়েছে: "Yes, Turnitin's AI indicator includes detection of AI-generated content that may have been paraphrased using a word spinner/AI paraphrasing tool." প্রায় একই ধরনের একটি উত্তর এমন পাঠ্যের ক্ষেত্রেও প্রযোজ্য, যা একটি bypasser tool দিয়ে চালানো হয়েছে, যা বিশেষভাবে AI output কে detector-এর পাশ কাটিয়ে পুনর্লিখনের জন্য তৈরি। কোনোটিই আলাদা score তৈরি করে না। উভয়ই একই একক percentage-এ যুক্ত হয়, যা একজন instructor দেখেন।

প্রতিটি system কী ধরে

Similarity ReportAI Writing Report
What it checksWhether the text overlaps sources already in Turnitin's database of web content, publications and student papersWhether the prose reads as statistically typical of machine-generated writing
Catches paraphrasing ofSomeone else's published or submitted workAI-generated drafts, including ones revised by a paraphraser or bypasser
Effect of a synonym passLowers the percentage, but leaves distinctive terms, quotations and sentence structure matchingLeaves the score largely where it was, because the classifier reads sentence pattern rather than word choice
Where it shows upA percentage plus match groups naming each sourceOne percentage, split into AI-generated only and AI-paraphrased

এই দুই report পৃথক product, এবং এদের সংখ্যা আলাদা, ফলে একটি paper একটিতে clean হতে পারে এবং অন্যটিতে flagged হতে পারে। TextPulse এই বিভাজনটি সম্পূর্ণভাবে ব্যাখ্যা করেছে তার Turnitin's similarity score against its AI score-এর তুলনা এবং classifier-এর নিজস্ব কার্যপ্রণালী how Turnitin detects AI writing-এ।

আপনার নিজস্ব পেপারকে মানবসদৃশ করুন

আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।

বিনামূল্যে শুরু করুন

Similarity দিক: পুনর্লিখিত text তবু overlap করে

সাদৃশ্য পরীক্ষা একটি মিল খোঁজার প্রক্রিয়া। Turnitin একটি জমা দেওয়া লেখা তার ওয়েব বিষয়বস্তু, প্রকাশনা এবং পূর্বে জমা দেওয়া প্রবন্ধের ভান্ডারের সঙ্গে তুলনা করে, এবং জানায় এর কতটা অংশ ইতিমধ্যে সূচিকৃত কোনো কিছুর সঙ্গে মিলে যায়। যথেষ্ট শব্দচয়ন বদলালে তুলনা করা সুনির্দিষ্ট স্ট্রিংগুলো ছোট হয়ে যায়, ফলে শতাংশ কমে। এটি বাস্তব, এবং এই কারণেই paraphrasing tools আছে।

এই অদলবদলের পরও যা টিকে থাকে, সেটিই শিক্ষার্থীরা কম গুরুত্ব দেয়। প্রযুক্তিগত পরিভাষা, সঠিক নাম, উদ্ধৃত তথ্য এবং সরাসরি উদ্ধৃতি অপরিবর্তিত থাকে, কারণ এগুলোর কোনো সমার্থক নেই। বাক্যগঠনও একই থাকে, যখন কেবল সংযোগকারী শব্দগুলো বদলানো হয়। Turnitin ওভারল্যাপকে match groups হিসেবে দেখায়, প্রতিটিতে তার উৎসের নাম থাকে, আর এটাই যথাযথভাবে উদ্ধৃত একটি অংশকে পুনর্লিখিত অংশ থেকে আলাদা করে।

Turnitin similarity report showing 12% overall similarity broken into match groups: 115 matches not cited or quoted at 9%, and 41 matches with missing quotations at 3%, with top sources listed across internet, publications and student papers
একটি similarity report তার শতাংশকে match groups এ ভাগ করে। 115টি "not cited or quoted" মিলই সেগুলো, যেগুলো উদ্ধৃত বক্তব্যের বদলে পুনর্লিখিত বা ধার করা উপাদান হিসেবে পড়ে।

কোনো উৎসের বাক্যক্রম এবং সহায়ক বিবরণ বজায় রেখে তাকে পুনর্লিখন করাকে patchwriting বলা হয়, এবং similarity percentage কমলেও অধিকাংশ বিশ্ববিদ্যালয় নীতিতে এটিকে plagiarism এর একটি রূপ হিসেবে গণ্য করা হয়। এটি শনাক্ত করতে প্রশিক্ষিত মূল্যায়কেরা প্রায়ই চোখে দেখে ধরে ফেলেন, কারণ একটি যুক্তি যদি উৎসের অনুচ্ছেদকে বাক্য ধরে ধরে অনুসরণ করে, তবে শব্দভান্ডার যাই হোক না কেন তা একই রকম পড়ে। কম সংখ্যা মানেই পরিষ্কার কাজ নয়, এবং এটাই TextPulse এর what counts as a good Turnitin score নির্দেশিকার মূল কথা।

AI দিক: একটি synonym pass স্কোর বদলায় না

AI লেখার সূচকটি কখনও আপনার অনুচ্ছেদকে কোনো উৎসের সঙ্গে তুলনা করেনি, তাই প্রতিশব্দ বদলে ভাঙার মতো কোনো মিল নেই। এটি গদ্যকে বাক্য ধরে ধরে স্কোর করে, দেখে সেটি যন্ত্র-উৎপাদিত লেখার পরিসংখ্যানগত বিন্যাসের সঙ্গে কতটা মেলে, শব্দের পূর্বানুমেয়তা, বাক্যের ছন্দ, এবং ভাষা মডেল ডিফল্টভাবে যে সাধারণ বাক্যাংশের দিকে যায় সেগুলি।

শব্দ বদলালে এর প্রায় সবটাই অপরিবর্তিত থাকে। বাক্যটি তার দৈর্ঘ্য, তার ক্রম, এবং উপবাক্যগুলির মধ্যে একই প্রচলিত সংযোগকারী কাঠামো বজায় রাখে। এই কারণেই কোনো AI খসড়াকে paraphrasing tool দিয়ে চালিয়ে AI স্কোর অপরিবর্তিত থাকতে দেখা এত সাধারণ অভিজ্ঞতা। শব্দভান্ডার বদলেছে। classifier যে বিন্যাস স্কোর করে তা বদলায়নি, তাই পাঠ্যটি এখনও যন্ত্র-লিখিত হিসেবেই পড়া হচ্ছে, ঠিক যেমন Turnitin-এর paraphrase category বলে যে তা হওয়া উচিত।

বাক্যের দৈর্ঘ্যের বণ্টন পুনর্লিখন টিকে থাকে

যন্ত্রে খসড়া করা গদ্য বাক্যের দৈর্ঘ্যের একটি সংকীর্ণ পরিসরে স্থিত হয়, কারণ একবারে একটি token পূর্বানুমান করা model-এর পক্ষে sentence four-কে sentence three-এর চেয়ে ছোট করার কোনো কারণ নেই। মানব লেখায় এর বদলে ছড়িয়ে থাকে, একটি উনিশ-শব্দের বাক্য, তারপর একটি ছয়-শব্দের বাক্য, তারপর একটি বত্রিশ-শব্দের বাক্য, যা একটি দাবি এবং তার সীমাবদ্ধতাকে একসঙ্গে বহন করে। GPTZero-এর নিজস্ব ব্যাখ্যায় এটি সরাসরি বলা হয়েছে, যেখানে burstiness-কে এমন একটি পরিমাপ হিসেবে সংজ্ঞায়িত করা হয়েছে যা দেখায় একটি নথিজুড়ে লেখার বিন্যাস এবং text perplexities কতটা পরিবর্তিত হয়।

একটি প্রতিশব্দ বদল একটি বাক্যের দৈর্ঘ্য এক বা দুই শব্দ সরায়, এবং প্রতিটি বাক্যকেও অনুরূপভাবে সামান্য পরিমাণে সরায়, ফলে বণ্টন তার আকার বজায় রাখে। একটি অনুচ্ছেদ যা একটি pass-এর আগে আঠারো, উনিশ, সতেরো এবং বিশ শব্দে চলছিল, paraphrase pass-এর পরে সেটিই এক বা দুই শব্দের মধ্যে সেই একই সমতল profile-এর কাছাকাছি চলবে।

এটি detector-এর কাছে না গিয়েও পরিমাপ করা যায়। একটি free burstiness checker কোনো অংশে বাক্য-স্তরের কতটা বৈচিত্র্য আছে তা জানায়, এবং একই অনুচ্ছেদকে paraphrase pass-এর আগে ও পরে এর মধ্যে চালালে দেখা যায় শব্দভান্ডার সম্পূর্ণ বদলালেও সংখ্যাটি প্রায় নড়ে না।

উপবাক্যের ক্রম এবং transition-ও টিকে থাকে

Clause order হলো দ্বিতীয় কাঠামোগত বৈশিষ্ট্য, যা একটি paraphraser অপরিবর্তিত রাখে, এবং এটি পাঠকের কাছে sentence length-এর তুলনায় বেশি দৃশ্যমান। Machine prose বারবার topic-কে সামনে আনে, claim-টি বলে, তারপর শেষে একটি qualifying clause জুড়ে দেয়। "While the sample size was limited, the results suggest" এবং "Although further research is needed, the findings indicate" একই sentence, শুধু ভিন্ন শব্দে লেখা।

A paraphrasing tool "while" কে "although" এ এবং "suggest" কে "show" এ রূপান্তর করবে। এটি সিদ্ধান্ত নেবে না যে qualification-টি তিন লাইন পরে নিজের একটি ছোট sentence-এ থাকা উচিত, বা hedge-টি সম্পূর্ণ বাদ দেওয়া উচিত। এটি paragraph কী যুক্তি দিচ্ছে, সে বিষয়ে একটি editorial judgement, এবং একটি substitution engine-এর argument সম্পর্কে কোনো দৃষ্টিভঙ্গি নেই।

Transitions হলো তৃতীয় এবং সবচেয়ে দৃশ্যমান বৈশিষ্ট্য। Models সংযোগস্থলে একটি ছোট, স্থিতিশীল set of connectives-এর দিকে ঝোঁকে, যেমন however, additionally, furthermore, in addition. একটি paraphraser এদের একটিকে একই set-এর অন্য সদস্য দিয়ে বদলে দেয়, ফলে classifier এখনও expected position-এ expected distribution থেকে নেওয়া একটি stock transition দেখে। এটাই সেই signal, যা rewrite শুরু হওয়ার আগেও এটি পড়ছিল।

Feature a classifier readsChanged by a paraphrase passWhy
Individual word choiceYes, substantiallyThe only feature a substitution engine is built to change
Sentence length and its varianceBarelySubstituted words are close in length, so the profile holds
Clause order within a sentenceRarelyReordering changes emphasis, which the meaning constraint discourages
Connectives at the joinsSwapped inside the same small setOne stock transition replaces another stock transition
Predictability of the next wordSlightlyA rarer synonym is less expected, but the frame around it stays as predictable as before
Specific evidence and detailNoA rewrite cannot add material that was never in the draft

ফলাফলকে আসলে কী পরিবর্তন করে

উভয় সিস্টেমই একই অগভীর পুনর্লিখনের ভিন্ন ভিন্ন উপসর্গে প্রতিক্রিয়া জানায়, তাই উভয়ের জন্য সমাধানও একই, লেখাকে বদলাতে হবে, শব্দকে নয়। এর মানে হলো বাক্যের বিষয়বস্তু পুনর্বিন্যাস না করে বাক্যগুলোর গঠন পুনর্নির্মাণ করা, ইচ্ছাকৃতভাবে বাক্যের দৈর্ঘ্যে বৈচিত্র্য আনা, মডেল যে সাধারণ সংযোজকগুলোর ওপর নির্ভর করে সেগুলো বাদ দেওয়া, এবং এমন নির্দিষ্ট সহায়ক বিবরণ যোগ করা যা কেবলমাত্র আপনি বাস্তবে যে উৎস উপাদান পড়েছেন সেখান থেকেই আসতে পারে। সাদৃশ্য কমে, কারণ গঠন আর উৎসকে অনুসরণ করে না। AI স্কোর কমে, কারণ শ্রেণিবিন্যাসকারী যে ধরনকে স্কোর করে, তা আর থাকে না।

একটি paraphrasing tool এই কাজ করতে পারে না, এবং কোনো একটি কেনার আগে এই দুই ধরনের টুলের পার্থক্য বোঝা মূল্যবান, যা TextPulse AI humanizer versus paraphraser এ আলোচনা করে। একটি খসড়ার নিজস্ব শব্দ-স্তরের পূর্বানুমেয়তা free perplexity checker দিয়ে পরীক্ষা করলে, কেবল একটি স্কোরের চেয়ে শ্রেণিবিন্যাসকারী যে ধরনে প্রতিক্রিয়া জানায় তা আরও কার্যকরভাবে দেখা যায়।

TextPulse-এর AI humanizer for students সমস্যার কাঠামোগত দিকটি নিয়ে কাজ করে, পৃথক শব্দ বদলানোর বদলে বাক্যের ছন্দ, দৈর্ঘ্যের বৈচিত্র্য এবং উপবাক্যের ক্রম পুনর্গঠন করে, আর এটাই সেই ফাঁক যা কেবল synonym-ভিত্তিক প্রক্রিয়ায় খোলা থেকে যায়। বিশেষভাবে coursework-এর ক্ষেত্রে, humanizing an AI essay for college শুরু থেকে শেষ পর্যন্ত workflow ব্যাখ্যা করে, এবং whether Turnitin detects DeepSeek ভিন্ন একটি model-এর জন্য একই প্রশ্নের উত্তর দেয়।

এর কোনোটিই কোনো course-এর AI use policy কী অনুমতি দেয় তা বদলায় না, এবং কোনো rewriting approach পরবর্তী পর্যায়ে একটি score নির্ধারণ করে না। কিছু জমা দেওয়ার আগে যে পরীক্ষা প্রয়োগ করা মূল্যবান, তা হলো আপনি কি বাক্য ধরে ধরে ব্যাখ্যা করতে পারেন কেন আপনার সামনে থাকা কাজটি যা বলছে, তা বলছে।

XLinkedInFacebook

সচরাচর জিজ্ঞাসিত প্রশ্ন

হ্যাঁ। এর similarity engine একটি submission-কে web content, publications এবং previously submitted papers-এর সঙ্গে তুলনা করে, তাই reworded passages যেগুলো এখনও কোনো source-এর সঙ্গে overlap করে, সেগুলো distinctive terms, quotations এবং sentence structure-এ matching বজায় রাখে। আলাদাভাবে, এর AI writing report-এ AI-generated text-এর জন্য একটি labelled category আছে, যা একটি AI paraphrasing tool বা word spinner দিয়ে সংশোধিত হয়েছিল, এবং Turnitin-এর নিজস্ব documentation নিশ্চিত করে যে এটি flag করার জন্যই তৈরি।

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI মানবিককরণ সম্পর্কে আপডেট থাকুন

একাডেমিক লেখা, AI শনাক্তকরণ, এবং মানবিককরণ নিয়ে টিপস আপনার ইনবক্সে পান।

স্প্যাম নয়। যেকোনো সময় আনসাবস্ক্রাইব করতে পারেন।