আমার লেখা কি AI-এর মতো শোনায়? একটি স্ব-পরীক্ষা
যে লেখকেরা কাজটি নিজেরাই করেছেন, কিন্তু এখন নিজেদের গদ্য আর শুনতে পাচ্ছেন না, তাদের জন্য একটি স্ব-নির্ণয়। কেন দক্ষ, শেখানো, ব্যাপকভাবে সংশোধিত একাডেমিক লেখা যন্ত্র-উৎপাদিত আউটপুটের মতোই সংকেত দেয়, কোন 5টি বিষয় পরীক্ষা করা মূল্যবান, এবং কোনগুলো নিয়ে ক্ষমা চাওয়া বন্ধ করা উচিত।
আপনি এটি লিখেছেন। চারটি সন্ধ্যা ধরে, ডেস্কের পাশে উৎসগুলো খোলা রেখে, প্রতিটি বাক্য। তারপর একটি checker একটি সংখ্যা ফেরত দেয়, অথবা একজন supervisor বলেন যে বাক্যগঠনটি generated মনে হচ্ছে, এবং আপনি নিজের অনুচ্ছেদটি তিনবার পড়ে দেখেন, তবু আর কিছুই বুঝতে পারেন না।
"Does my writing sound like AI?" একটি নির্দিষ্ট উত্তরের সঙ্গে যুক্ত ন্যায্য প্রশ্ন, এবং যারা এটি জিজ্ঞাসা করেন তাদের অধিকাংশের জন্য উত্তর হলো, লেখাটি সংগঠিত শোনায়। দক্ষ, শেখানো, সম্পাদিত academic prose-এর সঙ্গে machine output-এর পৃষ্ঠতলে অনেক মিল থাকে, কারণ একটি language model দক্ষ, শেখানো, সম্পাদিত prose-এর ওপর প্রশিক্ষিত হয়েছে। এরপর যা আসে তা হলো একটি self-check, আপনি নিজে লেখা একটি draft-এ কী দেখবেন, তা খুঁজে পেলে তার অর্থ কী, এবং এর কতটা ঠিক যেখানে আছে সেখানেই রেখে দেবেন।
মানব রচনা কেন একই সংকেত সৃষ্টি করে
আমাদের কাছে এমন একটি language model আছে, যা সেই লেখার ওপর শেখানো হয়েছে যাকে মানুষ ভালো বলে, published papers, edited journalism, textbooks, documentation। এটি তার গড় রূপটি বের করে, আর সেটাই মোটামুটি সেই জিনিস যা আপনি একটি writing course-এ করতে শেখেন। প্রথম topic sentence। প্রতি অনুচ্ছেদে একটি ধারণা। চিহ্নিত transition। পুরো লেখাজুড়ে consistent register। এগুলোর প্রতিটিই marking criterion, এবং এগুলোর প্রতিটিই detector যে statistical variation মাপে, তা কমিয়ে দেয়।
এই কারণে অন্য যে কারও তুলনায় দুটি গোষ্ঠী বেশি ধরা পড়ে। English-কে second বা third language হিসেবে ব্যবহার করা লেখকদের formal register-ই নিরাপদ register হিসেবে শেখানো হয়, আর formal-ই সেই register যা একটি model default হিসেবে গ্রহণ করে। সতর্ক reviser-রা বিপরীত কারণে ধরা পড়েন, revision variation কমিয়ে দেয়, তাই একটি chapter-এর অষ্টম draft-এ দ্বিতীয় draft-এর তুলনায় মানবসুলভ roughness কম থাকে। এসবের পেছনের mechanics full guide to AI writing patterns-এ আছে, এবং একটি বাক্যও বদলানোর আগে সেটি পড়ে নেওয়া মূল্যবান।
Does My Writing Sound Like AI? এই পাঁচটি পরীক্ষা করুন
পাঁচটি পরীক্ষা, ক্রমানুসারে, আপনার নিজের লেখা একটি draft-এ। প্রতিটি কয়েক মিনিট লাগে এবং কোনোটির জন্যই tool বা account দরকার হয় না।
- বাক্যের দৈর্ঘ্যের বিস্তার। টানা দশটি বাক্যের শব্দসংখ্যা গণনা করুন। যদি সেগুলোর আটটি পনেরো থেকে পঁচিশ শব্দের মধ্যে পড়ে, তবে আপনার পরিসর সংকীর্ণ। অধিকাংশ মানবিক খসড়ায় একটি পৃষ্ঠার কোথাও অন্তত একটি আট শব্দের কমের বাক্য থাকে।
- অনুচ্ছেদের সূচনাগত রূপ। ক্রমানুসারে প্রতিটি অনুচ্ছেদের কেবল প্রথম বাক্যটি পড়ুন। যদি প্রতিটি বাক্য বিষয়বস্তু দেওয়ার আগে অনুচ্ছেদটিকে ঘোষণা করে, তবে রূপটি সমান, এমনকি বিষয়বস্তু সম্পূর্ণ আপনার হলেও।
- ক্রিয়ার নির্দিষ্টতা। আপনার ফলাফল বা অনুসন্ধান অংশে, প্রতিটি প্রধান ক্রিয়ার নিচে দাগ দিন। গণনা করুন, কতটি এমন ক্রিয়া একটি কার্যকে নামকরণ করে যা আপনি বাস্তবে সম্পাদন করেছেন, আর কতটি এমন প্রদর্শনীমূলক ক্রিয়া যা যেকোনো বিষয়ের যেকোনো প্রবন্ধে বসতে পারে।
- আনুষ্ঠানিক শব্দভান্ডারের ঘনত্ব। আপনার তিনটি সবচেয়ে ঘন অনুচ্ছেদ নিন এবং প্রতি শতকে বিমূর্ত আনুষ্ঠানিক শব্দের সংখ্যা গণনা করুন, underscores, showcases, multifaceted, comprehensive। বাস্তব কাজ করে এমন দুটি থাকা সাধারণ একাডেমিক গদ্য। কিছুই না করে এমন পাঁচটি থাকা হলো সেই ধরন।
- নির্দিষ্টতার পরীক্ষা। এমন প্রতিটি বাক্য খুঁজে বের করুন, যা আপনার বিষয়কে অন্য কোনো বিষয় দিয়ে বদলে দিলেও সত্যই থেকে যাবে। সেই বাক্যগুলো পড়ে মনে হয়, যিনিই সেগুলো টাইপ করুন না কেন, সেগুলো তৈরি করা, এবং এটাই সেই কারণ, যার জন্য পাঠক বলেন একটি অনুচ্ছেদ যন্ত্রনির্মিত মনে হয়।
পাঁচ নম্বরটি সবচেয়ে গুরুত্বপূর্ণ, এবং কোনো ডিটেক্টর এটি করে না। যে বাক্য তার বিষয় বদলানোর পরও টিকে থাকে, শুরু থেকেই আপনার বিষয় সম্পর্কে কোনো তথ্য বহন করছিল না। এটাই সেই বৈশিষ্ট্য, যার প্রতি পাঠক প্রতিক্রিয়া দেখায়, এবং এটি এমনভাবে সংশোধনযোগ্য, যেভাবে বাক্যের দৈর্ঘ্য কখনোই হবে না।
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
কী পরিবর্তন করবেন, আর কী ঠিক যেমন আছে তেমনই রেখে দেবেন
নিজেদের গদ্য নিয়ে মানুষকে সবচেয়ে বেশি যে বিষয়টি উদ্বিগ্ন করে, তার অধিকাংশই অক্ষত রাখা উচিত। সংগঠন কোনো ত্রুটি নয়, এবং একটি পরিচ্ছন্ন পৃষ্ঠ কোনো কিছুর প্রমাণ নয়। সারণিটি সাধারণ সংকেতগুলোকে ভাগ করে সেইগুলোর মধ্যে, যেগুলোর ওপর কাজ করা উচিত, এবং সেইগুলোর মধ্যে, যেগুলোর জন্য আর ক্ষমা চাওয়া বন্ধ করা উচিত।
| আপনি যা লক্ষ্য করেছেন | আপনার নিজের লেখা কেন এমন করে | এটি বদলান নাকি রেখে দিন |
|---|---|---|
| অনুচ্ছেদগুলোর দৈর্ঘ্য প্রায় একই | আপনি একটি কাঠামো মেনে খসড়া করেছেন, তারপর শব্দসীমা অনুযায়ী সম্পাদনা করেছেন | এটি রেখে দিন। দৈর্ঘ্যকে যুক্তির অনুসরণ করা উচিত, আর কখনও কখনও যুক্তিটিও সমান হয় |
| বাক্যগুলোর দৈর্ঘ্য একটি সংকীর্ণ পরিসরে থাকে | জার্নালের নিজস্ব শৈলী এবং শব্দসংখ্যা, উভয়ই আপনাকে প্রতি বাক্যে একটি করে clause ব্যবহারের দিকে ঠেলে দেয় | তিন বা চারটি বদলান। যে জোড়াগুলোকে যুক্তি আগেই যুক্ত করেছে, সেগুলো একত্র করুন, এবং একটি বাক্যকে ছয়টি শব্দে নামিয়ে আনুন |
| সর্বত্র আনুষ্ঠানিক Latinate ক্রিয়া | থিসিসের টেমপ্লেট এবং ভাষা-সংক্রান্ত coursework আপনাকে শেখায় যে আনুষ্ঠানিক register-ই নিরাপদ | যেগুলো কোনো কাজ করছে না, সেগুলো বদলান। আপনার ক্ষেত্র যে পরিভাষা সংজ্ঞায়িত করে, সেগুলো রাখুন |
| ভারী signposting, first, second, finally | Markers signposting চায়, তাই আপনি ইচ্ছাকৃতভাবে তা যোগ করেন | এর বেশির ভাগই রেখে দিন। যে গুলো এমন একটি অনুচ্ছেদ ঘোষণা করে, যা পাঠক ইতিমধ্যেই দেখতে পাচ্ছেন, সেগুলো কেটে দিন |
| কোথাও কোনো contraction নেই | Academic register অধিকাংশ journal এবং অধিকাংশ department-এ এগুলোকে বাদ দেয় | এটি রেখে দিন। detector যা-ই পছন্দ করুক, genre-এর জন্য contraction ভুল |
| কয়েকটি স্থানে তিন-অংশের তালিকা | তিনটি item একটি বাক্যে মানিয়ে যায়, এবং rubric-ও এই গঠনকে পুরস্কৃত করে | এক বা দুইটি বদলান। প্রতিটি তালিকায় symmetry যেকোনো একক শব্দের চেয়ে বেশি কিছু বলে |
| কোনো typo নেই, কোনো slip নেই, কিছুই খসখসে নয় | আপনি এটি proofread করেছেন, একাধিকবার | এটি রেখে দিন। একটি পরিষ্কার surface authorship সম্পর্কে কোনো signal নয় |
শেষ সারিটিই নিয়ে মানুষ সবচেয়ে বেশি তর্ক করে। মানবসদৃশ দেখানোর জন্য কারও thesis-এ ইচ্ছাকৃতভাবে typo যোগ করা উচিত নয়, এবং আপনাকে তা করতে বলছে এমন যেকোনো পরামর্শ আসলে একটি submission-কে ক্ষতিগ্রস্ত করে একটি সংখ্যা পূরণ করতে বলছে।
দুই মিনিটের জোরে পড়ে শোনানোর পরীক্ষা
তিনটি অনুচ্ছেদ উচ্চস্বরে, বক্তৃতার গতিতে পড়ুন। তখন দুটি বিষয় স্পষ্ট হয়ে ওঠে, যা নীরব পাঠে আড়ালে থাকে। প্রথমটি হলো শ্বাস, এমন গদ্য যেখানে কোনো ছোট বাক্য নেই, সেখানে থামার জায়গা থাকে না, এবং আপনি তা দেখার আগেই শুনে ফেলেন। দ্বিতীয়টি হলো জোর। যে অনুচ্ছেদ এমন কারও লেখা, যিনি যুক্তিটির প্রতি যত্নশীল, তাতে একটি বাক্য থাকে যা বাকি বাক্যগুলোর চেয়ে বেশি ভার বহন করে, এবং আপনি নিজে থেকে সিদ্ধান্ত না নিয়েই সেটির ওপর জোর দিতে শুরু করেন। এমন বাক্যহীন অনুচ্ছেদ সমতল, আর এই সমতলতাই হলো মানুষ আসলে যা শনাক্ত করছে।
যদি এটি সমতল শোনায়, তবে সংশোধনটি বাক্য কী বলছে সেই স্তরেই করতে হবে। এমন কোনো বাক্য কেটে দিন, যা অন্য কোনো প্রবন্ধের অংশ হতে পারে। সংখ্যাটি আবার বসিয়ে দিন। যেখানে দুটি বাক্য একটিই বক্তব্য দেয়, সেখানে সেটি একবারেই বলুন। TextPulse-এর AI word cleaner আপনার জন্য একটি দীর্ঘ অধ্যায় জুড়ে শব্দভান্ডারের ঘনত্ব গণনা করবে, আর সমতলতা ঠিক করার দায় আপনারই থাকবে।
যদি কোনো Detector ইতিমধ্যে এটিকে চিহ্নিত করে থাকে
একটি detector স্কোর হলো কোনো পাঠ্যাংশের ওপর একটি সম্ভাব্যতা-অনুমান। এটি কে টাইপ করেছে, সে বিষয়ে কোনো বাস্তব-নির্ণয় নয়। detector দ্বারা চিহ্নিত হওয়া লেখকদের মধ্যে উপরে বর্ণিত দুটি গোষ্ঠীও আছে, দ্বিতীয় ভাষার লেখক এবং ঘন ঘন সংশোধনকারী লেখক। চিহ্নিত পাঠ্যের প্রতি সাড়া দেওয়ার সবচেয়ে ভালো উপায় হলো, পরে গিয়ে চিহ্নিত অনুচ্ছেদটি পুনর্লিখন করা। অর্থাৎ, আপনি যে প্রমাণের ওপর নির্ভর করতে চেয়েছিলেন, সেটিই বদলে ফেলা। পরে গিয়ে চিহ্নিত অনুচ্ছেদটি পুনর্লিখন করা হলো সবচেয়ে দুর্বল প্রতিক্রিয়া, কারণ এতে সেই প্রমাণ বদলে যায়, যার ওপর অন্যথায় আপনি নির্ভর করতেন।
বরং প্রক্রিয়াগত প্রমাণই রেখে দিন, সংস্করণ-ইতিহাস, তারিখসহ নোট, যে পাঠতালিকা থেকে আপনি কাজ করেছেন, এইটির আগে যে খসড়াগুলো ছিল সেগুলো। বাস্তবে এটি কেমন দেখায়, এবং একটি বিভাগ আসলে কী গ্রহণ করবে, তা how to prove you did not use AI শীর্ষক লেখায় ব্যাখ্যা করা হয়েছে।
TextPulse-এর AI humanizer পাঠ্য থেকে গণনা করা একটি আনুমানিক Human Score জানায়, যা লেখকের বিষয়ে কোনো রায় নয়, বরং গদ্যের একটি পাঠ, এবং এই সাইটের কোনো টুলই দাবি করে না যে কোনো নির্দিষ্ট detector কোনো নির্দিষ্ট পৃষ্ঠার বিষয়ে কী বলবে তা সে জানে।
নির্দিষ্ট শব্দভান্ডারটি আলাদাভাবে তালিকাভুক্ত করা হয়েছে, ChatGPT-কে প্রকাশ করে এমন শব্দগুলো সম্পর্কিত একটি পাতায়, এবং যে একক ক্রিয়াপদটি সবচেয়ে বেশি ক্ষতি করে তা আলাদাভাবে ব্যাখ্যা করা হয়েছে।
এই প্রশ্নটির বদলে যে প্রশ্নটি রাখা উচিত, তা আরও তীক্ষ্ণ। কোনো অনুচ্ছেদ যন্ত্রের মতো শোনায় কি না, তা জিজ্ঞাসা করার বদলে জিজ্ঞাসা করুন, এর কোন বাক্যটি কেবল আপনিই লিখতে পারতেন। যদি উত্তর হয়, এর কোনোটিই নয়, তবে সেটিই সেই অনুচ্ছেদ, যার ওপর কাজ করা উচিত, এবং এমন এক বছরে, যেখানে কোনো detector-ই ছিল না, তাতেও সেটির ওপর কাজ করা সার্থক হতো।
সচরাচর জিজ্ঞাসিত প্রশ্ন
সাধারণত হ্যাঁ, এবং এটাই এই প্রশ্নের সবচেয়ে সাধারণ উদ্দীপক। যারা "does my writing sound like AI" জিজ্ঞাসা করেন, তারা প্রায় সব সময় গঠন নিয়ে প্রতিক্রিয়া দিচ্ছেন: বিষয়বাক্য, চিহ্নিত সংযোগবাক্য এবং একটি সামঞ্জস্যপূর্ণ রেজিস্টার মূল্যায়নের মানদণ্ড, এবং এগুলোই একটি language model স্বাভাবিকভাবে তৈরি করে। সংগঠন কোনো লেখা কে লিখেছে সে সম্পর্কে কোনো তথ্য বহন করে না, এবং তা বাদ দিলে লেখা আরও খারাপ হয়।
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.