স্কেলড কনটেন্ট অপব্যবহার: Google আসলে কী শাস্তি দেয়
Google-এর সংজ্ঞা একটিমাত্র বাক্য, এবং এর প্রায় সব সারসংক্ষেপই সেই অংশটি বাদ দেয় যা গুরুত্বপূর্ণ। নীতিটি এমন পৃষ্ঠাকে বর্ণনা করে যা মূল উদ্দেশ্য হিসেবে র্যাঙ্কিংকে প্রভাবিত করা এবং ব্যবহারকারীদের সাহায্য না করার জন্য তৈরি, ফলে উদ্দেশ্যই এখানে ট্রিগার, আর পরিমাণ একটি পার্শ্বপ্রতিক্রিয়া। এখানে আছে সেই ভাষ্য, Google যে 5টি অনুশীলন তালিকাভুক্ত করেছে, এবং কিছু খসড়া করার আগে একটি প্রকাশনা পরিকল্পনা পরীক্ষা করার উপায়।
একটি স্থানীয় সেবা ব্র্যান্ড নব্বইটি শহর-পাতা প্রকাশ করে এবং পরের ত্রৈমাসিকটি এই আশঙ্কায় কাটায় যে তারা একটি সীমা অতিক্রম করেছে। কিছু দূরে একটি প্রতিদ্বন্দ্বী একই ধরনের টেমপ্লেট থেকে চার হাজারটি পাতা চালাচ্ছে। উভয় দলই পরিমাণ গণনা করছে। Google-এর নীতিতে যে একমাত্র বিষয়টি মাপা হয় না, তা হলো পরিমাণ।
scaled content abuse, যা Google তার স্প্যাম নীতিতে নাম দিয়েছে, তার একটি এক-বাক্যের সংজ্ঞা আছে, এবং তাতে থাকা প্রতিটি কার্যকর শব্দ উদ্দেশ্যকে বর্ণনা করে। লাইভ পাতায় লেখা আছে: "Scaled content abuse is when many pages are generated for the primary purpose of manipulating search rankings and not helping users." ধীরে ধীরে পড়ুন। দুটি শর্ত একসঙ্গে পূরণ হতে হবে, এবং কেবল একটি পাতা-সংখ্যা নিজে থেকে কোনোটিই পূরণ করে না।
এই পার্থক্যই নির্ধারণ করে যে একটি প্রকাশনা কর্মসূচি ব্যবসায়িক সিদ্ধান্ত নাকি স্প্যাম-ধরন, এবং নীতির অধিকাংশ ব্যাখ্যা সরাসরি এড়িয়ে গিয়ে এই আলোচনায় চলে যায় যে কতটা বিষয়বস্তু বেশি হয়ে যায়। AI-generated content সম্পর্কে Google-এর বিস্তৃত অবস্থান একই নথিসমষ্টির মধ্যে আছে এবং একই যুক্তিতে চলে। এখানে যা অনুসরণ করছে তা হলো স্প্যাম নীতিটিই, অর্থাৎ তার ভাষ্য, Google যে অনুশীলনগুলো এর অধীনে তালিকাভুক্ত করেছে, এবং একটি পরীক্ষা যা আপনি কোনো শব্দ খসড়া হওয়ার আগে একটি পরিকল্পনায় প্রয়োগ করতে পারেন।
Google যে Scaled Content Abuse শাস্তি দেয়: সুনির্দিষ্ট ভাষ্য
Google-এর সংজ্ঞাটি তিনটি উপবাক্যে বিভক্ত, এবং তিনটিই কার্যকর। অনেক পাতা তৈরি করা হয়, যা হলো পরিমাণের অংশ এবং অধিকাংশ সারসংক্ষেপে উদ্ধৃত একমাত্র অংশ। search rankings নিয়ন্ত্রণ করার প্রধান উদ্দেশ্যে, যা এই দাবি করে যে পাতাগুলো আদৌ কেন আছে। এবং ব্যবহারকারীদের সাহায্য না করে, যা এই দাবি করে যে কেউ সেখানে পৌঁছানোর পর সেগুলো কী করে। যে পাতায় এই বাক্যটি আছে, সেটি সর্বশেষ 2026 সালের May মাসে হালনাগাদ করা হয়েছিল, তাই এটি 2024 সালের ঘোষণার কোনো স্ক্রিনশট নয়, বরং বর্তমান ভাষ্য।
Primary হলো সেই শব্দ, যা সবচেয়ে বেশি কাজ করে। প্রায় প্রতিটি বাণিজ্যিক পৃষ্ঠা আংশিকভাবে র্যাঙ্কিংকে মাথায় রেখে তৈরি হয়, এবং নীতি কোনো প্রকাশককে ভান করতে বলে না যে বিষয়টি অন্যরকম। এটি জিজ্ঞাসা করে, পৃষ্ঠাটি মূলত কী উদ্দেশ্যে। যে পৃষ্ঠা আগামীকাল সার্চ ইঞ্জিন বন্ধ হয়ে গেলেও প্রকাশের যোগ্য থাকত, তার একটি primary purpose আছে, যা পরীক্ষাটি স্বচ্ছন্দে অতিক্রম করে। যে পৃষ্ঠা একই বিকেলে মুছে ফেলা হতো, তার তা নেই।
Google যে পাঁচটি অনুশীলনের তালিকা দেয়
নীতির অধীনে Google পাঁচটি অনুশীলনের নাম দেয়, এবং generative AI তাদের মধ্যে ঠিক একটিতে উপস্থিত। বাকি চারটি scraping, stitching, hidden satellite sites এবং এমন keyword pages বর্ণনা করে, যেগুলো কেউ পড়তে পারে না, এবং এর কোনোটির জন্যই language model দরকার হয় না। তালিকার প্রতিটি এন্ট্রি একই যোগ্যতাসূচক বাক্যাংশ দিয়ে শেষ হয়, users-এর জন্য value সম্পর্কে, আর সেটিই আপনাকে বলে দেয় Google আসলে কী মাপছে।
| Practice, in Google's words | What the entry is testing |
|---|---|
| "Using generative AI tools or other similar tools to generate many pages without adding value for users" | কিছু আদৌ যোগ করা হয়েছে কি না, কোন tool তা টাইপ করেছে তা নয় |
| "Scraping feeds, search results, or other content to generate many pages (including through automated transformations like synonymizing, translating, or other obfuscation techniques), where little value is provided to users" | উৎস উপাদানকে সত্যিই নতুন কিছুর মধ্যে রূপান্তর করা হয়েছে কি না, নাকি কেবল নতুন লেবেল দেওয়া হয়েছে |
| "Stitching or combining content from different web pages without adding value" | সংযোজনকে authorship হিসেবে গণ্য করা যায় কি না |
| "Creating multiple sites with the intent of hiding the scaled nature of the content" | প্রকাশক কি ইতিমধ্যেই এমন কারও মতো আচরণ করছে, যে ধরা পড়বে বলে ধরে নিচ্ছে |
| "Creating many pages where the content makes little or no sense to a reader but contains search keywords" | কোনো human reader আদৌ উদ্দেশ্যপ্রণোদিত audience ছিল কি না |
পাঁচটির মধ্যে চারটি এমন অনুশীলন বর্ণনা করে যা generative AI-এর এক দশক আগের। Scraped feeds, synonymized rewrites, doorway pages terms দিয়ে ভরা এবং stitched-together aggregations, এগুলো একটি model ব্যবহারযোগ্য অনুচ্ছেদ লিখতে পারার অনেক আগেই spam ছিল। কিন্তু এখন এটি সস্তা। আগে পাঁচশতম page-এর খরচ প্রায় প্রথমটির মতোই হতো, তাই এখন আমাদের কাছে এমন একটি rule আছে যা Google বহু বছর ধরে কোনো না কোনো রূপে প্রয়োগ করেছে। এটি একটি নতুন threat-এর মতো শোনায়।
আপনার নিজস্ব পেপারকে মানবসদৃশ করুন
আপনার AI-সহায়তাপ্রাপ্ত লেখাকে রূপান্তর করুন এবং গুরুত্বপূর্ণ শব্দ বা উদ্ধৃতি স্পর্শ না করে সেটিকে মানবসদৃশ শোনান।
কেন কেবল Volume-ই Trigger নয়
Google কোনো page-count threshold প্রকাশ করে না, এবং কোনো number of pages নিজে থেকেই policy trigger করে না। দুই লক্ষ product pages-সহ একটি retailer, প্রতিটি vacancy-এর জন্য live listing বহনকারী একটি job board, প্রতিটি chemical compound-এর জন্য একটি entry-সহ একটি reference site, এদের প্রত্যেকেই বিপুল scale-এ publish করে, এবং এদের কেউই rankings manipulate করার জন্য generated pages, অথচ users-কে সাহায্য করতে ব্যর্থ, এমন একটি sentence-এর সঙ্গে মেলে না। Scale হলো catalogue-এর ফল, project-এর কারণ নয়।
বিপরীতটিও সমানভাবে সত্য। চল্লিশটি page সহজেই policy breach করতে পারে, যদি চল্লিশটিই কেবল একটি page হয়, যেখানে একটি place name বদলে দেওয়া হয়েছে, এবং সেগুলোর কোনো একটিতেই এমন কিছু না থাকে যা সেই স্থানের একজন reader উপকারী বলে মনে করবে। Large volume একটি thin pattern-কে শনাক্ত করা আরও সহজ করে এবং systemically detect করাও সহজ করে, এই কারণেই policy-তে scale-এর উল্লেখ আছে। Scale হলো সেই setting, যেখানে problemটি দেখা দেয়, এবং problem-ই হলো pages-এর উদ্দেশ্য।
একটি plan line-এর কোন পাশে আছে তা কীভাবে বোঝা যায়
প্রতিটি page-এ এমন কী থাকবে যা batch-এর অন্য কোনো page-এ নেই, তা জিজ্ঞাসা করুন, এবং কিছু draft করার আগেই তা জিজ্ঞাসা করুন। যদি উত্তর হয় spreadsheet থেকে নেওয়া একটি name, একটি number এবং একটি postcode, তবে batchটি variables-সহ একটি template, এবং Google-এর sentence সেটিকে সঠিকভাবেই বর্ণনা করে।
- প্রথম খসড়া তৈরির আগে, প্রতিটি পৃষ্ঠার যে ইনপুটটি আছে এবং ব্যাচের অন্য কোনো পৃষ্ঠার নেই, সেটির নাম নির্ধারণ করুন। একটি স্প্রেডশিট কলামকে ইনপুট হিসেবে গণ্য করা হয় না।
- প্রতিটি পৃষ্ঠা যদি কখনোই কোনো কিছুর জন্য র্যাঙ্ক করতে না পারত, তবু কি সেটি কমিশন করা হতো, তা জিজ্ঞাসা করুন। উত্তর যদি হ্যাঁ হয়, তবে primary purpose প্রশ্নটি ইতিমধ্যেই উত্তরিত।
- নিশ্চিত করুন যে কোনো একক পৃষ্ঠায় অবতরণ করা একজন পাঠক এমন কিছু খুঁজে পান, যা তারা আপনার উপরের ফলাফল থেকে পেতে পারতেন না।
- নিশ্চিত করুন যে পৃষ্ঠাগুলি একটিমাত্র সাইটে, একটিমাত্র নামের অধীনে থাকে। সেগুলিকে satellite domains জুড়ে ছড়িয়ে দেওয়া Google-এর নিজস্ব উদাহরণের তালিকায় দেখা যায়।
Google-এর পাঁচটি এন্ট্রির শেষটি এমন পৃষ্ঠাগুলিকে অন্তর্ভুক্ত করে, য deren বিষয়বস্তু সঠিক search terms বহন করলেও পাঠকের কাছে সামান্য বা কোনো অর্থই প্রকাশ করে না, এবং এটি পরীক্ষা করার জন্য সবচেয়ে সস্তা ব্যর্থতা। একটি ব্যাচের মাঝখান থেকে তিনটি পৃষ্ঠা তুলে নিন এবং সেগুলি একজন গ্রাহকের মতো উচ্চস্বরে পড়ুন। সেগুলোর একটি একটি বিনামূল্যের readability checker দিয়ে চালালে, ওই বাক্যগুলি আদৌ কোনো মানুষের জন্য তৈরি হয়েছিল কি না, সে বিষয়ে একটি সরল দ্বিতীয় মতামত পাওয়া যায়।
যেখানে একটি ব্যাচ প্রকৃতপক্ষে বিষয়বস্তুর দিক থেকে স্বতন্ত্র এবং কেবল ভঙ্গিতে সাধারণ, সেখানে সমাধানটি কাঠামোগত নয়, সম্পাদকীয়। একটি AI humanizer পুরো ব্যাচ জুড়ে একটি পৃষ্ঠাসমষ্টি কীভাবে পড়া হয় তা পরিবর্তন করে, এবং AI text humanize করার ধাপে ধাপে নির্দেশিকা হাতে করা একই কাজটি কভার করে। এর কোনোটিই ইনপুট সমস্যার সমাধান করে না। সেটি লেখার আগের পর্যায়ে, যেখানে কেউ নির্ধারণ করে প্রতিটি পৃষ্ঠা কী উদ্দেশ্যে।
Scaled Content Abuse কি Site Reputation Abuse-এর সমান?
না, এবং এই দুটিকে প্রায়ই গুলিয়ে ফেলা হয়, কারণ Google 2024 সালের March-এ এগুলিকে একসঙ্গে ঘোষণা করেছিল। Scaled content abuse একটি সাইটের নিজস্ব বৃহৎ পরিসরে উৎপাদিত, নিম্ন-মূল্যের পৃষ্ঠাগুলিকে বোঝায়। Site reputation abuse হলো Google-এর সেই পরিভাষা, যা তৃতীয় পক্ষের বিষয়বস্তুকে বোঝায়, যা একটি host site-এ মূলত ranking signals-এর কারণে প্রকাশিত হয়, যেগুলি host ইতিমধ্যেই তার first-party কাজ থেকে অর্জন করেছিল, আর একটি news site-এর সঙ্গে জুড়ে দেওয়া coupon section হলো সেই ধরন, যা সবাই চিনতে পারে। একটি নীতি বর্ণনা করে যে একটি site তার নিজস্ব publishing capacity অপব্যবহার করছে। অন্যটি বর্ণনা করে যে একটি site এমন authority ভাড়া দিচ্ছে, যা সে সম্পূর্ণ ভিন্ন কিছুর জন্য গড়ে তুলেছিল।
Google যা চায় বলে জানায়, তা E-E-A-T শিরোনামের অধীনে ব্যাখ্যা করা হয়েছে, যার নিজস্ব পৃষ্ঠা আছে। উৎপাদন দিক থেকে, SEO-এর জন্য একটি AI ব্লগ পোস্টকে মানবিক করা আলাদাভাবে আলোচিত হয়েছে।
পরবর্তী কনটেন্ট ব্রিফের শীর্ষে Google-এর বাক্যটি রাখুন এবং কেউ খসড়া লেখা শুরু করার আগে পুরো ব্যাচের জন্য লিখিতভাবে এর উত্তর দিন। যে দল প্রতিটি পৃষ্ঠা কী যোগ করে তা বলতে পারে না, তারা সাধারণত পরিকল্পনা পর্যায়েই তা জানতে পারে, আর সেটিই তা জানার সবচেয়ে কম ব্যয়বহুল মুহূর্ত।
সচরাচর জিজ্ঞাসিত প্রশ্ন
Google এটিকে এমন বহু পৃষ্ঠা হিসেবে সংজ্ঞায়িত করে, যা মূল উদ্দেশ্য হিসেবে সার্চ র্যাঙ্কিংকে প্রভাবিত করা এবং ব্যবহারকারীদের সাহায্য না করার জন্য তৈরি। ওই বাক্যের উভয় অংশই প্রযোজ্য হতে হবে। Google যে স্কেলড কনটেন্ট অপব্যবহার বর্ণনা করে, তা পৃষ্ঠাগুলো কেন আছে এবং সেগুলো পাঠকের জন্য কী করে, সে বিষয়ে একটি বক্তব্য, এবং নীতিতে এমন কোনো পৃষ্ঠাসংখ্যা নেই যা একাই এটি ট্রিগার করে।
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.