Skip to content
Robots.txt জেনারেটর
Tools

Robots.txt জেনারেটর

নতুন

allow/disallow নিয়ম ও একটি sitemap লাইন সহ একটি বৈধ robots.txt তৈরি করুন।

Quick presets
Generated robots.txt
Test a URL Check whether your rules allow or block a path — same longest-match logic Google uses.

Disallow blocks crawling, not indexing. A blocked URL can still appear in Google if other sites link to it. To remove a page from search results, keep it crawlable and add a noindex meta tag or X-Robots-Tag header. robots.txt is also a public file and is not a security measure — protect private pages with real authentication.

robots.txt syntax cheat-sheet
Directive What it does
User-agent: *Which crawler the rules apply to (* = all bots).
Disallow: /pathAsk crawlers not to crawl URLs that start with this path.
Allow: /pathPermit a path, typically an exception inside a disallowed area.
Crawl-delay: 10Seconds between requests. Bing & Yandex honor it; Google ignores it.
Sitemap: https://…Absolute URL of your sitemap. Can appear anywhere in the file.
*Wildcard — matches any sequence of characters in a path.
$Anchors a rule to the end of the URL, e.g. /*.pdf$.
#A comment — the rest of the line is ignored by crawlers.

Runs entirely in your browser. Nothing is uploaded.

একটি ফ্রি robots.txt জেনারেটর যা চলে আপনার ব্রাউজারেই

এই robots.txt জেনারেটর একটি সহজ ফর্মকে একটি বৈধ robots.txt ফাইলে রূপান্তরিত করে — কোনো সিনট্যাক্স মুখস্থ করার দরকার নেই এবং কিছু ইনস্টল করারও প্রয়োজন নেই। একটি প্রিসেট বেছে নিন অথবা নিজের ক্রল নিয়ম তৈরি করুন, ফাইলটি লাইভ তৈরি হতে দেখুন, তারপর সেটি কপি বা ডাউনলোড করে আপনার সাইটের রুটে রাখুন। সবকিছুই স্থানীয়ভাবে আপনার ব্রাউজারে ঘটে, তাই আপনার লেখা নিয়মগুলো কখনও কোনো সার্ভারে আপলোড হয় না।

আপনার শুরু করার জন্য একটি দ্রুত robots.txt উদাহরণ দরকার হোক, একটি নির্দিষ্ট ক্রলারের জন্য কাস্টম robots.txt দরকার হোক, কিংবা WordPress, Blogger অথবা AI প্রশিক্ষণ বট ব্লক করার জন্য টিউন করা একটি ফাইল দরকার হোক — কয়েক সেকেন্ডেই তা প্রস্তুত করতে পারবেন। বিল্ট-ইন পাথ টেস্টার প্রকাশের আগেই আপনার নিয়ম যাচাই করে দেয় — এমন একটি সুবিধা যা প্রতিযোগী বেশিরভাগ জেনারেটরে নেই।

সিনট্যাক্স মুখস্থ না করেই ক্রল নিয়ম তৈরি করুন

প্রতিটি নিয়ম গ্রুপ একটি User-agent-এর সাথে সেই পাথগুলো জুড়ে দেয় যেগুলো আপনি Allow বা Disallow করতে চান, সাথে একটি ঐচ্ছিক Crawl-delay। সব ক্রলারকে টার্গেট করতে * ব্যবহার করুন, অথবা Googlebot বা Bingbot-এর মতো নির্দিষ্ট বটের নাম লিখুন — টাইপ শুরু করলেই ফিল্ডটি প্রচলিত ক্রলার সাজেস্ট করে। বিভিন্ন বটকে বিভিন্ন নিয়ম দিতে যত খুশি গ্রুপ যোগ করুন।

প্রতি লাইনে একটি করে পাথ লিখুন; টুলটি প্রতিটিকে সঠিক Disallow: বা Allow: ডিরেক্টিভ হিসেবে ফরম্যাট করে এবং আপনার গ্রুপগুলোকে সঠিক ক্রমে জোড়া লাগিয়ে দেয়। আপনার Sitemap URL যোগ করুন, আর এটি একটি অ্যাবসোলিউট Sitemap: লাইন হিসেবে যুক্ত হয়ে ক্রলারদের আপনার খুঁজে পাওয়ানো প্রতিটি পেজের দিকে নির্দেশ করে। Google-এর ক্রলার এটি তুলে নেয় এবং Search Console-এ সরাসরি জমা দেওয়া যেকোনো sitemap-এর পাশাপাশি এটি ব্যবহার করে।

WordPress, Blogger ও AI বট ব্লক করার প্রিসেট

এক ক্লিকেই একটি রেডিমেড শুরুর বিন্দু লোড হয়। Allow all এবং Block all দুটি চরম প্রান্ত কভার করে। WordPress প্রস্তাবিত ডিফল্ট লোড করে: /wp-admin/ ব্লক করে কিন্তু প্লাগইনগুলোর প্রয়োজনীয় AJAX কলের জন্য /wp-admin/admin-ajax.php খোলা রাখে। Blogger Google-এর প্রস্তাবিত Blogger সেটআপ লোড করে: ডুপ্লিকেট-কন্টেন্ট সমস্যা এড়াতে /search ছাড়া সবকিছু allow করে।

Block AI bots প্রিসেটটি তখন কাজে লাগে যখন আপনি চান আপনার কন্টেন্ট Google ও Bing-এ থাকুক অথচ AI মডেল প্রশিক্ষণে ব্যবহৃত না হোক। এটি GPTBot (OpenAI), CCBot (Common Crawl), Google-Extended (Gemini), ClaudeBot (Anthropic), PerplexityBot এবং আরও কিছু বট disallow করে — একই সাথে সাধারণ সার্চ ক্রলারদের অক্ষত রাখে। The New York Times, The Guardian এবং আরও অনেক বড় প্রকাশক ২০২৩ সালে এমন একই ব্লক যোগ করেছিল।

প্রকাশের আগে একটি URL টেস্ট করুন

যে জেনারেটর নিজেই নিজেকে টেস্ট করতে পারে না, সেটি কাজের অর্ধেকই করে। বিল্ট-ইন পাথ টেস্টার আপনাকে যেকোনো URL বা পাথ এবং একটি ক্রলারের নাম লিখতে দেয়, তারপর জানিয়ে দেয় আপনার বর্তমান নিয়ম সেটি allow করে না block করে — এবং ঠিক কোন Allow বা Disallow নিয়মটি সিদ্ধান্ত নেয়, Google যে longest-match লজিক প্রয়োগ করে সেটি ব্যবহার করে (সবচেয়ে নির্দিষ্ট নিয়মটি জেতে, এবং সমান দৈর্ঘ্যের ক্ষেত্রে Allow টাই ভাঙে)।

আপনি টাইপ করার সাথে সাথে টুলটি এমন ভুলের জন্যও লাইভ সতর্কবার্তা দেয় যা নীরবে বাস্তব robots.txt ফাইল নষ্ট করে দেয়: শুরুতে স্ল্যাশ না থাকা একটি পাথ, একটি রিলেটিভ sitemap URL, অথবা Googlebot-এর দিকে তাক করা একটি Crawl-delay (যা সেটি উপেক্ষা করে এবং Search Console-এ আলাদা সেটিং দরকার হয়)। প্রকাশের আগে এগুলো ঠিক করলে Google Search Console-এর মধ্য দিয়ে একটি ডিবাগিং রাউন্ড-ট্রিপ বেঁচে যায়।

ক্রলিং বনাম ইনডেক্সিং — এবং অন্যান্য সাধারণ ভুল

সবচেয়ে বড় robots.txt ভ্রান্তি হলো: Disallow একটি পেজকে Google থেকে সরিয়ে দেয়। তা করে না। এটি ক্রলিং থামায়, কিন্তু অন্য পেজ থেকে লিংক থাকলে একটি ব্লক করা URL এখনও সার্চ ফলাফলে দেখা যেতে পারে। Google হয়তো সেটি কোনো স্নিপেট ছাড়াই ইনডেক্স করে ফেলবে — শুধু একটি URL, কোনো বিবরণ নেই। একটি পেজকে সার্চ থেকে দূরে রাখতে হলে সেটিকে ক্রলযোগ্য রেখে পেজের মধ্যেই noindex যোগ করুন। robots.txt-এ ব্লক করলে Google পেজটি কখনও ক্রল করতে পারে না সেই noindex দেখার জন্য, ফলে URL-টি অনির্দিষ্টকাল ইনডেক্সে থেকে যেতে পারে।

এটাও মনে রাখবেন যে robots.txt পাবলিক এবং পরামর্শমূলক। এটি একটি নির্দিষ্ট, পাঠযোগ্য URL-এ থাকে, এটি কোনো নিরাপত্তা বেড়া নয়, এবং শুধু ভদ্র বটই এটি মানে। ক্রল বাজেট নিয়ন্ত্রণ এবং ডুপ্লিকেট বা পাতলা পেজ গুছিয়ে রাখতে এটি ব্যবহার করুন — সত্যিকারের সুরক্ষা প্রয়োজন এমন কিছু লুকাতে নয়। সেজন্য অথেন্টিকেশন ব্যবহার করুন। এই জেনারেটর সম্পূর্ণভাবে আপনার ব্রাউজারে চলে, তাই আপনার সাইটের অভ্যন্তরীণ পাথ কখনও আপনার ডিভাইস ছেড়ে যায় না।

robots.txt প্রোটোকল: ১৯৯৪-এর মেইলিং লিস্ট থেকে RFC 9309 পর্যন্ত

Robots Exclusion Standard কোনো স্ট্যান্ডার্ড সংস্থায় জন্মায়নি — এটি এসেছিল একটি মাত্র ইমেইল থেকে। ১৯৯৪ সালের জুনে Martijn Koster www-talk মেইলিং লিস্টে একটি প্রস্তাব পোস্ট করেন, যেখানে ওয়েব রোবটদের ক্রল করার আগে একটি সাইটের ইচ্ছা যাচাই করার একটি কনভেনশন বর্ণনা করা হয়েছিল। ধারণাটি দ্রুত ছড়িয়ে পড়ে কারণ এটি একটি বাস্তব সমস্যার সমাধান করেছিল: তখনকার ওয়েব ক্রলাররা সাইট মালিকদের কোনো অপ্ট-আউট প্রক্রিয়া ছাড়াই সার্ভারগুলোতে চাপ ফেলছিল। কয়েক মাসের মধ্যেই সেই যুগের প্রধান সার্চ ইঞ্জিনগুলো কনভেনশনটি গ্রহণ করে, আর তখন থেকে সরল robots.txt ফাইলটি ওয়েবের রুটে বসে আছে।

সর্বব্যাপী হওয়া সত্ত্বেও, Robots Exclusion Protocol প্রায় তিন দশক ধরে একটি প্রকৃত (de facto) কনভেনশন হিসেবেই ছিল — এটি কখনও একটি আনুষ্ঠানিক W3C বা IETF স্ট্যান্ডার্ড হিসেবে অনুমোদিত হয়নি। এটি বদলায় ২০১৯ সালে, যখন Google অন্যান্য সার্চ ইঞ্জিনের সমর্থনে প্রোটোকলটিকে কোডবদ্ধ করতে IETF-এ একটি প্রস্তাব জমা দেয়। এর ফল, RFC 9309, প্রকাশিত হয় ২০২২ সালের সেপ্টেম্বরে। এই RFC মূল ডিরেক্টিভগুলো (User-agent, Allow, Disallow) আনুষ্ঠানিক রূপ দেয়, পরস্পরবিরোধী ডিরেক্টিভের জন্য longest-match নিয়ম সংজ্ঞায়িত করে, এবং ফাইল আনার সময় ক্রলারদের কীভাবে HTTP স্ট্যাটাস কোড সামলাতে হবে তা নির্দিষ্ট করে। এটি ইচ্ছাকৃতভাবেই Crawl-delay বা Sitemap স্ট্যান্ডার্ড করেনি — সেগুলো আনুষ্ঠানিক স্পেকের বাইরে ব্যাপকভাবে সমর্থিত এক্সটেনশন হিসেবেই রয়ে গেছে।

এই ইতিহাস বোঝা বাস্তবে গুরুত্বপূর্ণ। যেহেতু স্ট্যান্ডার্ডটি অনানুষ্ঠানিক ঐকমত্য থেকে বিকশিত হয়েছিল, বিভিন্ন ক্রলার ঐতিহাসিকভাবে এজ কেসগুলো ভিন্নভাবে ব্যাখ্যা করেছে — ট্রেইলিং ওয়াইল্ডকার্ড, পাথের কেস সংবেদনশীলতা, অথবা সার্ভার 5xx এরর ফেরত দিলে কী আচরণ হবে। RFC 9309 এই অস্পষ্টতাগুলোর বেশিরভাগ সমাধান করে, তবে পুরনো বা কম প্রচলিত ক্রলারদের টার্গেট করা সাইটগুলো এখনও ভিন্ন আচরণের মুখোমুখি হতে পারে। নিরাপদ পন্থা: RFC-তে নথিভুক্ত ডিরেক্টিভগুলোতে আটকে থাকুন এবং যে নির্দিষ্ট বটগুলো নিয়ে আপনি চিন্তিত তাদের বিরুদ্ধে আপনার নিয়ম টেস্ট করুন।

ডিরেক্টিভ সিনট্যাক্স গভীরে: User-agent, Allow, Disallow, Crawl-delay, Sitemap

প্রতিটি robots.txt ফাইল একটি ছোট সেট ডিরেক্টিভ দিয়ে তৈরি। User-agent: একটি নিয়ম গ্রুপ শুরু করে এবং সেটি যে ক্রলারের জন্য প্রযোজ্য তার নাম দেয়। * মান প্রতিটি বটের সাথে মেলে; Googlebot, Bingbot, GPTBot, anthropic-ai, বা CCBot-এর মতো একটি নির্দিষ্ট নাম শুধু সেই ক্রলারকে টার্গেট করে। একটি ক্রলার তার নামের সাথে মেলা সবচেয়ে নির্দিষ্ট গ্রুপটি মানে — Google-এর ওয়েব ক্রলারের জন্য Googlebot গ্রুপ * গ্রুপের চেয়ে অগ্রাধিকার পায়। Disallow: ক্রলারকে মেলানো পাথ না আনতে বলে। একটি খালি মান (Disallow:) মানে সবকিছু allow; একটি মাত্র স্ল্যাশ (Disallow: /) পুরো সাইট ব্লক করে। Allow: মূল ১৯৯৪ স্পেকের অংশ ছিল না কিন্তু Google, Bing এবং বেশিরভাগ প্রধান ক্রলার এটি সমর্থন করে; এটি একটি বড় disallow-এর ভেতরে একটি ব্যতিক্রম তৈরি করে, এবং একটি পাথ উভয়ের সাথে মিললে সবচেয়ে দীর্ঘ (নির্দিষ্ট) নিয়মটি জেতে — সমান দৈর্ঘ্যের টাই Allow ভাঙে।

Crawl-delay: একটি ক্রলারকে অনুরোধের মধ্যে নির্দিষ্ট সংখ্যক সেকেন্ড বিরতি দিতে বলে — আক্রমণাত্মক ক্রলিং আপনার সার্ভারে চাপ ফেললে কাজে আসে। Bing ও Yandex এটি মানে; Googlebot এটি সম্পূর্ণভাবে উপেক্ষা করে। Google-এর ক্রল হার নিয়ন্ত্রণ করতে বদলে Google Search Console-এর Crawl Stats রিপোর্ট ব্যবহার করুন। Sitemap: ডিরেক্টিভ একটি সম্পূর্ণ অ্যাবসোলিউট URL গ্রহণ করে এবং ক্রলারদের আপনার XML sitemap কোথায় পাওয়া যাবে তা জানায়। এটি ফাইলের যেকোনো জায়গায় থাকতে পারে, এটি কোনো User-agent গ্রুপের সাথে বাঁধা নয়, এবং আলাদা sitemap ইনডেক্স ফাইলের জন্য আপনি একাধিক Sitemap: লাইন যোগ করতে পারেন। Google, Bing ও Yandex সবাই এটি প্রক্রিয়া করে; এটি Search Console-এ সরাসরি sitemap জমা দেওয়ার একটি বাস্তব পরিপূরক, কারণ এটি আপনার robots.txt পড়া যেকোনো ক্রলারের কাছে লোকেশনটি আবিষ্কারযোগ্য করে তোলে।

পাথ ম্যাচিং ডিফল্টভাবে প্রিফিক্স লজিক অনুসরণ করে: Disallow: /private/ /private/, /private/page, এবং /private/docs/file.pdf ব্লক করে। পাথের ভেতরে * ওয়াইল্ডকার্ড যেকোনো ক্যারেক্টার সিকোয়েন্সের সাথে মেলে, এবং শেষে থাকা $ অ্যাংকর ম্যাচটিকে URL-এর ঠিক শেষে পিন করে — উদাহরণস্বরূপ, Disallow: /*.pdf$ .pdf-এ শেষ হওয়া URL ব্লক করে। Google ওয়াইল্ডকার্ড ও ডলার অ্যাংকর দুটোই সমর্থন করে; প্রতিটি ক্রলার করে না, তাই অ্যাংকরটির ওপর তখনই নির্ভর করুন যখন Google বা নথিভুক্ত সমর্থনযুক্ত বট টার্গেট করছেন।

robots.txt যা করে না — যে সীমাবদ্ধতাগুলো জানা জরুরি

robots.txt ইনডেক্সিং ঠেকায় না। এটিই প্রোটোকলের সবচেয়ে ভুল-বোঝা দিক। আপনি যদি Disallow: /secret-page/ যোগ করেন, Google সেই URL ক্রল করবে না — কিন্তু অন্য সাইট থেকে লিংক থাকলে Google এখনও URL-টি আবিষ্কার করে সার্চ ফলাফলে অন্তর্ভুক্ত করতে পারে, সাধারণত একটি কাটা বা অনুপস্থিত স্নিপেটসহ। একটি পেজকে ইনডেক্স থেকে বাদ দেওয়ার একমাত্র নির্ভরযোগ্য উপায় হলো পেজের মধ্যেই একটি noindex ডিরেক্টিভ (একটি <meta name="robots" content="noindex"> ট্যাগ বা একটি X-Robots-Tag HTTP হেডারের মাধ্যমে), এবং গুরুত্বপূর্ণভাবে, পেজটি ক্রলযোগ্য থাকতে হবে যাতে Google সেই ডিরেক্টিভ পড়তে পারে। robots.txt-এ একটি URL ব্লক করে সেটি ইনডেক্সের বাইরে থাকবে বলে আশা করা একটি সুপরিচিত SEO ফাঁদ।

robots.txt নিরাপত্তা দেয় না। ফাইলটি yoursite.com/robots.txt-এ প্রকাশ্যে পাঠযোগ্য, তাই Disallow-এর নিচে যে পাথগুলো লুকাতে চান তা তালিকাভুক্ত করা আসলে সেই পাথগুলো ফাইল খোলা যে কারও কাছে বিজ্ঞাপিত করে — অ্যাডমিন প্যানেল, স্টেজিং এনভায়রনমেন্ট বা অভ্যন্তরীণ API খুঁজে বেড়ানো আক্রমণকারী সহ। Disallow: /admin-login-backup/ তালিকাভুক্ত করা একটি আমন্ত্রণ, তালা নয়। সংবেদনশীল রিসোর্স অবশ্যই প্রকৃত অ্যাক্সেস নিয়ন্ত্রণ দিয়ে সুরক্ষিত করতে হবে: সার্ভার-সাইড অথেন্টিকেশন, IP অ্যালোলিস্টিং, বা ফায়ারওয়াল নিয়ম। robots.txt সহযোগী ক্রলারদের জন্য একটি নির্দেশনা, এমন কোনো ব্যবস্থা নয় যা কিছু প্রয়োগ করে।

robots.txt স্বেচ্ছামূলক। নৈতিক, ভদ্র ক্রলার — Googlebot, Bingbot, Apple-এর Applebot এবং বৈধ গবেষণা বট — প্রোটোকল মানে কারণ রক্ষা করার মতো সুনাম ও ব্যবসায়িক সম্পর্ক তাদের আছে। ক্ষতিকর স্ক্র্যাপার, কন্টেন্ট চোর এবং ভালনারেবিলিটি স্ক্যানার নিয়মিতভাবে এটি উপেক্ষা করে। সম্মতিশীল ক্রলারদের মধ্যেও প্রোটোকলে এজ-কেস ফাঁক আছে: Google নথিভুক্ত করেছে যে robots.txt-এ disallow করা একটি URL যদি আপনার জমা দেওয়া একটি sitemap-এ থাকে, তবে সেটি ইনডেক্স হতে পারে — sitemap একটি প্রতিদ্বন্দ্বী সংকেত হিসেবে কাজ করে। বাস্তব উপদেশ: ক্রল বাজেট পরিচালনা এবং ভদ্র বটদের গাইড করতে robots.txt ব্যবহার করুন, কোনো প্রকৃত বিধিনিষেধ প্রয়োগ করতে নয়।

AI ক্রলার এবং বিবর্তনশীল robots.txt পরিমণ্ডল

গত দুই বছরে robots.txt-এর একটি নতুন বিবেচ্য বিষয় এসেছে: AI প্রশিক্ষণ ক্রলার। জেনারেটিভ AI কোম্পানিগুলো বড় ভাষা মডেলের জন্য প্রশিক্ষণ ডেটাসেট তৈরি করতে খোলা ওয়েব স্ক্র্যাপ করে। এই ক্ষেত্রের প্রধান ক্রলারগুলো হলো GPTBot (OpenAI, GPT-4 ও পরবর্তী মডেলের জন্য ব্যবহৃত), Google-Extended (Google, Bard ও Gemini প্রশিক্ষণে ব্যবহৃত — Googlebot থেকে আলাদা), anthropic-ai (Anthropic, Claude-এর জন্য ব্যবহৃত), CCBot (Common Crawl, একটি অলাভজনক সংস্থা যার ডেটাসেট একাডেমিক ও বাণিজ্যিক AI গবেষণায় ব্যাপকভাবে ব্যবহৃত হয়), PerplexityBot, Applebot-Extended, এবং meta-externalagent (Meta, Llama-এর জন্য ব্যবহৃত)। প্রতিটি তার নিজস্ব User-agent স্ট্রিং প্রকাশ করে বিশেষত যাতে সাইট মালিকরা robots.txt দিয়ে অপ্ট-আউট করতে পারে।

AI ক্রলার ব্লকের গ্রহণযোগ্যতা দ্রুত বেড়েছে। শীর্ষ-র‍্যাঙ্কড ডোমেইনের একটি নমুনা ট্র্যাক করা গবেষণায় দেখা গেছে, OpenAI GPTBot-এর user-agent স্ট্রিং প্রকাশ করার (আগস্ট ২০২৩) এক বছরের মধ্যেই বড় প্রকাশকদের একটি উল্লেখযোগ্য অংশ এটি ব্লক করেছিল — যার মধ্যে ছিল New York Times, Reuters এবং সংবাদশিল্পের একটি বড় অংশ। একটি বিশ্লেষণে সংখ্যাটি ২০২৪ সালের শেষ নাগাদ শীর্ষ ১,০০০ সাইটের ২৫%-এর বেশি বলা হয়। প্রকাশকরা কপিরাইট উদ্বেগ, ক্ষতিপূরণের অনুপস্থিতি এবং প্রতিযোগীদের পণ্য প্রশিক্ষণের সম্ভাবনাকে কারণ হিসেবে উল্লেখ করেন। AI ক্রলার ব্লক করা সঠিক সিদ্ধান্ত কিনা তা আপনার অগ্রাধিকারের ওপর নির্ভর করে: এটি ভবিষ্যৎ প্রশিক্ষণ রান থেকে আপনার কন্টেন্ট সরিয়ে দেয় কিন্তু আপনার সার্চ র‍্যাঙ্কিংয়ে সরাসরি কোনো প্রভাব ফেলে না।

প্রায়ই যে প্রশ্নটি ওঠে: Google-Extended ব্লক করলে কি Google Search-এ আপনার অবস্থান ক্ষতিগ্রস্ত হয়? Google স্পষ্টভাবে বলেছে যে Google-Extended এবং Googlebot আলাদা নিয়ন্ত্রণসহ স্বতন্ত্র ক্রলার। robots.txt-এ Google-Extended disallow করা Google-কে বলে আপনার কন্টেন্ট Gemini প্রশিক্ষণে ব্যবহার না করতে, কিন্তু এটি Googlebot-এর ক্রলিং বা আপনার অর্গানিক সার্চ ইনডেক্সেশনে কোনো প্রভাব ফেলে না। আপনি উপরে তালিকাভুক্ত সব AI প্রশিক্ষণ ক্রলার ব্লক করতে পারেন অথচ GooglebotBingbot সম্পূর্ণ সক্রিয় রেখে, আর আপনার সার্চ দৃশ্যমানতা অক্ষত থাকে। এই জেনারেটরের Block AI bots প্রিসেট ঠিক এটিই করে।

Frequently asked questions

robots.txt কী কাজে লাগে?

robots.txt হলো আপনার সাইটের রুটে থাকা একটি প্লেইন-টেক্সট ফাইল যা সার্চ-ইঞ্জিন ক্রলারদের বলে দেয় কোন URL তারা অনুরোধ করতে পারে বা পারে না। যেমন, Disallow: /cart/ ক্রলারদের আপনার শপিং-কার্ট পেজগুলো এড়িয়ে যেতে বলে, যাতে তারা তাদের ক্রল বাজেট SEO-এর জন্য সত্যিকারের গুরুত্বপূর্ণ পেজে ব্যয় করে। এটি Robots Exclusion Protocol-এর অংশ (এখন RFC 9309 হিসেবে স্ট্যান্ডার্ডাইজড) যা Google, Bing এবং অন্যান্য প্রধান ক্রলার মেনে চলে — কিন্তু এটি ক্রলিং নিয়ন্ত্রণ করে, অ্যাক্সেস বা নিরাপত্তা নয়। যে কেউ yoursite.com/robots.txt-এ আপনার robots.txt পড়তে পারে, তাই এটি কোনো প্রাইভেসি টুল নয়।

আমি কীভাবে একটি robots.txt ফাইল তৈরি করব?

উপরের বিল্ডারটি ব্যবহার করুন: একটি প্রিসেট বেছে নিন বা একটি নিয়ম গ্রুপ যোগ করুন, User-agent সেট করুন (সব ক্রলারের জন্য * ব্যবহার করুন), Disallow বা Allow করার পাথগুলো তালিকাভুক্ত করুন, ঐচ্ছিকভাবে একটি Crawl-delay যোগ করুন, এবং আপনার Sitemap URL পেস্ট করুন। আপনি টাইপ করার সাথে সাথে লাইভ আউটপুট আপডেট হয় — Copy বা Download ক্লিক করে এটি robots.txt হিসেবে সংরক্ষণ করুন, তারপর আপনার সাইটের রুট ফোল্ডারে আপলোড করুন যাতে এটি https://yoursite.com/robots.txt-এ অ্যাক্সেসযোগ্য হয়। কোনো কোডিং লাগে না, এবং পাথ টেস্টার প্রকাশের আগে আপনার নিয়ম যাচাই করে।

technicalseo.com বা seoptimer.com-এর মতো অন্যান্য robots.txt জেনারেটরের সাথে এটি কেমন তুলনীয়?

TechnicalSEO.com-এর robots.txt জেনারেটর এবং SEOptimer দুটোই বৈধ ফাইল তৈরি করে, কিন্তু কোনোটিতেই একটি বিল্ট-ইন পাথ টেস্টার নেই যা দেখায় কোন নিয়ম একটি নির্দিষ্ট URL-এ প্রযোজ্য। এই টুলে তা আছে: যেকোনো পাথ ও ক্রলার নাম লিখুন, আর এটি বলে দেয় আপনার বর্তমান নিয়ম সেটি allow করে না block করে, Google যে longest-match লজিক প্রয়োগ করে সেটি ব্যবহার করে। এটি সাধারণ ভুলগুলোও লাইভ চিহ্নিত করে — শুরুতে স্ল্যাশ না থাকা, রিলেটিভ sitemap URL, Googlebot-এর দিকে তাক করা Crawl-delay (যা এটি উপেক্ষা করে)। এসব কিছুই আপনার ব্রাউজারে চলে, কোনো ডেটা সার্ভারে পাঠানো হয় না।

robots.txt ফাইলটি আমি কোথায় রাখব?

এটি অবশ্যই আপনার ডোমেইনের রুট ডিরেক্টরিতে থাকতে হবে এবং ঠিক https://yoursite.com/robots.txt-এ পরিবেশিত হতে হবে — /blog/robots.txt-এর মতো কোনো সাবফোল্ডারে নয়, যা ক্রলাররা উপেক্ষা করে। প্রতিটি সাবডোমেইনের নিজস্ব ফাইল দরকার, তাই blog.yoursite.com এবং shop.yoursite.com প্রত্যেকের একটি করে আলাদা robots.txt লাগবে। WordPress-এ আপনি এটি FTP বা আপনার হোস্টের ফাইল ম্যানেজারের মাধ্যমে আপলোড করতে পারেন (অথবা Yoast SEO-এর মতো একটি প্লাগইন ব্যবহার করতে পারেন যা এটি আপনার হয়ে পরিচালনা করে)। Blogger-এ আপনি Settings → Search preferences-এ একটি কাস্টম robots.txt চালু করেন।

robots.txt-এ User-agent কী?

User-agent সেই ক্রলারের নাম দেয় যার জন্য একটি নিয়ম ব্লক প্রযোজ্য। User-agent: * প্রতিটি ক্রলারকে টার্গেট করে, আর User-agent: Googlebot শুধু Google-এর প্রধান ওয়েব ক্রলারকে টার্গেট করে। আপনার একাধিক গ্রুপ থাকতে পারে — যেমন, সবাইকে allow কিন্তু GPTBot ব্লক করা — এবং প্রতিটি ক্রলার তার নামের সাথে মেলা সবচেয়ে নির্দিষ্ট গ্রুপ মানে। প্রচলিত মানগুলোর মধ্যে আছে Googlebot, Bingbot, Googlebot-Image, GPTBot (OpenAI ChatGPT প্রশিক্ষণে ব্যবহার করে), CCBot (Common Crawl, অনেক AI প্রশিক্ষণ ডেটাসেটে ব্যবহৃত), Google-Extended (Google-এর Gemini ব্যবহার করে), এবং PerplexityBot।

Allow এবং Disallow-এর মধ্যে পার্থক্য কী?

Disallow একটি ক্রলারকে মেলানো URL না আনতে বলে; Allow সেগুলো আনার অনুমতি দেয়। Allow মূলত একটি disallow করা ফোল্ডারের ভেতরে একটি ব্যতিক্রম তৈরি করতে ব্যবহৃত হয়। যেমন, Disallow: /wp-admin/ সহ Allow: /wp-admin/admin-ajax.php WordPress অ্যাডমিন এলাকা ব্লক করে কিন্তু ক্রলারদের প্রয়োজনীয় একটি AJAX ফাইল যেতে দেয়। নিয়ম সংঘর্ষ করলে Google সবচেয়ে নির্দিষ্ট (দীর্ঘতম) মেলানো পাথ অনুসরণ করে, এবং সমান দৈর্ঘ্যের টাই Allow জেতে। Bing একই লজিক ব্যবহার করে; Yandex এজ কেসে সামান্য আলাদা।

robots.txt-এ কীভাবে একটি sitemap যোগ করব?

সম্পূর্ণ অ্যাবসোলিউট URL সহ একটি Sitemap: লাইন যোগ করুন, যেমন Sitemap: https://example.com/sitemap.xml। এটি ফাইলের যেকোনো জায়গায় থাকতে পারে এবং কোনো User-agent গ্রুপের সাথে বাঁধা নয়, আর আপনি আলাদা লাইনে একাধিক sitemap তালিকাভুক্ত করতে পারেন। উপরের Sitemap ফিল্ডে URL পেস্ট করুন, আর টুলটি লাইনটি সঠিকভাবে বসিয়ে দেয়। Google-এর ডকুমেন্টেশন Search Console-এ সরাসরি sitemap জমা দেওয়ার পাশাপাশি এই পদ্ধতির পরামর্শ দেয়, কারণ উভয় উপায়ই Google-কে আপনার সব পেজ আবিষ্কার করতে সাহায্য করে।

Google থেকে কীভাবে একটি পেজ ব্লক করব?

Google-কে একটি পেজ ক্রল করা থেকে থামাতে, তার পাথের জন্য একটি Disallow: নিয়ম যোগ করুন, যেমন Disallow: /draft-page/। কিন্তু ক্রলিং ব্লক করা আর ফলাফল থেকে একটি পেজ সরানো এক জিনিস নয় — অন্য সাইট লিংক করলে একটি disallow করা URL এখনও ইনডেক্স হতে পারে। একটি পেজকে সত্যিই Google থেকে দূরে রাখতে, একটি noindex ডিরেক্টিভ (meta name='robots' content='noindex') বা একটি X-Robots-Tag হেডার যোগ করুন, এবং সেটি robots.txt-এও ব্লক করবেন না, নইলে Google পেজটি ক্রল করে noindex নির্দেশনা দেখতে পারবে না।

robots.txt কি ইনডেক্সিং থামায়?

না। robots.txt ক্রলিং নিয়ন্ত্রণ করে, ইনডেক্সিং নয়। আপনি যদি একটি URL Disallow করেন, Google তার কন্টেন্ট আনবে না, কিন্তু অন্য জায়গা থেকে লিংক থাকলে URL-টি নিজেই ফলাফলে দেখা যেতে পারে — প্রায়ই কোনো বিবরণ ছাড়াই। একটি পেজ ইনডেক্স থেকে সরাতে, পেজেই একটি noindex ডিরেক্টিভ ব্যবহার করুন এবং পেজটি ক্রলযোগ্য রাখুন যাতে Google সেই ডিরেক্টিভ পড়তে পারে। এটি সবচেয়ে সাধারণ SEO ভুলগুলোর একটি: মানুষ ফলাফল থেকে পেজ সরাতে Disallow নিয়ম যোগ করে তারপর অবাক হয় কেন পেজগুলো এখনও দেখা যাচ্ছে।

Google Search Console-এ 'blocked by robots.txt' মানে কী?

Google Search Console-এ 'Blocked by robots.txt' মানে Google একটি URL আবিষ্কার করেছে কিন্তু আপনার robots.txt তাকে সেই URL ক্রল না করতে বলেছে, তাই সেই ক্রল থেকে পেজটি আনা বা ইনডেক্স করা হয়নি। পেজটি পাবলিক হওয়া উচিত হলে, মেলানো Disallow নিয়ম সরিয়ে বা সংকুচিত করে এটি ঠিক করুন। ব্লকটি ইচ্ছাকৃত হলে — একটি অ্যাডমিন পাথ, স্টেজিং এলাকা বা পাতলা-কন্টেন্ট পেজ — সেটি রেখে দেওয়া নিরাপদ। ফাইল সম্পাদনের আগে ঠিক কোন নিয়ম একটি প্রদত্ত URL ব্লক করছে তা দেখতে এই জেনারেটরের পাথ টেস্টার ব্যবহার করুন।

crawl-delay কী?

Crawl-delay একটি ক্রলারকে সার্ভার লোড কমাতে অনুরোধের মধ্যে নির্দিষ্ট সংখ্যক সেকেন্ড অপেক্ষা করতে বলে। Crawl-delay: 10 মানে মোটামুটি প্রতি ১০ সেকেন্ডে একটি অনুরোধ। Bing ও Yandex এটি মানে; Googlebot Crawl-delay সম্পূর্ণভাবে উপেক্ষা করে — বদলে Search Console-এর Crawl Stats রিপোর্টে Google-এর ক্রল হার সেট করুন। শুধু তখনই Crawl-delay যোগ করুন যখন আপনার সার্ভার সত্যিই ক্রলিংয়ের চাপে আছে, কারণ একটি উচ্চ মান আপনার সাইট কত দ্রুত ইনডেক্স হয় তা ধীর করে দেয়।

WordPress বা Blogger-এর জন্য কীভাবে একটি robots.txt তৈরি করব?

উপরের WordPress বা Blogger প্রিসেটে ক্লিক করুন। WordPress-এর স্ট্যান্ডার্ড ফাইল অ্যাডমিন এলাকা ব্লক করে কিন্তু ক্রলারদের প্রয়োজনীয় একটি Ajax ফাইল রাখে: User-agent: * / Disallow: /wp-admin/ / Allow: /wp-admin/admin-ajax.php। Blogger-এর ডিফল্ট তার সার্চ পেজ ছাড়া সবকিছু allow করে: User-agent: * / Disallow: /search / Allow: /। আপনার sitemap URL যোগ করুন, তারপর ফলাফলটি WordPress-এ কপি করুন (Yoast SEO-এর মাধ্যমে বা FTP দিয়ে ফাইল আপলোড করে) অথবা Blogger-এ Settings → Search preferences → Custom robots.txt-এ পেস্ট করুন।

কীভাবে আমার robots.txt টেস্ট বা যাচাই করব?

এই টুলের পাথ টেস্টার ব্যবহার করুন: একটি URL বা পাথ (যেমন /blog/post-1) এবং একটি ক্রলার নাম লিখুন, আর এটি বলে দেয় আপনার বর্তমান নিয়ম সেটি allow করে না block করে — এবং কোন নির্দিষ্ট নিয়ম সিদ্ধান্ত নেয়, Google যে longest-match লজিক প্রয়োগ করে সেটি ব্যবহার করে। বিল্ডারটি সাধারণ ভুলও লাইভ চিহ্নিত করে, যেমন শুরুর স্ল্যাশ না থাকা একটি পাথ বা একটি রিলেটিভ sitemap URL। প্রকাশের পর, Google Search Console-এর robots.txt রিপোর্টে লাইভ ফাইল নিশ্চিত করুন এবং নির্দিষ্ট পেজ চেক করতে URL Inspection টুল ব্যবহার করুন।

robots.txt কি নিরাপদ?

robots.txt ব্যবহার করা নিরাপদ, কিন্তু এটি কোনো নিরাপত্তা টুল নয়। এটি একটি পাবলিক ফাইল যা যে কেউ yoursite.com/robots.txt-এ পড়তে পারে, তাই সেখানে একটি 'গোপন' ফোল্ডার তালিকাভুক্ত করা আসলে যে কেউ চেক করলে তার কাছে সেটি বিজ্ঞাপিত করে। ভদ্র ক্রলার — Google, Bing, Apple — নিয়ম মানে, কিন্তু ক্ষতিকর বট সেগুলো সম্পূর্ণভাবে উপেক্ষা করতে পারে। সংবেদনশীল পেজ সুরক্ষিত করতে প্রকৃত অথেন্টিকেশন (লগইন, পাসওয়ার্ড, IP অ্যালোলিস্টিং) বা সার্ভার-সাইড অ্যাক্সেস নিয়ন্ত্রণ ব্যবহার করুন। প্রাইভেট ডেটা লুকাতে কখনও Disallow-এর ওপর নির্ভর করবেন না।

আমার কন্টেন্টে প্রশিক্ষণ থেকে AI বট কীভাবে ব্লক করব?

প্রতিটি AI প্রশিক্ষণ ক্রলারের জন্য আলাদা User-agent গ্রুপ যোগ করুন এবং প্রত্যেকের জন্য Disallow: / দিন। প্রধানগুলো: GPTBot (OpenAI / ChatGPT), CCBot (Common Crawl, অনেক AI প্রশিক্ষণ ডেটাসেটে ব্যবহৃত), Google-Extended (Google-এর Gemini ও Vertex AI), ClaudeBot (Anthropic / Claude), PerplexityBot, Applebot-Extended, এবং meta-externalagent (Meta / Llama)। এই জেনারেটরের 'Block AI bots' প্রিসেট এক ক্লিকেই এসব যোগ করে, একই সাথে সাধারণ সার্চ ক্রলার (Googlebot, Bingbot) অক্ষত রাখে যাতে আপনার কন্টেন্ট ইনডেক্সড থাকে।

নতুন

UTM বিল্ডার

utm_source, medium, campaign এবং আরও সহ ট্র্যাকযোগ্য ক্যাম্পেইন URL তৈরি করুন।

SEO ও মার্কেটিং
নতুন

SERP স্নিপেট প্রিভিউ

আপনার শিরোনাম ও বিবরণ Google-এ ডেস্কটপ ও মোবাইলে কেমন দেখায় তা প্রিভিউ করুন।

SEO ও মার্কেটিং
নতুন

Slug জেনারেটর

যেকোনো শিরোনামকে পরিচ্ছন্ন, SEO-বান্ধব URL slug-এ রূপান্তর করুন — বাল্ক ও অ্যাকসেন্ট-সচেতন।

SEO ও মার্কেটিং
নতুন

মেটা ট্যাগ জেনারেটর

লাইভ প্রিভিউ সহ SEO, Open Graph ও Twitter Card মেটা ট্যাগ তৈরি করুন।

SEO ও মার্কেটিং
নতুন

পাসওয়ার্ড শক্তি পরীক্ষক

এনট্রপি, ক্র্যাক-সময়ের আনুমানিক হিসাব ও পরামর্শ সহ পাসওয়ার্ডের শক্তি পরীক্ষা করুন।

নিরাপত্তা ও গোপনীয়তা
নতুন

স্টপওয়াচ ও টাইমার

ল্যাপ সহ সঠিক অনলাইন স্টপওয়াচ এবং প্রিসেট সহ কাউন্টডাউন টাইমার।

উৎপাদনশীলতা