Robots.txt 生成器
新生成有效的 robots.txt,含 allow/disallow 规则与 sitemap 行。
Disallow blocks crawling, not indexing. A blocked URL can still
appear in Google if other sites link to it. To remove a page from search results, keep it crawlable
and add a noindex meta tag or X-Robots-Tag header. robots.txt is also a
public file and is not a security measure — protect private pages with real authentication.
robots.txt syntax cheat-sheet
| Directive | What it does |
|---|---|
| User-agent: * | Which crawler the rules apply to (* = all bots). |
| Disallow: /path | Ask crawlers not to crawl URLs that start with this path. |
| Allow: /path | Permit a path, typically an exception inside a disallowed area. |
| Crawl-delay: 10 | Seconds between requests. Bing & Yandex honor it; Google ignores it. |
| Sitemap: https://… | Absolute URL of your sitemap. Can appear anywhere in the file. |
| * | Wildcard — matches any sequence of characters in a path. |
| $ | Anchors a rule to the end of the URL, e.g. /*.pdf$. |
| # | A comment — the rest of the line is ignored by crawlers. |
Runs entirely in your browser. Nothing is uploaded.
免费 robots.txt 生成器,直接在浏览器中运行
这款 robots.txt 生成器通过简单的表单即可生成合规的 robots.txt 文件——无需记忆语法,无需安装任何软件。选择预设方案或自定义抓取规则,文件内容实时更新,完成后一键复制或下载,上传至网站根目录即可使用。所有操作均在本地浏览器完成,您填写的规则不会上传至任何服务器。
无论是需要一个快速上手的 robots.txt 示例、针对特定爬虫的 自定义 robots.txt,还是适配 WordPress、Blogger 或屏蔽 AI 训练爬虫的配置,几秒内即可生成。内置路径测试功能,发布前即可验证规则是否生效——这是大多数同类工具所缺少的功能。
无需记忆语法,可视化构建抓取规则
每条规则组将 User-agent 与您希望 Allow(允许)或 Disallow(禁止)的路径配对,还可设置可选的 Crawl-delay(抓取延迟)。使用 * 匹配所有爬虫,或指定具体的爬虫名称,例如 Googlebot 或 百度蜘蛛——输入时字段会自动提示常见爬虫。根据需要添加多个规则组,为不同爬虫设置不同规则。
每行填写一个路径,工具会自动生成标准的 Disallow: 或 Allow: 指令,并按正确顺序合并规则组。填入 Sitemap 地址后,工具会自动在文件末尾添加绝对路径的 Sitemap: 行,引导爬虫发现您希望被收录的所有页面。Googlebot 会自动读取此配置,配合在 Search Console 中直接提交 Sitemap 效果更佳。
WordPress、Blogger 及屏蔽 AI 爬虫的一键预设
一键加载预配置的起始方案。允许全部和禁止全部覆盖两种极端情况。WordPress 预设加载推荐默认配置:禁止 /wp-admin/ 访问,但保留 /wp-admin/admin-ajax.php 供插件 AJAX 请求使用。Blogger 预设加载 Google 官方建议的 Blogger 配置:允许全部内容爬取,仅禁止 /search 页面以避免重复内容问题。
屏蔽 AI 爬虫预设适合希望内容继续在 Google 和百度收录、但不被用于 AI 模型训练的站长。该预设禁止 GPTBot(OpenAI)、CCBot(Common Crawl)、Google-Extended(Gemini)、ClaudeBot(Anthropic)、PerplexityBot 等爬虫,同时不影响正常搜索引擎爬虫。《纽约时报》、《卫报》等众多主流媒体已于 2023 年添加了类似屏蔽规则。
发布前先测试 URL
无法自测的生成器只完成了一半工作。内置的路径测试器允许您输入任意 URL 或路径及爬虫名称,即可查看当前规则是允许还是禁止访问——并精确显示是哪条 Allow 或 Disallow 规则生效,遵循与 Google 相同的最长匹配逻辑(最具体的规则优先,等长时 Allow 优先)。
输入过程中,工具还会实时提示易错点:路径缺少开头的斜杠、Sitemap 地址为相对路径、或 Crawl-delay 针对 Googlebot 设置(Googlebot 会忽略此项,需在 Search Console 单独配置)。上线前修复这些问题,避免事后通过 Google Search Console 反复排查。
抓取与收录的区别,以及常见错误
关于 robots.txt 最大的误解:Disallow 会让页面从 Google 消失。事实并非如此。Disallow 只是阻止爬取,被屏蔽的 URL 如果有其他页面链接指向它,仍然可能出现在搜索结果中。Google 甚至可能在没有摘要的情况下收录该 URL——只显示链接,没有描述。要让页面从搜索结果中消失,需保持页面可被爬取,并在页面本身添加 noindex 标签。如果在 robots.txt 中屏蔽了该页面,Google 就无法爬取并读取 noindex 指令,该 URL 可能会长期留在索引中。
另外请记住,robots.txt 是公开文件,且属于建议性质。它位于固定的公开 URL,不是安全屏障,只有合规爬虫才会遵守。请用它来优化抓取预算、整理重复或低质量页面——而非隐藏真正需要保护的内容。保护敏感内容应使用身份验证。本工具完全在浏览器端运行,您网站的内部路径不会离开您的设备。
Frequently asked questions
robots.txt 有什么作用?
robots.txt 是位于网站根目录的纯文本文件,用于告知搜索引擎爬虫哪些 URL 可以或不可以抓取。例如,Disallow: /cart/ 指示爬虫跳过购物车页面,让爬虫将抓取预算用在对 SEO 真正重要的页面上。它是爬虫排除协议(现已标准化为 RFC 9309)的组成部分,Google、百度、必应等主流爬虫均遵守该协议——但它控制的是抓取行为,而非访问权限或安全性。任何人都可以通过 yoursite.com/robots.txt 查看您的 robots.txt 文件,因此它不是隐私保护工具。
如何创建 robots.txt 文件?
使用上方的生成器:选择预设或添加规则组,设置 User-agent(使用 * 表示所有爬虫),列出需要 Disallow 或 Allow 的路径,可选添加 Crawl-delay,并粘贴 Sitemap URL。输入时实时预览输出内容——点击复制或下载,保存为 robots.txt 文件,然后上传至网站根目录,确保可通过 https://yoursite.com/robots.txt 访问。无需编写代码,路径测试器可在发布前验证规则是否正确。
这个工具和 technicalseo.com、seoptimer.com 等其他 robots.txt 生成器有什么区别?
TechnicalSEO.com 的 robots.txt 生成器和 SEOptimer 都能生成合规文件,但两者均不包含内置路径测试器——无法直观显示某个具体 URL 匹配哪条规则。本工具支持该功能:输入任意路径和爬虫名称,即可显示当前规则是允许还是屏蔽该路径,并采用与 Google 相同的最长匹配逻辑。工具还会实时提示常见错误——路径缺少开头斜杠、Sitemap 为相对路径、Crawl-delay 针对 Googlebot 设置(Googlebot 会忽略此项)。所有操作均在浏览器端完成,不向服务器发送任何数据。
robots.txt 文件应该放在哪里?
robots.txt 必须位于域名根目录,可通过 https://yoursite.com/robots.txt 精确访问——不能放在子目录中(如 /blog/robots.txt),爬虫会忽略子目录中的文件。每个子域名需要独立的 robots.txt 文件,例如 blog.yoursite.com 和 shop.yoursite.com 各需要一个单独的文件。WordPress 用户可通过 FTP 或主机文件管理器上传,也可使用 Yoast SEO 等插件自动管理。Blogger 用户可在「设置 → 搜索偏好设置」中启用自定义 robots.txt。
robots.txt 中的 User-agent 是什么?
User-agent 指定一组规则适用于哪个爬虫。User-agent: * 针对所有爬虫,User-agent: Googlebot 仅针对 Google 主爬虫。您可以设置多个规则组——例如允许所有爬虫但屏蔽 GPTBot——每个爬虫遵循与其名称最匹配的规则组。常见值包括:Googlebot、Bingbot、Baiduspider(百度)、Googlebot-Image、GPTBot(OpenAI 用于训练 ChatGPT)、CCBot(Common Crawl,被多个 AI 训练数据集使用)、Google-Extended(Google Gemini)以及 PerplexityBot。
Allow 和 Disallow 有什么区别?
Disallow 要求爬虫不要抓取匹配的 URL;Allow 则允许抓取。Allow 主要用于在已禁止的目录中开放例外路径。例如,Disallow: /wp-admin/ 加上 Allow: /wp-admin/admin-ajax.php,可屏蔽 WordPress 管理后台,但允许插件所需的 AJAX 文件通过。规则冲突时,Google 遵循最具体(最长)的匹配路径,等长时 Allow 优先。必应采用相同逻辑;Yandex 在边缘情况下略有不同。
如何在 robots.txt 中添加 Sitemap?
添加一行 Sitemap: 并填写完整的绝对路径 URL,例如 Sitemap: https://example.com/sitemap.xml。该行可放在文件任意位置,不归属于任何 User-agent 规则组,还可在多行分别列出多个 Sitemap。将 URL 粘贴到上方的 Sitemap 字段,工具会自动将其放置在正确位置。Google 官方文档建议同时在 Search Console 中直接提交 Sitemap,两种方式结合有助于 Google 发现您的所有页面。
如何防止 Google 抓取某个页面?
要阻止 Google 抓取某个页面,可为其路径添加 Disallow: 规则,例如 Disallow: /draft-page/。但阻止抓取与从搜索结果中删除页面并不相同——被 Disallow 的 URL 如果有其他网站链接指向它,仍可能被收录。要彻底让页面不出现在 Google 搜索结果中,应在页面添加 noindex 指令(meta name='robots' content='noindex')或 X-Robots-Tag 响应头,同时不要在 robots.txt 中屏蔽该页面,否则 Google 无法爬取页面并读取 noindex 指令。
robots.txt 会阻止页面被收录(索引)吗?
不会。robots.txt 控制的是抓取行为,而非收录。如果您 Disallow 了某个 URL,Google 不会抓取其内容,但当该 URL 被其他页面链接时,仍可能出现在搜索结果中——通常没有摘要描述,只显示 URL。要让页面从索引中消失,需在页面本身添加 noindex 指令,并保持页面可被爬取,以便 Google 能读取该指令。这是最常见的 SEO 误区之一:站长以为添加 Disallow 规则就能从搜索结果中删除页面,却发现页面依然出现在结果中。
Google Search Console 中的「被 robots.txt 屏蔽」是什么意思?
在 Google Search Console 中,「被 robots.txt 屏蔽」表示 Google 发现了某个 URL,但 robots.txt 指示不抓取该 URL,因此该页面未被抓取或收录。如果该页面应该公开,请修改或缩小对应的 Disallow 规则。如果屏蔽是有意为之——例如管理后台、测试环境或低质量页面——可以保持原样。使用本工具的路径测试器,可以在编辑文件前准确查看哪条规则屏蔽了特定 URL。
Crawl-delay(抓取延迟)是什么?
Crawl-delay 要求爬虫在两次请求之间等待指定的秒数,以减轻服务器压力。Crawl-delay: 10 表示大约每 10 秒发送一次请求。必应和 Yandex 支持该指令;Googlebot 完全忽略 Crawl-delay——如需控制 Google 的抓取频率,请在 Search Console 的抓取统计报告中设置。仅在服务器因爬取压力确实过大时才考虑添加 Crawl-delay,因为较高的值会降低网站被收录的速度。
如何为 WordPress 或 Blogger 生成 robots.txt?
点击上方的 WordPress 或 Blogger 预设即可。WordPress 标准配置屏蔽管理后台,但保留爬虫所需的 AJAX 文件:User-agent: * / Disallow: /wp-admin/ / Allow: /wp-admin/admin-ajax.php。Blogger 默认配置允许抓取所有内容,仅屏蔽搜索页面:User-agent: * / Disallow: /search / Allow: /。添加 Sitemap URL 后,将结果复制到 WordPress(通过 Yoast SEO 插件或 FTP 上传文件),或粘贴到 Blogger 的「设置 → 搜索偏好设置 → 自定义 robots.txt」中。
如何测试或验证 robots.txt?
使用本工具的路径测试器:输入 URL 或路径(例如 /blog/post-1)及爬虫名称,即可查看当前规则是允许还是屏蔽该路径——并显示具体是哪条规则生效,遵循与 Google 相同的最长匹配逻辑。生成器还会实时提示常见错误,如路径缺少开头斜杠或 Sitemap 为相对路径。发布后,可在 Google Search Console 的 robots.txt 报告中确认线上文件状态,并使用网址检查工具检查具体页面。
robots.txt 安全吗?
robots.txt 可以安全使用,但它不是安全工具。它是一个公开文件,任何人都可以通过 yoursite.com/robots.txt 查看,因此在其中列出「隐秘」目录反而会向查看者暴露该路径的存在。合规爬虫——Google、百度、苹果——会遵守规则,但恶意爬虫可能完全无视这些规定。要保护敏感页面,请使用真实的身份验证(登录、密码、IP 白名单)或服务器端访问控制。切勿依赖 Disallow 来隐藏私密数据。
如何防止 AI 爬虫抓取我的内容用于模型训练?
为每个 AI 训练爬虫分别添加 User-agent 规则组,并设置 Disallow: /。主要爬虫包括:GPTBot(OpenAI / ChatGPT)、CCBot(Common Crawl,被多个 AI 训练数据集使用)、Google-Extended(Google Gemini 和 Vertex AI)、ClaudeBot(Anthropic / Claude)、PerplexityBot、Applebot-Extended 以及 meta-externalagent(Meta / Llama)。本工具的「屏蔽 AI 爬虫」预设一键添加所有上述规则,同时不影响正常搜索引擎爬虫(Googlebot、Bingbot),确保您的内容继续被搜索引擎收录。
Related tools
查看全部工具UTM 链接构建器
构建可追踪的营销链接,含 utm_source、medium、campaign 等参数。
SERP 摘要预览
预览标题与描述在 Google 桌面端与移动端的显示效果。
URL Slug 生成器
将标题转换为简洁、SEO 友好的 URL slug,支持批量与重音处理。
Meta 标签生成器
生成 SEO、Open Graph 与 Twitter Card 元标签,实时预览。
密码强度检测器
通过熵值、破解耗时估算与建议来检测密码强度。
秒表与计时器
精准的在线秒表(支持计圈)与带预设的倒计时器。