Skip to content
Robots.txt 產生器
Tools

Robots.txt 產生器

建立有效的 robots.txt,含 allow/disallow 規則與 sitemap 行。

Quick presets
Generated robots.txt
Test a URL Check whether your rules allow or block a path — same longest-match logic Google uses.

Disallow blocks crawling, not indexing. A blocked URL can still appear in Google if other sites link to it. To remove a page from search results, keep it crawlable and add a noindex meta tag or X-Robots-Tag header. robots.txt is also a public file and is not a security measure — protect private pages with real authentication.

robots.txt syntax cheat-sheet
Directive What it does
User-agent: *Which crawler the rules apply to (* = all bots).
Disallow: /pathAsk crawlers not to crawl URLs that start with this path.
Allow: /pathPermit a path, typically an exception inside a disallowed area.
Crawl-delay: 10Seconds between requests. Bing & Yandex honor it; Google ignores it.
Sitemap: https://…Absolute URL of your sitemap. Can appear anywhere in the file.
*Wildcard — matches any sequence of characters in a path.
$Anchors a rule to the end of the URL, e.g. /*.pdf$.
#A comment — the rest of the line is ignored by crawlers.

Runs entirely in your browser. Nothing is uploaded.

在瀏覽器中免費產生 robots.txt

這款 robots.txt 產生器將簡易表單轉換為符合規範的 robots.txt 檔案——無需記憶語法,也不必安裝任何工具。選擇預設範本或自行建立爬蟲規則,即時預覽檔案內容,再複製或下載後放置於網站根目錄即可。所有操作均在瀏覽器本機完成,您所設定的規則不會上傳至任何伺服器。

無論您需要一個現成的 robots.txt 範例作為起點、針對特定爬蟲的自訂 robots.txt,還是專為 WordPress、Blogger 或封鎖 AI 訓練爬蟲所調整的設定,幾秒鐘內即可完成。內建路徑測試器可在發布前驗證規則的正確性——這是多數同類工具所缺乏的功能。

無需記憶語法,輕鬆建立爬蟲規則

每組規則將 User-agent 與您想要 Allow(允許)Disallow(禁止)的路徑配對,並可選擇加入 Crawl-delay。使用 * 套用至所有爬蟲,或指定特定機器人如 GooglebotBingbot——開始輸入時欄位會自動建議常見爬蟲名稱。可依需求新增多個規則群組,為不同爬蟲套用不同規則。

每行填寫一條路徑;工具會自動格式化為正確的 Disallow:Allow: 指令,並按正確順序組合各規則群組。填入您的 Sitemap 網址後,工具會將其附加為絕對路徑的 Sitemap: 指令,協助爬蟲找到您希望被收錄的所有頁面。Google 爬蟲會讀取此設定,並與直接在 Search Console 提交的 Sitemap 一併使用。

WordPress、Blogger 與封鎖 AI 機器人的預設範本

一鍵載入現成起點。允許全部封鎖全部涵蓋兩種極端情況。WordPress 預設載入官方建議設定:封鎖 /wp-admin/,但保留 /wp-admin/admin-ajax.php 供外掛所需的 AJAX 呼叫使用。Blogger 預設載入 Google 建議的 Blogger 設定:允許所有路徑,但封鎖 /search 以避免重複內容問題。

封鎖 AI 機器人預設適合希望內容繼續出現在 Google 和 Bing,但不想被 AI 模型訓練所使用的網站主。此預設會封鎖 GPTBot(OpenAI)、CCBot(Common Crawl)、Google-Extended(Gemini)、ClaudeBot(Anthropic)、PerplexityBot 等,同時不影響一般搜尋引擎爬蟲。《紐約時報》、《衛報》及眾多主要媒體在 2023 年起陸續加入了類似的封鎖設定。

發布前先測試網址

無法自我測試的產生器只做了一半的工作。內建的路徑測試器讓您輸入任意網址或路徑,以及爬蟲名稱,即可得知目前規則是否允許或封鎖該路徑——並明確顯示是哪條 AllowDisallow 規則生效,採用與 Google 相同的最長匹配邏輯(最具體的規則優先,當長度相同時 Allow 優先)。

輸入時,工具也會即時顯示常見錯誤警告,例如路徑缺少開頭的斜線、相對路徑的 Sitemap 網址,或針對 Googlebot 設定 Crawl-delay(Googlebot 會忽略此設定,需改在 Search Console 中另行設定)。在發布前修正這些問題,可節省事後在 Google Search Console 中除錯的時間。

爬取與索引的差異,以及常見錯誤

最常見的 robots.txt 誤解:使用 Disallow 可將頁面從 Google 移除。事實並非如此。Disallow 只會阻止爬取,但被封鎖的網址仍可能出現在搜尋結果中——當其他頁面連結至該網址時,Google 甚至可能在沒有摘要的情況下收錄它,只顯示網址而無任何描述。若要讓頁面不出現在搜尋中,應保持頁面可被爬取,並在頁面本身加入 noindex 標籤。若在 robots.txt 中封鎖該頁面,Google 將無法爬取頁面以讀取 noindex 指令,該網址可能長期留在索引中。

此外,請記住 robots.txt 是公開且僅供參考的檔案。它位於固定、可讀取的網址,並非安全屏障,且只有遵守規範的機器人才會遵循。請用它來引導爬取預算、整理重複或低品質頁面——而非用來隱藏真正需要保護的內容。對於敏感資料,請使用身份驗證。本工具完全在您的瀏覽器中執行,您的網站內部路徑不會離開您的裝置。

Frequently asked questions

robots.txt 是用來做什麼的?

robots.txt 是放在網站根目錄的純文字檔案,用來告知搜尋引擎爬蟲哪些網址可以或不可以存取。例如,Disallow: /cart/ 要求爬蟲跳過購物車頁面,讓爬取預算集中於對 SEO 真正重要的頁面。這是機器人排除協定(現已標準化為 RFC 9309)的一部分,Google、Bing 及其他主要爬蟲均會遵守——但它控制的是爬取行為,而非存取權限或安全性。任何人都可以在 yoursite.com/robots.txt 讀取您的 robots.txt,因此它並非隱私保護工具。

如何建立 robots.txt 檔案?

使用上方的產生器:選擇預設範本或新增規則群組,設定 User-agent(使用 * 代表所有爬蟲),列出要 Disallow 或 Allow 的路徑,視需要加入 Crawl-delay,並貼上您的 Sitemap 網址。輸入時即時預覽輸出內容——點擊「複製」或「下載」儲存為 robots.txt,再上傳至網站根目錄,確保可透過 https://yoursite.com/robots.txt 存取。無需撰寫程式碼,路徑測試器可在發布前確認規則正確無誤。

這個工具與 technicalseo.com 或 seoptimer.com 的 robots.txt 產生器相比如何?

TechnicalSEO.com 的 robots.txt 產生器和 SEOptimer 都能產生有效的檔案,但兩者都沒有內建路徑測試器,無法顯示特定網址適用哪條規則。本工具可以:輸入任意路徑和爬蟲名稱,即可得知目前規則是否允許或封鎖,採用與 Google 相同的最長匹配邏輯。工具也會即時標記常見錯誤——路徑缺少開頭斜線、相對路徑的 Sitemap 網址、針對 Googlebot 設定 Crawl-delay(Googlebot 會忽略此設定)。所有操作均在瀏覽器中執行,不傳送任何資料至伺服器。

robots.txt 檔案要放在哪裡?

必須放在您網域的根目錄,並可透過 https://yoursite.com/robots.txt 精確存取——不能放在子資料夾如 /blog/robots.txt,爬蟲不會讀取子資料夾的設定。每個子網域需要各自的檔案,因此 blog.yoursite.com 和 shop.yoursite.com 都需要各自的 robots.txt。在 WordPress 中,可透過 FTP 或主機的檔案管理員上傳(或使用 Yoast SEO 等外掛自動管理)。在 Blogger 中,可在「設定」→「搜尋偏好」→「自訂 robots.txt」中啟用並貼上內容。

robots.txt 中的 User-agent 是什麼意思?

User-agent 指定一組規則適用於哪個爬蟲。User-agent: * 針對所有爬蟲,而 User-agent: Googlebot 則只針對 Google 的主要網路爬蟲。您可以設定多個群組——例如允許所有人但封鎖 GPTBot——每個爬蟲會遵守與其名稱最匹配的群組規則。常見的值包括:Googlebot、Bingbot、Googlebot-Image、GPTBot(OpenAI 用於訓練 ChatGPT)、CCBot(Common Crawl,被許多 AI 訓練資料集使用)、Google-Extended(Google 的 Gemini 使用)及 PerplexityBot。

Allow 和 Disallow 有什麼差別?

Disallow 要求爬蟲不要抓取符合條件的網址;Allow 則允許抓取。Allow 主要用於在已封鎖的資料夾中設定例外。例如,Disallow: /wp-admin/ 加上 Allow: /wp-admin/admin-ajax.php 可封鎖 WordPress 管理區域,但讓爬蟲所需的 AJAX 檔案通過。當規則衝突時,Google 會遵循最具體(最長)的匹配路徑,若長度相同則 Allow 優先。Bing 使用相同邏輯;Yandex 在邊緣情況下略有不同。

如何在 robots.txt 中加入 Sitemap?

新增一行 Sitemap: 並附上完整的絕對網址,例如 Sitemap: https://example.com/sitemap.xml。此行可放在檔案中的任何位置,且不受任何 User-agent 群組限制;您也可以在不同行列出多個 Sitemap。在上方的 Sitemap 欄位貼上網址,工具即會將該行正確放置。Google 的文件建議同時採用此方法與直接在 Search Console 提交 Sitemap,因為兩者都有助於 Google 發現您的所有頁面。

如何封鎖 Google 爬取特定頁面?

若要阻止 Google 爬取某頁面,針對該路徑新增 Disallow: 規則,例如 Disallow: /draft-page/。但封鎖爬取並不等於從搜尋結果中移除頁面——被封鎖的網址若有其他網站連結,仍可能被收錄。若要真正將頁面排除在 Google 搜尋之外,請加入 noindex 指令(meta name='robots' content='noindex')或 X-Robots-Tag 標頭,並且不要在 robots.txt 中封鎖該頁面,否則 Google 無法爬取頁面以讀取 noindex 指令。

robots.txt 可以阻止頁面被收錄嗎?

不行。robots.txt 控制的是爬取,而非收錄。若您 Disallow 某個網址,Google 不會抓取其內容,但該網址本身仍可能出現在搜尋結果中——通常沒有描述——因為其他頁面連結了它。若要將頁面從索引中移除,請在頁面本身使用 noindex 指令,並保持頁面可被爬取,讓 Google 能讀取該指令。這是最常見的 SEO 錯誤之一:網站主新增 Disallow 規則想要移除頁面,卻疑惑為何頁面仍然出現在搜尋結果中。

Google Search Console 中的「已被 robots.txt 封鎖」是什麼意思?

在 Google Search Console 中,「已被 robots.txt 封鎖」表示 Google 發現了某個網址,但您的 robots.txt 指示它不要爬取該網址,因此該頁面未被抓取或從此次爬取中收錄。若該頁面應為公開,請移除或縮小對應的 Disallow 規則。若封鎖是刻意為之——例如管理員路徑、測試環境或低品質頁面——則可安心保留。在編輯檔案前,請使用本產生器的路徑測試器,確認究竟是哪條規則封鎖了指定網址。

crawl-delay 是什麼?

Crawl-delay 要求爬蟲在每次請求之間等待指定秒數,以減輕伺服器負擔。Crawl-delay: 10 表示大約每 10 秒發出一次請求。Bing 和 Yandex 會遵守此設定;Googlebot 完全忽略 Crawl-delay——若需設定 Google 的爬取頻率,請改在 Search Console 的「爬取統計資料」報告中調整。只有在伺服器確實因爬取而承受壓力時,才建議加入 Crawl-delay,因為較高的值會減慢網站被收錄的速度。

如何為 WordPress 或 Blogger 製作 robots.txt?

點擊上方的 WordPress 或 Blogger 預設按鈕即可載入。WordPress 的標準設定封鎖管理員區域,但保留 AJAX 檔案:User-agent: * / Disallow: /wp-admin/ / Allow: /wp-admin/admin-ajax.php。Blogger 的預設設定允許所有內容,除了搜尋頁面:User-agent: * / Disallow: /search / Allow: /。填入您的 Sitemap 網址,然後將結果複製至 WordPress(透過 Yoast SEO 或以 FTP 上傳檔案),或貼至 Blogger 的「設定」→「搜尋偏好」→「自訂 robots.txt」中。

如何測試或驗證我的 robots.txt?

使用本工具的路徑測試器:輸入網址或路徑(例如 /blog/post-1)和爬蟲名稱,即可得知目前規則是否允許或封鎖該路徑——並顯示哪條具體規則生效,採用與 Google 相同的最長匹配邏輯。產生器也會即時標記常見錯誤,例如路徑缺少開頭斜線或 Sitemap 使用相對路徑。發布後,請在 Google Search Console 的 robots.txt 報告中確認線上檔案是否正確,並使用「網址檢查」工具核查特定頁面。

robots.txt 安全嗎?

robots.txt 使用起來是安全的,但它並非安全工具。這是一個任何人都可在 yoursite.com/robots.txt 讀取的公開檔案,因此將「秘密」資料夾列在其中,反而會向所有查看者公開其存在。Google、Bing、Apple 等遵守規範的爬蟲會遵循規則,但惡意爬蟲可能完全忽略這些設定。若要保護敏感頁面,請使用正式的身份驗證機制(登入、密碼、IP 白名單)或伺服器端存取控制。切勿依賴 Disallow 來隱藏私密資料。

如何防止 AI 機器人使用我的內容進行訓練?

為每個 AI 訓練爬蟲分別建立 User-agent 群組,並設定 Disallow: /。主要的 AI 爬蟲包括:GPTBot(OpenAI / ChatGPT)、CCBot(Common Crawl,被許多 AI 訓練資料集使用)、Google-Extended(Google 的 Gemini 和 Vertex AI)、ClaudeBot(Anthropic / Claude)、PerplexityBot、Applebot-Extended,以及 meta-externalagent(Meta / Llama)。本產生器的「封鎖 AI 機器人」預設只需一鍵即可新增所有這些設定,同時保持一般搜尋爬蟲(Googlebot、Bingbot)不受影響,讓您的內容繼續被收錄。

Related tools

檢視所有工具