Skip to content
Gerador de robots.txt
Tools

Gerador de robots.txt

Novo

Crie um robots.txt válido com regras allow/disallow e uma linha de sitemap.

Quick presets
Generated robots.txt
Test a URL Check whether your rules allow or block a path — same longest-match logic Google uses.

Disallow blocks crawling, not indexing. A blocked URL can still appear in Google if other sites link to it. To remove a page from search results, keep it crawlable and add a noindex meta tag or X-Robots-Tag header. robots.txt is also a public file and is not a security measure — protect private pages with real authentication.

robots.txt syntax cheat-sheet
Directive What it does
User-agent: *Which crawler the rules apply to (* = all bots).
Disallow: /pathAsk crawlers not to crawl URLs that start with this path.
Allow: /pathPermit a path, typically an exception inside a disallowed area.
Crawl-delay: 10Seconds between requests. Bing & Yandex honor it; Google ignores it.
Sitemap: https://…Absolute URL of your sitemap. Can appear anywhere in the file.
*Wildcard — matches any sequence of characters in a path.
$Anchors a rule to the end of the URL, e.g. /*.pdf$.
#A comment — the rest of the line is ignored by crawlers.

Runs entirely in your browser. Nothing is uploaded.

Um gerador de robots.txt gratuito que funciona no seu browser

Este gerador de robots.txt converte um formulário simples num ficheiro robots.txt válido — sem sintaxe para memorizar nem nada para instalar. Escolha uma predefinição ou crie as suas próprias regras de crawl, veja o ficheiro a ser montado em tempo real e depois copie-o ou descarregue-o para a raiz do seu site. Tudo acontece localmente no seu browser, pelo que as regras que escrever nunca são enviadas para um servidor.

Quer precise de um exemplo de robots.txt para começar, de um robots.txt personalizado para um crawler específico, ou de um ficheiro configurado para WordPress, Blogger ou para bloquear bots de treino de IA, pode tê-lo pronto em segundos. O testador de caminhos integrado valida as suas regras antes de publicar — algo que a maioria dos geradores concorrentes não oferece.

Crie regras de crawl sem memorizar a sintaxe

Cada grupo de regras associa um User-agent aos caminhos que pretende Permitir (Allow) ou Bloquear (Disallow), mais um Crawl-delay opcional. Use * para atingir todos os crawlers, ou indique um bot específico como Googlebot ou Bingbot — comece a escrever e o campo sugere os crawlers mais comuns. Adicione tantos grupos quantos precisar para dar regras diferentes a bots diferentes.

Liste um caminho por linha; a ferramenta formata cada um como uma diretiva Disallow: ou Allow: correta e une os seus grupos na ordem certa. Adicione o URL do seu Sitemap e este é acrescentado como uma linha absoluta Sitemap: que aponta os crawlers para todas as páginas que quer indexadas. O crawler da Google recolhe esta informação e usa-a em conjunto com qualquer sitemap submetido diretamente na Search Console.

Predefinições para WordPress, Blogger e bloqueio de bots de IA

Um clique carrega um ponto de partida já preparado. Permitir tudo e Bloquear tudo cobrem os dois extremos. WordPress carrega a predefinição recomendada: bloquear /wp-admin/ mas manter /wp-admin/admin-ajax.php aberto para as chamadas AJAX de que os plugins precisam. Blogger carrega a configuração sugerida pela Google para Blogger: permitir tudo exceto /search para evitar problemas de conteúdo duplicado.

A predefinição Bloquear bots de IA é útil se quiser que o seu conteúdo permaneça no Google e Bing sem ser utilizado para treinar modelos de IA. Bloqueia o GPTBot (OpenAI), CCBot (Common Crawl), Google-Extended (Gemini), ClaudeBot (Anthropic), PerplexityBot e outros — mantendo os crawlers de pesquisa normais sem restrições. O New York Times, The Guardian e muitos grandes meios de comunicação adicionaram bloqueios semelhantes em 2023.

Teste um URL antes de publicar

Um gerador que não consegue testar a si próprio só faz metade do trabalho. O testador de caminhos integrado permite-lhe introduzir qualquer URL ou caminho e um nome de crawler, indicando depois se as suas regras atuais o permitem ou bloqueiam — e exatamente qual a regra Allow ou Disallow que decide, usando a mesma lógica de correspondência mais longa que a Google aplica (a regra mais específica vence, e o Allow desempata quando o comprimento é igual).

À medida que escreve, a ferramenta apresenta também avisos em tempo real sobre erros que danificam silenciosamente ficheiros robots.txt reais: um caminho sem a barra inicial, um URL de sitemap relativo, ou um Crawl-delay direcionado ao Googlebot (que o ignora e requer uma definição separada na Search Console). Corrigir estes problemas antes de publicar evita uma ronda de depuração pela Google Search Console.

Crawling vs indexação — e outros erros comuns

O maior equívoco sobre robots.txt: Disallow remove uma página da Google. Não remove. Impede o crawling, mas um URL bloqueado pode continuar a aparecer nos resultados de pesquisa se outras páginas lhe fizerem link. A Google pode até indexá-lo sem snippet — apenas o URL sem descrição. Para manter uma página fora da pesquisa, deixe-a acessível ao crawler e adicione noindex na própria página. Se a bloquear no robots.txt, a Google nunca consegue fazer crawl da página para ver esse noindex, e o URL pode permanecer no índice indefinidamente.

Lembre-se também de que o robots.txt é público e consultivo. Existe num URL fixo e legível, não é uma barreira de segurança, e apenas os bots bem comportados o respeitam. Use-o para gerir o orçamento de crawl e organizar páginas duplicadas ou com pouco conteúdo — não para esconder nada que precise verdadeiramente de proteção. Para isso, use autenticação. Este gerador funciona inteiramente no seu browser, pelo que os caminhos internos do seu site nunca saem do seu dispositivo.

Frequently asked questions

Para que serve o robots.txt?

O robots.txt é um ficheiro de texto simples na raiz do seu site que indica aos crawlers dos motores de busca quais os URLs que podem ou não visitar. Por exemplo, Disallow: /cart/ pede aos crawlers que saltem as páginas do carrinho de compras para que gastem o seu orçamento de crawl em páginas que realmente importam para o SEO. Faz parte do Robots Exclusion Protocol (agora padronizado como RFC 9309) que a Google, Bing e outros crawlers principais respeitam — mas controla o crawling, não o acesso nem a segurança. Qualquer pessoa pode ler o seu robots.txt em oseusite.com/robots.txt, pelo que não é uma ferramenta de privacidade.

Como criar um ficheiro robots.txt?

Use o criador acima: escolha uma predefinição ou adicione um grupo de regras, defina o User-agent (use * para todos os crawlers), liste os caminhos a Bloquear ou Permitir, adicione opcionalmente um Crawl-delay e cole o URL do seu Sitemap. O resultado atualiza-se em tempo real enquanto escreve — clique em Copiar ou Descarregar para o guardar como robots.txt e depois faça upload para a pasta raiz do seu site para que fique acessível em https://oseusite.com/robots.txt. Não é necessário programar, e o testador de caminhos verifica as suas regras antes de publicar.

Como se compara a outros geradores de robots.txt como o technicalseo.com ou o seoptimer.com?

O gerador de robots.txt do TechnicalSEO.com e o SEOptimer produzem ambos ficheiros válidos, mas nenhum inclui um testador de caminhos integrado que mostre qual a regra que se aplica a um URL específico. Esta ferramenta faz isso: introduza qualquer caminho e nome de crawler e indica-lhe se as suas regras atuais o permitem ou bloqueiam, usando a mesma lógica de correspondência mais longa que a Google aplica. Também assinala erros comuns em tempo real — barras iniciais em falta, URLs de sitemap relativos, Crawl-delay direcionado ao Googlebot (que o ignora). Tudo isto funciona no seu browser sem enviar dados para um servidor.

Onde devo colocar o ficheiro robots.txt?

Deve estar na diretoria raiz do seu domínio e ser servido exatamente em https://oseusite.com/robots.txt — não numa subpasta como /blog/robots.txt, que os crawlers ignoram. Cada subdomínio precisa do seu próprio ficheiro, pelo que blog.oseusite.com e loja.oseusite.com requerem cada um um robots.txt separado. No WordPress pode fazer upload via FTP ou pelo gestor de ficheiros do seu alojamento (ou usar um plugin como o Yoast SEO que o gere por si). No Blogger, ative um robots.txt personalizado em Definições → Preferências de pesquisa.

O que é o User-agent no robots.txt?

User-agent designa o crawler a que se aplica um bloco de regras. User-agent: * abrange todos os crawlers, enquanto User-agent: Googlebot abrange apenas o principal crawler web da Google. Pode ter vários grupos — por exemplo, permitir a todos mas bloquear o GPTBot — e cada crawler obedece ao grupo mais específico que corresponde ao seu nome. Os valores comuns incluem Googlebot, Bingbot, Googlebot-Image, GPTBot (usado pela OpenAI para treinar o ChatGPT), CCBot (Common Crawl, usado por muitos conjuntos de dados de treino de IA), Google-Extended (usado pelo Gemini da Google) e PerplexityBot.

Qual a diferença entre Allow e Disallow?

Disallow pede a um crawler que não aceda aos URLs correspondentes; Allow permite-o. O Allow é usado principalmente para criar uma exceção dentro de uma pasta bloqueada. Por exemplo, Disallow: /wp-admin/ mais Allow: /wp-admin/admin-ajax.php bloqueia a área de administração do WordPress mas deixa passar o único ficheiro AJAX de que os crawlers precisam. Quando as regras entram em conflito, a Google segue o caminho correspondente mais específico (mais longo), e o Allow vence um empate de igual comprimento. O Bing usa a mesma lógica; o Yandex é ligeiramente diferente em casos extremos.

Como adicionar um sitemap ao robots.txt?

Adicione uma linha Sitemap: com o URL absoluto completo, por exemplo Sitemap: https://exemplo.com/sitemap.xml. Pode ser colocada em qualquer parte do ficheiro e não está associada a nenhum grupo User-agent; pode listar vários sitemaps em linhas separadas. Cole o URL no campo Sitemap acima e a ferramenta coloca a linha corretamente. A documentação da Google recomenda esta abordagem em conjunto com a submissão do sitemap diretamente na Search Console, uma vez que ambos os métodos ajudam a Google a descobrir todas as suas páginas.

Como bloquear uma página da Google?

Para impedir que a Google faça crawl de uma página, adicione uma regra Disallow: para o seu caminho, por exemplo Disallow: /rascunho-pagina/. Mas bloquear o crawling não é o mesmo que remover uma página dos resultados — um URL bloqueado pode ainda ser indexado se outros sites lhe fizerem link. Para realmente manter uma página fora da Google, adicione uma diretiva noindex (meta name='robots' content='noindex') ou um cabeçalho X-Robots-Tag, e não a bloqueie também no robots.txt, caso contrário a Google não consegue fazer crawl da página para ver a instrução noindex.

O robots.txt impede a indexação?

Não. O robots.txt controla o crawling, não a indexação. Se bloquear um URL com Disallow, a Google não vai buscar o seu conteúdo, mas o próprio URL pode continuar a aparecer nos resultados — frequentemente sem descrição — quando está referenciado noutros locais. Para remover uma página do índice, use uma diretiva noindex na própria página e deixe-a acessível ao crawler para que a Google possa ler essa diretiva. Este é um dos erros de SEO mais comuns: as pessoas adicionam regras Disallow para remover páginas dos resultados de pesquisa e depois questionam-se por que razão as páginas continuam a aparecer.

O que significa 'bloqueado pelo robots.txt' na Google Search Console?

Na Google Search Console, 'Bloqueado pelo robots.txt' significa que a Google descobriu um URL mas o seu robots.txt indicou-lhe para não fazer crawl desse URL, pelo que a página não foi acedida nem indexada nesse crawl. Se a página deve ser pública, corrija removendo ou restringindo a regra Disallow correspondente. Se o bloqueio é intencional — um caminho de administração, área de staging ou página com conteúdo escasso — pode deixar ficar. Use o testador de caminhos neste gerador para ver exatamente qual a regra que está a bloquear um determinado URL antes de editar o ficheiro.

O que é o crawl-delay?

O Crawl-delay pede a um crawler que aguarde um determinado número de segundos entre pedidos para aliviar a carga do servidor. Crawl-delay: 10 significa aproximadamente um pedido a cada 10 segundos. O Bing e o Yandex respeitam-no; o Googlebot ignora completamente o Crawl-delay — defina a taxa de crawl da Google no relatório de Estatísticas de Crawl da Search Console. Adicione Crawl-delay apenas se o seu servidor estiver genuinamente sob pressão devido ao crawling, uma vez que um valor elevado atrasa a rapidez com que o seu site é indexado.

Como criar um robots.txt para WordPress ou Blogger?

Clique na predefinição WordPress ou Blogger acima. O ficheiro padrão do WordPress bloqueia a área de administração mas mantém o ficheiro Ajax de que os crawlers precisam: User-agent: * / Disallow: /wp-admin/ / Allow: /wp-admin/admin-ajax.php. A predefinição do Blogger permite tudo exceto as páginas de pesquisa: User-agent: * / Disallow: /search / Allow: /. Adicione o URL do seu sitemap e depois copie o resultado para o WordPress (via Yoast SEO ou fazendo upload do ficheiro via FTP) ou cole-o no Blogger em Definições → Preferências de pesquisa → Robots.txt personalizado.

Como testar ou validar o meu robots.txt?

Use o testador de caminhos nesta ferramenta: introduza um URL ou caminho (por exemplo /blog/artigo-1) e um nome de crawler, e indica-lhe se as suas regras atuais o permitem ou bloqueiam — e qual a regra específica que decide, usando a mesma lógica de correspondência mais longa que a Google aplica. O criador também assinala erros comuns em tempo real, como um caminho sem a barra inicial ou um URL de sitemap relativo. Após publicar, confirme o ficheiro em vigor no relatório de robots.txt da Google Search Console e use a ferramenta de Inspeção de URL para verificar páginas específicas.

O robots.txt é seguro?

O robots.txt é seguro de usar, mas não é uma ferramenta de segurança. É um ficheiro público que qualquer pessoa pode ler em oseusite.com/robots.txt, pelo que listar uma pasta 'secreta' aí acaba por a publicitar a quem verificar. Os crawlers bem comportados — Google, Bing, Apple — respeitam as regras, mas os bots maliciosos podem ignorá-las completamente. Para proteger páginas sensíveis, use autenticação real (início de sessão, palavras-passe, lista de IPs permitidos) ou controlos de acesso do lado do servidor. Nunca confie no Disallow para ocultar dados privados.

Como bloquear bots de IA de usar o meu conteúdo para treino?

Adicione grupos User-agent separados para cada crawler de treino de IA e Disallow: / para cada um. Os principais: GPTBot (OpenAI / ChatGPT), CCBot (Common Crawl, usado por muitos conjuntos de dados de treino de IA), Google-Extended (Gemini e Vertex AI da Google), ClaudeBot (Anthropic / Claude), PerplexityBot, Applebot-Extended e meta-externalagent (Meta / Llama). A predefinição 'Bloquear bots de IA' neste gerador adiciona todos estes com um clique, mantendo os crawlers de pesquisa normais (Googlebot, Bingbot) sem restrições para que o seu conteúdo continue indexado.