Skip to content
Générateur de robots.txt
Tools

Générateur de robots.txt

Nouveau

Créez un robots.txt valide avec des règles allow/disallow et une ligne sitemap.

Quick presets
Generated robots.txt
Test a URL Check whether your rules allow or block a path — same longest-match logic Google uses.

Disallow blocks crawling, not indexing. A blocked URL can still appear in Google if other sites link to it. To remove a page from search results, keep it crawlable and add a noindex meta tag or X-Robots-Tag header. robots.txt is also a public file and is not a security measure — protect private pages with real authentication.

robots.txt syntax cheat-sheet
Directive What it does
User-agent: *Which crawler the rules apply to (* = all bots).
Disallow: /pathAsk crawlers not to crawl URLs that start with this path.
Allow: /pathPermit a path, typically an exception inside a disallowed area.
Crawl-delay: 10Seconds between requests. Bing & Yandex honor it; Google ignores it.
Sitemap: https://…Absolute URL of your sitemap. Can appear anywhere in the file.
*Wildcard — matches any sequence of characters in a path.
$Anchors a rule to the end of the URL, e.g. /*.pdf$.
#A comment — the rest of the line is ignored by crawlers.

Runs entirely in your browser. Nothing is uploaded.

Un générateur robots.txt gratuit qui fonctionne dans votre navigateur

Ce générateur robots.txt transforme un simple formulaire en un fichier robots.txt valide — sans syntaxe à mémoriser ni logiciel à installer. Choisissez un préréglage ou construisez vos propres règles d'exploration, observez le fichier se composer en direct, puis copiez-le ou téléchargez-le et déposez-le à la racine de votre site. Tout s'exécute localement dans votre navigateur : les règles que vous saisissez ne sont jamais envoyées vers un serveur.

Que vous ayez besoin d'un exemple de robots.txt comme point de départ, d'un robots.txt personnalisé pour un robot d'indexation précis, ou d'un fichier adapté à WordPress, Blogger ou au blocage des bots d'entraînement IA, vous pouvez l'avoir prêt en quelques secondes. Le testeur de chemin intégré valide vos règles avant publication — une fonctionnalité que la plupart des générateurs concurrents ne proposent pas.

Créez des règles d'exploration sans mémoriser la syntaxe

Chaque groupe de règles associe un User-agent aux chemins que vous souhaitez Allow (autoriser) ou Disallow (interdire), avec un Crawl-delay facultatif. Utilisez * pour cibler tous les robots d'exploration, ou nommez un bot précis comme Googlebot ou Bingbot — commencez à taper et le champ vous suggère les bots courants. Ajoutez autant de groupes que nécessaire pour attribuer des règles différentes à chaque bot.

Saisissez un chemin par ligne ; l'outil formate chacun en directive Disallow: ou Allow: correcte et assemble vos groupes dans le bon ordre. Renseignez l'URL de votre Sitemap et elle est ajoutée sous forme d'une ligne Sitemap: absolue qui guide les robots vers toutes les pages que vous souhaitez indexer. Google l'exploite en complément de tout sitemap soumis directement dans Search Console.

Préréglages pour WordPress, Blogger et le blocage des bots IA

Un seul clic charge un point de départ prêt à l'emploi. Tout autoriser et Tout bloquer couvrent les deux extrêmes. WordPress charge la configuration recommandée : bloquer /wp-admin/ tout en gardant /wp-admin/admin-ajax.php ouvert pour les appels AJAX dont les extensions ont besoin. Blogger charge la configuration suggérée par Google : tout autoriser sauf /search afin d'éviter les problèmes de contenu dupliqué.

Le préréglage Bloquer les bots IA est utile si vous souhaitez que votre contenu reste référencé sur Google et Bing sans être utilisé pour entraîner des modèles d'IA. Il interdit GPTBot (OpenAI), CCBot (Common Crawl), Google-Extended (Gemini), ClaudeBot (Anthropic), PerplexityBot et d'autres — tout en laissant les robots de recherche classiques intacts. Le New York Times, The Guardian et de nombreux grands éditeurs ont ajouté des blocages similaires en 2023.

Testez une URL avant de publier

Un générateur qui ne permet pas de tester ses propres règles ne fait que la moitié du travail. Le testeur de chemin intégré vous permet de saisir n'importe quelle URL ou chemin ainsi qu'un nom de bot, puis indique si vos règles actuelles l'autorisent ou le bloquent — en précisant exactement quelle règle Allow ou Disallow s'applique, selon la même logique de correspondance la plus longue qu'utilise Google (la règle la plus spécifique l'emporte, et Allow gagne en cas d'égalité).

Au fur et à mesure de votre saisie, l'outil affiche aussi des avertissements en direct pour les erreurs qui brisent silencieusement de vrais fichiers robots.txt : un chemin sans barre oblique initiale, une URL de sitemap relative, ou un Crawl-delay ciblant Googlebot (qui l'ignore et nécessite un réglage distinct dans Search Console). Corriger ces erreurs avant la mise en ligne vous évite un aller-retour de débogage dans Google Search Console.

Exploration ou indexation — et autres erreurs courantes

La plus grande idée reçue sur robots.txt : Disallow retire une page de Google. C'est faux. Cela stoppe l'exploration, mais une URL bloquée peut toujours apparaître dans les résultats de recherche si d'autres pages y font un lien. Google peut même l'indexer sans extrait — uniquement l'URL, sans description. Pour qu'une page reste hors des résultats, laissez-la explorée et ajoutez noindex sur la page elle-même. Si vous la bloquez dans robots.txt, Google ne peut jamais l'explorer pour lire ce noindex, et l'URL peut rester dans l'index indéfiniment.

N'oubliez pas non plus que robots.txt est public et indicatif. Il réside à une URL fixe et lisible, ce n'est pas un outil de sécurité, et seuls les bots bien intentionnés le respectent. Utilisez-le pour gérer le budget d'exploration et mettre de l'ordre dans les pages dupliquées ou à faible valeur — pas pour masquer ce qui nécessite vraiment une protection. Pour cela, utilisez l'authentification. Ce générateur s'exécute entièrement dans votre navigateur, donc les chemins internes de votre site ne quittent jamais votre appareil.

Frequently asked questions

À quoi sert le fichier robots.txt ?

robots.txt est un fichier texte brut situé à la racine de votre site qui indique aux robots d'exploration des moteurs de recherche quelles URL ils peuvent ou non demander. Par exemple, Disallow: /panier/ demande aux robots de ne pas parcourir vos pages de panier d'achat, pour qu'ils consacrent leur budget d'exploration aux pages qui comptent vraiment pour le référencement. Il fait partie du protocole d'exclusion des robots (désormais standardisé en RFC 9309) respecté par Google, Bing et les principaux robots d'exploration — mais il contrôle l'exploration, pas l'accès ni la sécurité. N'importe qui peut lire votre robots.txt à l'adresse votresite.com/robots.txt, ce n'est donc pas un outil de confidentialité.

Comment créer un fichier robots.txt ?

Utilisez le créateur ci-dessus : choisissez un préréglage ou ajoutez un groupe de règles, définissez le User-agent (utilisez * pour tous les robots), listez les chemins à Disallow ou Allow, ajoutez éventuellement un Crawl-delay, et collez l'URL de votre sitemap. L'aperçu se met à jour en direct pendant que vous tapez — cliquez sur Copier ou Télécharger pour l'enregistrer sous robots.txt, puis uploadez-le dans le dossier racine de votre site pour qu'il soit accessible à l'adresse https://votresite.com/robots.txt. Aucun codage requis, et le testeur de chemin vérifie vos règles avant publication.

Comment cet outil se compare-t-il à d'autres générateurs robots.txt comme technicalseo.com ou seoptimer.com ?

Le générateur robots.txt de TechnicalSEO.com et SEOptimer produisent tous deux des fichiers valides, mais aucun n'inclut de testeur de chemin intégré qui vous indique quelle règle s'applique à une URL précise. Cet outil le fait : saisissez n'importe quel chemin et nom de robot, et il vous indique si vos règles actuelles l'autorisent ou le bloquent, en utilisant la même logique de correspondance la plus longue qu'applique Google. Il signale aussi en direct les erreurs courantes — barre oblique initiale manquante, URL de sitemap relative, Crawl-delay ciblant Googlebot (qui l'ignore). Tout cela s'exécute dans votre navigateur sans envoyer de données vers un serveur.

Où placer le fichier robots.txt ?

Il doit se trouver dans le répertoire racine de votre domaine et être accessible exactement à l'adresse https://votresite.com/robots.txt — pas dans un sous-dossier comme /blog/robots.txt, que les robots ignorent. Chaque sous-domaine nécessite son propre fichier : blog.votresite.com et boutique.votresite.com ont chacun besoin d'un robots.txt distinct. Sur WordPress, vous pouvez l'uploader via FTP ou le gestionnaire de fichiers de votre hébergeur (ou utiliser une extension comme Yoast SEO qui le gère pour vous). Sur Blogger, activez un robots.txt personnalisé sous Paramètres → Préférences de recherche.

Qu'est-ce que le User-agent dans robots.txt ?

User-agent désigne le robot d'exploration auquel un bloc de règles s'applique. User-agent: * cible tous les robots, tandis que User-agent: Googlebot cible uniquement le robot d'exploration principal de Google. Vous pouvez avoir plusieurs groupes — par exemple, autoriser tout le monde mais bloquer GPTBot — et chaque robot respecte le groupe le plus spécifique correspondant à son nom. Les valeurs courantes incluent Googlebot, Bingbot, Googlebot-Image, GPTBot (utilisé par OpenAI pour entraîner ChatGPT), CCBot (Common Crawl, utilisé par de nombreux ensembles de données d'entraînement IA), Google-Extended (utilisé par Gemini de Google) et PerplexityBot.

Quelle est la différence entre Allow et Disallow ?

Disallow demande à un robot de ne pas récupérer les URL correspondantes ; Allow les autorise. Allow est principalement utilisé pour créer une exception à l'intérieur d'un dossier interdit. Par exemple, Disallow: /wp-admin/ combiné avec Allow: /wp-admin/admin-ajax.php bloque la zone d'administration WordPress tout en laissant passer l'unique fichier AJAX dont les robots ont besoin. En cas de conflit, Google suit le chemin correspondant le plus spécifique (le plus long), et Allow l'emporte en cas d'égalité de longueur. Bing utilise la même logique ; Yandex diffère légèrement dans les cas limites.

Comment ajouter un sitemap au fichier robots.txt ?

Ajoutez une ligne Sitemap: avec l'URL absolue complète, par exemple Sitemap: https://exemple.com/sitemap.xml. Elle peut se placer n'importe où dans le fichier et n'est liée à aucun groupe User-agent ; vous pouvez lister plusieurs sitemaps sur des lignes séparées. Collez l'URL dans le champ Sitemap ci-dessus et l'outil insère la ligne correctement. La documentation de Google recommande cette approche en complément de la soumission du sitemap directement dans Search Console, car les deux méthodes aident Google à découvrir toutes vos pages.

Comment empêcher Google d'indexer une page ?

Pour que Google cesse d'explorer une page, ajoutez une règle Disallow: pour son chemin, par exemple Disallow: /page-brouillon/. Mais bloquer l'exploration n'est pas la même chose que retirer une page des résultats — une URL bloquée peut toujours être indexée si d'autres sites y font un lien. Pour réellement exclure une page de Google, ajoutez une directive noindex (meta name='robots' content='noindex') ou un en-tête X-Robots-Tag, et ne la bloquez pas en même temps dans robots.txt, sinon Google ne peut pas explorer la page pour lire l'instruction noindex.

Est-ce que robots.txt empêche l'indexation ?

Non. robots.txt contrôle l'exploration, pas l'indexation. Si vous utilisez Disallow pour une URL, Google ne récupèrera pas son contenu, mais l'URL elle-même peut toujours apparaître dans les résultats — souvent sans description — si d'autres pages y font un lien. Pour retirer une page de l'index, utilisez une directive noindex sur la page elle-même et laissez la page explorable pour que Google puisse lire cette directive. C'est l'une des erreurs SEO les plus fréquentes : les gens ajoutent des règles Disallow pour retirer des pages des résultats de recherche, puis se demandent pourquoi elles y figurent encore.

Que signifie « Bloqué par robots.txt » dans Google Search Console ?

Dans Google Search Console, « Bloqué par robots.txt » signifie que Google a découvert une URL mais que votre robots.txt lui a demandé de ne pas explorer cette URL, de sorte que la page n'a pas été récupérée ni indexée lors de cette exploration. Si la page doit être publique, corrigez le problème en supprimant ou en restreignant la règle Disallow correspondante. Si le blocage est intentionnel — un chemin d'administration, un environnement de staging ou une page à faible contenu — vous pouvez laisser tel quel. Utilisez le testeur de chemin de ce générateur pour identifier exactement quelle règle bloque une URL donnée avant de modifier le fichier.

Qu'est-ce que le Crawl-delay ?

Crawl-delay demande à un robot d'attendre un certain nombre de secondes entre chaque requête pour alléger la charge du serveur. Crawl-delay: 10 signifie environ une requête toutes les 10 secondes. Bing et Yandex le respectent ; Googlebot ignore complètement Crawl-delay — réglez le rythme d'exploration de Google dans le rapport Statistiques d'exploration de Search Console. N'ajoutez Crawl-delay que si votre serveur est réellement mis à rude épreuve par l'exploration, car une valeur élevée ralentit la vitesse à laquelle votre site est indexé.

Comment créer un robots.txt pour WordPress ou Blogger ?

Cliquez sur le préréglage WordPress ou Blogger ci-dessus. Le fichier standard WordPress bloque la zone d'administration mais conserve le fichier Ajax dont les robots ont besoin : User-agent: * / Disallow: /wp-admin/ / Allow: /wp-admin/admin-ajax.php. La configuration par défaut de Blogger autorise tout sauf les pages de recherche : User-agent: * / Disallow: /search / Allow: /. Ajoutez l'URL de votre sitemap, puis copiez le résultat dans WordPress (via Yoast SEO ou en uploadant le fichier par FTP) ou collez-le dans Blogger sous Paramètres → Préférences de recherche → Robots.txt personnalisé.

Comment tester ou valider mon fichier robots.txt ?

Utilisez le testeur de chemin de cet outil : saisissez une URL ou un chemin (par exemple /blog/article-1) et un nom de robot, et il vous indique si vos règles actuelles l'autorisent ou le bloquent — et quelle règle précise l'emporte, selon la même logique de correspondance la plus longue qu'applique Google. Le créateur signale aussi en direct les erreurs courantes, comme un chemin sans barre oblique initiale ou une URL de sitemap relative. Après publication, vérifiez le fichier en ligne dans le rapport robots.txt de Google Search Console et utilisez l'outil d'inspection d'URL pour contrôler des pages spécifiques.

Le fichier robots.txt est-il sûr ?

robots.txt est sûr à utiliser, mais ce n'est pas un outil de sécurité. C'est un fichier public que tout le monde peut lire à l'adresse votresite.com/robots.txt ; lister un dossier « secret » y revient donc à l'afficher à quiconque le consulte. Les robots bien intentionnés — Google, Bing, Apple — respectent les règles, mais les bots malveillants peuvent les ignorer totalement. Pour protéger des pages sensibles, utilisez une vraie authentification (identifiant, mot de passe, liste blanche d'IP) ou des contrôles d'accès côté serveur. Ne comptez jamais sur Disallow pour masquer des données privées.

Comment bloquer les bots IA pour qu'ils n'utilisent pas mon contenu pour l'entraînement ?

Ajoutez des groupes User-agent distincts pour chaque robot d'entraînement IA et Disallow: / pour chacun. Les principaux : GPTBot (OpenAI / ChatGPT), CCBot (Common Crawl, utilisé par de nombreux ensembles de données d'entraînement IA), Google-Extended (Gemini et Vertex AI de Google), ClaudeBot (Anthropic / Claude), PerplexityBot, Applebot-Extended et meta-externalagent (Meta / Llama). Le préréglage « Bloquer les bots IA » de ce générateur les ajoute tous en un seul clic, tout en laissant les robots de recherche classiques (Googlebot, Bingbot) intacts pour que votre contenu reste référencé.