Robots.txt-Generator
NeuEine gültige robots.txt mit Allow-/Disallow-Regeln und einer Sitemap-Zeile bauen.
Disallow blocks crawling, not indexing. A blocked URL can still
appear in Google if other sites link to it. To remove a page from search results, keep it crawlable
and add a noindex meta tag or X-Robots-Tag header. robots.txt is also a
public file and is not a security measure — protect private pages with real authentication.
robots.txt syntax cheat-sheet
| Directive | What it does |
|---|---|
| User-agent: * | Which crawler the rules apply to (* = all bots). |
| Disallow: /path | Ask crawlers not to crawl URLs that start with this path. |
| Allow: /path | Permit a path, typically an exception inside a disallowed area. |
| Crawl-delay: 10 | Seconds between requests. Bing & Yandex honor it; Google ignores it. |
| Sitemap: https://… | Absolute URL of your sitemap. Can appear anywhere in the file. |
| * | Wildcard — matches any sequence of characters in a path. |
| $ | Anchors a rule to the end of the URL, e.g. /*.pdf$. |
| # | A comment — the rest of the line is ignored by crawlers. |
Runs entirely in your browser. Nothing is uploaded.
Ein kostenloser Robots.txt-Generator direkt im Browser
Dieser Robots.txt-Generator verwandelt ein einfaches Formular in eine gültige robots.txt-Datei — ohne Syntax auswendig zu lernen und ohne Installation. Wählen Sie ein Preset oder erstellen Sie eigene Crawl-Regeln, beobachten Sie die Datei live beim Aufbau, kopieren oder laden Sie sie herunter und legen Sie sie im Wurzelverzeichnis Ihrer Website ab. Alles läuft lokal in Ihrem Browser, die eingegebenen Regeln werden niemals auf einen Server übertragen.
Ob Sie ein schnelles robots.txt-Beispiel als Ausgangspunkt benötigen, eine individuelle robots.txt für einen bestimmten Crawler oder eine Datei für WordPress, Blogger oder zum Blockieren von KI-Trainings-Bots — in Sekunden ist alles fertig. Der integrierte Pfad-Tester überprüft Ihre Regeln vor der Veröffentlichung — eine Funktion, die den meisten konkurrierenden Generatoren fehlt.
Crawl-Regeln erstellen ohne Syntaxkenntnisse
Jede Regelgruppe verbindet einen User-agent mit den Pfaden, die Sie erlauben oder sperren möchten, zuzüglich einem optionalen Crawl-delay. Verwenden Sie * für alle Crawler oder benennen Sie einen bestimmten Bot wie Googlebot oder Bingbot — beim Tippen schlägt das Feld gängige Crawler vor. Fügen Sie beliebig viele Gruppen hinzu, um verschiedenen Bots unterschiedliche Regeln zu geben.
Geben Sie je einen Pfad pro Zeile ein; das Tool formatiert jeden als korrektes Disallow:- oder Allow:-Direktiv und fügt Ihre Gruppen in der richtigen Reihenfolge zusammen. Tragen Sie Ihre Sitemap-URL ein und sie wird als absolute Sitemap:-Zeile angehängt, die Crawler zu allen Seiten führt, die gefunden werden sollen. Googles Crawler wertet diese aus und verwendet sie zusätzlich zu jeder direkt in der Search Console eingereichten Sitemap.
Presets für WordPress, Blogger und KI-Bot-Blockierung
Ein Klick lädt einen fertigen Ausgangspunkt. Alles erlauben und Alles blockieren decken die beiden Extreme ab. WordPress lädt die empfohlene Standardeinstellung: /wp-admin/ sperren, aber /wp-admin/admin-ajax.php für die von Plugins benötigten AJAX-Aufrufe offenhalten. Blogger lädt Googles vorgeschlagenes Blogger-Setup: alles erlauben außer /search, um Duplicate-Content-Probleme zu vermeiden.
Das Preset KI-Bots blockieren ist nützlich, wenn Ihre Inhalte weiterhin bei Google und Bing erscheinen sollen, ohne für das Training von KI-Modellen verwendet zu werden. Es sperrt GPTBot (OpenAI), CCBot (Common Crawl), Google-Extended (Gemini), ClaudeBot (Anthropic), PerplexityBot und weitere — während normale Suchmaschinen-Crawler unberührt bleiben. Die New York Times, The Guardian und viele große Verlage haben 2023 ähnliche Sperren eingeführt.
URL vor der Veröffentlichung testen
Ein Generator, der sich nicht selbst testen kann, erledigt nur die halbe Arbeit. Der integrierte Pfad-Tester ermöglicht es Ihnen, beliebige URLs oder Pfade und einen Crawler-Namen einzugeben, und zeigt dann, ob Ihre aktuellen Regeln diesen Pfad erlauben oder blockieren — und genau welche Allow- oder Disallow-Regel entscheidet, nach derselben Longest-Match-Logik wie Google (die spezifischste Regel gewinnt, Allow entscheidet bei gleicher Länge).
Beim Tippen zeigt das Tool auch Live-Warnungen für Fehler an, die robots.txt-Dateien stillschweigend defekt machen: ein Pfad ohne führenden Schrägstrich, eine relative Sitemap-URL oder ein Crawl-delay für Googlebot (der dieses ignoriert und eine separate Einstellung in der Search Console erfordert). Diese Fehler vor dem Veröffentlichen zu beheben erspart einen aufwendigen Debugging-Durchlauf über die Google Search Console.
Crawling vs. Indexierung — und andere häufige Fehler
Das größte Missverständnis bei robots.txt: Disallow entfernt eine Seite aus Google. Das stimmt nicht. Es stoppt das Crawling, aber eine gesperrte URL kann dennoch in den Suchergebnissen erscheinen, wenn andere Seiten auf sie verlinken. Google kann sie sogar ohne Snippet indexieren — nur eine URL ohne Beschreibung. Um eine Seite aus der Suche fernzuhalten, lassen Sie sie crawlbar und fügen Sie noindex direkt auf der Seite hinzu. Wenn Sie sie in robots.txt sperren, kann Google die Seite nie crawlen, um das noindex zu lesen, und die URL kann dauerhaft im Index verbleiben.
Beachten Sie auch, dass robots.txt öffentlich und nur eine Empfehlung ist. Sie liegt unter einer festen, lesbaren URL, ist keine Sicherheitsbarriere und wird nur von gut erzogenen Bots befolgt. Nutzen Sie sie, um das Crawl-Budget zu steuern und doppelte oder dünne Seiten zu bereinigen — nicht um etwas zu verstecken, das wirklich schützenswert ist. Dafür verwenden Sie Authentifizierung. Dieser Generator läuft vollständig in Ihrem Browser, sodass interne Pfade Ihrer Website Ihr Gerät nie verlassen.
Frequently asked questions
Wofür wird robots.txt verwendet?
robots.txt ist eine Nur-Text-Datei im Wurzelverzeichnis Ihrer Website, die Suchmaschinen-Crawlern mitteilt, welche URLs sie aufrufen dürfen und welche nicht. Zum Beispiel fordert Disallow: /warenkorb/ Crawler auf, Ihre Warenkorb-Seiten zu überspringen, damit sie ihr Crawl-Budget für Seiten verwenden, die für SEO tatsächlich relevant sind. Sie ist Teil des Robots Exclusion Protocol (inzwischen als RFC 9309 standardisiert), das von Google, Bing und anderen wichtigen Crawlern befolgt wird — aber sie kontrolliert das Crawling, nicht den Zugriff oder die Sicherheit. Jeder kann Ihre robots.txt unter ihrewebsite.de/robots.txt lesen, sie ist also kein Datenschutzwerkzeug.
Wie erstelle ich eine robots.txt-Datei?
Nutzen Sie den Builder oben: Wählen Sie ein Preset oder fügen Sie eine Regelgruppe hinzu, legen Sie den User-agent fest (nutzen Sie * für alle Crawler), listen Sie die zu sperrenden oder erlaubenden Pfade auf, fügen Sie optional einen Crawl-delay hinzu und tragen Sie Ihre Sitemap-URL ein. Die Live-Vorschau aktualisiert sich während der Eingabe — klicken Sie auf Kopieren oder Herunterladen, um die Datei als robots.txt zu speichern, und laden Sie sie dann in das Wurzelverzeichnis Ihrer Website hoch, sodass sie unter https://ihrewebsite.de/robots.txt erreichbar ist. Keine Programmierkenntnisse erforderlich, und der Pfad-Tester prüft Ihre Regeln vor der Veröffentlichung.
Wie schneidet dieser Generator im Vergleich zu anderen wie technicalseo.com oder seoptimer.com ab?
Der robots.txt-Generator von TechnicalSEO.com und SEOptimer erzeugen beide gültige Dateien, aber keiner davon enthält einen integrierten Pfad-Tester, der anzeigt, welche Regel für eine bestimmte URL gilt. Dieses Tool tut es: Geben Sie einen Pfad und einen Crawler-Namen ein, und es teilt Ihnen mit, ob Ihre aktuellen Regeln diesen erlauben oder blockieren — nach derselben Longest-Match-Logik wie Google. Es markiert außerdem live häufige Fehler: fehlende führende Schrägstriche, relative Sitemap-URLs, Crawl-delay für Googlebot (der diesen ignoriert). Alles läuft in Ihrem Browser, ohne Daten an einen Server zu senden.
Wo muss die robots.txt-Datei abgelegt werden?
Sie muss im Wurzelverzeichnis Ihrer Domain liegen und genau unter https://ihrewebsite.de/robots.txt erreichbar sein — nicht in einem Unterordner wie /blog/robots.txt, den Crawler ignorieren. Jede Subdomain benötigt eine eigene Datei, also brauchen blog.ihrewebsite.de und shop.ihrewebsite.de jeweils eine separate robots.txt. Unter WordPress können Sie sie per FTP oder über den Dateimanager Ihres Hosters hochladen (oder ein Plugin wie Yoast SEO verwenden, das sie für Sie verwaltet). Bei Blogger aktivieren Sie eine individuelle robots.txt unter Einstellungen → Sucheinstellungen.
Was bedeutet User-agent in robots.txt?
User-agent gibt den Crawler an, für den ein Regelblock gilt. User-agent: * richtet sich an alle Crawler, während User-agent: Googlebot nur Googles Haupt-Webcrawler anspricht. Sie können mehrere Gruppen haben — zum Beispiel alle erlauben, aber GPTBot blockieren — und jeder Crawler befolgt die spezifischste Gruppe, die seinem Namen entspricht. Gängige Werte sind: Googlebot, Bingbot, Googlebot-Image, GPTBot (von OpenAI zum Training von ChatGPT verwendet), CCBot (Common Crawl, von vielen KI-Trainingsdatensätzen genutzt), Google-Extended (von Googles Gemini verwendet) und PerplexityBot.
Was ist der Unterschied zwischen Allow und Disallow?
Disallow fordert einen Crawler auf, passende URLs nicht abzurufen; Allow erlaubt sie. Allow wird hauptsächlich verwendet, um innerhalb eines gesperrten Ordners eine Ausnahme zu definieren. Zum Beispiel sperrt Disallow: /wp-admin/ zusammen mit Allow: /wp-admin/admin-ajax.php den WordPress-Adminbereich, lässt aber die eine AJAX-Datei durch, die Crawler benötigen. Bei Regelkonflikten folgt Google dem spezifischsten (längsten) passenden Pfad, und Allow gewinnt bei gleicher Länge. Bing verwendet dieselbe Logik; Yandex verhält sich bei Grenzfällen leicht abweichend.
Wie füge ich eine Sitemap zur robots.txt hinzu?
Fügen Sie eine Sitemap:-Zeile mit der vollständigen absoluten URL hinzu, zum Beispiel Sitemap: https://beispiel.de/sitemap.xml. Sie kann an beliebiger Stelle in der Datei stehen und ist an keine User-agent-Gruppe gebunden; Sie können mehrere Sitemaps in separaten Zeilen auflisten. Tragen Sie die URL in das Sitemap-Feld oben ein, und das Tool platziert die Zeile korrekt. Googles Dokumentation empfiehlt diesen Ansatz ergänzend zur direkten Einreichung der Sitemap in der Search Console, da beide Methoden Google dabei helfen, alle Ihre Seiten zu entdecken.
Wie verhindere ich, dass Google eine Seite indexiert?
Um das Crawling einer Seite durch Google zu stoppen, fügen Sie eine Disallow:-Regel für deren Pfad hinzu, zum Beispiel Disallow: /entwurf-seite/. Crawling zu blockieren ist jedoch nicht dasselbe wie eine Seite aus den Ergebnissen zu entfernen — eine gesperrte URL kann dennoch indexiert werden, wenn andere Websites auf sie verlinken. Um eine Seite wirklich aus Google fernzuhalten, fügen Sie eine noindex-Direktive (meta name='robots' content='noindex') oder einen X-Robots-Tag-Header hinzu, und sperren Sie die Seite dabei nicht in robots.txt — sonst kann Google die Seite nicht crawlen, um den noindex-Hinweis zu lesen.
Verhindert robots.txt die Indexierung?
Nein. robots.txt steuert das Crawling, nicht die Indexierung. Wenn Sie eine URL mit Disallow sperren, ruft Google deren Inhalt nicht ab, aber die URL selbst kann weiterhin in den Ergebnissen erscheinen — oft ohne Beschreibung — wenn andere Seiten auf sie verlinken. Um eine Seite aus dem Index zu entfernen, verwenden Sie eine noindex-Direktive auf der Seite selbst und lassen Sie die Seite crawlbar, damit Google diese Direktive lesen kann. Dies ist einer der häufigsten SEO-Fehler: Webseitenbetreiber fügen Disallow-Regeln hinzu, um Seiten aus den Suchergebnissen zu entfernen, und wundern sich dann, warum die Seiten weiterhin erscheinen.
Was bedeutet 'Von robots.txt blockiert' in der Google Search Console?
In der Google Search Console bedeutet 'Von robots.txt blockiert', dass Google eine URL entdeckt hat, aber Ihre robots.txt ihr mitgeteilt hat, diese URL nicht zu crawlen — die Seite wurde daher bei diesem Crawl weder abgerufen noch indexiert. Wenn die Seite öffentlich sein soll, beheben Sie das Problem, indem Sie die passende Disallow-Regel entfernen oder einschränken. Wenn die Sperre beabsichtigt ist — ein Adminbereich, eine Staging-Umgebung oder eine inhaltsarme Seite — ist es sicher, sie beizubehalten. Nutzen Sie den Pfad-Tester in diesem Generator, um genau zu sehen, welche Regel eine bestimmte URL blockiert, bevor Sie die Datei bearbeiten.
Was ist Crawl-delay?
Crawl-delay fordert einen Crawler auf, eine bestimmte Anzahl von Sekunden zwischen Anfragen zu warten, um die Serverlast zu reduzieren. Crawl-delay: 10 bedeutet etwa eine Anfrage alle 10 Sekunden. Bing und Yandex berücksichtigen diesen Wert; Googlebot ignoriert Crawl-delay vollständig — stellen Sie Googles Crawl-Rate stattdessen im Crawl-Statistiken-Bericht der Search Console ein. Fügen Sie Crawl-delay nur hinzu, wenn Ihr Server tatsächlich durch Crawling-Aktivitäten überlastet ist, da ein hoher Wert verlangsamt, wie schnell Ihre Website indexiert wird.
Wie erstelle ich eine robots.txt für WordPress oder Blogger?
Klicken Sie oben auf das Preset WordPress oder Blogger. Die WordPress-Standarddatei sperrt den Adminbereich, lässt aber die eine Ajax-Datei offen, die Crawler benötigen: User-agent: * / Disallow: /wp-admin/ / Allow: /wp-admin/admin-ajax.php. Der Blogger-Standard erlaubt alles außer Suchseiten: User-agent: * / Disallow: /search / Allow: /. Fügen Sie Ihre Sitemap-URL hinzu, kopieren Sie dann das Ergebnis in WordPress (über Yoast SEO oder per FTP-Upload) oder fügen Sie es bei Blogger unter Einstellungen → Sucheinstellungen → Individuelle robots.txt ein.
Wie teste oder validiere ich meine robots.txt?
Nutzen Sie den Pfad-Tester in diesem Tool: Geben Sie eine URL oder einen Pfad (zum Beispiel /blog/beitrag-1) und einen Crawler-Namen ein, und er zeigt Ihnen, ob Ihre aktuellen Regeln diesen erlauben oder blockieren — und welche spezifische Allow- oder Disallow-Regel entscheidet, nach derselben Longest-Match-Logik wie Google. Der Builder weist auch live auf häufige Fehler hin, wie einen Pfad ohne führenden Schrägstrich oder eine relative Sitemap-URL. Bestätigen Sie nach der Veröffentlichung die Live-Datei im robots.txt-Bericht der Google Search Console und nutzen Sie das URL-Prüftool, um einzelne Seiten zu überprüfen.
Ist robots.txt sicher?
robots.txt ist sicher zu verwenden, aber kein Sicherheitswerkzeug. Es ist eine öffentliche Datei, die jeder unter ihrewebsite.de/robots.txt lesen kann — ein dort aufgeführter 'geheimer' Ordner wird damit jedem bekannt gemacht, der nachschaut. Gutartige Crawler — Google, Bing, Apple — befolgen die Regeln, aber bösartige Bots können sie vollständig ignorieren. Um sensible Seiten zu schützen, verwenden Sie echte Authentifizierung (Login, Passwörter, IP-Allowlisting) oder serverseitige Zugriffskontrollen. Verlassen Sie sich nie auf Disallow, um private Daten zu verbergen.
Wie blockiere ich KI-Bots davon, meine Inhalte zum Training zu nutzen?
Fügen Sie separate User-agent-Gruppen für jeden KI-Trainings-Crawler hinzu und setzen Sie für jeden Disallow: /. Die wichtigsten: GPTBot (OpenAI / ChatGPT), CCBot (Common Crawl, von vielen KI-Trainingsdatensätzen genutzt), Google-Extended (Googles Gemini und Vertex AI), ClaudeBot (Anthropic / Claude), PerplexityBot, Applebot-Extended und meta-externalagent (Meta / Llama). Das Preset 'KI-Bots blockieren' in diesem Generator fügt all diese mit einem einzigen Klick hinzu, während normale Suchcrawler (Googlebot, Bingbot) unberührt bleiben, sodass Ihre Inhalte weiterhin indexiert werden.
Related tools
Alle Tools ansehenUTM-Builder
Nachverfolgbare Kampagnen-URLs mit utm_source, medium, campaign und mehr bauen.
SERP-Snippet-Vorschau
Vorschau, wie Titel und Beschreibung in Google aussehen — Desktop und Mobil.
Slug-Generator
Jeden Titel in einen sauberen, SEO-freundlichen URL-Slug umwandeln — als Stapel und akzentsicher.
Meta-Tag-Generator
SEO-, Open-Graph- und Twitter-Card-Meta-Tags mit Live-Vorschau erzeugen.
Passwortstärke-Prüfer
Passwortstärke mit Entropie, Knackzeit-Schätzungen und Tipps testen.
Stoppuhr & Timer
Präzise Online-Stoppuhr mit Runden und ein Countdown-Timer mit Voreinstellungen.