Robots.txt-Generator
Erstelle eine robots.txt visuell mit Regeln pro Crawler
User-Agent-Regeln
Globale Einstellungen
Generierte robots.txt
Erstelle eine standardkonforme robots.txt ganz visuell – ohne die Syntax auswendig lernen zu müssen. Lege Regeln pro Crawler fest, sperre oder erlaube bestimmte Pfade, setze eine Crawl-Verzögerung und verweise auf deine Sitemap. Alles läuft im Browser; nichts wird hochgeladen.
Anleitung
- Voreinstellung wählen: Starte mit 「Alles erlauben」 oder 「Alles blockieren」 – oder mit der Standard-Wildcard-Regel.
- User-Agents hinzufügen: Nutze
*für alle Crawler oder wähle benannte Bots wie Googlebot oder Bingbot aus den Vorschlägen. - Pfade eintragen: Disallow- und Allow-Pfade, einer pro Zeile. Pfade müssen mit
/beginnen. - Globale Optionen setzen: Optional Crawl-Verzögerung (Sekunden) und Sitemap-URL angeben.
- Kopieren oder herunterladen: Kopiere die erzeugte Datei oder lade sie als robots.txt herunter und lade sie ins Wurzelverzeichnis deiner Website hoch.
Funktionen
- Visueller Regel-Editor mit beliebig vielen User-Agent-Gruppen
- Vorschläge für bekannte Crawler (Googlebot, Bingbot, GPTBot und mehr)
- Voreinstellungen 「Alles erlauben」 und 「Alles blockieren」 per Klick
- Optionale Crawl-delay- und Sitemap-Direktiven
- Live-Validierung für leere Agents, doppelte Regeln, ungültige Pfade und fehlerhafte Sitemap-URLs
- 100 % clientseitig – deine Konfiguration verlässt den Browser nicht
Die robots.txt-Syntax verstehen
Eine robots.txt besteht aus Gruppen. Jede Gruppe beginnt mit einer User-agent-Zeile, die den Crawler benennt, für den die Regeln gelten – * trifft auf alle Bots zu – gefolgt von Disallow- und Allow-Zeilen. Pfade werden als Präfix abgeglichen: Disallow: /admin sperrt also /admin, /admin/users und /administrator gleichermaßen. Ein leeres Disallow: bedeutet, dass nichts gesperrt ist – die übliche Art, Vollzugriff zu erlauben. Kommentare beginnen mit # und werden von Crawlern ignoriert. Bedenke: robots.txt ist eine öffentliche Datei, die jeder lesen kann. Vertraue dich ihr niemals an, um sensible URLs zu verbergen – dafür gibt es Authentifizierung.
Anwendungsfälle
- Neue Website starten: Alle Crawler erlauben und die Sitemap referenzieren, damit Seiten schnell entdeckt werden.
- Staging-Umgebungen: Alle Bots blockieren, damit Testseiten nie in Suchergebnissen auftauchen.
- Crawl-Budget sparen: Facettensuche, interne Suchergebnisseiten oder endlose Kalenderseiten sperren.
- KI-Crawler steuern: Eigene Regeln für GPTBot oder CCBot, ohne Googlebot zu beeinflussen.
- Aggressive Bots drosseln: Crawl-Verzögerung für Crawler setzen, die den Server überlasten.
Verwandte Tools
Häufig gestellte Fragen
Was ist eine robots.txt-Datei?
robots.txt ist eine reine Textdatei im Wurzelverzeichnis deiner Website (zum Beispiel https://example.com/robots.txt), die Webcrawlern mitteilt, welche Seiten oder Bereiche sie aufrufen dürfen. Sie folgt dem Robots Exclusion Protocol und ist die erste Datei, die wohlerzogene Bots wie Googlebot vor dem Crawlen abrufen.
Wie blockiere ich alle Crawler für meine Website?
Nutze die Voreinstellung 「Alles blockieren」. Sie erzeugt 「User-agent: *」 gefolgt von 「Disallow: /」 – damit wird jeder Crawler gebeten, alle Seiten zu meiden. Üblich ist das für Staging- oder Entwicklungsumgebungen.
Was ist der Unterschied zwischen Allow und Disallow?
Disallow untersagt dem Crawler den Zugriff auf einen Pfad, Allow erlaubt ihn ausdrücklich. Allow dient vor allem dazu, Ausnahmen innerhalb eines gesperrten Verzeichnisses zu schaffen – etwa /private/ sperren, aber /private/hinweis.html erlauben. Bei Google gewinnt die längste (spezifischste) passende Regel.
Wird Crawl-delay von allen Suchmaschinen unterstützt?
Nein. Crawl-delay ist eine nicht standardisierte Direktive, die Bing, Yandex und einige andere Crawler beachten, Google jedoch ignoriert. Um Googlebot zu drosseln, nutze die Crawling-Rate-Einstellungen in der Google Search Console.
Warum sollte ich eine Sitemap-Zeile einfügen?
Die Sitemap-Direktive weist Crawler auf deine XML-Sitemap hin, damit sie alle wichtigen Seiten schneller entdecken. Es muss eine absolute URL sein, etwa https://example.com/sitemap.xml, und du darfst mehrere angeben.
Hält robots.txt meine Seiten aus den Google-Suchergebnissen fern?
Nicht zuverlässig. robots.txt steuert nur das Crawling, nicht die Indexierung. Eine blockierte Seite kann trotzdem in den Suchergebnissen erscheinen (ohne Beschreibung), wenn andere Websites auf sie verlinken. Gegen die Indexierung hilft ein noindex-Meta-Tag oder ein Passwortschutz.