Die robots.txt ist eine der ältesten und gleichzeitig am häufigsten missverstandenen Dateien im Web. Sie liegt im Wurzelverzeichnis deiner Website und ist das Erste, was ein Suchmaschinen-Crawler abruft, bevor er deine Seiten besucht. Eine falsch konfigurierte robots.txt kann im schlimmsten Fall deine komplette Website aus dem Index verbannen – ein richtig gesetztes Detail spart dagegen Crawling-Budget und schützt sensible Bereiche.
Was ist die robots.txt?
Die robots.txt ist eine einfache Textdatei, die nach dem "Robots Exclusion Standard" aufgebaut ist. Sie liegt immer unter https://deine-domain.de/robots.txt und richtet sich an automatische Crawler ("Bots", "Robots"). In ihr legst du fest, welche Bereiche deiner Seite gecrawlt werden dürfen und welche nicht.
Wichtig zu verstehen: Die robots.txt ist eine Bitte, keine Sperre. Seriöse Crawler wie der Googlebot halten sich daran. Bösartige Bots ignorieren sie schlicht. Für echten Zugriffsschutz brauchst du Authentifizierung auf Serverebene – die robots.txt ist ein Steuerungs-, kein Sicherheitswerkzeug.
Der Aufbau: User-agent, Disallow und Allow
Eine robots.txt besteht aus einem oder mehreren Blöcken. Jeder Block beginnt mit einer User-agent-Zeile, die festlegt, für welchen Crawler die folgenden Regeln gelten.
- User-agent: Der angesprochene Crawler. Ein Sternchen (
*) bedeutet "alle Crawler". - Disallow: Ein Pfad, der nicht gecrawlt werden soll.
Disallow: /admin/sperrt den gesamten Admin-Bereich. - Allow: Eine Ausnahme innerhalb eines gesperrten Pfads. Praktisch, um eine einzelne Datei in einem ansonsten gesperrten Ordner freizugeben.
Ein typisches Beispiel sieht so aus:
User-agent: *Disallow: /admin/Disallow: /warenkorb/Allow: /
Statt diese Syntax von Hand zu tippen und dabei Tippfehler zu riskieren, baust du die Datei bequem mit dem robots.txt Generator. Du wählst die zu sperrenden Pfade, fügst deine Sitemap hinzu und bekommst eine fertige, korrekt formatierte Datei zum Kopieren.
Die Sitemap einbinden
Die robots.txt ist der ideale Ort, um auf deine XML-Sitemap zu verweisen. Crawler finden dort die vollständige Liste deiner wichtigen URLs. Die Zeile steht typischerweise am Ende der Datei und nutzt eine absolute URL:
Sitemap: https://deine-domain.de/sitemap.xml
Diese Angabe ist unabhängig von den User-agent-Blöcken und gilt für alle Crawler. Hast du noch keine Sitemap, erzeugst du sie schnell aus einer URL-Liste mit dem Sitemap URL Liste Generator.
Crawling ist nicht Indexierung
Der wohl folgenreichste Irrtum: Disallow verhindert keine Indexierung. Es verhindert nur, dass der Crawler den Inhalt der Seite liest. Verlinken andere Seiten auf eine per robots.txt gesperrte URL, kann diese trotzdem – ohne Beschreibung – in den Suchergebnissen auftauchen.
Willst du verhindern, dass eine Seite überhaupt im Index erscheint, brauchst du stattdessen ein Meta-Robots-Tag mit dem Wert noindex auf der Seite selbst. Paradoxerweise musst du die Seite dafür crawlen lassen, denn nur dann kann der Bot das noindex überhaupt sehen. Eine per robots.txt gesperrte Seite mit noindex-Tag bleibt also möglicherweise im Index, weil der Bot das Tag nie liest.
Typische Fehler
- Die ganze Seite sperren: Ein versehentliches
Disallow: /für alle User-agents nimmt die komplette Website aus dem Crawling. Klassischer Unfall beim Umzug von der Test- in die Live-Umgebung. - CSS und JavaScript blockieren: Sperrst du diese Ressourcen, kann Google deine Seite nicht korrekt rendern und bewertet sie schlechter.
- Falscher Speicherort: Die Datei muss exakt im Wurzelverzeichnis liegen, nicht in einem Unterordner.
- robots.txt für Geheimhaltung nutzen: Da die Datei öffentlich ist, verrätst du mit jedem Disallow-Eintrag genau die Pfade, die du verbergen wolltest.
So gehst du vor
Halte deine robots.txt bewusst schlank: Sperre nur, was wirklich nicht ins Crawling soll, und lass den Rest offen. Erstelle die Datei mit dem robots.txt Generator, binde deine Sitemap ein und prüfe das Ergebnis anschließend im robots.txt-Tester der Google Search Console. Für die Steuerung der Indexierung einzelner Seiten lohnt sich ein Blick in die weiteren technischen Helfer der Webtools-Sammlung.
Häufige Fragen
Braucht jede Website eine robots.txt?
Zwingend nötig ist sie nicht. Fehlt sie, gehen Crawler davon aus, dass alles erlaubt ist. Eine vorhandene Datei mit Sitemap-Verweis ist aber empfehlenswert und gilt als sauberer Standard.
Wie blockiere ich einen bestimmten Bot?
Lege einen eigenen Block mit dem genauen Namen des User-agents an, etwa User-agent: AhrefsBot, gefolgt von Disallow: /. Ob sich der Bot daran hält, liegt allerdings bei ihm.
Wie verhindere ich sicher, dass eine Seite indexiert wird?
Nicht über die robots.txt, sondern über ein noindex im Meta-Robots-Tag der Seite. Achte darauf, die Seite dafür nicht gleichzeitig per Disallow zu sperren, sonst liest der Bot das Tag nie.