← Zum Magazin
Technik

robots.txt: Crawling steuern, Geheimnisse schützen

Die robots.txt ist eine Steuerdatei für Crawler. Sie ersetzt weder Anmeldung noch Zugriffsschutz.

SEOdienste Wissensgrafik: robots.txt: Crawling steuern, Geheimnisse schützen
Artikel anhörenDie Sprachausgabe deines Geräts liest den vollständigen Bericht vor.

Bereit zum Vorlesen.

Zwei verschiedene Aufgaben

Eine robots.txt beschreibt, welche Bereiche kooperierende Crawler abrufen dürfen. Sie verhindert keinen Zugriff durch Besucher. Vertrauliche Dateien gehören hinter einen echten Zugriffsschutz. Auch eine gesperrte URL kann unter Umständen in Suchergebnissen bekannt bleiben, wenn andere Seiten darauf verweisen.

Kleine Regeln, große Wirkung

Öffne die Datei direkt unter dem Ursprung deiner Website. Prüfe besonders pauschale Sperren wie einen Schrägstrich als gesamten Disallow-Pfad. Solche Regeln können nach einem Testbetrieb versehentlich öffentlich bleiben. Überprüfe auch, ob wichtige Bilder, Stylesheets oder Skripte für Suchmaschinen erreichbar sind.

Indexierung getrennt prüfen

Soll eine öffentliche Seite nicht im Index erscheinen, braucht sie eine passende Indexierungsanweisung. Damit ein Crawler diese Anweisung sieht, muss er die Seite abrufen können. Ein Login-Bereich wiederum sollte unabhängig von Suchmaschinen technisch geschützt sein.

Vor dem Veröffentlichen

Sichere die bisherige Datei und überprüfe jede neue Regel an konkreten Beispiel-URLs. Nutze einen passenden Prüfbericht in den Webmaster-Werkzeugen und kontrolliere die Live-Datei nach dem Hochladen. Für eine kleine Website genügt oft eine einfache Konfiguration mit Verweis auf die Sitemap. Komplexität sollte einen klaren Zweck haben.