robots.txt
Kurz erklärt: Eine Textdatei im Wurzelverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie besuchen dürfen.
Detail-Definition
Die robots.txt steuert das Crawling, nicht die Indexierung, für letzteres braucht es das Meta-Robots-Tag oder noindex-Header. Eine fehlerhafte robots.txt mit „Disallow: /" kann eine ganze Website unsichtbar machen. Sitemaps werden hier ebenfalls referenziert.
Wann ist robots.txt relevant?
- Admin-, Cache- oder Testbereiche sollen nicht gecrawlt werden.
- Sitemaps sollen Suchmaschinen schnell auffindbar gemacht werden.
- Crawl-Budget soll von unwichtigen Bereichen weggeführt werden.
Typische Fehler
- Disallow mit noindex verwechseln.
- CSS oder JavaScript blockieren, die Google zum Rendering braucht.
- Beim Relaunch versehentlich die ganze Website sperren.
Praxis-Checkliste
- robots.txt unter /robots.txt prüfen.
- Wichtige Sitemaps referenzieren.
- Keine wichtigen Assets oder Seiten blockieren.
- Mit Search Console und Live-Test validieren.
Warum ist das für bayerische KMU wichtig?
Eine fehlerhafte robots.txt kann wichtige Seiten vom Crawling ausschließen. Für Unternehmen bedeutet das im schlimmsten Fall: gute Inhalte existieren, werden aber nicht sauber gefunden oder aktualisiert.
Unsere lokale Expertise direkt anwenden:
Verwandte Begriffe
- Crawler Ein Crawler ist ein automatisiertes Programm, das Webseiten…
- Crawl-Budget Die Anzahl an URLs, die der Googlebot innerhalb eines Zeitr…
- Sitemap Eine Übersicht wichtiger Website-URLs, die Nutzern oder Suc…
- Indexierung Der Prozess, bei dem Google eine Webseite in seinen Suchind…
- User Agent Ein User Agent identifiziert Browser, Crawler oder andere P…