robots.txt und sitemap.xml: technisches SEO erklärt | POLPROG Zum Inhalt springen

robots.txt und sitemap.xml: kompletter Leitfaden für technisches SEO

robots.txt und sitemap.xml lösen zwei unterschiedliche Aufgaben im technischen SEO. robots.txt steuert, welche URLs Crawler abrufen dürfen. sitemap.xml hilft Suchmaschinen, wichtige URLs und zugehörige Metadaten zu entdecken. Probleme entstehen, wenn robots.txt zur Indexierungssteuerung missbraucht wird oder Sitemaps Weiterleitungen, Duplikate und noindex-URLs enthalten.

Veröffentlicht Verfasst von Lesezeit 9 Min. Lesezeit

robots.txt und sitemap.xml lösen zwei unterschiedliche Aufgaben im technischen SEO. robots.txt steuert, welche URLs Crawler abrufen dürfen. sitemap.xml hilft Suchmaschinen, wichtige URLs und zugehörige Metadaten zu entdecken. Probleme entstehen, wenn robots.txt zur Indexierungssteuerung missbraucht wird oder Sitemaps Weiterleitungen, Duplikate und noindex-URLs enthalten.

Auf dieser Seite
  1. 1robots.txt und sitemap.xml haben unterschiedliche Aufgaben
  2. 2Speicherort und Geltungsbereich von robots.txt
  3. 3Grundlegende robots.txt-Syntax
  4. 4Regelabgleich, Großschreibung und Wildcards
  5. 5robots.txt ist kein noindex
  6. 6HTTP-Fehler und Caching von robots.txt
  7. 7Wozu sitemap.xml dient
  8. 8Unterstützte Sitemap-Formate
  9. 9Limits für Sitemap und Sitemap-Index
  10. 10Welche URLs in die Sitemap gehören
  11. 11`<lastmod>`, `<priority>` und `<changefreq>`
  12. 12Sitemap bei Google einreichen
  13. 13Mehrsprachigkeit und spezielle Sitemaps
  14. 14Häufige technische SEO-Fehler
  15. 15Deployment-Checkliste

robots.txt und sitemap.xml haben unterschiedliche Aufgaben

MechanismusZweckBereichWirkung
robots.txtCrawling steuernCrawler-PfadeGarantiert keine Deindexierung
sitemap.xmlWichtige URLs meldenURLs und MetadatenHinweis, keine Indexierungsgarantie
noindexAus Index ausschließenURL oder RessourceWirkt nach dem Crawlen
rel="canonical"Bevorzugte Duplikatversion angebenURL oder RessourceStarkes Signal, keine absolute Direktive

robots.txt gehört zum Robots Exclusion Protocol und regelt den Zugriff von Crawlern auf URL-Pfade. RFC 9309 stellt klar, dass diese Regeln keine Zugriffsauthentifizierung sind. [4]

Eine Sitemap informiert Suchmaschinen über wichtige Seiten, Videos und andere Dateien sowie deren Beziehungen und Metadaten. [6]

Speicherort und Geltungsbereich von robots.txt

Die Datei muss `robots.txt` heißen und im Root des Hosts liegen, zum Beispiel `https://example.com/robots.txt`. Eine Datei in einem Unterverzeichnis steuert nicht die gesamte Website. [2][4]

Der Geltungsbereich ist an Protokoll, Host und Port gebunden. Außerdem gilt bei Google ein Limit von 500 KiB. [2][3]

Grundlegende robots.txt-Syntax

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://example.com/sitemap.xml

Google unterstützt `user-agent`, `allow`, `disallow` und `sitemap`. `crawl-delay` wird von Google nicht unterstützt. [3]

`sitemap` muss eine vollständig qualifizierte URL enthalten. Mehrere `Sitemap`-Zeilen sind möglich. [2][3]

Regelabgleich, Großschreibung und Wildcards

Google verwendet die spezifischste passende Regel. Sind `allow` und `disallow` gleich spezifisch, gewinnt die weniger restriktive `allow`-Regel. [3][4]

Pfadwerte sind case-sensitive. Google unterstützt außerdem `*` als Wildcard und `$` für das URL-Ende. [3]

robots.txt ist kein noindex

Eine durch robots.txt blockierte URL kann trotzdem in Suchergebnissen erscheinen, wenn Google sie über andere Links entdeckt. [1][3]

Für die Entfernung aus dem Index sollte `noindex` als Meta-Robots-Regel oder `X-Robots-Tag` verwendet werden. Google muss die Ressource crawlen können, um diese Regel zu sehen. [5][16]

HTTP-Fehler und Caching von robots.txt

StatusVerhalten von Google
2xxVerarbeitet die Datei
3xxFolgt mindestens 5 Weiterleitungen
4xx except 429Behandelt wie fehlende robots.txt
5xx / networkKann Crawling pausieren und letzte gültige Version nutzen

Google verarbeitet `2xx`, folgt bei `3xx` mindestens fünf Weiterleitungen und behandelt die meisten `4xx` außer `429` so, als gäbe es keine Crawl-Beschränkungen. [3]

Bei `5xx` oder Netzwerkproblemen kann Google das Crawling vorübergehend stoppen und die letzte gültige Version verwenden. robots.txt wird normalerweise bis zu 24 Stunden gecacht. [3]

Wozu sitemap.xml dient

Sitemaps helfen beim Entdecken wichtiger URLs und können Änderungsdaten, Sprachvarianten sowie Informationen zu Bildern, Videos und News übertragen. [6][7]

Kleine Websites mit ungefähr 500 Seiten oder weniger und guter interner Verlinkung benötigen laut Google nicht zwingend eine Sitemap. [6]

Unterstützte Sitemap-Formate

Google unterstützt XML, RSS, mRSS, Atom 1.0 und Text-Sitemaps. XML ist am flexibelsten und unterstützt Erweiterungen für Medien, News und Lokalisierung. [7]

Google bevorzugt keines der unterstützten Formate grundsätzlich. [7]

Limits für Sitemap und Sitemap-Index

DateiMaximale EinträgeMaximale GrößeHinweis
Einzelne Sitemap50,00050 MBUnkomprimiertes Limit; gzip erlaubt
Sitemap-Index50,000 sitemaps50 MBUnkomprimiertes Limit; gzip erlaubt

Eine Sitemap ist auf 50.000 URLs oder 50 MB unkomprimiert begrenzt. Größere Mengen müssen aufgeteilt werden. [7][8]

Ein Sitemap-Index kann bis zu 50.000 Sitemaps enthalten und unterliegt ebenfalls dem 50-MB-Limit. gzip ist erlaubt. [8]

Welche URLs in die Sitemap gehören

Google empfiehlt vollständig qualifizierte URLs, die tatsächlich in Suchergebnissen erscheinen sollen. [7]

Bei Duplikaten sollte bevorzugt die kanonische URL eingetragen werden. Sitemap-Aufnahme ist ein schwaches Canonical-Signal und schwächer als Redirect oder `rel="canonical"`. [7][9]

`<lastmod>`, `<priority>` und `<changefreq>`

Google ignoriert `<priority>` und `<changefreq>`. [7]

`<lastmod>` kann verwendet werden, wenn es dauerhaft korrekt ist und eine wesentliche Änderung an Inhalt, strukturierten Daten oder Links widerspiegelt. [7]

Sitemap bei Google einreichen

Sitemaps können über Search Console, die Search Console API oder über eine `Sitemap:`-Zeile in robots.txt bekannt gemacht werden. [7][11][12]

Eine Einreichung ist nur ein Hinweis und garantiert weder Download noch Crawling oder Indexierung. [7]

Mehrsprachigkeit und spezielle Sitemaps

Google unterstützt `hreflang`-Beziehungen in XML-Sitemaps. Jede Sprachversion sollte alle Varianten einschließlich sich selbst referenzieren. [10]

Es gibt außerdem Erweiterungen für Bilder, Videos und News. [13][14][15]

Häufige technische SEO-Fehler

Ein schwerer Fehler ist, eine Seite in robots.txt zu blockieren und gleichzeitig zu erwarten, dass Google deren `noindex` liest. [5][16]

Auch widersprüchliche Signale zwischen Sitemap und `rel="canonical"` sollten vermieden werden. [9]

  • robots.txt nicht als Ersatz für `noindex` verwenden.
  • Keine Weiterleitungen, 404-Seiten oder unnötigen Duplikate in Sitemaps aufnehmen.
  • `<lastmod>` nicht bei jedem Deployment künstlich aktualisieren.
  • Canonical und Sitemap konsistent halten.
  • Subdomains und andere Protokolle separat prüfen.

Deployment-Checkliste

Prüfe reale HTTP-Antworten, nicht nur Dateien im Repository. robots.txt muss als Text erreichbar sein, Sitemaps in einem unterstützten Format. [2][7]

Nach dem Deployment sollte die Sitemap in Search Console geprüft werden. Bei Site-Migrationen können Sitemaps helfen, neue URLs schneller zu entdecken. [11][17]

  • Ist `/robots.txt` erreichbar?
  • Sind wichtige URLs versehentlich blockiert?
  • Sind noindex-Seiten crawlbar?
  • Enthält die Sitemap nur bevorzugte absolute URLs?
  • Bleibt jede Sitemap unter 50.000 URLs und 50 MB?
  • Sind Canonical und Sitemap konsistent?
  • Sind hreflang-Beziehungen korrekt?
  • Meldet Search Console Fehler?

Eine gute technische SEO-Konfiguration ist einfach und widerspruchsfrei. robots.txt sollte nur Bereiche blockieren, die Crawler wirklich nicht abrufen sollen. sitemap.xml sollte bevorzugte, erreichbare und indexierbare URLs enthalten. `noindex` darf nicht hinter robots.txt versteckt werden, und `<lastmod>` sollte echte Inhaltsänderungen abbilden.

SEO Technical SEO robots.txt sitemap.xml Crawling Indexing Google Search Console Canonical hreflang Sitemaps

Häufig gestellte Fragen

Verhindert robots.txt die Indexierung?

Nicht zuverlässig. Eine blockierte URL kann weiterhin indexiert erscheinen. Für einen Ausschluss sollte noindex genutzt werden, wobei die Seite crawlbar bleiben muss. [1][5]

Kann noindex in robots.txt stehen?

Google unterstützt das nicht. Verwende Robots-Meta oder X-Robots-Tag. [5][16]

Garantiert sitemap.xml die Indexierung?

Nein. Eine Sitemap ist nur ein Hinweis. [7]

Wie groß darf eine Sitemap sein?

Maximal 50.000 URLs und 50 MB unkomprimiert. [7][8]

Nutzt Google <priority> und <changefreq>?

Nein. Beide Werte werden ignoriert. [7]

Nutzt Google <lastmod>?

Ja, wenn es konsistent und nachprüfbar korrekt ist. [7]

Muss die Sitemap im Root liegen?

Google empfiehlt den Root. Ohne Search-Console-Einreichung hängt der Geltungsbereich vom Verzeichnis ab. [7]

Kann die Sitemap auf einem anderen Host liegen?

Ja, in unterstützten Cross-Site-Konfigurationen. Auch Sitemap in robots.txt kann auf einen anderen Host zeigen. [3][7]

Unterstützt Google crawl-delay?

Nein. [3]

Sollten noindex- oder Redirect-URLs in die Sitemap?

In der Regel nein, wenn die Sitemap die URLs repräsentieren soll, die indexiert werden sollen. [7][9]

Sind mehrere Sitemaps erlaubt?

Ja. Ein Sitemap-Index kann bis zu 50.000 Sitemaps enthalten. [7][8]

Reicht Sitemap in robots.txt?

Google kann die Sitemap so entdecken. Search Console liefert zusätzlich Verarbeitungs- und Fehlerdaten. [7][11]

Quellen und Referenzen

  1. Google Search Central, robots.txt introduction12
  2. Google Crawling Infrastructure, Create and submit a robots.txt file1234
  3. Google Crawling Infrastructure, How Google interprets the robots.txt specification12345678910
  4. IETF RFC 9309, Robots Exclusion Protocol123
  5. Google Search Central, Block Search indexing with noindex1234
  6. Google Search Central, Learn about sitemaps123
  7. Google Search Central, Build and submit a sitemap1234567891011121314151617181920
  8. sitemaps.org, Sitemap protocol1234
  9. Google Search Central, How to specify a canonical URL123
  10. Google Search Central, Localized versions of your pages
  11. Google Search Console Help, Sitemaps report123
  12. Google Search Console API, Sitemaps: submit
  13. Google Search Central, Image sitemaps
  14. Google Search Central, Video sitemaps and alternatives
  15. Google Search Central, News sitemaps
  16. Google Search Central, Robots meta tag and X-Robots-Tag specifications123
  17. Google Search Central, Site moves and migrations

War das hilfreich?

Neue Artikel per E-Mail erhalten

Eine kurze E-Mail pro neuem Wissens-Artikel. Kein Spam, Abmeldung mit einem Klick.

Wir nutzen Ihre E-Mail nur, um neue Artikel zu versenden. Keine Weitergabe an Dritte.

Zurück zu Wissen