robots.txt en sitemap.xml: technische SEO-gids | POLPROG Naar de inhoud

robots.txt en sitemap.xml: complete gids voor technische SEO

robots.txt en sitemap.xml lossen twee verschillende technische SEO-problemen op. robots.txt bepaalt welke URL's crawlers mogen ophalen, terwijl sitemap.xml zoekmachines helpt belangrijke URL's en metadata te ontdekken. Problemen ontstaan wanneer robots.txt wordt gebruikt om indexering te blokkeren of wanneer een sitemap redirects, duplicaten en noindex-URL's bevat.

Gepubliceerd Geschreven door Leestijd 9 min lezen

robots.txt en sitemap.xml lossen twee verschillende technische SEO-problemen op. robots.txt bepaalt welke URL's crawlers mogen ophalen, terwijl sitemap.xml zoekmachines helpt belangrijke URL's en metadata te ontdekken. Problemen ontstaan wanneer robots.txt wordt gebruikt om indexering te blokkeren of wanneer een sitemap redirects, duplicaten en noindex-URL's bevat.

Op deze pagina
  1. 1robots.txt en sitemap.xml hebben verschillende functies
  2. 2Locatie en bereik van robots.txt
  3. 3Basissyntaxis
  4. 4Regelmatching, hoofdletters en wildcards
  5. 5robots.txt is geen noindex
  6. 6HTTP-fouten en caching van robots.txt
  7. 7Waar sitemap.xml voor dient
  8. 8Ondersteunde sitemapformaten
  9. 9Limieten voor sitemap en sitemapindex
  10. 10Welke URL's in de sitemap horen
  11. 11`<lastmod>`, `<priority>` en `<changefreq>`
  12. 12Een sitemap indienen bij Google
  13. 13Meertalige sites en speciale sitemaps
  14. 14Veelgemaakte technische SEO-fouten
  15. 15Deploymentchecklist

robots.txt en sitemap.xml hebben verschillende functies

MechanismeDoelBereikBelangrijkste effect
robots.txtCrawling sturenPaden voor crawlersGarandeert geen de-indexering
sitemap.xmlBelangrijke URL's meldenURL's en metadataHint, geen indexeringsgarantie
noindexUit index uitsluitenURL of resourceWerkt nadat crawler de regel leest
rel="canonical"Voorkeursversie aangevenURL of resourceSterk signaal, geen absolute richtlijn

robots.txt maakt deel uit van het Robots Exclusion Protocol en regelt crawler-toegang tot URL-paden. RFC 9309 stelt expliciet dat dit geen toegangsautorisatie is. [4]

Een sitemap informeert zoekmachines over belangrijke pagina's, video's en andere bestanden en hun metadata. [6]

Locatie en bereik van robots.txt

Het bestand moet `robots.txt` heten en in de root van de host staan, bijvoorbeeld `https://example.com/robots.txt`. [2][4]

Het bereik is gekoppeld aan protocol, host en poort. Google hanteert ook een limiet van 500 KiB. [2][3]

Basissyntaxis

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://example.com/sitemap.xml

Google ondersteunt `user-agent`, `allow`, `disallow` en `sitemap`. `crawl-delay` wordt niet ondersteund. [3]

Het `sitemap`-veld bevat een absolute URL en mag meerdere keren voorkomen. [2][3]

Regelmatching, hoofdletters en wildcards

Google kiest de meest specifieke passende regel. Bij gelijke specificiteit van `allow` en `disallow` gebruikt Google de minst beperkende regel, `allow`. [3][4]

Padwaarden zijn hoofdlettergevoelig. Google ondersteunt `*` als wildcard en `$` als einde van de URL. [3]

robots.txt is geen noindex

Een door robots.txt geblokkeerde URL kan nog steeds in Google verschijnen als de URL via andere links wordt ontdekt. [1][3]

Gebruik `noindex` via robots meta of `X-Robots-Tag` om een URL uit de index te houden. Google moet de pagina kunnen crawlen om die regel te lezen. [5][16]

HTTP-fouten en caching van robots.txt

StatusGedrag van Google
2xxVerwerkt het robots.txt-bestand
3xxVolgt minstens 5 redirects
4xx except 429Behandelt als geen crawlbeperkingen
5xx / networkKan crawling pauzeren en laatste geldige versie gebruiken

Google verwerkt `2xx`, volgt bij `3xx` minstens vijf redirects en behandelt de meeste `4xx`, behalve `429`, alsof er geen crawlbeperkingen zijn. [3]

Bij `5xx` of netwerkproblemen kan Google crawling tijdelijk pauzeren en de laatst geldige versie gebruiken. robots.txt wordt normaal tot ongeveer 24 uur gecachet. [3]

Waar sitemap.xml voor dient

Een sitemap helpt belangrijke URL's ontdekken en kan wijzigingsdatums, taalvarianten, afbeeldingen, video's en nieuws bevatten. [6][7]

Google geeft aan dat een kleine site van ongeveer 500 pagina's of minder met goede interne links mogelijk geen sitemap nodig heeft. [6]

Ondersteunde sitemapformaten

Google ondersteunt XML, RSS, mRSS, Atom 1.0 en tekstsitemaps. XML is het meest veelzijdig. [7]

Google spreekt geen algemene voorkeur uit voor een van de ondersteunde formaten. [7]

Limieten voor sitemap en sitemapindex

BestandMaximale itemsMaximale grootteOpmerking
Enkele sitemap50,00050 MBOngecomprimeerde limiet; gzip toegestaan
Sitemapindex50,000 sitemaps50 MBOngecomprimeerde limiet; gzip toegestaan

Eén sitemap is beperkt tot 50.000 URL's of 50 MB ongecomprimeerd. Grotere verzamelingen moeten worden opgesplitst. [7][8]

Een sitemapindex kan maximaal 50.000 sitemaps bevatten en heeft eveneens een limiet van 50 MB. gzip is toegestaan. [8]

Welke URL's in de sitemap horen

Google adviseert absolute URL's op te nemen die je in zoekresultaten wilt zien. [7]

Bij duplicaten hoort meestal de voorkeurs-canonical in de sitemap. Sitemapopname is een zwakker canonicals signaal dan een redirect of `rel="canonical"`. [7][9]

`<lastmod>`, `<priority>` en `<changefreq>`

Google negeert `<priority>` en `<changefreq>`. [7]

`<lastmod>` kan worden gebruikt als de waarde consequent betrouwbaar is en een belangrijke wijziging aan content, structured data of links weerspiegelt. [7]

Een sitemap indienen bij Google

Je kunt een sitemap indienen via Search Console, de Search Console API of via `Sitemap:` in robots.txt. [7][11][12]

Indienen is slechts een hint en garandeert geen download, crawling of indexering. [7]

Meertalige sites en speciale sitemaps

Google ondersteunt `hreflang`-relaties in XML-sitemaps. Elke taalvariant moet alle varianten, inclusief zichzelf, vermelden. [10]

Er zijn uitbreidingen voor afbeeldingen, video's en nieuws. [13][14][15]

Veelgemaakte technische SEO-fouten

Een pagina blokkeren in robots.txt en tegelijk verwachten dat Google de `noindex` leest, is een ernstige fout. [5][16]

Ook tegenstrijdige signalen tussen sitemap en `rel="canonical"` moeten worden vermeden. [9]

  • Gebruik robots.txt niet als vervanging voor `noindex`.
  • Plaats geen onnodige redirects, 404's of duplicaten in de sitemap.
  • Wijzig `<lastmod>` niet bij iedere deployment zonder echte pagina-aanpassing.
  • Houd canonical en sitemap consistent.
  • Controleer subdomeinen en protocollen afzonderlijk.

Deploymentchecklist

Controleer echte HTTP-responses. robots.txt moet als tekst worden geserveerd en de sitemap in een ondersteund formaat. [2][7]

Controleer na publicatie het Sitemaps-rapport in Search Console. Bij migraties kan een sitemap helpen nieuwe URL's sneller te ontdekken. [11][17]

  • Is `/robots.txt` bereikbaar?
  • Zijn belangrijke URL's per ongeluk geblokkeerd?
  • Blijven noindex-pagina's crawlbaar?
  • Bevat de sitemap alleen absolute voorkeurs-URL's?
  • Blijft elk bestand onder 50.000 URL's en 50 MB?
  • Zijn canonical en sitemap consistent?
  • Zijn hreflang-relaties correct?
  • Meldt Search Console fouten?

Een goede technische SEO-configuratie is eenvoudig en consistent. robots.txt hoort alleen delen te blokkeren die crawlers echt niet moeten ophalen. sitemap.xml hoort voorkeur-URL's te bevatten die bereikbaar en indexeerbaar zijn. Verberg `noindex` niet achter robots.txt en laat `<lastmod>` echte, betekenisvolle wijzigingen weerspiegelen.

SEO Technical SEO robots.txt sitemap.xml Crawling Indexing Google Search Console Canonical hreflang Sitemaps

Veelgestelde vragen

Voorkomt robots.txt indexering?

Niet gegarandeerd. Een geblokkeerde URL kan nog in zoekresultaten verschijnen. Gebruik noindex en zorg dat Google de pagina kan crawlen. [1][5]

Kan noindex in robots.txt?

Google ondersteunt dat niet. Gebruik robots meta of X-Robots-Tag. [5][16]

Garandeert sitemap.xml indexering?

Nee. Het is alleen een hint. [7]

Wat zijn de sitemaplimieten?

50.000 URL's en 50 MB ongecomprimeerd per bestand. [7][8]

Gebruikt Google <priority> en <changefreq>?

Nee. Beide worden genegeerd. [7]

Gebruikt Google <lastmod>?

Ja, als die betrouwbaar is en een belangrijke wijziging weergeeft. [7]

Moet de sitemap in de root staan?

Google raadt de root aan. Zonder Search Console-indiening hangt het bereik af van de directory. [7]

Kan een sitemap op een andere host staan?

Ja, binnen ondersteunde cross-site-configuraties. [3][7]

Ondersteunt Google crawl-delay?

Nee. [3]

Horen noindex- of redirect-URL's in de sitemap?

Meestal niet als de sitemap de gewenste indexeerbare URL's representeert. [7][9]

Kun je meerdere sitemaps hebben?

Ja. Eén index kan maximaal 50.000 sitemaps bevatten. [7][8]

Is Sitemap in robots.txt genoeg?

Google kan de sitemap zo ontdekken. Search Console blijft nuttig voor verwerking en fouten. [7][11]

Bronnen en referenties

  1. Google Search Central, robots.txt introduction12
  2. Google Crawling Infrastructure, Create and submit a robots.txt file1234
  3. Google Crawling Infrastructure, How Google interprets the robots.txt specification12345678910
  4. IETF RFC 9309, Robots Exclusion Protocol123
  5. Google Search Central, Block Search indexing with noindex1234
  6. Google Search Central, Learn about sitemaps123
  7. Google Search Central, Build and submit a sitemap1234567891011121314151617181920
  8. sitemaps.org, Sitemap protocol1234
  9. Google Search Central, How to specify a canonical URL123
  10. Google Search Central, Localized versions of your pages
  11. Google Search Console Help, Sitemaps report123
  12. Google Search Console API, Sitemaps: submit
  13. Google Search Central, Image sitemaps
  14. Google Search Central, Video sitemaps and alternatives
  15. Google Search Central, News sitemaps
  16. Google Search Central, Robots meta tag and X-Robots-Tag specifications123
  17. Google Search Central, Site moves and migrations

Was dit nuttig?

Ontvang nieuwe artikelen per e-mail

Eén korte e-mail per nieuw blogartikel. Geen spam, uitschrijven in één klik.

We gebruiken je e-mail alleen om nieuwe artikelen te sturen. Geen delen met derden.

Terug naar de blog