robots.txt- en sitemapvalidator: test crawlregels en XML-sitemaps | POLPROG Naar de inhoud

robots.txt- en sitemapvalidator FREE

Analyseer de robots.txt van een site en de sitemapstructuur. Ontleed crawlerregels, volg sitemap indexes, valideer de gelezen documenten en controleer de URL's die ze aanleveren.

Gratis te gebruiken Geen registratie Privacy voorop
Voer een website in om te analyseren

Voer een domein in of een willekeurige pagina daarop. robots.txt wordt altijd uit de root van die host gelezen, dus een pad in het adres verandert daar niets aan.

Geavanceerde opties
Scanmodus

Analyseer naast de automatisch gevonden sitemaps ook een specifieke sitemap. Handig voor een sitemap die robots.txt niet opgeeft.

Regels worden per crawler gematcht. Deze keuze bepaalt de URL-tester en de kolom crawlbaarheid.

Deze analyse draait op servers van POLPROG, omdat de robots.txt en sitemaps van een andere site niet vanuit uw browser gelezen kunnen worden. Er worden alleen openbaar beschikbare bestanden opgevraagd, er wordt niets bewaard nadat de respons is verstuurd, en er wordt geen rapport opgeslagen of gedeeld.

Naslag

robots.txt en XML-sitemaps in het kort

01

Wat robots.txt is

Een bestand in platte tekst in de root van een host, op /robots.txt, dat crawlers vertelt welke URL-paden ze mogen opvragen. Het is een crawlinstructie, geen toegangscontrole: het bestand is openbaar, en een crawler die het negeert doet technisch gezien niets verkeerd. Slechts vier directives zijn gestandaardiseerd in RFC 9309: User-agent, Allow, Disallow en Sitemap.

02

robots.txt bepaalt niet de indexering

Disallow verhindert dat een pagina wordt opgehaald. Het verhindert niet dat de URL in de zoekresultaten verschijnt: een geblokkeerde pagina waarnaar andere sites linken kan nog steeds worden vermeld, zonder omschrijving, omdat de crawler de pagina nooit mocht lezen om uw noindex-tag te vinden. Om een pagina buiten de index te houden, laat u hem crawlbaar en serveert u een noindex robots-metatag of een X-Robots-Tag-header.

03

Hoe regels worden gematcht

Een crawler gebruikt één groep: die waarvan het User-agent-token het langst overeenkomt met zijn eigen naam, met * als terugval. Binnen die groep wint de meest specifieke regel, gemeten aan de lengte van het padpatroon en niet aan de volgorde van de regels. Als een Allow en een Disallow van gelijke lengte allebei matchen, wint Allow. * staat voor een willekeurige reeks tekens en een afsluitende $ verankert het einde van de URL.

04

Wat een XML-sitemap is

Een lijst van de URL's die u gecrawld wilt hebben, met optioneel lastmod, changefreq en priority per URL. Het helpt bij het ontdekken van pagina's op grote sites, op sites met pagina's die slecht gelinkt zijn en op nieuwe sites. Het garandeert geen indexering, en Google negeert changefreq en priority volledig.

05

Wat een sitemap index is

Een sitemap van sitemaps. Eén bestand mag hoogstens 50.000 URL's en 50 MB ongecomprimeerd bevatten, dus een grote site verdeelt zijn URL's over meerdere sitemaps en vermeldt die bestanden in een sitemapindex-document. Die index is de enige URL die u in robots.txt opgeeft en in Search Console indient.

06

De limieten waar u werkelijk tegenaan loopt

Een sitemap: 50.000 URL's en 50 MB ongecomprimeerd per bestand. Gzip is toegestaan en de 50 MB geldt voor de uitgepakte omvang. robots.txt: Google leest de eerste 500 KiB en verwerpt de rest. Een sitemap mag alleen URL's vermelden op de host die hem serveert, tenzij cross-submission is geconfigureerd.

07

Waar elk bestand moet staan

robots.txt is alleen geldig in de root van een host en poort: https://example.com/robots.txt geldt voor https://example.com en verder niets. Een bestand op /blog/robots.txt wordt genegeerd, en https://example.com/robots.txt zegt niets over http://example.com of over www.example.com. Een sitemap mag overal op zijn host staan en wordt gevonden via robots.txt of door indiening.

08

De tegenspraak waar u het eerst naar kijkt

Een URL die in de sitemap staat en door robots.txt wordt verboden. De sitemap vraagt om hem te crawlen en robots.txt weigert, waardoor hij niet wordt gecrawld en niet betrouwbaar wordt geïndexeerd, en Search Console dit als fout meldt. Deze tool toetst elke sitemap-URL aan de regels in dezelfde robots.txt en telt ze.

Reikwijdte en grenzen

Wat deze analyse omvat

Gemeten aan de bestanden zelf, met vermelding van de grenzen

Alles wat hier wordt gerapporteerd, is tijdens de scan gelezen uit de robots.txt en de sitemapbestanden van de site zelf: HTTP-status, bestandsgrootte, verwerkte regels, XML-structuur en de URL's die elke sitemap vermeldt. Crawlbaarheid wordt berekend door die URL's te toetsen aan dezelfde robots.txt, volgens de regels van RFC 9309. De scan leest hoogstens 40 sitemapdocumenten, vijf niveaus van geneste indexes en 50.000 URL's, en controleert de HTTP-status van een begrensd aantal URL's in plaats van van alle; overal waar een getal maar een deel van de site dekt, vermeldt het rapport dat erbij. De tool kan u niet vertellen of een pagina geïndexeerd is: niets in robots.txt, in een sitemap of in een HTTP-respons bevat die informatie, en deze tool heeft geen verbinding met Search Console.

Hulp

FAQ

Voorkomt robots.txt dat een pagina in Google verschijnt?

Nee. Disallow verhindert dat een crawler de pagina ophaalt; het haalt de URL niet uit de index. Een geblokkeerde pagina waarnaar andere sites linken kan nog steeds worden vermeld, meestal zonder omschrijving, omdat de crawler de pagina nooit mocht lezen. Om een pagina buiten de index te houden, laat u hem crawlbaar en serveert u een noindex robots-metatag of een X-Robots-Tag-header. Een Noindex-regel in robots.txt doet niets: Google heeft die nooit ondersteund en houdt er sinds 2019 helemaal geen rekening meer mee.

Waar moet robots.txt staan?

In de root van de host en poort waarvoor hij geldt, en nergens anders. https://example.com/robots.txt geldt voor https://example.com en verder niets: niet voor http://example.com, niet voor www.example.com, niet voor een subdomein. Een bestand op /blog/robots.txt wordt genegeerd. Deze tool leest altijd de root van de host die u invoert, dus een pad in het adres verandert daar niets aan.

Hoeveel URL's kan één sitemap bevatten?

Maximaal 50.000 URL's en 50 MB ongecomprimeerd per bestand. Gzip is toegestaan en de groottelimiet geldt voor het uitgepakte bestand. Gaat u over een van beide limieten heen, verdeel de URL's dan over meerdere sitemaps en vermeld die bestanden in een sitemap index; voor een index gelden dezelfde limieten van 50.000 URL's en 50 MB voor de sitemaps waarnaar hij verwijst.

Welke regel wint als twee regels op dezelfde URL passen?

De meest specifieke, gemeten aan de lengte van het padpatroon en niet aan de volgorde van de regels in het bestand. Als een Allow en een Disallow van gelijke lengte allebei matchen, wint Allow. Daarvoor kiest de crawler eerst één groep: die waarvan het User-agent-token het langst overeenkomt met zijn eigen naam, met de groep * als terugval. De URL-tester in dit rapport laat zien welke regel elk antwoord bepaalde en op welke regel in het bestand die staat.

Slaat POLPROG de sites op die ik analyseer?

Nee. De analyse draait op servers van POLPROG, omdat de robots.txt en sitemaps van een andere site niet vanuit uw browser gelezen kunnen worden, en er worden alleen openbaar beschikbare bestanden opgevraagd. Er wordt niets naar een database geschreven, er wordt geen rapport bewaard en er wordt geen deelbare kopie gemaakt. De link in uw adresbalk voert de analyse opnieuw uit in plaats van een opgeslagen versie te laden.

Waarom staat er in het rapport dat maar een deel van de URL's is gecontroleerd?

Omdat het controleren van een URL betekent dat er een echt verzoek naar de geanalyseerde site gaat, en een grote sitemap er tienduizenden bevat. De sitemapstructuur wordt altijd volledig verwerkt, dus de aantallen, duplicaten, lastmod en crawlbaarheidscijfers gelden voor elke URL die de scan heeft gelezen. De HTTP-status wordt voor een begrensd aantal opgevraagd: ongeveer 40 bij de snelle analyse en maximaal 500 bij de volledige URL-analyse. Het rapport vermeldt altijd hoeveel er werkelijk zijn opgevraagd, en presenteert een steekproef nooit alsof die de hele site dekt.

Bouw een beter web, sneller.

Wij bouwen maatwerksoftware en oplossingen afgestemd op jouw wensen.

Neem contact op