Validátor robots.txt a sitemáp - test pravidiel prehľadávania a XML sitemáp | POLPROG Prejsť na obsah

Validátor robots.txt a sitemáp FREE

Analyzujte robots.txt webu a jeho strom sitemáp. Nástroj spracuje pravidlá pre prehľadávače, prejde sitemap indexy, overí načítané dokumenty a skontroluje URL adresy, ktoré odosielajú.

Zadarmo Bez registrácie Súkromie na prvom mieste
Zadajte web na analýzu

Zadajte doménu alebo ktorúkoľvek stránku na nej. robots.txt sa vždy číta z koreňa daného hostiteľa, takže cesta v adrese nič nemení.

Rozšírené možnosti
Režim kontroly

Analyzujte konkrétnu sitemapu popri tých, ktoré sa nájdu automaticky. Užitočné pri sitemape, ktorú robots.txt nedeklaruje.

Pravidlá sa vyhodnocujú pre každý prehľadávač zvlášť. Táto voľba riadi tester URL adries a stĺpec prehľadávateľnosti.

Táto analýza beží na serveroch POLPROG, pretože prečítať robots.txt a sitemapy cudzieho webu sa z vášho prehliadača nedá. Požadujú sa len verejne dostupné súbory, po odoslaní odpovede sa nič neuchováva a žiadna správa sa neukladá ani nezdieľa.

Referencia

robots.txt a XML sitemapy v skratke

01

Čo je robots.txt

Súbor v čistom texte v koreni hostiteľa, na adrese /robots.txt, ktorý prehľadávačom hovorí, o ktoré cesty URL smú požiadať. Je to pokyn na prehľadávanie, nie riadenie prístupu: súbor je verejný a prehľadávač, ktorý ho ignoruje, technicky nič neporušuje. V RFC 9309 sú štandardizované len štyri direktívy: User-agent, Allow, Disallow a Sitemap.

02

robots.txt neriadi indexovanie

Disallow bráni stiahnutiu stránky. Nebráni tomu, aby sa URL adresa objavila vo výsledkoch vyhľadávania: blokovaná stránka, na ktorú odkazujú iné weby, sa stále môže objaviť, a to bez popisu, pretože prehľadávač ju nikdy nesmel prečítať a nájsť vašu značku noindex. Ak chcete stránku udržať mimo indexu, nechajte ju prehľadávateľnú a poskytnite meta značku robots s hodnotou noindex alebo hlavičku X-Robots-Tag.

03

Ako sa pravidlá vyhodnocujú

Prehľadávač použije jednu skupinu: tú, ktorej token User-agent je najdlhšou zhodou s jeho vlastným názvom, s návratom k *. V rámci tejto skupiny vyhráva najkonkrétnejšie pravidlo, merané dĺžkou vzoru cesty, nie poradím riadkov. Keď zodpovedá Allow aj Disallow rovnakej dĺžky, vyhráva Allow. Znak * zodpovedá ľubovoľnej postupnosti znakov a koncový $ ukotví koniec URL adresy.

04

Čo je XML sitemapa

Zoznam URL adries, ktoré chcete mať prehľadané, s voliteľnými hodnotami lastmod, changefreq a priority pre každú z nich. Pomáha objavovaniu na veľkých weboch, na weboch so slabo prepojenými stránkami a na nových weboch. Nezaručuje indexovanie a Google changefreq a priority úplne ignoruje.

05

Čo je sitemap index

Sitemapa sitemáp. Jeden súbor môže obsahovať najviac 50 000 URL adries a 50 MB v nekomprimovanej podobe, takže veľký web rozdelí svoje URL adresy medzi viac sitemáp a tieto súbory uvedie v dokumente sitemapindex. Tento index je tá jediná URL adresa, ktorú deklarujete v robots.txt a odosielate v Search Console.

06

Limity, ktoré naozaj bolia

Sitemapa: 50 000 URL adries a 50 MB v nekomprimovanej podobe na jeden súbor. Gzip je povolený a 50 MB platí pre rozbalenú veľkosť. robots.txt: Google prečíta prvých 500 KiB a zvyšok zahodí. Sitemapa smie uvádzať len URL adresy na hostiteľovi, ktorý ju poskytuje, pokiaľ nie je nastavené krížové odosielanie.

07

Kde musí byť každý súbor umiestnený

robots.txt je platný len v koreni hostiteľa a portu: https://example.com/robots.txt riadi https://example.com a nič iné. Súbor na adrese /blog/robots.txt sa ignoruje a https://example.com/robots.txt nehovorí nič o http://example.com ani o www.example.com. Sitemapa môže byť kdekoľvek na svojom hostiteľovi a nájde sa cez robots.txt alebo odoslaním.

08

Protirečenie, ktoré treba hľadať ako prvé

URL adresa, ktorá sa nachádza v sitemape a zároveň je zakázaná v robots.txt. Sitemapa žiada o jej prehľadanie a robots.txt to odmieta, takže sa ani neprehľadáva, ani spoľahlivo neindexuje, a Search Console to hlási ako chybu. Tento nástroj porovná každú URL adresu zo sitemáp s pravidlami v tom istom robots.txt a spočíta ich.

Rozsah a hranice

Čo táto analýza pokrýva

Merané priamo zo súborov, s uvedenými limitmi

Všetko, čo je tu uvedené, sa počas kontroly načíta z vlastného súboru robots.txt a zo súborov sitemáp daného webu: stav HTTP, veľkosť súboru, spracované pravidlá, štruktúra XML a URL adresy, ktoré každá sitemapa uvádza. Prehľadávateľnosť sa vypočíta porovnaním týchto adries s tým istým robots.txt podľa pravidiel RFC 9309. Kontrola prečíta najviac 40 dokumentov sitemáp, päť úrovní vnorenia indexov a 50 000 URL adries a stav HTTP zisťuje pre obmedzený počet adries, nie pre všetky; všade, kde číslo pokrýva len časť webu, to správa uvádza priamo pri ňom. Nedokáže povedať, či je stránka zaindexovaná: nič v robots.txt, v sitemape ani v odpovedi HTTP túto informáciu nenesie a tento nástroj nemá žiadne prepojenie na Search Console.

Pomoc

FAQ

Bráni robots.txt tomu, aby sa stránka objavila v Google?

Nie. Disallow bráni prehľadávaču stiahnuť stránku; URL adresu z indexu neodstráni. Blokovaná stránka, na ktorú odkazujú iné weby, sa stále môže vo výsledkoch objaviť, zvyčajne bez popisu, pretože prehľadávač ju nikdy nesmel prečítať. Ak chcete stránku udržať mimo indexu, nechajte ju prehľadávateľnú a poskytnite meta značku robots s hodnotou noindex alebo hlavičku X-Robots-Tag. Riadok Noindex v robots.txt nerobí nič: Google ho nikdy nepodporoval a v roku 2019 ho prestal rešpektovať.

Kde musí byť robots.txt umiestnený?

V koreni hostiteľa a portu, ktorý riadi, a nikde inde. https://example.com/robots.txt platí pre https://example.com a pre nič viac: nie pre http://example.com, nie pre www.example.com a nie pre subdoménu. Súbor na adrese /blog/robots.txt sa ignoruje. Tento nástroj vždy číta koreň hostiteľa, ktorý zadáte, takže cesta v adrese nič nemení.

Koľko URL adries môže obsahovať jedna sitemapa?

Až 50 000 URL adries a 50 MB v nekomprimovanej podobe na jeden súbor. Gzip je povolený a limit veľkosti platí pre rozbalený súbor. Po prekročení ktoréhokoľvek z týchto limitov rozdeľte URL adresy medzi viac sitemáp a tieto súbory uveďte v sitemap indexe; pre index platia rovnaké limity 50 000 a 50 MB na sitemapy, na ktoré odkazuje.

Ktoré pravidlo vyhráva, keď tej istej URL adrese zodpovedajú dve?

To najkonkrétnejšie, merané dĺžkou vzoru cesty, nie poradím, v akom riadky v súbore stoja. Keď zodpovedá Allow aj Disallow rovnakej dĺžky, vyhráva Allow. Ešte predtým si prehľadávač vyberie jednu skupinu: tú, ktorej token User-agent je najdlhšou zhodou s jeho vlastným názvom, s návratom ku skupine *. Tester URL adries v tejto správe ukazuje, ktoré pravidlo o každej odpovedi rozhodlo a na ktorom riadku sa nachádza.

Ukladá POLPROG weby, ktoré analyzujem?

Nie. Analýza beží na serveroch POLPROG, pretože prečítať robots.txt a sitemapy cudzieho webu sa z vášho prehliadača nedá, a požadujú sa len verejne dostupné súbory. Nič sa nezapisuje do databázy, žiadna správa sa neukladá a nevytvára sa žiadna zdieľateľná kópia. Odkaz vo vašom adresnom riadku analýzu spustí znova namiesto načítania uloženej.

Prečo správa uvádza, že sa kontrolovali len niektoré URL adresy?

Pretože kontrola URL adresy znamená odoslanie skutočnej požiadavky na analyzovaný web a veľká sitemapa ich obsahuje desaťtisíce. Štruktúra sitemáp sa vždy spracuje celá, takže počty, duplicity, lastmod a údaje o prehľadávateľnosti pokrývajú každú URL adresu, ktorú kontrola prečítala. Stav HTTP sa zisťuje pre obmedzený počet: približne 40 v režime Rýchla analýza a až 500 v režime Úplná analýza URL adries. Správa vždy uvádza, o koľko adries sa skutočne požiadalo, a nikdy nevydáva vzorku za celý web.

Tvorte lepší web, rýchlejšie.

Vytvárame softvér na mieru a riešenia prispôsobené vašim potrebám.

Kontaktujte nás