robots.txt & Sitemap Validator - test pravidel procházení a XML sitemap | POLPROG Přejít na obsah

robots.txt & Sitemap Validator FREE

Analyzujte soubor robots.txt webu a jeho strom sitemap. Rozeberte pravidla pro prohledávače, projděte sitemap index soubory, ověřte načtené dokumenty a zkontrolujte URL, které odesílají.

Zdarma Bez registrace Důraz na soukromí
Zadejte web k analýze

Zadejte doménu nebo jakoukoli její stránku. robots.txt se vždy čte z kořene daného hostitele, takže cesta v adrese nic nemění.

Pokročilé možnosti
Režim kontroly

Analyzujte konkrétní sitemap navíc k těm, které se najdou automaticky. Užitečné pro sitemap, kterou robots.txt nedeklaruje.

Pravidla se vyhodnocují pro každý prohledávač zvlášť. Tato volba řídí tester URL a sloupec s průchodností.

Tato analýza běží na serverech POLPROG, protože čtení souboru robots.txt a sitemap jiného webu nelze provést z vašeho prohlížeče. Stahují se pouze veřejně dostupné soubory, po odeslání odpovědi se nic neuchovává a žádný report se neukládá ani nesdílí.

Reference

robots.txt a XML sitemap ve zkratce

01

Co je robots.txt

Soubor v prostém textu v kořeni hostitele, na adrese /robots.txt, který prohledávačům říká, o které cesty URL smějí žádat. Jde o pokyn k procházení, nikoli o řízení přístupu: soubor je veřejný a prohledávač, který jej ignoruje, technicky nic neporušuje. V RFC 9309 jsou standardizovány jen čtyři direktivy - User-agent, Allow, Disallow a Sitemap.

02

robots.txt neřídí indexování

Disallow brání stažení stránky. Nebrání tomu, aby se URL objevila ve výsledcích vyhledávání: blokovaná stránka, na kterou odkazují jiné weby, může být uvedena i nadále, bez popisku, protože prohledávač nikdy nesměl stránku přečíst a najít vaši značku noindex. Chcete-li stránku udržet mimo index, nechte ji průchozí a doručte meta značku robots s hodnotou noindex nebo hlavičku X-Robots-Tag.

03

Jak se pravidla vyhodnocují

Prohledávač používá jednu skupinu: tu, jejíž token User-agent nejdelší měrou odpovídá jeho vlastnímu jménu, s návratem ke skupině *. Uvnitř této skupiny vyhrává nejkonkrétnější pravidlo, měřeno délkou vzoru cesty, nikoli pořadím řádků. Pokud odpovídá Allow i Disallow shodné délky, vyhrává Allow. Znak * odpovídá libovolné sekvenci znaků a koncový znak $ ukotví konec URL.

04

Co je XML sitemap

Seznam URL, které chcete nechat procházet, s nepovinnými hodnotami lastmod, changefreq a priority u každé z nich. Pomáhá s objevováním na velkých webech, na webech se stránkami, na které vede málo odkazů, a na nových webech. Nezaručuje indexaci a Google hodnoty changefreq a priority zcela ignoruje.

05

Co je sitemap index

Sitemap sitemap souborů. Jeden soubor smí obsahovat nejvýše 50 000 URL a 50 MB v nekomprimované podobě, takže velký web rozdělí své URL do několika sitemap souborů a uvede je v dokumentu sitemapindex. Právě tento index je jediná URL, kterou deklarujete v souboru robots.txt a odesíláte v Search Console.

06

Limity, které skutečně bolí

Sitemap: 50 000 URL a 50 MB v nekomprimované podobě na soubor. Gzip je povolen a 50 MB platí pro rozbalenou velikost. robots.txt: Google čte prvních 500 KiB a zbytek zahodí. Sitemap smí uvádět jen URL na hostiteli, který ji doručuje, pokud není nastaveno křížové odesílání.

07

Kde musí každý soubor být

robots.txt platí jen v kořeni hostitele a portu: https://example.com/robots.txt řídí https://example.com a nic jiného. Soubor na /blog/robots.txt se ignoruje a https://example.com/robots.txt neříká nic o http://example.com ani o www.example.com. Sitemap může být na svém hostiteli kdekoli a nachází se přes robots.txt nebo odesláním.

08

Rozpor, který je třeba hledat jako první

URL, která se objevuje v sitemap a je zároveň zakázána souborem robots.txt. Sitemap žádá o její procházení a robots.txt to odmítá, takže není procházena ani spolehlivě indexována a Search Console to hlásí jako chybu. Tento nástroj porovnává každou URL ze sitemap s pravidly v tomtéž souboru robots.txt a počítá je.

Rozsah a hranice

Co tato analýza pokrývá

Měřeno přímo ze souborů, s uvedenými limity

Vše, co je zde uvedeno, se během kontroly čte ze souboru robots.txt a ze sitemap souborů samotného webu: stav HTTP, velikost souboru, zpracovaná pravidla, struktura XML a URL, které každá sitemap uvádí. Průchodnost se počítá porovnáním těchto URL s týmž souborem robots.txt podle pravidel RFC 9309. Kontrola přečte nejvýše 40 sitemap dokumentů, pět úrovní zanoření indexů a 50 000 URL a stav HTTP zjišťuje u omezeného počtu URL, nikoli u všech; kdekoli číslo pokrývá jen část webu, report to u něj uvádí. Nemůže vám říci, zda je stránka indexována: nic v souboru robots.txt, v sitemap ani v odpovědi HTTP takovou informaci nenese a tento nástroj nemá připojení k Search Console.

Nápověda

FAQ

Zabrání robots.txt tomu, aby se stránka objevila v Googlu?

Ne. Disallow brání prohledávači stáhnout stránku; neodstraní URL z indexu. Blokovaná stránka, na kterou odkazují jiné weby, může být ve výsledcích uvedena i nadále, obvykle bez popisku, protože prohledávač nikdy nesměl stránku přečíst. Chcete-li stránku udržet mimo index, nechte ji průchozí a doručte meta značku robots s hodnotou noindex nebo hlavičku X-Robots-Tag. Řádek Noindex uvnitř souboru robots.txt nedělá nic: Google jej nikdy nepodporoval a v roce 2019 jej přestal respektovat.

Kde musí robots.txt být?

V kořeni hostitele a portu, který řídí, a nikde jinde. https://example.com/robots.txt platí pro https://example.com a pro nic dalšího: ne pro http://example.com, ne pro www.example.com, ne pro subdoménu. Soubor na /blog/robots.txt se ignoruje. Tento nástroj vždy čte kořen toho hostitele, kterého zadáte, takže cesta v adrese nic nemění.

Kolik URL smí obsahovat jedna sitemap?

Nejvýše 50 000 URL a 50 MB v nekomprimované podobě na soubor. Gzip je povolen a limit velikosti platí pro rozbalený soubor. Po překročení kteréhokoli z těchto limitů rozdělte URL do několika sitemap souborů a uveďte tyto soubory v dokumentu sitemap index; index má nad sitemap soubory, na které odkazuje, stejné limity 50 000 a 50 MB.

Které pravidlo vyhraje, když se na tutéž URL hodí dvě?

To nejkonkrétnější, měřeno délkou vzoru cesty, nikoli pořadím řádků v souboru. Když se hodí Allow i Disallow shodné délky, vyhrává Allow. Ještě předtím si prohledávač vybere jednu skupinu: tu, jejíž token User-agent nejdelší měrou odpovídá jeho vlastnímu jménu, s návratem ke skupině *. Tester URL v tomto reportu ukazuje, které pravidlo o každé odpovědi rozhodlo a na kterém řádku leží.

Uchovává POLPROG weby, které analyzuji?

Ne. Analýza běží na serverech POLPROG, protože čtení souboru robots.txt a sitemap jiného webu nelze provést z vašeho prohlížeče, a stahují se pouze veřejně dostupné soubory. Nic se nezapisuje do databáze, žádný report se neukládá a nevzniká žádná sdílitelná kopie. Odkaz ve vašem adresním řádku analýzu spustí znovu, místo aby načetl uloženou.

Proč report uvádí, že byla zkontrolována jen část URL?

Protože kontrola URL znamená odeslat skutečný požadavek na analyzovaný web a velká sitemap jich obsahuje desetitisíce. Struktura sitemap se vždy zpracuje celá, takže počty, duplicity a údaje o lastmod a průchodnosti pokrývají každou URL, kterou kontrola přečetla. Stav HTTP se zjišťuje u omezeného počtu: přibližně 40 v rychlé analýze a až 500 v úplné analýze URL. Report vždy uvádí, kolik jich bylo skutečně vyžádáno, a nikdy nevydává vzorek za celý web.

Tvořte lepší web, rychleji.

Vytváříme software a řešení na míru vašim potřebám.

Kontaktujte nás