robots.txt a sitemap.xml mají různé role
| Mechanismus | Účel | Rozsah | Hlavní efekt |
|---|---|---|---|
| robots.txt | Řízení crawlování | Cesty pro crawlery | Negarantuje odstranění z indexu |
| sitemap.xml | Signalizace důležitých URL | URL a metadata | Signál, ne záruka indexace |
| noindex | Vyloučení z indexu | URL nebo zdroj | Funguje po přečtení crawlerem |
| rel="canonical" | Určení preferované verze | URL nebo zdroj | Silný signál, ne absolutní direktiva |
robots.txt je součástí Robots Exclusion Protocol a řídí přístup crawlerů k URL cestám. RFC 9309 výslovně říká, že nejde o autorizaci přístupu. [4]
Sitemap informuje vyhledávače o důležitých stránkách, videích a dalších souborech a jejich metadatech. [6]
Umístění a rozsah robots.txt
Soubor se musí jmenovat `robots.txt` a být v kořeni hostu, například `https://example.com/robots.txt`. [2][4]
Rozsah je vázán na protokol, host a port. Google také používá limit 500 KiB. [2][3]
Základní syntaxe
User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://example.com/sitemap.xml
Google podporuje `user-agent`, `allow`, `disallow` a `sitemap`. `crawl-delay` nepodporuje. [3]
Pole `sitemap` musí obsahovat absolutní URL a může být uvedeno vícekrát. [2][3]
Porovnávání pravidel, velikost písmen a wildcardy
Google použije nejkonkrétnější odpovídající pravidlo. Pokud jsou `allow` a `disallow` stejně konkrétní, použije méně restriktivní `allow`. [3][4]
Cesty rozlišují velikost písmen. Google podporuje `*` jako wildcard a `$` jako konec URL. [3]
robots.txt není noindex
URL blokovaná v robots.txt se může stále objevit ve výsledcích, pokud ji Google objeví z jiných odkazů. [1][3]
Pro vyloučení z indexu použijte `noindex` v robots meta nebo `X-Robots-Tag`. Google musí stránku crawlovat, aby pravidlo přečetl. [5][16]
HTTP chyby a cache robots.txt
| Stav | Chování Google |
|---|---|
| 2xx | Zpracuje robots.txt |
| 3xx | Sleduje alespoň 5 redirectů |
| 4xx except 429 | Bere jako absenci omezení |
| 5xx / network | Může crawling pozastavit a použít poslední platnou verzi |
Google zpracuje `2xx`, u `3xx` sleduje alespoň pět redirectů a většinu `4xx` kromě `429` chápe jako absenci omezení crawlování. [3]
U `5xx` nebo síťových problémů může crawling dočasně pozastavit a použít poslední platnou verzi. robots.txt obvykle cacheuje až 24 hodin. [3]
K čemu slouží sitemap.xml
Sitemap pomáhá objevovat důležité URL a může obsahovat datum změny, jazykové varianty, obrázky, videa a news obsah. [6][7]
Google uvádí, že malý web s přibližně 500 stránkami nebo méně a dobrým interním prolinkováním sitemap nutně potřebovat nemusí. [6]
Podporované formáty sitemap
Google podporuje XML, RSS, mRSS, Atom 1.0 a textové sitemap. XML je nejuniverzálnější. [7]
Google mezi podporovanými formáty neuvádí obecnou preferenci. [7]
Limity sitemap a sitemap indexu
| Soubor | Maximum položek | Maximální velikost | Poznámka |
|---|---|---|---|
| Jedna sitemap | 50,000 | 50 MB | Limit po rozbalení; gzip povolen |
| Sitemap index | 50,000 sitemaps | 50 MB | Limit po rozbalení; gzip povolen |
Jedna sitemap je omezena na 50 000 URL nebo 50 MB po rozbalení. Větší sady musí být rozděleny. [7][8]
Sitemap index může obsahovat až 50 000 sitemap a také má limit 50 MB. gzip je povolen. [8]
Které URL do sitemap patří
Google doporučuje uvádět absolutní URL, které chcete zobrazovat ve výsledcích. [7]
U duplicit je vhodné uvést preferovanou canonical URL. Přítomnost v sitemap je slabší canonical signál než redirect nebo `rel="canonical"`. [7][9]
`<lastmod>`, `<priority>` a `<changefreq>`
Google ignoruje `<priority>` a `<changefreq>`. [7]
`<lastmod>` může použít, pokud je spolehlivé a odpovídá významné změně obsahu, strukturovaných dat nebo odkazů. [7]
Jak sitemap odeslat Googlu
Sitemap lze odeslat přes Search Console, Search Console API nebo uvést v robots.txt pomocí `Sitemap:`. [7][11][12]
Odeslání je pouze signál a nezaručuje stažení, crawling ani indexaci. [7]
Vícejazyčné weby a specializované sitemap
Google podporuje `hreflang` vztahy v XML sitemap. Každá jazyková varianta má uvést všechny varianty včetně sebe. [10]
Existují rozšíření pro obrázky, videa a news obsah. [13][14][15]
Časté technické SEO chyby
Zablokovat stránku v robots.txt a současně čekat, že Google přečte její `noindex`, je zásadní chyba. [5][16]
Je třeba se vyhnout i rozporným signálům mezi sitemap a `rel="canonical"`. [9]
- Nepoužívejte robots.txt jako náhradu za `noindex`.
- Nevkládejte zbytečné redirecty, 404 ani duplicity do sitemap.
- Neměňte `<lastmod>` při každém deployi bez skutečné změny.
- Udržujte canonical a sitemap konzistentní.
- Kontrolujte subdomény a protokoly samostatně.
Checklist nasazení
Kontrolujte skutečné HTTP odpovědi. robots.txt musí být dostupný jako text a sitemap v podporovaném formátu. [2][7]
Po publikaci zkontrolujte report Sitemaps v Search Console. Při migraci může sitemap pomoci Google objevit nové URL. [11][17]
- Je `/robots.txt` dostupný?
- Nejsou důležité URL omylem blokované?
- Zůstávají noindex stránky crawlable?
- Obsahuje sitemap pouze absolutní preferované URL?
- Je každý soubor pod 50 000 URL a 50 MB?
- Jsou canonical a sitemap konzistentní?
- Jsou hreflang vztahy správné?
- Hlásí Search Console chyby?

