robots.txt a sitemap.xml: průvodce technickým SEO | POLPROG Přejít na obsah

robots.txt a sitemap.xml: kompletní průvodce technickým SEO

robots.txt a sitemap.xml řeší dva odlišné problémy technického SEO. robots.txt řídí, které URL mohou crawleři stahovat, zatímco sitemap.xml pomáhá vyhledávačům objevit důležité URL a jejich metadata. Problémy vznikají, když se robots.txt používá pro blokování indexace nebo když sitemap obsahuje redirecty, duplicity a URL s noindex.

Publikováno Autor Čas čtení 9 min čtení

robots.txt a sitemap.xml řeší dva odlišné problémy technického SEO. robots.txt řídí, které URL mohou crawleři stahovat, zatímco sitemap.xml pomáhá vyhledávačům objevit důležité URL a jejich metadata. Problémy vznikají, když se robots.txt používá pro blokování indexace nebo když sitemap obsahuje redirecty, duplicity a URL s noindex.

Na této stránce
  1. 1robots.txt a sitemap.xml mají různé role
  2. 2Umístění a rozsah robots.txt
  3. 3Základní syntaxe
  4. 4Porovnávání pravidel, velikost písmen a wildcardy
  5. 5robots.txt není noindex
  6. 6HTTP chyby a cache robots.txt
  7. 7K čemu slouží sitemap.xml
  8. 8Podporované formáty sitemap
  9. 9Limity sitemap a sitemap indexu
  10. 10Které URL do sitemap patří
  11. 11`<lastmod>`, `<priority>` a `<changefreq>`
  12. 12Jak sitemap odeslat Googlu
  13. 13Vícejazyčné weby a specializované sitemap
  14. 14Časté technické SEO chyby
  15. 15Checklist nasazení

robots.txt a sitemap.xml mají různé role

MechanismusÚčelRozsahHlavní efekt
robots.txtŘízení crawlováníCesty pro crawleryNegarantuje odstranění z indexu
sitemap.xmlSignalizace důležitých URLURL a metadataSignál, ne záruka indexace
noindexVyloučení z indexuURL nebo zdrojFunguje po přečtení crawlerem
rel="canonical"Určení preferované verzeURL nebo zdrojSilný signál, ne absolutní direktiva

robots.txt je součástí Robots Exclusion Protocol a řídí přístup crawlerů k URL cestám. RFC 9309 výslovně říká, že nejde o autorizaci přístupu. [4]

Sitemap informuje vyhledávače o důležitých stránkách, videích a dalších souborech a jejich metadatech. [6]

Umístění a rozsah robots.txt

Soubor se musí jmenovat `robots.txt` a být v kořeni hostu, například `https://example.com/robots.txt`. [2][4]

Rozsah je vázán na protokol, host a port. Google také používá limit 500 KiB. [2][3]

Základní syntaxe

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://example.com/sitemap.xml

Google podporuje `user-agent`, `allow`, `disallow` a `sitemap`. `crawl-delay` nepodporuje. [3]

Pole `sitemap` musí obsahovat absolutní URL a může být uvedeno vícekrát. [2][3]

Porovnávání pravidel, velikost písmen a wildcardy

Google použije nejkonkrétnější odpovídající pravidlo. Pokud jsou `allow` a `disallow` stejně konkrétní, použije méně restriktivní `allow`. [3][4]

Cesty rozlišují velikost písmen. Google podporuje `*` jako wildcard a `$` jako konec URL. [3]

robots.txt není noindex

URL blokovaná v robots.txt se může stále objevit ve výsledcích, pokud ji Google objeví z jiných odkazů. [1][3]

Pro vyloučení z indexu použijte `noindex` v robots meta nebo `X-Robots-Tag`. Google musí stránku crawlovat, aby pravidlo přečetl. [5][16]

HTTP chyby a cache robots.txt

StavChování Google
2xxZpracuje robots.txt
3xxSleduje alespoň 5 redirectů
4xx except 429Bere jako absenci omezení
5xx / networkMůže crawling pozastavit a použít poslední platnou verzi

Google zpracuje `2xx`, u `3xx` sleduje alespoň pět redirectů a většinu `4xx` kromě `429` chápe jako absenci omezení crawlování. [3]

U `5xx` nebo síťových problémů může crawling dočasně pozastavit a použít poslední platnou verzi. robots.txt obvykle cacheuje až 24 hodin. [3]

K čemu slouží sitemap.xml

Sitemap pomáhá objevovat důležité URL a může obsahovat datum změny, jazykové varianty, obrázky, videa a news obsah. [6][7]

Google uvádí, že malý web s přibližně 500 stránkami nebo méně a dobrým interním prolinkováním sitemap nutně potřebovat nemusí. [6]

Podporované formáty sitemap

Google podporuje XML, RSS, mRSS, Atom 1.0 a textové sitemap. XML je nejuniverzálnější. [7]

Google mezi podporovanými formáty neuvádí obecnou preferenci. [7]

Limity sitemap a sitemap indexu

SouborMaximum položekMaximální velikostPoznámka
Jedna sitemap50,00050 MBLimit po rozbalení; gzip povolen
Sitemap index50,000 sitemaps50 MBLimit po rozbalení; gzip povolen

Jedna sitemap je omezena na 50 000 URL nebo 50 MB po rozbalení. Větší sady musí být rozděleny. [7][8]

Sitemap index může obsahovat až 50 000 sitemap a také má limit 50 MB. gzip je povolen. [8]

Které URL do sitemap patří

Google doporučuje uvádět absolutní URL, které chcete zobrazovat ve výsledcích. [7]

U duplicit je vhodné uvést preferovanou canonical URL. Přítomnost v sitemap je slabší canonical signál než redirect nebo `rel="canonical"`. [7][9]

`<lastmod>`, `<priority>` a `<changefreq>`

Google ignoruje `<priority>` a `<changefreq>`. [7]

`<lastmod>` může použít, pokud je spolehlivé a odpovídá významné změně obsahu, strukturovaných dat nebo odkazů. [7]

Jak sitemap odeslat Googlu

Sitemap lze odeslat přes Search Console, Search Console API nebo uvést v robots.txt pomocí `Sitemap:`. [7][11][12]

Odeslání je pouze signál a nezaručuje stažení, crawling ani indexaci. [7]

Vícejazyčné weby a specializované sitemap

Google podporuje `hreflang` vztahy v XML sitemap. Každá jazyková varianta má uvést všechny varianty včetně sebe. [10]

Existují rozšíření pro obrázky, videa a news obsah. [13][14][15]

Časté technické SEO chyby

Zablokovat stránku v robots.txt a současně čekat, že Google přečte její `noindex`, je zásadní chyba. [5][16]

Je třeba se vyhnout i rozporným signálům mezi sitemap a `rel="canonical"`. [9]

  • Nepoužívejte robots.txt jako náhradu za `noindex`.
  • Nevkládejte zbytečné redirecty, 404 ani duplicity do sitemap.
  • Neměňte `<lastmod>` při každém deployi bez skutečné změny.
  • Udržujte canonical a sitemap konzistentní.
  • Kontrolujte subdomény a protokoly samostatně.

Checklist nasazení

Kontrolujte skutečné HTTP odpovědi. robots.txt musí být dostupný jako text a sitemap v podporovaném formátu. [2][7]

Po publikaci zkontrolujte report Sitemaps v Search Console. Při migraci může sitemap pomoci Google objevit nové URL. [11][17]

  • Je `/robots.txt` dostupný?
  • Nejsou důležité URL omylem blokované?
  • Zůstávají noindex stránky crawlable?
  • Obsahuje sitemap pouze absolutní preferované URL?
  • Je každý soubor pod 50 000 URL a 50 MB?
  • Jsou canonical a sitemap konzistentní?
  • Jsou hreflang vztahy správné?
  • Hlásí Search Console chyby?

Dobrá konfigurace technického SEO je jednoduchá a konzistentní. robots.txt má blokovat jen části, které crawler skutečně nemá stahovat. sitemap.xml má obsahovat preferované, dostupné a indexovatelné URL. `noindex` nesmí být skrytý za robots.txt a `<lastmod>` má odpovídat skutečným významným změnám.

SEO Technical SEO robots.txt sitemap.xml Crawling Indexing Google Search Console Canonical hreflang Sitemaps

Často kladené otázky

Brání robots.txt indexaci?

Ne zaručeně. Blokovaná URL může být stále ve výsledcích. Pro vyloučení použijte noindex a nechte Google stránku crawlovat. [1][5]

Lze dát noindex do robots.txt?

Google to nepodporuje. Použijte robots meta nebo X-Robots-Tag. [5][16]

Garantuje sitemap.xml indexaci?

Ne. Je to pouze signál. [7]

Jaké jsou limity sitemap?

50 000 URL a 50 MB po rozbalení na soubor. [7][8]

Používá Google <priority> a <changefreq>?

Ne. Obě hodnoty ignoruje. [7]

Používá Google <lastmod>?

Ano, pokud je spolehlivé a reprezentuje významnou změnu. [7]

Musí být sitemap v kořeni webu?

Google doporučuje kořen. Bez odeslání přes Search Console závisí rozsah na adresáři. [7]

Může být sitemap na jiném hostu?

Ano, v podporovaných cross-site konfiguracích. [3][7]

Podporuje Google crawl-delay?

Ne. [3]

Patří noindex nebo redirect URL do sitemap?

Obvykle ne, pokud má sitemap reprezentovat URL určené k indexaci. [7][9]

Lze mít více sitemap?

Ano. Jeden index může obsahovat až 50 000 sitemap. [7][8]

Stačí Sitemap v robots.txt?

Google ji tak může objevit. Search Console je stále užitečná pro monitoring a chyby. [7][11]

Zdroje a reference

  1. Google Search Central, robots.txt introduction12
  2. Google Crawling Infrastructure, Create and submit a robots.txt file1234
  3. Google Crawling Infrastructure, How Google interprets the robots.txt specification12345678910
  4. IETF RFC 9309, Robots Exclusion Protocol123
  5. Google Search Central, Block Search indexing with noindex1234
  6. Google Search Central, Learn about sitemaps123
  7. Google Search Central, Build and submit a sitemap1234567891011121314151617181920
  8. sitemaps.org, Sitemap protocol1234
  9. Google Search Central, How to specify a canonical URL123
  10. Google Search Central, Localized versions of your pages
  11. Google Search Console Help, Sitemaps report123
  12. Google Search Console API, Sitemaps: submit
  13. Google Search Central, Image sitemaps
  14. Google Search Central, Video sitemaps and alternatives
  15. Google Search Central, News sitemaps
  16. Google Search Central, Robots meta tag and X-Robots-Tag specifications123
  17. Google Search Central, Site moves and migrations

Bylo to užitečné?

Odebírejte nové články e-mailem

Jeden krátký e-mail na každý nový článek znalostní báze. Žádný spam, odhlášení jedním kliknutím.

Váš e-mail používáme pouze k zasílání nových článků. Žádné sdílení s třetími stranami.

Zpět do znalostní báze