robots.txt a sitemap.xml majú rozdielne úlohy
| Mechanizmus | Účel | Rozsah | Hlavný efekt |
|---|---|---|---|
| robots.txt | Riadenie crawlovania | Cesty pre crawlery | Negarantuje odstránenie z indexu |
| sitemap.xml | Signalizácia dôležitých URL | URL a metadáta | Signál, nie záruka indexovania |
| noindex | Vylúčenie z indexu | URL alebo zdroj | Funguje po prečítaní crawlerom |
| rel="canonical" | Určenie preferovanej verzie | URL alebo zdroj | Silný signál, nie absolútna direktíva |
robots.txt je súčasť Robots Exclusion Protocol a riadi prístup crawlerov k URL cestám. RFC 9309 výslovne uvádza, že nejde o autorizáciu prístupu. [4]
Sitemap informuje vyhľadávače o dôležitých stránkach, videách a ďalších súboroch a ich metadátach. [6]
Umiestnenie a rozsah robots.txt
Súbor sa musí volať `robots.txt` a byť v koreňovom adresári hosta, napríklad `https://example.com/robots.txt`. [2][4]
Rozsah je viazaný na protokol, host a port. Google navyše používa limit 500 KiB. [2][3]
Základná syntax
User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://example.com/sitemap.xml
Google podporuje `user-agent`, `allow`, `disallow` a `sitemap`. `crawl-delay` nepodporuje. [3]
Pole `sitemap` musí obsahovať absolútnu URL a môže byť uvedené viackrát. [2][3]
Porovnávanie pravidiel, veľkosť písmen a wildcardy
Google použije najkonkrétnejšie zodpovedajúce pravidlo. Ak sú `allow` a `disallow` rovnako konkrétne, použije menej reštriktívne `allow`. [3][4]
Cesty rozlišujú veľkosť písmen. Google podporuje `*` ako wildcard a `$` ako koniec URL. [3]
robots.txt nie je noindex
URL blokovaná v robots.txt sa môže stále objaviť vo výsledkoch, ak ju Google objaví z iných odkazov. [1][3]
Na vylúčenie z indexu použite `noindex` v robots meta alebo `X-Robots-Tag`. Google musí stránku crawlovat, aby pravidlo prečítal. [5][16]
HTTP chyby a cache robots.txt
| Stav | Správanie Google |
|---|---|
| 2xx | Spracuje robots.txt |
| 3xx | Sleduje aspoň 5 redirectov |
| 4xx except 429 | Berie ako absenciu obmedzení |
| 5xx / network | Môže crawling pozastaviť a použiť poslednú platnú verziu |
Google spracuje `2xx`, pri `3xx` sleduje aspoň päť redirectov a väčšinu `4xx` okrem `429` chápe ako absenciu obmedzení crawlovania. [3]
Pri `5xx` alebo sieťových problémoch môže crawling dočasne pozastaviť a použiť poslednú platnú verziu. robots.txt zvyčajne cacheuje do 24 hodín. [3]
Na čo slúži sitemap.xml
Sitemap pomáha objavovať dôležité URL a môže obsahovať dátumy zmien, jazykové varianty, obrázky, videá a spravodajský obsah. [6][7]
Google uvádza, že malý web s približne 500 stránkami alebo menej a kvalitným interným prelinkovaním sitemap nevyhnutne potrebovať nemusí. [6]
Podporované formáty sitemap
Google podporuje XML, RSS, mRSS, Atom 1.0 a textové sitemap. XML je najuniverzálnejší formát. [7]
Google medzi podporovanými formátmi neuvádza všeobecnú preferenciu. [7]
Limity sitemap a sitemap indexu
| Súbor | Maximum položiek | Maximálna veľkosť | Poznámka |
|---|---|---|---|
| Jedna sitemap | 50,000 | 50 MB | Limit po rozbalení; gzip povolený |
| Sitemap index | 50,000 sitemaps | 50 MB | Limit po rozbalení; gzip povolený |
Jedna sitemap je obmedzená na 50 000 URL alebo 50 MB po rozbalení. Väčšie súbory treba rozdeliť. [7][8]
Sitemap index môže obsahovať až 50 000 sitemap a tiež má limit 50 MB. gzip je povolený. [8]
Ktoré URL patria do sitemap
Google odporúča uvádzať absolútne URL, ktoré chcete zobrazovať vo výsledkoch vyhľadávania. [7]
Pri duplicitách je vhodné uvádzať preferovanú canonical URL. Zaradenie do sitemap je slabší canonical signál než redirect alebo `rel="canonical"`. [7][9]
`<lastmod>`, `<priority>` a `<changefreq>`
Google ignoruje `<priority>` a `<changefreq>`. [7]
`<lastmod>` môže použiť, ak je spoľahlivé a zodpovedá významnej zmene obsahu, štruktúrovaných dát alebo odkazov. [7]
Ako odoslať sitemap Googlu
Sitemap možno odoslať cez Search Console, Search Console API alebo uviesť v robots.txt pomocou `Sitemap:`. [7][11][12]
Odoslanie je iba signál a nezaručuje stiahnutie, crawling ani indexovanie. [7]
Viacjazyčné weby a špecializované sitemap
Google podporuje `hreflang` vzťahy v XML sitemap. Každá jazyková varianta má uvádzať všetky varianty vrátane seba. [10]
Existujú rozšírenia pre obrázky, videá a spravodajský obsah. [13][14][15]
Časté technické SEO chyby
Zablokovať stránku v robots.txt a zároveň očakávať, že Google prečíta jej `noindex`, je zásadná chyba. [5][16]
Treba sa vyhnúť aj rozporným signálom medzi sitemap a `rel="canonical"`. [9]
- Nepoužívajte robots.txt ako náhradu za `noindex`.
- Nevkladajte zbytočné redirecty, 404 ani duplicity do sitemap.
- Nemeňte `<lastmod>` pri každom deployi bez skutočnej zmeny.
- Udržujte canonical a sitemap konzistentné.
- Kontrolujte subdomény a protokoly samostatne.
Checklist nasadenia
Kontrolujte skutočné HTTP odpovede. robots.txt musí byť dostupný ako text a sitemap v podporovanom formáte. [2][7]
Po publikovaní skontrolujte report Sitemaps v Search Console. Pri migrácii môže sitemap pomôcť Google objaviť nové URL. [11][17]
- Je `/robots.txt` dostupný?
- Nie sú dôležité URL omylom blokované?
- Zostávajú noindex stránky crawlable?
- Obsahuje sitemap iba absolútne preferované URL?
- Je každý súbor pod 50 000 URL a 50 MB?
- Sú canonical a sitemap konzistentné?
- Sú hreflang vzťahy správne?
- Hlási Search Console chyby?

