robots.txt a sitemap.xml: sprievodca technickým SEO | POLPROG Prejsť na obsah

robots.txt a sitemap.xml: kompletný sprievodca technickým SEO

robots.txt a sitemap.xml riešia dve odlišné úlohy technického SEO. robots.txt riadi, ktoré URL môžu crawlery načítať, zatiaľ čo sitemap.xml pomáha vyhľadávačom objaviť dôležité URL a ich metadáta. Problémy vznikajú, keď sa robots.txt používa na blokovanie indexovania alebo keď sitemap obsahuje redirecty, duplicity a URL s noindex.

Publikované Autor Čas čítania 9 min čítania

robots.txt a sitemap.xml riešia dve odlišné úlohy technického SEO. robots.txt riadi, ktoré URL môžu crawlery načítať, zatiaľ čo sitemap.xml pomáha vyhľadávačom objaviť dôležité URL a ich metadáta. Problémy vznikajú, keď sa robots.txt používa na blokovanie indexovania alebo keď sitemap obsahuje redirecty, duplicity a URL s noindex.

Na tejto stránke
  1. 1robots.txt a sitemap.xml majú rozdielne úlohy
  2. 2Umiestnenie a rozsah robots.txt
  3. 3Základná syntax
  4. 4Porovnávanie pravidiel, veľkosť písmen a wildcardy
  5. 5robots.txt nie je noindex
  6. 6HTTP chyby a cache robots.txt
  7. 7Na čo slúži sitemap.xml
  8. 8Podporované formáty sitemap
  9. 9Limity sitemap a sitemap indexu
  10. 10Ktoré URL patria do sitemap
  11. 11`<lastmod>`, `<priority>` a `<changefreq>`
  12. 12Ako odoslať sitemap Googlu
  13. 13Viacjazyčné weby a špecializované sitemap
  14. 14Časté technické SEO chyby
  15. 15Checklist nasadenia

robots.txt a sitemap.xml majú rozdielne úlohy

MechanizmusÚčelRozsahHlavný efekt
robots.txtRiadenie crawlovaniaCesty pre crawleryNegarantuje odstránenie z indexu
sitemap.xmlSignalizácia dôležitých URLURL a metadátaSignál, nie záruka indexovania
noindexVylúčenie z indexuURL alebo zdrojFunguje po prečítaní crawlerom
rel="canonical"Určenie preferovanej verzieURL alebo zdrojSilný signál, nie absolútna direktíva

robots.txt je súčasť Robots Exclusion Protocol a riadi prístup crawlerov k URL cestám. RFC 9309 výslovne uvádza, že nejde o autorizáciu prístupu. [4]

Sitemap informuje vyhľadávače o dôležitých stránkach, videách a ďalších súboroch a ich metadátach. [6]

Umiestnenie a rozsah robots.txt

Súbor sa musí volať `robots.txt` a byť v koreňovom adresári hosta, napríklad `https://example.com/robots.txt`. [2][4]

Rozsah je viazaný na protokol, host a port. Google navyše používa limit 500 KiB. [2][3]

Základná syntax

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://example.com/sitemap.xml

Google podporuje `user-agent`, `allow`, `disallow` a `sitemap`. `crawl-delay` nepodporuje. [3]

Pole `sitemap` musí obsahovať absolútnu URL a môže byť uvedené viackrát. [2][3]

Porovnávanie pravidiel, veľkosť písmen a wildcardy

Google použije najkonkrétnejšie zodpovedajúce pravidlo. Ak sú `allow` a `disallow` rovnako konkrétne, použije menej reštriktívne `allow`. [3][4]

Cesty rozlišujú veľkosť písmen. Google podporuje `*` ako wildcard a `$` ako koniec URL. [3]

robots.txt nie je noindex

URL blokovaná v robots.txt sa môže stále objaviť vo výsledkoch, ak ju Google objaví z iných odkazov. [1][3]

Na vylúčenie z indexu použite `noindex` v robots meta alebo `X-Robots-Tag`. Google musí stránku crawlovat, aby pravidlo prečítal. [5][16]

HTTP chyby a cache robots.txt

StavSprávanie Google
2xxSpracuje robots.txt
3xxSleduje aspoň 5 redirectov
4xx except 429Berie ako absenciu obmedzení
5xx / networkMôže crawling pozastaviť a použiť poslednú platnú verziu

Google spracuje `2xx`, pri `3xx` sleduje aspoň päť redirectov a väčšinu `4xx` okrem `429` chápe ako absenciu obmedzení crawlovania. [3]

Pri `5xx` alebo sieťových problémoch môže crawling dočasne pozastaviť a použiť poslednú platnú verziu. robots.txt zvyčajne cacheuje do 24 hodín. [3]

Na čo slúži sitemap.xml

Sitemap pomáha objavovať dôležité URL a môže obsahovať dátumy zmien, jazykové varianty, obrázky, videá a spravodajský obsah. [6][7]

Google uvádza, že malý web s približne 500 stránkami alebo menej a kvalitným interným prelinkovaním sitemap nevyhnutne potrebovať nemusí. [6]

Podporované formáty sitemap

Google podporuje XML, RSS, mRSS, Atom 1.0 a textové sitemap. XML je najuniverzálnejší formát. [7]

Google medzi podporovanými formátmi neuvádza všeobecnú preferenciu. [7]

Limity sitemap a sitemap indexu

SúborMaximum položiekMaximálna veľkosťPoznámka
Jedna sitemap50,00050 MBLimit po rozbalení; gzip povolený
Sitemap index50,000 sitemaps50 MBLimit po rozbalení; gzip povolený

Jedna sitemap je obmedzená na 50 000 URL alebo 50 MB po rozbalení. Väčšie súbory treba rozdeliť. [7][8]

Sitemap index môže obsahovať až 50 000 sitemap a tiež má limit 50 MB. gzip je povolený. [8]

Ktoré URL patria do sitemap

Google odporúča uvádzať absolútne URL, ktoré chcete zobrazovať vo výsledkoch vyhľadávania. [7]

Pri duplicitách je vhodné uvádzať preferovanú canonical URL. Zaradenie do sitemap je slabší canonical signál než redirect alebo `rel="canonical"`. [7][9]

`<lastmod>`, `<priority>` a `<changefreq>`

Google ignoruje `<priority>` a `<changefreq>`. [7]

`<lastmod>` môže použiť, ak je spoľahlivé a zodpovedá významnej zmene obsahu, štruktúrovaných dát alebo odkazov. [7]

Ako odoslať sitemap Googlu

Sitemap možno odoslať cez Search Console, Search Console API alebo uviesť v robots.txt pomocou `Sitemap:`. [7][11][12]

Odoslanie je iba signál a nezaručuje stiahnutie, crawling ani indexovanie. [7]

Viacjazyčné weby a špecializované sitemap

Google podporuje `hreflang` vzťahy v XML sitemap. Každá jazyková varianta má uvádzať všetky varianty vrátane seba. [10]

Existujú rozšírenia pre obrázky, videá a spravodajský obsah. [13][14][15]

Časté technické SEO chyby

Zablokovať stránku v robots.txt a zároveň očakávať, že Google prečíta jej `noindex`, je zásadná chyba. [5][16]

Treba sa vyhnúť aj rozporným signálom medzi sitemap a `rel="canonical"`. [9]

  • Nepoužívajte robots.txt ako náhradu za `noindex`.
  • Nevkladajte zbytočné redirecty, 404 ani duplicity do sitemap.
  • Nemeňte `<lastmod>` pri každom deployi bez skutočnej zmeny.
  • Udržujte canonical a sitemap konzistentné.
  • Kontrolujte subdomény a protokoly samostatne.

Checklist nasadenia

Kontrolujte skutočné HTTP odpovede. robots.txt musí byť dostupný ako text a sitemap v podporovanom formáte. [2][7]

Po publikovaní skontrolujte report Sitemaps v Search Console. Pri migrácii môže sitemap pomôcť Google objaviť nové URL. [11][17]

  • Je `/robots.txt` dostupný?
  • Nie sú dôležité URL omylom blokované?
  • Zostávajú noindex stránky crawlable?
  • Obsahuje sitemap iba absolútne preferované URL?
  • Je každý súbor pod 50 000 URL a 50 MB?
  • Sú canonical a sitemap konzistentné?
  • Sú hreflang vzťahy správne?
  • Hlási Search Console chyby?

Dobrá konfigurácia technického SEO je jednoduchá a konzistentná. robots.txt má blokovať len časti, ktoré crawler naozaj nemá načítať. sitemap.xml má obsahovať preferované, dostupné a indexovateľné URL. `noindex` nesmie byť skrytý za robots.txt a `<lastmod>` má odrážať skutočné významné zmeny.

SEO Technical SEO robots.txt sitemap.xml Crawling Indexing Google Search Console Canonical hreflang Sitemaps

Často kladené otázky

Bráni robots.txt indexovaniu?

Nie zaručene. Blokovaná URL sa môže stále objaviť vo výsledkoch. Na vylúčenie použite noindex a nechajte Google stránku crawlovat. [1][5]

Možno dať noindex do robots.txt?

Google to nepodporuje. Použite robots meta alebo X-Robots-Tag. [5][16]

Garantuje sitemap.xml indexovanie?

Nie. Je to iba signál. [7]

Aké sú limity sitemap?

50 000 URL a 50 MB po rozbalení na jeden súbor. [7][8]

Používa Google <priority> a <changefreq>?

Nie. Obe hodnoty ignoruje. [7]

Používa Google <lastmod>?

Áno, ak je spoľahlivé a odráža významnú zmenu. [7]

Musí byť sitemap v koreňovom adresári?

Google odporúča root. Bez odoslania cez Search Console závisí rozsah od adresára. [7]

Môže byť sitemap na inom hoste?

Áno, v podporovaných cross-site konfiguráciách. [3][7]

Podporuje Google crawl-delay?

Nie. [3]

Patria noindex alebo redirect URL do sitemap?

Zvyčajne nie, ak má sitemap predstavovať URL určené na indexovanie. [7][9]

Možno mať viac sitemap?

Áno. Jeden index môže obsahovať až 50 000 sitemap. [7][8]

Stačí Sitemap v robots.txt?

Google ju tak môže objaviť. Search Console je stále užitočná na monitoring a chyby. [7][11]

Zdroje a referencie

  1. Google Search Central, robots.txt introduction12
  2. Google Crawling Infrastructure, Create and submit a robots.txt file1234
  3. Google Crawling Infrastructure, How Google interprets the robots.txt specification12345678910
  4. IETF RFC 9309, Robots Exclusion Protocol123
  5. Google Search Central, Block Search indexing with noindex1234
  6. Google Search Central, Learn about sitemaps123
  7. Google Search Central, Build and submit a sitemap1234567891011121314151617181920
  8. sitemaps.org, Sitemap protocol1234
  9. Google Search Central, How to specify a canonical URL123
  10. Google Search Central, Localized versions of your pages
  11. Google Search Console Help, Sitemaps report123
  12. Google Search Console API, Sitemaps: submit
  13. Google Search Central, Image sitemaps
  14. Google Search Central, Video sitemaps and alternatives
  15. Google Search Central, News sitemaps
  16. Google Search Central, Robots meta tag and X-Robots-Tag specifications123
  17. Google Search Central, Site moves and migrations

Bolo to užitočné?

Získavajte nové články e-mailom

Jeden krátky e-mail na každý nový článok Vzdelávania. Žiadny spam, odhlásenie jedným kliknutím.

Váš e-mail používame len na zasielanie nových článkov. Žiadne zdieľanie s tretími stranami.

Späť na Vzdelávanie