robots.txt і sitemap.xml: посібник з технічного SEO | POLPROG Перейти до вмісту

robots.txt і sitemap.xml: повний посібник з технічного SEO

robots.txt і sitemap.xml вирішують дві різні задачі технічного SEO. robots.txt визначає, які URL пошуковий робот може завантажувати, а sitemap.xml допомагає пошуковим системам знаходити важливі URL та їхні метадані. Проблеми починаються, коли robots.txt використовують для блокування індексації або коли sitemap містить перенаправлення, дублікати й URL з noindex.

Опубліковано Автор Час читання 20 хв читання

robots.txt і sitemap.xml вирішують дві різні задачі технічного SEO. robots.txt визначає, які URL пошуковий робот може завантажувати, а sitemap.xml допомагає пошуковим системам знаходити важливі URL та їхні метадані. Проблеми починаються, коли robots.txt використовують для блокування індексації або коли sitemap містить перенаправлення, дублікати й URL з noindex.

На цій сторінці
  1. 1robots.txt і sitemap.xml мають різні ролі
  2. 2Розташування і область дії robots.txt
  3. 3Базовий синтаксис
  4. 4Вибір правила, регістр і wildcard
  5. 5robots.txt не замінює noindex
  6. 6HTTP-помилки і cache robots.txt
  7. 7Для чого потрібен sitemap.xml
  8. 8Підтримувані формати sitemap
  9. 9Ліміти sitemap і sitemap index
  10. 10Які URL варто включати
  11. 11`<lastmod>`, `<priority>` і `<changefreq>`
  12. 12Як надіслати sitemap Google
  13. 13Багатомовні сайти і спеціалізовані sitemaps
  14. 14Типові помилки технічного SEO
  15. 15Checklist перед публікацією

robots.txt і sitemap.xml мають різні ролі

МеханізмМетаОбластьОсновний ефект
robots.txtКерування скануванняPaths для пошуковий роботНе гарантує видалення з індексу
sitemap.xmlСигналізувати важливі URLURL і метаданіПідказка, не гарантія індексації
noindexВиключити з індексуURL або ресурсПрацює після прочитання пошуковий робот
rel="canonical"Вказати бажану версіюURL або ресурсСильний сигнал, не абсолютна directive

robots.txt є частиною Robots Exclusion Protocol і керує доступом пошуковий робот до URL шляхи. RFC 9309 прямо зазначає, що ці правила не є механізмом authorization. [4]

Sitemap повідомляє пошуковим системам про важливі сторінки, відео та інші файли, а також їхні метадані. [6]

Розташування і область дії robots.txt

Файл має називатися `robots.txt` і бути в корені хост, наприклад `https://example.com/robots.txt`. [2][4]

Область дії прив'язана до протоколу, хост і порт. Google також застосовує ліміт 500 KiB. [2][3]

Базовий синтаксис

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://example.com/sitemap.xml

Google підтримує `user-agent`, `allow`, `disallow` і `sitemap`. `crawl-delay` не підтримується. [3]

Поле `sitemap` має містити абсолютну URL і може повторюватися кілька разів. [2][3]

Вибір правила, регістр і wildcard

Google застосовує найконкретніше відповідне правило. Якщо `allow` і `disallow` однаково конкретні, використовується менш обмежувальне `allow`. [3][4]

Paths чутливі до регістру. Google підтримує `*` як wildcard і `$` як кінець URL. [3]

robots.txt не замінює noindex

URL, заблокована в robots.txt, все одно може з'явитися в результатах, якщо Google знайде її через інші посилання. [1][3]

Для виключення з індексу використовуйте `noindex` у robots meta або `X-Robots-Tag`. Google має мати можливість завантажити сторінку, щоб прочитати правило. [5][16]

HTTP-помилки і cache robots.txt

СтатусПоведінка Google
2xxОбробляє robots.txt
3xxПереходить щонайменше через 5 перенаправлення
4xx except 429Трактує як відсутність обмежень
5xx / networkМоже призупинити сканування і використати останню коректну версію

Google обробляє `2xx`, для `3xx` переходить щонайменше через п'ять перенаправлення і більшість `4xx`, окрім `429`, трактує як відсутність обмежень сканування. [3]

При `5xx` або мережевих проблемах Google може тимчасово призупинити сканування і використовувати останню коректну версію. Зазвичай robots.txt зберігається в cache до 24 годин. [3]

Для чого потрібен sitemap.xml

Sitemap допомагає знаходити важливі URL і може містити дату зміни, мовні варіанти, зображення, відео та новини вміст. [6][7]

Google зазначає, що невеликому сайту приблизно до 500 сторінок із хорошими внутрішні посилання sitemap може бути не обов'язковим. [6]

Підтримувані формати sitemap

Google підтримує XML, RSS, mRSS, Atom 1.0 і текстові sitemaps. XML є найгнучкішим форматом. [7]

Google не заявляє загальної переваги одного підтримуваного формату над іншим. [7]

Ліміти sitemap і sitemap index

ФайлМаксимум записівМаксимальний розмірПримітка
Один sitemap50,00050 MBЛіміт після розпакування; gzip дозволений
Sitemap index50,000 sitemaps50 MBЛіміт після розпакування; gzip дозволений

Один sitemap обмежений 50 000 URL або 50 MB після розпакування. Більші набори треба розділяти. [7][8]

Sitemap index може містити до 50 000 sitemaps і також має ліміт 50 MB. gzip дозволений. [8]

Які URL варто включати

Google рекомендує додавати абсолютні URL, які ви хочете бачити в результатах пошуку. [7]

Для дублікатів варто вказувати бажану canonical URL. Наявність у sitemap є слабшим canonical сигнал, ніж перенаправлення або `rel="canonical"`. [7][9]

`<lastmod>`, `<priority>` і `<changefreq>`

Google ігнорує `<priority>` і `<changefreq>`. [7]

`<lastmod>` може використовуватися, якщо значення надійне і відповідає значущій зміні вміст, структуровані дані або посилання. [7]

Як надіслати sitemap Google

Sitemap можна надіслати через Search Console, Search Console API або вказати в robots.txt через `Sitemap:`. [7][11][12]

Надсилання є лише підказкою і не гарантує завантаження, сканування чи індексацію. [7]

Багатомовні сайти і спеціалізовані sitemaps

Google підтримує `hreflang` зв'язки в XML sitemap. Кожна мовна версія має вказувати всі варіанти, включно з собою. [10]

Існують розширення для зображення, відео та новини. [13][14][15]

Типові помилки технічного SEO

Блокувати сторінку в robots.txt і водночас очікувати, що Google прочитає її `noindex`, є серйозною помилкою. [5][16]

Також слід уникати суперечливих сигналs між sitemap і `rel="canonical"`. [9]

  • Не використовуйте robots.txt замість `noindex`.
  • Не додавайте зайві перенаправлення, 404 або duplicates до sitemap.
  • Не змінюйте `<lastmod>` при кожному розгортання без реальної зміни.
  • Тримайте canonical і sitemap узгодженими.
  • Перевіряйте субдомени і протоколи окремо.

Checklist перед публікацією

Перевіряйте реальні HTTP відповіді. robots.txt має віддаватися як text, а sitemap у підтримуваному форматі. [2][7]

Після публікації перевірте reпорт Sitemaps у Search Console. Під час migration sitemap може допомогти Google швидше знайти нові URL. [11][17]

  • Чи доступний `/robots.txt`?
  • Чи не заблоковані важливі URL помилково?
  • Чи залишаються noindex сторінки доступними для сканування?
  • Чи sitemap містить лише абсолютні бажані URL?
  • Чи кожен файл менший за 50 000 URL і 50 MB?
  • Чи canonical і sitemap узгоджені?
  • Чи hreflang зв'язки коректні?
  • Чи Search Console показує помилки?

Хороша конфігурація технічного SEO має бути простою та узгодженою. robots.txt повинен блокувати лише ті ділянки, які пошуковий робот справді не має завантажувати. sitemap.xml має містити бажані, доступні й індексовані URL. `noindex` не слід ховати за robots.txt, а `<lastmod>` має відображати реальні значущі зміни.

SEO Technical SEO robots.txt sitemap.xml Crawling Indexing Google Search Console Canonical hreflang Sitemaps

Часті запитання

Чи robots.txt запобігає індексації?

Не гарантовано. Заблокована URL може все одно з'явитися у результатах. Для виключення використовуйте noindex і дозвольте Google завантажити сторінку. [1][5]

Чи можна додати noindex у robots.txt?

Google цього не підтримує. Використовуйте robots meta або X-Robots-Tag. [5][16]

Чи sitemap.xml гарантує індексацію?

Ні. Це лише підказка. [7]

Які ліміти sitemap?

50 000 URL і 50 MB після розпакування на один файл. [7][8]

Чи Google використовує <priority> і <changefreq>?

Ні. Обидва значення ігноруються. [7]

Чи Google використовує <lastmod>?

Так, якщо значення надійне й відображає значущу зміну. [7]

Чи sitemap має бути в корені сайту?

Google рекомендує корінь. Без надсилання через Search Console область дії залежить від каталогу. [7]

Чи sitemap може бути на іншому хост?

Так, у підтримуваних cross-site конфігураціях. [3][7]

Чи Google підтримує crawl-delay?

Ні. [3]

Чи варто включати noindex або перенаправлення URL?

Зазвичай ні, якщо sitemap має представляти URL, які ви хочете індексувати. [7][9]

Чи можна мати кілька sitemaps?

Так. Один index може містити до 50 000 sitemaps. [7][8]

Чи достатньо Sitemap у robots.txt?

Google може так знайти sitemap. Search Console все одно корисний для моніторинг та помилки. [7][11]

Джерела та примітки

  1. Google Search Central, robots.txt introduction12
  2. Google Crawling Infrastructure, Create and submit a robots.txt file1234
  3. Google Crawling Infrastructure, How Google interprets the robots.txt specification12345678910
  4. IETF RFC 9309, Robots Exclusion Protocol123
  5. Google Search Central, Block Search indexing with noindex1234
  6. Google Search Central, Learn about sitemaps123
  7. Google Search Central, Build and submit a sitemap1234567891011121314151617181920
  8. sitemaps.org, Sitemap protocol1234
  9. Google Search Central, How to specify a canonical URL123
  10. Google Search Central, Localized versions of your сторінки
  11. Google Search Console Help, Sitemaps reпорт123
  12. Google Search Console API, Sitemaps: submit
  13. Google Search Central, Image sitemaps
  14. Google Search Central, Video sitemaps and alternatives
  15. Google Search Central, News sitemaps
  16. Google Search Central, Robots meta tag and X-Robots-Tag specifications123
  17. Google Search Central, Site moves and migrations

Чи було це корисно?

Отримуйте нові статті електронною поштою

Один короткий лист на кожну нову статтю Навчання. Без спаму, відписка в один клік.

Ми використовуємо вашу пошту лише для надсилання нових статей. Без передачі третім сторонам.

Назад до Навчання