Валідатор robots.txt і Sitemap, перевірка правил сканування та XML-карт сайту | POLPROG Перейти до вмісту

Валідатор robots.txt і Sitemap FREE

Проаналізуйте robots.txt сайту та дерево його карт сайту. Розберіть правила для роботів, пройдіть по sitemap index, перевірте прочитані документи і URL, які він подає.

Безкоштовно Без реєстрації Приватність передусім
Вкажіть сайт для аналізу

Введіть домен або будь-яку сторінку на ньому. robots.txt завжди читається з кореня цього хоста, тому шлях в адресі нічого не змінює.

Додаткові параметри
Режим сканування

Проаналізувати конкретну карту сайту додатково до знайдених автоматично. Корисно для карти сайту, яку robots.txt не оголошує.

Правила зіставляються окремо для кожного робота. Цей вибір визначає роботу тестера URL і стовпця доступності для сканування.

Цей аналіз виконується на серверах POLPROG, бо прочитати robots.txt і карти сайту чужого сайту з вашого браузера неможливо. Запитуються лише публічно доступні файли, після надсилання відповіді нічого не залишається, і жоден звіт не зберігається та не публікується.

Довідка

robots.txt і XML-карти сайту, коротко

01

Що таке robots.txt

Текстовий файл у корені хоста, за адресою /robots.txt, який повідомляє роботам, які шляхи URL їм можна запитувати. Це вказівка щодо сканування, а не контроль доступу: файл публічний, і робот, який його ігнорує, технічно нічого не порушує. У RFC 9309 стандартизовано лише чотири директиви: User-agent, Allow, Disallow і Sitemap.

02

robots.txt не керує індексуванням

Disallow не дає завантажити сторінку. Він не заважає URL з'явитися в результатах пошуку: заблокована сторінка, на яку посилаються інші сайти, все одно може потрапити до видачі, без опису, бо роботові так і не дозволили прочитати сторінку й знайти ваш тег noindex. Щоб не пустити сторінку в індекс, залиште її доступною для сканування та віддавайте метатег robots зі значенням noindex або заголовок X-Robots-Tag.

03

Як зіставляються правила

Робот використовує одну групу: ту, чий токен User-agent є найдовшим збігом із його власним іменем, а якщо такої немає, групу *. Усередині цієї групи перемагає найточніше правило, і точність вимірюється довжиною шаблону шляху, а не порядком рядків у файлі. Коли збігаються Allow і Disallow однакової довжини, перемагає Allow. * відповідає будь-якій послідовності символів, а $ у кінці прив'язує правило до кінця URL.

04

Що таке XML-карта сайту

Список URL, які ви хочете віддати на сканування, з необов'язковими lastmod, changefreq і priority для кожного. Він допомагає виявляти сторінки на великих сайтах, на сайтах зі слабкою перелінковкою та на нових сайтах. Він не гарантує індексування, а changefreq і priority Google ігнорує повністю.

05

Що таке sitemap index

Карта карт сайту. Один файл може містити щонайбільше 50 000 URL і 50 MB без стиснення, тому великий сайт розподіляє свої URL між кількома картами сайту й перелічує ці файли в документі sitemapindex. Саме цей index є єдиним URL, який ви оголошуєте в robots.txt і подаєте в Search Console.

06

Ліміти, які справді відчутні

Карта сайту: 50 000 URL і 50 MB без стиснення на один файл. Gzip дозволено, і 50 MB стосуються розпакованого розміру. robots.txt: Google читає перші 500 KiB і відкидає решту. Карта сайту може перелічувати лише URL того хоста, який її віддає, якщо не налаштовано перехресне подання.

07

Де має лежати кожен файл

robots.txt чинний лише в корені хоста й порту: https://example.com/robots.txt керує https://example.com і нічим іншим. Файл за адресою /blog/robots.txt ігнорується, а https://example.com/robots.txt не каже нічого про http://example.com чи про www.example.com. Карта сайту може лежати будь-де на своєму хості, а знаходять її через robots.txt або через подання.

08

Протиріччя, яке варто шукати першим

URL, який є в карті сайту й водночас заборонений у robots.txt. Карта сайту просить його просканувати, а robots.txt відмовляє, тому він не сканується і не індексується надійно, а Search Console повідомляє про це як про помилку. Цей інструмент перевіряє кожен URL із карти сайту за правилами того самого robots.txt і підраховує їх.

Обсяг і межі

Що охоплює цей аналіз

Виміряно за самими файлами, із зазначеними обмеженнями

Усе, про що тут ідеться, прочитано з robots.txt і файлів карт сайту самого сайту під час сканування: статус HTTP, розмір файлу, розібрані правила, структура XML і URL, які перелічує кожна карта сайту. Доступність для сканування обчислюється зіставленням цих URL із тим самим robots.txt за правилами RFC 9309. Сканування читає щонайбільше 40 документів карт сайту, п'ять рівнів вкладеності index і 50 000 URL, а статус HTTP перевіряє для обмеженої кількості URL, а не для всіх; скрізь, де число охоплює лише частину сайту, звіт зазначає це поруч. Він не може сказати, чи проіндексована сторінка: ані robots.txt, ані карта сайту, ані відповідь HTTP цього не містять, і цей інструмент не має підключення до Search Console.

Довідка

FAQ

Чи не дає robots.txt сторінці з'явитися в Google?

Ні. Disallow не дає роботові завантажити сторінку, але не вилучає URL з індексу. Заблокована сторінка, на яку посилаються інші сайти, все одно може потрапити до видачі, зазвичай без опису, бо роботові так і не дозволили її прочитати. Щоб не пустити сторінку в індекс, залиште її доступною для сканування та віддавайте метатег robots зі значенням noindex або заголовок X-Robots-Tag. Рядок Noindex усередині robots.txt не робить нічого: Google ніколи його не підтримував і припинив ураховувати у 2019 році.

Де має бути robots.txt?

У корені того хоста й порту, якими він керує, і ніде більше. https://example.com/robots.txt стосується https://example.com і нічого понад це: ані http://example.com, ані www.example.com, ані піддомену. Файл за адресою /blog/robots.txt ігнорується. Цей інструмент завжди читає корінь того хоста, який ви ввели, тому шлях в адресі нічого не змінює.

Скільки URL може містити одна карта сайту?

До 50 000 URL і 50 MB без стиснення на один файл. Gzip дозволено, і ліміт розміру стосується розпакованого файлу. Понад будь-який із цих лімітів розподіліть URL між кількома картами сайту й перелічіть ці файли в sitemap index; для index діють ті самі ліміти 50 000 і 50 MB щодо карт сайту, на які він посилається.

Яке правило перемагає, коли з одним URL збігаються два правила?

Найточніше, що вимірюється довжиною шаблону шляху, а не порядком рядків у файлі. Коли збігаються Allow і Disallow однакової довжини, перемагає Allow. Перед цим робот вибирає одну групу: ту, чий токен User-agent є найдовшим збігом із його власним іменем, а якщо такої немає, групу *. Тестер URL у цьому звіті показує, яке правило дало кожну відповідь і в якому рядку воно стоїть.

Чи зберігає POLPROG сайти, які я аналізую?

Ні. Аналіз виконується на серверах POLPROG, бо прочитати robots.txt і карти сайту чужого сайту з вашого браузера неможливо, і запитуються лише публічно доступні файли. Нічого не записується до бази даних, жоден звіт не зберігається і жодна копія для поширення не створюється. Посилання у вашому адресному рядку запускає аналіз заново, а не завантажує збережений.

Чому у звіті сказано, що перевірено лише частину URL?

Бо перевірка URL означає надсилання реального запиту до аналізованого сайту, а велика карта сайту містить десятки тисяч таких URL. Структура карти сайту завжди розбирається повністю, тому кількості, дублікати, lastmod і показники доступності для сканування охоплюють кожен URL, який прочитало сканування. Статус HTTP запитується для обмеженої кількості: близько 40 у швидкому аналізі та до 500 у повному аналізі URL. Звіт завжди вказує, скільки їх було справді запитано, і ніколи не подає вибірку так, ніби вона охоплює весь сайт.

Створюйте кращий вебпростір, швидше.

Ми створюємо індивідуальне програмне забезпечення та рішення, адаптовані до ваших потреб.

Зв'язатися