Walidator robots.txt i map witryny, test reguł i map XML | POLPROG Przejdź do treści

Walidator robots.txt i map witryny FREE

Przeanalizuj plik robots.txt witryny i drzewo jej map witryny. Narzędzie parsuje reguły dla robotów, podąża za plikami sitemap index, waliduje odczytane dokumenty i sprawdza zgłaszane w nim adresy URL.

Za darmo Bez rejestracji Prywatność przede wszystkim
Podaj witrynę do analizy

Podaj domenę lub dowolną jej podstronę. robots.txt jest zawsze odczytywany z katalogu głównego tego hosta, więc ścieżka w adresie niczego nie zmienia.

Opcje zaawansowane
Tryb skanowania

Przeanalizuj konkretną mapę witryny oprócz tych znalezionych automatycznie. Przydatne dla mapy, której nie deklaruje robots.txt.

Reguły dopasowywane są osobno dla każdego robota. Ten wybór steruje testerem adresów URL i kolumną dostępności dla robotów.

Ta analiza działa na serwerach POLPROG, ponieważ odczytu pliku robots.txt i map witryny innej strony nie da się wykonać z Twojej przeglądarki. Żądania dotyczą wyłącznie plików publicznie dostępnych, po wysłaniu odpowiedzi nic nie jest przechowywane, a żaden raport nie jest zapisywany ani udostępniany.

Materiał referencyjny

robots.txt i mapy witryny XML w skrócie

01

Czym jest robots.txt

Plik tekstowy w katalogu głównym hosta, pod adresem /robots.txt, który informuje roboty, o które ścieżki URL mogą wysyłać żądania. To instrukcja indeksowania, a nie mechanizm kontroli dostępu: plik jest publiczny, a robot, który go ignoruje, nie łamie żadnego zabezpieczenia technicznego. W RFC 9309 ustandaryzowano tylko cztery dyrektywy: User-agent, Allow, Disallow i Sitemap.

02

robots.txt nie steruje indeksowaniem w wyszukiwarce

Disallow powstrzymuje pobranie strony. Nie powstrzymuje pojawienia się adresu URL w wynikach wyszukiwania: zablokowana strona, do której prowadzą linki z innych witryn, nadal może zostać wypisana, bez opisu, ponieważ robot nigdy nie mógł jej odczytać i znaleźć Twojego tagu noindex. Aby utrzymać stronę poza indeksem, pozostaw ją dostępną dla robotów i udostępnij metatag robots z wartością noindex albo nagłówek X-Robots-Tag.

03

Jak dopasowywane są reguły

Robot korzysta z jednej grupy: tej, której token User-agent najdłużej pasuje do jego własnej nazwy, a w braku dopasowania z grupy *. W obrębie tej grupy wygrywa reguła najbardziej szczegółowa, mierzona długością wzorca ścieżki, a nie kolejnością wierszy. Gdy pasują jednocześnie Allow i Disallow o identycznej długości, wygrywa Allow. Znak * pasuje do dowolnego ciągu znaków, a $ na końcu zakotwicza koniec adresu URL.

04

Czym jest mapa witryny XML

Lista adresów URL, które chcesz udostępnić robotom, z opcjonalnymi wartościami lastmod, changefreq i priority dla każdego z nich. Pomaga w wykrywaniu stron w dużych witrynach, w witrynach ze słabo podlinkowanymi podstronami oraz w nowych serwisach. Nie gwarantuje umieszczenia w indeksie, a Google całkowicie ignoruje changefreq i priority.

05

Czym jest sitemap index

Mapa map witryny. Jeden plik może zawierać najwyżej 50 000 adresów URL i 50 MB w postaci nieskompresowanej, więc duża witryna rozdziela swoje adresy pomiędzy kilka map witryny i wypisuje te pliki w dokumencie sitemapindex. To właśnie ten indeks jest jedynym adresem URL, który deklarujesz w robots.txt i zgłaszasz w Search Console.

06

Limity, które naprawdę dają się we znaki

Mapa witryny: 50 000 adresów URL i 50 MB w postaci nieskompresowanej na plik. Gzip jest dozwolony, a limit 50 MB dotyczy rozmiaru po dekompresji. robots.txt: Google odczytuje pierwsze 500 KiB i odrzuca resztę. Mapa witryny może zawierać wyłącznie adresy URL z hosta, który ją serwuje, chyba że skonfigurowano zgłaszanie międzydomenowe.

07

Gdzie musi znajdować się każdy z plików

robots.txt obowiązuje wyłącznie w katalogu głównym hosta i portu: https://example.com/robots.txt zarządza adresem https://example.com i niczym więcej. Plik pod adresem /blog/robots.txt jest ignorowany, a https://example.com/robots.txt nie mówi nic o http://example.com ani o www.example.com. Mapa witryny może znajdować się w dowolnym miejscu na swoim hoście i jest wykrywana przez robots.txt albo przez zgłoszenie.

08

Sprzeczność, której warto szukać w pierwszej kolejności

Adres URL, który występuje w mapie witryny i jest jednocześnie zabroniony przez robots.txt. Mapa witryny prosi o jego zaindeksowanie, a robots.txt odmawia, więc nie jest on ani odwiedzany przez roboty, ani niezawodnie indeksowany, a Search Console zgłasza to jako błąd. To narzędzie sprawdza każdy adres URL z mapy witryny wobec reguł z tego samego pliku robots.txt i zlicza takie przypadki.

Zakres i ograniczenia

Co obejmuje ta analiza

Zmierzone na podstawie samych plików, z jasno podanymi ograniczeniami

Wszystko, co tu raportujemy, jest odczytywane podczas skanowania z własnego pliku robots.txt i map witryny danej strony: status HTTP, rozmiar pliku, sparsowane reguły, struktura XML oraz adresy URL wypisane w każdej mapie witryny. Dostępność dla robotów jest wyliczana przez porównanie tych adresów z tym samym plikiem robots.txt, według reguł RFC 9309. Skan odczytuje najwyżej 40 dokumentów map witryny, pięć poziomów zagnieżdżenia indeksów i 50 000 adresów URL, a status HTTP sprawdza dla ograniczonej liczby adresów, a nie dla wszystkich. Wszędzie tam, gdzie liczba obejmuje tylko część witryny, raport pisze o tym obok niej. Nie powie Ci, czy strona jest zaindeksowana: nie niesie tej informacji ani robots.txt, ani mapa witryny, ani odpowiedź HTTP, a to narzędzie nie ma połączenia z Search Console.

Pomoc

FAQ

Czy robots.txt powstrzymuje pojawienie się strony w Google?

Nie. Disallow powstrzymuje robota przed pobraniem strony, ale nie usuwa adresu URL z indeksu. Zablokowana strona, do której prowadzą linki z innych witryn, nadal może zostać wypisana, zwykle bez opisu, ponieważ robot nigdy nie mógł jej odczytać. Aby utrzymać stronę poza indeksem, pozostaw ją dostępną dla robotów i udostępnij metatag robots z wartością noindex albo nagłówek X-Robots-Tag. Wiersz Noindex wewnątrz robots.txt nie robi nic: Google nigdy go nie obsługiwał i przestał go respektować w 2019 roku.

Gdzie musi znajdować się plik robots.txt?

W katalogu głównym hosta i portu, którym zarządza, i nigdzie indziej. https://example.com/robots.txt dotyczy https://example.com i niczego więcej: nie dotyczy http://example.com, nie dotyczy www.example.com, nie dotyczy subdomeny. Plik pod adresem /blog/robots.txt jest ignorowany. To narzędzie zawsze odczytuje katalog główny hosta, który podasz, więc ścieżka w adresie niczego nie zmienia.

Ile adresów URL może zawierać jedna mapa witryny?

Najwyżej 50 000 adresów URL i 50 MB w postaci nieskompresowanej na plik. Gzip jest dozwolony, a limit rozmiaru dotyczy pliku po dekompresji. Po przekroczeniu któregokolwiek z tych limitów rozdziel adresy URL pomiędzy kilka map witryny i wypisz te pliki w dokumencie sitemap index. Indeks podlega tym samym limitom 50 000 i 50 MB wobec map witryny, do których się odwołuje.

Która reguła wygrywa, gdy do tego samego adresu URL pasują dwie reguły?

Ta najbardziej szczegółowa, mierzona długością wzorca ścieżki, a nie kolejnością wierszy w pliku. Gdy pasują jednocześnie Allow i Disallow o identycznej długości, wygrywa Allow. Wcześniej robot wybiera jedną grupę: tę, której token User-agent najdłużej pasuje do jego własnej nazwy, a w braku dopasowania grupę *. Tester adresów URL w tym raporcie pokazuje, która reguła zadecydowała o każdej odpowiedzi i w którym wierszu się znajduje.

Czy POLPROG przechowuje analizowane przeze mnie witryny?

Nie. Analiza działa na serwerach POLPROG, ponieważ odczytanie pliku robots.txt i map witryny cudzej strony nie jest możliwe z poziomu Twojej przeglądarki, i pobierane są wyłącznie pliki publicznie dostępne. Nic nie jest zapisywane w bazie danych, żaden raport nie jest przechowywany i nie powstaje żadna kopia do udostępnienia. Link w pasku adresu uruchamia analizę ponownie, zamiast wczytywać zapisany wynik.

Dlaczego raport podaje, że sprawdzono tylko część adresów URL?

Ponieważ sprawdzenie adresu URL oznacza wysłanie prawdziwego żądania do analizowanej witryny, a duża mapa witryny zawiera ich dziesiątki tysięcy. Struktura map witryny jest zawsze parsowana w całości, więc liczby, duplikaty, wartości lastmod i dane o dostępności dla robotów obejmują każdy adres URL odczytany podczas skanowania. Status HTTP jest sprawdzany dla ograniczonej liczby adresów: około 40 w Analizie szybkiej i do 500 w Pełnej analizie adresów URL. Raport zawsze podaje, ile ich faktycznie sprawdzono, i nigdy nie przedstawia próbki tak, jakby obejmowała całą witrynę.

Twórz lepszy internet, szybciej.

Tworzymy dedykowane oprogramowanie i rozwiązania dopasowane do Twoich potrzeb.

Skontaktuj się