robots.txt & Sitemap Validator - prueba reglas de rastreo y sitemaps XML | POLPROG Ir al contenido

robots.txt & Sitemap Validator FREE

Analiza el robots.txt de un sitio y su árbol de sitemaps. Interpreta las reglas para rastreadores, sigue los sitemap index, valida los documentos leídos y comprueba las URL que envían.

Uso gratuito Sin registro Privacidad ante todo
Introduce un sitio web para analizarlo

Introduce un dominio o cualquier página de él. robots.txt siempre se lee desde la raíz de ese host, así que una ruta en la dirección no cambia nada.

Opciones avanzadas
Modo de análisis

Analiza un sitemap concreto además de los que se encuentren automáticamente. Útil para un sitemap que robots.txt no declara.

La coincidencia de reglas es específica de cada rastreador. Esta elección determina el probador de URL y la columna de rastreabilidad.

Este análisis se ejecuta en los servidores de POLPROG, porque leer el robots.txt y los sitemaps de otro sitio no se puede hacer desde tu navegador. Solo se solicitan archivos disponibles públicamente, no se almacena nada después de enviar la respuesta y no se guarda ni se comparte ningún informe.

Referencia

robots.txt y sitemaps XML, en breve

01

Qué es robots.txt

Un archivo de texto plano en la raíz de un host, en /robots.txt, que indica a los rastreadores qué rutas de URL pueden solicitar. Es una instrucción de rastreo, no un control de acceso: el archivo es público y un rastreador que lo ignore no está saltándose nada técnico. Solo cuatro directivas están estandarizadas en el RFC 9309: User-agent, Allow, Disallow y Sitemap.

02

robots.txt no controla la indexación

Disallow impide que una página se obtenga. No impide que la URL aparezca en los resultados de búsqueda: una página bloqueada a la que enlazan otros sitios puede seguir apareciendo, sin descripción, porque el rastreador nunca pudo leerla para encontrar tu etiqueta noindex. Para mantener una página fuera del índice, déjala rastreable y sirve una metaetiqueta robots con noindex o una cabecera X-Robots-Tag.

03

Cómo se comparan las reglas

Un rastreador usa un solo grupo: aquel cuyo token de User-agent sea la coincidencia más larga con su propio nombre, y recurre a * si no hay ninguno. Dentro de ese grupo gana la regla más específica, medida por la longitud del patrón de ruta, no por el orden en que aparecen las líneas. Cuando coinciden un Allow y un Disallow de la misma longitud, gana Allow. El carácter * coincide con cualquier secuencia de caracteres y un $ final ancla el fin de la URL.

04

Qué es un sitemap XML

Una lista de las URL que quieres que se rastreen, con lastmod, changefreq y priority opcionales para cada una. Ayuda al descubrimiento en sitios grandes, en sitios con páginas mal enlazadas y en sitios nuevos. No garantiza la indexación, y Google ignora changefreq y priority por completo.

05

Qué es un sitemap index

Un sitemap de sitemaps. Un archivo puede contener como máximo 50.000 URL y 50 MB sin comprimir, así que un sitio grande reparte sus URL entre varios sitemaps y enumera esos archivos en un documento sitemapindex. Ese índice es la única URL que declaras en robots.txt y envías en Search Console.

06

Los límites que de verdad importan

Un sitemap: 50.000 URL y 50 MB sin comprimir por archivo. Se permite gzip y los 50 MB se aplican al tamaño descomprimido. robots.txt: Google lee los primeros 500 KiB y descarta el resto. Un sitemap solo puede enumerar URL del host que lo sirve, salvo que se configure el envío cruzado.

07

Dónde tiene que estar cada archivo

robots.txt solo es válido en la raíz de un host y un puerto: https://example.com/robots.txt gobierna https://example.com y nada más. Un archivo en /blog/robots.txt se ignora, y https://example.com/robots.txt no dice nada sobre http://example.com ni sobre www.example.com. Un sitemap puede estar en cualquier punto de su host y se encuentra a través de robots.txt o por envío.

08

La contradicción que hay que buscar primero

Una URL que aparece en el sitemap y está prohibida por robots.txt. El sitemap pide que se rastree y robots.txt lo impide, así que no se rastrea ni se indexa de forma fiable, y Search Console lo informa como un error. Esta herramienta comprueba cada URL del sitemap frente a las reglas del mismo robots.txt y las cuenta.

Alcance y límites

Qué cubre este análisis

Medido a partir de los propios archivos, con los límites indicados

Todo lo que se informa aquí se lee del propio robots.txt y de los archivos sitemap del sitio durante el análisis: estado HTTP, tamaño del archivo, reglas analizadas, estructura XML y las URL que enumera cada sitemap. La rastreabilidad se calcula comparando esas URL con ese mismo robots.txt, usando las reglas del RFC 9309. El análisis lee como máximo 40 documentos sitemap, cinco niveles de anidamiento de índices y 50.000 URL, y comprueba el estado HTTP de un número limitado de URL en lugar de todas; siempre que una cifra cubra solo una parte del sitio, el informe lo indica junto a ella. No puede decirte si una página está indexada: nada en robots.txt, en un sitemap ni en una respuesta HTTP lo indica, y esta herramienta no tiene conexión con Search Console.

Ayuda

FAQ

¿Impide robots.txt que una página aparezca en Google?

No. Disallow impide que un rastreador obtenga la página; no elimina la URL del índice. Una página bloqueada a la que enlazan otros sitios puede seguir apareciendo, normalmente sin descripción, porque el rastreador nunca pudo leerla. Para mantener una página fuera del índice, déjala rastreable y sirve una metaetiqueta robots con noindex o una cabecera X-Robots-Tag. Una línea Noindex dentro de robots.txt no hace nada: Google nunca la ha admitido y dejó de tenerla en cuenta en 2019.

¿Dónde tiene que estar robots.txt?

En la raíz del host y del puerto que gobierna, y en ningún otro sitio. https://example.com/robots.txt se aplica a https://example.com y a nada más: ni a http://example.com, ni a www.example.com, ni a un subdominio. Un archivo en /blog/robots.txt se ignora. Esta herramienta siempre lee la raíz del host que introduzcas, así que una ruta en la dirección no cambia nada.

¿Cuántas URL puede contener un sitemap?

Hasta 50.000 URL y 50 MB sin comprimir por archivo. Se permite gzip y el límite de tamaño se aplica al archivo descomprimido. Si superas cualquiera de los dos límites, reparte las URL entre varios sitemaps y enumera esos archivos desde un sitemap index; un índice tiene los mismos límites de 50.000 URL y 50 MB sobre los sitemaps a los que hace referencia.

¿Qué regla gana cuando dos reglas coinciden con la misma URL?

La más específica, medida por la longitud del patrón de ruta, no por el orden en que aparecen las líneas en el archivo. Cuando coinciden un Allow y un Disallow de la misma longitud, gana Allow. Antes de eso, el rastreador elige un solo grupo: aquel cuyo token de User-agent sea la coincidencia más larga con su propio nombre, y recurre al grupo * si no hay ninguno. El probador de URL de este informe muestra qué regla decidió cada respuesta y en qué línea se encuentra.

¿POLPROG almacena los sitios que analizo?

No. El análisis se ejecuta en los servidores de POLPROG, porque leer el robots.txt y los sitemaps de otro sitio no se puede hacer desde tu navegador, y solo se solicitan archivos disponibles públicamente. No se escribe nada en una base de datos, no se guarda ningún informe y no se crea ninguna copia compartible. El enlace de tu barra de direcciones vuelve a ejecutar el análisis en lugar de cargar uno almacenado.

¿Por qué el informe dice que solo se comprobaron algunas URL?

Porque comprobar una URL significa enviar una petición real al sitio analizado, y un sitemap grande contiene decenas de miles. La estructura del sitemap siempre se analiza por completo, así que los recuentos, los duplicados, lastmod y las cifras de rastreabilidad cubren todas las URL que leyó el análisis. El estado HTTP se solicita para un número limitado: unas 40 en el Análisis rápido y hasta 500 en el Análisis completo de URL. El informe siempre indica cuántas se solicitaron realmente, y nunca presenta una muestra como si cubriera todo el sitio.

Crea una web mejor, más rápido.

Creamos software y soluciones a medida adaptadas a tus necesidades.

Contáctanos