robots.txt y sitemap.xml: guía de SEO técnico | POLPROG Ir al contenido

robots.txt y sitemap.xml: guía completa de SEO técnico

robots.txt y sitemap.xml resuelven dos problemas distintos del SEO técnico. robots.txt controla qué URL puede solicitar un crawler, mientras que sitemap.xml ayuda a los buscadores a descubrir URL importantes y sus metadatos. Los errores aparecen cuando robots.txt se usa para bloquear indexación o cuando la sitemap contiene redirecciones, duplicados y URL con noindex.

Publicado Escrito por Tiempo de lectura 9 min de lectura

robots.txt y sitemap.xml resuelven dos problemas distintos del SEO técnico. robots.txt controla qué URL puede solicitar un crawler, mientras que sitemap.xml ayuda a los buscadores a descubrir URL importantes y sus metadatos. Los errores aparecen cuando robots.txt se usa para bloquear indexación o cuando la sitemap contiene redirecciones, duplicados y URL con noindex.

En esta página
  1. 1robots.txt y sitemap.xml cumplen funciones distintas
  2. 2Ubicación y alcance de robots.txt
  3. 3Sintaxis básica de robots.txt
  4. 4Coincidencia de reglas, mayúsculas y wildcards
  5. 5robots.txt no sustituye a noindex
  6. 6Errores HTTP y caché de robots.txt
  7. 7Para qué sirve sitemap.xml
  8. 8Formatos de sitemap admitidos
  9. 9Límites de sitemap e índice de sitemaps
  10. 10Qué URL deben incluirse
  11. 11`<lastmod>`, `<priority>` y `<changefreq>`
  12. 12Cómo enviar una sitemap a Google
  13. 13Sitios multilingües y sitemaps especializadas
  14. 14Errores frecuentes de SEO técnico
  15. 15Checklist de despliegue

robots.txt y sitemap.xml cumplen funciones distintas

MecanismoObjetivoAlcanceEfecto principal
robots.txtControlar crawlingPaths para crawlersNo garantiza desindexación
sitemap.xmlSeñalar URL importantesURL y metadatosSeñal, no garantía de indexación
noindexExcluir del índiceURL o recursoFunciona después del rastreo
rel="canonical"Indicar versión preferidaURL o recursoSeñal fuerte, no directiva absoluta

robots.txt forma parte del Robots Exclusion Protocol y controla qué paths puede solicitar un crawler. RFC 9309 aclara que estas reglas no son autorización de acceso. [4]

Una sitemap informa a los buscadores sobre páginas, vídeos y otros archivos importantes, además de sus relaciones y metadatos. [6]

Ubicación y alcance de robots.txt

El archivo debe llamarse `robots.txt` y estar en la raíz del host, por ejemplo `https://example.com/robots.txt`. Un archivo en un subdirectorio no controla todo el sitio. [2][4]

El alcance depende de protocolo, host y puerto. Google además aplica un límite de 500 KiB. [2][3]

Sintaxis básica de robots.txt

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://example.com/sitemap.xml

Google admite `user-agent`, `allow`, `disallow` y `sitemap`. `crawl-delay` no está admitido. [3]

El campo `sitemap` debe contener una URL absoluta y puede repetirse varias veces. [2][3]

Coincidencia de reglas, mayúsculas y wildcards

Google aplica la regla coincidente más específica. Si `allow` y `disallow` tienen la misma especificidad, usa la opción menos restrictiva, `allow`. [3][4]

Los paths distinguen mayúsculas de minúsculas. Google admite `*` como wildcard y `$` como final de URL. [3]

robots.txt no sustituye a noindex

Una URL bloqueada por robots.txt puede seguir apareciendo en Google si se descubre mediante enlaces externos o internos. [1][3]

Para excluir una página del índice usa `noindex` mediante robots meta o `X-Robots-Tag`. Google debe poder rastrear el recurso para leer esa regla. [5][16]

Errores HTTP y caché de robots.txt

EstadoComportamiento de Google
2xxProcesa el archivo robots.txt
3xxSigue al menos 5 redirecciones
4xx except 429Lo trata como ausencia de restricciones
5xx / networkPuede pausar el crawling y usar la última versión válida

Google procesa respuestas `2xx`, sigue al menos cinco redirecciones en `3xx` y trata la mayoría de `4xx`, salvo `429`, como ausencia de restricciones. [3]

Con `5xx` o errores de red puede pausar temporalmente el crawling y reutilizar la última versión válida. Normalmente cachea robots.txt hasta 24 horas. [3]

Para qué sirve sitemap.xml

Una sitemap facilita descubrir URL importantes y puede incluir fecha de modificación, variantes de idioma, imágenes, vídeos y noticias. [6][7]

Google indica que un sitio pequeño, de unas 500 páginas o menos y con buen enlazado interno, puede no necesitar sitemap. [6]

Formatos de sitemap admitidos

Google admite XML, RSS, mRSS, Atom 1.0 y sitemaps de texto. XML es el formato más flexible. [7]

Google no declara una preferencia general entre los formatos admitidos. [7]

Límites de sitemap e índice de sitemaps

ArchivoEntradas máximasTamaño máximoNota
Sitemap individual50,00050 MBLímite sin comprimir; gzip permitido
Índice de sitemaps50,000 sitemaps50 MBLímite sin comprimir; gzip permitido

Una sitemap está limitada a 50.000 URL o 50 MB sin comprimir. Si se supera cualquiera de los límites, debe dividirse. [7][8]

Un índice puede contener hasta 50.000 sitemaps y también tiene límite de 50 MB. Se permite gzip. [8]

Qué URL deben incluirse

Google recomienda incluir URL absolutas que quieras ver en los resultados de búsqueda. [7]

En contenido duplicado conviene incluir la URL canonical preferida. La inclusión en sitemap es una señal canonical débil, inferior a una redirección o `rel="canonical"`. [7][9]

`<lastmod>`, `<priority>` y `<changefreq>`

Google ignora `<priority>` y `<changefreq>`. [7]

Puede usar `<lastmod>` si es coherente, verificable y representa una modificación significativa del contenido, datos estructurados o enlaces. [7]

Cómo enviar una sitemap a Google

La sitemap puede enviarse desde Search Console, mediante la Search Console API o referenciarse en robots.txt con `Sitemap:`. [7][11][12]

El envío es solo una señal y no garantiza descarga, crawling ni indexación. [7]

Sitios multilingües y sitemaps especializadas

Google admite relaciones `hreflang` dentro de sitemaps XML. Cada variante debe referenciar todas las versiones, incluida ella misma. [10]

También existen extensiones para imágenes, vídeos y noticias. [13][14][15]

Errores frecuentes de SEO técnico

Bloquear una página en robots.txt y esperar que Google lea su `noindex` es un error grave. [5][16]

También deben evitarse señales contradictorias entre sitemap y `rel="canonical"`. [9]

  • No uses robots.txt como sustituto de `noindex`.
  • No añadas deliberadamente redirecciones, 404 o duplicados innecesarios a la sitemap.
  • No actualices `<lastmod>` en cada despliegue sin cambios reales.
  • Mantén canonical y sitemap coherentes.
  • Revisa por separado subdominios y protocolos.

Checklist de despliegue

Comprueba las respuestas HTTP reales. robots.txt debe servirse como texto y la sitemap en un formato admitido. [2][7]

Después de publicar, revisa el informe Sitemaps de Search Console. En migraciones, una sitemap puede ayudar a Google a descubrir URL nuevas. [11][17]

  • ¿Está disponible `/robots.txt`?
  • ¿Hay URL importantes bloqueadas por error?
  • ¿Las páginas con noindex siguen siendo rastreables?
  • ¿La sitemap contiene solo URL absolutas preferidas?
  • ¿Cada archivo está por debajo de 50.000 URL y 50 MB?
  • ¿Canonical y sitemap son coherentes?
  • ¿Las relaciones hreflang son correctas?
  • ¿Search Console muestra errores?

Una buena configuración de SEO técnico debe ser simple y coherente. robots.txt debe bloquear solo zonas que los crawlers realmente no deban solicitar. sitemap.xml debe contener URL preferidas, accesibles e indexables. `noindex` no debe quedar oculto detrás de robots.txt y `<lastmod>` debe reflejar cambios reales y relevantes.

SEO Technical SEO robots.txt sitemap.xml Crawling Indexing Google Search Console Canonical hreflang Sitemaps

Preguntas frecuentes

¿robots.txt evita la indexación?

No de forma garantizada. Una URL bloqueada puede seguir apareciendo en los resultados. Para excluirla usa noindex y permite que Google la rastree. [1][5]

¿Se puede poner noindex en robots.txt?

Google no lo admite. Usa robots meta o X-Robots-Tag. [5][16]

¿sitemap.xml garantiza la indexación?

No. Es solo una señal. [7]

¿Cuáles son los límites de una sitemap?

50.000 URL y 50 MB sin comprimir por archivo. [7][8]

¿Google usa <priority> y <changefreq>?

No. Ignora ambos valores. [7]

¿Google usa <lastmod>?

Sí, si es fiable y refleja un cambio relevante. [7]

¿La sitemap debe estar en la raíz?

Google recomienda la raíz. Sin envío mediante Search Console, su alcance depende del directorio donde se aloja. [7]

¿Puede una sitemap estar en otro host?

Sí, en configuraciones cross-site admitidas. [3][7]

¿Google admite crawl-delay?

No. [3]

¿Deben incluirse URL noindex o redirigidas?

Normalmente no si la sitemap representa las URL que quieres indexar. [7][9]

¿Se pueden usar varias sitemaps?

Sí. Un índice puede listar hasta 50.000 sitemaps. [7][8]

¿Es suficiente Sitemap en robots.txt?

Google puede descubrirla así. Search Console sigue siendo útil para seguimiento y errores. [7][11]

Fuentes y referencias

  1. Google Search Central, robots.txt introduction12
  2. Google Crawling Infrastructure, Create and submit a robots.txt file1234
  3. Google Crawling Infrastructure, How Google interprets the robots.txt specification12345678910
  4. IETF RFC 9309, Robots Exclusion Protocol123
  5. Google Search Central, Block Search indexing with noindex1234
  6. Google Search Central, Learn about sitemaps123
  7. Google Search Central, Build and submit a sitemap1234567891011121314151617181920
  8. sitemaps.org, Sitemap protocol1234
  9. Google Search Central, How to specify a canonical URL123
  10. Google Search Central, Localized versions of your pages
  11. Google Search Console Help, Sitemaps report123
  12. Google Search Console API, Sitemaps: submit
  13. Google Search Central, Image sitemaps
  14. Google Search Central, Video sitemaps and alternatives
  15. Google Search Central, News sitemaps
  16. Google Search Central, Robots meta tag and X-Robots-Tag specifications123
  17. Google Search Central, Site moves and migrations

¿Te ha resultado útil?

Recibe nuevos artículos por email

Un correo breve por cada nuevo artículo de la base de conocimiento. Sin spam, te das de baja con un clic.

Solo usamos tu email para enviar nuevos artículos. Sin compartir con terceros.

Volver a la base de conocimiento