robots.txt et sitemap.xml : guide SEO technique | POLPROG Aller au contenu

robots.txt et sitemap.xml : guide complet du SEO technique

robots.txt et sitemap.xml répondent à deux besoins différents du SEO technique. robots.txt contrôle les URL que les robots peuvent récupérer, tandis que sitemap.xml aide les moteurs à découvrir les URL importantes et leurs métadonnées. Les problèmes apparaissent quand robots.txt est utilisé pour bloquer l'indexation ou quand la sitemap contient redirections, doublons et URL en noindex.

Publié Rédigé par Temps de lecture 20 min de lecture

robots.txt et sitemap.xml répondent à deux besoins différents du SEO technique. robots.txt contrôle les URL que les robots peuvent récupérer, tandis que sitemap.xml aide les moteurs à découvrir les URL importantes et leurs métadonnées. Les problèmes apparaissent quand robots.txt est utilisé pour bloquer l'indexation ou quand la sitemap contient redirections, doublons et URL en noindex.

Sur cette page
  1. 1robots.txt et sitemap.xml ont des rôles différents
  2. 2Emplacement et portée de robots.txt
  3. 3Syntaxe de base
  4. 4Priorité des règles, casse et wildcards
  5. 5robots.txt ne remplace pas noindex
  6. 6Erreurs HTTP et cache de robots.txt
  7. 7À quoi sert sitemap.xml
  8. 8Formats de sitemap pris en charge
  9. 9Limites de sitemap et d'index de sitemaps
  10. 10Quelles URL inclure
  11. 11`<lastmod>`, `<priority>` et `<changefreq>`
  12. 12Soumettre une sitemap à Google
  13. 13Sites multilingues et sitemaps spécialisées
  14. 14Erreurs fréquentes de SEO technique
  15. 15Checklist de déploiement

robots.txt et sitemap.xml ont des rôles différents

MécanismeObjectifPortéeEffet principal
robots.txtContrôler le crawlChemins pour robotsNe garantit pas la désindexation
sitemap.xmlSignaler les URL importantesURL et métadonnéesIndication, pas garantie d'indexation
noindexExclure de l'indexURL ou ressourceFonctionne après lecture par le robot
rel="canonical"Indiquer la version préféréeURL ou ressourceSignal fort, pas directive absolue

robots.txt fait partie du Robots Exclusion Protocol et contrôle l'accès des robots aux chemins d'URL. RFC 9309 précise qu'il ne s'agit pas d'un mécanisme d'autorisation. [4]

Une sitemap indique aux moteurs les pages, vidéos et autres fichiers importants, ainsi que leurs relations et métadonnées. [6]

Emplacement et portée de robots.txt

Le fichier doit s'appeler `robots.txt` et se trouver à la racine de l'hôte, par exemple `https://example.com/robots.txt`. [2][4]

Sa portée dépend du protocole, de l'hôte et du port. Google limite le fichier à 500 KiB. [2][3]

Syntaxe de base

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://example.com/sitemap.xml

Google prend en charge `user-agent`, `allow`, `disallow` et `sitemap`. `crawl-delay` n'est pas pris en charge. [3]

Le champ `sitemap` doit contenir une URL absolue et plusieurs lignes `Sitemap` sont possibles. [2][3]

Priorité des règles, casse et wildcards

Google utilise la règle correspondante la plus spécifique. En cas d'égalité entre `allow` et `disallow`, Google choisit la règle la moins restrictive, donc `allow`. [3][4]

Les chemins sont sensibles à la casse. Google prend en charge `*` comme wildcard et `$` comme fin d'URL. [3]

robots.txt ne remplace pas noindex

Une URL bloquée par robots.txt peut encore apparaître dans Google si elle est découverte via d'autres liens. [1][3]

Pour exclure une page de l'index, utilisez `noindex` dans robots meta ou `X-Robots-Tag`. Google doit pouvoir crawler la page pour lire cette règle. [5][16]

Erreurs HTTP et cache de robots.txt

StatutComportement Google
2xxTraite le fichier robots.txt
3xxSuit au moins 5 redirections
4xx except 429Considère qu'il n'existe pas de restrictions
5xx / networkPeut suspendre le crawl et utiliser la dernière version valide

Google traite les réponses `2xx`, suit au moins cinq redirections pour `3xx` et considère la plupart des `4xx` sauf `429` comme l'absence de restrictions. [3]

Avec `5xx` ou des erreurs réseau, Google peut suspendre temporairement le crawl et réutiliser la dernière version valide. Le cache dure généralement jusqu'à 24 heures. [3]

À quoi sert sitemap.xml

Une sitemap facilite la découverte des URL importantes et peut inclure date de modification, variantes linguistiques, images, vidéos et actualités. [6][7]

Google indique qu'un petit site d'environ 500 pages ou moins, bien lié en interne, peut ne pas avoir besoin de sitemap. [6]

Formats de sitemap pris en charge

Google prend en charge XML, RSS, mRSS, Atom 1.0 et les sitemaps texte. XML est le plus polyvalent. [7]

Google ne déclare pas de préférence entre les formats pris en charge. [7]

Limites de sitemap et d'index de sitemaps

FichierEntrées maximalesTaille maximaleNote
Sitemap unique50,00050 MBLimite non compressée; gzip autorisé
Index de sitemaps50,000 sitemaps50 MBLimite non compressée; gzip autorisé

Une sitemap est limitée à 50 000 URL ou 50 MB non compressés. Au-delà, elle doit être divisée. [7][8]

Un index peut contenir jusqu'à 50 000 sitemaps et reste limité à 50 MB. gzip est autorisé. [8]

Quelles URL inclure

Google recommande d'inclure des URL absolues que vous souhaitez voir dans les résultats. [7]

En présence de doublons, la sitemap devrait contenir l'URL canonique préférée. L'inclusion dans la sitemap est un signal canonical plus faible qu'une redirection ou `rel="canonical"`. [7][9]

`<lastmod>`, `<priority>` et `<changefreq>`

Google ignore `<priority>` et `<changefreq>`. [7]

Google peut utiliser `<lastmod>` s'il est constamment exact et correspond à une modification significative du contenu, des données structurées ou des liens. [7]

Soumettre une sitemap à Google

Une sitemap peut être soumise via Search Console, l'API Search Console ou référencée dans robots.txt avec `Sitemap:`. [7][11][12]

La soumission reste une indication et ne garantit ni téléchargement, ni crawl, ni indexation. [7]

Sites multilingues et sitemaps spécialisées

Google accepte les relations `hreflang` dans les sitemaps XML. Chaque version doit référencer toutes les variantes, y compris elle-même. [10]

Des extensions existent pour images, vidéos et actualités. [13][14][15]

Erreurs fréquentes de SEO technique

Bloquer une page dans robots.txt tout en attendant que Google respecte son `noindex` est une erreur majeure. [5][16]

Il faut aussi éviter les signaux contradictoires entre sitemap et `rel="canonical"`. [9]

  • Ne pas utiliser robots.txt à la place de `noindex`.
  • Ne pas ajouter volontairement redirections, 404 ou doublons inutiles à la sitemap.
  • Ne pas modifier `<lastmod>` à chaque déploiement sans changement réel.
  • Garder sitemap et canonical cohérents.
  • Vérifier séparément sous-domaines et protocoles.

Checklist de déploiement

Vérifiez les vraies réponses HTTP. robots.txt doit être servi comme texte et la sitemap dans un format pris en charge. [2][7]

Après publication, contrôlez le rapport Sitemaps de Search Console. Lors d'une migration, une sitemap peut aider Google à découvrir les nouvelles URL. [11][17]

  • `/robots.txt` est-il accessible ?
  • Des URL importantes sont-elles bloquées ?
  • Les pages noindex restent-elles crawlables ?
  • La sitemap contient-elle uniquement des URL absolues préférées ?
  • Chaque fichier reste-t-il sous 50 000 URL et 50 MB ?
  • Canonical et sitemap sont-ils cohérents ?
  • Les relations hreflang sont-elles correctes ?
  • Search Console signale-t-il des erreurs ?

Une bonne configuration de SEO technique doit rester simple et cohérente. robots.txt doit bloquer uniquement les zones que les robots ne doivent réellement pas récupérer. sitemap.xml doit contenir des URL préférées, accessibles et indexables. `noindex` ne doit pas être caché derrière robots.txt, et `<lastmod>` doit refléter de vraies modifications.

SEO Technical SEO robots.txt sitemap.xml Crawling Indexing Google Search Console Canonical hreflang Sitemaps

Questions fréquentes

robots.txt empêche-t-il l'indexation ?

Pas de manière garantie. Une URL bloquée peut encore apparaître dans les résultats. Utilisez noindex pour l'exclure, tout en laissant Google la crawler. [1][5]

Peut-on mettre noindex dans robots.txt ?

Google ne le prend pas en charge. Utilisez robots meta ou X-Robots-Tag. [5][16]

sitemap.xml garantit-elle l'indexation ?

Non. C'est une indication. [7]

Quelles sont les limites d'une sitemap ?

50 000 URL et 50 MB non compressés par fichier. [7][8]

Google utilise-t-il <priority> et <changefreq> ?

Non, ils sont ignorés. [7]

Google utilise-t-il <lastmod> ?

Oui, s'il est fiable et reflète une modification significative. [7]

La sitemap doit-elle être à la racine ?

Google recommande la racine. Sans soumission Search Console, sa portée dépend du répertoire où elle est hébergée. [7]

Une sitemap peut-elle être sur un autre hôte ?

Oui, dans des configurations cross-site prises en charge. [3][7]

Google prend-il en charge crawl-delay ?

Non. [3]

Faut-il mettre les URL noindex ou redirigées dans la sitemap ?

En général non si la sitemap représente les URL destinées à être indexées. [7][9]

Peut-on avoir plusieurs sitemaps ?

Oui. Un index peut contenir jusqu'à 50 000 sitemaps. [7][8]

La ligne Sitemap dans robots.txt suffit-elle ?

Google peut ainsi découvrir la sitemap. Search Console reste utile pour les erreurs et le suivi. [7][11]

Sources et références

  1. Google Search Central, robots.txt introduction12
  2. Google Crawling Infrastructure, Create and submit a robots.txt file1234
  3. Google Crawling Infrastructure, How Google interprets the robots.txt specification12345678910
  4. IETF RFC 9309, Robots Exclusion Protocol123
  5. Google Search Central, Block Search indexing with noindex1234
  6. Google Search Central, Learn about sitemaps123
  7. Google Search Central, Build and submit a sitemap1234567891011121314151617181920
  8. sitemaps.org, Sitemap protocol1234
  9. Google Search Central, How to specify a canonical URL123
  10. Google Search Central, Localized versions of your pages
  11. Google Search Console Help, Sitemaps report123
  12. Google Search Console API, Sitemaps: submit
  13. Google Search Central, Image sitemaps
  14. Google Search Central, Video sitemaps and alternatives
  15. Google Search Central, News sitemaps
  16. Google Search Central, Robots meta tag and X-Robots-Tag specifications123
  17. Google Search Central, Site moves and migrations

Cela vous a-t-il été utile ?

Recevez les nouveaux articles par e-mail

Un court e-mail par nouvel article d'apprentissage. Pas de spam, désinscription en un clic.

Nous utilisons uniquement votre e-mail pour envoyer de nouveaux articles. Aucun partage avec des tiers.

Retour à l'apprentissage