Trois problèmes, trois signaux
Robots.txt gère l’exploration, noindex demande de ne pas conserver une page dans les résultats, et canonical indique l’URL préférée parmi des contenus identiques ou très proches. Commencez par nommer le problème avant de choisir la directive.
Ne pas cacher le noindex au robot
Si robots.txt bloque la page, Google peut ne jamais lire le noindex présent dans son HTML. Pour retirer une page HTML classique de l’index, laissez-la accessible au crawl et renvoyez un noindex valide.
Canonical ne sert pas à masquer une mauvaise page
Une canonical consolide des variantes proches ; elle ne remplace pas noindex pour un brouillon ou une page sans valeur. Les liens internes, redirections, canonical et Sitemap doivent tous pointer vers la même URL finale.
Liste de contrôle pratique
- Identifier crawl, indexation ou duplication.
- Laisser Google lire un noindex.
- Réserver canonical aux contenus proches.
- Exclure les URL non canoniques du Sitemap.