Tres decisiones diferentes
Robots.txt controla el rastreo, noindex solicita que una página no aparezca en resultados y canonical señala la versión preferida de contenido igual o muy parecido.
No bloquees la directiva noindex
Si robots.txt impide descargar la página, Google quizá no vea el noindex. Para sacar una página HTML del índice, normalmente debe poder rastrearla y leer la directiva.
Canonical no sirve para esconder contenido
Úsala para consolidar variantes, no como sustituto de noindex. Enlaces internos, redirecciones, canonical y Sitemap deberían coincidir en la URL final.
Lista de control práctica
- Definir el problema.
- Permitir leer noindex.
- Reservar canonical para duplicados.
- Excluir URL no canónicas del Sitemap.