三つは別の判断
robots.txtはクロール、noindexは検索結果への掲載、canonicalは同一または非常に近いページの代表URLを扱います。まず問題がどれかを言葉にします。
noindexを読めなくしない
robots.txtでページを遮断すると、GoogleがHTML内のnoindexを読めないことがあります。通常のHTMLを検索結果から外す場合は、クロールできる状態でnoindexを返します。
canonicalは隠すためのタグではない
canonicalは類似ページの統合用で、下書きや低品質ページのnoindex代わりではありません。内部リンク、リダイレクト、Sitemapも最終URLにそろえます。
実用チェックリスト
- 問題を分類する。
- noindexを読める状態にする。
- canonicalは類似ページに使う。
- 非canonical URLをSitemapから外す。