Noindex
Qu'est-ce que le noindex
Le noindex est une directive qui demande aux moteurs de recherche de ne pas inclure une page dans leur index, ce qui signifie qu'elle n'apparaitra pas dans les resultats. Il est le plus souvent transmis par une balise meta robots dans le head de la page ou par un en-tete HTTP X-Robots-Tag. Le noindex n'empeche pas l'exploration d'une page, il empeche son affichage dans les resultats. C'est donc le bon outil quand une page doit exister et rester accessible aux internautes, mais ne jamais apparaitre dans la recherche organique.
Comment mettre en place le noindex
La methode la plus simple est une balise meta robots avec la valeur noindex placee dans le head du HTML. Pour empecher aussi le suivi des liens de la page, on peut la combiner en noindex, nofollow, meme si noindex, follow est souvent preferable pour que la valeur des liens continue de circuler a travers la page. Pour les ressources non HTML comme les PDF, l'en-tete HTTP X-Robots-Tag applique la meme directive. Point crucial : le moteur doit pouvoir explorer la page pour voir le noindex, la page ne doit donc pas etre bloquee dans robots.txt.
Noindex face a robots.txt et a la canonique
On les confond souvent. Le robots.txt bloque l'exploration mais ne retire pas de facon fiable une page de l'index, et une page bloquee peut encore apparaitre sous forme d'URL nue si elle est liee ailleurs. Le noindex retire de facon fiable une page des resultats mais exige que la page soit explorable. Une canonique consolide des doublons vers une URL preferee tout en gardant en principe l'ensemble indexable. La regle : utilisez le noindex pour exclure une page de la recherche, une canonique pour choisir entre des doublons, et robots.txt pour economiser du budget de crawl sur des espaces d'URL a ne jamais explorer.
Quand utiliser le noindex
Les bonnes candidates au noindex incluent les pages de remerciement et de confirmation, les resultats de recherche interne, les pages de tags ou de filtres minces, les contenus de preproduction ou dupliques, les pages de connexion et de compte, et les archives a faible valeur. Ces pages ont une utilite pour les internautes mais encombreraient l'index ou concurrenceraient votre vrai contenu si elles etaient listees. Le noindex les garde fonctionnelles tout en s'assurant que seules vos pages utiles et intentionnelles vous representent dans les resultats.
Erreurs courantes avec le noindex
L'erreur la plus dommageable est de laisser un noindex a l'echelle du site apres une mise en ligne ou une migration, ce qui peut desindexer discretement un site entier. Une autre est de bloquer une page en noindex dans robots.txt, ce qui empeche le robot de voir le noindex, si bien que la page peut rester dans l'index. Appliquer le noindex par erreur a des pages importantes et generatrices de revenus est tout aussi couteux. Des audits reguliers avec Ahrefs, Semrush ou une search console sont essentiels pour confirmer que seules les pages voulues portent la directive.
Noindex, budget de crawl et GEO
Bien utilise, le noindex garde l'index concentre sur vos meilleures pages, ce qui soutient indirectement l'efficacite du crawl et la clarte de votre site aux yeux des moteurs. La meme clarte profite aux moteurs generatifs : garder les pages minces et utilitaires hors de l'index reduit le risque qu'un moteur de reponse mette en avant ou cite une page a faible valeur plutot que votre contenu de reference. L'usage delibere du noindex fait partie d'une base technique propre, pour le SEO classique comme pour l'optimisation des moteurs generatifs.