Indexation
L'indexation est le processus par lequel un moteur de recherche analyse une page explorée puis l'enregistre dans son index, la base de données à partir de laquelle il répond aux requêtes. Une page non indexée ne peut apparaître dans aucun résultat de recherche, quelle que soit la qualité de son optimisation.
Qu'est-ce que l'indexation ?
Les moteurs de recherche fonctionnent en trois étapes : le crawl (découvrir et télécharger une page), l'indexation (analyser et enregistrer le contenu, la structure et les signaux de cette page), puis le classement (décider où une page indexée apparaît pour une requête donnée). L'indexation se situe entre les deux : une page peut être explorée sans jamais être indexée, si le moteur la juge peu utile, dupliquée, ou si on lui a explicitement demandé de ne pas l'indexer. Seules les pages indexées peuvent être classées.
Comment fonctionne l'indexation
Après avoir exploré une URL, un moteur de recherche rend la page, en extrait le texte, les liens et les données structurées, puis décide de l'ajouter ou non à son index. Les propriétaires de site contrôlent l'indexation via une balise meta ou un en-tête HTTP :
<meta name="robots" content="index, follow">
L'en-tête HTTP équivalent, utile pour les fichiers non HTML comme les PDF, donne la même instruction côté serveur :
X-Robots-Tag: index, follow
Utiliser noindex à la place retire la page de l'index, même si elle y était auparavant et même si elle continue d'être explorée.
Les statuts d'indexation dans Google Search Console
- Indexée : la page est dans l'index et peut être classée.
- Explorée, actuellement non indexée : Google a visité la page mais a choisi de ne pas l'indexer, souvent un signal de qualité ou de duplication.
- Découverte, actuellement non indexée : Google connaît l'URL mais ne l'a pas encore explorée, souvent une question de budget de crawl ou de priorité.
- Exclue par une balise 'noindex' : la page a explicitement demandé aux moteurs de ne pas l'indexer.
- Doublon, l'URL envoyée n'a pas été sélectionnée comme canonique : Google a indexé une autre version d'une page quasi identique.
Indexation vs crawl vs classement
| Aspect | Crawl | Indexation | Classement |
|---|---|---|---|
| Ce que ça signifie | Découvrir et télécharger une page | Analyser et enregistrer une page dans l'index | Ordonner les pages indexées pour une requête donnée |
| Contrôlé par | robots.txt, budget de crawl | Meta robots / X-Robots-Tag, qualité du contenu | Algorithme (pertinence, autorité, signaux UX) |
| Prérequis | Aucun, c'est la première étape | Nécessite le crawl | Nécessite l'indexation |
| Vérification côté propriétaire | Statistiques de crawl dans Search Console | Outil d'inspection d'URL | Rapport de performance dans Search Console |
Bonnes pratiques et pièges courants
L'erreur d'indexation la plus courante est une balise noindex oubliée après un environnement de préproduction, qui retire silencieusement une page des résultats sans aucun message d'erreur. Une page pauvre ou dupliquée est rarement indexée, car les moteurs de recherche réservent leur budget de crawl et d'indexation au contenu qui apporte une valeur distincte. Soumettre un sitemap et créer des liens internes depuis des pages déjà indexées accélèrent tous deux la découverte de nouvelles URL, mais aucun des deux ne garantit l'indexation si le contenu lui-même ne passe pas la barre de qualité.
Vérifier et améliorer le statut d'indexation
L'outil d'inspection d'URL de Google Search Console indique le statut exact d'indexation d'une page et la raison en cas d'exclusion, et une action « Demander l'indexation » peut accélérer une nouvelle exploration après une correction. Une recherche site:exemple.com donne une estimation approximative, non exhaustive, du nombre de pages indexées. Une page a plus de chances d'être indexée si elle est accessible en quelques clics depuis la page d'accueil, incluse dans le sitemap XML, et libre de signaux contradictoires comme une balise canonique pointant ailleurs.
L'indexation chez BeBranded
Nous auditons le statut d'indexation en première étape de chaque mission SEO & GEO, car une page techniquement parfaite mais non indexée génère zéro trafic organique, quelle que soit la qualité de son contenu.