Robots.txt

Robots.txt est un fichier texte à la racine d'un site qui indique aux robots des moteurs quelles pages ou sections ils peuvent ou non explorer.
SEO & GEO
Created on
02.08.2026
Updated on
17.08.2026

Résumer avec

Ce qu'est robots.txt

Robots.txt est un fichier en texte brut placé à la racine d'un site web qui indique aux robots des moteurs de recherche à quelles parties du site ils ont le droit d'accéder. Quand un robot bien élevé comme Googlebot visite, il consulte ce fichier en premier et suit ses instructions avant de récupérer quoi que ce soit d'autre. C'est l'un des outils les plus anciens et les plus simples pour gérer la façon dont les visiteurs automatisés interagissent avec un site.

Le fichier se trouve à un emplacement fixe, votresite.com/robots.txt, et utilise une petite syntaxe standardisée. Il est visible publiquement par tous, point important : robots.txt guide les robots, il ne cache ni ne sécurise rien.

Malgré son âge, robots.txt reste l'une des premières choses qu'un robot cherche, ce qui donne beaucoup d'influence à un tout petit fichier. Il fait partie d'un accord de longue date entre propriétaires de sites et bots bien élevés, un protocole volontaire plutôt qu'une barrière imposée. Cette nature volontaire est centrale pour comprendre à la fois ce à quoi il excelle et là où il s'arrête, car un robot qui choisit de l'ignorer ne rencontre aucun obstacle technique.

À quoi sert robots.txt

Son but principal est la gestion de l'exploration. Les grands sites ont des pages sans valeur pour la recherche, comme les résultats de recherche interne, les zones d'administration, les URL dupliquées par filtrage ou les contenus de préproduction. Dire aux robots de ne pas y perdre de temps les aide à concentrer leur budget d'exploration limité sur les pages qui comptent, ce qui est particulièrement utile sur les gros sites.

Il sert aussi à pointer les robots vers le sitemap, et à tenir les bots éloignés de sections qui gaspilleraient des ressources. Bien employé, il rend l'exploration plus efficace et garde les URL sans valeur hors du chemin d'un robot.

Le budget d'exploration est le concept qui rend robots.txt réellement utile sur les grands sites. Les moteurs allouent une quantité finie d'exploration à chaque site, et chaque requête dépensée sur une URL inutile est une requête non dépensée sur une page qui compte. En éloignant les bots d'innombrables variations filtrées, de pages de recherche interne et d'autres chemins sans valeur, vous les aidez à atteindre et à rafraîchir votre contenu important plus vite, ce qui peut influer réellement sur la rapidité avec laquelle vos changements sont pris en compte.

Comment fonctionne robots.txt

Le fichier est une liste de règles groupées selon le robot auquel elles s'appliquent. Les directives de base sont simples.

  • User-agent : nomme le robot concerné par une règle, l'astérisque désignant tous les robots.
  • Disallow : indique au robot de ne pas accéder à un chemin.
  • Allow : crée une exception dans une zone interdite.
  • Sitemap : pointe vers l'emplacement du sitemap du site.

Par exemple, une règle peut bloquer tous les robots d'un dossier d'administration tout en autorisant le reste. La syntaxe est tolérante mais littérale : une petite erreur dans un chemin peut avoir un grand effet.

Un malentendu crucial

L'erreur la plus courante et la plus dangereuse est de croire que robots.txt sert à cacher des pages ou à les tenir hors de la recherche. Il ne fait ni l'un ni l'autre. Bloquer une page dans robots.txt empêche seulement les robots respectueux de la récupérer ; l'URL peut toujours apparaître dans les résultats si d'autres pages y renvoient, simplement sans description. Et comme le fichier est public, y lister un chemin secret revient en réalité à l'annoncer.

Pour tenir une page hors des résultats de recherche, on utilise plutôt une directive noindex sur la page, ce qui exige que le robot puisse y accéder. Pour protéger un contenu privé, on utilise une vraie authentification. Robots.txt est un guide de circulation pour les bots, pas un verrou.

La confusion entre bloquer et cacher provoque certaines des erreurs les plus dommageables du SEO. Comme une page bloquée peut tout de même être indexée sous forme d'URL nue quand d'autres sites y renvoient, et comme le robot ne peut plus lire une balise noindex qu'il lui est interdit de récupérer, les deux outils peuvent même se contrarier. La règle fiable est de laisser un robot lire une page que vous voulez retirer, pour qu'il voie le noindex, et de réserver robots.txt au guidage plutôt qu'à la suppression.

Risques et bonnes pratiques de robots.txt

Comme une seule ligne peut bloquer un site entier, robots.txt mérite du soin. Une règle disallow oubliée, héritée d'un environnement de préproduction, peut discrètement retirer un site de la recherche, l'une des erreurs SEO les plus dommageables et les plus faciles à manquer. La bonne pratique est de garder le fichier minimal, de le tester, et de ne jamais bloquer des ressources comme le CSS ou le JavaScript dont les moteurs ont besoin pour afficher la page.

Les vérifications régulières comptent. Les consoles de recherche offrent des outils pour tester le fichier et voir comment les robots l'interprètent, donc vérifier après chaque changement est une habitude sensée, surtout avant et après la mise en ligne d'un site.

Robots.txt chez BeBranded

Chez BeBranded, nous considérons robots.txt comme un petit fichier aux conséquences démesurées, et nous le relisons sur chaque projet Webflow que nous livrons. Nous nous assurons que le disallow global d'un site de préproduction ne survive jamais en production, que le sitemap soit référencé, et que rien de ce dont les moteurs ont besoin pour afficher la page ne soit bloqué. Nous le combinons correctement avec des directives noindex pour un vrai désindexage, car les deux outils font des travaux différents. Le résultat pour le client est un site que les robots explorent proprement et efficacement, sans blocage accidentel lui coûtant discrètement en visibilité.

FAQ

Robots.txt est un fichier texte à la racine d'un site qui indique aux robots des moteurs quelles pages ou sections ils peuvent ou non explorer. Il aide à gérer le budget d'exploration en tenant les bots éloignés des URL sans valeur et peut les diriger vers le sitemap.
Non. Bloquer une page dans robots.txt empêche seulement les robots respectueux de la récupérer, mais l'URL peut toujours apparaître dans les résultats si d'autres pages y renvoient. Pour tenir une page hors de la recherche, utilisez plutôt une directive noindex sur la page.
Il se situe à un emplacement fixe, la racine du domaine, donc toujours à votresite.com/robots.txt. Il doit être à la racine pour être reconnu, et il est visible publiquement par quiconque consulte cette URL.
Robots.txt contrôle si un robot accède à une page, tandis que noindex contrôle si une page accédée apparaît dans les résultats. Pour désindexer une page, le robot doit pouvoir la lire et voir le noindex, donc les deux ne doivent pas être combinés sur la même URL.
Oui, s'il est mal configuré. Une règle disallow oubliée, souvent héritée de la préproduction, peut bloquer l'exploration d'un site entier et le retirer discrètement de la recherche. Bloquer le CSS ou le JavaScript peut aussi empêcher l'affichage des pages, d'où l'importance d'une relecture soignée.
Vous le pouvez. Beaucoup de bots d'IA respectent robots.txt, vous pouvez donc les autoriser ou les interdire par user-agent selon que vous voulez ou non que votre contenu serve à l'entraînement ou aux réponses IA. C'est un choix de politique qui dépend de vos objectifs de visibilité.

Prêt à booster vos conversions ?

Notre équipe est là pour comprendre vos besoins et travailler avec vous pour créer vos prochains projets.
Recevez des news et des ressources.
Des conseils pratiques directement dans votre boîte mail.
Merci ! Votre demande a bien été reçue.
Oups ! Une erreur est survenue lors de l'envoi du formulaire.