En résumé : Le fichier robots.txt compile l’ensemble des requêtes d’autorisation et d’exclusion d’accès aux robots indexeurs des moteurs de recherche. Situé à la racine de votre site, il vous permet de sélectionner les contenus que vous souhaitez voir indexés en priorité, ou ceux que vous souhaitez voir exclus pour des raisons de sécurité ou d’efficacité.
Parmi les nombreux outils qui peuvent faciliter votre référencement en ligne, il en existe certains qui doivent vous demander de plonger jusqu’à la racine de votre site. Malgré son apparence assez effrayante pour ceux qui ne maîtrisent pas les rudiments du code, le fichier robots.txt fait partie de ces outils précieux. Son optimisation peut vous apporter un coup de pouce salutaire pour prioriser les contenus que vous souhaitez mettre en avant aux yeux des algorithmes des moteurs de recherche.
À quoi correspond le fichier robots.txt ?
Le fichier robots.txt est un simple fichier textuel intégré à la racine d’un site internet. Il est l’un des premiers auxquels ont accès les robots indexeurs chargés de crawler votre contenu pour les moteurs de recherche, mais aussi pour les moteurs conversationnels des IA. Le fichier robots.txt contient sous forme de code une série d’instructions concernant les contenus auxquels les robots peuvent avoir ou non accès. Il formule des protocoles d’exclusion de tous les agents ou d’une partie d’entre eux. Le fichier intègre également d’autres informations utiles à l’indexation, notamment l’emplacement de la sitemap de votre page web.
Où peut-on trouver le fichier robots.txt d’un site ?
Pour accéder au fichier d’exclusion des robots de votre page, rien de plus simple. Dans la barre d’adresse de votre navigateur, il vous suffit d’entrer l’URL de la page d’accueil de votre site suivi d’un slash et du nom du fichier. Concrètement, vous devez taper dans votre barre d’adresse http://nomdevotresite.com/robots.txt. Deux cas de figure peuvent alors se présenter :
- Si une page se charge, cela signifie que le fichier robots.txt est déjà intégré à la racine de votre site.
- Si une erreur 404 s’affiche, cela signifie que le fichier robots.txt est absent. Par défaut, l’absence de ce fichier signifie qu’aucun contenu de votre site n’est interdit de crawling. Si vous souhaitez mettre en place une interdiction de crawling, vous devrez créer un fichier à intégrer à la racine du site.
Pourquoi peut-on avoir besoin de modifier le fichier robots.txt d’une page ?
Bloquer tout ou partie du contenu de son site aux robots indexeurs peut apparaître contradictoire dans le cadre d’une stratégie SEO, puisque l’on cherche à ce que lesdits contenus soient accessibles aux sources les plus variées possibles. Or, l’intérêt de bien maîtriser le degré d’accès de votre site aux robots est multiple.
- Le fichier robots.txt peut vous permettre de définir une zone de confidentialité, notamment si votre site recueille des données personnelles et des comptes privés. Il permet, par exemple, d’autoriser les robots à accéder à la partie publique d’un site, mais de leur interdire d’accéder à l’intranet des employés.
- Son plus grand intérêt en termes de SEO est de vous permettre de gérer le budget de crawl alloué à votre site. Bloquer l’accès à certaines pages ou certains contenus sans intérêt direct pour votre stratégie SEO permet de concentrer le processus d’indexation sur vos pages clés à haut niveau de trafic potentiel.
- Il permet également de prioriser certains contenus à d’autres très similaires ou plus obsolètes, et d’éviter de voir votre site pénalisé pour contenu dupliqué.
Que ne faut-il pas demander à un fichier robots.txt ?
Dans un premier temps, il ne faut pas oublier que ce fichier ne peut bloquer que l’indexation directe d’une page. Celle-ci peut néanmoins se retrouver dans les répertoires d’indexation de Google si son URL apparaît dans un autre contenu lui-même indexé. Si vous souhaitez aller plus loin et masquer complètement votre page, il faut lui adjoindre une balise meta noindex spécifique, ou protéger son accès par un mot de passe.
Il est important aussi de rappeler que le fichier robots.txt d’un site est un fichier d’accès public : n’importe qui peut y avoir accès et consulter ses informations, sans pour autant pouvoir le modifier. Il est donc fortement conseillé, si vous le rédigez vous-même, de n’y inclure aucune information que vous ne souhaitez pas divulguer, par exemple des sections confidentielles ou des dossiers secrets.
Enfin, le fichier a une taille de prise en charge maximale limitée : par exemple, l’algorithme de Google fixe cette limite à 521 ko et peut ignorer votre fichier au-delà de cette taille. Attention donc à ne pas multiplier les requêtes à l’excès.
Comment comprendre les informations du fichier robots.txt ?
Sans entrer dans toutes les spécificités techniques, il est important de connaître et comprendre les grands termes de la syntaxe de code d’un fichier robots.txt.
- User-agent : ce terme se réfère aux agents, c’est-à-dire les robots indexeurs (ou spiders) des moteurs de recherche : Googlebot, Bingbot… Une commande User-agent suivie d’un astérisque (*) signifie que le protocole s’applique par défaut à tous les agents.
- Allow/Disallow : Ces commandes vont indiquer quels sont les contenus auxquels les robots auront accès ou non. L’absence de tout caractère après cette commande signifie “rien”, et la présence d’un slash signifie “tout”.
- Vous pouvez spécifier vos requêtes d’exclusion y compris par dossier ou sous-dossier. Par exemple, un code Disallow:/dossier1/ suivi de Allow : /dossier1/fichier1.html signifie que vous bloquez l’indexation complète du dossier 1, à l’exception du fichier 1, qui lui peut être crawlé.
Si vous devez créer un fichier robots.txt pour votre site, le plus simple reste, si possible, de faire appel à l’outil intégré à votre système de gestion de contenu (CMS), comme le propose notamment WordPress. Des outils en ligne peuvent également vous permettre d’effectuer cette tâche complexe pour les néophytes. D’autant plus qu’une simple erreur de syntaxe peut bloquer l’indexation complète de votre site. Mais si vous vous sentez partant, il vous suffit de rentrer vos lignes de commande dans un éditeur de texte supportant l’encodage UTF-8, y compris le simple Bloc-notes Microsoft.
Visuel de Shoper .pl / Pexels