Définition · Technique
robots.txt
Le fichier robots.txt, placé à la racine d'un site, indique aux robots quelles zones ils peuvent explorer. C'est une directive respectée par les robots légitimes, pas une protection : une URL bloquée reste accessible à qui connaît son adresse. Depuis l'essor des moteurs de réponse, il sert aussi à autoriser ou refuser les robots des IA.
En pratique
Deux familles de robots doivent être distinguées. Les robots de recherche IA, qui alimentent les réponses générées en temps réel : les bloquer retire mécaniquement le site des réponses des assistants. Les robots d'entraînement, qui collectent des données pour entraîner de futurs modèles : les bloquer n'a pas d'effet sur votre visibilité immédiate.
Confondre les deux est l'erreur la plus coûteuse du moment. Beaucoup de sites ont bloqué l'ensemble des robots d'IA par précaution, et se sont ainsi exclus des réponses générées sans le vouloir.
La confusion à éviter
Bloquer une page dans robots.txt ne la désindexe pas. Le moteur cesse de la lire, mais peut continuer à l'afficher s'il la connaît par ailleurs. Pour retirer une page de l'index, il faut la laisser explorable et y placer une directive noindex.
Quels outils traitent ce sujet ?
Cette notion relève des outils de type crawler technique et extension cms. Voici ceux que nous suivons dans cette famille, avec leur prix d'entrée relevé sur la page tarifaire de l'éditeur :
- Screaming Frog (Crawler technique, gratuit jusqu'à 500 URL, puis 199£/an par licence) : Crawler de bureau devenu le standard de l'audit technique, gratuit jusqu'à 500 URL.
- Rank Math (Extension CMS, gratuit, puis 7,99€ HT/mois (PRO, facturé annuellement)) : Extension SEO WordPress la plus complète en version gratuite, avec un module de contenu IA en option.
- Yoast SEO (Extension CMS, gratuit, puis 118,80$ HT/an (Premium)) : Extension SEO WordPress la plus installée au monde, orientée lisibilité et bonnes pratiques rédactionnelles.
Aucune place n'est achetée dans ce comparatif. Voir la méthodologie, le comparateur filtrable ou les simulateurs de coût.
Termes liés
- Crawl (exploration) : Le crawl est le passage d'un robot de moteur sur les pages d'un site pour en lire le contenu et suivre les liens.
- Indexation : L'indexation est l'enregistrement d'une page dans la base d'un moteur, après exploration et évaluation.
- llms.txt : Le fichier llms.txt est une proposition de convention : un fichier texte à la racine d'un site qui présente son contenu de façon lisible par un modèle de langage.
Aller plus loin
Parcourir le glossaire
Cette définition fait partie de notre glossaire du référencement et de la visibilité dans les IA, 43 termes expliqués sans jargon et sans chiffre inventé.