Définition · Technique

robots.txt

Le fichier robots.txt, placé à la racine d'un site, indique aux robots quelles zones ils peuvent explorer. C'est une directive respectée par les robots légitimes, pas une protection : une URL bloquée reste accessible à qui connaît son adresse. Depuis l'essor des moteurs de réponse, il sert aussi à autoriser ou refuser les robots des IA.

En pratique

Deux familles de robots doivent être distinguées. Les robots de recherche IA, qui alimentent les réponses générées en temps réel : les bloquer retire mécaniquement le site des réponses des assistants. Les robots d'entraînement, qui collectent des données pour entraîner de futurs modèles : les bloquer n'a pas d'effet sur votre visibilité immédiate.

Confondre les deux est l'erreur la plus coûteuse du moment. Beaucoup de sites ont bloqué l'ensemble des robots d'IA par précaution, et se sont ainsi exclus des réponses générées sans le vouloir.

La confusion à éviter

Bloquer une page dans robots.txt ne la désindexe pas. Le moteur cesse de la lire, mais peut continuer à l'afficher s'il la connaît par ailleurs. Pour retirer une page de l'index, il faut la laisser explorable et y placer une directive noindex.

Quels outils traitent ce sujet ?

Cette notion relève des outils de type crawler technique et extension cms. Voici ceux que nous suivons dans cette famille, avec leur prix d'entrée relevé sur la page tarifaire de l'éditeur :

Aucune place n'est achetée dans ce comparatif. Voir la méthodologie, le comparateur filtrable ou les simulateurs de coût.

Termes liés

Aller plus loin

Parcourir le glossaire

Cette définition fait partie de notre glossaire du référencement et de la visibilité dans les IA, 43 termes expliqués sans jargon et sans chiffre inventé.

Passer de la théorie à l'outil

Notre comparatif de 27 logiciels SEO, avec les prix relevés à la source et la raison de chaque place.

Voir le classement Utiliser les simulateurs