Définition · Technique

Crawl (exploration)

Le crawl est le passage d'un robot de moteur sur les pages d'un site pour en lire le contenu et suivre les liens. C'est la première étape obligatoire : une page jamais explorée ne peut pas être indexée, donc pas affichée. Le comportement des robots se pilote via le fichier robots.txt et la structure des liens internes.

En pratique

Les moteurs n'explorent pas tout, tout le temps. Ils allouent à chaque site une capacité d'exploration, fonction de sa taille, de sa fraîcheur et de sa réputation. Sur un petit site, cette limite est théorique ; sur un catalogue de plusieurs centaines de milliers d'URL, elle décide de ce qui est vu.

Les gaspillages classiques de capacité d'exploration sont les paramètres d'URL qui multiplient les variantes d'une même page, les filtres de navigation à facettes non maîtrisés, et les pages de pagination sans fin. Un crawler d'audit les repère en un passage.

La confusion à éviter

Être exploré ne garantit pas d'être indexé. Un moteur peut lire une page et décider de ne pas la conserver, notamment si elle duplique un contenu existant ou n'apporte rien. La Search Console distingue explicitement les deux états.

Quels outils traitent ce sujet ?

Cette notion relève des outils de type crawler technique. Voici ceux que nous suivons dans cette famille, avec leur prix d'entrée relevé sur la page tarifaire de l'éditeur :

Aucune place n'est achetée dans ce comparatif. Voir la méthodologie, le comparateur filtrable ou les simulateurs de coût.

Termes liés

Aller plus loin

Parcourir le glossaire

Cette définition fait partie de notre glossaire du référencement et de la visibilité dans les IA, 43 termes expliqués sans jargon et sans chiffre inventé.

Passer de la théorie à l'outil

Notre comparatif de 27 logiciels SEO, avec les prix relevés à la source et la raison de chaque place.

Voir le classement Utiliser les simulateurs