Testeur robots.txt en ligne
Collez le contenu de votre robots.txt : la syntaxe est analysée en direct et vous pouvez simuler l'accès d'un robot à une URL précise.
Aucun problème détecté : toutes les lignes sont reconnues.
- User-agent: *
- Disallow: /admin
- Disallow: /cgi-bin
- User-agent: GPTBot
- Disallow: /
- https://exemple.fr/sitemap.xml
Simulateur
Bloqué
Règle appliquée (ligne 2) : Disallow: /admin — groupe User-agent: *
Qu'est-ce que robots.txt ?
Le fichier robots.txt, placé à la racine d'un site (/robots.txt), indique aux robots d'exploration les zones du site qu'ils peuvent ou ne peuvent pas visiter, via des directives comme User-agent, Disallow, Allow, Sitemap et Crawl-delay. C'est une convention respectée volontairement par les robots bien élevés (moteurs de recherche, la plupart des crawlers IA connus) : ce n'est pas un mécanisme de sécurité, un robot malveillant peut l'ignorer.
Bloquer ou autoriser les crawlers IA
De plus en plus de sites veulent gérer explicitement les crawlers utilisés pour entraîner ou alimenter des modèles de langage et des moteurs de réponse génératifs : GPTBot et ChatGPT-User (OpenAI), ClaudeBot (Anthropic), Google-Extended (entraînement Gemini / AI Overviews), PerplexityBot, ou encore CCBot (Common Crawl, dont le jeu de données sert à de nombreux modèles). Bloquer un de ces crawlers réduit sa capacité à indexer votre contenu, ce qui peut réduire votre visibilité dans les réponses des moteurs génératifs (enjeu dit d'AEO, « Answer Engine Optimization ») — un arbitrage à faire consciemment selon vos objectifs, pas une case à cocher par défaut.
Repères de syntaxe
- Chaque groupe commence par une ou plusieurs lignes
User-agent:. Disallow: /cheminbloque toute URL commençant par ce chemin ;Disallow:(vide) n'interdit rien.- Une règle
Allowplus spécifique (chemin plus long) l'emporte sur unDisallowplus général. - Les règles d'un groupe ciblant nommément un user-agent priment sur celles du groupe générique
User-agent: *.
Disallow dans robots.txt empêche un robot bien élevé de crawler (visiter) une URL, mais n'empêche pas forcément cette URL d'apparaître dans les résultats de recherche si elle est référencée ailleurs. La balise meta « noindex » (ou l'en-tête X-Robots-Tag) demande explicitement de ne pas indexer la page, mais nécessite que le robot puisse crawler la page pour la voir — un Disallow empêche justement ce crawl, donc les deux ne doivent pas être combinés sur la même URL.
robots.txt s'applique à tout un site ou des sections entières via des chemins, et est lu avant même que le robot visite une page. La balise meta robots (ou l'en-tête HTTP équivalent) s'applique page par page et n'est lue qu'après que le robot a pu accéder à la page — elle est donc inutile sur une URL déjà bloquée par robots.txt.
Non. robots.txt est une convention indicative, pas une mesure de sécurité : les moteurs de recherche majeurs et la plupart des crawlers IA reconnus la respectent, mais rien n'empêche techniquement un robot mal intentionné ou peu documenté de l'ignorer. Pour protéger réellement une ressource sensible, utilisez une authentification ou un contrôle d'accès côté serveur, pas uniquement robots.txt.
Ajoutez un groupe dédié avec le nom exact du user-agent du crawler IA (ex. « User-agent: GPTBot ») suivi de « Disallow: / », en le plaçant à côté (pas à la place) de votre groupe « User-agent: * » qui reste ouvert aux autres robots. Les règles les plus spécifiques à un user-agent prennent le pas sur les règles génériques.