Gratuit · Analyse côté serveur
Vérificateur d’accès des robots d’IA
Collez un domaine et découvrez si robots.txt autorise GPTBot, ChatGPT-User, ClaudeBot, Perplexity, Googlebot, Bingbot et d’autres robots — avec la règle exacte appliquée et des corrections prêtes à copier.
En bref
- Vérifiez en une seule analyse les principaux robots de recherche, moteurs de réponse d’IA et user-agents d’entraînement des modèles.
- Consultez la règle Allow ou Disallow exacte — et son numéro de ligne — à l’origine de chaque décision d’accès.
- Générez des préréglages robots.txt pratiques en séparant l’accès de recherche de l’accès destiné à l’entraînement.
Ce que cela signifie
robots.txt, sans les idées reçues
robots.txt est un fichier d’instructions déclaratives placé à la racine d’un site. Les robots le lisent avant de récupérer les pages, puis comparent leur user-agent aux règles Allow et Disallow. La règle correspondante la plus longue l’emporte ; en cas d’égalité, Allow est prioritaire. Cet outil rend cette décision visible pour les robots qui suscitent actuellement le plus de questions.
Que vérifie réellement cet outil ?
Il récupère le fichier public /robots.txt du site et applique les règles standard de correspondance la plus longue pour les principaux robots de recherche, de réponse en direct et d’entraînement. Lorsque c’est possible, il affiche la directive et le numéro de ligne qui ont déterminé chaque décision.
Autoriser un robot garantit-il une visibilité dans l’IA ?
Non. Cela signifie seulement que robots.txt ne bloque pas l’accès. Le fait qu’un produit d’IA cite, indexe ou utilise votre contenu pour l’entraînement dépend des systèmes et politiques du fournisseur.
Pourquoi distinguer les robots de réponse en direct des robots d’entraînement ?
De nombreux propriétaires souhaitent que leurs pages publiques restent accessibles aux moteurs de recherche et de réponse tout en limitant l’exploration à grande échelle pour l’entraînement. Le préréglage reflète cette politique courante : autoriser les robots de récupération ou citation en direct et bloquer ceux destinés à l’entraînement, si tel est votre choix.
L’URL vérifiée est-elle stockée ?
Non. Le serveur récupère robots.txt car CORS bloque cette opération dans de nombreux navigateurs. La vérification s’effectue en mémoire, refuse les cibles privées ou internes et ne stocke ni ne journalise les URL soumises.