
Quels robots d'IA respectent vraiment robots.txt
Lisez la documentation des quatre éditeurs et la réponse n'est pas un oui ou un non par entreprise. Trois exemptent de robots.txt les récupérations initiées par l'utilisateur, un ne le fait pas, et bloquer le robot d'entraînement d'une société laisse tourner son robot de recherche.
Chaque guide sur les robots d'IA répond à cette question par un oui ou un non par entreprise. Lisez la documentation des quatre éditeurs et un motif plus net apparaît : trois d'entre eux exemptent de robots.txt les récupérations initiées par un utilisateur, et un ne le fait pas. Cette distinction est toute la réponse, et elle n'est énoncée nulle part sur la première page de résultats.
Le raisonnement derrière l'exemption est le même chez les trois. Une récupération déclenchée parce qu'une personne a tapé une question est traitée comme la visite de cette personne, pas comme l'indexation d'un robot, et robots.txt régit les robots. Que vous trouviez cela convaincant est une autre question que celle de savoir si c'est vrai, et c'est vrai.
Les agents, et ce que chaque éditeur déclare
| Agent | Ce qu'il fait | Respecte robots.txt |
|---|---|---|
GPTBot | OpenAI, données d'entraînement | Oui |
OAI-SearchBot | OpenAI, fait apparaître les sites dans la recherche ChatGPT | Oui |
OAI-AdsBot | OpenAI, vérifie les pages soumises comme annonces | Oui |
ChatGPT-User | OpenAI, visite une page quand un utilisateur demande | Non. OpenAI : les règles « peuvent ne pas s'appliquer » |
ClaudeBot | Anthropic, données d'entraînement | Oui |
Claude-SearchBot | Anthropic, qualité des résultats de recherche | Oui |
Claude-User | Anthropic, visite une page quand un utilisateur demande | Oui, contrairement à ses homologues |
PerplexityBot | Perplexity, index de recherche | Oui |
Perplexity-User | Perplexity, visite une page quand un utilisateur demande | Non. « ignore généralement les règles robots.txt » |
Google-Extended | Google, refus de l'entraînement et de l'ancrage Gemini | Oui |
Google-Agent, Google-GeminiNotebook, GoogleMessages | Google, récupère une page pour un utilisateur | Non. Google : ils « ignorent généralement les règles robots.txt » |
Bloquer un agent n'en bloque pas d'autres
La deuxième erreur dans la plupart des fichiers robots.txt est de traiter une entreprise comme un seul robot. Chaque éditeur exploite un agent pour l'entraînement, un autre pour la recherche et un troisième pour les récupérations initiées par l'utilisateur, et ils s'adressent séparément. Interdire ClaudeBot bloque l'entraînement et laisse Claude-SearchBot et Claude-User intacts. Interdire GPTBot ne change rien à OAI-SearchBot.
Cette séparation est utile plutôt qu'agaçante, car elle permet la distinction que la plupart des propriétaires de sites veulent vraiment : rester hors du corpus d'entraînement, rester dans les réponses. Autorisez les agents de recherche, décidez des agents d'entraînement selon vos termes, et comprenez que les agents initiés par l'utilisateur ne sont pas une décision qui vous appartient sur trois des quatre plateformes.
Le fichier de ce site autorise quatorze agents et n'interdit que /api/. Écrire cet article y a révélé une lacune : OAI-AdsBot n'y figure pas, car il n'existait pas quand le fichier a été écrit. C'est le coût de maintenance ordinaire d'un tel fichier, et la raison de relire les pages des éditeurs plutôt qu'un guide.
Ce que robots.txt ne peut pas faire ici
- Il ne peut pas empêcher une récupération initiée par l'utilisateur chez OpenAI, Perplexity ou Google. Seuls des contrôles côté serveur le peuvent, et bloquer ces agents signifie qu'une personne posant une question sur votre entreprise obtient une réponse construite sans votre page.
- Il ne contrôle pas votre présence dans les fonctionnalités IA de Google. Cela relève des directives ordinaires d'aperçu et d'indexation :
nosnippet,data-nosnippet,max-snippetetnoindex. Il n'existe pas d'exclusion spécifique à l'IA. - Ce n'est pas là que
llms.txtaide. Google déclare ignorer les fichiers texte pour IA dans Search, y compris ses fonctionnalités génératives, et qu'ils ne nuisent ni n'aident. Gardez-en un pour d'autres services si vous voulez ; n'y voyez pas un levier.
Une fois le fichier correct, la question devient ce que ces agents reçoivent réellement en arrivant, un problème différent et mesurable : voir ce qu'un robot d'IA reçoit vraiment de votre site. Le tableau plus large de la fabrication des citations est dans comment les moteurs de recherche IA décident quoi citer et comment ChatGPT choisit les entreprises qu'il recommande.

