Quels robots d'IA respectent vraiment robots.txt

Lisez la documentation des quatre éditeurs et la réponse n'est pas un oui ou un non par entreprise. Trois exemptent de robots.txt les récupérations initiées par l'utilisateur, un ne le fait pas, et bloquer le robot d'entraînement d'une société laisse tourner son robot de recherche.

Chaque guide sur les robots d'IA répond à cette question par un oui ou un non par entreprise. Lisez la documentation des quatre éditeurs et un motif plus net apparaît : trois d'entre eux exemptent de robots.txt les récupérations initiées par un utilisateur, et un ne le fait pas. Cette distinction est toute la réponse, et elle n'est énoncée nulle part sur la première page de résultats.

Le raisonnement derrière l'exemption est le même chez les trois. Une récupération déclenchée parce qu'une personne a tapé une question est traitée comme la visite de cette personne, pas comme l'indexation d'un robot, et robots.txt régit les robots. Que vous trouviez cela convaincant est une autre question que celle de savoir si c'est vrai, et c'est vrai.

Les agents, et ce que chaque éditeur déclare

AgentCe qu'il faitRespecte robots.txt
GPTBotOpenAI, données d'entraînementOui
OAI-SearchBotOpenAI, fait apparaître les sites dans la recherche ChatGPTOui
OAI-AdsBotOpenAI, vérifie les pages soumises comme annoncesOui
ChatGPT-UserOpenAI, visite une page quand un utilisateur demandeNon. OpenAI : les règles « peuvent ne pas s'appliquer »
ClaudeBotAnthropic, données d'entraînementOui
Claude-SearchBotAnthropic, qualité des résultats de rechercheOui
Claude-UserAnthropic, visite une page quand un utilisateur demandeOui, contrairement à ses homologues
PerplexityBotPerplexity, index de rechercheOui
Perplexity-UserPerplexity, visite une page quand un utilisateur demandeNon. « ignore généralement les règles robots.txt »
Google-ExtendedGoogle, refus de l'entraînement et de l'ancrage GeminiOui
Google-Agent, Google-GeminiNotebook, GoogleMessagesGoogle, récupère une page pour un utilisateurNon. Google : ils « ignorent généralement les règles robots.txt »
Lu le 7 septembre 2026 sur developers.openai.com, le centre d'aide d'Anthropic, docs.perplexity.ai et la documentation Google sur les crawlers et fetchers. Les éditeurs les révisent : la date fait partie de la donnée.

Articles

Vous voulez la même chose sur votre site ?

Réserver un appel

Bloquer un agent n'en bloque pas d'autres

La deuxième erreur dans la plupart des fichiers robots.txt est de traiter une entreprise comme un seul robot. Chaque éditeur exploite un agent pour l'entraînement, un autre pour la recherche et un troisième pour les récupérations initiées par l'utilisateur, et ils s'adressent séparément. Interdire ClaudeBot bloque l'entraînement et laisse Claude-SearchBot et Claude-User intacts. Interdire GPTBot ne change rien à OAI-SearchBot.

Cette séparation est utile plutôt qu'agaçante, car elle permet la distinction que la plupart des propriétaires de sites veulent vraiment : rester hors du corpus d'entraînement, rester dans les réponses. Autorisez les agents de recherche, décidez des agents d'entraînement selon vos termes, et comprenez que les agents initiés par l'utilisateur ne sont pas une décision qui vous appartient sur trois des quatre plateformes.

Le fichier de ce site autorise quatorze agents et n'interdit que /api/. Écrire cet article y a révélé une lacune : OAI-AdsBot n'y figure pas, car il n'existait pas quand le fichier a été écrit. C'est le coût de maintenance ordinaire d'un tel fichier, et la raison de relire les pages des éditeurs plutôt qu'un guide.

Ce que robots.txt ne peut pas faire ici

  • Il ne peut pas empêcher une récupération initiée par l'utilisateur chez OpenAI, Perplexity ou Google. Seuls des contrôles côté serveur le peuvent, et bloquer ces agents signifie qu'une personne posant une question sur votre entreprise obtient une réponse construite sans votre page.
  • Il ne contrôle pas votre présence dans les fonctionnalités IA de Google. Cela relève des directives ordinaires d'aperçu et d'indexation : nosnippet, data-nosnippet, max-snippet et noindex. Il n'existe pas d'exclusion spécifique à l'IA.
  • Ce n'est pas là que llms.txt aide. Google déclare ignorer les fichiers texte pour IA dans Search, y compris ses fonctionnalités génératives, et qu'ils ne nuisent ni n'aident. Gardez-en un pour d'autres services si vous voulez ; n'y voyez pas un levier.

Une fois le fichier correct, la question devient ce que ces agents reçoivent réellement en arrivant, un problème différent et mesurable : voir ce qu'un robot d'IA reçoit vraiment de votre site. Le tableau plus large de la fabrication des citations est dans comment les moteurs de recherche IA décident quoi citer et comment ChatGPT choisit les entreprises qu'il recommande.

Construisons le site que votre entreprise mérite.

Envoyez ce que vous avez aujourd'hui et où vous voulez aller. Vous obtenez une réponse claire sur le périmètre, le calendrier et le budget, généralement dans l'heure.

Nous travaillons en Amérique du Nord, en Europe et au Moyen-Orient.