Ton site laisse-t-il les IA découvrir ton entreprise? Comprendre robots.txt

Illustration conceptuelle : ordinateur portable et symboles OpenAI, Anthropic et Gemini autour d’un site Web.

Tes pages de services sont faites pour être découvertes. Notre position : favoriser leur accès aux IA, y compris pour l’entraînement. Cela ouvre la porte à l’apprentissage, sans garantir qu’un modèle retiendra ou recommandera ton entreprise.

Commence par vérifier robots.txt. Mais tous les robots IA ne font pas le même travail.

À quoi sert robots.txt?

Un robot d’exploration, ou crawler, est un programme qui visite des pages automatiquement. Le fichier robots.txt indique aux robots qui suivent ce protocole les chemins qu’ils peuvent explorer.

Consulte-le à l’adresse https://example.com/robots.txt. Les sous-domaines, comme ta boutique, ont leurs propres règles. Guide de création de robots.txt

Ce fichier public ne protège pas un espace client et ne garantit pas le retrait d’une page des résultats de recherche. Les espaces privés exigent de vrais contrôles d’accès. Introduction de Google

Tous les robots liés à l’IA ne font pas le même travail

On peut distinguer trois usages :

Usage Ce qui se passe Exemples
Entraînement Collecter du contenu susceptible de servir au développement des modèles GPTBot, ClaudeBot
Recherche Explorer le Web pour alimenter les fonctions de recherche OAI-SearchBot, Claude-SearchBot
Demande d’un utilisateur Récupérer une page lorsqu’une personne utilise l’assistant ChatGPT-User, Claude-User

Les règles varient : ChatGPT-User peut ne pas suivre robots.txt; Anthropic indique que Claude-User le respecte. OpenAI, Anthropic

Comment lire une règle, sans être développeur

Voici un exemple volontairement fictif :

User-agent: ExampleBot
Disallow: /archives/

User-agent désigne le robot. Disallow lui demande de ne pas explorer le chemin indiqué, ici /archives/ et ce qui suit. Allow autorise un chemin; / couvre la racine et les chemins suivants. RFC 9309

Trois exemples pour comprendre les choix

Ces extraits expliquent tes options. Ne les colle pas par-dessus ton fichier : fais vérifier ses règles complètes avant tout changement.

1. Autoriser l’entraînement et la recherche OpenAI

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

Cet exemple autorise l’entraînement et la recherche ChatGPT. Les réglages sont indépendants : remplacer le premier Allow: / par Disallow: / refuserait GPTBot sans changer ce groupe de recherche. Documentation OpenAI

2. Comprendre l’option de refus d’entraînement chez Anthropic

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

Cet exemple refuse l’entraînement chez Anthropic, mais autorise la recherche et les visites demandées par un utilisateur. C’est une option, pas notre recommandation par défaut pour tes pages publiques. Documentation Anthropic

3. Reconnaître une fermeture beaucoup plus large

User-agent: *
Disallow: /

Dans un fichier limité à ces lignes, tous les robots qui appliquent ce protocole reçoivent une interdiction d’explorer le site. Ce n’est pas une règle qui vise seulement l’entraînement. Dans un fichier plus long, il faut aussi examiner les groupes spécifiques. RFC 9309

Pourquoi Google-Extended mérite une explication à part

Google-Extended n’est pas un robot HTTP distinct. C’est un jeton de contrôle qui concerne l’utilisation de contenu déjà exploré, pour l’entraînement de Gemini et certaines réponses Gemini appuyées sur Google Search.

User-agent: Google-Extended
Disallow: /

Cette règle ne correspond donc pas à « refuser seulement l’entraînement ». Elle n’affecte pas l’inclusion du site ni son classement dans Google Search. Il ne faut pas non plus la confondre avec un blocage de Googlebot. Documentation Google

Et llms.txt?

llms.txt propose aux agents IA un guide en Markdown : une présentation et des liens utiles. Il a déjà des usages, notamment en documentation logicielle. Ce n’est pas une autorisation d’entraînement. Proposition llms.txt

Google indique qu’il n’améliore pas la visibilité dans Search, y compris ses fonctionnalités génératives. Guide officiel de Google

Notre conseil : une fois tes pages claires et accessibles, un fichier simple et bien tenu peut être un petit investissement raisonnable. Présente ton entreprise et relie tes services, ta zone desservie et tes coordonnées publiques. Son adoption pourrait s’élargir, sans calendrier garanti. Prévois un peu d’entretien; les pages elles-mêmes restent prioritaires.

La vérification à faire sur ton propre site

Commence par observer, sans modifier :

  1. Ouvre /robots.txt sur le domaine exact de ton site.
  2. Note les groupes complets et classe leurs usages : entraînement, recherche ou visite à la demande.
  3. Ouvre aussi /llms.txt. S’il existe, vérifie la description de ton entreprise, les liens et les renseignements. Son absence à cette adresse ne signifie pas que ton site bloque les IA.

Si le fichier ne charge pas, note « non vérifié », pas « IA bloquée ».

Un piège avant de coller un exemple

Un groupe spécifique ne récupère pas forcément les restrictions du groupe *. Fais vérifier les exclusions avant d’ajouter un Allow: /. Interprétation des groupes par Google

Tu peux faire cette première lecture toi-même, sans rien modifier. Elle ne vérifie pas tous les accès réels : un pare-feu peut bloquer une requête autorisée par robots.txt. Si tu dois investiguer ce point ou changer une règle, examine aussi l’hébergement et les restrictions existantes. Guide Google sur les fonctionnalités IA

Prochain article : ton site est accessible, mais qu’est-ce que l’IA peut réellement y lire?

Tu veux un premier portrait de ton site?

Le diagnostic BRÈCHE gratuit examine les signaux publics de ton site, pas les recommandations des assistants.

Essayer BRÈCHE gratuitement

Pour des tests sur des questions d’acheteurs et une comparaison de compétiteurs, découvre BRÈCHE Pro.

← Retour aux articles