Tes pages de services sont faites pour être découvertes. Notre position : favoriser leur accès aux IA, y compris pour l’entraînement. Cela ouvre la porte à l’apprentissage, sans garantir qu’un modèle retiendra ou recommandera ton entreprise.
Commence par vérifier robots.txt. Mais tous les robots IA ne font pas le même travail.
À quoi sert robots.txt?
Un robot d’exploration, ou crawler, est un programme qui visite des pages automatiquement. Le fichier robots.txt indique aux robots qui suivent ce protocole les chemins qu’ils peuvent explorer.
Consulte-le à l’adresse https://example.com/robots.txt. Les sous-domaines, comme ta boutique, ont leurs propres règles. Guide de création de robots.txt
Ce fichier public ne protège pas un espace client et ne garantit pas le retrait d’une page des résultats de recherche. Les espaces privés exigent de vrais contrôles d’accès. Introduction de Google
Tous les robots liés à l’IA ne font pas le même travail
On peut distinguer trois usages :
| Usage | Ce qui se passe | Exemples |
|---|---|---|
| Entraînement | Collecter du contenu susceptible de servir au développement des modèles | GPTBot, ClaudeBot |
| Recherche | Explorer le Web pour alimenter les fonctions de recherche | OAI-SearchBot, Claude-SearchBot |
| Demande d’un utilisateur | Récupérer une page lorsqu’une personne utilise l’assistant | ChatGPT-User, Claude-User |
Les règles varient : ChatGPT-User peut ne pas suivre robots.txt; Anthropic indique que Claude-User le respecte. OpenAI, Anthropic
Comment lire une règle, sans être développeur
Voici un exemple volontairement fictif :
User-agent: ExampleBot
Disallow: /archives/
User-agent désigne le robot. Disallow lui demande de ne pas explorer le chemin indiqué, ici /archives/ et ce qui suit. Allow autorise un chemin; / couvre la racine et les chemins suivants. RFC 9309
Trois exemples pour comprendre les choix
Ces extraits expliquent tes options. Ne les colle pas par-dessus ton fichier : fais vérifier ses règles complètes avant tout changement.
1. Autoriser l’entraînement et la recherche OpenAI
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
Cet exemple autorise l’entraînement et la recherche ChatGPT. Les réglages sont indépendants : remplacer le premier Allow: / par Disallow: / refuserait GPTBot sans changer ce groupe de recherche. Documentation OpenAI
2. Comprendre l’option de refus d’entraînement chez Anthropic
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
Cet exemple refuse l’entraînement chez Anthropic, mais autorise la recherche et les visites demandées par un utilisateur. C’est une option, pas notre recommandation par défaut pour tes pages publiques. Documentation Anthropic
3. Reconnaître une fermeture beaucoup plus large
User-agent: *
Disallow: /
Dans un fichier limité à ces lignes, tous les robots qui appliquent ce protocole reçoivent une interdiction d’explorer le site. Ce n’est pas une règle qui vise seulement l’entraînement. Dans un fichier plus long, il faut aussi examiner les groupes spécifiques. RFC 9309
Pourquoi Google-Extended mérite une explication à part
Google-Extended n’est pas un robot HTTP distinct. C’est un jeton de contrôle qui concerne l’utilisation de contenu déjà exploré, pour l’entraînement de Gemini et certaines réponses Gemini appuyées sur Google Search.
User-agent: Google-Extended
Disallow: /
Cette règle ne correspond donc pas à « refuser seulement l’entraînement ». Elle n’affecte pas l’inclusion du site ni son classement dans Google Search. Il ne faut pas non plus la confondre avec un blocage de Googlebot. Documentation Google
Et llms.txt?
llms.txt propose aux agents IA un guide en Markdown : une présentation et des liens utiles. Il a déjà des usages, notamment en documentation logicielle. Ce n’est pas une autorisation d’entraînement. Proposition llms.txt
Google indique qu’il n’améliore pas la visibilité dans Search, y compris ses fonctionnalités génératives. Guide officiel de Google
Notre conseil : une fois tes pages claires et accessibles, un fichier simple et bien tenu peut être un petit investissement raisonnable. Présente ton entreprise et relie tes services, ta zone desservie et tes coordonnées publiques. Son adoption pourrait s’élargir, sans calendrier garanti. Prévois un peu d’entretien; les pages elles-mêmes restent prioritaires.
La vérification à faire sur ton propre site
Commence par observer, sans modifier :
- Ouvre
/robots.txtsur le domaine exact de ton site. - Note les groupes complets et classe leurs usages : entraînement, recherche ou visite à la demande.
- Ouvre aussi
/llms.txt. S’il existe, vérifie la description de ton entreprise, les liens et les renseignements. Son absence à cette adresse ne signifie pas que ton site bloque les IA.
Si le fichier ne charge pas, note « non vérifié », pas « IA bloquée ».
Un piège avant de coller un exemple
Un groupe spécifique ne récupère pas forcément les restrictions du groupe *. Fais vérifier les exclusions avant d’ajouter un Allow: /. Interprétation des groupes par Google
Tu peux faire cette première lecture toi-même, sans rien modifier. Elle ne vérifie pas tous les accès réels : un pare-feu peut bloquer une requête autorisée par robots.txt. Si tu dois investiguer ce point ou changer une règle, examine aussi l’hébergement et les restrictions existantes. Guide Google sur les fonctionnalités IA
Prochain article : ton site est accessible, mais qu’est-ce que l’IA peut réellement y lire?
Tu veux un premier portrait de ton site?
Le diagnostic BRÈCHE gratuit examine les signaux publics de ton site, pas les recommandations des assistants.
Pour des tests sur des questions d’acheteurs et une comparaison de compétiteurs, découvre BRÈCHE Pro.