Visibilité IA & GEO

llms.txt et crawlers IA : le setup technique pour la visibilité IA

Ce que llms.txt, robots.txt et sitemaps apportent à la visibilité IA

Ces trois fichiers sont des couches distinctes aux rôles clairs. robots.txt est le contrôle d'accès : pour chaque crawler, il définit les zones lisibles. Le sitemap XML est la carte : il liste vos URL canoniques les plus importantes afin que rien ne soit oublié. llms.txt est l'invitation : il offre aux assistants IA un résumé structuré et lisible de vos contenus clés en Markdown.

Pour des attentes réalistes : aucun de ces fichiers ne force une citation. Ils rendent vos contenus trouvables, lisibles par les machines et accessibles selon votre politique - la condition préalable au GEO (Generative Engine Optimization). robots.txt et sitemaps sont des standards établis et largement supportés. llms.txt est en revanche une proposition récente (llmstxt.org, 2024), pas encore exploitée automatiquement par tous les grands fournisseurs IA : ne comptez jamais dessus seul.

Les principaux crawlers IA et leurs user-agents

Point crucial : entraînement, recherche et récupération en direct passent souvent par des user-agents différents d'un même fournisseur. Tout bloquer sans distinction fait perdre aussi les canaux qui produisent des citations. Les principaux noms (en 2026 ; les libellés évoluent) :

  • GPTBot (OpenAI) - crawler pour l'entraînement/index de ChatGPT. Le bloquer retire vos contenus du corpus d'entraînement.
  • OAI-SearchBot et ChatGPT-User (OpenAI) - alimentent les résultats de recherche ChatGPT ou récupèrent une page quand l'utilisateur demande à ChatGPT d'ouvrir un lien. Bloquer = pas de citations dans la recherche ChatGPT.
  • ClaudeBot et Claude-User (Anthropic) - crawler pour Claude et récupération initiée par l'utilisateur. Pertinents pour la visibilité dans les réponses de Claude.
  • PerplexityBot et Perplexity-User (Perplexity) - indexation et récupération en direct pour les réponses sourcées de Perplexity.
  • Google-Extended (Google) - pas un crawler mais un token robots : il contrôle uniquement si les contenus entraînent Gemini/Vertex AI. Il n'affecte ni Googlebot ni les AI Overviews de Google.
  • Googlebot (Google) - le crawler classique derrière Google Search et les AI Overviews. Le bloquer, c'est disparaître de la recherche organique.
  • Autres agents d'entraînement : CCBot (Common Crawl, base de nombreux modèles), Applebot-Extended (Apple Intelligence), Bytespider (ByteDance), meta-externalagent (Meta).

Configurer robots.txt correctement - avec exemple

Définissez d'abord votre stratégie : il vaut généralement mieux autoriser les bots de recherche et de récupération (OAI-SearchBot, PerplexityBot, ClaudeBot), car ce sont eux qui produisent des réponses citées. Pour les bots purement d'entraînement (GPTBot, CCBot, Google-Extended), décidez selon votre stratégie de marque et de propriété intellectuelle. Exemple pragmatique d'une politique orientée visibilité :

# robots.txt - https://www.weissmann.ai/robots.txt\nUser-agent: OAI-SearchBot\nAllow: /\n\nUser-agent: ClaudeBot\nAllow: /\n\nUser-agent: PerplexityBot\nAllow: /\n\nUser-agent: GPTBot\nAllow: /\n\nUser-agent: *\nAllow: /\nDisallow: /interne/\n\nSitemap: https://www.weissmann.ai/sitemap.xml

Pour limiter l'entraînement IA sans perdre Google Search, bloquez de façon sélective : un bloc dédié "User-agent: GPTBot / Disallow: /" plus "User-agent: Google-Extended / Disallow: /" vous sort de l'entraînement tandis que Googlebot et OAI-SearchBot continuent de lire vos contenus. Deux limites à connaître : robots.txt n'est qu'une directive - les bots sérieux la respectent, les malveillants non (il faut alors des blocages côté serveur ou un WAF). Et le fichier est public : n'y listez jamais de chemins secrets.

Créer llms.txt : structure et exemple

llms.txt se trouve à /llms.txt et est du Markdown pur. Structure proposée : un H1 avec votre nom, un court résumé en blockquote, puis des sections thématiques avec des liens Markdown vers vos pages canoniques les plus importantes, chacune accompagnée d'une brève description. En option, ajoutez /llms-full.txt contenant les textes complets. Gardez la liste courte, à jour et sélectionnée.

# Weissmann AI Academy\n\n> Plateforme de connaissances suisse sur l'IA, le SEO et le GEO pour PME.\n\n## Guides principaux\n- [Qu'est-ce que le GEO](https://www.weissmann.ai/fr/wissen/geo) : fondamentaux de la Generative Engine Optimization\n- [llms.txt et crawlers IA](https://www.weissmann.ai/fr/wissen/llms-txt) : ce setup technique\n\n## À propos\n- [À propos de Weissmann](https://www.weissmann.ai/fr/a-propos) : équipe, approche, contact

Deux principes décident de sa valeur : exactitude et maintenance. Ne liez que des URL réelles et accessibles, décrivez le contenu honnêtement et mettez le fichier à jour à chaque changement important. Un llms.txt périmé avec des liens morts nuit plus à la confiance que son absence.

Sitemaps et hreflang pour la visibilité multilingue

Le sitemap XML liste vos URL canoniques avec une date lastmod. Référencez-le dans robots.txt (ligne "Sitemap:") et soumettez-le dans Google Search Console et Bing Webmaster Tools - Bing alimente notamment Copilot. Pour la Suisse, le multilinguisme est central : les annotations hreflang (de-CH, fr-CH, it-CH, en) indiquent quelle version linguistique correspond à quel public.

Pour la visibilité IA, cela compte double : des liens hreflang propres aident les assistants à citer la version dans la bonne langue - au lieu d'appuyer une réponse en allemand sur l'URL italienne. Maintenez des valeurs lastmod réalistes et gardez le sitemap exempt de redirections, pages d'erreur et doublons non canoniques.

Erreurs fréquentes et le regard suisse

Regard suisse : votre politique de crawlers relève de la gouvernance des données. Si vous publiez des contenus personnels ou sensibles, la loi révisée sur la protection des données (revDSG/nFADP) et la surveillance du PFPDT (EDOEB) s'appliquent, quel que soit le bot qui lit. Une décision réfléchie sur le droit d'auteur et l'usage de vos contenus pour l'entraînement IA s'impose aussi. Pour le marché suisse multilingue, des signaux hreflang propres sont obligatoires. Là où vous préférez ne pas implémenter ou auditer cette configuration vous-même, l'équipe Weissmann vous accompagne de la politique à la mise en oeuvre.

  • Bloquer GPTBot en attendant quand même des citations ChatGPT : elles viennent d'OAI-SearchBot et ChatGPT-User, pas de GPTBot.
  • Croire que Google-Extended vous retire des AI Overviews : celles-ci utilisent l'index Googlebot ; Google-Extended ne concerne que l'entraînement de Gemini.
  • Prendre robots.txt pour une mesure de sécurité : c'est une directive, pas un contrôle d'accès - et il est lisible publiquement.
  • Règles contradictoires ou mauvais ordre des wildcards qui bloquent tout par accident ; et un llms.txt publié mais jamais entretenu.

Questions fréquentes

Qu'est-ce que llms.txt et en ai-je besoin ?

llms.txt est un fichier Markdown à /llms.txt qui propose aux assistants IA des liens et résumés sélectionnés de vos contenus clés. C'est une proposition récente (2024), pas encore exploitée automatiquement par tous. Non obligatoire, mais un élément utile et peu coûteux - à condition d'avoir d'abord bien configuré robots.txt et sitemaps.

robots.txt bloque-t-il vraiment les crawlers IA de manière fiable ?

Seulement pour les bots sérieux. GPTBot, ClaudeBot, PerplexityBot et Googlebot respectent les directives. Mais robots.txt n'est pas une barrière technique : les bots qui choisissent de ne pas s'y conformer peuvent l'ignorer. Pour un blocage réel, il faut des mesures côté serveur : blocages IP, limitation de débit ou un pare-feu applicatif.

Comment empêcher l'entraînement IA sans perdre ma visibilité Google ?

Bloquez sélectivement les agents d'entraînement - notamment GPTBot et le token Google-Extended - chacun avec "Disallow: /". En parallèle, autorisez Googlebot (recherche organique) ainsi qu'OAI-SearchBot et PerplexityBot (citations). Vous restez visible en recherche et dans les réponses IA sans alimenter les corpus d'entraînement.

Vais-je encore apparaître dans les AI Overviews de Google si je bloque Google-Extended ?

Oui. Les AI Overviews s'appuient sur l'index Googlebot classique, pas sur Google-Extended. Le token Google-Extended contrôle uniquement si vos contenus entraînent Gemini/Vertex AI. Tant que Googlebot peut explorer vos pages, vous pouvez apparaître dans les AI Overviews - il n'existe actuellement pas d'opt-out spécifique aux AI Overviews.

Où ces fichiers doivent-ils exactement se trouver ?

Tous à la racine du domaine : https://www.votre-domaine.ch/robots.txt, /llms.txt et /sitemap.xml. robots.txt doit pointer vers le sitemap via une ligne "Sitemap:". Si vous utilisez un domaine par langue ou des sous-répertoires, robots.txt se place à la racine de chaque hôte qui le sert.

Faut-il autoriser ou bloquer les crawlers IA ?

Cela dépend de votre objectif. Pour être cité dans les réponses IA, autorisez les bots de recherche et de récupération (OAI-SearchBot, PerplexityBot, ClaudeBot). Si votre priorité est le contrôle de votre propriété intellectuelle, bloquez les bots purement d'entraînement. Pour la plupart des PME suisses, une approche mixte est pertinente : permettre la visibilité, limiter sciemment l'entraînement.

Termes du glossaire

← Retour à l’aperçu

L’IA pratique pour votre entreprise

De l’idée à la mise en œuvre – nous vous montrons ce qui est concrètement possible dans votre cas.

Demander une démo