llms.txt : comment le construire et quel impact sur votre visibilité IA
Le llms.txt est un fichier texte proposé pour aider les modèles de langage à comprendre rapidement un site. Ce qu'il contient, comment le rédiger et ce qu'on sait réellement de son impact sur le référencement IA.
Un site web est pensé pour un navigateur : mise en page, menus, scripts, publicités. Un modèle de langage qui tente de comprendre ce même site doit filtrer tout ce bruit pour extraire l'information utile, avec un budget de contexte limité. Le llms.txt part de ce constat simple : proposer, à la racine du domaine, un résumé écrit directement pour une machine plutôt que pour un navigateur.
Le format a été proposé fin 2024 par Jeremy Howard (answer.ai) et a rapidement été adopté par de nombreux éditeurs de documentation technique. Il n'est pas (encore) un standard officiel au sens où le sont robots.txt ou sitemap.xml, mais Google a commencé à en vérifier la présence dans ses audits Lighthouse dédiés à l'agentic browsing, ce qui en fait un signal à connaître.
À retenir
- llms.txt est un fichier markdown placé à la racine du domaine (exemple.com/llms.txt), pensé pour être lu par un modèle de langage plutôt que par un navigateur.
- Il liste, en langage clair, ce qu'est le site, ce qu'il propose et les pages ou ressources les plus importantes à consulter.
- Ce n'est pas un standard officiel imposé par les moteurs IA : aucun grand fournisseur (OpenAI, Google, Anthropic, Perplexity) ne confirme aujourd'hui l'exploiter de façon systématique pour le crawl.
- Google l'intègre néanmoins comme un des critères de sa catégorie Lighthouse expérimentale « agentic browsing », ce qui en fait un signal de préparation à surveiller plutôt qu'un levier de classement garanti.
Qu’est-ce que le fichier llms.txt ?
llms.txt est un fichier texte au format Markdown, déposé à la racine d'un site (à l'adresse /llms.txt), qui résume le contenu du site en langage naturel structuré. L'idée est proche de celle d'un sitemap.xml, mais orientée sens plutôt qu'exhaustivité technique : au lieu de lister toutes les URLs, il met en avant les pages qui comptent vraiment et explique en une phrase ce que chacune contient.
Certains sites publient également un llms-full.txt, une version plus complète qui inclut le contenu texte intégral des pages clés plutôt que de simples liens, pensée pour être injectée directement dans le contexte d'un modèle.
Comment construire un fichier llms.txt
La convention proposée par le format suit une structure Markdown simple, volontairement minimaliste :
- Un titre H1 avec le nom du site ou du produit.
- Une citation en blockquote (`>`) qui résume en une ou deux phrases ce qu'est le site et à qui il s'adresse.
- Des paragraphes courts qui apportent le contexte nécessaire pour comprendre l'activité, sans jargon marketing.
- Des sections en H2 (par exemple `## Documentation`, `## Guides`, `## Optional`) contenant des listes de liens Markdown, chacun accompagné d'une courte description entre parenthèses.
llms.txt, sitemap.xml et robots.txt : trois rôles différents
Ces trois fichiers cohabitent à la racine d'un domaine mais répondent à des questions différentes. robots.txt indique ce qu'un robot a le droit de parcourir. sitemap.xml liste exhaustivement les URLs à indexer, pour un moteur de recherche classique. llms.txt, lui, ne remplace ni l'un ni l'autre : il ne gère aucune permission et ne prétend pas à l'exhaustivité. Son rôle est de faire gagner du temps à un modèle en le pointant directement vers les ressources les plus représentatives du site, avec le contexte nécessaire pour les interpréter correctement.
Concrètement, un site peut très bien conserver son sitemap.xml classique pour le SEO traditionnel tout en ajoutant un llms.txt pensé spécifiquement pour la couche IA.
Quel impact réel sur le référencement IA
Il faut être honnête sur l'état actuel des choses : à ce jour, aucun des grands moteurs de réponse (ChatGPT, Gemini, Perplexity, Claude) n'a confirmé publiquement exploiter systématiquement le llms.txt pour son crawl ou son grounding. Ce n'est donc pas un raccourci garanti vers plus de citations.
Ce qui change la donne, c'est que Google a commencé à vérifier la présence de ce fichier dans sa catégorie Lighthouse expérimentale dédiée à l'agentic browsing, aux côtés d'audits sur WebMCP et l'accessibilité machine. Le llms.txt devient ainsi un signal de préparation technique plutôt qu'un levier de classement direct : peu coûteux à mettre en place, il oblige surtout à formuler clairement ce qu'est le site et ce qui compte dedans, un exercice qui profite aussi à la structuration générale du contenu pour le grounding.
À lire ensuite
llms.txt
La définition courte du terme et son lien avec la préparation technique d’un site pour les IA.
Agentic browsing : ce que Google recommande pour les agents IA
Le llms.txt fait partie des audits Lighthouse dédiés à la préparation d'un site pour les agents IA.
Comment les moteurs IA sélectionnent et citent leurs sources
Le mécanisme de grounding, pour comprendre ce qui rend une page réellement citable.
Méthodologie
Comprendre comment AIglebot observe la présence d'une marque dans les réponses des moteurs IA suivis.
Generative Engine Optimization
Relier la préparation technique du site au pilotage GEO plus large de la visibilité de marque.
Questions fréquentes
Faut-il vraiment créer un llms.txt pour son site ?
Ce n'est pas indispensable, mais c'est peu coûteux à mettre en place et cela oblige à clarifier ce que propose le site. C'est aussi désormais un des critères vérifiés par Google dans ses audits d'agentic browsing, ce qui en fait un signal de préparation utile à moyen terme.
Est-ce que ChatGPT, Perplexity ou Gemini lisent ce fichier ?
Aucun de ces moteurs ne confirme aujourd'hui exploiter systématiquement le llms.txt pour son crawl ou ses réponses. Le format reste une convention communautaire, adoptée volontairement par certains outils et agents, sans garantie d'usage universel.
Quelle différence avec le sitemap.xml ?
Le sitemap.xml liste exhaustivement les URLs d'un site pour l'indexation par un moteur de recherche classique. Le llms.txt sélectionne les pages les plus représentatives et les décrit en langage naturel, pour aider un modèle à comprendre rapidement le site plutôt qu'à en indexer chaque URL.
Le llms.txt améliore-t-il directement le classement dans les réponses IA ?
Rien ne le prouve à ce jour. Son intérêt est surtout indirect : il pousse à formuler clairement l'offre du site et à hiérarchiser ses pages clés, ce qui profite à la structuration générale du contenu utile au grounding.
AIglebot aide les entreprises à suivre leur visibilité, leur réputation et leur recommandation dans ChatGPT, Gemini, Perplexity et Claude.