Qu'est-ce qu'un fichier llms.txt ?
llms.txt est une convention proposée en 2024 (llmstxt.org) : un fichier Markdown à la racine d'un site, qui dit en quelques lignes qui vous êtes et quelles pages comptent, pour les assistants IA et les agents qui lisent le web. Un titre, une description entre chevrons, puis des sections de liens commentés.
Convention émergente, adoption non garantie : aucun grand assistant IA n'a annoncé lire llms.txt systématiquement, et son effet sur vos citations n'est pas mesurable aujourd'hui. Il coûte dix minutes, ne peut pas nuire, et documente proprement votre site ; c'est à ce titre que nous le recommandons, pas comme une formule magique.
Comment le brouillon est construit (v1, septembre 2026)
Chaque étape est déterministe et lit uniquement ce que vos pages publient déjà :
- Lecture de robots.txt : emplacement de votre sitemap, et respect des interdictions faites à notre robot (SEOForge-GEO-Test).
- Lecture du sitemap (200 URL au maximum ; pour un index, les 2 premiers sitemaps enfants). Sans sitemap : les liens de la page d'accueil (20 au maximum).
- Sélection de 10 pages au maximum par la forme de leur URL : même site, pages HTML, pas de paramètres, pas de pagination ni d'utilitaires (panier, connexion, mentions légales), les plus proches de la racine d'abord.
- Une requête par page pour lire sa balise <title> et sa meta description. Le corps des pages n'est ni analysé ni conservé.
- Assemblage au format llmstxt.org : « # Nom du site » (og:site_name ou <title> de l'accueil), « > description » (meta description de l'accueil, si elle existe), une section « ## » par premier segment d'URL. Budget total : 20 secondes.
Ce que le générateur ne fait jamais
- Inventer une description : une page sans meta description est listée avec son titre seul.
- Résumer ou reformuler vos pages : titres et descriptions sont copiés tels quels.
- Passer outre votre robots.txt ou lire des pages non publiques.
- Conserver le contenu de vos pages : seuls l'adresse testée, la date et des compteurs sont enregistrés.
Limites
- La sélection par forme d'URL est un pari raisonnable, pas une lecture de votre stratégie : les pages qui comptent pour vous ne sont pas forcément les plus courtes.
- Un site rendu uniquement en JavaScript peut n'exposer ni titre ni description dans son HTML : le brouillon sera pauvre, et c'est un signal en soi (voir le test GEO).
- Le fichier n'est pas publié pour vous : vous le déposez à la racine de votre site.
- Le format llms-full.txt (contenu complet) n'est pas généré : il demande une rédaction, pas une extraction.
Ce brouillon vs un llms.txt stratégique
Le générateur extrait ; l'Audit GEO décide. La différence tient en trois mots : curation, priorités, désambiguïsation.
| Brouillon généré | Audit GEO - 490 € HT | |
|---|---|---|
| Pages listées | Jusqu'à 10 pages choisies par la forme de leur URL | Les pages qui portent votre offre, choisies avec vous, dans l'ordre où un assistant doit les lire |
| Descriptions | Meta descriptions existantes, copiées | Une ligne réponse-d'abord par page, écrite pour être citée |
| Identité | Nom du site tel que publié | Phrase de désambiguïsation (homonymes, secteur, zone), cohérente avec vos données structurées |
| Cohérence | Fichier isolé | llms.txt, robots.txt, schéma Organization et pages alignés ; llms-full.txt si pertinent |
| Suivi | Instantané au moment de la génération | Fichier généré depuis vos routes ou vos contenus, mis à jour avec le site |
Questions fréquentes
Les assistants IA lisent-ils vraiment llms.txt ?
Pas de façon garantie. llms.txt est une convention proposée en 2024 par Jeremy Howard (llmstxt.org), adoptée par des outils et des documentations, mais aucun grand assistant (ChatGPT, Claude, Perplexity, Gemini) n'a annoncé le lire systématiquement. Il ne remplace ni robots.txt ni le sitemap. Nous le recommandons parce qu'il coûte peu, ne peut pas nuire et documente votre site ; pas parce qu'il garantit des citations.
D'où viennent les descriptions du brouillon ?
Uniquement de vos pages : la balise <title> et la meta description de chacune, copiées telles quelles. Une page sans meta description est listée avec son titre seul. Le générateur ne résume pas, ne reformule pas, n'invente rien.
Pourquoi certaines de mes pages n'apparaissent-elles pas ?
Le brouillon liste au plus dix pages en plus de l'accueil, choisies par la forme de leur URL (les plus proches de la racine d'abord), après exclusion des documents, de la pagination et des pages utilitaires. Les pages interdites à notre robot par votre robots.txt sont respectées. Ajoutez celles qui manquent à la main : c'est justement ce qu'un brouillon attend.
Où et comment publier le fichier ?
À la racine de votre site, à l'adresse /llms.txt, servi en texte brut (Content-Type text/plain, UTF-8), accessible sans redirection et sans blocage dans robots.txt. Sur WordPress, un fichier déposé à la racine ou un plugin de fichiers statiques suffit ; sur un site sur mesure, une route dédiée permet de le générer depuis vos pages et de ne jamais le laisser vieillir.
Que faut-il ajouter au brouillon pour qu'il soit vraiment utile ?
Trois choses que l'extraction ne peut pas deviner : une phrase de désambiguïsation après le titre (qui vous êtes, ce que vous n'êtes pas, votre zone), un ordre de priorité qui reflète votre offre plutôt que votre arborescence, et des descriptions écrites pour répondre à une question plutôt que pour Google. Retirez aussi ce qui n'aide pas un lecteur pressé.
Que conservez-vous d'une génération ?
L'URL saisie et l'URL finale, la date, le nombre de pages trouvées, listées et décrites, la source utilisée (sitemap ou liens), les avertissements, la durée et, pendant 30 jours, une empreinte tronquée et irréversible de votre adresse IP pour détecter les abus. Ni le fichier généré ni le contenu de vos pages ne sont conservés ; le brouillon est reconstruit à la demande pendant une heure (cache). Ces données sont supprimées après 24 mois. Si vous demandez le fichier par e-mail, la génération est rattachée à votre demande.
Un llms.txt ne sert à rien si les crawlers IA ne peuvent pas lire votre site : vérifiez-le avec le test GEO.