llms.txt, le nouveau robots.txt pour l'ère IA
Le fichier llms.txt est une proposition émergente (llmstxt.org) qui donne aux LLMs un plan structuré de votre site, en Markdown lisible. Analogue à robots.txt pour les crawlers historiques, mais orienté content discovery.
Les LLMs ne parsent pas votre HTML comme Googlebot. Ils lisent souvent la version markdown/texte d'une page (fournie par Firecrawl, Jina Reader, ou leur propre bot). Un llms.txt bien fait sert 3 objectifs ·
- Prioriser · indiquer les 10 pages les plus importantes (à la racine du fichier).
- Contextualiser · décrire en 2 phrases ce qu'est votre marque, sans marketing.
- Économiser le crawl · les LLMs qui suivent la spec ingèrent moins de pages inutiles.
Un exemple minimaliste pour une marque SaaS ·
# Notion
> Workspace collaboratif pour équipes, docs, wiki, tâches, projets.
## Products
- [Notion Docs](https://notion.so/product/docs): éditeur collaboratif temps réel
- [Notion AI](https://notion.so/product/ai): assistant IA intégré
- [Notion Sites](https://notion.so/product/sites): sites web depuis Notion
## Pricing
- [Plans](https://notion.so/pricing): Free, Plus, Business, Enterprise
## Support
- [FAQ](https://notion.so/faq): questions fréquentes
- [Support technique](https://notion.so/help): documentation complète
- [API](https://developers.notion.com): développeursÀ la racine de votre domaine · https://votre-marque.com/llms.txt. Servi en text/plain ou text/markdown.
Certaines marques déploient aussi un llms-full.txt qui contient le contenu complet de la doc / des articles principaux, formatés en markdown. Attention · peut faire plusieurs Mo · à réserver aux sites dont la doc technique est un asset stratégique (Stripe, Anthropic, Supabase le font).
En 2026, pas d'outil officiel de vérification. GEO Radar (dans son audit AI Crawlability) détecte automatiquement la présence de llms.txt + parse la structure + vérifie les URLs listées. Vous pouvez aussi ·
curl https://votre-marque.com/llms.txt· vérifier la réponse HTTP 200 + le content-type.- Poser à Perplexity ou ChatGPT · "Pouvez-vous résumer le contenu de
votre-marque.com/llms.txt?" - Vérifier vos logs serveurs pour identifier les User-Agents qui hit le fichier (GPTBot, PerplexityBot, ClaudeBot).
- Overload marketing · ne pas écrire votre llms.txt comme une brochure. Les LLMs préfèrent des descriptions factuelles courtes.
- Liens 404 · chaque URL doit être valide. Un lien mort dilue votre crédibilité perçue.
- Cross-domain · ne référencer que des URLs de votre propre domaine (le fichier ne remplace pas un sitemap externe).
- Oublier /robots.txt · llms.txt ne remplace pas robots.txt. Il faut les deux, avec les bons User-Agents explicités.
Lancez un audit gratuit pour savoir si votre llms.txt est correctement configuré (et détecter les 4 autres critères d'AI Crawlability · bots bloqués, sitemap, robots.txt, JS rendering).