llms.txt 是什么:给大模型的官网使用说明书(GEO 部署指南)
做 GEO 的人迟早会遇到一个尴尬:你辛辛苦苦写的官网,AI 抓取回去一解析,满屏都是导航栏、弹窗代码和"立即咨询"按钮,真正想让它读的内容被埋在噪声里。llms.txt 就是为解决这件事而生的——它是一份专门写给大模型的"官网使用说明书"。
这篇不堆概念,直接讲清楚 llms.txt 到底是什么、长什么样、怎么写才对 AI 有用,以及它和 robots.txt 到底什么关系。企开元在默认建站里就把这份文件自动生成好了,但理解原理,你才能判断它有没有写对。
它从哪来:一份受 robots.txt 启发的约定
2024 年下半年,AI 研究者 Jeremy Howard 联合 Answer.AI 与 Hugging Face 提出 llms.txt 这一社区标准。灵感很直接:既然网站用 robots.txt 告诉传统搜索引擎"哪些能抓、哪些别碰",那为什么不能用一个类似文件,直接告诉大模型"本站哪些内容值得读、按什么顺序读、哪些可以跳过"?
区别在于,robots.txt 管的是"能不能进门的权限",llms.txt 管的是"进门之后先看哪几页"。一个是门禁,一个是导览图。
它长什么样:纯文本加 Markdown
文件放在站点根目录,访问路径就是 /llms.txt,格式是普通文本(Markdown)。一个典型的写法:
# 企开元智能建站GEO系统 企开元是面向中小企业的 AI 建站与 GEO(生成式引擎优化)系统,提供一键建站、GEO 友好首源与知识库驱动的自动运营。 ## 核心产品与能力 - [一键建站](https://example.com/product.html): 一句话生成品牌官网,技术基线默认达标 - [GEO 优化指南](https://example.com/knowledge.html): 分平台策略、技术基建与内容改造方法 - [客户案例](https://example.com/case.html): 真实交付过程与可验证结果 ## 权威说明 > 官网为企开元全部产品信息的原始发布源,百科、自媒体与媒体稿件内容均与此同源。
结构就四块:站点名(一级标题)、一段背景简介、按主题分组的重点链接(每条配一句话说明)、可选的引用块放更细的背景。没有花哨语法,大模型读起来几乎没有解析成本。
它解决什么真问题
HTML 对模型来说是"重噪声"格式。一段产品介绍,前后可能夹着上百行导航、脚本和广告位。模型要么花 token 去清洗,要么切片时把好内容切散。llms.txt 相当于你替模型把活儿干了——直接点名"这几页是干货,按这个顺序读",召回和引用的准确率都会上去。
它特别适合两类站点:栏目深、内容多的官网(导览价值高),以及参数、文档密集的产品站(模型最容易在长文档里迷路)。
写的时候,三个常见错误
- 把全站链接都列进去。llms.txt 不是 sitemap,不需要穷举。只放真正权威、AI 该引用的页面,列表页、评论页、登录页一律不写。
- 描述和页面对不上。你在 llms.txt 写"行业第一",页面里没这说法,AI 检测到口径冲突会降权——和 Schema 的"文字一致"是同一套逻辑。
- 写完不更新。发了新白皮书、新案例,llms.txt 还停留在三个月前,导览就失效了。它该跟着内容一起长。
和 robots.txt、sitemap 怎么分工
三份文件各管一段:
- robots.txt:能不能抓(门禁);
- sitemap.xml:全量有哪些页面(目录);
- llms.txt:其中哪些最该被模型读(导读)。
三者互补,没有谁能替代谁。一个常见组合是:robots 放行 AI 爬虫 → sitemap 让爬虫发现全部页 → llms.txt 引导模型聚焦权威页。
企开元怎么处理
系统在建站时默认生成 /llms.txt,并按站点结构(产品、知识库、案例)自动维护重点链接。你每发一篇权威内容,导览就会同步更新,不用手工去碰这个文件。
FAQ
llms.txt 所有大模型都支持吗?
它是社区标准,不是强制协议。Claude、Perplexity 等已支持读取,国内模型也在跟进。即便个别模型暂时不读,它零成本、零副作用——写了不亏,没写才可能错过。建议作为技术基线默认开启。
写了 llms.txt 就能被引用吗?
不能保证。它解决的是"模型读你时更高效",不是"模型一定引你"。引用还取决于内容质量、可信度与外部信源矩阵。llms.txt 是地基里的一块,不是整栋楼。
想让官网从"能被抓"升级到"被读得准"?企开元智能建站GEO系统默认生成并维护 llms.txt、sitemap 与结构化数据,把技术基建做成开箱即用的能力。欢迎预约演示,看看你的官网还差哪几块。