llms.txt完整指南:让你的网站对AI搜索引擎可读
读完这篇,你会知道什么
llms.txt是网站根目录的Markdown文件,为AI搜索引擎提供网站的结构化摘要。包含:开篇事实描述、核心功能列表、带描述的核心页面、重要文章和公司联系信息。拥有llms.txt的网站被AI引擎引用的准确性提升高达3倍。保持800词以内,使用具体事实(非营销套话),并验证所有URL有效。
核心要点
- 1llms.txt放置在yourdomain.com/llms.txt — 纯Markdown格式
- 2AI爬虫在访问新域名的前3个请求内读取llms.txt
- 3使用具体、事实性语言——AI无法引用营销套话
- 4明确列出前5-10篇文章——它们成为AI的引用来源
AI引擎理解你网站的方式存在根本性问题
当ChatGPT或Perplexity第一次访问你的网站时,它需要弄清楚你的网站是关于什么的。它阅读你的主页,也许还有几个其他页面,扫描你的title标签和meta描述,然后尝试构建你网站做什么的模型。
问题在于:这种推断是嘈杂且不精确的。如果你的主页以"用AI驱动的解决方案转型你的业务"这样的营销标题开头,AI几乎得不到任何可引用的信息。它可能误判你的主要受众、核心能力或公司历史。结果是AI对你公司的描述模糊、过时或干脆是错误的。
llms.txt直接解决了这个问题。
放置在域名根目录(yourdomain.com/llms.txt),这是一个纯Markdown文件,为AI语言模型提供关于你网站的结构化、简洁简报——你是谁、你做什么、你服务谁、以及你最重要的内容在哪里。把它看作AI阅读你的营销手册与阅读你的执行摘要之间的区别。
拥有精心制作的llms.txt的网站被AI引擎引用的准确性提升高达3倍。AI爬虫通常在访问任何新域名的前3个请求内读取它。
llms.txt的起源和快速采用
llms.txt惯例由Answer.AI在2024年底提出,作为帮助AI语言模型浏览网站的非正式标准。它有意模仿robots.txt和sitemap.xml的设计理念——任何爬虫都可以读取的域名根目录上的简单纯文本文件。
到2026年初,llms.txt被以下AI积极读取:ChatGPT浏览模式、Perplexity、Claude、Gemini、通义千问和其他中国AI平台。
虽然尚未成为正式标准,但其采用模式与1994年的robots.txt如出一辙——非正式共识迅速成为AI可见网站的事实要求。
高效llms.txt的5个必要章节
第1节:开篇摘要——最重要的段落
第一段是你对AI的推介。它必须用2-3句话回答三个问题:
- 这个网站/产品是什么?
- 它具体解决什么问题?
- 它是为谁设计的?
不要这样写:
我们是创新数字解决方案的领先提供商,为企业赋能转型。
这对AI毫无用处——不包含任何可引用的事实。什么行业?什么"解决方案"?"转型"具体指什么?
要这样写:
AnswerX是一个免费的双语(英/中)SEO和GEO诊断平台。它分析任何网站URL并生成评分报告,涵盖Google搜索优化、AI引擎可见性(GEO)、结构化数据完整性和核心网页指标。它服务于需要提升在传统搜索引擎和AI搜索引擎中可见性的网站所有者、SEO专业人员和营销人员。
第二个版本包含AI可以在答案中准确复现的具体、可引用的事实。
第2节:核心功能——结构化能力列表
将4-8个核心能力列为要点列表。每个条目应该是完整的、独立的事实,无需上下文即可理解。
第3节:核心页面——带注释的链接
不要只列URL——为每个页面添加简短的功能性描述。AI引擎用这些描述将特定用户查询路由到最相关的内容。
第4节:重要文章——你的引用来源
列出你5-10篇最全面、最权威的文章。这些成为AI引擎在回答你领域问题时引用的具体页面。
第5节:公司信息+联系方式
完整的法定公司名称、简短的事实性描述和直接联系邮箱。这确立了内容背后的实体,为AI提供具体的归因对象。
常见llms.txt错误及修复方法
| 错误 | 危害 | 修复方法 |
|---|---|---|
| 营销套话("世界级"、"创新性") | AI无法引用非事实 | 替换为具体可验证的陈述 |
| URL失效或过期 | AI引用错误或死链页面 | 每月审查所有列出的URL |
| 缺少重要文章章节 | AI错过你的最佳内容 | 明确列出前5-10篇文章 |
| 文件太长(2000字+) | AI可能读不到末尾 | 保持在400-800词 |
| 主要更新后未更新 | AI描述你的旧产品 | 每3个月或重大变更后审查 |
| 与网站实际内容不一致 | AI产生混乱 | llms.txt必须与页面实际内容匹配 |
llms.txt vs. robots.txt vs. sitemap.xml
| 文件 | 用途 | 主要受众 | 格式 |
|---|---|---|---|
| robots.txt | 控制爬虫访问 | 所有网络爬虫 | 纯文本规则 |
| sitemap.xml | 列出页面供发现 | 传统搜索引擎 | XML |
| llms.txt | 解释网站含义+内容 | AI语言模型 | Markdown |
你需要三者都有才能获得完整的SEO+GEO覆盖。它们服务于不同功能,互不重叠。
验证和维护你的llms.txt
创建llms.txt后:
- 验证它在
yourdomain.com/llms.txt可访问——返回HTTP 200 - 检查它以
text/plain或text/markdown内容类型提供 - 运行AnswerX免费诊断——我们检查llms.txt的存在、格式和质量信号
- 手动测试:在添加llms.txt前后询问ChatGPT或Perplexity描述你的网站,衡量准确性提升
维护计划:每3个月审查一次,或在推出重大新功能、产品方向调整或大幅改变主要受众后立即审查。