「你能不能爬我?」
声明各个抓取工具是否被允许访问。搜索类抓取与训练类抓取可以分别授权。
技术说明
本页说明本站的技术结构:全部品牌事实来自一份结构化数据源,同时以网页、结构化标记与 Markdown 三种形态发布,并通过站点地图、链接关系与爬虫协议告诉外部工具去哪里取、能不能取。
过去网站只需要面向两类读者:人和搜索引擎。现在多了第三类 —— 代表用户去取信息的 AI Agent。 它不浏览页面,它抓取、解析、然后向用户复述。复述得对不对,取决于它读到了什么。
本站的做法是:不为这三类读者各写一份内容,而是写一份数据,发布三种形态。
全站 15 个产品、9 家门店的事实只存在于结构化数据文件中。 页面组件里没有任何一个写死的价格、热量或地址 —— 这一条由构建时的检查脚本强制,发现即构建失败。
| 出口 | 读者 | 形态 |
|---|---|---|
| HTML 页面 | 人 | 带排版与导航的网页,事实文本全部在初始 HTML 中,不依赖脚本渲染 |
| JSON-LD | 搜索引擎与解析程序 | 嵌在页面里的 schema.org 实体,带类型、字段与实体间引用 |
| Markdown | AI Agent | 同一页面的纯文本版本,没有导航、样式与脚本,只有事实 |
这四个东西经常被混为一谈,但它们解决的不是同一件事。
「你能不能爬我?」
声明各个抓取工具是否被允许访问。搜索类抓取与训练类抓取可以分别授权。
「我有哪些页面?」
列出全部可索引页面。已过销售或活动截止日期的内容自动移出。
「这一页里的实体和字段分别是什么?」
嵌在每个页面里,把产品、门店、活动描述成带类型与字段的实体,而不是一段自然语言。
「如果你是 Agent,应该怎样理解和使用我的网站?」
一份小体量的站点说明,先告诉 Agent 本站是什么、哪些是权威事实源、哪些是宣传内容,再让它按需取详细内容。
光把文件放在服务器上不够 —— Agent 得知道它存在。本站用三种方式主动声明。
最基础的约定:站点根目录下的 /llms.txt。 当前这份共 69 行,由构建脚本从数据源生成,不允许手写维护。
本站每个页面的 <head> 里都有这一行, 用标准链接关系告诉 Agent「描述本站如何使用的文档在这里」,而不是等它去试固定路径:
全站统一输出
<link rel="describedby" href="/llms.txt">Agent 抓到网页后,不必解析整页 HTML 去找一个热量数字 —— 页面会告诉它同一份内容的纯文本版本在哪:
/products/shanghai-osmanthus-shake 的 head 中
<link rel="alternate" type="text/markdown"
href="/products/shanghai-osmanthus-shake.md">于是 Agent 的路径变成:抓 HTML → 发现 Markdown 版本 → 直接读干净事实。 全站 24 个事实页面都有对应的 Markdown 版本,同样由构建脚本生成。
能不能抓,由 robots.txt 决定,这是各家 AI 抓取工具真正遵守的机制。 关键在于:检索类抓取与训练类抓取是两件事,可以分别授权,不必一刀切。
| 抓取工具 | 用途 | 本站策略 | 说明 |
|---|---|---|---|
| * | 通用抓取 | 允许 | 默认放行,具体 AI 抓取工具的策略见下方逐条配置。 |
| OAI-SearchBot | ChatGPT Search 检索抓取 | 允许 | 放行后本站内容可出现在 ChatGPT Search 的结果与引用中。 |
| ClaudeBot | Claude 检索抓取 | 允许 | Anthropic 的抓取工具遵循 robots.txt。 |
| Google-Extended | Google 生成式 AI 功能抓取 | 允许 | 控制内容是否用于 Google 的生成式 AI 功能,与普通搜索收录相互独立。 |
| GPTBot | 模型训练抓取 | 不允许 | 演示站默认不放行训练类抓取。是否开放属于品牌版权决策,改此处一行即可切换。 |
这张表和实际生效的 /robots.txt 来自同一份配置文件,不会出现「文档写允许、线上是禁止」的情况。
这套做法有明确的能力边界。把它当成「AI 时代的 SEO 秘籍」会得出错误预期。
它不像 robots.txt 与站点地图那样已经进入成熟的互联网标准体系。目前处在生态快速形成阶段,规范本身仍在演进,不同工具的支持程度不一致。
Google 已在官方文档中说明,包括其生成式 AI 搜索功能在内,Google 搜索不使用 llms.txt,提供这个文件既不会提升也不会降低在 Google 搜索中的可见性与排名。
不存在类似搜索引擎站长平台那样的「提交 llms.txt」流程。当前机制是基于发现而不是基于登记 —— 靠抓取工具自己发现,不靠人工提交。
公开可访问的地址、不在 robots.txt 中屏蔽检索类抓取工具、页面可被正常抓取、内容表述清晰、站内链接完整、结构化数据规范 —— 这些才是决定性因素。llms.txt 与 Markdown 版本是增强层,不是收录开关。
以上每一项在本站都是真实生效的,可以直接打开查看。
Agent 入口索引
页面清单,过期内容已排除
逐个抓取工具的授权
单个产品的 Markdown 版本
全部在售产品的事实表
想看同一个页面在人与 AI 眼中的并排对照,去 AI 视角审计。
本站为改版提案演示站,全部产品、价格、营养、门店与新闻数据均为演示用虚拟数据,不代表真实经营信息。