│ robots.txt │ ✅ 允许 /,屏蔽应用路由,指向 sitemap │ ├─────────────────────┼───────────────────────────────────────────────────────────┤ │ sitemap.xml │ ✅ 列出落地页 │ ├─────────────────────┼───────────────────────────────────────────────────────────┤ │ auth 子域名 noindex │ ✅ x-robots-tag: noindex, nofollow 已生效 这几个概念是什么意思文章目录概念介绍这三个概念都与 SEO搜索引擎优化 和 网站爬虫控制 相关。下面逐一通俗解释1️⃣ robots.txt2️⃣ sitemap.xml3️⃣ auth 子域名 noindex 三者协作关系概念介绍这三个概念都与 SEO搜索引擎优化 和 网站爬虫控制 相关。下面逐一通俗解释1️⃣ robots.txt是什么放在网站根目录如example.com/robots.txt下的一个纯文本文件相当于给搜索引擎爬虫如 Googlebot、百度蜘蛛的门禁指令。表格中描述的含义描述含义允许 /允许爬虫访问网站首页根路径屏蔽应用路由禁止爬虫访问一些内部路径比如/admin、/api、/dashboard等后台或功能性页面指向 sitemap文件中写了类似Sitemap: https://example.com/sitemap.xml的一行告诉爬虫完整地图在这里通俗比喻就像在小区门口立了个牌子——“访客可以进大门/但别去物业办公室/admin想看完整楼栋分布图请看这边sitemap”。2️⃣ sitemap.xml是什么一个 XML 格式的站点地图文件列出了你希望被搜索引擎收录的所有页面 URL。表格中描述的含义描述含义列出落地页sitemap 里包含了所有落地页Landing Page的链接。落地页就是用户从搜索引擎/广告点进来后看到的页面通俗比喻相当于给搜索引擎一份我希望你收录的页面清单确保重要页面不被遗漏。3️⃣ auth 子域名 noindex是什么网站的登录/注册功能通常放在一个子域名下如auth.example.com。“noindex” 是告诉搜索引擎不要收录这个子域名。表格中描述的含义描述含义x-robots-tag这是一种通过HTTP 响应头而不是 HTML meta 标签来控制爬虫的方式noindex告诉搜索引擎不要把登录页、注册页放进搜索结果nofollow告诉搜索引擎不要跟踪这个页面上的链接不传递权重已生效表示这个配置已经正确部署并在工作通俗比喻登录页面是给用户用的不是给搜索用户看的。你肯定不希望搜XX平台时出现一个登录框页面所以把这类页面隐藏起来。 三者协作关系搜索引擎爬虫来到网站 │ ▼ 先看 robots.txt ──→ 知道哪些能爬、哪些不能爬 │ 以及 sitemap 在哪里 ▼ 再看 sitemap.xml ──→ 知道有哪些重要页面需要收录 │ ▼ 爬取各页面 ──→ 遇到 auth 子域名 │ ▼ 读到 x-robots-tag: noindex │ ▼ 跳过不收录登录/注册页面 ✅简单说这是一套完整的网站爬虫控制策略开放该开放的索引该索引的隐藏该隐藏的。