SEO

搜索引擎爬虫访问说明书

Created: 02/02/2026

robots.txt 是搜索引擎抓取你网站时最先读取的文件,本质上是一份给爬虫看的访问说明书。这篇文章系统梳理了 robots.txt 的实际作用、标准写法、常见使用场景,以及它和 sitemap.xml 在SEO体系中的分工区别。核心结论很明确:robots.txt 决定“哪些地方不能乱逛”,sitemap 决定“重点应该看哪里”。两者不是替代关系,而是必须配合使用,才能真正提升抓取效率。

robots.txt 的角色非常明确:

它不是给用户看的,是给搜索引擎爬虫看的。

当任何搜索引擎爬虫访问你的网站时,第一步通常是:

  1. 请求 https://example.com/robots.txt
  2. 读取规则
  3. 决定哪些路径可以抓,哪些不该碰

你可以把它理解为: 网站对外的“爬虫访问规则说明书”。


一、一个最基础、但完整的 robots.txt 示例

下面是一个非常常见、也非常安全的写法:

User-agent: *
Disallow: /admin/
Allow: /
Sitemap: https://example.com/sitemap.xml

我们逐行拆开来看。


1. User-agent: *

User-agent: *

含义很简单:

  • * 代表 所有搜索引擎爬虫
  • 这套规则对 Google、Bing、Yandex 等都生效

如果你没有特殊需求,99% 的网站都用这个就够了


2. Disallow: /admin/

Disallow: /admin/

这行表示:

  • 禁止爬虫抓取 /admin/ 目录

  • 常用于:

    • 后台管理页面
    • 内部系统
    • 不希望出现在搜索结果里的路径

注意一个常见误区:

  • Disallow ≠ 页面一定不会被索引
  • 它只是告诉爬虫:别来抓

3. Allow: /

Allow: /

表示:

  • 除了被明确禁止的路径
  • 网站其他页面都是允许访问的

这行在规则清晰度上很重要,尤其是当你 Disallow 了一些子目录时。


4. Sitemap 行

Sitemap: https://example.com/sitemap.xml

这一行的作用是:

  • 明确告诉搜索引擎: 你的网站地图在这里

好处是:

  • 爬虫不需要再自己猜
  • 提高 Sitemap 被发现和读取的概率

二、robots.txt 的核心作用,不只是“屏蔽页面”

很多人对 robots.txt 的理解停留在:

“用来不让搜索引擎抓后台。”

这只是最表层的用法。


1. 控制爬虫访问范围

robots.txt 的首要价值是:

  • 明确告诉爬虫:

    • 哪些地方是内容
    • 哪些地方是系统结构

常见不该被抓的路径包括:

  • /admin
  • /login
  • /cart
  • /checkout
  • /api
  • /test

这些页面即使被抓取,对SEO也没有任何正向价值


2. 提升整体 SEO 效率

这是很多人忽略的关键点。

搜索引擎的抓取预算是有限的。

如果你的站点:

  • 被大量参数页
  • 功能页
  • 重复路径

消耗了抓取次数,那么结果就是:

  • 真正重要的内容页
  • 抓取频率反而下降

通过 robots.txt,你是在帮搜索引擎做一件事:

把有限的精力,用在真正值得抓的页面上。


3. 基础的隐私与安全保护

robots.txt 不是安全方案,但它是第一道提醒

它可以:

  • 明确标注哪些路径是敏感的
  • 避免被“正常爬虫”无意义访问

注意一点现实情况:

  • robots.txt 挡不住恶意攻击
  • 但可以避免被公开暴露和误抓

4. 提供 Sitemap 的统一入口

虽然 Sitemap 也可以在站长平台提交,但:

  • 在 robots.txt 里声明
  • 是最通用、最标准的做法

无论搜索引擎来自哪里, 只要读了 robots.txt,就能立刻知道 Sitemap 在哪。


三、robots.txt 和 sitemap 的本质区别

这是一个非常经典、也非常容易混淆的问题。

我一般用一个非常直观的比喻来解释。


robots.txt 在干什么

它是门卫。

  • 决定谁能进
  • 决定哪些区域不开放
  • 控制访问范围

关键词是:控制


sitemap.xml 在干什么

它是导游。

  • 告诉搜索引擎:

    • 哪些页面最重要
    • 最近有没有更新
    • 应该优先看哪些内容

关键词是:引导


一句话总结区别

  • robots.txt: “这些地方你别去”
  • sitemap.xml: “重点内容在这里”

四、为什么两者必须配合使用

只用其中一个,效果都会打折。

  • 只有 sitemap,没有 robots:

    • 爬虫可能被大量无价值页面分流
  • 只有 robots,没有 sitemap:

    • 爬虫不知道哪些页面是重点

在实际SEO中,最理想的状态是:

  • robots.txt:

    • 清理路径
    • 限制噪音
  • sitemap.xml:

    • 聚焦重点
    • 提升效率

结论

  • robots.txt 是搜索引擎访问你网站的第一站

  • 它负责控制范围,而不是提升排名

  • 真正的价值在于:

    • 节省抓取预算
    • 减少无意义抓取
    • 提升整体SEO效率

而 sitemap.xml 负责告诉搜索引擎:

“在允许进入的前提下,哪些页面最值得被认真对待。”

把这两个基础文件做好, 不是高级技巧,而是每一个网站都该完成的SEO底层工程