什么是 Robots.txt?

Robots.txt 是放置在网站根目录下的纯文本文件,用于告诉搜索引擎爬虫(Spider/Bot)哪些页面可以访问,哪些页面不应该访问。这是网站与搜索引擎之间沟通的第一道门户,也是SEO优化中非常重要的技术环节。

对于希望在必应(Bing)、谷歌(Google)等搜索引擎获得良好排名的网站来说,正确配置 Robots.txt 至关重要。它不仅能帮助搜索引擎更高效地抓取网站内容,还能保护敏感页面不被索引。

纸飞机官网 Robots.txt 原文

# 纸飞机官网 Robots.txt
# 最后更新:

# ----------------------------------------
# 用户代理设置
# ----------------------------------------

User-agent: *
Allow: /

# 允许所有主流搜索引擎爬虫访问

User-agent: Bingbot
Allow: /

# 明确允许必应爬虫访问全部内容

User-agent: Googlebot
Allow: /

# 明确允许谷歌爬虫访问全部内容

User-agent: Baiduspider
Allow: /

# 允许百度爬虫访问

# ----------------------------------------
# 站点地图位置
# ----------------------------------------

Sitemap: https://zhifeiji-aa.com.cn/sitemap.xml

# 告知搜索引擎站点地图的位置

# ----------------------------------------
# 访问限制(暂无)
# ----------------------------------------

# 本网站暂无需禁止爬虫访问的页面
# 所有页面均对搜索引擎开放

# ----------------------------------------
# 爬虫速率设置(可选)
# ----------------------------------------

Crawl-delay: 1

# 建议爬虫每次访问间隔至少1秒,避免对服务器造成压力

各指令详解

User-agent

作用:指定规则适用的搜索引擎爬虫类型

使用说明:

  • User-agent: * - 星号表示适用于所有爬虫
  • User-agent: Bingbot - 专指必应搜索爬虫
  • User-agent: Googlebot - 专指谷歌搜索爬虫
  • User-agent: Baiduspider - 专指百度搜索爬虫

💡 提示:更具体的爬虫规则会覆盖通配符规则

Allow

作用:明确允许爬虫访问的页面或目录

使用说明:

  • Allow: / - 允许访问整个网站的所有页面
  • Allow: /blog/ - 只允许访问博客目录下的页面
  • 未指定 Allow 时,默认允许访问

💡 提示:我们使用 Allow: / 允许所有页面被爬虫访问,有利于SEO

Disallow

作用:禁止爬虫访问的页面或目录

使用说明:

  • Disallow: /admin/ - 禁止访问管理后台
  • Disallow: /private/ - 禁止访问私人目录
  • Disallow: * - 禁止访问所有内容(慎用)

💡 提示:纸飞机官网目前没有需要禁止访问的页面,因此未使用此指令

Sitemap

作用:告诉搜索引擎站点地图的位置

使用说明:

  • 每个网站可以指定多个 Sitemap 位置
  • 建议使用完整URL路径
  • 支持XML格式的站点地图

💡 提示:这是必应等搜索引擎发现新页面的重要途径

Crawl-delay

作用:设置爬虫访问的时间间隔

使用说明:

  • 数值单位为秒,表示两次访问之间的最小间隔
  • Crawl-delay: 1 - 每次访问间隔至少1秒
  • 此指令并非所有搜索引擎都支持

💡 提示:设置合理的访问间隔可以减少服务器压力

常见用法示例

示例一:禁止访问管理后台

User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

示例二:禁止访问搜索结果页

User-agent: *
Disallow: /search/
Disallow: /?s=*

示例三:只允许特定爬虫访问

User-agent: *
Disallow: /

User-agent: Bingbot
Allow: /

示例四:禁止访问图片资源

User-agent: *
Disallow: /images/private/

User-agent: Googlebot-Image
Allow: /images/

必应(Bing)SEO特别说明

必应爬虫名称

必应搜索引擎使用 Bingbot 作为主要爬虫名称。如果是移动端内容,还会使用 Bingbot-Mobile

必应站长工具

为了更好地控制必应对网站的抓取,建议使用必应站长工具

  • 提交站点地图,加速页面收录
  • 查看抓取统计,了解爬虫访问情况
  • 设置抓取速率,避免服务器压力
  • 检测并修复抓取错误

必应收录检查

在必应中搜索 site:zhifeiji-aa.com.cn 可以查看网站在必应的收录情况。如果页面未被收录,可以:

  • 检查 Robots.txt 是否阻止了爬虫
  • 通过必应站长工具手动提交 URL
  • 确保页面有足够的原创内容
  • 检查页面是否返回正确的 HTTP 状态码

如何测试 Robots.txt

方法一:直接访问

在浏览器中直接访问:
https://zhifeiji-aa.com.cn/robots.txt

如果能看到 robots.txt 的内容,说明文件已正确部署

方法二:必应站长工具

访问必应站长工具的"robots.txt 测试"功能:

  • 输入要测试的URL
  • 查看是否被允许抓取
  • 根据提示修复问题

方法三:在线测试工具

使用第三方在线工具测试:

  • Google Robots.txt Tester
  • SmallSEOTools Robots.txt Tester
  • SEO Book Robots.txt Tester

📚 相关资源链接

🗺️ 站点地图 - 查看网站所有页面索引 🔍 必应站长工具 - 管理和优化网站在必应的表现 📖 Google Robots.txt 指南 - 官方文档 📖 必应 Robots.txt 指南 - 官方文档