纸飞机官网对搜索引擎爬虫的访问规则配置
📅 最后更新: | 协议版本:v1.0
Robots.txt 是放置在网站根目录下的纯文本文件,用于告诉搜索引擎爬虫(Spider/Bot)哪些页面可以访问,哪些页面不应该访问。这是网站与搜索引擎之间沟通的第一道门户,也是SEO优化中非常重要的技术环节。
对于希望在必应(Bing)、谷歌(Google)等搜索引擎获得良好排名的网站来说,正确配置 Robots.txt 至关重要。它不仅能帮助搜索引擎更高效地抓取网站内容,还能保护敏感页面不被索引。
# 纸飞机官网 Robots.txt
# 最后更新:
# ----------------------------------------
# 用户代理设置
# ----------------------------------------
User-agent: *
Allow: /
# 允许所有主流搜索引擎爬虫访问
User-agent: Bingbot
Allow: /
# 明确允许必应爬虫访问全部内容
User-agent: Googlebot
Allow: /
# 明确允许谷歌爬虫访问全部内容
User-agent: Baiduspider
Allow: /
# 允许百度爬虫访问
# ----------------------------------------
# 站点地图位置
# ----------------------------------------
Sitemap: https://zhifeiji-aa.com.cn/sitemap.xml
# 告知搜索引擎站点地图的位置
# ----------------------------------------
# 访问限制(暂无)
# ----------------------------------------
# 本网站暂无需禁止爬虫访问的页面
# 所有页面均对搜索引擎开放
# ----------------------------------------
# 爬虫速率设置(可选)
# ----------------------------------------
Crawl-delay: 1
# 建议爬虫每次访问间隔至少1秒,避免对服务器造成压力
作用:指定规则适用的搜索引擎爬虫类型
使用说明:
User-agent: * - 星号表示适用于所有爬虫User-agent: Bingbot - 专指必应搜索爬虫User-agent: Googlebot - 专指谷歌搜索爬虫User-agent: Baiduspider - 专指百度搜索爬虫💡 提示:更具体的爬虫规则会覆盖通配符规则
作用:明确允许爬虫访问的页面或目录
使用说明:
Allow: / - 允许访问整个网站的所有页面Allow: /blog/ - 只允许访问博客目录下的页面💡 提示:我们使用 Allow: / 允许所有页面被爬虫访问,有利于SEO
作用:禁止爬虫访问的页面或目录
使用说明:
Disallow: /admin/ - 禁止访问管理后台Disallow: /private/ - 禁止访问私人目录Disallow: * - 禁止访问所有内容(慎用)💡 提示:纸飞机官网目前没有需要禁止访问的页面,因此未使用此指令
作用:告诉搜索引擎站点地图的位置
使用说明:
💡 提示:这是必应等搜索引擎发现新页面的重要途径
作用:设置爬虫访问的时间间隔
使用说明:
Crawl-delay: 1 - 每次访问间隔至少1秒💡 提示:设置合理的访问间隔可以减少服务器压力
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
User-agent: *
Disallow: /search/
Disallow: /?s=*
User-agent: *
Disallow: /
User-agent: Bingbot
Allow: /
User-agent: *
Disallow: /images/private/
User-agent: Googlebot-Image
Allow: /images/
必应搜索引擎使用 Bingbot 作为主要爬虫名称。如果是移动端内容,还会使用 Bingbot-Mobile。
在必应中搜索 site:zhifeiji-aa.com.cn 可以查看网站在必应的收录情况。如果页面未被收录,可以:
在浏览器中直接访问:
https://zhifeiji-aa.com.cn/robots.txt
如果能看到 robots.txt 的内容,说明文件已正确部署
访问必应站长工具的"robots.txt 测试"功能:
使用第三方在线工具测试: