配好robots.txt让AI爬虫该看的看到、不该看的不看
核心要点
- robots.txt在GEO中既要让AI爬虫访问关键内容,又要保护敏感数据
- GEO时代需考虑10+种AI爬虫,而非SEO时代只需考虑Googlebot/Bingbot
- 不要全网封锁AI爬虫(等于放弃GEO),应选择性开放内容目录+保护敏感目录
正文
背景:robots.txt在GEO中的双重角色
robots.txt是网站根目录的纯文本文件,告诉爬虫哪些页面可以访问、哪些不能访问。在SEO时代,robots.txt主要服务Googlebot和Bingbot两个爬虫,配置相对简单。但在GEO时代,AI爬虫种类从2种扩展到10+种,配置复杂度大幅增加。
robots.txt在GEO中的双重角色:
- 开放角色:确保AI爬虫能访问你的关键内容页面(博客、产品、FAQ、知识库),让AI引擎能爬取和理解你的品牌信息
- 保护角色:阻止AI爬虫访问敏感数据(用户数据、后台管理、API密钥),防止隐私泄露和知识产权风险
两者的平衡是robots.txt配置的核心挑战:过度开放=数据泄露风险,过度封锁=放弃AI搜索流量。
AI时代robots.txt的新挑战
| 维度 | SEO时代 | GEO时代 |
| 爬虫数量 | 2-3种(Googlebot/Bingbot/Yandexbot) | 10+种AI爬虫+传统搜索爬虫 |
| 配置复杂度 | 简单(主要配置Googlebot) | 复杂(每种AI爬虫可能需要不同规则) |
| 核心权衡 | SEO排名 vs 爬取保护 | AI引用流量 vs 数据保护 |
| 争议焦点 | 是否封锁Yandexbot | 是否封锁AI训练爬虫 |
| 新问题 | 无 | AI训练数据使用争议、爬虫识别困难 |
6种主流AI爬虫详解
1. Googlebot——Google搜索爬虫(同时服务于AI Overview)
| 属性 | 信息 |
| 所属平台 | |
| User-Agent | Googlebot/2.1 |
| 爬取特点 | 支持JS渲染,爬取预算有限,遵守robots.txt |
| 双重身份 | 同时服务于Google搜索和AI Overview(Gemini) |
| 配置建议 | 必须放行,是SEO和GEO的基础爬虫 |
| Crawl-delay建议 | 不设置(Google不支持Crawl-delay) |
2. Bingbot——Microsoft搜索爬虫(同时服务于Copilot)
| 属性 | 信息 |
| 所属平台 | Microsoft |
| User-Agent | bingbot/2.0 |
| 爬取特点 | 支持部分JS渲染,遵守robots.txt |
| 双重身份 | 同时服务于Bing搜索和Microsoft Copilot |
| 配置建议 | 必须放行,影响Bing搜索和Copilot引用 |
| Crawl-delay建议 | 1-10秒(Bing支持Crawl-delay) |
3. PerplexityBot——Perplexity AI搜索爬虫
| 属性 | 信息 |
| 所属平台 | Perplexity AI |
| User-Agent | PerplexityBot/1.0 |
| 爬取特点 | 不支持JS渲染,遵守robots.txt,爬取频次较低 |
| GEO价值 | 直接影响Perplexity AI搜索的引用 |
| 配置建议 | 放行内容目录,保护敏感目录 |
| Crawl-delay建议 | 5-10秒 |
4. ChatGPT-User——OpenAI ChatGPT浏览爬虫
| 属性 | 信息 |
| 所属平台 | OpenAI |
| User-Agent | ChatGPT-User/1.0 |
| 爬取特点 | ChatGPT实时浏览时触发,遵守robots.txt |
| GEO价值 | 影响ChatGPT实时浏览回答的引用 |
| 配置建议 | 放行(ChatGPT-User用于实时浏览回答,不是训练爬虫) |
| Crawl-delay建议 | 5秒 |
注意区分:ChatGPT-User是实时浏览爬虫(回答用户问题时实时访问网页),GPTBot是训练爬虫(用网页数据训练模型)。两者目的不同,配置策略也不同。
5. ClaudeBot/Claude-Web——Anthropic Claude爬虫
| 属性 | 信息 |
| 所属平台 | Anthropic |
| User-Agent | ClaudeBot/1.0 / Claude-Web/1.0 |
| 爬取特点 | 不支持JS渲染,遵守robots.txt |
| GEO价值 | 影响Claude回答中的引用和推荐 |
| 配置建议 | 放行内容目录 |
| Crawl-delay建议 | 5-10秒 |
6. Bytespider——字节跳动豆包爬虫
| 属性 | 信息 |
| 所属平台 | 字节跳动(豆包/抖音搜索) |
| User-Agent | Bytespider |
| 爬取特点 | 爬取频次较高,有时不遵守Crawl-delay |
| GEO价值 | 影响豆包AI和抖音搜索的引用 |
| 配置建议 | 放行但设置Crawl-delay,监控爬取频次 |
| Crawl-delay建议 | 10秒 |
其他新兴AI爬虫
| 爬虫名称 | 所属平台 | User-Agent | 说明 |
| GPTBot | OpenAI | GPTBot/1.0 | AI训练数据爬虫(非实时浏览) |
| OAI-SearchBot | OpenAI | OAI-SearchBot/1.0 | OpenAI搜索爬虫 |
| Applebot-Extended | Apple | Applebot-Extended | Apple AI服务爬虫 |
| DeepSeek-SearchBot | DeepSeek | DeepSeek-SearchBot | DeepSeek AI搜索爬虫 |
| CCBot | Common Crawl | CCBot/2.0 | 开放网络爬取,AI训练数据来源 |
关键区分:训练爬虫(GPTBot/CCBot)用你的数据训练AI模型,浏览爬虫(ChatGPT-User/PerplexityBot)用你的内容实时回答用户问题。两者的配置策略不同——浏览爬虫应放行(影响实时引用),训练爬虫的策略取决于你的IP保护立场。
GEO友好的robots.txt配置模板
策略1:开放策略——允许所有AI爬虫访问(适合内容型品牌)
# GEO开放策略:允许所有爬虫访问内容目录
# 适合:内容型品牌,希望最大化AI引用
User-agent: *
Allow: /blog
Allow: /products
Allow: /faq
Allow: /knowledge
Allow: /articles
Allow: /about
Allow: /llms.txt
Allow: /sitemap.xml
Disallow: /admin
Disallow: /api
Disallow: /user-data
Disallow: /internal
Disallow: /search
Sitemap: https://yourdomain.com/sitemap.xml
# Crawl-delay设置(对各爬虫设置合理延迟)
User-agent: Bingbot
Crawl-delay: 5
User-agent: PerplexityBot
Crawl-delay: 5
User-agent: Bytespider
Crawl-delay: 10
适用场景:媒体/博客/知识库/教育等内容型品牌,AI引用是流量增长的核心渠道,不担心训练数据使用。
策略2:选择性开放策略——允许特定AI爬虫,禁止其他(适合有选择需求的品牌)
# GEO选择性开放策略
# 适合:有选择性放行需求的品牌
# 放行搜索+AI浏览爬虫
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
Crawl-delay: 5
User-agent: PerplexityBot
Allow: /blog
Allow: /products
Allow: /faq
Allow: /knowledge
Disallow: /admin
Disallow: /api
Crawl-delay: 5
User-agent: ChatGPT-User
Allow: /blog
Allow: /products
Allow: /faq
Crawl-delay: 5
User-agent: ClaudeBot
Allow: /blog
Allow: /products
Allow: /faq
Crawl-delay: 5
# 限制AI训练爬虫(可选:根据IP保护立场决定)
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# 限制其他未识别爬虫
User-agent: *
Disallow: /admin
Disallow: /api
Disallow: /user-data
Allow: /blog
Allow: /products
Allow: /faq
Sitemap: https://yourdomain.com/sitemap.xml
适用场景:希望AI引擎能实时引用内容,但不想让AI模型用你的数据做训练。放行浏览爬虫(ChatGPT-User/PerplexityBot),限制训练爬虫(GPTBot/CCBot)。
策略3:保护策略——允许搜索爬虫但限制AI训练爬虫(适合IP敏感品牌)
# GEO保护策略:放行搜索爬虫,限制AI训练爬虫
# 适合:知识产权敏感品牌(原创内容/独家数据/商业秘密)
# 放行搜索爬虫(SEO基础)
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
Crawl-delay: 5
# 放行AI浏览爬虫(影响实时引用)
User-agent: ChatGPT-User
Allow: /
Crawl-delay: 5
User-agent: PerplexityBot
Allow: /
Crawl-delay: 5
User-agent: OAI-SearchBot
Allow: /
# 限制AI训练爬虫(保护知识产权)
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Bytespider
Disallow: /
# 通用保护规则
User-agent: *
Disallow: /admin
Disallow: /api
Disallow: /user-data
Disallow: /internal
Sitemap: https://yourdomain.com/sitemap.xml
适用场景:原创内容品牌、独家数据品牌、商业秘密敏感品牌。放行搜索爬虫保SEO流量,放行浏览爬虫保AI实时引用,限制训练爬虫保护知识产权。
重要提醒:策略3中封锁ClaudeBot意味着Claude无法爬取你的内容,Claude回答中不会引用你的品牌。这是IP保护与AI引用的权衡,品牌需根据自身情况决策。
robots.txt配置的5个关键规则
| 规则 | 说明 | 违规后果 |
| 不要全网封锁AI爬虫 | Disallow: / 对所有爬虫等于放弃GEO | AI搜索中你的品牌完全不可见 |
| 保护敏感目录 | /admin /api /user-data /internal 必须Disallow | 用户数据泄露、后台暴露 |
| 开放内容目录 | /blog /products /faq /knowledge 应Allow | AI爬虫无法访问核心内容 |
| 设置合理Crawl-delay | 不同爬虫频次不同,设置适当延迟 | 爬虫频次过高→服务器压力,过低→爬取不及时 |
| 明确Sitemap位置 | 在robots.txt末尾声明Sitemap URL | AI爬虫发现页面效率降低 |
robots.txt验证方法
| 验证项 | 工具/方法 | 检查内容 |
| 文件可访问性 | 浏览器访问 /robots.txt | 返回200状态码,内容正确 |
| 语法正确性 | Google Search Console robots.txt测试工具 | 规则语法无误 |
| 规则效果模拟 | Google Search Console robots.txt测试工具 | 输入URL查看是否被Allow/Disallow |
| 爬虫日志验证 | 服务器日志分析 | 查看各爬虫的实际访问路径是否符合规则 |
| AI爬虫实际测试 | 在AI引擎中搜索品牌关键词 | 验证AI是否能引用你开放的内容 |
Google Search Console验证步骤:
- 登录Search Console
- 进入"设置"→"robots.txt测试工具"
- 输入URL查看规则效果
- 确认关键内容页面被Allow,敏感目录被Disallow
AI爬虫识别和日志分析方法
从服务器日志中识别AI爬虫
# 分析Nginx日志中的AI爬虫访问记录
grep -i "PerplexityBot\|ChatGPT-User\|ClaudeBot\|GPTBot\|Bytespider\|OAI-SearchBot" /var/log/nginx/access.log
# 统计各AI爬虫的访问频次
awk '{print $1}' /var/log/nginx/access.log | grep -i "PerplexityBot\|ChatGPT-User\|ClaudeBot" | sort | uniq -c | sort -rn
# 检查AI爬虫是否被正确放行/拦截
grep "PerplexityBot" /var/log/nginx/access.log | grep "403" # 如果403多=被误拦截
grep "PerplexityBot" /var/log/nginx/access.log | grep "200" # 如果200多=正确放行
常见日志分析问题
| 问题 | 日志特征 | 原因 | 修复 |
| AI爬虫大量403 | PerplexityBot访问返回403 | robots.txt误Disallow或WAF拦截 | 修改robots.txt Allow / 调整WAF规则 |
| AI爬虫访问频次异常高 | 同一爬虫短时间内大量请求 | Crawl-delay未设置或爬虫不遵守 | 设置Crawl-delay / 服务器速率限制 |
| AI爬虫爬取无关页面 | 爬虫访问/admin等敏感路径 | robots.txt规则不够严格 | 补充Disallow规则 |
| AI爬虫完全不来 | 日志中无AI爬虫记录 | 品牌知名度低或robots.txt全网封锁 | 提升内容质量 / 修改robots.txt开放策略 |
常见误区
误区1:封锁AI爬虫保护知识产权。
事实:封锁AI爬虫=放弃AI搜索流量。AI搜索(Perplexity/ChatGPT/Claude等)正在快速增长,2024年Perplexity月活跃用户已超过1500万。全网封锁AI爬虫等于在快速增长的新渠道中完全消失。
正确策略是选择性放行:放行AI浏览爬虫(影响实时引用和推荐),根据IP保护立场决定是否限制AI训练爬虫。两者是不同决策,不应一刀切。
误区2:所有爬虫用同一规则。
事实:不同爬虫需要不同配置。Googlebot不支持Crawl-delay,Bingbot支持;Bytespider爬取频次高需要更严格延迟;ChatGPT-User和GPTBot目的不同需要不同策略。一刀切配置会导致部分爬虫行为异常或关键爬虫被误拦。
误区3:robots.txt部署后AI立即遵守。
事实:新爬虫发现robots.txt有延迟(1-7天不等),已有爬虫缓存旧robots.txt需要刷新周期。部署修改后需要1-2周才能全面生效。重大修改(如从全封锁改为开放)生效周期更长。
白帽提示
robots.txt配置的目的是管理爬虫访问权限,而非操纵爬虫行为。不得使用cloaking技术向爬虫展示与用户不同的内容。不得通过robots.txt诱导AI爬虫访问专门为爬虫制造的虚假页面。白帽GEO原则:爬虫看到的内容与用户看到的内容完全一致,robots.txt只是管理访问权限的工具。
关键指标
| 指标 | 标准 |
| robots.txt可访问性 | /robots.txt返回200 |
| 内容目录可爬取性 | /blog /products /faq被主要AI爬虫Allow |
| 敏感目录保护性 | /admin /api /user-data被所有爬虫Disallow |
| AI爬虫访问成功率 | 主要AI爬虫访问核心页面返回200 |
| Crawl-delay合理性 | 不同爬虫设置差异化延迟 |
| Sitemap声明 | robots.txt末尾声明Sitemap URL |
| AI爬虫日志覆盖率 | 能识别和分析6种以上AI爬虫的访问记录 |
| 生效周期 | 配置修改后1-2周全面生效 |
相关文章
- → 04-技术实施/01 Schema.org标记完全指南
- → 03-内容优化/01 GEO内容四大原则
- → 03-内容优化/07 内容Chunk化-让AI精准抓取你的段落
关于根哥GEO
根哥GEO是一款白帽GEO优化工具,帮助企业/个人品牌在AI搜索引擎中获得更多引用和推荐。基于20年SEO经验与GEO方法论,合规、可持续、越做越值钱。
👉 了解根哥GEO