没有基线数据,GEO就是盲人摸象
核心要点
- 先测后做是白帽GEO第一原则,无基线数据的优化等于随机试错
- 自测流程四步法:词库准备→逐平台记录→数据汇总→等级判定
- 品类词是GEO核心战场,品牌词自测只是起点而非终点
正文
背景:为什么必须自测
GEO优化的前提是知道"你现在在哪里"。没有基线数据,每一次内容调整、每一次技术优化都无法验证效果——你不知道改进了什么,也不知道浪费了什么。传统SEO有Google Analytics、Search Console提供流量基线;GEO目前缺乏官方分析工具,品牌在AI引擎中的曝光状态完全不可见,自测是唯一获取基线数据的方式。
白帽GEO的第一原则:先测后做,边做边测,做完再测。自测不是一次性动作,而是贯穿优化全周期的闭环机制。
自测前的准备工作
1. 确定测试词库(20-50个词)
词库由三类词配比构成:
| 词类 | 定义 | 数量占比 | 示例(SaaS行业) |
| 品类词 | 用户搜索解决方案时使用的通用词 | 40% | "项目管理软件""团队协作工具" |
| 竞品对比词 | 用户对比选择时使用的词 | 30% | "飞书vs钉钉""Notion替代品" |
| 长尾问题词 | 用户遇到具体问题时使用的词 | 30% | "小型团队用什么项目管理""免费项目管理软件推荐" |
品类词是GEO核心战场。AI引擎回答品类问题时,推荐列表就是你的曝光位。品牌词搜索几乎100%出现品牌名(因为AI直接识别实体),测试价值有限,不要只测品牌词。
2. 确定测试平台(至少4个)
| 平台 | 测试价值 | 特点 |
| DeepSeek | 国内用户量大,中文能力强 | 免费可测,响应快 |
| Kimi | 长文本处理优秀,引用链清晰 | 适合内容密集型行业 |
| ChatGPT | 全球最大用户量,英文生态主战场 | GPT-4o免费额度可用 |
| 智谱清言 | 国产模型,中文语义理解好 | 适合中文品牌测试 |
| Perplexity | AI搜索引擎标杆,引用机制最透明 | 必测,引用格式最规范 |
至少覆盖4个平台,优先包含Perplexity(引用最透明)和1个国内平台(用户量大的)。
3. 确定测试频次
核心规则:每个词每个平台测试3次,不同时间不同措辞。
- 3次测试取均值,消除AI答案随机性
- 不同时间:上午10点、下午3点、晚间8点各1次(避开凌晨高峰和模型更新时段)
- 不同措辞:同一个词至少2种表述方式,如"项目管理软件推荐"和"好用的项目管理工具有哪些"
四步自测流程详解
Step 1:核心词准备与分类
建立词库表格,每个词标注类别、优先级和2-3种替代措辞:
| 序号 | 测试词 | 词类 | 优先级 | 替代措辞1 | 替代措辞2 |
| 1 | 项目管理软件 | 品类词 | P0 | 项目管理工具推荐 | 哪款项目管理软件好用 |
| 2 | 飞书vs钉钉 | 竞品对比词 | P1 | 飞书和钉钉哪个好 | 钉钉飞书对比 |
| 3 | 小团队项目管理 | 长尾问题词 | P1 | 5人团队项目管理工具 | 小团队用什么管理项目 |
| ... | ... | ... | ... | ... | ... |
操作要点:
- 品类词优先级最高(P0),因为品类词是GEO优化的核心目标
- 竞品对比词和长尾问题词标注P1
- 替代措辞用自然语言表达,不要机械替换同义词
Step 2:逐平台逐词测试记录
使用统一记录模板,每次测试填一行:
| 平台 | 测试词 | 措辞版本 | 测试时间 | 品牌是否出现 | 出现位置 | 提及类型 | 具体描述 | 引用来源 |
| DeepSeek | 项目管理软件 | 原词 | 10:00 | ✓ | 第3位 | 推荐列表 | "XX是一款面向中小团队的轻量项目管理工具" | 无 |
| Perplexity | 项目管理软件 | 原词 | 15:00 | ✓ | 第2位 | 引用推荐 | "XX.com - lightweight PM tool for small teams" | xx.com/blog |
| ChatGPT | 项目管理软件 | 原词 | 20:00 | ✗ | — | 未提及 | — | — |
字段说明:
- 品牌是否出现:✓/✗,出现记1,不出现记0
- 出现位置:AI回答中品牌被提及的顺序位次(第1位=最优先推荐,第5位=末位提及)
- 提及类型:推荐列表/对比提及/背景引用/负面提及/未提及
- 具体描述:AI原文中对品牌的描述语句,逐字记录
- 引用来源:AI标注的信息来源URL(Perplexity最常标注)
实操建议:
- 每次测试截图保存原始回答,防止后续争议
- 测试时关闭个性化设置(如ChatGPT的"memory"功能),确保测试条件一致
- 同一个词在同一平台的3次测试,间隔至少2小时
Step 3:数据汇总与AOR/RR计算
##### AOR(AI出现率)计算公式
AOR = 品牌出现次数 / 总测试次数 × 100%
示例:测试"项目管理软件"在DeepSeek上3次,品牌出现2次:
- AOR = 2/3 × 100% = 66.7%
汇总维度:
- 单词AOR:每个词在各平台的出现率
- 单平台AOR:所有词在某个平台的平均出现率
- 综合AOR:所有词所有平台的加权平均出现率
##### RR(推荐率)计算公式
RR = 进入推荐列表(前3位)的次数 / 品牌出现次数 × 100%
示例:品牌在"项目管理软件"相关测试中出现6次,其中3次进入前3推荐位:
- RR = 3/6 × 100% = 50%
AOR衡量"能不能被看见",RR衡量"能不能被优先推荐"。两者结合才是完整的AI可见性评估。
##### Excel操作示例
| 测试词 | DeepSeek AOR | Kimi AOR | ChatGPT AOR | Perplexity AOR | 综合AOR | DeepSeek RR | Perplexity RR | 综合RR |
| 项目管理软件 | 66.7% | 100% | 33.3% | 66.7% | 66.7% | 50% | 100% | 75% |
| 飞书vs钉钉 | 100% | 100% | 100% | 100% | 100% | 0% | 33.3% | 16.7% |
| 小团队项目管理 | 33.3% | 66.7% | 0% | 33.3% | 33.3% | 100% | 100% | 100% |
Excel公式:
- AOR:
=COUNTIF(出现列,"✓")/COUNTA(出现列) - RR:
=COUNTIF(位置列,"<=3")/COUNTIF(出现列,"✓")
Step 4:结果解读与等级判定
基于综合AOR和RR的数值,判定品牌AI可见性成熟度等级:
| 等级 | AOR标准 | RR标准 | 状态描述 | 优化策略 |
| Level 1 不可见 | <20% | <20% | AI几乎不提及品牌 | 基础建设:内容可抓取+结构化数据 |
| Level 2 偶尔可见 | 20%-50% | 20%-40% | 品牌偶尔出现,但位置靠后 | 内容深化:提升E-E-A-T信号+品类内容覆盖 |
| Level 3 常规可见 | 50%-80% | 40%-70% | 品牌稳定出现,偶入推荐 | 差异化竞争:独特数据+权威引用链建设 |
| Level 4 优先推荐 | >80% | >70% | 品牌高频出现且优先推荐 | 生态护城河:跨平台一致+知识图谱占位 |
等级判定规则:AOR和RR需同时达标才能升级。例如AOR=60%但RR=30%,判定为Level 2而非Level 3。
自测常见坑
| 常见坑 | 具体表现 | 规避方法 |
| 时间段差异大 | 上午测出现,晚上测不出现 | 上午10点/下午3点测试较稳定,避开凌晨(模型更新期)和晚高峰(负载大) |
| AI答案随机性 | 同一问题两次回答不同 | 3次测试取均值,不取单次结果作为基线 |
| 同义词差异大 | "项目管理软件"出现但"项目管理工具"不出现 | 每个词至少2种措辞,覆盖用户真实搜索习惯 |
| 只测品牌词 | "XX软件"搜索100%出现品牌 | 品类词才是GEO核心战场,品牌词测试价值有限 |
| 个性化干扰 | ChatGPT记忆功能导致结果偏私 | 测试时关闭memory/custom instructions,使用隐私模式 |
| 平台覆盖不足 | 只测ChatGPT忽略国内平台 | 至少4个平台,国内品牌必须覆盖DeepSeek/Kimi |
| 样本量过小 | 只测5个词就下结论 | 20-50个词,品类词占40%以上 |
自测结果如何指导下一步优化
自测不是终点,而是优化的起点。根据等级判定结果:
Level 1→Level 2:基础建设期
- 优先解决D1(可抓取性):检查robots.txt是否误封AI爬虫,确保核心页面可被抓取
- 添加基础Schema.org标记(Organization、Product)
- 确保品牌官网在百度/Google搜索结果中稳定出现(AI引擎大量引用搜索结果)
Level 2→Level 3:内容深化期
- 围绕品类词创建深度内容(指南、对比、数据报告)
- 增加E-E-A-T信号:作者署名、数据来源标注、专家引用
- 在第三方权威平台建立品牌内容(知乎、行业媒体、百科词条)
Level 3→Level 4:差异化竞争期
- 发布独家数据/原创研究(AI引擎优先引用有数据的来源)
- 建立跨平台品牌描述一致性(官网、社交媒体、第三方平台描述统一)
- 在Perplexity/Wikipedia等高引用源建立品牌实体
自测工具对比:手动vs自动化
| 维度 | 手动测试 | 自动化工具 |
| 成本 | 人力时间成本高(50词×4平台×3次=600次测试) | 工具订阅成本(月费数百至数千元) |
| 数据质量 | 可记录完整上下文,截图保存原始回答 | 通常只有出现/不出现的二元数据 |
| 可控性 | 完全可控,可随时调整测试条件和措辞 | 受限于工具预设的测试逻辑 |
| 速度 | 慢,600次测试约需2-3天 | 快,批量测试数小时完成 |
| 适用场景 | 首次自测、深度诊断、验证自动化结果 | 定期监控、大规模词库、趋势追踪 |
建议:首次自测用手动方式,建立完整基线数据;后续定期监控用自动化工具,节省时间。两者数据交叉验证,确保可信度。
白帽提示
自测是观察行为而非干预行为。白帽GEO自测严格遵守以下边界:
1. 不通过反复提问"引导"AI输出特定结果——测试措辞应模拟真实用户自然搜索
2. 不使用prompt injection等技术手段操控AI输出——这属于黑帽GEO
3. 不在测试中伪装不同身份制造虚假引用——真实数据才有真实价值
4. 自测数据是优化基线,不是营销素材——不要挑选性地展示数据制造虚假效果
关键指标
| 指标 | 标准 | 说明 |
| 测试词数量 | 20-50个 | 品类词≥40%,竞品对比词≤30%,长尾问题词≤30% |
| 测试平台数 | ≥4个 | 必含Perplexity+1个国内主流平台 |
| 每词每平台测试次数 | 3次 | 不同时间不同措辞,取均值 |
| AOR(AI出现率) | Level 4目标>80% | 衡量品牌能否被AI看见 |
| RR(推荐率) | Level 4目标>70% | 衡量品牌能否被AI优先推荐 |
| 措辞覆盖 | 每词≥2种 | 避免同义词导致的样本偏差 |
| 基线建立周期 | 2-3天 | 手动测试全量完成的时间 |
| 复测频率 | 每2周1次 | 监控优化效果,对比基线变化 |
相关文章
- → 01-认知基础/01 GEO是什么-生成式引擎优化全解
- → 01-认知基础/05 GEO核心指标体系
关于根哥GEO
根哥GEO是一款白帽GEO优化工具,帮助企业/个人品牌在AI搜索引擎中获得更多引用和推荐。基于20年SEO经验与GEO方法论,合规、可持续、越做越值钱。
👉 了解根哥GEO