没有基线数据,GEO就是盲人摸象

核心要点

  • 先测后做是白帽GEO第一原则,无基线数据的优化等于随机试错
  • 自测流程四步法:词库准备→逐平台记录→数据汇总→等级判定
  • 品类词是GEO核心战场,品牌词自测只是起点而非终点

正文

背景:为什么必须自测

GEO优化的前提是知道"你现在在哪里"。没有基线数据,每一次内容调整、每一次技术优化都无法验证效果——你不知道改进了什么,也不知道浪费了什么。传统SEO有Google Analytics、Search Console提供流量基线;GEO目前缺乏官方分析工具,品牌在AI引擎中的曝光状态完全不可见,自测是唯一获取基线数据的方式。

白帽GEO的第一原则:先测后做,边做边测,做完再测。自测不是一次性动作,而是贯穿优化全周期的闭环机制。

自测前的准备工作

1. 确定测试词库(20-50个词)

词库由三类词配比构成:

词类定义数量占比示例(SaaS行业)
品类词用户搜索解决方案时使用的通用词40%"项目管理软件""团队协作工具"
竞品对比词用户对比选择时使用的词30%"飞书vs钉钉""Notion替代品"
长尾问题词用户遇到具体问题时使用的词30%"小型团队用什么项目管理""免费项目管理软件推荐"

品类词是GEO核心战场。AI引擎回答品类问题时,推荐列表就是你的曝光位。品牌词搜索几乎100%出现品牌名(因为AI直接识别实体),测试价值有限,不要只测品牌词

2. 确定测试平台(至少4个)

平台测试价值特点
DeepSeek国内用户量大,中文能力强免费可测,响应快
Kimi长文本处理优秀,引用链清晰适合内容密集型行业
ChatGPT全球最大用户量,英文生态主战场GPT-4o免费额度可用
智谱清言国产模型,中文语义理解好适合中文品牌测试
PerplexityAI搜索引擎标杆,引用机制最透明必测,引用格式最规范

至少覆盖4个平台,优先包含Perplexity(引用最透明)和1个国内平台(用户量大的)。

3. 确定测试频次

核心规则:每个词每个平台测试3次,不同时间不同措辞

  • 3次测试取均值,消除AI答案随机性
  • 不同时间:上午10点、下午3点、晚间8点各1次(避开凌晨高峰和模型更新时段)
  • 不同措辞:同一个词至少2种表述方式,如"项目管理软件推荐"和"好用的项目管理工具有哪些"

四步自测流程详解

Step 1:核心词准备与分类

建立词库表格,每个词标注类别、优先级和2-3种替代措辞:

序号测试词词类优先级替代措辞1替代措辞2
1项目管理软件品类词P0项目管理工具推荐哪款项目管理软件好用
2飞书vs钉钉竞品对比词P1飞书和钉钉哪个好钉钉飞书对比
3小团队项目管理长尾问题词P15人团队项目管理工具小团队用什么管理项目
..................

操作要点:

  • 品类词优先级最高(P0),因为品类词是GEO优化的核心目标
  • 竞品对比词和长尾问题词标注P1
  • 替代措辞用自然语言表达,不要机械替换同义词

Step 2:逐平台逐词测试记录

使用统一记录模板,每次测试填一行:

平台测试词措辞版本测试时间品牌是否出现出现位置提及类型具体描述引用来源
DeepSeek项目管理软件原词10:00第3位推荐列表"XX是一款面向中小团队的轻量项目管理工具"
Perplexity项目管理软件原词15:00第2位引用推荐"XX.com - lightweight PM tool for small teams"xx.com/blog
ChatGPT项目管理软件原词20:00未提及

字段说明:

  • 品牌是否出现:✓/✗,出现记1,不出现记0
  • 出现位置:AI回答中品牌被提及的顺序位次(第1位=最优先推荐,第5位=末位提及)
  • 提及类型:推荐列表/对比提及/背景引用/负面提及/未提及
  • 具体描述:AI原文中对品牌的描述语句,逐字记录
  • 引用来源:AI标注的信息来源URL(Perplexity最常标注)

实操建议:

  • 每次测试截图保存原始回答,防止后续争议
  • 测试时关闭个性化设置(如ChatGPT的"memory"功能),确保测试条件一致
  • 同一个词在同一平台的3次测试,间隔至少2小时

Step 3:数据汇总与AOR/RR计算

##### AOR(AI出现率)计算公式

AOR = 品牌出现次数 / 总测试次数 × 100%

示例:测试"项目管理软件"在DeepSeek上3次,品牌出现2次:

  • AOR = 2/3 × 100% = 66.7%

汇总维度:

  • 单词AOR:每个词在各平台的出现率
  • 单平台AOR:所有词在某个平台的平均出现率
  • 综合AOR:所有词所有平台的加权平均出现率

##### RR(推荐率)计算公式

RR = 进入推荐列表(前3位)的次数 / 品牌出现次数 × 100%

示例:品牌在"项目管理软件"相关测试中出现6次,其中3次进入前3推荐位:

  • RR = 3/6 × 100% = 50%

AOR衡量"能不能被看见",RR衡量"能不能被优先推荐"。两者结合才是完整的AI可见性评估。

##### Excel操作示例

测试词DeepSeek AORKimi AORChatGPT AORPerplexity AOR综合AORDeepSeek RRPerplexity RR综合RR
项目管理软件66.7%100%33.3%66.7%66.7%50%100%75%
飞书vs钉钉100%100%100%100%100%0%33.3%16.7%
小团队项目管理33.3%66.7%0%33.3%33.3%100%100%100%

Excel公式:

  • AOR:=COUNTIF(出现列,"✓")/COUNTA(出现列)
  • RR:=COUNTIF(位置列,"<=3")/COUNTIF(出现列,"✓")

Step 4:结果解读与等级判定

基于综合AOR和RR的数值,判定品牌AI可见性成熟度等级:

等级AOR标准RR标准状态描述优化策略
Level 1 不可见<20%<20%AI几乎不提及品牌基础建设:内容可抓取+结构化数据
Level 2 偶尔可见20%-50%20%-40%品牌偶尔出现,但位置靠后内容深化:提升E-E-A-T信号+品类内容覆盖
Level 3 常规可见50%-80%40%-70%品牌稳定出现,偶入推荐差异化竞争:独特数据+权威引用链建设
Level 4 优先推荐>80%>70%品牌高频出现且优先推荐生态护城河:跨平台一致+知识图谱占位

等级判定规则:AOR和RR需同时达标才能升级。例如AOR=60%但RR=30%,判定为Level 2而非Level 3。

自测常见坑

常见坑具体表现规避方法
时间段差异大上午测出现,晚上测不出现上午10点/下午3点测试较稳定,避开凌晨(模型更新期)和晚高峰(负载大)
AI答案随机性同一问题两次回答不同3次测试取均值,不取单次结果作为基线
同义词差异大"项目管理软件"出现但"项目管理工具"不出现每个词至少2种措辞,覆盖用户真实搜索习惯
只测品牌词"XX软件"搜索100%出现品牌品类词才是GEO核心战场,品牌词测试价值有限
个性化干扰ChatGPT记忆功能导致结果偏私测试时关闭memory/custom instructions,使用隐私模式
平台覆盖不足只测ChatGPT忽略国内平台至少4个平台,国内品牌必须覆盖DeepSeek/Kimi
样本量过小只测5个词就下结论20-50个词,品类词占40%以上

自测结果如何指导下一步优化

自测不是终点,而是优化的起点。根据等级判定结果:

Level 1→Level 2:基础建设期

  • 优先解决D1(可抓取性):检查robots.txt是否误封AI爬虫,确保核心页面可被抓取
  • 添加基础Schema.org标记(Organization、Product)
  • 确保品牌官网在百度/Google搜索结果中稳定出现(AI引擎大量引用搜索结果)

Level 2→Level 3:内容深化期

  • 围绕品类词创建深度内容(指南、对比、数据报告)
  • 增加E-E-A-T信号:作者署名、数据来源标注、专家引用
  • 在第三方权威平台建立品牌内容(知乎、行业媒体、百科词条)

Level 3→Level 4:差异化竞争期

  • 发布独家数据/原创研究(AI引擎优先引用有数据的来源)
  • 建立跨平台品牌描述一致性(官网、社交媒体、第三方平台描述统一)
  • 在Perplexity/Wikipedia等高引用源建立品牌实体

自测工具对比:手动vs自动化

维度手动测试自动化工具
成本人力时间成本高(50词×4平台×3次=600次测试)工具订阅成本(月费数百至数千元)
数据质量可记录完整上下文,截图保存原始回答通常只有出现/不出现的二元数据
可控性完全可控,可随时调整测试条件和措辞受限于工具预设的测试逻辑
速度慢,600次测试约需2-3天快,批量测试数小时完成
适用场景首次自测、深度诊断、验证自动化结果定期监控、大规模词库、趋势追踪

建议:首次自测用手动方式,建立完整基线数据;后续定期监控用自动化工具,节省时间。两者数据交叉验证,确保可信度。

白帽提示

自测是观察行为而非干预行为。白帽GEO自测严格遵守以下边界:

1. 不通过反复提问"引导"AI输出特定结果——测试措辞应模拟真实用户自然搜索

2. 不使用prompt injection等技术手段操控AI输出——这属于黑帽GEO

3. 不在测试中伪装不同身份制造虚假引用——真实数据才有真实价值

4. 自测数据是优化基线,不是营销素材——不要挑选性地展示数据制造虚假效果

关键指标

指标标准说明
测试词数量20-50个品类词≥40%,竞品对比词≤30%,长尾问题词≤30%
测试平台数≥4个必含Perplexity+1个国内主流平台
每词每平台测试次数3次不同时间不同措辞,取均值
AOR(AI出现率)Level 4目标>80%衡量品牌能否被AI看见
RR(推荐率)Level 4目标>70%衡量品牌能否被AI优先推荐
措辞覆盖每词≥2种避免同义词导致的样本偏差
基线建立周期2-3天手动测试全量完成的时间
复测频率每2周1次监控优化效果,对比基线变化

相关文章

  • → 01-认知基础/01 GEO是什么-生成式引擎优化全解
  • → 01-认知基础/05 GEO核心指标体系

关于根哥GEO

根哥GEO是一款白帽GEO优化工具,帮助企业/个人品牌在AI搜索引擎中获得更多引用和推荐。基于20年SEO经验与GEO方法论,合规、可持续、越做越值钱。

👉 了解根哥GEO