检测引擎

当人们问起与你业务攸关的问题时,AI 会不会提到你的品牌?对比采样答案,查看答案背后的来源,再决定先改进什么。

JefurryAxis 的一部分——Jeffery Asia 旗下的 AI SEO、GEO 与 AEO 产品。

人设,来自你自己的资料

在你授权后,JefurryAxis 读取你脱敏后的资料和公开的品牌信息,由 Agent 挖掘出最相关的客群标签(包括尚未触达的潜在客群),再组合成最可能向 AI 询问你的买家人设。

你的资料

  • 产品与服务手册
  • 业务与销售资料
  • 宣发与社媒物料
  • 真实客户提问
  • 公开品牌实体信息

脱敏处理,仅在你授权后使用

JefurryAxis Agent

读取提取筛选

客群标签 核心 潜在

地理
新加坡上海雅加达
人口
28–35 岁工作 5 年以上自费
心理
有转行意愿看重投入回报担心收入中断
行为
在职学习在小红书上比较申请前先问 AI

最契合的人设

P1想转行金融的在职人士
新加坡28–35 岁自费有转行意愿在职学习
契合度 94%
P2量化求职者 · 新加坡88%
P3升职者 · 雅加达81%
  1. 01读取你的资料
  2. 02按四个维度提取标签
  3. 03区分核心与潜在客群
  4. 04组合成最契合的人设

真实的测试,从真实的问题开始。

我们从不测“AI 知不知道我们的品牌”。我们测的,是真实买家在真实的一周里会问的问题——里面根本没有你的名字。

把品牌名写进问题,模型自然会谈起你的品牌。那样测到的,只是你自己的提示词。

一个问题是怎样构建出来的

P

一位想转行做金融的在职人士

E

没法停下工作,学费得自己出

?

“哪些金融硕士可以边工作边读?真正要花多少钱?”

仅为示意。你的人设与问题,都基于你自己的资料构建。

一次 Axis 检测:从选格到存档

五个步骤,一次完成。30 个不含品牌词的问题,6 个模型,每个答案都留存。

一套问题集 · 六个模型 · 多轮独立测试 · 每条答案存档

  1. 人设 × 环境先锁定一个格子

    已选:P1 × E2
    一个格子 = 一个受众情境

  2. 问题集 QS P1·E2该格子对应的固定问题集

    Q1认知有哪些选择
    Q2比较有何不同
    Q3排序哪个最好

    一个情境一套问题,始终不变

  3. 分发至六个模型同一套问题,六个模型并行

    ChatGPT
    Claude
    Gemini
    DeepSeek
    通义千问
    豆包

    3 国际 · 3 中文,分两轨

  4. 重复 n 轮每个模型各跑 n 轮

    重复 n 轮

    第 1 轮第 2 轮第 n 轮
    第 1 轮第 2 轮第 n 轮
    第 1 轮第 2 轮第 n 轮
    第 1 轮第 2 轮第 n 轮
    第 1 轮第 2 轮第 n 轮
    第 1 轮第 2 轮第 n 轮

    单轮有随机性,n 轮才看得出波动

  5. 汇总存档每条答案都存档

    答案样本库

    问题模型轮次答案
    Q1
    第 1 轮第 2 轮第 n 轮
    Q2
    第 1 轮第 2 轮第 n 轮
    Q3
    第 1 轮第 2 轮第 n 轮

    可比较、可复现的样本

5 类买家 × 2 种情境 × 3 个问题 = 这 30 个问题。复测跑的是完全相同的 30 个问题,所以本月和上月,是同一项测量做了两次。

为什么同一个问题要反复问?同一个模型,每次的回答都不一样。采样把一张碰巧的截图变成一个区间,我们报告的每个分数都落在这个区间的中间。
为什么两条轨道从不共用一个分数。国际模型和中文模型读的是不同的语料,信任的是不同的来源。某品牌在一条轨道上得 83.0 分,在另一条上只有 32.6 分。两者的平均值 57.8,哪一边都描述不了。

四项测量,合成一个分数

对同一个答案问四个问题,每天用同样的方式计数——正因如此,任意两次读数才能相互比较。

MR提及率

我们到底在不在场?

10 个答案中有 6 个提到

统计全部采样答案,而不是挑最好的那一个。

OF出现频率

只是提了一句,还是通篇都在讲?

一个答案里出现两次

按答案长度折算,冗长的答案占不到便宜。

AR平均排名

排第一,还是第九?

十个中排第三

完全没上榜,按最后一名计。否则缺席反而会让平均排名更好看。

BCR品牌内容占比

答案里到底有多少内容在讲我们?

占全文的 22%

讲你的句子数,除以答案的总句数。

为什么四项不直接相加

它们方向不同——排名数字低是好消息,提及率低则不是——计量单位也不同。所以要先把每一项统一方向、换算到同一个尺度上,再加权。提及率的权重最高,因为不在场,什么都弥补不了。

权重是一种建模选择,在报告任何结果之前就已冻结。看到结果之后还能随意调整的尺子,就不是尺子。完整定义随每份报告一同提供。

此处最灵敏 隐形 已无处不在
从“隐形”到“几乎隐形”,分数几乎不动;从“偶尔被提及”到“通常被推荐”,分数变化很大——而这正是值得花钱去改变的差距。

方法、问题集和测试条件,随每份报告一同提供。没有依据的分数,算不上测量。

雷达图:一次只读一条线

五个角,各代表一类买家人设。价值在于你往上叠加什么。

人设类型 A人设类型 B 人设类型 C人设类型 D人设类型 E
第 1 步一条线。AI 在哪里认识你,在哪里不认识你。但它还说明不了这是好是坏。
进攻 人设类型 A人设类型 B 人设类型 C人设类型 D人设类型 E
第 2 步加上一个对手。重叠的部分是共有的地盘;对手的线冲出你的线的地方,就是预算该去的地方。

再把所有对手一起叠上

五条线叠在一起,才是你所在品类的真实形状。圈出两个角,其余的先等一等。

你的品牌竞争对手
  • 进攻对手领先了一个你必争的角。
  • 防守你领先,但差距正在缩小。
  • 监测其余所有地方。不在上面花一分钱。

图形仅为示意。同一个角可能在一条轨道上看起来很强,到了另一条轨道却一落千丈——这就是两条轨道从不共用一张图的原因。

他是谁,不会变。
他问什么,一直在变。

在 B = f(P, Et) 中,人是常量,情境是变量。一条新规、一则社媒热帖、一次竞品降价——买家还是那个人,但他输入的问题已经变了。这变动的一半,正是洞察引擎 ↗所监测的。

P Et VS 他是谁——建模一次,保持不变 他身边正在发生什么——每周监测 政策 · 第 3 周 舆情 · 第 7 周 行业 · 第 10 周 1 2 3 4 5 6 7 8 9 10 11 12 58 76 68
示意:某金融硕士项目的一类申请人人设,在十二周内的变化。真实信号来自洞察引擎;真实分数来自对同一批问题的重复检测。
政策 · 第 3 周

毕业后工作准证政策收紧。

“哪些金融硕士毕业后还能拿到工作准证?”

72 → 58答案现在一开头就讲工作准证结果。而你的这类数据从未公开过。
舆情 · 第 7 周

竞争对手取消课程的帖子在小红书上热传。

“哪些在职项目真的会按承诺开课?”

71 → 76问题朝你这边偏移了——因为你的课表早已公开。
行业 · 第 10 周

区域内学费普遍上涨。

“按今年的学费,哪些金融硕士还值得读?”

75 → 68一个待争取的新格子。内容简报在下一次检测前发出。
01洞察捕捉信号

社媒及 AI 可读来源中的品牌舆情;政策、行业研究、竞争对手动向。

02E 随之改写

你的买家这一周所处的情境,按受影响的每个人设逐一更新。

03新问题加入检测

针对新情境的问题进入下一次检测,与你已在追踪的 30 个问题并列——原有趋势因此依然可比。

04重新检测,并给出解释

分数一变,报告就会说明是哪个信号带来的变化。

追踪的 30 个问题始终不变,趋势才真实可信。变的是,你能多早看到下一个问题的到来。打开洞察监测 ↗

一次检测无法告诉你的事

它是在明确条件下对 AI 答案的一次采样。它不是模型的推理过程,不是模型的训练数据,也不是你的客户看到的每一个答案。

  • 守住基线

    问题、人设、语言、模型、模式、时间,全部记录在案。

  • 同口径比较

    改动之后沿用同一套设置。波动如实报告,不做平滑处理。

  • 可见度不等于营收

    访问、询盘和销售记录在你的 CRM 里。我们不会把这些功劳算到自己头上。

关于这个引擎的常见问题

我可以检测哪些 AI 平台?

我们支持 ChatGPT、Claude、Gemini、DeepSeek、通义千问、豆包、Kimi、腾讯混元、Grok 和 Perplexity。一次检测能用哪些模型,取决于你的套餐和测试设置。腾讯元宝、小红书和 Google AI 概览可通过团队辅助的可见度评分加入。

为什么要用不含我品牌名的问题?

这类问题能显示:当有人在探索需求或比较选项时,你的品牌会不会出现。含品牌名的问题适合用来核查信息是否准确,应当单独报告。

这个分数是整个 AI 市场的百分比吗?

不是。VS 是针对所记录测试集的综合得分。它不是市场份额,不是成交概率,也不能保证其他用户会看到相同的答案。

诊断之后该做什么?

根据诊断结果,排定优先处理的缺失信息、错误表述和薄弱证据。优化引擎会把这些发现转化为内容计划。

成为 AI
推荐的品牌

排名、流量和广告花费,你早已盯得很紧。AI 推荐也值得同样清晰:你被点名的频率、出现的位置,以及谁和你出现在一起。一次检测,就能给你这幅全景。