怎么证明数据来源可信?不能自己说数据是从 AI 编出来的吧?▾
AI 在这里是我们「测量的对象」,不是「编数据的来源」。所有结论都能追溯到两类可复现证据:一是 AI 侧——把真实问题发给真实的豆包、Kimi、ChatGPT 等,原样记录下回答、时间戳和截图;二是 UGC 侧——小红书等平台的真实评论语料,报告会附原文引用,可以回溯到原帖。简单说:每个结论都能翻回原始的评论或 AI 回答截图,你可以自己重新跑一次验证。
跟千瓜这类平台数据工具有什么区别(除了多了 AI)?▾
三层区别:① 测的东西不一样——千瓜测的是小红书站内的笔记、达人、声量数据,我们测的是「AI 引擎里你会不会被提到、被推荐、说得对不对」,这一层千瓜看不到;② 我们不只测单一平台,是多个 AI 引擎加 UGC 数据交叉验证;③ 交付的是决策建议,不是数据面板——报告会直接告诉你「你的第一对手是谁」「哪些资产该优先补」,而不是丢一堆数字让你自己看。
豆包等平台的引用(citation)里小红书、抖音很少、大多引官网,这样真的有用吗?▾
「被引用」(citation)和「有影响」(influence)是两件事。AI 回答「地址、房价、设施」这类事实型问题时,会找官网、百科这类权威稳定来源来引用,所以 citation 里官网多是正常、健康的现象。但 AI 判断「推不推荐你、用什么词形容你、语气正不正面」,靠的是全网被讨论的量级——这一层小红书、抖音这类 UGC 是主力,不一定会以 inline citation 的形式出现,但它决定了 AI 在「推荐类」问题里会不会主动说出你。简单说:事实型问题看官网,推荐/发现型问题看 UGC 声量,两者都重要,只是分工不同。
你们看到的数据是平台真实数据还是估算数据?能给到平台搜索量级吗?▾
数据是真实实测:AI 侧把真实问题发给真实的豆包、Kimi、ChatGPT 等,原样记录回答;小红书声量数据是真实抓取,不是估算或建模推测的数字。但「平台搜索量级」(比如某关键词一个月被搜多少次)不是我们的指标,那是巨量算数、百度指数这类工具的范畴,我们不做这个。
平台能看到哪些核心数据?▾
品牌在各 AI 平台的出现率(SOV)、推荐排名(首推率/前三率)、AI 引用你的信息对不对(讲对率),以及跟竞品的差距对比,这些都是核心指标,也是每份审计报告的主体内容。
能不能直观展示做了 GEO 前后的数据变化?▾
可以。每次审计都会存一份带时间戳的快照,累积起来就能对比「做之前 vs 做之后」的曲线变化——这是证明「做了真的有用」最直接的证据。要提醒的是,「after」需要跑完一个完整的优化周期(通常至少一个月)才看得出来,不是当天见效。
市场情报的行业排行榜,是拿什么问题去问 AI 的?▾
不是拿各家自己审计的题目——那样每家题目不同,排名不能比。排行榜用的是一套全行业统一的标准问题库(酒店垂直目前 28 题),所有品牌问同一批题,SOV 才有横向可比性。每道题由 6 个中文模型(豆包 / Kimi / DeepSeek / 文心 / 通义 / 混元)各答一次,按跟审计一致的排名加权计分,再平均。题目是真实旅客问法(顶级推荐、地标附近、商务出差、蜜月、亲子、设计感…),分「分城市」与「全国通用」两类,而且有城市感知过滤:只有全国通用题+你所在城市的题才会拿来问你,不会拿北京的题去问广州的酒店。
GEO 有没有行业标准?你们的指标是按什么定的?▾
有。中国商务广告协会 2026 年 9 月发布了《生成式引擎优化(GEO)》五项团体标准(T/CAACCHINA 001~005-2026),其中第 3 部分《计价、评估与测量规范》定义了 9 项核心指标:可见率(提及率,可按 TOP1/TOP3 位序分算)、AI 情感中正率、可见份额、平均排名、指定信息正确率、指定信息覆盖率、信源数量引用率、信源问题引用率、语义一致性。我们报告里的指标可以对应过去:体感覆盖率对应「可见率」、首推率/前三率对应「可见率-TOP1/TOP3」、讲对率对应「指定信息正确率」、引用感知率对应「信源问题引用率(指定信源=官网)」。标准也把服务商分成六类,我们属于「数据监测型」——做 GEO 表现监测、引擎结果页采集分析和效果报告,不做内容铺量、不做信源建设。标准还要求采集参数(引擎版本、是否联网、是否深度思考、模式、城市、日期范围)写进报告,我们的报告页会逐步补齐这张「采集组参数表」。