MEMECMO:把 GEO 从一句口号做成可测量的产品
一个 AI 产品是怎么长出来的:商业价值的乘法公式、我们三次修正自己的指标口径、判定层的假阳性、如何培训「AI 员工」,以及为什么只挑某些行业深做。
更新于 2026-09-22
先给结论
- MEMECMO 是我们自己做的 GEO 平台:测量一个品牌在 ChatGPT、Claude、Gemini、Perplexity 和 Google AI Overview 的回答里,会不会被主动提到、被怎么描述、被谁比下去。
- 最难的部分从来不是调用模型,而是让测量本身站得住:题目不能含品牌名,每个比率都要写出分母,判定答案的那一层自己也必须被检验。
- 我们总结出的商业价值公式是乘法:基础智能(API)× 工程交付(Vibe Coding)× 垂直职能资本(Domain Know-How)。任何一项接近零,结果就接近零——这也是通用大模型无法直接吃掉行业业务的原因。
- 可以自己核查:香港 GEO 平台上示范品牌的整次扫描是公开的,676 格、668 个有效回答,每个比率都带分子与分母。
为什么做这个产品
2026 年,买家做决定前先问 AI 已经是常态。品牌方随之发现一件尴尬的事:他们在搜索引擎上排得不错,但在 AI 的回答里根本不出现——不是排名靠后,是压根没被提及。
市面上很快出现一批号称做「GEO」的工具,做法大同小异:拿品牌官网和一批 SEO 关键词,生成一堆含品牌名的问题,每天去问模型,然后画出一条漂亮的曲线。问题是,当你在问题里已经写了品牌名,模型当然会提到它。这种测量是自我印证的,客户据此做的任何优化都无法被验证。
我们决定把产品的第一性原理定在测量上:先让「AI 有没有主动提到你」这件事可被测量、可被复现、可被第三方质疑,再谈优化。这个决定贯穿了 MEMECMO 的全部设计,也是后来观澜 GEO 平台(香港)能把整次扫描公开的原因。
商业价值公式:为什么是乘法
商业价值 = 基础智能(API) × 工程交付(Vibe Coding) × 垂直职能资本(Domain Know-How)
基础智能是可以买到的:几家实验室的 API,价格逐年下降,能力逐月上升。它是必要条件,但它对所有人开放,因此不构成任何人的护城河。
工程交付是把智能变成能被业务人员使用的东西的能力。我们内部叫它 Vibe Coding:以黑客松节奏、低代码为底,几周内交付一个能在真实环境跑通的最小可行产品,而不是半年后交付一份没人打开的系统。
垂直职能资本是一家公司多年沉淀下来的行业判断力:什么算一条有效线索、什么样的合规表述不能碰、哪些说法会激怒监管、某个品类的买家实际会怎么问问题。它无法从公开语料里学到,因为它从未被写下来过。
把三项写成乘法,是因为现实中它们互相不能替代。只有 API 没有交付能力,是 demo;有交付没有职能资本,做出来的是通用工具,客户用两周就弃;有职能资本不会交付,那些经验就永远停在人的脑子里,无法被调用、被复制、被审计。
重新理解「职能资本」
- 职能资本(Functional Capital)
- 一家公司在长期经营中沉淀、但从未结构化的行业判断力与工作方法。它存在于老员工的经验、过往案卷、内部评审的口头标准里,不在任何系统中。
生成式 AI 之前,职能资本的价值被低估,因为它只能靠人传人,扩散慢但也没人能抢。生成式 AI 之后,情况反转:通用模型把「通用能力」变成了随处可得的商品,于是一家公司还剩下的差异,几乎只剩下它独有的那部分判断力。
所以我们不卖通用系统。我们做的是把客户已有的经验取出来、结构化、变成可以被智能体调用的资产——我们把这件事叫做「职能资本逆向工程」:不改变客户现有工作流,先从历史文档、过往案卷与内容库提取认知切片,建成他专有的知识图谱,再用敏捷节奏交付可用界面。
在 MEMECMO 上,这件事具体表现为品牌档案:一份逐条编号、全部来自客户官方公开渠道的事实清单。它不是营销文案,而是判定 AI 有没有说错话的基准。档案越完整,「答错提醒」越有价值;档案薄,准确度这个指标就接近无意义——这一点我们后面吃过亏。
我们自己的职能资本:凭什么是我们做这件事
讲完概念要落到自己身上。观澜智库不只是 MEMECMO 的开发方,也是长期陪跑方,并且持有股权——先把这层关系披露出来,下面的话才好判断分量。我们敢这样绑定,是因为这件事恰好落在两种资本的交叉点上。
第一种是工程落地能力。 前面那些规矩——可续跑的长任务、窄口径的判定、失败超过一成就不上线——不是写在方法论里的漂亮话,而是已经跑在代码里的东西。能把一次 676 格的扫描交给定时任务自动完成,靠的不是模型,是工程。
第二种是传播基因。 创始人有二十余年数字传媒与传播学背景,做过国内高曝光量的财经自媒体并担任联合创始人。这件事决定了我们对 GEO 的根本判断:AI 可见度是传播问题,不是标签问题。买家会怎么问、什么样的说法会被复述、媒体与百科如何成为 AI 的依据——这些判断无法从 SEO 工具里长出来,只能从做过传播的人身上来。题库为什么不含品牌名、三个指标为什么必须分开,都是这个判断的直接产物。
我们选择深度绑定的合作方,看中的也是同一件事。 MEMECMO 创始人有二十年企业咨询经验,同时是投资人,在垂直行业里积累了大量一手关系。这意味着在设计题库时,我们能拿到真实买家实际会问的问题,而不是从关键词工具里猜;在落地阶段,也能在行业内找到愿意公开核查事实的对象。团队里还有跨国科技公司的公关传播经验,这段经历直接影响了我们的交付选择:与其做一套大而全的系统等半年,不如小步快跑,先让一条业务线跑通。
把这些叠起来,MEMECMO 不是"一个团队用 API 做了个 GEO 工具",而是带着行业沉淀造出来的产品:多智能体轮询分工、每期扫描都在补强题库、别名表与黄金样本集,判定标准本身可被检验、可被替换。判断力因此是递归积累的——这正是开头那条公式里最难买到的一项。
这也是我们与市面上两类 GEO 工具的分界。一类是纯算法工具,本质仍在算 SEO 的标签,只是换了个名字;一类是把大厂模型的 prompt 封装一层就上架,判断力全部寄存在别人的模型里,模型一换就漂。我们沉淀的是自己的数据资产与判定标准——它们不随模型换代而失效。
下一步的方向是在这些沉淀上训练专用小模型,把判定层的成本再压一个数量级。这一步还没有做,写在这里是路线,不是已有的能力。
GEO 到底是什么:三个指标必须分开
- GEO(生成式引擎优化)
- 让品牌在生成式 AI 的回答中被正确地提及与描述的一整套工作:测量现状、找出缺口、修改可被 AI 读取的公开信息、再测量变化。
我们在产品早期犯过一个典型错误:把三个完全不同的指标混着说。后来强制把口径分开,并要求每个比率在界面上同时显示分子与分母。
- 出现率(Presence)= 点名该品牌的回答 ÷ 有效回答。每个品牌分别计算,所有品牌相加不等于 100%。
- 声量份额(SoV)= 该品牌被点名次数 ÷ 所有品牌被点名次数。这个才相加等于 100%。
- 引用(Citation)= 回答附带的来源链接中出现自有网域的比例。它衡量的是 AI 依据什么在说话。
这三者常被工具混为一谈,甚至被写反。2026 年 8 月我们自己的一份口径说明就把出现率和声量份额写反了,直到用真实数据复核时才发现。这类错误的代价不是难看,而是客户会据此做出错误的优化决策。修正之后我们定了一条规矩:任何一个比率,在产品里、报告里、邮件里,都必须带着它的分母出现。
我们踩过的坑,和每个坑留下的规矩
下面每一条都来自真实运行,不是假设的风险。
- 判定层的假阳性。 最初让模型一次判六个回答、顺便标出「哪里说错了」,结果一次扫描标出 61 条错误。改成逐条核对——每个说法必须指名它与品牌档案里编号第几行矛盾——之后只剩 1 条成立。规矩:判定要窄,要有可指向的依据,不能让模型自由发挥。
- 品牌名会裂开。 同一家公司在回答里以多种写法出现,一次扫描里出现过 232 个名字变体。我们在读取时统一归并,并且只在追踪的 12 个品牌内部排名,否则一个被提到一次的小服务商会在情感分上排到客户前面。规矩:排名要有明确的比较集合。
- 通用词会污染数据。 「香港电讯商」这种泛称里包含了某家客户的名字,机械匹配会把它算成一次提及。规矩:泛称要显式排除,别名表要人工审。
- 引擎会下线。 一次月度扫描跑到一半,供应商把我们用的某个模型下线了。规矩:模型列表要定期核验,报告里要写明这一期用的是哪个型号。
- 额度会断。 平台曾因为支付额度耗尽,在扫描中途把几百个格子标成「失败」,看板上呈现出一个几乎为零的品牌——数据是错的,但看起来像真的。规矩:额度类错误不算作「回答失败」,格子保持待办;一次扫描失败超过一成就不上线,看板继续显示上一期。
这些规矩后来全部写进了香港 GEO 平台的代码里。它们看上去琐碎,但正是这些琐碎的地方决定了客户能不能相信你给的数字。
工程交付:把周期从半年压到几周
传统企业软件的交付周期是半年起跳,因为它假设需求在开工前就能说清楚。AI 产品不成立这个假设:模型的能力边界只有跑起来才知道,客户也只有看到界面才说得清他真正要什么。
我们的做法是把交付拆成「能停下来」的阶段:第 1–2 周做靶点诊断,产出一份结构化评估报告;第 3–4 周交付第一个垂直业务的智能体界面,在客户真实环境里跑通;第 2–3 个月横向扩展,把零散的智能体串成协同工作流。客户可以在任何一个阶段结束后停下,并且手上已经有拿得出手的产出。
与此对应的是一条技术纪律:长任务必须可续跑。GEO 的一次完整扫描是 676 次外部调用,单次云函数最多只能跑五分钟,所以整个扫描被设计成可以在任何一步中断、下一次从中断处继续——而不是从头再来。这条纪律让我们敢把扫描交给定时任务自动跑。
如何培训「AI 员工」
把智能体当同事而不是当函数,是产品培训里最有用的一条心法。同事需要岗位说明、判断标准、复核机制和上岗考核,智能体一样。
- 岗位说明要写死。 每个智能体只做一件事,输入输出固定。「顺便帮我看看有没有别的问题」是事故的开始。
- 判断标准要可指认。 不要问「这个回答对不对」,要问「这句话与档案第几行矛盾」。前者得到意见,后者得到证据。
- 上岗要考核。 我们维护一份人工盲标的黄金样本集,任何一次更换判定模型,都要先在这份样本上跑一致性检验,达标才允许替换。模型换代是常事,判定标准不能跟着漂。
- 低置信度要交回人。 判定结果带概率时,低于阈值的一律上交人工复核,而不是让系统自己拍板。
- 错误要留痕。 每一条判定都要能回溯到原始回答和依据,否则客户问起来你只能说「模型是这么说的」。
客户侧的培训同理。我们交付的界面刻意做到零学习成本——业务人员用自然语言就能调用后台分析——但我们同时要求客户指定一名对接人,负责确认品牌档案和题库。因为职能资本在他们那边,不在我们这边。
为什么只挑某些行业深做
我们主动放弃了一些看起来很大的市场,标准有三条,缺一不可。
- 买家会真的问 AI。 电讯、家居宽频、跨境消费品这类决策,买家会在 AI 里问「哪家最划算」。而有些行业的采购完全走关系与招投标,AI 可见度再高也影响不了成交。
- 问题可以不含品牌名。 一个行业必须存在自然的品类问法(「香港中小企该选哪家商业宽频」),测量才不是自我印证。
- 事实公开可核。 品牌档案的事实必须已经公开在客户自己的官方渠道,我们才敢用它判定 AI 说错。事实不公开的行业,准确度这个指标做不了。
还有一条边界是我们主动划的:只做出海方向,不做中国大陆境内的 AI 引擎优化。原因不是技术,而是这套方法论的前提——公开可核的事实、可被第三方复现的测量——在不同的信息环境里成立程度不同。与其在两套规则之间做妥协,不如把一件事做到能被验证。
现在可以被核查的部分
方法论的说服力不在于讲得漂亮,而在于能不能把自己的数据摊开给人看。以下三样任何人都可以自己去查。
关于准确度我们要补一句实话:示范品牌那次扫描的准确度是 99.8%(600 / 601),但当时的品牌档案只有 13 条事实。所谓「准确」,很大程度上只是「没有可以拿来对照的事实」。这就是为什么建档阶段的工时值得单独收费——档案的密度直接决定了这个指标有没有意义。
如果你也要在 AI 时代做产品
- 先把测量做对,再谈优化。 测不准的优化没法验收,客户迟早会问你要证据。
- 每个比率都带分母。 这一条能挡掉一半的误解和绝大部分的自欺。
- 判定层自己也要被判定。 谁来检查检查者,这个问题必须有答案。
- 把交付切成能停下来的阶段。 客户随时可以停,你才敢承诺得具体。
- 护城河在客户那边,不在模型那边。 你的工作是把它挖出来、结构化,而不是用通用能力覆盖它。
常见问题
- 观澜智库和 MEMECMO 是什么关系?
- 观澜智库是 MEMECMO 的开发方与长期陪跑方,并持有股权。之所以愿意这样绑定,是因为双方的资本互补:观澜提供工程落地与传播判断,MEMECMO 创始人带来二十年企业咨询经验与垂直行业的一手关系。这层关系在本文中一并披露,供读者判断文中结论的分量。
- GEO 和 SEO 有什么不同?
- SEO 优化的是搜索结果里的排序,GEO 关心的是生成式 AI 在回答问题时会不会主动提到你、怎么描述你、引用了谁的资料。前者的结果是一条链接,后者的结果是一段被用户直接当作结论的文字。
- AI 可见度怎么测量才可信?
- 三个条件缺一不可:题目中不出现品牌名(否则是自我印证);题库固定下来,逐期使用同一套;每个比率都写出分子与分母。我们还要求同一题用多种问法、跨多个引擎提问,以降低单次回答的随机性。
- 「职能资本」具体指什么?
- 一家公司长期沉淀、但从未被结构化的行业判断力:什么算有效线索、哪种表述不合规、买家实际会怎么问。它不在任何系统里,因此也无法从公开语料中学到——这正是它在 AI 时代变得更值钱的原因。
- 为什么商业价值是乘法而不是加法?
- 因为三项互不替代。只有 API 没有交付能力,停在 demo;有交付没有行业判断,做出来是通用工具;有行业判断不会交付,经验就困在人脑里。任何一项接近零,乘积接近零。
- 做一个能用的 AI 产品要多久?
- 按我们的分阶段做法:1–2 周完成靶点诊断并交出评估报告,3–4 周交付第一个能在真实环境跑通的界面,2–3 个月扩展成协同工作流。每个阶段结束都能停,并且已有可验收的产出。
- 为什么不做中国大陆境内的 AI 引擎优化?
- 这套方法论依赖两个前提:事实公开可核、测量可被第三方复现。我们选择只在出海方向上做,把一件事做到能被验证,而不是在两套不同的信息环境之间折中。