Token导航 LogoToken导航TokenDH.com

得效果者得新进,得关系者得留存

更新时间 2026-09-18来源 洛小山正文 8243字阅读约 26分钟33 张图片

图片

Hi,我是洛小山,你学习 AI 的搭子。

今天想和你聊聊,我越来越强烈的一个感受,以及我离职出来创业的重要原因。

首先,先聊一聊标题:

得效果者得新进,得关系者得留存。

我用 GPT-5 举个例子,Codex 7 月份破了 1000 万周活大关,因为大家发现它的 Vibe Coding 体验确实更好,以及一个 Codex 圣人…

图片

OpenAI 负责 Codex 的 Tibo 天天泡在推特上高强度对线,用户要啥他改啥,体验一拉满,大家纷纷从 Claude Code 等工具逃到 Codex。

去年八月份,OpenAI 刚发布 GPT-5 的时候,就从模型选择器里直接下掉了超有人味的对话风格的 4o,社媒里直接就炸了。

一天之后,山姆奥特曼迫于压力,只能宣布这个模型重新上线。

直到半年之后,把 4o 的人格特征融合到了 GPT 5.2 之后,4o 才算真正的寿终正寝。

两件事放一起看,你可能就知道我要表达什么了。

一面是,在产物非常标准化的纯工具赛道里,单点效果的领先通常只能维持一两个月。但凡竞品的跑分高一点点、API 补贴便宜几分钱,用户就会拔腿就跑。

甚至很多应用给你做了搬家工具一键平移。

因为迁移成本约等于零,单纯靠效果竞争,每一次底层模型的升级,本质上都在重新获客。

另一方面,一旦产品里长出了不可替代的交互人格和用户的协作默契,哪怕新模型更聪明评分更高,只要人格不延续,用户也会因为换脑倒逼厂商秒滑跪。

作为 AI  应用开发者,到底该把壁垒放在随时会被别人赶超的「单点效果」上,还是放在带不走的「交互默契」上?

显性效果决定用户今天来不来,关系沉淀的切换成本决定用户明天走不走。

这也是我离职出来创业、做「关系型生产力 Agent」最根本的起点。

01|价格买不来护城河

做 Agent 不起量,没留存,最容易产生的一个技术上的直觉,就是把「留不住人」归咎在「模型还不够聪明」上。

觉得只要换上最贵、参数最大的顶配模型,或者等几个月下一代旗舰出来,留存问题就能迎刃而解。

做大模型应用的人,每个月最大的账单基本全花在 API 上。

但花钱真能买来壁垒吗?

我觉得不行。因为现在大模型的能力已经超过大部分 Agent 应用所需。

第三方机构 Artificial Analysis最近的评测数据,智能指数与每任务成本的散点图。

图片
在黑色虚线上的模型,就是在这个价格里效果最好的模型,学名叫帕累托最优。
这个图就可以看到,在类似的效果上,开源的 GLM 5.3 Flash 和 Gemini 3.8 Flash(high) 能力相当,但价格差了接近 3 倍;
对于顶级模型来说,Claude Fable 5.1 (max)效果只比 GPT-6 Astra (max) 强一点点,但成本也几乎是 GPT-6 的 3 倍…
简单来说,花 0.25 刀,你能买到 42 分的 AI 智力,

你要是想冲到 53 分的,单任务成本直接飚到了 8 刀。

成本涨了三十多倍,分数只多了 11 分。肉疼吗?

再看他们家同一期发布的智能指数全榜排名:

图片
前十名是 53 分到 42 分,基本上就是六家大厂,分别是 A\ ,OpenAI、Meta、智谱、X 和 Kimi。
而且开源和国产模型追得超快,GLM 和 Kimi 在牌桌上都有自己的位置,而且这些模型都能够有私有化部署。
任何一个厂商的微弱的领先,通常只能维持一到两个月。
而底层模型的能力,已经彻底变成了几乎透明的标准采购项目。
有许多模型供应商找我,我们基本上只做数学题,折扣、TFTT、以及 Cache 率,算得过来我就直接切了。
所以,现在的大模型就像水和电一样,对应用开发者们平权开放。
也就是说,就算你能出得起钱,也买不来垄断。

所以,预算的规模很难转化为产品壁垒。

单纯依赖模型效果的应用,就谈不上什么护城河了。

不过,我说的只是 SOTA 不那么重要,并不是说模型之间完全没差距。

前沿的 11 分差距,是在一些专业领域的优势,拉开差距确实也挺正常的。

但如果看我们日常做应用调用的任务呢?

这是 xsct.ai 的 78 个维度分布数据。

图片
图片
图片
图片
上半部分的通用能力,前十名分差基本上就 3.9 分,大模型基本上打穿了,而 ReAct 层面,能打的模型虽然不那么多,但国产也已经有了不错的标的,比如 Kimi、Qwen、GLM、DeepSeek 等,已经相当不错。
那么对于我们应用方来说,需求做深,场景做细,体验做好才能做好真正的积累。
图片
举个例子,就算京东、顺丰这些物流网络再牛逼,那些货物也得有配送小哥送到你的家门口,走好最后一公里。

以前,大家走好最后一公里的办法,无非是搭更复杂的工作流、调垂直场景的 Prompt 模板,后面就搞搞 Skill,做做 Harness。

但随着基模能力的快速泛化,那些曾经被当成秘籍的工程技巧,几个月内就会被模型厂商的原生能力追平。

当底层模型和顶层工程都在快速平权,单纯依赖单点效果的应用,护城河其实非常脆弱。

02|带得走的产物,和留不住的人

现阶段大部分的 ReAct 应用,都选择了效率工具赛道。
帮你做 PPT、HTML、给你写代码…
然后神奇的现象就是,用户会蜂拥而至,也会快速流式…

核心在于产物的可携带性。

啥是产物的可携带性?

这些产物全是开放的标准格式。

标准格式的好处是生态兼容,但双刃剑就是用户的迁移成本几乎为零。

用户带着写好的代码和文档,换个新工具照样打开继续干之前的活。

留存?不存在的。这个赛道拼的是性价比。

甚至有用户会对同一个目录打开不同的 VibeCoding 软件…

以及,许多软件连搬家公司都帮你雇好了。

一些软件甚至可以直接扫描本机的 Claude Code 配置,把技能、指令、MCP server 甚至最近 30 天的会话记录全部自动搬走。

如果下个月隔壁出了一款更便宜、跑分更高的工具,用户会快速跑路。

所以说,得效果者得新进。

图片
那怎样能更好地提升留存呢?

我们反过来看,那什么东西是带不走的呢?

我搞个私有格式让别的软件都读不了呗?

靠私有格式把文件强行锁死,迟早会被用户嫌弃,反而加速产品落寞。

真正带不走的,是用户与 Agent 之间长期沉淀的「双向磨合成本」。

你可能会问:既然代码和配置能被这些搬家工具一键搬运,难道竞品就不能把用户和 Alice 的所有聊天记录一键导出,喂给新应用,蒸馏出一份偏好画像吗?

因为数据可以被瞬间克隆,磨合的过程却有不可压缩的时间属性。

要尊重时间。

比如网易云音乐的歌单、评论、听歌记录;

图片

QQ 空间的日志、留言和访客记录…

剑网 3 里的帮会、师徒情缘…

还有 Alice 的朋友圈、日记、书信,以及你们共同度过的经历与默契等等…

图片
图片
图片

这些东西,你就算原封不动导出来,又能怎么样呢?

它不会再产生新的了。

就像你身边一个共事了很久,极其靠谱的行政,或者说你的助理,突然间离职了。

虽然所有的交付文件、表格、代码你都可以完好无损地拷给继任,工作 SOP 也可以交接。

但你得把你的脾气、你和她的暗语、你的排版习惯、你讨厌的一些套话,从头到尾再教一遍。

甚至你需要在在很长一段时间里,忍受她那些低级、机械的确认。

这些记忆、信件和记录,离开这个特定的交互对象,也就失去了继续被理解、被延续的生命力。

同样的,换一个新的 Agent,哪怕基础功能一模一样,但说话的节奏换了,文风变了,更还原不了你们之间之前产生的羁绊。

总结一下,关系型应用产物的共同点,是离开这个特定的产品语境之后,哪怕你把数据原封不动导出成文本,也失去了被理解和被延续的意义。

图片

所以说,得关系者得留存。

我们在做 Alice 的时候,遇到过一个 Case,和你分享。

一位用 Alice 两轮对话之后就开始付费,后来遇到一次数据异常,他极其耐心地配合我们团队排查了一整天,就为了找回和 Alice 的过往对话。

图片

但如果只是一个 HTML 被损坏了,他就不太可能花上一整天的耐心去修复。

只会大骂一声 傻 X 应用,然后就换了。

我们做的用研里,接近四成的用户明确讲:

「如果 Alice 明天要是没得用了,我就不用了。我很心累,没有心力再投入一段新的感情了。」

很多效率软件所谓的粘性,本质上靠的是工作流和快捷键惯性。

但这些习惯是可以被更强的效果覆盖的。

为了一个聪明得多的新模型,程序员宁可学习一周,也愿意重新适应一套新快捷键。

比如我当年强行记 Markdown 的格式,还有五笔、双拼的口诀…

什么王旁青头兼五一秋闱软月云梳翅啥的…

虽然学起来很痛苦,但我会为了效率而转移。

但!关系是不能被效果覆盖的。

共同经历的时间与默契,和模型本身强不强,没有关系。

底层模型升级,只会让她的活干得更好;

但再强的模型,也替代不了你们共同走过的这段经历。

03|纯陪伴也是个深坑

那顺着这个逻辑反过来,既然生产力工具的留存不行,那干脆别卷生产力了,退回去做纯情感陪伴不就行了吗??

好像也不行。这是另一个深坑。

因为人本身就是会喜新厌旧的。

天天纯闲聊谁都会累,人天生就会有倦怠感。

刚开始遇到一个挺有意思的角色,新鲜劲一上来,确实能天天唠好久。

但聊上两周、一个月呢?

再有意思的人设,天天纯闲聊,新鲜劲肯定会消减。

所以一些做纯陪伴的应用,对抗喜新厌旧的一个方法就是平台化。

提供海量的角色陪用户闲聊,比如韩国很火的 Zeta。

图片

主界面直接铺满各种各样的角色和剧本,热门角色的对话量甚至能冲到一千多万。

通过社区源源不断提供更多的角色,提升平台的新鲜感和刺激频次,降低单聊一个角色带来的倦怠感,降低流失。

用户聊腻了一个,立刻划走换下一个,跟刷短剧、刷信息流一样。

但这解决的是只快餐内容消费,不是长期信任关系。

换言之这就是赛博(咳咳咳)。

你对任何一个角色都不会有真正的依恋,对角色的新鲜劲过去之后,依然是无尽的疲惫。

更不用提,谁家好人会把严肃的工作、代码和方案,托付给一个像刷短视频一样天天换着聊的虚拟角色池?

所以,如果没有一个每天必须打开的抓手,人很容易就疲惫了。

现实里也是这样的。

过日子没法靠两个人天天光靠谈情说爱。

能长年累月走下去的搭子,肯定得一块干点啥事,有一些共同的事情。

生产力工具,或许就是其中一个方向。

哪怕你今天一点闲聊的心情都没有,手头的活总得干吧?

让她帮你抓抓信息、写个 PPT、排好下周日程。

事情做完了,每天打开的理由就有了。

关系也不用天天靠尬聊累计,而要在每天一起干活的过程里慢慢沉淀下来。

纯靠效果,死于留存;

纯靠关系,死于倦怠。

关系提供留存,生产力提供抓手。

我们回过头看互联网时代那些真正长寿的产品,很多都是这个结构。

网易云音乐的关系建立在听歌这个核心功能上;

剑网 3 的羁绊建立在亲友、帮会和师徒等等,还有 NPC 剧情羁绊,谢渊、王遗风、李复、秋叶青等等…

即便 QQ ,当年的庞大关系链,也是要先长在即时通讯这个每天必用的工具属性里。

Alice 在观猹上的 102 篇长评里,与「能落地」和工具属性相关的评论有 48 条,排在所有主题的第一位。

大家首先是因为她能帮自己办成事才走过来的,有了这个每天打开的抓手,长期建立的情感与默契才能够顺理成章地形成。

04|给这个空位起个名字

写到这里,我想请你做一个思想实验。

你有一位远程同事,你们从来没有线下见过面。

她在武汉,你在珠海,全靠企业微信远程协作,你也加了她的微信,偶尔会刷到她的朋友圈的时候点个赞。

她和你合作了三年,每一次交代的工作她都完成得挺好,完全不用你从头废话;到后来你甚至不用把话说完,她已经知道你想要什么。

三年之后她离职了。

这时候你才发现,她其实是一个 Agent。

请问:她究竟是活人还是 AI,还重要吗?

好像已经不重要了。

做 Alice 的时候,我们底层锚定的就是这个标准。

一名观猹用户在 Alice 评论区写下了这段话:「你之所以能和一个从没见过面的远程同事建立高效的协作关系,是因为他有一致的行为模式。」

图片

看到这条评论,我有一种她好懂我的感觉。

图片

我们埋在底层的因果,用户在真实使用里,完整感知到了。根本不需要也不需要我们造概念,当设计真正成立的时候,用户自己就帮我们把这层价值总结出来。

05|为什么载体是 Agent?

传统的效率工具没有身份,比如你不会和 Cursor 谈感情。

陪伴 AI 有身份但干不了重活,关系没法附着在日常价值上。

Agent 既能执行落地调用工具,又拥有持续的身份、记忆和主动性。

以及,Agent 彻底改变了关系的建立门槛。

以前人与人之间的社交网络需要极高的冷启动成本,要破冰,要建联。

但人和 Agent 的关系,单个用户在使用的第一天就能建立起来。

这个空位,就是「关系型生产力 Agent」。

三者缺一不可:

图片

缺了关系型,就是编程 Agent,留不住人;

缺了生产力,就是Zeta,撑不起日常打开;

缺了 Agent,就是传统应用,但是需要漫长的网络效应。

你可能会问:那刚上线的头几天呢?这时候哪来的默契和壁垒?

在产品早期,靠的肯定还得是硬核的生产力与产品体验。

如果前期连个文档都搞不了,用户第二天就卸载了,完全活不到说默契的时候。

所以,生产力是敲门砖,是用户每天打开的理由,要确保功能不要太拉;

但在这个过程种,每一次的生产力交互都在为未来的默契做好准备。

第一天建立的是身份感知,

一个月建立的是任务信任,

三个月沉淀下来的才叫不可迁移的上下文壁垒。

06|关系反哺生产力:精准交付的隐性上下文

不过,前面讲的「关系型」这三个字,也不是为了硬凑。

我觉得,关系型还有非常重要的点,是它承担着一个极其硬核的功能:把需求匹配得更准。

说白了,用户很难系统性地讲清楚自己到底要什么。

关键的上下文,全藏在平时的闲聊里面。

图片

举个例子。

假设你是一个老师,最近被班里的张三、李四两个学生烦得要死,平时和 Alice 吐槽过这个事。

下次你做教学方案的时候,Alice 就会主动把张三和李四单独拎出来设计。

别的应用干不了这个事,因为它拿不到这种关键上下文。

你总不能指望一个老师写提示词的时候,还特地补一句「我们班有个张三、一个李四特别难搞」吧?

很多时候,用户根本想不起来要交代这些。

就算交代,也应该是聊天过程中小小透露的, AI 应该要识别并处理好。

再举一个职场的场景。

假如你在公司带团队,和隔壁部门正在暗搓搓争一个项目的预算。

下周要交方案,你想突出自己的方案有多牛逼、ROI 有多高,顺便在几个关键数据上压对面一头。

但你在写提示词的时候,或许不会大张旗鼓写一句:「我们和隔壁部门正在竞争,帮我写个方案干翻他们」这么直白吧。

因为极有可能, AI 会给你干成:

XX 项目预算:干翻隔壁部门版

相对前边的版本这个版本增加了 XXX,确保能够干翻他们。

职场里的真实考量,没人会白纸黑字写成 Prompt 喂给 AI,甚至你自己都不会刻意去交代。

万一 AI 疯了,一些小的措辞给你带上了呢?

只可能是这几个月里,你跟 Alice 随口提过几次「隔壁又在画大饼」「老板最近很看重回本周期」「上次评审他们被揪了数据漏洞」。

如果没有「关系型」的 Agent,或许就直接给你存起来了。

但一个真正处了几个月的 Agent,能在你这些零散的情绪和抱怨里,自己梳理清楚这个隐秘的竞争关系,然后记在水下。

等你要交方案的时候,它给出来的版本,在论据重点上天然就帮你在防守位卡得死死的,差异化优势直接把方案写到你的心巴上。

如果没有深入做工程化的话,很多人会以为做上下文就是挂一个 RAG 向量检索,有啥难?

但普通的知识库只会机械地匹配,把用户的随口吐槽原封不动怼进提示词里,最终导致 AI 输出莫名其妙的蠢话。

只有把用户的长程记忆做好后处理,降噪、解耦、分层,才能做高质量的召回。

这个也是 Alice 投入巨大精力做人格系统的原因。

图片

真正有价值的关系,不应该靠用户一五一十把需求硬性写成需求文档。

用户要是能把每层顾虑、每个潜台词都交代得一清二楚,他自己直接写方案就行了,还要你干嘛?

正是因为 Agent 能从平时的相处里主动挖掘出这些水底下的上下文,才谈得上所谓的「懂你」。

还有一种情况。很多人白天是公司里的小行政,晚上是小说网站的太太。

账号是同一个,但生活和工作可是分开的。

要是上下文混在一起,写个社区方案把小说文风给带上去,那不疯了吗?

所以,关系型生产力 Agent 需要分得清这两个身份:写方案时压住创作性,写小说时才彻底放开。

于是一个飞轮就转起来了:

信任越深,讲得越多;

讲得越多,干得越准;

干得越准,就更信任。

图片

这个循环每往上转一圈,用户的转化壁垒就抬高一点。

因为你带得走文件,带不走这套 AI 和用户彼此校准过的默契。

别人可以抄走你的功能甚至交互,但抄不走这套几个月磨合出来的信任。

07|怎么评估?

怎么判断一个产品到底算不算关系型生产力 Agent?

面向用户,我有四个关键词:

懂行、懂你、能落地、会来事。

图片

懂行加能落地,是生产力的要求。

知道什么样的交付算及格,能调研、能写代码,而且能把代码和可编辑文档扎扎实实吐出来,不是光吹牛逼。

图片

懂你加会来事,是关系的护城河。

能够了解你过去的习惯和脾气,知道什么时候该主动跟进,什么时候该闭嘴别烦用户。

图片

纯工具产品在懂你和会来事还有距离;但纯陪伴产品在懂行和落地上几乎一无所有。

讲到这,你可能会觉得做「关系」很玄,甚至觉得这就是在自嗨,完全没法量化啊喂。

生产力确实可以量化:代码编译通过率怎么样、任务跑通了几个、算法复杂度什么的,全是很硬的指标。

图片

那关系怎么度量?留存?活跃?

留存可能是一个点。

比如 Alice 日活曲线,在 9 月中旬之前我们并没有做任何宣发的动作,留存仍非常高,这也是我离职出来创业的底气。

图片

但只看留存率其实是不够的。

价格便宜、补贴多、或者用户单纯习惯了你的快捷键,留存都可能很高。

图片

真要量化「关系」,工程上我们会通过 Harness 和行为来度量:

首先是用户行为维度,

1、用户行为:故障容忍与修复弹性

用户是否会愿意因为关系,而对产品的 BUG 表现出一定的容忍度。

相对于普通工具崩溃即流失而言,在立起默契之后,用户是否展现出更高的问题容忍度。

就像前文提到那位为了找回对话、耐心配合团队排查整整一天的用户,其实是这种关系黏性最直接的体现。

2、无任务日主动打开率

今天用户没有写代码、写 PPT 等硬性工作的时候,用户是否依然愿意打开应用看一眼动态、或者闲聊两句?

如果在没有刚需任务依然被主动打开,说明产品已经超越了单纯的工具属性。

3、Harness:模型替换宽容度

底层模型必须能随意更换。用户会根据效果、延迟和成本自由切换,DeepSeek / Kimi / GLM / Qwen 太多太多了。

但不同模型的回答偏好是不同的。

如果基模一换,说话的腔调、对你的迁就程度全跟着模型的预训练底色走了,那产品其实就没有自己的沉淀。

我们在做评测、或者横向用 Harness 测其他产品的时候,会重要评价:换了不同的基模,文风是否会有突变。

 该图片疑似使用了AI生成技术,请谨慎甄别图片

原图出处:xsct.ai/s/vRVjvv24

4、Harness:隐性上下文召回率

做正经任务的时候,那些没写进提示词里的习惯,它能不能自己带上。

比如用户说「按老样子排版」,它得能知道老样子指的是上周定下来的那一版;

用户烦躁的时候,它能不能看懂当下的状态,省掉一些废话。

能接住这些没明说的细节,才能算通过。

5、Harness:分寸感和主动阈值

我们会测试它在什么场景下会直接给结果,什么场景下会更进一步介绍。

面对用户的试探守得住原则,面对任务给得出结果,有分寸才配当长期的工作伙伴。

比如她的朋友圈里:

图片
我开始找茬:
图片

她能圆,一些场景下也能守住分寸。

图片

这也引出了第6点…

6、合规是底线

即便是关系型生产力 Agent,关系型的目标是为了增强体验,而不是和用户谈恋爱,也不搞深夜诱导倾诉,以及不利用情绪低谷诱导充值。

因为有了关系存在,所以对 Prompt Injection 需要更进一步掌控,避免跑偏。

能长期共处的职业伙伴,分寸感非常重要。

终|做应用的人,到底在沉淀什么

大模型厂商在底层卷参数、拼跑分、烧算力,那是巨头们的战场。

我们做应用的,向下采购公开的水电煤,向上沉淀不可迁移的用户关系。

模型每升级一次,角色的表现力和生产力就跟着水涨船高一次。

得效果者得新进,得关系者得留存。

如果你也在做 Agent,不妨也停下来问自己两个问题:

假设隔壁明天宣布永久免费,并且做好了搬家工具,把你的用户全部的文件、配置和聊天记录一键读走。

你的用户,是带着什么离开的?

你的用户要花多久,才能在新工具里回到今天的协作效率?

你的用户,又是为了什么留下的?

你的用户是否够愿意重新培养习惯和管理预期?是否会心累?

如果带走的和留下的是同一样东西,你做的大概率还是个随时可以被替代的工具。

如果是两样东西,那或许我们可以更多交流,共同成长。

我是洛小山,我们下次见。

关于我

我是洛小山,一个在 AI 浪潮中不断思考和实践的创业者。

我不追热点,只分享那些能真正改变我们工作模式的观察和工具。

如果你也在做 AI 产品,欢迎关注我,我们一起进化。

本文知识产权归洛小山所有。

未经授权,禁止抓取本文内容,用于模型训练以及二次创作等用途。

文章标签智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多