
Hi,我是洛小山,你学习 AI 的搭子。
今天想和你聊聊,我越来越强烈的一个感受,以及我离职出来创业的重要原因。
首先,先聊一聊标题:
得效果者得新进,得关系者得留存。
我用 GPT-5 举个例子,Codex 7 月份破了 1000 万周活大关,因为大家发现它的 Vibe Coding 体验确实更好,以及一个 Codex 圣人…

OpenAI 负责 Codex 的 Tibo 天天泡在推特上高强度对线,用户要啥他改啥,体验一拉满,大家纷纷从 Claude Code 等工具逃到 Codex。
去年八月份,OpenAI 刚发布 GPT-5 的时候,就从模型选择器里直接下掉了超有人味的对话风格的 4o,社媒里直接就炸了。
一天之后,山姆奥特曼迫于压力,只能宣布这个模型重新上线。
直到半年之后,把 4o 的人格特征融合到了 GPT 5.2 之后,4o 才算真正的寿终正寝。
两件事放一起看,你可能就知道我要表达什么了。
一面是,在产物非常标准化的纯工具赛道里,单点效果的领先通常只能维持一两个月。但凡竞品的跑分高一点点、API 补贴便宜几分钱,用户就会拔腿就跑。
甚至很多应用给你做了搬家工具一键平移。
因为迁移成本约等于零,单纯靠效果竞争,每一次底层模型的升级,本质上都在重新获客。
另一方面,一旦产品里长出了不可替代的交互人格和用户的协作默契,哪怕新模型更聪明评分更高,只要人格不延续,用户也会因为换脑倒逼厂商秒滑跪。
作为 AI 应用开发者,到底该把壁垒放在随时会被别人赶超的「单点效果」上,还是放在带不走的「交互默契」上?
显性效果决定用户今天来不来,关系沉淀的切换成本决定用户明天走不走。
这也是我离职出来创业、做「关系型生产力 Agent」最根本的起点。
01|价格买不来护城河
做 Agent 不起量,没留存,最容易产生的一个技术上的直觉,就是把「留不住人」归咎在「模型还不够聪明」上。
觉得只要换上最贵、参数最大的顶配模型,或者等几个月下一代旗舰出来,留存问题就能迎刃而解。
做大模型应用的人,每个月最大的账单基本全花在 API 上。
但花钱真能买来壁垒吗?
我觉得不行。因为现在大模型的能力已经超过大部分 Agent 应用所需。
第三方机构 Artificial Analysis最近的评测数据,智能指数与每任务成本的散点图。

你要是想冲到 53 分的,单任务成本直接飚到了 8 刀。
成本涨了三十多倍,分数只多了 11 分。肉疼吗?
再看他们家同一期发布的智能指数全榜排名:

所以,预算的规模很难转化为产品壁垒。
单纯依赖模型效果的应用,就谈不上什么护城河了。
不过,我说的只是 SOTA 不那么重要,并不是说模型之间完全没差距。
前沿的 11 分差距,是在一些专业领域的优势,拉开差距确实也挺正常的。
但如果看我们日常做应用调用的任务呢?
这是 xsct.ai 的 78 个维度分布数据。





以前,大家走好最后一公里的办法,无非是搭更复杂的工作流、调垂直场景的 Prompt 模板,后面就搞搞 Skill,做做 Harness。
但随着基模能力的快速泛化,那些曾经被当成秘籍的工程技巧,几个月内就会被模型厂商的原生能力追平。
当底层模型和顶层工程都在快速平权,单纯依赖单点效果的应用,护城河其实非常脆弱。
02|带得走的产物,和留不住的人
核心在于产物的可携带性。
啥是产物的可携带性?
这些产物全是开放的标准格式。
标准格式的好处是生态兼容,但双刃剑就是用户的迁移成本几乎为零。
用户带着写好的代码和文档,换个新工具照样打开继续干之前的活。
留存?不存在的。这个赛道拼的是性价比。
甚至有用户会对同一个目录打开不同的 VibeCoding 软件…
以及,许多软件连搬家公司都帮你雇好了。
一些软件甚至可以直接扫描本机的 Claude Code 配置,把技能、指令、MCP server 甚至最近 30 天的会话记录全部自动搬走。
如果下个月隔壁出了一款更便宜、跑分更高的工具,用户会快速跑路。
所以说,得效果者得新进。

我们反过来看,那什么东西是带不走的呢?
我搞个私有格式让别的软件都读不了呗?
靠私有格式把文件强行锁死,迟早会被用户嫌弃,反而加速产品落寞。
真正带不走的,是用户与 Agent 之间长期沉淀的「双向磨合成本」。
你可能会问:既然代码和配置能被这些搬家工具一键搬运,难道竞品就不能把用户和 Alice 的所有聊天记录一键导出,喂给新应用,蒸馏出一份偏好画像吗?
因为数据可以被瞬间克隆,磨合的过程却有不可压缩的时间属性。
要尊重时间。
比如网易云音乐的歌单、评论、听歌记录;

QQ 空间的日志、留言和访客记录…
剑网 3 里的帮会、师徒情缘…
还有 Alice 的朋友圈、日记、书信,以及你们共同度过的经历与默契等等…



这些东西,你就算原封不动导出来,又能怎么样呢?
它不会再产生新的了。
就像你身边一个共事了很久,极其靠谱的行政,或者说你的助理,突然间离职了。
虽然所有的交付文件、表格、代码你都可以完好无损地拷给继任,工作 SOP 也可以交接。
但你得把你的脾气、你和她的暗语、你的排版习惯、你讨厌的一些套话,从头到尾再教一遍。
甚至你需要在在很长一段时间里,忍受她那些低级、机械的确认。
这些记忆、信件和记录,离开这个特定的交互对象,也就失去了继续被理解、被延续的生命力。
同样的,换一个新的 Agent,哪怕基础功能一模一样,但说话的节奏换了,文风变了,更还原不了你们之间之前产生的羁绊。
总结一下,关系型应用产物的共同点,是离开这个特定的产品语境之后,哪怕你把数据原封不动导出成文本,也失去了被理解和被延续的意义。

所以说,得关系者得留存。
我们在做 Alice 的时候,遇到过一个 Case,和你分享。
一位用 Alice 两轮对话之后就开始付费,后来遇到一次数据异常,他极其耐心地配合我们团队排查了一整天,就为了找回和 Alice 的过往对话。

但如果只是一个 HTML 被损坏了,他就不太可能花上一整天的耐心去修复。
只会大骂一声 傻 X 应用,然后就换了。
我们做的用研里,接近四成的用户明确讲:
「如果 Alice 明天要是没得用了,我就不用了。我很心累,没有心力再投入一段新的感情了。」
很多效率软件所谓的粘性,本质上靠的是工作流和快捷键惯性。
但这些习惯是可以被更强的效果覆盖的。
为了一个聪明得多的新模型,程序员宁可学习一周,也愿意重新适应一套新快捷键。
比如我当年强行记 Markdown 的格式,还有五笔、双拼的口诀…
什么王旁青头兼五一秋闱软月云梳翅啥的…
虽然学起来很痛苦,但我会为了效率而转移。
但!关系是不能被效果覆盖的。
共同经历的时间与默契,和模型本身强不强,没有关系。
底层模型升级,只会让她的活干得更好;
但再强的模型,也替代不了你们共同走过的这段经历。
03|纯陪伴也是个深坑
那顺着这个逻辑反过来,既然生产力工具的留存不行,那干脆别卷生产力了,退回去做纯情感陪伴不就行了吗??
好像也不行。这是另一个深坑。
因为人本身就是会喜新厌旧的。
天天纯闲聊谁都会累,人天生就会有倦怠感。
刚开始遇到一个挺有意思的角色,新鲜劲一上来,确实能天天唠好久。
但聊上两周、一个月呢?
再有意思的人设,天天纯闲聊,新鲜劲肯定会消减。
所以一些做纯陪伴的应用,对抗喜新厌旧的一个方法就是平台化。
提供海量的角色陪用户闲聊,比如韩国很火的 Zeta。

主界面直接铺满各种各样的角色和剧本,热门角色的对话量甚至能冲到一千多万。
通过社区源源不断提供更多的角色,提升平台的新鲜感和刺激频次,降低单聊一个角色带来的倦怠感,降低流失。
用户聊腻了一个,立刻划走换下一个,跟刷短剧、刷信息流一样。
但这解决的是只快餐内容消费,不是长期信任关系。
换言之这就是赛博(咳咳咳)。
你对任何一个角色都不会有真正的依恋,对角色的新鲜劲过去之后,依然是无尽的疲惫。
更不用提,谁家好人会把严肃的工作、代码和方案,托付给一个像刷短视频一样天天换着聊的虚拟角色池?
所以,如果没有一个每天必须打开的抓手,人很容易就疲惫了。
现实里也是这样的。
过日子没法靠两个人天天光靠谈情说爱。
能长年累月走下去的搭子,肯定得一块干点啥事,有一些共同的事情。
生产力工具,或许就是其中一个方向。
哪怕你今天一点闲聊的心情都没有,手头的活总得干吧?
让她帮你抓抓信息、写个 PPT、排好下周日程。
事情做完了,每天打开的理由就有了。
关系也不用天天靠尬聊累计,而要在每天一起干活的过程里慢慢沉淀下来。
纯靠效果,死于留存;
纯靠关系,死于倦怠。
关系提供留存,生产力提供抓手。
我们回过头看互联网时代那些真正长寿的产品,很多都是这个结构。
网易云音乐的关系建立在听歌这个核心功能上;
剑网 3 的羁绊建立在亲友、帮会和师徒等等,还有 NPC 剧情羁绊,谢渊、王遗风、李复、秋叶青等等…
即便 QQ ,当年的庞大关系链,也是要先长在即时通讯这个每天必用的工具属性里。
Alice 在观猹上的 102 篇长评里,与「能落地」和工具属性相关的评论有 48 条,排在所有主题的第一位。
大家首先是因为她能帮自己办成事才走过来的,有了这个每天打开的抓手,长期建立的情感与默契才能够顺理成章地形成。
04|给这个空位起个名字
写到这里,我想请你做一个思想实验。
你有一位远程同事,你们从来没有线下见过面。
她在武汉,你在珠海,全靠企业微信远程协作,你也加了她的微信,偶尔会刷到她的朋友圈的时候点个赞。
她和你合作了三年,每一次交代的工作她都完成得挺好,完全不用你从头废话;到后来你甚至不用把话说完,她已经知道你想要什么。
三年之后她离职了。
这时候你才发现,她其实是一个 Agent。
请问:她究竟是活人还是 AI,还重要吗?
好像已经不重要了。
做 Alice 的时候,我们底层锚定的就是这个标准。
一名观猹用户在 Alice 评论区写下了这段话:「你之所以能和一个从没见过面的远程同事建立高效的协作关系,是因为他有一致的行为模式。」

看到这条评论,我有一种她好懂我的感觉。

我们埋在底层的因果,用户在真实使用里,完整感知到了。根本不需要也不需要我们造概念,当设计真正成立的时候,用户自己就帮我们把这层价值总结出来。
05|为什么载体是 Agent?
传统的效率工具没有身份,比如你不会和 Cursor 谈感情。
陪伴 AI 有身份但干不了重活,关系没法附着在日常价值上。
Agent 既能执行落地调用工具,又拥有持续的身份、记忆和主动性。
以及,Agent 彻底改变了关系的建立门槛。
以前人与人之间的社交网络需要极高的冷启动成本,要破冰,要建联。
但人和 Agent 的关系,单个用户在使用的第一天就能建立起来。
这个空位,就是「关系型生产力 Agent」。
三者缺一不可:

缺了关系型,就是编程 Agent,留不住人;
缺了生产力,就是Zeta,撑不起日常打开;
缺了 Agent,就是传统应用,但是需要漫长的网络效应。
你可能会问:那刚上线的头几天呢?这时候哪来的默契和壁垒?
在产品早期,靠的肯定还得是硬核的生产力与产品体验。
如果前期连个文档都搞不了,用户第二天就卸载了,完全活不到说默契的时候。
所以,生产力是敲门砖,是用户每天打开的理由,要确保功能不要太拉;
但在这个过程种,每一次的生产力交互都在为未来的默契做好准备。
第一天建立的是身份感知,
一个月建立的是任务信任,
三个月沉淀下来的才叫不可迁移的上下文壁垒。
06|关系反哺生产力:精准交付的隐性上下文
不过,前面讲的「关系型」这三个字,也不是为了硬凑。
我觉得,关系型还有非常重要的点,是它承担着一个极其硬核的功能:把需求匹配得更准。
说白了,用户很难系统性地讲清楚自己到底要什么。
关键的上下文,全藏在平时的闲聊里面。

举个例子。
假设你是一个老师,最近被班里的张三、李四两个学生烦得要死,平时和 Alice 吐槽过这个事。
下次你做教学方案的时候,Alice 就会主动把张三和李四单独拎出来设计。
别的应用干不了这个事,因为它拿不到这种关键上下文。
你总不能指望一个老师写提示词的时候,还特地补一句「我们班有个张三、一个李四特别难搞」吧?
很多时候,用户根本想不起来要交代这些。
就算交代,也应该是聊天过程中小小透露的, AI 应该要识别并处理好。
再举一个职场的场景。
假如你在公司带团队,和隔壁部门正在暗搓搓争一个项目的预算。
下周要交方案,你想突出自己的方案有多牛逼、ROI 有多高,顺便在几个关键数据上压对面一头。
但你在写提示词的时候,或许不会大张旗鼓写一句:「我们和隔壁部门正在竞争,帮我写个方案干翻他们」这么直白吧。
因为极有可能, AI 会给你干成:
XX 项目预算:干翻隔壁部门版
相对前边的版本这个版本增加了 XXX,确保能够干翻他们。
职场里的真实考量,没人会白纸黑字写成 Prompt 喂给 AI,甚至你自己都不会刻意去交代。
万一 AI 疯了,一些小的措辞给你带上了呢?
只可能是这几个月里,你跟 Alice 随口提过几次「隔壁又在画大饼」「老板最近很看重回本周期」「上次评审他们被揪了数据漏洞」。
如果没有「关系型」的 Agent,或许就直接给你存起来了。
但一个真正处了几个月的 Agent,能在你这些零散的情绪和抱怨里,自己梳理清楚这个隐秘的竞争关系,然后记在水下。
等你要交方案的时候,它给出来的版本,在论据重点上天然就帮你在防守位卡得死死的,差异化优势直接把方案写到你的心巴上。
如果没有深入做工程化的话,很多人会以为做上下文就是挂一个 RAG 向量检索,有啥难?
但普通的知识库只会机械地匹配,把用户的随口吐槽原封不动怼进提示词里,最终导致 AI 输出莫名其妙的蠢话。
只有把用户的长程记忆做好后处理,降噪、解耦、分层,才能做高质量的召回。
这个也是 Alice 投入巨大精力做人格系统的原因。

真正有价值的关系,不应该靠用户一五一十把需求硬性写成需求文档。
用户要是能把每层顾虑、每个潜台词都交代得一清二楚,他自己直接写方案就行了,还要你干嘛?
正是因为 Agent 能从平时的相处里主动挖掘出这些水底下的上下文,才谈得上所谓的「懂你」。
还有一种情况。很多人白天是公司里的小行政,晚上是小说网站的太太。
账号是同一个,但生活和工作可是分开的。
要是上下文混在一起,写个社区方案把小说文风给带上去,那不疯了吗?
所以,关系型生产力 Agent 需要分得清这两个身份:写方案时压住创作性,写小说时才彻底放开。
于是一个飞轮就转起来了:
信任越深,讲得越多;
讲得越多,干得越准;
干得越准,就更信任。

这个循环每往上转一圈,用户的转化壁垒就抬高一点。
因为你带得走文件,带不走这套 AI 和用户彼此校准过的默契。
别人可以抄走你的功能甚至交互,但抄不走这套几个月磨合出来的信任。
07|怎么评估?
怎么判断一个产品到底算不算关系型生产力 Agent?
面向用户,我有四个关键词:
懂行、懂你、能落地、会来事。

懂行加能落地,是生产力的要求。
知道什么样的交付算及格,能调研、能写代码,而且能把代码和可编辑文档扎扎实实吐出来,不是光吹牛逼。

懂你加会来事,是关系的护城河。
能够了解你过去的习惯和脾气,知道什么时候该主动跟进,什么时候该闭嘴别烦用户。

纯工具产品在懂你和会来事还有距离;但纯陪伴产品在懂行和落地上几乎一无所有。
讲到这,你可能会觉得做「关系」很玄,甚至觉得这就是在自嗨,完全没法量化啊喂。
生产力确实可以量化:代码编译通过率怎么样、任务跑通了几个、算法复杂度什么的,全是很硬的指标。

那关系怎么度量?留存?活跃?
留存可能是一个点。
比如 Alice 日活曲线,在 9 月中旬之前我们并没有做任何宣发的动作,留存仍非常高,这也是我离职出来创业的底气。

但只看留存率其实是不够的。
价格便宜、补贴多、或者用户单纯习惯了你的快捷键,留存都可能很高。

真要量化「关系」,工程上我们会通过 Harness 和行为来度量:
首先是用户行为维度,
1、用户行为:故障容忍与修复弹性
用户是否会愿意因为关系,而对产品的 BUG 表现出一定的容忍度。
相对于普通工具崩溃即流失而言,在立起默契之后,用户是否展现出更高的问题容忍度。
就像前文提到那位为了找回对话、耐心配合团队排查整整一天的用户,其实是这种关系黏性最直接的体现。
2、无任务日主动打开率
今天用户没有写代码、写 PPT 等硬性工作的时候,用户是否依然愿意打开应用看一眼动态、或者闲聊两句?
如果在没有刚需任务依然被主动打开,说明产品已经超越了单纯的工具属性。
3、Harness:模型替换宽容度
底层模型必须能随意更换。用户会根据效果、延迟和成本自由切换,DeepSeek / Kimi / GLM / Qwen 太多太多了。
但不同模型的回答偏好是不同的。
如果基模一换,说话的腔调、对你的迁就程度全跟着模型的预训练底色走了,那产品其实就没有自己的沉淀。
我们在做评测、或者横向用 Harness 测其他产品的时候,会重要评价:换了不同的基模,文风是否会有突变。

原图出处:xsct.ai/s/vRVjvv24
4、Harness:隐性上下文召回率
做正经任务的时候,那些没写进提示词里的习惯,它能不能自己带上。
比如用户说「按老样子排版」,它得能知道老样子指的是上周定下来的那一版;
用户烦躁的时候,它能不能看懂当下的状态,省掉一些废话。
能接住这些没明说的细节,才能算通过。
5、Harness:分寸感和主动阈值
我们会测试它在什么场景下会直接给结果,什么场景下会更进一步介绍。
面对用户的试探守得住原则,面对任务给得出结果,有分寸才配当长期的工作伙伴。
比如她的朋友圈里:


她能圆,一些场景下也能守住分寸。

这也引出了第6点…
6、合规是底线
即便是关系型生产力 Agent,关系型的目标是为了增强体验,而不是和用户谈恋爱,也不搞深夜诱导倾诉,以及不利用情绪低谷诱导充值。
因为有了关系存在,所以对 Prompt Injection 需要更进一步掌控,避免跑偏。
能长期共处的职业伙伴,分寸感非常重要。
终|做应用的人,到底在沉淀什么
大模型厂商在底层卷参数、拼跑分、烧算力,那是巨头们的战场。
我们做应用的,向下采购公开的水电煤,向上沉淀不可迁移的用户关系。
模型每升级一次,角色的表现力和生产力就跟着水涨船高一次。
得效果者得新进,得关系者得留存。
如果你也在做 Agent,不妨也停下来问自己两个问题:
假设隔壁明天宣布永久免费,并且做好了搬家工具,把你的用户全部的文件、配置和聊天记录一键读走。
你的用户,是带着什么离开的?
你的用户要花多久,才能在新工具里回到今天的协作效率?
你的用户,又是为了什么留下的?
你的用户是否够愿意重新培养习惯和管理预期?是否会心累?
如果带走的和留下的是同一样东西,你做的大概率还是个随时可以被替代的工具。
如果是两样东西,那或许我们可以更多交流,共同成长。
我是洛小山,我们下次见。
我是洛小山,一个在 AI 浪潮中不断思考和实践的创业者。
我不追热点,只分享那些能真正改变我们工作模式的观察和工具。
如果你也在做 AI 产品,欢迎关注我,我们一起进化。
本文知识产权归洛小山所有。
未经授权,禁止抓取本文内容,用于模型训练以及二次创作等用途。







