本文的契机是最近 DeepSeek V4 Pro 上线之后,我在龙虾和 Claude Code 里使劲用、使劲用,结果发现:这玩意儿不花钱。原来说一句话可能少则一两块,多则十块八块就出去了,现在一句话只要几毛钱,甚至几分钱。账单余额怎么也用不完。
DeepSeek V4 Pro 这次是永久降价 2.5 折。这个价格意味着,这款最好的国产模型和开源模型,单价仅是海外模型的几十分之一、国产模型的 1/4。
便宜,是最直接的体感。但便宜背后是什么 —— 降价底气从何而来,会推动周边生态发生什么变化,在 Agent 时代这样一款模型意味着什么 —— 是这一期想聊清楚的事。
所以我们请了 Erlich。我和 Erlich 最早认识,是在 2025 年 3 月前后那波 DeepClaude 出来的时候。当时 DeepSeek 刚把开源推理能力放出来,一夜之间几乎所有闭源模型都把推理能力跟上了,他做了一个把 DeepSeek 推理和 Claude 输出拼在一起的产品,我们这边很多期节目的嘉宾、不少自媒体老师都在他的用户群里。后来到 V4 Pro 永久降价那一刻,他又用 Claude Agent SDK 做了 Proma,一个桌面端 agent 产品,正好接住了价格打下来之后突然放大的调用需求。
他算是踩到 DeepSeek 两轮红利的人。第一轮是 DeepClaude,第二轮是 Proma(https://proma.cool/)。V4 Pro 降价以后,Proma 的活跃用户直接翻倍,日均 Token 消耗翻了 5 倍,DeepSeek 一家就占到 50%。
更有意思的,是他自己怎么看这件事:DeepSeek 为什么敢这么打价格,价格打下去之后哪些人会赚到钱,套壳到底有没有价值,中转站到底是基础设施还是高危地带,以及一个普通人今天到底该怎么开始用 agent。
第一部分:二流程序员的逆袭・一个会写代码但一直不愿承认自己是程序员的人,怎么被大模型重新改造・为什么技术红利往往先落到 "二流人才" 头上・从频繁跳槽的产品经理,到彻底不想再回去上班的独立开发者
第二部分:DeepClaude—— 前 Agent 时代的偶然爆款・DeepSeek 推理加 Claude 输出,为什么当时会比单模型好用很多・API 手发、个人网站充值、没有后台也能把产品做起来・为什么 DeepClaude 是前 Agent 时代的典型产品
第三部分:Proma 的诞生・Claude Code 为什么会在 2025 年全面压过 Cursor 和 Windsurf・从 CLI 到 GUI,普通用户真正缺的是什么・一个通宵零报错的夜晚,Proma 的内核怎么写出来
第四部分:DeepSeek V4 Pro 的价格震撼・从一两块到几分钱,真实体感为什么接近百倍・300 到 600 用户、8 亿到 40 亿 Token 背后发生了什么・华为昇腾 950、DSA、Ingram、OCR 小模型,价格底气来自哪里
第五部分:套壳的价值与中转站的深水・套壳到底值不值钱,值钱的部分到底是什么・Harness、Skills、subagent 到底有没有那么玄・中转站的几层价值,和它最危险的几类风险
第六部分:给普通人的实操建议・今天到底还要不要追那些爆火的开源项目・效率提高之后,责任为什么反而更重了・普通人开始用 AI,最小可行路径是什么
Chapter 1:二流程序员的逆袭 —— 从产品经理到独立开发者
在 DeepClaude 之前,Erlich 更像一个典型的 "懂技术的产品经理"。
Erlich 是软件工程毕业的,也会写代码,可他一直觉得自己写得挺烂,不太好意思把自己当程序员。他的判断是,自己脑子还行,沟通能力也还行,那就去做产品经理,尽量少写代码。这种 "绕着走" 的状态,持续了很多年。
那段时间他最大的情绪是愤怒。他会觉得,很多东西明明很简单,为什么做不出来,为什么大家就是不去做。对开发会生气,对管理层会生气,对公司也会生气。所以那几年他跳槽非常频繁 —— 一年里可能只有一半时间在正经上班,另一半时间在做自己的小项目,或者看别的机会。这是一种典型的 "知道问题在哪、也知道大概要怎么做,却偏偏卡在亲手把它写出来这一步" 的开发者状态。
真正的转折是 2022 年底 ChatGPT 出来之后。2023 年初,他开始重新写代码,然后越来越强烈地意识到一件事:这一轮最大的红利之一,是那些过去够不上顶尖工程师标准、但又不是真的不懂技术的人,终于有机会补上自己缺的那一块。
Erlich 在节目里反复提到一个判断:技术浪潮里真正吃到大红利的,很多时候是 "二流人才"。一流人才在旧体系里本来就过得很好,有位置、有评价体系、有既得利益,未必愿意第一时间冒险去换工具。反而是那些知道自己在旧体系里打不过的人,更愿意拥抱新工具。工具一旦强到一定程度,原来那点差距就被抹平了,甚至会反过来。所谓 vibe coding,做得最顺手的,不一定是传统意义上最顶尖的工程师,反而是这种 "会一点、懂一点、脑子灵、产品感又强" 的人。
这一点他自己有非常直接的体感。2023 年的时候,他跟 ChatGPT 聊着聊着,就把一个 RAG 客服系统写出来了,后端基本都是他自己弄的,还真的上线给用户用了。过去那些学不进去的概念,在实践里一下就通了。原来不是永远学不会,而是过去那套学习和实践的成本太高了。
他的路径也很典型:最早是 ChatGPT 复制粘贴阶段;后面到 Cursor、Windsurf 这种半自动编程阶段;再往后,就是 Claude Code 和 Agent 的阶段。每到一个阶段,他都会多做一点。那时候他基本就是三四天做一个 demo,发到小红书上,有人感兴趣就继续做产品化。这样滚了一个多月,后来就滚到了 DeepClaude。
至于 "不想回去上班",几乎是同步发生的。他当时还在上一家公司,脑子里想的是,能不能在公司里立一个新业务 —— 做一个点单小程序,配合大模型帮小商家做经营决策,比如测盈亏平衡点、算优惠券策略。今天听起来这就是个经营 agent。但老板不信他能做出来。他心里只剩一句话:算了,拜拜了,在这里太耽误我赚钱了。
从那以后,他就一直在做自己的东西。拉群、找用户、做一版死一版,再做下一版。这个过程并不浪漫,更像是不断试、不断错、不断发现自己又能比上一轮多做一些事。直到 DeepClaude 出来,他才第一次觉得,这个东西是真的接上用户了。
Chapter 2:DeepClaude—— 前 Agent 时代的偶然爆款
很多人会把 DeepClaude 记成 DeepCloud,其实是 DeepClaude。这是一个今天回头看特别有时代感的产品,几乎是前 Agent 时代一个标本式的东西。
它的诞生非常偶然。那时候 Erlich 所在的群里有人转了一个产品评测,说有家公司在试一件事:让 DeepSeek 负责推理,让 Claude Sonnet 3.5 负责执行。结果发现,这么拼起来之后,效果比单独用 Sonnet 好很多。
Erlich 当时看到那个评测,第一反应不是 "这理论上成立",而是 "这玩意儿为什么不能给大家更方便地用"。原方案不支持 OpenAI 兼容接口。他干脆自己用 vibe coding 重写了一个兼容版本,让 Chatbox、Cherry Studio 这些工具都能直接接进去。从看到机会到动手,基本就是当天的事。
至于为什么拼接模型在那个时间点会那么有效,Erlich 给的解释相当直白。DeepSeek 当时最强的部分,在于推理链条做得很猛,它会让语义指向更清楚。可以理解成,它先把问题想得更明白,再把这个更清楚的思路交给 Claude 去写、去展开、去组织。这样就会触发 Claude 里更专业、更对路的那块知识。再加上 DeepSeek 这类模型对中文互联网、中国语境、本土知识的覆盖本来就更强,拼起来以后体验就特别明显。
到今天,他都觉得这个逻辑没过时。很多 agent 优化,本质上也还是在做类似的事 —— 让模型更准确地知道自己该往哪一块知识和动作空间里走。DeepClaude 只是一个比较早的、大家能直接体感到的版本。
DeepClaude 对我来说是一个分水岭。从那个项目开始,我才正式把脑放电波的 show notes 和文字稿都切到不再让自己写了。
每期节目我们对外是一两个小时,实际录的时候经常是三到四小时。三四个小时的转录,加上我自己的策划稿,加上预设好的提示词,一股脑丢给它,它就在那吐。在 DeepClaude 之前不是完全做不了,但总差一口气 ——ChatGPT 能写,写出来 "差点意思",不能上生产。DeepClaude 是第一次让我觉得,这玩意儿真能交活了。一次跑下来大概 50 到 100 块,换来一篇可用的 show notes 和长文字稿。
跟我处在同一类需求里的用户其实不少。做小红书文案的,一天要跑几百上千条;媒体写作者,要把大量素材揉进一个统一结构里;还有一批人拿它做论文润色和长文本整理。这些场景的共同点,就是你很难只靠一个短对话窗口解决问题。
更有意思的是,DeepClaude 的早期产品形态非常简单。作为独立开发者,门槛其实没有外界想得那么高 —— 个人网站开了个子页面,充值跳转到一个窗口,用户买完就能直接接入 Chatbox、Cherry Studio 这种客户端。没有什么后台系统,也没有那么多花哨的 UI,但用户照样能跑起来。
今天回头看会觉得有点离谱,但那个阶段恰恰说明一件事:当用户足够痛、产品又刚好够用的时候,没有那么完整的基础设施,也一样可能先跑起来。
DeepClaude 还顺手干了一件事 —— 让很多人第一次习惯了 "通过 API 使用模型"。用户不是去下载一个完整 App,而是装 Chatbox、装 Cherry Studio,再把接口填进去。这一步门槛不算低,但它让一批人比普通消费者更早进入了 "模型即能力层" 的使用方式。
Erlich 后来会把 DeepClaude 称为前 Agent 时代的荣光。那个时候,模型还没强到足够把很多流程自己跑完,需要通过组合、包装、拼接,让它变得更像一个能交付结果的产品。等到模型能力再往上走,大家会发现,单纯拼模型已经不够了,必须开始做 agent,开始做工作流,开始做界面和交互,开始处理真实用户的上下文。这时候 DeepClaude 的历史任务,差不多就完成了。
Chapter 3:Proma 的诞生
从 DeepClaude 走到 Proma(https://proma.cool/),并不是一次简单升级,而是整个范式都变了。Erlich 不再只是把能力转卖出去,而是开始做一个真正意义上的 agent 产品。
转折点大概发生在 2025 年下半年。那段时间他在全国各地做活动,也帮一些朋友的公司快速搭 demo,带他们看怎么把 Web coding 跑起来。刚好赶上 Claude Agent SDK 出来。他拿它做了两个 demo,速度非常快,差不多 20 分钟就能 web 出一个能用的东西,而且效果直接能进业务场景。
那一刻他意识到,新的东西来了。DeepClaude 这种模式当然还能跑,但它会越来越像一个渠道层,而不是最终产品。用户真正需要的,是一个更接近 "任务完成本身" 的东西。
要理解 Proma 为什么会以那种形态出现,得先看清楚 2025 年程序员工具市场的剧变。2023 到 2024 年最火的还是 Cursor 和 Windsurf,但到了 2025 年,Claude Code 的热度已经明显压过去了。很多程序员开始统一迁移到 Claude Code,这不只是模型变强,更是产品思路的差别。Erlich 在节目里把这个差别拆成了四块,相当具体。
第一块是全局探索和局部修改的差别。Cursor 很长时间里默认当前打开的 tab 就是上下文中心,会优先围着眼前那几段代码转。Claude Code 不这么假设。它会先探索整个代码库,理解整体结构,再决定怎么改。这样一来,成功率天然就高很多。
第二块,是它形成了一个很强的自举循环。Claude Code 的创造者 Boris Cherny 本人就在用 Claude Code 开发 Claude Code,每天都在用自己验证自己。这个反馈回路特别短。很多体验问题,在别的团队可能要排期、提需求、过几轮评审,在它这里就是 "我今天写代码的时候就不爽了,那我今天就改"。Erlich 把它形容成 "左脚踩右脚"。
第三块,是它的 UI 很薄。Claude Code 本质上就是 Claude Agent SDK 上面一层很薄的 Terminal UI,所以迭代特别快。Cursor 那种图形界面产品,很多资源要花在界面、交互、插件、兼容性上。Claude Code 因为更轻,节奏快很多 —— 一天迭代五到十个版本,并不是特别夸张的说法。
第四块,是模型协同的优势。Claude 自己最清楚自家模型哪一版强、强在哪,可以更激进地试一些策略。第三方工具很多时候只能等,等模型稳定,等接口,等社区总结经验,天然滞后一点。
可 Claude Code 也有一个非常明显的问题:它太程序员了。这正是 Proma 出场的原因。很多普通人一听 Claude Code,第一反应就是 "这玩意儿只能写代码吧"。再加上 CLI 的形态、安装配置、命令行界面,本身就会筛掉一大批人。
但 Erlich 已经很明确地意识到,Claude Agent SDK 并不是一个只能写代码的东西。今天大家觉得 Manus 能做的事 —— 电脑控制、文件整理、长文本处理、流程化任务,Agent SDK 其实都能做。他想做的事情很简单:把这个能力包起来,让一个普通用户在图形界面里就能直接用。Proma 就是这么出来的。
但 Proma 不是一次就写成的。Erlich 前前后后大概写了四五次。真正成功的那次发生在 2025 年 12 月的一个夜里。他整晚都在 vibe coding,通宵没睡。最神奇的是,那一晚 Claude Code 基本没有出错。Proma 的内核就是那个晚上长出来的。他后来形容那种感觉,就像自己第一次用到 Sonnet 3.5 一样 —— 一旦一个东西开始能稳定地产出不太出错的结构,而且架构还说得过去,它的扩展性就刚刚开始。
GUI 版本一定有人要,这件事在那一晚之后他已经完全没有怀疑。用户不是不需要 agent,他们只是没法接受一个只有终端的人机交互入口。Proma 的定位也很明确:不是 "给最 hardcore 的程序员一个替代品",而是把 agent 这个能力从 CLI 里搬出来,让更多人能碰到它。
还有一个很实际的点 ——Proma 不只支持 Claude。当时国内很多用户其实更想接国产模型,像 DeepSeek、Kimi、MiniMax。Proma 让这些模型也能跑完整的 agent 流程。很多人后来对 agent 有感知,不是因为他们装了 Claude Code,而是因为他们第一次在一个看得懂的界面里,让模型真的帮自己把事做完了。
更有意思的是,Claude Agent SDK 的文档其实一直很少,到今天也只有差不多一页入门说明,很多坑根本没人告诉你。Proma 里很多能力,不是照着文档抄出来的,是 agent 自己一遍一遍探索出来的。这件事让 Erlich 后来越来越相信一个判断:很多工具不是等文档齐了才开始工作,而是先把它跑起来,跑着跑着,文档反而才会慢慢长出来。
Chapter 4:DeepSeek V4 Pro 的价格震撼 —— 从 "舍不得跑" 到 "放开跑"
这一切发展到 DeepSeek V4 Pro 永久降价 2.5 折的那一刻,撞出了真正的烟花。
Erlich 形容那段时间的体感非常强。很多讨论会只盯着公告里的单价变化,但真正做产品、天天盯后台的人,感受不是 "便宜了一点",而是整个调用习惯都改了。以前一句话少则一两块,多一点十块八块很正常。现在同样的任务,前端经常只显示 0.00。这倒不是真的零成本,而是因为单次调用花的费用太少,在收费端已经被四舍五入到两位小数后展示不出来了。
我自己的体感也是这样。原来每说一句话都在掉血,现在变成怎么还没花掉。
真实体感很多时候比表面倍率还更大。拿 V4 Pro 和 Claude Opus 4.6 做比较,账面上看,输入价格考虑 2.5 折以后,大概是十几倍的差距;命中缓存时差距能到更夸张的级别;输出也有几十倍差别。但 Claude 的缓存策略、对话间隔、上下文重用方式,都会让用户的实际体感差距接近百倍。
更关键的是,价格往下一压,需求并不是线性上涨的。很多原来停在边缘的需求,直接进场了。Erlich 后台数据非常明显:活跃用户从 300 多涨到六七百;日均 Token 消耗从 8 亿涨到 40 亿。尤其五一那几天,按道理应该是低谷,结果反而一路在涨。大家一旦意识到便宜到这个程度,就会开始疯狂试场景。
其中超过 90% 的流量都跑到了 DeepSeek。其他模型还在,但更多像补充。DeepSeek 直接变成主力干活的那个。40 亿 Token 换算下来,大概是两三万到三四万次请求,已经不是一个 "小圈子里几个人玩玩" 的量级。
但价格不能凭空降。很多人会说,这是价格战,是补贴,是抢市场,但真做推理的人都知道,价格没有那么容易随便砍。我自己也查了一些资料,节目里也展开聊过 ——DeepSeek 这次能把成本压到这个水平,主要靠两条主线:一条是国产算力,另一条是它过去一年在工程层面做的、行业里还没普遍 follow 的几项优化。
先看硬件这条线。DeepSeek 在 V4 Pro 的价格表里就明确写了,下半年会大规模上华为昇腾 950 的超节点。这个超节点是什么概念?目前比较普遍的推测是,它和英伟达同档芯片的性能差距应该在 5% 以内,但整体硬件成本能压到 1/4 以下。也就是说,付一份英伟达四分之一的钱,拿到几乎一样的算力。更关键的是,目前来看,只有 DeepSeek 这种量级的模型厂商,才能在训练期就拿到华为这种芯片厂商最高优先级的支持,自己也投入了大量适配工作,包括专门针对华为做的算子和技术架构改造。这种 "模型方 + 芯片方" 在训练阶段就深度协同的关系,本身就是别人短时间内复制不了的。
软件这条线,更值得展开。很多人对 DeepSeek 的印象还停留在 V3 和 R1,但其实整个 2025 年内,它还有几个工作,对这次成本下探起到了关键作用。
9 月发布的 DSA,是一种稀疏注意力机制。简单理解就是,模型在扫描上下文的时候,不必把所有上下文一口气全扫一遍,而是先扫上下文的索引或者大板块,再来对关键部分做精读。同样的长上下文场景,计算开销直接被压下来一大截。
10 月发布的是一个 3B 的 OCR 小模型。它的核心能力是:你把一张图片直接喂进去,让它以 OCR 的方式把图里的内容当成上下文来读,token 占用只有正常把同样内容按文本喂给 tokenizer 时的 1/10。也就是说,对图文混合场景做到了大约 10 倍的无损压缩。
到了 2026 年 1 月发布的 Ingram,则是把静态知识丢进 CPU。今天大模型推理的真正瓶颈是显存 —— 显卡贵、显存更贵。DeepSeek 的做法是把知识切成静态和动态两部分,静态部分常驻 CPU,只把动态的、当前热点的知识加载并缓存进 GPU,从而绕开显存瓶颈。
再叠加 DeepSeek 和 Claude 这类模型本身在缓存加载机制上的根本性差异,整个软件工程层面的红利就被一次性兑现了。硬件成本压下来一截,软件工程又压下来一截,所以 V4 Pro 一发出来,价格就能这么夸张 —— 即便和国产同行比,也直接打到对手的 1/4 到 1/2。
Erlich 还在节目里留了一句很有分量的判断:DeepSeek 可能永远不会恢复到原价了。理由是,这次不是临时试探,更像是借一个价格动作,把整条生态链都打通。开发者会跟进做产品,运营商会跟进做推理工程和渠道,研究员会因为用量和反馈继续研究下一代架构。对它来说,价格下去之后,反而会有更大的生态反哺价值。这个价值,可能比一开始少赚那点钱重要得多。
按 R1 时代的经验,每当 DeepSeek 出新旗舰,国内大厂应该一拥而上。但这次很多大厂反而没第一时间接 V4 Pro。Erlich 给出的解释是,时代又变了。R1 那会儿,接入别人模型是一个流量动作,大家还是在做 chatbot 入口。到了 V4 Pro 这一轮,很多大厂已经开始把重点放在自己的代码产品、agent 产品和整个工具生态上了。再去接别人家的开源旗舰,面子上也不太好看。更何况很多国产模型能力其实并不差,大家会更愿意把精力放在 harness、工作流和产品体验上。
还有一个更现实的原因 —— 别人没法复制 DeepSeek 这次的成本结构。市面上甚至能看到反向涨价的产品,这背后并不是他们坏,而是他们不涨价商业模式就不成立。DeepSeek 这次价格动作真正可怕的地方在于,它可能来自一个别人暂时抄不了的成本环境。
Chapter 5:套壳的价值与中转站的深水
价格下来了,大家第一个会想到的,就是套壳是不是又有机会了。能力层更便宜了,产品层好像又能重新做一遍。
套壳当然有价值,而且是长期价值。问题出在 "壳" 这个词被污名化了。很多投资人特别喜欢把壳说得很轻,因为他们需要制造一种叙事落差:上游高贵、下游低级。但普通用户根本不在乎你是不是壳,只要好用,他就会用。
壳真正的价值,是帮用户收集和整理上下文。模型再强,主产品界面也还是有限的。它不可能为每一个人、每一个职业、每一类工作流都单独长出一套交互。壳的意义,就是把这些分化出来。有人更看重情绪照顾,有人更看重决策质量,有人更看重流程化执行,有人更看重跨工具协同。这些差异,是产品层来承接的。
Skills 的出现,进一步坐实了壳的价值。用户一旦开始沉淀自己的 Skills、自己的工作流,这东西就不再只是 "我给你套了个皮肤",而是在累积你的操作习惯、任务偏好和上下文组织方式。拿我自己举例,脑放电波的录制整理流程跟别人就是不一样的,这套流程不会因为模型升级就自动长回主模型里 —— 它只能存在于产品层、存在于壳里、存在于你自己的工作流配置里。
Harness 这件事,其实也有点被神化了。很多时候 Harness 没那么玄。比如 Proma 里有一些效果不错的地方,本质上就是在提示词里多写一句:如果用户反复做同一个任务,还经常纠正,还用了 Skills,那你下次就主动帮他迭代这个 Skill。再加一句:你在积极使用 subagent。很多体验上的改善,就是这么来的。再比如,危险代码的拦截、敏感动作的提醒、执行前多一道确认,也都属于 harness 的一部分。它不是某种神秘技术,更像是你是否真的理解用户任务链路,是否愿意把那些脏活累活补上。
中转站是这一节里 Erlich 反复提醒大家要小心的部分。他一边觉得它有价值,一边又非常直白地讲它的危险。
价值层面是真实存在的。最上层,中转站能帮一些大渠道消化算力、分配资源;中间层,它让用户不必单独持有很多模型账号和接口;底层,它提供更便宜的模型使用方式。所以它不是完全没价值。
但风险也非常实在,Erlich 在节目里几乎是逐条列出来的。第一类,是模型来源不正规。你根本不知道它卖给你的到底是什么,甚至可能是灰产渠道里的东西。第二类,是偷换模型。高峰时段悄悄把高价模型切成便宜模型,普通用户不一定看得出来。第三类,是跑路,这是最常见的消费者风险,他自己就被坑过很多次。第四类,是数据安全。聊天里贴进去的账号、密码、业务信息,很可能全过一遍中间人。第五类,也是 agent 时代特别危险的,是提示词注入。中转站如果在中间塞一段东西,agent 真可能替它执行一些你根本不想执行的动作,甚至给你的电脑装上木马。
这件事不是未来风险,而是已经发生了。保守估计,中国现在的中转站,几万到十几万个都不夸张。很多就是基于一个叫 New API 的开源项目直接搭,稍微会一点的人,就能在一个月内做出一个界面长得差不多的东西。我自己就在飞书群里见过有人一比一仿一个站出来开始拉人。
Erlich 对中转站的总态度,是 "你可以知道它有价值,但别把它当成天然安全的基础设施"。尤其在 agent 时代,问题比以前严重得多。以前你最多是内容被看一眼,现在它可能直接影响执行链路。
正规军开始下场,是另一层信号。运营商开始做话费加 Token 套餐,大公司开始自己下场做分发产品,像猎豹移动的 Easy Router 这类东西冒出来,海外是孙宇晨和特朗普家族也在做类似的事。这些都说明一件事:这个需求已经大到足以驱动大公司认真看它了。它不再只是小开发者的小生意,而是开始进入真正的基础设施视野。
这一节里还有一段稍微敏感的对话。曾经有人来找 Erlich,想买他后台的用户数据。他的回答很直接 —— 他们不记,所以连卖都没法卖。一旦记了,快钱就会赚,但产品就没时间发展了。这句话差不多也回答了为什么有些产品看起来更 "狠":不是它们更聪明,而是它们已经走在另一条路上。
Chapter 6:给普通人的实操建议 —— 别追概念,先把一个小问题跑通
节目最后,Erlich 把话题拉回到普通用户。今天一个不是程序员的人,面对这么多模型、agent、套壳、中转站、工作流概念,到底该怎么开始?他的建议反而非常朴素。
说实话我自己也是被这几年的风潮一波一波割过的人。从 2025 年初的 DeepSeek,到后来的龙虾,每一波都跟着学,时间也搭进去了,事后回头看,真的留下生产力的并不多。所以听到 Erlich 这套建议的时候,我其实是有共鸣的。
第一句话是:先别追概念。也别一上来就研究什么 agent teams、什么多智能体编排、什么 harness 体系。那不是大多数人现在的瓶颈。大多数人的瓶颈,是根本没有一个自己愿意持续尝试的小场景。
他给的最小可行路径很具体。先找一个真实问题 —— 写一篇东西、整理一次会议、处理一个 Excel、跑一个重复性的工作任务。拿任何一个手边能用的免费工具去试,豆包、Kimi、DeepSeek 都行。先把一个很小的问题跑通。第一次不完整没关系,第二次多补半句话,第三次多改一个提示。慢慢地,你会知道模型在哪些环节会听话,哪些环节会出错,哪些地方必须人工校验。
形成这个体感之后,再去沉淀自己的 Skills。你会知道哪些操作总要重复,哪些上下文每次都得交代,哪些结果格式是你真正想要的。到那一步,就已经比大多数只会围观概念的人更接近真正的 AI 用户了。
Erlich 还顺手戳破了一个常见迷信 —— 不要太相信那些最火的开源产品。他承认这是一个偏见:一个产品如果每天要处理几十上百个 PR,它往往就已经没有很强的一致理念了。大家都来改一点,最后方向会很散。不是说开源一定不好,而是爆火之后它会很容易变成一块谁都能啃一口的东西。对普通用户来说,盲目追这种热点,不一定是效率最高的选择。
最后一段聊的是他自己。Erlich 现在还是不想拿投资。他知道那套逻辑会把人带去哪里 —— 一旦拿了,就要开始讲更大的增长、更快的扩张、下一轮融资、更多的人、更高的风险。他不是说这条路不对,只是觉得它不适合自己。对他来说,能有几千个信任你的用户,能让两三个人过得不错,能持续做产品,这就已经很好了。
他今年 30 岁,觉得自己的时间才刚刚展开。Proma(https://proma.cool/) 如果赚到钱,他更想做的事情,也不是立刻把公司做得多大,而是成立一个很小的基金,去投一些真的在一线做事、很朴实、很认真、也许还没被看到的人。先让这些人和他们的产品活下来,比一上来就谈规模,重要得多。







