8月1日,在 AI Engineer World’s Fair 的台上,Jev的创始人Diogo Almeida 用了一种很少见的方式介绍自己。
他参与过 GPT-4、ChatGPT 和 InstructGPT 的工作,也参与了 RLHF 这套后训练范式的建立。但他告诉台下:自己是少数会公开批评 ChatGPT 的 OpenAI 前员工之一。
这不是一个离开旧世界后才有的姿态。他站在旧世界内部,而且曾经相信过它。
这使得他接下来的问题显得格外有重量:
模型聊天已经这么强了,自动化到底在哪里?
这句话背后,其实压着当下 AI 行业最奇怪的一组矛盾。
一边是近乎失控的乐观。基准被不断攻克,模型会推理、会写代码、会调用工具,能完成的任务越来越长。另一边是同样有道理的怀疑:如果 AI 已经如此强大,为什么大多数企业软件的变化,仍然只是侧边栏里多了一个聊天框?为什么今天最流行的产品形态,依然是 ChatGPT,或者一个更强的 Claude Code?
两边都在说事实。
模型能力确实在跃迁。
真正无人值守的自动化,也确实没有随之发生。
Almeida 没有急着站队。他把这件事重新摆了一遍。
他让人先看一个几乎荒谬的反差:模型已经能够处理极难的数学、编程和研究任务,但一家普通企业仍然不敢把一次退款、一次风控、一次客服升级,放心交给 AI 独立判断。
左边的任务看上去困难得多,AI 却常常表现惊人。
右边的任务看上去简单得多,人却迟迟不能离开。
在他的演讲里,这是一个分水岭。
一、三条路摆在面前,他怀疑前两条都还不够
AI 的后训练大致有三条越来越清晰的道路。
第一条,是已经征服世界的 RLHF。
它把人类偏好放进训练回路里,让模型学习怎样更有帮助、更自然、更符合人的期待。它造就了 ChatGPT,也奠定了今天绝大多数 AI 产品的体验基础。
第二条,是正在被推理模型推向前台的 RLVR。
它把重点放在可验证的正确性上。数学题有没有算对,代码能否通过测试,证明是否成立。它让模型愿意花更多计算去寻找一个能被外部验证的答案。
第三条,是 Almeida 想走的路RLCD。
它不以取悦人类为目标,也不把一切都压缩成“对或错”的封闭任务。它想让模型在复杂、真实、并不总有标准答案的软件环境中,给出带校准置信度的结构化判断。
RLHF:人类偏好
RLVR:可验证正确性
RLCD:校准后的决策这三条路的差别,在问三种不同的问题。
RLHF 问:这个回答会不会让眼前的人满意?
RLVR 问:这个结果能不能被证明为对?
Almeida 想问:当软件必须自己行动时,它知道自己有多大把握吗?它能不能在不确定时停下来、升级、交给更强的模型或人?
这时,他看见了一个很多人一直绕开的事实。
Claude Code 再强,依然属于协助时代。
它当然能写出比很多人更快的代码,也能帮开发者拆任务、找 bug、调用工具。但它仍然围绕一个人工作。人定义任务,人看过程,人承担试错成本,人决定什么时候信它、什么时候停它。
这是它的设计目标。
Almeida 说,所有“人仍然在回路里”的任务,目的本来就是取悦、辅助、放大这个人。
而自动化恰好相反。
自动化的目标,是把人移出回路。
它理想中的形态,不是一个人盯着对话框、不断输入下一句提示词,而是一个运行在后台的系统。它安静地处理状态、做出判断、承担重复工作。像今天许多稳定运行的遗留软件一样,平时根本没人想起它。
这也解释了那个荒谬的反差。
模型能写一段让人拍手的代码,并不意味着它适合在没有人看的后台,独立判断一笔高风险赔偿该不该通过。
模型能在对话里显得聪明,也不意味着它知道自己什么时候不该行动。
这是 Almeida 对前两条路产生不满意的起点。
RLHF 太擅长人类在场时的协助。
RLVR 很适合有明确裁判、明确答案的封闭问题。
但大量真实软件任务,恰好处在两者之间。它们没有一道数学题那样的唯一答案,也不能把“看起来合理”当作正确。
它们需要的,是一种能在不确定中做决定,同时把不确定性显露出来的智能。
这才是 Jev 的思想来源。
如果目标变成了无人值守的自动化,为什么还要沿用为人类对话而设计的整套技术形状?
二、他先看见了“更聪明的软件”迟迟没有出现
Almeida 在演讲里还有一个观察,特别能说明这种不满意来自哪里。
过去几年,写软件这件事变得越来越便宜。
代码可以更快生成,原型可以更快搭建,一个人能完成过去一个小团队的工作量。
但软件本身,似乎没有因此真正变得更聪明。
大量 B2B SaaS 的底层能力没有发生根本变化,只是在已有产品旁边挂上了一个聊天助手。你可以问它问题,让它帮你写邮件、找文档、总结表格,甚至替你做一些局部操作。
可软件依然很少真正理解自己的状态,持续做出可靠判断,再把一份机械、重复、边界清楚的工作安静地完成。一个天生为协助设计的模型,最自然的落点就是“在旁边帮你”。
它很难直接成为软件本身的一部分。
Almeida说,下一个时代不是 Claude Code 时代
在他看来,它仍然属于 ChatGPT 时代的延伸:界面变了,从聊天框变成终端;人和模型的关系没有根本变,模型依然围绕人的即时判断工作。
他更在意的是另一件事:
AI 能不能不只把软件写得更便宜,也让软件本身获得新的表达力?
如果答案是可以,那么软件的基本积木也该改变。
过去的软件由规则、数据库、工作流、函数和界面组成。
未来的软件里,或许会多出一类东西:
状态
→ 判断
→ 置信度
→ 分支
→ 升级Jev 是对这类积木的一次尝试。
TypeSafe 将它描述为一种面向程序状态的模型:输入不是一段等待人阅读的提问,输出也不是一段等待人理解的文字,而是软件可以直接调用的类型化决策与概率。
他把变化一路推到了:
目标函数
→ 训练方式
→ 输出空间
→ 推理方式
→ API
→ 软件架构如果世界观真的变了,API 也不该和以前长得一模一样。

三、技术品味不是“复杂不好”,而是知道复杂该由谁承担
很多人听到这里,会把它概括成一句很熟悉的话:
少即是多。
但真正好的技术设计,从来不只是删东西。
它更难的部分,是知道哪些东西删不掉,只能搬家。
关系数据库没有消灭数据管理的复杂性。
数据仍然要存储、索引、更新、恢复。它只是把“沿着数据结构导航”“理解底层存储方式”的复杂性,从应用开发者身上移交给数据库系统。
MapReduce 没有消灭分布式计算的复杂性。
机器仍然会宕机,数据仍然要分片,网络仍然会失败。它只是把这些复杂性压进 runtime,让用户只表达自己真正关心的计算逻辑。
Unix 也不是因为讨厌复杂而成功。
Thompson 和 Ritchie 面对 Multics 时,真正想保留的是交互式计算和程序之间能够组合的环境。他们扔掉的,是承载这些价值时已经变得过重的体系负担。
所以,技术品味更接近:
我能分辨什么复杂性是本质的,什么复杂性只是历史留下来的;我知道前者该由谁承担,后者该从哪里移走。
Jev 的重构也可以这样理解。
复杂推理仍然属于真正需要它的场景。
但软件内部的大量高频、小颗粒度决策,也许应该有自己的接口。
把复杂放回正确的位置。
四、真正改写系统的人,往往是“失望的局内人”
回到 Almeida 身上,会发现他和 Unix 团队之间有一种相似。
他们都不是从零开始反对一切的人。
他们先经历过旧范式的高光,但时时看到了一种异常。
Almeida 参与过让模型更会遵循人类意图的工作。RLHF 的成功并不需要被否认。它让大模型从“会续写文本”变成了今天人们愿意交谈、愿意使用的助手。
Unix 团队也不是不知道 Multics 的先进。
他们正因为体验过它真正好的部分,才知道什么应该留下。
这类人有一种共同的能力。
他们没有把旧系统的成功,当成旧系统永远正确的证据。
他们也没有把旧系统的失败,当成否定一切的理由。
他们知道,旧范式里总有一些东西是必须保留的。
也总有一些东西,只是当初的限制、偶然的路径、组织的惯性,后来被误当成了世界本身。
这大概就是技术品味最难训练的地方。
一个完全不了解旧系统的人,也能说“删掉它”。
但他不知道删掉之后,什么会一起消失。
一个真正住过旧系统的人,才有机会知道:
- 什么是不能动的;
- 什么是早就该被放下的;
- 什么复杂性应该留在底层;
- 什么复杂性不该继续由用户、程序员或运营人员承担。
所以,技术品味往往不来自“没有包袱”。它来自一种更复杂的经历:你曾经深度进入一套系统,慢慢对它产生不满意,却没有因此失去对它的理解。
这种经历,可以叫作约束学徒期。
更多时候,是因为他长期面对过成本、延迟、失败、用户行为、维护负担和边界条件。那些东西不讲道理,也不会因为你的理论优雅就配合你。
它们一点点教会人:什么是世界不允许删掉的东西。
五、专业能力会给人答案,也会替人决定注意力
这也是为什么,越聪明、越专业的人,有时越难看见范式的问题。
熟悉一种工具之后,人会下意识用它来理解所有问题。
模型专家看到问题,会先想到模型能力。
强化学习研究者会先想到奖励函数。
Agent 工程师会先想到 Harness。
数据库工程师会先想到存储与查询。
但任何专业能力都会慢慢变成一种注意力的默认设置。它不仅告诉你怎么解决问题,也悄悄告诉你哪些问题值得被看见。
Almeida 的特别之处,他参与过它。
他理解它为什么有效。
但当“模型越来越强”与“自动化仍然很差”这两个事实长期并存时,他允许自己把注意力从旧答案上移开。
这比从来没有相信过旧范式更难。
六、技术品味不是不同意所有人
技术品味从来不是“我想得和别人不一样”。
它也不是一句“第一性原理思考”。第一性原理是方法,技术品味更像一种长期形成的判断力。
它先让你在复杂系统里感觉到一个异常。参见黄仁勋的答案,杨振宁的解法
再让你分辨:这到底只是一个 bug,还是旧问题定义已经开始失效。
它让你保留真正重要的东西,丢掉历史遗留的前提。
它让你知道,复杂性不会凭空消失,关键是它最终该由谁承担。
最后,它要求你做出一个新的 primitive 基元,让现实判断你的重构是否成立。
所以,技术品味的终点不是一个漂亮观点。
而是一个系统。
一个在事后看来,好像本来就该如此的系统。
>/作者:王零壹,920.org.cn(AI Research Institute)创始人,港大AIBT研究生,前上市公司 CMO。长期研究 AI 产品、Agent 架构与商业增长,并持续观察技术变迁如何重塑人的工作、判断与生活。
*著有《AIGC从0到1》系列丛书、及东方寓言小说《飞将军》;
*善于洞察先机,中文互联网第1个意识到OpenClaw范式价值的人(1月26日);
关注我,一起AIGC从0到1~







