Token导航 LogoToken导航

Jev创始人Diogo Almeida谈复杂异常感知

更新时间 2026-09-23来源 AIGC从0到1正文 4212字阅读约 14分钟1 张图片
真正有意思的时刻,是 9月15日Jev出现之前。

8月1日,在 AI Engineer World’s Fair 的台上,Jev的创始人Diogo Almeida 用了一种很少见的方式介绍自己。

他参与过 GPT-4、ChatGPT 和 InstructGPT 的工作,也参与了 RLHF 这套后训练范式的建立。但他告诉台下:自己是少数会公开批评 ChatGPT 的 OpenAI 前员工之一。

这不是一个离开旧世界后才有的姿态。他站在旧世界内部,而且曾经相信过它。

这使得他接下来的问题显得格外有重量:

模型聊天已经这么强了,自动化到底在哪里?

这句话背后,其实压着当下 AI 行业最奇怪的一组矛盾。

一边是近乎失控的乐观。基准被不断攻克,模型会推理、会写代码、会调用工具,能完成的任务越来越长。另一边是同样有道理的怀疑:如果 AI 已经如此强大,为什么大多数企业软件的变化,仍然只是侧边栏里多了一个聊天框?为什么今天最流行的产品形态,依然是 ChatGPT,或者一个更强的 Claude Code?

两边都在说事实。

模型能力确实在跃迁。

真正无人值守的自动化,也确实没有随之发生。

Almeida 没有急着站队。他把这件事重新摆了一遍。

他让人先看一个几乎荒谬的反差:模型已经能够处理极难的数学、编程和研究任务,但一家普通企业仍然不敢把一次退款、一次风控、一次客服升级,放心交给 AI 独立判断。

左边的任务看上去困难得多,AI 却常常表现惊人。

右边的任务看上去简单得多,人却迟迟不能离开。

在他的演讲里,这是一个分水岭。

一、三条路摆在面前,他怀疑前两条都还不够

AI 的后训练大致有三条越来越清晰的道路。

第一条,是已经征服世界的 RLHF。

它把人类偏好放进训练回路里,让模型学习怎样更有帮助、更自然、更符合人的期待。它造就了 ChatGPT,也奠定了今天绝大多数 AI 产品的体验基础。

第二条,是正在被推理模型推向前台的 RLVR。

它把重点放在可验证的正确性上。数学题有没有算对,代码能否通过测试,证明是否成立。它让模型愿意花更多计算去寻找一个能被外部验证的答案。

第三条,是 Almeida 想走的路RLCD。

它不以取悦人类为目标,也不把一切都压缩成“对或错”的封闭任务。它想让模型在复杂、真实、并不总有标准答案的软件环境中,给出带校准置信度的结构化判断。

RLHF:人类偏好
RLVR:可验证正确性
RLCD:校准后的决策

这三条路的差别,在问三种不同的问题。

RLHF 问:这个回答会不会让眼前的人满意?

RLVR 问:这个结果能不能被证明为对?

Almeida 想问:当软件必须自己行动时,它知道自己有多大把握吗?它能不能在不确定时停下来、升级、交给更强的模型或人?

这时,他看见了一个很多人一直绕开的事实。

Claude Code 再强,依然属于协助时代。

它当然能写出比很多人更快的代码,也能帮开发者拆任务、找 bug、调用工具。但它仍然围绕一个人工作。人定义任务,人看过程,人承担试错成本,人决定什么时候信它、什么时候停它。

这是它的设计目标。

Almeida 说,所有“人仍然在回路里”的任务,目的本来就是取悦、辅助、放大这个人。

而自动化恰好相反。

自动化的目标,是把人移出回路。

它理想中的形态,不是一个人盯着对话框、不断输入下一句提示词,而是一个运行在后台的系统。它安静地处理状态、做出判断、承担重复工作。像今天许多稳定运行的遗留软件一样,平时根本没人想起它。

这也解释了那个荒谬的反差。

模型能写一段让人拍手的代码,并不意味着它适合在没有人看的后台,独立判断一笔高风险赔偿该不该通过。

模型能在对话里显得聪明,也不意味着它知道自己什么时候不该行动。

这是 Almeida 对前两条路产生不满意的起点。

RLHF 太擅长人类在场时的协助。

RLVR 很适合有明确裁判、明确答案的封闭问题。

但大量真实软件任务,恰好处在两者之间。它们没有一道数学题那样的唯一答案,也不能把“看起来合理”当作正确。

它们需要的,是一种能在不确定中做决定,同时把不确定性显露出来的智能。

这才是 Jev 的思想来源。

如果目标变成了无人值守的自动化,为什么还要沿用为人类对话而设计的整套技术形状?


二、他先看见了“更聪明的软件”迟迟没有出现

Almeida 在演讲里还有一个观察,特别能说明这种不满意来自哪里。

过去几年,写软件这件事变得越来越便宜。

代码可以更快生成,原型可以更快搭建,一个人能完成过去一个小团队的工作量。

但软件本身,似乎没有因此真正变得更聪明。

大量 B2B SaaS 的底层能力没有发生根本变化,只是在已有产品旁边挂上了一个聊天助手。你可以问它问题,让它帮你写邮件、找文档、总结表格,甚至替你做一些局部操作。

可软件依然很少真正理解自己的状态,持续做出可靠判断,再把一份机械、重复、边界清楚的工作安静地完成。一个天生为协助设计的模型,最自然的落点就是“在旁边帮你”。

它很难直接成为软件本身的一部分。

Almeida说,下一个时代不是 Claude Code 时代

在他看来,它仍然属于 ChatGPT 时代的延伸:界面变了,从聊天框变成终端;人和模型的关系没有根本变,模型依然围绕人的即时判断工作。

他更在意的是另一件事:

AI 能不能不只把软件写得更便宜,也让软件本身获得新的表达力?

如果答案是可以,那么软件的基本积木也该改变。

过去的软件由规则、数据库、工作流、函数和界面组成。

未来的软件里,或许会多出一类东西:

状态
→ 判断
→ 置信度
→ 分支
→ 升级

Jev 是对这类积木的一次尝试。

TypeSafe 将它描述为一种面向程序状态的模型:输入不是一段等待人阅读的提问,输出也不是一段等待人理解的文字,而是软件可以直接调用的类型化决策与概率。

他把变化一路推到了:

目标函数
→ 训练方式
→ 输出空间
→ 推理方式
→ API
→ 软件架构

如果世界观真的变了,API 也不该和以前长得一模一样。

图片

三、技术品味不是“复杂不好”,而是知道复杂该由谁承担

很多人听到这里,会把它概括成一句很熟悉的话:

少即是多。

但真正好的技术设计,从来不只是删东西。

它更难的部分,是知道哪些东西删不掉,只能搬家。

关系数据库没有消灭数据管理的复杂性。

数据仍然要存储、索引、更新、恢复。它只是把“沿着数据结构导航”“理解底层存储方式”的复杂性,从应用开发者身上移交给数据库系统。

MapReduce 没有消灭分布式计算的复杂性。

机器仍然会宕机,数据仍然要分片,网络仍然会失败。它只是把这些复杂性压进 runtime,让用户只表达自己真正关心的计算逻辑。

Unix 也不是因为讨厌复杂而成功。

Thompson 和 Ritchie 面对 Multics 时,真正想保留的是交互式计算和程序之间能够组合的环境。他们扔掉的,是承载这些价值时已经变得过重的体系负担。

所以,技术品味更接近:

我能分辨什么复杂性是本质的,什么复杂性只是历史留下来的;我知道前者该由谁承担,后者该从哪里移走。

Jev 的重构也可以这样理解。

复杂推理仍然属于真正需要它的场景。

但软件内部的大量高频、小颗粒度决策,也许应该有自己的接口。

把复杂放回正确的位置。

四、真正改写系统的人,往往是“失望的局内人”

回到 Almeida 身上,会发现他和 Unix 团队之间有一种相似。

他们都不是从零开始反对一切的人。

他们先经历过旧范式的高光,但时时看到了一种异常。

Almeida 参与过让模型更会遵循人类意图的工作。RLHF 的成功并不需要被否认。它让大模型从“会续写文本”变成了今天人们愿意交谈、愿意使用的助手。

Unix 团队也不是不知道 Multics 的先进。

他们正因为体验过它真正好的部分,才知道什么应该留下。

这类人有一种共同的能力。

他们没有把旧系统的成功,当成旧系统永远正确的证据。

他们也没有把旧系统的失败,当成否定一切的理由。

他们知道,旧范式里总有一些东西是必须保留的。

也总有一些东西,只是当初的限制、偶然的路径、组织的惯性,后来被误当成了世界本身。

这大概就是技术品味最难训练的地方。

一个完全不了解旧系统的人,也能说“删掉它”。

但他不知道删掉之后,什么会一起消失。

一个真正住过旧系统的人,才有机会知道:

  • 什么是不能动的;
  • 什么是早就该被放下的;
  • 什么复杂性应该留在底层;
  • 什么复杂性不该继续由用户、程序员或运营人员承担。

所以,技术品味往往不来自“没有包袱”。它来自一种更复杂的经历:你曾经深度进入一套系统,慢慢对它产生不满意,却没有因此失去对它的理解。

这种经历,可以叫作约束学徒期。

更多时候,是因为他长期面对过成本、延迟、失败、用户行为、维护负担和边界条件。那些东西不讲道理,也不会因为你的理论优雅就配合你。

它们一点点教会人:什么是世界不允许删掉的东西。

五、专业能力会给人答案,也会替人决定注意力

这也是为什么,越聪明、越专业的人,有时越难看见范式的问题。

熟悉一种工具之后,人会下意识用它来理解所有问题。

模型专家看到问题,会先想到模型能力。

强化学习研究者会先想到奖励函数。

Agent 工程师会先想到 Harness。

数据库工程师会先想到存储与查询。

但任何专业能力都会慢慢变成一种注意力的默认设置。它不仅告诉你怎么解决问题,也悄悄告诉你哪些问题值得被看见。

Almeida 的特别之处,他参与过它。

他理解它为什么有效。

但当“模型越来越强”与“自动化仍然很差”这两个事实长期并存时,他允许自己把注意力从旧答案上移开。

这比从来没有相信过旧范式更难。

六、技术品味不是不同意所有人

技术品味从来不是“我想得和别人不一样”。

它也不是一句“第一性原理思考”。第一性原理是方法,技术品味更像一种长期形成的判断力。

它先让你在复杂系统里感觉到一个异常。参见黄仁勋的答案,杨振宁的解法

再让你分辨:这到底只是一个 bug,还是旧问题定义已经开始失效。

它让你保留真正重要的东西,丢掉历史遗留的前提。

它让你知道,复杂性不会凭空消失,关键是它最终该由谁承担。

最后,它要求你做出一个新的 primitive 基元,让现实判断你的重构是否成立。

所以,技术品味的终点不是一个漂亮观点。

而是一个系统。

一个在事后看来,好像本来就该如此的系统。


>/作者:王零壹,920.org.cn(AI Research Institute)创始人,港大AIBT研究生,前上市公司 CMO。长期研究 AI 产品、Agent 架构与商业增长,并持续观察技术变迁如何重塑人的工作、判断与生活。

*著有《AIGC从0到1》系列丛书、及东方寓言小说《飞将军》;

*善于洞察先机,中文互联网第1个意识到OpenClaw范式价值的人(1月26日);

关注我,一起AIGC从0到1~

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多