本文来自微信公众号: 快刀青衣 ,作者:快刀青衣
大量中间步骤,并不需要AI会说话。
不少朋友可能发现,虽然最近这两三个月新的大模型层出不穷,但我却很少聊这些。
原因很简单,我觉得现阶段,这几个顶尖大模型的能力虽然有差别,但整体都已经非常强了。
比起纠结到底选什么大模型,我们更应该关注,到底用AI解决什么问题。
还有一个原因,过去一年,大模型赛道上来来回回都是那几张熟面孔:GPT、Claude、Gemini、DeepSeek……
大家卷的方向也差不多,谁写得更好,谁推理更强,谁上下文更长,真是你方唱罢我登场。
不过,今天我要跟你聊一个这两天新冒出来的东西,叫Jev。
它简直就像我们在管理学故事里常见的「鲶鱼」一样,掀起了讨论热潮,刷屏了整个硅谷开发者社区。
它火得很猛。创始人的发布帖两天拿了超过3000万次浏览、6万多个赞,DCVC领投了4000万美元的种子轮,有媒体说估值大约2亿美元。
我更感兴趣的是它做的一个选择,同时也能解答大家的一个问题:这模型凭啥突然火了?
要知道,Jev这个模型主动砍掉了大模型最核心的一项能力:生成文本。它不会写文章,不会写代码,甚至不会聊天。
它重点只做一件事:判断。
造它的人叫迪奥戈·阿尔梅达,前OpenAI研究员,也是2022年InstructGPT论文的共同作者之一。
InstructGPT这篇论文地位非常高,因为它是ChatGPT的直系前身,也就是让AI学会听人话、像人一样说话的那套训练方法。
阿尔梅达是参与者之一,所以,也有唯恐天下不乱的短视频把他称为「ChatGPT之父」。怎么说呢,反正我觉得ChatGPT挺不容易的,我差不多见过七八个人被称为它的爸爸了。
不过我的好奇心就来自这里:他当初可是帮AI学会聊天的人,离开OpenAI之后花了两年时间,造了一个不会聊天的AI。为什么?他图什么?
他在发布帖的视频里解释了动机,大意是:现在的AI Agent系统,有一个巨大的浪费。
我们来想一个场景。你是一家公司的客服主管,每天收到几千封客户邮件,需要分拣到不同的处理队列里,退款的归退款,投诉的归投诉,咨询的归咨询。
你让一个大模型来干这事,它会怎么做呢?
它会认认真真读完每封邮件,然后写一大段分析:这封邮件的客户情绪偏负面,涉及产品质量问题,建议归类为投诉类,优先级为高。
写得很好。但软件系统根本不需要这段话。软件需要的只是一个词,「投诉」;或者一个数字,「3」;或者一个判断,「是或否」。
中间那一大段文字,没人会读,也没有软件会用。它就是凭空生成出来,又凭空消失掉了。
这就像一个人被要求做选择题,但他每次都非要先写一篇议论文,然后再从里面提取出ABCD。
阿尔梅达说,在今天的Agent系统里,这种浪费无处不在。一个复杂的AI工作流可能要做上百次判断,每次都让大模型跑一整套生成流程,等于用大炮打蚊子。
而Jev的做法是,把这些「小判断」单独拎出来,用一个专门训练过的模型来处理。它只输出三种东西:选择、打分、是否。
不写句子,不做解释,不输出任何人类语言。
快多少呢?官方给的数据是,同样一个分类判断,GPT-4o可能要花几秒甚至更久,Jev可以压到几十毫秒,快了近200倍。
再说成本。因为它不需要生成任何文本,每次调用消耗的算力极小,官方说成本只有原来的四百分之一。
当然,这些倍数大家看看就好,因为比的是特定任务上的峰值表现,不是所有场景都这样。但核心逻辑是成立的:在不需要语言输出的任务上,压根不需要一个会说话的模型。
那它到底好使在哪?我翻了一圈发布这两天媒体和社区里的讨论,还有官方放出来的案例,挑几个具体说说。
第一个是浏览器Agent。Browser Use的创始人格雷戈尔·祖尼奇做了一个演示,让AI帮他搜一张从苏黎世飞伦敦的机票。
用传统大模型驱动的浏览器Agent,光是在页面上判断该点哪个按钮、该往哪个输入框填内容,就磨磨蹭蹭花了好几分钟。
换成Jev处理这些中间判断,整个流程7秒钟跑完。因为每一步的判断延迟从秒级压到了毫秒级,累计下来,差距就是几十倍。
第二个是上下文压缩。现在的Agent动不动就要处理超长文本,一个复杂任务的上下文可能撑到上百万token。
Jev可以做一件事:逐段扫描这些上下文,判断每一段跟当前任务有没有关系,没关系的直接扔掉。
有人测试过,128万token的上下文,经过Jev筛完只剩8.6万,缩了93%,而且关键信息没丢。
这就相当于,你让一个实习生先帮你把一百页的报告划出重点段落,你只需要看那七八页就行了。
第三个是大批量文档处理。有个开发者测试了一下,用Jev跑777次分类判断,总共花了大约0.25美分,不到两分钱人民币。
对那些每天要处理海量文档的企业来说,这个成本意味着,以前用不起的场景,现在可能可以随便跑了。
但值得关注的是,类似这样只用来判断的东西早就有人做过,为什么偏偏是Jev在这个时间点爆了?
我觉得,让它这次火起来的,是时机。
过去一年,AI Agent从概念走向实际部署,越来越多的开发者真的开始在生产环境里跑Agent了。
举个例子,Anthropic最近披露了一组内部数据,他们自己的研发流程里,半年前能被Agent主导的任务占比还不到1%,现在已经飙到了26%,有3万个Agent在同时运行。
这还只是一家公司。
Agent跑得越多,那些中间环节的小判断就越多。每次都调大模型跑完整的生成流程,账单高得离谱,延迟慢得想骂人。
特别是现在越顶级的大模型,思考时间越长。甚至一个小问题,顶级模型都会觉得:人肯定不会问这么简单的问题,一定有深意。
Jev不是第一个看到这个问题的,但它的出现,恰好是所有人都受够了的时候。
你看,推出时机,可能比技术本身更重要,这件事本身就是一个挺好的案例。当然,Jev这个故事里最让我有感触的,是我们之前忽略的一个问题。
过去两年,大模型变得越来越强,能写文章,能写代码,能推理,能多模态,所有人都在卷「全能」。我们也习惯了,遇到什么任务都往大模型上扔。
但拆开来看,Agent系统里真正需要语言能力的环节,可能连一半都不到。大量的中间步骤,要的只是一个选择、一个评分、一个是或否。
我们一直在用会说话的模型,去干不需要说话的活。
这个错配,不是谁故意为之,而是因为之前没有别的选择。你手上只有锤子,什么都得当钉子。现在Jev出来了,它未必是最终答案,但它至少让大家意识到了这个错配的存在。
做产品也一样。现在AI把很多工具层面的能力拉平了,人人都能做网站,人人都能写APP。做出来不难,难的是做出来有人用。
Jev给我的启发是,先别急着想「我能做什么」,先问一个更基本的问题:我的用户到底需要什么?
需求匹配得准,比一味追求能力全面更重要。
说了这么多,除了技术本身,我还挺佩服这个团队做的事情,因为他们做的是一件反共识的事,并不是别人怎么做,自己就怎么做。
也许正因为这样,阿尔梅达才能在之前参与做出擅长说话的AI,现在又做出了不会说话的Jev。
1.Jev官网介绍:
https://typesafe.ai/blog/introducing-system-one-models-and-jev
2.Jev官方文档:
https://docs.typesafe.ai/introduction







