Token导航 LogoToken导航

Jev为什么突然火了?它想把Agent里的大量LLM调用干掉

更新时间 2026-09-21来源 算法一只狗正文 2548字阅读约 8分钟10 张图片

最近这个模型好像在外网很火。主要是它在尝试把 Agent 里大量原本由 LLM 承担的「判断」单独拆成一种模型。

Jev 被定义成一种 System One Model:输入可以是非结构化状态,但输出不是自然语言,而是预定义类型的决策、概率和置信度。TypeSafe 把对应训练方法称为 RLCD(Reinforcement Learning for Calibrated Decisions)。

图片

其实按我的理解,它直接把模型变成一个智能 if / classifier / scorer / router。

Jev 输出的速度很快

TypeSafe 官方宣称 Jev 的响应时间大约在 70–500ms,输入价格为 0.042 美元/百万 token,并在自己构造的 System One workflow 上报告了最高约 193.6× 更快、444.6× 更便宜的结果。

图片

他们自己的 workflow benchmark 中,Jev 对 GPT-6 Astra + Claude Fable 5.1 平均参考判断的一致率约为 67.8%,而最佳对照模型大约是 74.1%。所以你可以理解为,Jev牺牲一部分通用性和最高精度,换取极端低 latency + 极端低成本 + 原生概率输出。

Every 做了一轮比较早的测试。他们让 Jev 对 37 篇文章回答 21 个判断问题,总计 777 个 judgments,不到 0.7 秒完成;另一组实验里,Jev 单次中位延迟约 0.35 秒,Claude Fable 5.1 约 8.83 秒,约快 25 倍,估算成本低约 580 倍。不过在一个包含 7 个刻意错误的测试里,Jev 找到 6 个,Fable 找到了 7 个。

图片

不过,现在最大的未知数仍然是 RLCD 的训练细节、模型规模、真正独立 benchmark,以及在长尾/OOD decision 上的 calibration。Jev 目前仍是 early access,虽然有潜力,但是还是需要持续验证的。

我这边用了我业务上常用的一个分类样本给他,相当于是一个zero-shot的样本。可以看到它确实在分类上好像会一点。不过整体的Macro-F1在70%,排在了其他大模型之后。

图片

但是耐不住它很便宜,1千万token,才不到$0.435。推理效率也高,对于我给的1800个样本进行分类,它只需要耗时1分半左右的时间。

图片

怎么申请试玩?

目前可以直接去到官网申请。官网在typesafe.ai,进去就能排队。

图片

申请成功之后,就可以进去里面对话了。一次调用只有三块。 State 是原始材料,一段客服消息或一段 JSON。Questions 是你事先定义的问题,每道题只能是 Noul、Choice、Score 三种之一。Answers 按你起的键名返回。代码读键,别去解析散文。

图片

比如我这里询问它:用户收到电脑后发现屏幕破裂,并提供了完整开箱视频,视频显示刚拆开包装时屏幕已经破裂。 然后让它做出是否“判断这台笔记本电脑是否更可能在用户收到之前就已经损坏。”

图片

它可以很快就可以把答案给整理输出来。大家可以参考我这个直接写一个demo。

外网太过于火爆了

目前jev在很多应用场景都可以接入。包括游戏操作、金融交易、日常开发等等。

在游戏操作领域中,有用户让jev玩《杀戮尖塔2》,行动思考只需0.7秒。

使用jev,辅助查看浏览器的航班信息。视频速度正常,没有快进。它不会让大型模型反复扫描图像或写冗长的推理;相反,它给网页上的所有按钮和输入字段编号,变成了Jev的多项选择题:下一步点击哪里,输入什么,是否滚动。只有在需要打字时,它才会暂时调用小型模型,所以速度和成本都令人惊叹。

除批量数据处理外,也有用户尝试将 Jev 集成至日常开发工作之中。通常情况下,在使用 Claude Code 编写较长代码时,一旦上下文容量达到上限,系统便不得不中断以生成阶段性摘要。开发者 tamaratran 开发了一款插件,使 Jev 能够在数十毫秒内扫描数千行终端日志,并自动剔除其中的冗余信息与无效内容。此举有效避免了代码执行过程频繁受阻的情况。

还可以使用jev秒换试穿衣服。人说话后,Jev 会实时读取语音转录内容和我当前的穿搭状态,理解我的意图与场景需求,再从衣柜中挑选合适的服装,并实时切换生成新的穿搭效果,单次决策成本约 $0.0011,延迟约 620ms。

有人做了一个个人知识/饮食 Agent 系统,里面有:

recipe_agent / scraper_agent / meal_planner / grocery_agent / nutrition_agent...

他给 Jev 一段 Instagram Recipe Transcript:

如果只是“完整食谱请看 bio 链接”,Jev 路由到 scraper_agent

如果 transcript 已经包含完整用量和步骤,则路由到 recipe_agent

报告延迟大约 145–271ms。这其实就是非常典型的“Agent 前置决策层”。

图片

浏览器自主操控也是很多人做出来,比如这个项目Jev Browser GitHub

Wikipedia 导航,大约 4 秒、成本约 $0.0016

填 Contact Form,但在提交前停止

从真实 Pricing Page 提取价格

输出页面 Markdown

分析 WordPress accessibility tree

图片

只需要LLM 负责规划,Jev 负责大量局部 Computer Use 决策。

游戏控制已经开始有人做 Benchmark,目前不仅有官方 Doom,社区还直接比较了:

Jev vs Laya vs ModernCE vs Qwen3.5-4B

控制 Doom。输入不是图片,而是 Python adapter 提取:

写在最后

体验下来,Jev模型不只是更快、更便宜,而是它把 Agent 里大量“不需要生成,只需要判断”的任务单独拆了出来。

未来 Agent 很可能会变成一种分层架构:LLM 负责规划和复杂推理,Decision Model 负责高频、低延迟的小判断,程序负责执行。

当然,Jev 现在还很早期,RLCD 细节、模型规模、OOD 表现和第三方 benchmark 都还需要验证,我自己的测试里它的分类精度也没有超过主流大模型。

但如果一个模型能用更低的成本和延迟,完成足够多的中间判断,那它在工程上的价值可能非常大。

以前我们有 Embedding Model、Reranker、LLM、Reward Model,未来也许还会多一个新的基础组件:Decision Model。

文章标签大模型智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多