Token导航 LogoToken导航

我复刻并开源了全网爆火的 Jev(多模态版)

更新时间 2026-09-18来源 AI独立开发正文 1322字阅读约 5分钟2 张图片
我复刻并开源了全网爆火的 Jev(多模态版)

这两天最火的话题非 Jev 莫属了,这是参与构建了 RLHF/ChatGPT 的前 OpenAI 员工 Diogo Almeida 的创业公司搞出来的新模型。

简单来说 Jev 是一个低成本、低延迟、高并发的决策模型,可以输入文本和候选,并快速决策出选项。

Jev 已经发布就引起全网复刻,各种 OpenJev 横空出世。我也动手做了一个视觉版实验:Jev Visual,让模型看着图片做选择、判断和打分,并且在本地运行。

先放项目地址,欢迎体验、点个 Star:

https://github.com/hr98w/jev-visual

什么是 Jev

Jev 是 TypeSafe 推出的决策模型。你给它当前状态和问题,它直接返回程序能用的结果。最核心的能力只有三种:

• Choice:做选择。 比如下一步应该点击哪个按钮。
• Score:打分。 按你定义的等级,判断一条线索有多大价值。
• Noul:判断真假。 用 0~1 表示一句话成立的概率,比如“这个任务已经完成”。

这三种问题可以放进同一次请求,并行得到结果,交给代码继续执行。模型已经发布就在网上引起热烈讨论,Jev 的优势莫过于实现了低成本、低延迟、高并发的 LLM 决策,模型输出的不再是一串 token,而是简简单单的 ABC 选项,或者只是一个 yes or no.

发布后,围绕 Jev 的讨论和应用实验很快多了起来,Browser Use、AI 交易这些热门方向都有人接上了。

jev-trader 尝试把它接进链上交易:读取订单簿,选择买入或卖出,再由程序处理挂单。高频交易应该是最有噱头,但是估计最不靠谱的一个应用了。

Browser Use 的 jev-ultrafast,让 Jev 选择下一步操作和页面元素。项目展示的一次 Google Flights 航班搜索用了约 7.1 秒,包含输入文本和页面等待。

图片

fast-jev-compaction 得到了 Jev 开发者的好评,把 jev 的分类器引入到 coding agent 的 compaction 中。

不过,目前 Jev 接收的是文本和结构化状态,还不能直接看图。 连官方玩 Doom 的演示,喂给模型的也是游戏状态数据。

那能不能做一个能看图的版本?

Jev 刚发布,社区就已经出现了 OpenJev 这样的开源尝试:用现成模型,直接读取各个候选答案的分数;同一份上下文只计算一次,再让多个问题复用,省掉逐字生成答案的过程。

我借鉴了这些思路,换上支持视觉的 Qwen3.5-0.8B,用 MLX 在 Mac 上运行。 图片和公共上下文先算一次,再批量给不同问题的选项打分,由代码组装结果。

下面两个 Demo,看看它能做什么:

AI 分拣工厂: 看传送带截图,识别物品,选择分拣通道。

打砖块: 看游戏截图,判断球在哪个编号区域,再由程序把挡板移过去。这是简化后的视觉分类玩法,目前还不能稳定通关。

复刻原理解释如下,并小小的叠个甲:这只是在 infer 层小小的复现一下 jev 的形式,肯定不如各种成熟推理框架效率高,也肯定不是 jev 的正在原理,但是作为 inference  的小入门仍旧是不错的

图片

代码、运行方法和 Demo 都放在这里了,感兴趣可以在自己的 Mac 上试试,也环境大家 star:

https://github.com/hr98w/jev-visual

文章标签模型发布开源
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多