这几天,一个叫「Jev」的模型火了。
发布才四五天,外网上已经到处都是它的使用案例。连官宣帖的浏览量,都快逼近 4000 万了。

更夸张的是,即使还有大量用户卡在 Waiting List 里,它的官网也因为短时间访问量太大,直接崩了。

Jev 为啥这么火?
首先,它背后的公司 TypeSafe,来头不小。
这家公司由前 OpenAI 研究员 Diogo Almeida、前 Meta 研究工程师 Sasha Sheng,以及连续创业者 Erik Gafni 共同创办。
其中最受关注的是 Diogo。他曾参与 OpenAI 的 InstructGPT 及 RLHF 相关研究,而这些工作,后来成了 ChatGPT 技术路线的重要基础。

Jev 火的另一个原因,是它和我们熟悉的大模型不太一样。
GPT、Claude 这类模型,本质上是在不断预测下一个 Token,然后生成文字、代码、图片或视频。
Jev 不走这条路。它不会聊天,也不会直接生成一大段内容。它最擅长的是做判断,给出决策建议。
比如你问 Jev:“这个用户是不是想退款?”它不会先写一段解释和分析,而是直接返回:“是,概率 92%。”
总结下来,它的特点是快、便宜,能输出判断,特别适合做分类、打标签、判断风险,或者决定下一步该走哪个流程。
这个特点一方面能让 Jev 和现有模型形成互补,还能提升任务速度、降低成本。
今天就让我们一起看看,全网刷屏的这几天,大家拿这个模型做了哪些尝试。
实时生成界面
这是我最关注的 Jev 用法之一。
现在很多实时互动内容产品纠结模型选型,Jev 的出现或许是一条新路。
开发者@Hugo Duprez 就搞出了实时互动小游戏。
视频里能看出,这个跑酷小人接下来的跑酷路径都是实时生成的,而且速度很快。
这位开发者介绍,这个例子里,他并没有让 Jev 像 GPT 一样直接“写出一个关卡”,而是先把玩家当前的位置、速度、是否落地、能不能冲刺、前面的地形等状态喂给 Jev。
然后问它:下一段平台是宽 2、3 还是 5 格?间隔是 0、1 还是 2 格?高度放在哪一行?是普通实体平台还是可穿过的平台?
Jev 返回的不是一段自然语言,而是这些明确的结构化选择以及对应概率。游戏代码拿到结果后,可以直接生成地图,不需要再解析文字。
对游戏开发来说,更快、更便宜的结构化输出,可能会是一个很实用的突破口。


Vercel 的一位负责人也发了案例,认为 Jev 会让用户界面进入实时生成的阶段,以毫秒为单位完成渲染。
做分析和数据整理
Jev 的能力,还体现在归类和分析上。
有营销公司的专家用它来整理和分析广告效果,只用 40 秒,就拆解了 37 个品牌的 724 条广告,token 成本 只有 9 美分。
这位博主@Matthew Berman 的做法是,先用Gemini pipeline with embedding 整理所有广告素材,再将这些信息喂给 Jev,让它根据钩子、行动号召力、落地页匹配度等维度进行分类和打分。
这省去了大把逐条阅读和手工整理的时间。
还有整理 excel。
这应该是许多打工人的“痛”,但 Jev 能加速这个过程。
网友@dabit3 就用它来给表格中记录的各项事件区分优先级。Jev 可以快速了解表格里事件的紧急程度,在 100ms 里完成快速分类。

*给Excel标记优先级

做压缩插件,帮AI干活
还有开发者,搞了一个 Claude 插件,用来处理 Claude Code 里的 compaction summary。
compaction summary 是 Claude Code 里的一个机制:当对话或工具调用太多、接近上下文长度限制时,Claude Code 会把较早的对话压缩成摘要,以便继续工作。
这个摘要通常由模型生成,所以可能会省略细节或改写原文。
但@tamarajtran开发的 fast-jev-compaction插件,思路不太一样。
它会对每次工具调用及其结果进行一次快速评分,过时的内容会被丢弃或截断,而保留下来的内容则完全保持原文。
也就是说,compaction summary 更像“把旧对话写成一份摘要”,这个插件更像“保留原始记录,只清理它认为不再需要的工具调用和结果”。
现在这个插件已经上线了github,已经有约 2K 星了。


增强版“Computer use”
有网友@awlevin 用 Jev 做了一个 Computer use 的实验。
任务是让它帮忙浏览 TechCrunch,找到下一场活动里最便宜门票的结账页面。
在这个过程中,Jev 负责判断下一步该点哪个按钮。
实验显示对比 Claude Opus5,Jev 做单次决策速度快了 14-40 倍,价格只有 1/155。


还有网友@Saccc_c 开发了一个工具,把 Jev 接入 codex 的 Computer use 流程里做优化。据说在差不多的 token 消耗下,操作丝滑了很多。
判断任务路由
还有一些开发者,会把 Jev 接入自己的业务系统,用它判断需求和不同模型的适配度。
这种项目现在在 GitHub 上不少,还有人搞了个导航网站把它们汇聚了起来,大家可以进一步围观。



Coding分诊代码
在 Coding 场景,还有人用 Jev 查代码。
它做的依然不是“写代码”,而是分诊:判断问题属于哪一类、应该走哪条处理路径、下一步该交给哪个工具。


打小游戏
还有一个常见的玩法,就是拿这个适合快速决策的模型去玩结构化小游戏。
网友@Faadil Shaik 拿它操作马里奥。

网友@Kevin Madura 拿 Jev 开打射击游戏,十分钟只花了0.1美元,处理 240 万个 Token。

模拟炒币
还有人发明了更脑洞的玩法:用 Jev 进行 21 个小时的模拟炒币。
从结果看,它赚了12%左右。


Jev背后的逻辑
不得不说,Jev 的实用玩法还挺多,不太像单纯的噱头。
它的开发团队同期还发了一份报告,进一步解读这个模型的特点。
Typesafe 官方给Jev 的定位是:一个具备前沿模型智能水平模型(官方称目前智能水平接近GPT-5.6 Terra)。它输入非结构化状态,输出带类型的概率化决策。
这种设定,让 Jev 的回答速度快,同时价格也很低。
官方技术博客里提到,在他们自己的特定工作流评测中,Jev 最高比对照大模型快 193.6 倍、便宜 444.6 倍,端到端响应时间为 70 毫秒至 500 毫秒。
作为对比,现有前沿模型的端到端响应时间是 3 到 329 秒。
价格上,Jev 输入价额仅0.042 美元/百万 tokens,输出价格可以忽略不计。
作为对比,TypeSafe 提到,目前一些前沿模型的输入价格约为 0.20 到 10 美元 / 百万 tokens,输出价格通常更高。

TypeSafe 还把 Jev 和 GPT-5.6 Terra 放在一起演示。
同一个任务里,Jev 直接输出多项判断;GPT-5.6 Terra 则是逐步输出文本。时间差非常明显:Jev 耗时 0.114 秒,后者为 8.566 秒。

之所以出现这些特点,是因为 Jev 的训练思路和其他大模型不一样。
它采用的是 RLCD,也就是 Reinforcement Learning for Calibrated Decisions,面向“校准决策”的强化学习。
这种训练目标,不是让模型生成一段更“讨人喜欢”的回答,而是让模型在做判断时,给出尽可能符合真实正确率的概率。
Typesafe 还说 Jev 几乎是零幻觉的模型。
原因是,它所有可能的输出,都需要在输入时预先定义好。模型不会给出指定选项集合或数值范围之外的内容,单次决策最多支持 255 个选项。
但这并不代表 Jev 不会做错决定。
它依然可能在预设选项中,以很高的置信度选出一个错误答案。

当然,在一片夸夸声音之外,这几天也开始出现一些不同的声音。
比如有人认为,Jev 的技术门槛未必高到无法复现。已经有开发者称,自己用两个小时做出了开源版本。
也有人认为,这类能力未来可能会被通用大模型吃掉。还有人在实际拿它打游戏时发现,效果并没有想象中那么稳定。
另一个问题是,模型输出概率的过程目前仍然是黑盒。
这会影响开发者对 Jev 的可解释性和信任度。毕竟在很多决策场景里,它选了什么很重要,为什么这么选同样重要。

*开发者2小时复现
所以,Jev 现在最有意思的地方是把大模型能力拆出了一个更窄、更硬、更工程化的分支:不负责长篇表达,只负责在限定选项里快速做决定。
它回答的问题是:我们真的需要模型一直生成那么多东西吗?在客服、风控、游戏、数据整理、任务路由这些场景里,答案可能是否定的。
很多软件流程缺的不是一段漂亮文字,而是一个便宜、稳定、低延迟、能直接被程序使用的判断。
但 Jev 到底是一个中间形态,还是会长成新的模型品类,还得看后续场景里的真实表现。
从目前的案例来看,这颗子弹确实飞得挺快。







