这两天刷屏的模型有点反常。它不会聊天,不会写代码,连一句完整的话都说不出来。
它叫 Jev。9 月 19 日上线,36 小时内涌进 14 万开发者,Vercel、Cloudflare、LangChain 陆续接入,社区跑出近 500 个开源项目。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT 和 RLHF,就是那套让 ChatGPT 听懂人话的核心技术。
一个能力看起来被砍掉一大半的模型,凭什么火成这样。这件事值得从头讲一遍。
01 它到底是什么:一个不说话的判断器
Jev 不生成文字。你给它一段状态描述,外加一组提前定义好的问题,它直接返回带概率的结构化答案,代码拿到就能分支。
官方把接口收得很窄,只有一个端点,三种问题类型。Choice 从最多 255 个选项里挑一个;Score 按有序等级打分;Noul 判断一句话是真还是假,返回 0 到 1 之间的概率。这些问题是并行跑的,多加几个,响应时间几乎不动。
名字取自经济学家杰文斯。杰文斯悖论说的是蒸汽机效率越高,煤反而烧得越多。TypeSafe 赌的是同一件事:当一次判断便宜到接近免费,开发者会在以前根本舍不得用的地方,疯狂往里塞 AI。
它对外叫 System One 模型,借的是卡尼曼《思考,快与慢》的分法:系统一是快速直觉,系统二是缓慢推理。GPT、Claude 在系统二那一侧,Jev 要占的是系统一的位置。

所以它不是更小更便宜的 GPT。普通小模型还是一个词一个词往外蹦,只是规模变小;Jev 从一开始就把活收窄到判断上,不需要自由发挥。
02 它到底输出什么:一段 JSON 对一段话
说了半天不会说话,那它到底吐出什么。官方没有公开完整的响应结构,下面这段是按文档描述还原的示意,字段名以实际接口为准。
请求示例:

三个问题一次发出去,并行跑完,回来的东西长这样。
响应示例:

留意那两个数是两回事。probability 是选项之间的高低,confidence 是整个分布干不干净,下一节展开讲。
对比一下主流大模型。GPT、Claude 这类接口里真正的正文在 choices[0].message.content,是一整段自然语言。想让程序拿去分支,还得再叠一层:开 JSON 模式加 schema 约束,或者用 function calling 把字段抠出来,或者正则匹配加失败重试。多一层解析,就多一处会断的地方。
还有输出长度。大模型一个词一个词往外写,字数直接决定时间和花销;Jev 的返回就这几个字段,长度基本固定。
这两类模型不是替代关系。大模型负责把事想清楚,Jev 负责在已经想清楚的地方快速拍板。

03 差在哪:砍掉的不只是文字
最容易被忽略的差别在训练目标上。RLHF 优化的是人类觉得这个回答好不好,代价是话多、过度自信,还有模式塌缩,那些正确但不够讨喜的答案被压掉了。
TypeSafe 换成了 RLCD,也就是面向校准决策的强化学习,目标是让模型说出口的把握和真实准确率对得上。
这解释了一个细节。回头看上面那段 JSON 里的 dept 项,账单以 0.84 的概率胜出,置信度却只有 0.596,因为技术部门还占着 0.159。置信度不是赢家那个概率本身,而是从整个分布的形状里推出来的。
它不光告诉你选了什么,还告诉你这个选择有多悬。
官方宣传的零幻觉也要拆开读。它的意思是答案一定落在你给的选项里,不会凭空编一个不存在的部门。这不等于选得对,选项之内照样可能选错。
04 怎么火起来的:Agent 缺的那一层
速度是入口。官方数据是端到端 70 到 500 毫秒,输入每百万 token 0.042 美元,输出免费。有人叫它 AI 界的蜜雪冰城。
但真正让它被抢的,是它补上了 Agent 工作流里一直空着的一层。一个 Agent 跑起来,每一步都要做判断:任务属于哪一类、下一步调哪个工具、结果合不合格。以前这些判断全都交给大模型,能用,但慢而且贵。
X 上那条公告帖拿了 3620 万浏览,评论区里挤满的不是"它能写什么",而是"这一层终于可以拆出来了"。
05 大家玩出了什么:从游戏手柄到流水线
社区这一周的产出,可以按玩具到生产排成一条光谱。
玩具那一头最热闹。官方演示让 Jev 玩初代《毁灭战士》,每秒约 10 次动作决策,跑一小时约 7 美元。开发者 MaxBlade 让它同时操控 50 局《地铁跑酷》,总花费不到 1 美分。
更能说明问题的是 MuJoCo 物理仿真里的火箭回收。何时点火、开几台发动机、何时切换着陆姿态全交给 Jev 判断,12 次试验后成功着陆,单次完整试验约 0.04 美元。
生产那一头更值得看。Vercel 工程师把内部的 Shell 命令安全审查分类器换成 Jev,处理速度提升 5 到 18 倍,误判率下降以后实际准确率反而更高。
Browser Use 在三天内推出集成库 jev-ultrafast,两天拿到 2700 颗 Star。创始人放出无剪辑实测:在真实航司官网完成一次单程航班查询,7.1 秒,0.0039 美元。它把网页操作抽象成两组选择题,全程不截图。
还有一些更工程的用法:判断每一轮工具调用值不值得留在上下文里,给长任务瘦身;代码任务发起前预判难度,简单的路由给便宜模型,复杂的才唤醒大模型,整体开销压降六成以上;给每个工具调用打上放行、询问或拒绝的标签。

最该警惕的那一类也有人试了。把 Jev 接进链上订单簿,高频输出买入、卖出或观望三个动作。社区自己的评价是噱头最足、真实行情里风险最高。
这也恰好划出了边界。Jev 只负责在你给的选项里挑一个,它不负责判断这些选项本身对不对。把止损、仓位、风控这些前提都省掉,只留一个便宜的买卖开关,省下来的成本远不够填那个坑。
06 置信度才是真正的卖点
真正把它和大模型拉开距离的,是独立评测机构 PrimeLine 做的那个双盲预注册测试。
两项真实任务上,Claude Opus 5 和 Haiku 4.5 的初始准确率原本追平甚至领先。可一旦规则允许模型跳过自己最没把握的样本,Jev 两项全部反超。
原因就在置信度。Jev 给出的概率有统计意义,通用大模型自我评估的把握常常严重过头。对一个只想让程序自动跑下去的系统来说,知道自己不知道,比多答对两个点值钱得多。
文档里给的三条路由建议也很朴素:高置信度直接执行,中间的排队复核,低置信度转人工。阈值按犯错的代价来定。

07 前景:便宜之后会发生什么
先说能确定的。中间那一层调度代码会被标准化。LangChain 写了专题博客,说过去 Agent 的分类决策深埋在各家闭源系统的定制代码里,现在有了又便宜又确定的选择模型,这层可以推广到每一个开源 Agent。
再说需要打折扣看的。那组被反复引用的数字,最快 193.6 倍、最便宜 444.6 倍,来自 TypeSafe 自己的评测,参照答案是 GPT-6 Astra 和 Fable 5.1 的平均,工作流也是自家团队写的。公司自己都承认,这些增益会处在真实使用的偏高端,而且无法证明价格没有补贴。它的数学能力大致在 GPT-4 水平,也不支持图像。
更实际的约束是开放方式。目前只有托管 API,早期访问要排队,权重、参数量、架构都没公开,也没有自托管选项,中国大陆地区尚未开放。
想上手的人有几条路可走:官方控制台(https://typesafe.ai/)和文档、OpenRouter 上的 typesafe/jev,以及 Vercel AI Gateway。
复现倒是来得很快。9 月 19 日,国内 APUS 的 AI 实验室公开了全球最早一批独立复现,做成开箱即用、MIT 协议的技能包。它抓住的核心机制是跳过自回归解码,用隐状态直接打分。
往远看,杰文斯悖论很可能兑现。判断成本趋近于零之后,需求不会减少,反而会嵌进软件的每一个分支里。
这和华为监事会主席郭平最近那份座谈纪要里的逻辑是同一条。华为把自己定位在连接和计算上,认为优势不在拥有自研大模型,而在于让任何大模型都能在自己的算力上高效跑起来。
价值正从谁的模型更强,转向谁能让模型在业务流程里真正跑起来。这两句话看着像,落点差得很远。
郭平还坦承,华为在大模型上起步早却没占主导,反倒是 Anthropic、Kimi、DeepSeek 这样的团队实现了突破,大公司既有优势也有劣势。这句话放在 Jev 身上同样成立:窄切口不是偷懒,是让自己不必在对手的主场上比力气。
但要提醒一句。没有权重、没有自托管、价格可能含补贴,这三件事叠在一起,意味着今天的成本结构未必是明天的。真正需要盯的指标只有一个:它给出的置信度,在更多真实业务里还能不能和实际准确率对得上。
对得上,这套分工就立得住;对不上,它就只是一个便宜点的分类器。大模型负责想,Jev 这类模型负责判,AI 终于开始认真分工了。







