Token导航 LogoToken导航

基元律动发布NeoHorse-Jev 开源Jev综合评测第一

更新时间 2026-09-24来源 ZFinTech正文 4481字阅读约 15分钟
你玩过贪吃蛇吗?
游戏刚开始时,怎么走都不容易出错。但随着蛇身越来越长,留给自己的活动空间被不断压缩,任何一次错误转向,都可能让整局游戏瞬间结束。
如果让一个 AI 模型来玩贪吃蛇,它要做的并不只是简单的“去找食物”,而是每走一步都要重新审视盘面,在上、下、左、右四个方向之间快速比较,并把判断实时转化为下一次转向。
最近,有一个 AI 完成了一场这样的测试:3000 步,89 个目标,蛇还活着。
这意味着,在数千次连续决策中,它不仅要做对眼前这一步,还要尽可能避免前面的选择把后续空间一步步“走死”。
图 1|贪吃蛇演示:3,000 步、89 个目标、蛇身长度 95,存活到回合结束。右侧同步展示候选方向、概率与最终选择。
做出这个表现的,是创业公司基元律动(tokenrhythm.ai)最新发布的轻量级模型 NeoHorse-Jev-4B
这家由华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的团队,将研发重点放在了实时决策上。作为一款仅 4B(40亿)参数规模的模型,NeoHorse-Jev-4B 主打毫秒级的响应速度。在包含六组评测的本轮基准测试中,它最终凭借 77.70 的综合 AVG 分数,拿下了成绩完整的开源参评模型第一名。目前,基元律动已同步开源了该模型的权重、推理源码以及部署示例,方便开发者直接上手使用。

小身材大能量:用更少的参数,实现毫秒级“极速决策”

凭借更小的参数体积,NeoHorse-Jev-4B 展现出了极为出色的综合性能。
在本轮六组涵盖决策、迁移、知识与语义判断的基准测试中,NeoHorse-Jev-4B 取得了 77.70 的综合 AVG 分数,一举超越参数规模更大的 Open-Jev-9B(领先 2.03 分),在成绩完整的开源参评模型中位居第一。
尤其是在 Nimble、VitaminC、MASSIVE 这三项核心测试中,NeoHorse-Jev-4B 的平均得分高达 83.26 分,相比对应原始模型的 71.76 分大幅提升了 11.50 分。这种显著的跨越,得益于团队针对决策场景进行的专门优化,让模型从基础的语言理解力成功转化为可直接调用的“判断力”。
评测数据与说明:
  • 数据源自 9 月 24 日评测汇总及同目录下的三项成绩截图;汇总报告中本模型采用 vLLM 推理后端。
  • “第一”限定为本轮六组评测结果完整的参评开源模型,并不代表各单项成绩均为第一;此外,本轮评测尚未覆盖市场上全部开源 Jev 类模型。
除了性能上的突破,NeoHorse-Jev-4B 在实用性上也做了针对性设计——让开发者能够像调用传统程序函数一样,轻松接入模型的决策能力。
开发者只需用自然语言定义好具体任务,模型就能直接返回软件系统可识别的概率分布与量化分数。这种设计省去了原本需要手动编写复杂逻辑规则的繁琐过程,直接把模型的“理解力”转换成了标准化的能力接口。
目前,模型针对常见的业务场景提供了三种核心调用方式:
  • Choice(单选): “这条请求应该路由给哪一个下游工具?”
  • Noul(是非判断): “这段用户生成内容(UGC)是否符合合规规则?”
  • Score(打分评价): “这个搜索结果与用户意图的相关度有多高?”
开发者只需要用自然语言定义问题和候选项,模型便可以直接返回概率或分数,应用随后按照结果继续执行。
换句话说,过去很多依赖 if-else、规则引擎甚至额外分类模型完成的“判断层”,被重新封装成可以直接调用的模型能力。这也是 Jev 类模型和传统生成式模型最核心的差异之一:不直接把答案“说出来”,而是尽快完成一次决策。
这种差异也直接反映在推理链路上。
传统生成式模型通常要经历:理解输入 → 逐 Token 生成答案 → 解析答案 → 执行而 NeoHorse-Jev-4B 的路径被缩短为:理解输入 → 返回候选概率 → 执行
NeoHorse-Jev-4B 使用 prefill-only 推理,直接计算不同候选项的概率,而不需要逐字生成自然语言答案,相当于省掉了生成阶段最主要的一段延迟。
在一组由 1158 个真实文本请求构成的混合负载测试中,32 并发情况下,服务端记录的平均决策耗时为 74.3 ms,也就是一次判断平均不到 0.1 秒;客户端完整请求的平均耗时为 273.3 ms。
尤其当并发提高到 256 时,系统每秒可以成功处理 347.05 个请求,该档测试中的 6,948 次请求全部成功。
需要说明的是,这里的流程对比并不是传统生成模型与 NeoHorse 在完全相同条件下的模型测速。74.3 ms 指的是服务端返回的 Decision 计时,273.3 ms 则包含完整客户端请求链路;74.3 ms 和 347.05 请求/秒也分别对应 32 并发和 256 并发两个不同测试档位。
这些数字说明了一件事:Jev 模型优化的不是“写话有多快”,而是“做一次判断够不够便宜、够不够快”,以至于可以被高频嵌入软件执行链路”。
这也正是 4B 规模的意义所在。大模型负责深思熟虑,而软件内部海量的高频细碎决策——工具路由、意图识别、内容过滤、搜索排序——并不需要百亿参数的模型每次都完整做一遍大题。真正有价值的,是用毫秒级的成本,完成成千上万次“足够好”的判断。

从游戏到具身智能:让每一次判断,都直接变成行动

开场的贪吃蛇,只是 NeoHorse-Jev-4B 展示能力的第一步。从俄罗斯方块、Flappy Bird,到四方麻将与炸弹人竞技,甚至跨越到自动驾驶和机械臂具身仿真——同一套标准化决策接口,正在被快速接入越来越多的复杂场景:输入当前状态 -> 实时比较候选选项 -> 返回概率与得分 ->  驱动动作执行。每一次毫秒级的判断,都在直接推动具体业务场景向前运转。

1. 俄罗斯方块:一局消除 59 行

每一个方块落下前,NeoHorse-Jev-4B 都要在极短时间内对“不同落点 x 不同朝向”的所有候选组合进行概率评估。随着棋盘局面的实时变化,模型的决策策略随之动态更新。
这段演示的结果面板记录了 190 次落子、59 行消除、6,500 分
图 2|一局游戏的加速回放。右侧展示候选落点与朝向、对应概率及最终选择,结尾展示本局结果。

2. Flappy Bird:把握起落,连续穿越管道

何时振翅,何时滑行,模型来判断。 NeoHorse-Jev-4B 根据小鸟的实时高度、飞行速度以及前方管道的结构化文本状态,持续输出下一步动作策略,精准穿过狭窄的管道间隙。
在完整的回合测试中,模型单次成功穿越了 28 根管道,而在同组 6 个回合的综合测试中,平均通过管道数达到了 27.67 根
图 3|Flappy Bird 的 12 秒回放节选,以 2 倍速播放。模型接收文字状态输入,右侧展示判断分数与动作;完整回合成绩见画面底部。

3. 麻将:从逐手选择到自摸胡牌

摸到一张牌,该留下什么、打出什么?如何根据场上已出现的公开牌型调整策略?
基于本家手牌与公共盘面信息,NeoHorse-Jev-4B 在每一个回合的候选动作中进行概率筛选。在简化为 108 张牌规则的四方对局演示中,模型一路推演并最终以 “NEO 自摸胡牌” 完成收官。
图 4|简化 108 张规则的四方麻将演示。右侧显示候选动作概率;模型使用本家手牌、公开信息与牌型辅助。

4. 四方炸弹竞技:在动态对抗中赢下本局

走位避险,还是原地放置炸弹?面对三名不断行动的对手以及随时间收缩的安全区域,NeoHorse-Jev-4B 必须在博弈中持续做出下一步选择。
在一局包含“三个 AI 模型 + 一个规则机器人”的混战展示局中,模型成功应对了复杂的动态对抗,坚持到最后并锁定胜局(NEO WINS)。
图 5|三个模型与一个规则机器人同场竞技的展示局。画面保留各方动作、概率面板及运行配置标注。

5. 自动驾驶仿真:152 次决策,到达终点

在城镇道路的仿真环境里,NeoHorse-Jev-4B 负责持续输出车辆的下一步驾驶动作,驱动车辆沿着预定路线行驶。如果说前面的几类 demo 主要展示了模型在规则环境中的连续决策能力,那么更有行业意义的,是它开始进入更接近真实应用的仿真任务。
在自动驾驶仿真中,NeoHorse-Jev-4B 需要根据结构化状态输入,持续选择下一步驾驶动作,推动车辆沿既定路线前进。界面会同步显示候选动作概率、当前速度、剩余距离以及决策进度。
这段回放共记录 152 次决策,最终车辆到达终点,并实现 0 次碰撞、0 次违规。这意味着,模型的判断不再只是“过关”或“得分”,而开始具备与安全约束、路径执行相关的任务属性。
图 6|城镇路线驾驶仿真回放。模型使用结构化状态输入,场景提供原生规划与安全辅助;上述结果对应本次演示。

6. 机械臂:84 次决策,打开仿真保险柜

在机械臂仿真任务中,NeoHorse-Jev-4B 则把判断力进一步带进了具身场景。
在 Meta-World 的 door-open-v3 任务中,模型结合多模态输入理解环境状态,逐步完成接近柜门、调整位置和开门等动作。整个过程中,它一共进行了 84 次决策,最终任务状态显示 “SUCCESS”
图 7|Meta-World 的 door-open-v3 任务。84 次决策后,画面亮起“SUCCESS”。
更值得注意的是,这款模型并未针对具身数据进行专门训练。也就是说,这一结果更多体现的是,基于 NeoHorse-1-4B 的通用能力,决策接口本身已经具备了一定的跨场景迁移潜力。
把这些演示连起来看,NeoHorse-Jev-4B 想传递的重点,其实并不只是几个游戏或仿真项目里的单点成绩,而是同一种调用范式正在跨场景复用。从屏幕里的小游戏,到多主体对抗,再到自动驾驶和机械臂仿真,这条路径所展示的,是模型能力从“回答问题”向“驱动动作”延伸的可能性。

全量开源:让每个应用都能接入“极速判断力”

相比只发布一个模型分数,基元律动这次更强调的是可用性。
NeoHorse-Jev-4B 同步开放了模型权重、推理源码与调用示例,支持 Python、命令行、HTTP 等接入方式,并兼容 vLLM、SGLang 部署。模型按 Apache-2.0 协议发布,开发者可以直接在自己的环境中完成测试、集成和二次开发。
除了文本输入,NeoHorse-Jev-4B 还支持单张图片与文本联合输入。这意味着,同一套“输入状态—返回判断—执行动作”的接口,不再只处理抽象文本,也开始具备连接可见环境状态的能力。
目前,模型与相关文件已经上线 Huggingface/ModelScope,代码与部署示例同步发布在 GitHub,Hugging Face 也开放了对应社区入口。
ModelScope:
https://www.modelscope.cn/collections/TokenRhythm/NeoHorse-Jev
HuggingFace:
https://huggingface.co/collections/TokenRhythm/neohorse-jev
GitHub:
https://github.com/TokenRhythm/NeoHorse
当这种判断能力被压缩进更小的模型、以更低延迟被频繁调用,AI 进入软件和真实环境的方式,也可能随之发生变化。
最后,NeoHorse-Jev 还被安排完成了一次“奔月”——带着嫦娥飞向月宫,也给这场偏工程和技术向的发布,留了一点中秋节的彩蛋。
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多