Token导航 LogoToken导航

StartLux开源决策模型 38项基准中31项高于Jev

更新时间 2026-10-02来源 InfoQ正文 8131字阅读约 26分钟
作者|StartLux
Jev 为大模型领域带来了一条全新的技术思路,在决策效率与响应速度上展现出很强的潜力。我们十分欣赏该团队的创新,也高度认可这一技术方向。智能体真正执行任务时,每一步等待都会累积,最终影响用户体验。 

为此,StartLux(原点星辉)将团队自建的 Auto Research 方法用于决策模型研发,用 3 天时间完成了 StartLux-Decision 的研发与验证,并一次性推出 0.8B、2B、4B、9B、27B 五档版本。如此快速的迭代,得益于我们持续建设的 Auto Research 研发管线。这也是 StartLux 推进 RSI 的核心路径之一,让 AI 深度参与数据构造、训练、评测与失败分析,加快模型迭代。   

在独立的 Decision Index 0.2.1 评测中,27B 版本得分 63.88,38 项基准中有 31 项高于 Jev 1.13;在上海人工智能实验室(上海 AI 实验室)发布 Intern-Decision 时采用的七项评测中,27B 平均准确率达到 91.82%,同样高于 Jev 的 88.74%。[1]

本次发布的核心表现如下:

  • 27B 版本决策综合得分 63.88,38 项基准中 31 项高于 Jev。在 Decision Index 0.2.1 上,这一成绩比 Jev1.13 的 57.91 高出 5.97 分;9B 版本以 58.63 分超过这一公开对照。

  • 27B 版本七套测试平均准确率达到 91.82%。高于 Jev 的 88.74% 和 Intern-Decision-4B 的 90.02%;公开 JevBench 答对 208/231 题,比 Jev 多 9 题,Hard 子集的 111 道难题少错 8 题。

  • 一次回答三个问题,4B 平均耗时 26 毫秒。在单卡 H200、BF16 的短请求测试中,0.8B、2B、9B 和 27B 分别为 12.2、15.5、35.7 和 102.3 毫秒。模型直接输出选择及概率,不必生成回答文本。

  • 五档规格覆盖 0.8B 至 27B,支持本地部署。在 Decision Index 0.2.1 上,五档模型均领先对应公开对照:0.8B、2B、4B、9B 均高于同尺寸公开榜单最高分,27B 则高于当日公开榜首 Jev 1.13。五档模型均提供原始权重及 Q8_0、Q4_K_M、BF16 三种 GGUF 版本。

以上为项目公布的测试结果。Decision Index 对照采用 2026 年 9 月 28 日公开榜单快照,StartLux-Decision 为团队自测;时延为特定硬件与短请求条件下的结果,详细口径见正文。

一次计算,完成多个判断

一条业务信息,往往需要同时作出多个判断。以客服工单为例,同一条“订单被重复扣费,但仍显示未支付”的信息,可以同时对应三个问题:交给哪个团队、今天是否需要处理、影响有多严重。StartLux-Decision 支持选择题、是非题和等级评分,让这些问题可以在一次请求中共同完成,不必逐个生成回答。[1]

工单分流演示:一次请求完成三个判断。

从单步判断走向连续网页操作

连续执行,来自每一步决策与页面状态的衔接。在网页操作中,StartLux-Decision 每步回答两个问题:下一步操作哪个控件,任务是否已经完成?执行系统按模型的选择操作页面,再把更新后的状态交给模型,进入下一轮判断。

  • 在多重条件下完成商品筛选与下单

在购物演示中,用户要求购买“最便宜、免运费的 8 节装 AA 电池,并寄到家庭地址”。模型需要同时考虑型号、包装数量、价格和配送条件,不能只选择页面上最便宜的商品。最终,系统完成下单,并通过任务条件检查。

购物演示:筛选符合型号、包装与配送条件的商品,完成下单并核对结果。

  • 把成员邀请与权限设置衔接起来

在办公协作演示中,任务是把指定成员邀请到 Design 团队,并设置为 Editor。模型需要选对团队、成员和角色,再判断邀请是否完成。同样的方法可作为后台配置、成员管理等流程中的操作决策环节。

团队管理演示:选择 Design 团队,邀请指定成员,并设置 Editor 角色。

注:上述演示由执行系统提供页面状态和可选控件,输入框通过候选建议项完成选择;模型负责决策,系统负责执行与结果检查。它们展示的是受控环境中的连续操作,不等同于任意网站的自由输入能力。

让决策能力进入动态游戏交互

从网页操作延伸到业务流程,同一套决策接口可以承担更多明确的判断任务:客服系统选择处理团队,办公助手判断该使用哪个工具,工作流决定进入哪条处理分支。开发者提供业务状态和合法选项,模型负责在这些选项中作出判断。需要撰写邮件、填写开放式内容时,再由生成式模型接手。

游戏则提供了另一类测试环境:状态持续变化,动作执行后很快就会产生反馈。在 Mario、DOOM、StarCraft II 和 JevBall 的演示中,StartLux-Decision 被接入各自的运行环境,用于选择移动、跳跃、攻击或其他候选操作。

  • Mario · 1-1 关卡

比较候选动作的模拟结果,选择移动与跳跃。

  • StarCraft II · 策略决策

选择建造目标、兵种优先级与攻防策略。

  • DOOM · Deathmatch

选择目标、是否开火与移动方式。

  • JevBall · 足球协作

为球附近的球员分别选择传球、射门等动作。

根据本次发布记录,StartLux-Decision 在 Mario 演示中完成了 1-1 关卡;在 StarCraft II 演示中,为人族机器人选择建造目标、兵种优先级与攻防策略,并战胜内置 Hard 难度 AI。这里展示的是具体运行结果,不是多轮测试的通关率或胜率。

不同游戏也对应不同的决策节奏。StarCraft II 每 12 秒游戏时间提交一组三个问题;DOOM 同时判断目标、是否开火和如何移动,并等待模型回答;JevBall 则持续运行,一次请求为球附近的多名球员分别选择动作,迟到的回答由游戏自身策略兜底。

这些演示并非统一的“直接读屏”测试。Mario 先在模拟器中试运行 11 种候选动作,再将结果写成文字供模型选择;StarCraft II 的采集、建造与单位控制由脚本执行;DOOM 的状态来自游戏引擎,瞄准、寻路和脱困由代码处理。模型负责各自接口定义的决策,不包办全部感知与执行。

  • 交互中的细节,也可以单独测量

可靠的交互,往往取决于一个容易被忽略的判断。例如,玩家说“汉娜,你今天见过杰夫吗?”,系统需要判断对话对象是汉娜,而不是只因句子出现“杰夫”就让另一个角色回应。把这一环节单独测量,才能更清楚地比较模型是在理解对话,还是仅仅匹配名字。

对话对象判断:句子同时出现汉娜与杰夫,但被询问的是汉娜。各角色分别作是非判断。

旗舰版本为 StartLux-Decision-27B。除 Dino Run 为团队通过 Jev API 在同一执行环境复测外,Jev 数据引自相应测试作者的报告;0.8B、2B 在这些游戏上的表现明显较弱。

正常文本与姓名误听两种输入下,StartLux-Decision 分别比 Jev 少错 5 条和 7 条;相比简单姓名匹配,差距更为明显。Dino Run 则没有拉开差距:双方都在 20 次测试中达到预设上限。对应用而言,既要看模型在哪些复杂判断上更可靠,也要看某项测试是否已经不足以区分能力。

多项决策评测高于 Jev

团队使用 Decision Index 官方评测工具运行完整测试,并以 2026 年 9 月 28 日的公开榜单快照作为对照。StartLux-Decision 的系列最高得分为 63.88,高于 Jev 1.13 的 57.91;在指数包含的 38 项基准中,有 31 项得分更高。

同一快照中,Rune 26B-A4B、Decider chat 31B 和 AutoJev-27B 的得分分别为 57.44、57.33 和 56.40。StartLux-Decision 的最高得分分别高出 6.44、6.55 和 7.48 分;9B 版本得分为 58.63,也高于这几项公开结果以及 Jev 1.13 的 57.91。

Decision Index 0.2.1 对比。StartLux-Decision 使用榜单评测工具完成团队自测,其他模型取自 2026 年 9 月 28 日公开榜单;不表示已获官方上榜认证。

  • 从综合得分看关键能力的优势

总分之外,分领域结果更能说明差异来自哪里。在语言理解、检索与分类、工具与自动化,以及艺术与人类偏好四个领域,StartLux-Decision 旗舰版本的得分均高于表中其余对照;知识与推理领域则由 Jev 1.13 领先。

表中数值均为 Decision Index 的领域得分,不是原始准确率;旗舰版本对应 StartLux-Decision-27B。

其中,语言理解为 74.5 对 62.0,检索与分类为 66.8 对 55.4,工具与自动化为 82.2 对 75.1,分别高出 Jev 1.13 12.5、11.4 和 7.1 分。这些能力与前面的应用场景相呼应:理解用户提出的条件,在候选对象中作出区分,再选择下一步操作。

对开发者而言,综合表现最终要落到具体任务。进一步拆到单项测试,差异也并不完全一致。以下几项同时列出领先项和未领先项,便于开发者结合自己的任务判断。

以上为 Decision Index 版本中的随机基线校正分数,不能直接当作各基准原版的准确率或完整 Agent 成功率。† 表示训练使用了该基准的公开训练集,测试题已过滤;完整 38 项结果见项目文档。

这种差异也说明,综合得分领先不等于所有能力都更强。StartLux-Decision 在知识与推理领域的 44.3 低于 Jev 的 51.4,API-Bank 也未领先。对智能体更有用的选择方式,仍然是看它最常遇到哪些判断,而不只看一个总分。

  • 公开决策测试:不仅比较总分,也比较错在哪里

在来自上海人工智能实验室(上海 AI 实验室)发布 Intern-Decision 时采用的七套测试中,StartLux-Decision 旗舰版本平均准确率为 91.82%,高于 Jev 1.13 的 88.74% 和 Intern-Decision-4B 的 90.02%。公开 JevBench 共 231 题,三者分别答对 208、199 和 201 题。下面把同一组资料中的其他模型也放在一起对照。

七套测试为 JevBench Easy / Original / Hard、Typed Decisions、ToolACE、AG News 与 WildJailBreak。公开题答对数、七套平均与 Decision Index 是不同指标。

在 JevBench-Hard 的 111 道公开难题中,旗舰版本错 23 题,比 Jev 1.13 的 31 题少 8 题;4B 版本错 27 题,也少于 Intern-Decision-4B 的 29 题。七套测试平均错误率四舍五入后,旗舰版本为 8.2%,本系列 4B 为 8.8%,Intern-Decision-4B 为 10.0%,Jev 1.13 为 11.3%。

左:JevBench-Hard 公开难题错误数,越少越好。右:七套测试平均错误率。图中错误率为四舍五入后的结果。

  • 多档规格支撑不同部署需求

StartLux-Decision 提供五档版本,开发者可以按设备资源和任务需求选择。对照同日公开榜单,四个较小版本的得分均超过对应尺寸的最高分模型;旗舰版本则与榜首 Jev 1.13 比较,Jev 1.13 的参数规模未公开。

同尺寸比较:0.8B、2B、4B、9B 分别对照当日同尺寸最高分模型;27B 对照公开榜首 Jev 1.13,后者参数规模未公开,不属于已知的同尺寸比较。

这四档模型分别领先对应公开对照 19.64、15.22、9.71 和 11.74 分。9B 版本也以 58.63 分高于 Jev 1.13 的 57.91 分,分差为 0.72。与同样提供多个规格的 Intern-Decision 相比,差异也出现在各档模型,而不只在旗舰版本。

StartLux / Intern 分别指 StartLux-Decision 与 Intern-Decision 的对应规格。

其中,4B 版本在公开 JevBench 上答对 204 题,七套测试平均准确率为 91.17%,均高于 Jev 的相应结果;但其 Decision Index 综合得分仍低于 Jev。不同测试反映不同能力,选择模型仍应回到实际任务。

评测说明:以上 StartLux-Decision 成绩为团队自测,并非官方上榜结果。Decision Index 是经随机基线校正、加权汇总的指数,不是直接准确率。训练数据使用了其中 14 项基准的公开训练集,对应测试题已过滤。公开 JevBench 的 208/231 不是包含保密测试、速度与成本的官方总分。ToolACE 项取自公开训练集;排除该项后,4B 的其余六套平均准确率为 90.67%,Intern-Decision-4B 为 88.95%。

以毫秒级响应支撑高频判断

决策速度关系到智能体能多快进入下一步。在单卡 H200、bf16、本地 HTTP 的短请求测试中,StartLux-Decision-4B 一次回答三个问题,平均耗时 26.0 毫秒;只回答一个是非问题时,平均为 14.7 毫秒。0.8B 与 2B 的三问题请求分别为 12.2 和 15.5 毫秒。

推理时延:StartLux-Decision 为 H200 上 200 次串行请求的平均值;Jev 为其 API 网关报告的服务端耗时,取 100 次平均。

Jev 1.13 在同类三问题请求上的服务端耗时为 64.0 毫秒,但双方硬件和服务栈不同,不能据此得出严格的同硬件倍速结论。这里的毫秒数也不是整项网页任务的完成时间:输入长度、页面加载和工具执行都会影响最终耗时。

同类参考中,Intern-Decision 在 RTX 4090 上报告的 0.8B、2B、4B 时延分别约为 34.0、33.3 和 44.2 毫秒。与 StartLux-Decision 的 H200 数据一样,这些数值需要连同硬件与服务环境阅读,不能直接归结为模型本身的速度差。

同一模型内部的优化更能直接说明工程收益:在上述短请求测试中,StartLux-Decision-4B 未启用 CUDA Graph 时为 90.3 毫秒,启用后为 26.0 毫秒。项目同时使用快速线性注意力算子,并把多个问题合并到一次前向计算,减少重复计算与调用开销。

对智能体而言,这种计算方式的价值,是让候选动作已经明确的判断直接进入决策环节,不必等待长文本生成。一次请求还可以同时完成动作选择与结束判断,减少重复调用,为更紧凑、更连贯的执行流程提供条件。

  • 让专用决策与大模型协同工作

StartLux-Decision 还会返回每个候选项的概率。这为模型协作提供了明确的分流接口:在经过验证的常规场景里,可以直接执行决策;候选项难以区分、状态不充分或操作风险较高时,则补充观察、交给大模型分析,或者请求人工确认。

概率输出并不自动等于真实成功率,分流阈值需要结合业务数据校准。支付、删除、权限修改等操作仍应遵守原有授权与确认规则。决策模型的作用是帮助系统判断下一步,而不是替代这些约束。

以量化版本推进本地部署

模型是否适合长期运行,还取决于它能否装进实际的部署环境。除原始权重外,StartLux-Decision 的五档版本均提供面向 llama.cpp 的 GGUF 文件,包含保留原权重精度的 BF16,以及 Q8_0、Q4_K_M 两种量化格式。

在 Hugging Face 模型合集中,每档规格的 Q8_0、Q4_K_M 和 BF16 版本均已单独列出,共 15 个 GGUF 条目。开发者可以直接按“模型规格+精度”选择对应仓库,下载 GGUF 文件及决策服务所需的配套配置。

表中为模型文件大小,不是运行时总内存或显存需求;不代表这些规格已在任意设备上达到前文 H200 的时延。

以 4B 为例,Q8_0 文件大小为 4.48GB,在这次 231 道公开 JevBench 题目的量化复测中,与原始权重的决策一致率为 100%,同样答对 204 题。进一步压缩为 2.71 GB 的 Q4_K_M 后,决策一致率为 98.3%,答对 201 题。开发者因此可以在文件大小与任务表现之间作出更具体的取舍。

  • 兼容现有接口并支持业务适配

在接入方式上,StartLux-Decision 采用 TypeSafe 的 /v1/systemone 的接口,兼容原有 Jev 客户端的数据结构。业务程序可以保留现有的“状态+问题”调用方式,再配置相应服务地址。

接口说明:常见选择题可在一次前向计算中处理;单题超过 26 个候选项时,服务会分组筛选并进行后续决选,不是任意长度候选列表都只计算一次。

GGUF 部署同样保留这一接口:llama.cpp 负责承载模型,项目配套的决策服务负责组织问题并读出选项结果。项目代码采用 Apache-2.0 许可,模型权重采用 CC BY-NC 4.0 许可,可用于研究及其他非商业用途;商业使用需另行取得 StartLux Labs 授权;仓库还提供推理、评测复现、LoRA 微调与温度校准工具,方便开发者围绕自己的业务继续适配。

以 Auto Research 驱动决策模型迭代

StartLux-Decision 背后,是 StartLux 持续推进的 Auto Research 研发管线。这套由联合创始人兼 CTO 郭权玮带领团队建设的研发系统,将研究过程本身纳入迭代,也是公司推进 RSI(递归式自我改进)的一条路径。

此前,机器之心在 2026 年 9 月 16 日的专访《本地该怎么做 RSI?我们与 StartLux CTO 聊了聊》中,介绍过这套方法:AI 不只执行预先安排的实验,还会根据上一轮结果分析失败、提出新假设,并参与决定下一步研究什么;研究目标、评价标准和关键规则仍由人把关。[2]

这次,团队将这套方法落实到专用决策模型的迭代中,围绕智能体执行时的关键判断展开研发:能否选对动作、能否理解任务条件、输出是否适合程序使用。AI 参与数据构造、训练与评测,失败结果再回到下一轮实验中;改动是否保留,由实际测试检验,而不只看模型自己如何评价。

这也延续了郭权玮此前在钛媒体报道中表达的观点。2026 年 9 月 16 日,钛媒体记录了他在 ITValue Summit 的分享:企业评估 AI,应更多关注整套系统能否完成业务任务,并结合模型调度、权限与任务反馈持续改进。[3]

  • 让决策能力进一步服务自动研究

自动研究同样需要反复作出决策:下一步调用哪个工具,哪些失败需要进一步检查,什么情况应当暂停或转交其他模型。StartLux-Decision 为这些环节提供了可尝试的专用组件,也为决策能力进入研究流程打开了进一步探索的空间;是否能带来稳定收益,仍需要在具体研究流程中验证。

在郭权玮的定义中,Auto Research 是实现 RSI 的核心元件:先让 AI 参与研究和模型改进,之后进一步要求被改进后的 AI 连“改进 AI 的能力”本身也得到提升。StartLux-Decision 是这条研发路线上的另一项具体成果。

从一次判断到连续执行,StartLux 关注的是智能体如何把任务做得更顺畅。StartLux-Decision 将专用决策能力带到操作页面、分配任务和调用工具等环节,让高频判断有机会减少不必要的等待,让复杂问题及时转交合适的模型或人。围绕这些真实任务,StartLux 将继续推进模型、推理系统与智能体执行能力的协同,让研发成果更直接地服务任务完成。

代码与模型:

为助力决策模型赛道发展,我们决定完整开源 Startlux-Decision,欢迎大家下载、测试与交流。同时,也欢迎优秀人才加入我们共同推动 RSI 发展。

GitHub 链接:https://github.com/StartLuxLabs/Startlux-Decision

Hugging Face 模型合集下载链接:https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493

合集包含五档原始模型,以及按规格与精度分别列出的 15 个 GGUF 版本;

技术资料与相关阅读

[1] StartLux-Decision 已公开项目仓库:README、推理文档、评测结果、量化测试及 media 演示素材。2026-09-30 核对;Decision Index 对照仍采用仓库注明的 2026-09-28 榜单快照,主评测与量化复测分别列示。

[2] 机器之心,2026-09-16:《本地该怎么做 RSI?我们与 StartLux CTO 聊了聊》(公开转载)。

[3] 钛媒体,2026-09-16:《郭权玮:企业 AI 不必迷信综合榜单,重系统闭环与可信部署》。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多