强强联合
今天,阶跃星辰发布了旗舰模型:Step 5 Preview
总参数 600B,激活参数 27B,上下文 1M,原生支持文本与视觉输入。价格方面,输入 ¥7,输出 ¥20,缓存 ¥0.35(单位:每百万 token)
这款模型将在 10 月 15 日正式开源,下面这个是核心 bench
这款模型在 Artificial Analysis 获得 44 分, 全球开源前三
Step 5 Preview 的智能与任务成本对比
并且:模型已接入 AGI Bar,在未来 1 周里免费提供给大家老样子:连上店内 Wi-Fi,配置 Base URL 和 API Key,直接就能用了

模型定位
Step 5 Preview 面向软件工程、深度研究和专业工作流,重点训练长上下文、多轮工具调用和长程 Agent 执行,下面这些事各种 bench 数据

除此之外,阶跃还构建了StepCodeBench,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言。任务包括功能修改、Bug 修复、重构、文档生成、性能调优、代码生成、CI/CD 运维、代码转换和环境配置等
Step 5 Preview 在这项评测上的 avg@4 为 49.0%,在功能修改、Bug 修复和重构较为突出;低、中等难度任务的结果接近 Claude Opus 5
StepCodeBench 六类主要任务的表现
另外,Step 5 Preview 在金融领域进行了特别优化。这里有三项内部金融评测,以及外部的 FrontierFinance:
LiveSearch:检索并核验及时、可靠的金融信息
CorporateValuation:把金融数据与假设转成财务预测,完成可复现的企业估值
DeepResearch:覆盖证据搜集、分析与完整研究报告,检查来源、假设和计算能否追溯
FrontierFinance:覆盖 6 类投资场景、220 道专家设计的问题、11,543 项评估标准

官方案例
下面这些,来自官方的案例,来给大家展示下 Step 5 Preview 能够调用 Blender 创建、调整 3D 资产,再把这些东西接入 Three.js 应用或游戏
1. Room Planner:从一张照片到可交互的房间
输入一张卧室照片,生成可编辑的 3D 空间。家具可以移动、旋转,摆放时有反馈,完成后还能进入房间,以第一人称视角查看布局
2. 3D Flappy Bird把 Flappy Bird 做成浏览器里的 3D 游戏,包含立体障碍、动态环境、实时操控和完整的游戏循环
3. Dream Racing驾驶线条构成的赛车,在不断变化的场景中前进,速度、颜色和音乐一起变化
4. Toy Universe两个风格不同的 3D 世界放进同一个交互空间,通过动画和交互探索场景,也可以用实时语音与角色对话
5. 穿越时光的铁路以一本 1922 年的旅行指南为基础,重建九广铁路的交互式历史图册,包含路线、车站、行程规划和票价计算
6. 清明上河图用 p5.js 的线条和图形逐笔构建场景,再通过绘制动画,把画面一点点展开
7. 动态象棋
可玩的 3D 中国象棋,包含传统规则、立体棋盘、棋子动画和视听反馈
长程任务
在没有 Pokémon 专项优化的情况下,Step 5 Preview 持续推进《Pokémon Red》。回放面板记录了 3,093 回合、6,288,358 个任务 Tokens、3 枚道馆徽章
模型已经解锁「居合斩」,在第 3,082 步击败枯叶道馆馆主马志士,主线进度约三分之一。回放可以按回合查看游戏画面、模型输出与工具结果,也可以从里程碑跳转,并查看累计 Token 消耗
宝可梦回放
在获得开发文档和用户授权后,Step 5 Preview 调用相机、COM 端口、截图与模拟鼠标输入,完成设备侧的开发调试。这个案例里,它连续工作超过 3 小时,根据设备反馈编写、运行和修改代码,最终控制可编程键盘
可编程键盘开发与调试
给模型 24 小时、一张 NVIDIA H100,从零优化 MLA GPU Kernel。任务配置为 Head Dimension 512、Batch Size 1、64 Heads、8,192 Tokens。模型自行实现、运行 Kernel,根据吞吐结果继续修改;能运行但性能退步的版本会被放弃,后续搜索从当前更好的版本继续
每个模型独立运行 4 次,取最佳结果。Step 5 Preview 在约 22 小时后达到前向、反向合计 508 TFLOPS。这组对比中,Claude Opus 5 为 493,Kimi K3 为 307,GLM-5.3 为 286
MLA Kernel 优化过程与最终吞吐
另一项实验也给了 24 小时,目标是提高 Qwen3-30B-A3B 基础模型在 AIME24 上的表现。Step 5 Preview 可以调用接入生产数据的 API annotator,自行决定标注方式和数据调整方案,再根据训练后的效果继续迭代,最终,模型在 AIME24 官方测试集上的准确率从 53.3% 提高到 60%,与 Claude Opus 5 的结果持平,但消耗的 annotator tokens 更少
后训练实验:Token 消耗与 AIME24 准确率
技术思考
下面这些思考,来自 Step 技术团队:
如何让模型思考的更深
复杂 Agent 任务里存在大量多跳依赖:后续判断要依赖前面的信息和工具结果,频繁调用工具又会带来越来越长的 Prefill。Step 5 Preview 因此采用 Narrow but Deep 的设计,用 92 层 Transformer 为长 Prefill 中的隐式多跳推理提供更长的信息传播路径。更深的网络也更难训练,团队专门处理了数值爆炸、梯度尖峰等稳定性问题
如何让稀疏真正产生效率
面对 1M 上下文,Step 5 Preview 引入 Sparse GQA,通过稀疏索引选择相关历史信息参与计算。但减少 Attention 计算量,并不自动等于运行更快:Indexer 开销、数据读取和 GPU 利用率都会影响实际收益。因此,模型进一步通过 Block-wise Token Merging,把 Indexer 与 Top-k Selection 的成本降到原来的 1/8,并合并相邻 Token 高度重叠的 Top-k 结果,改善碎片化计算造成的 GPU 利用率问题
走向自进化:模型参与自身迭代
数据生产也开始让 Step 5 Preview 参与自身的迭代。随着长程 Agent 能力增强,研发中的模型已经能够承担部分数据构建工作。但直接把 Agent 放进流程,会遇到任务被简化、反复收敛到熟悉模式,以及利用评测漏洞等问题
为此,团队用统一上下文沉淀领域先验与历史反馈,把领域知识组织成可遍历的结构,帮助 Agent 寻找长尾盲区;再用显式信号调节任务难度与多样性,将 Anti-hacking 审计嵌入流程。人类专家负责原则与关键判断,确定性操作交给可复用工具,Agent 负责流程编排与跨步骤决策。这套体系已经参与构建了百万级、可验证的高难任务,覆盖科学推理、软件工程、机器学习研发和专业工作;构建过程中留下的轨迹与反馈,还会继续用于训练下一代模型的数据生产能力
如何让长程 Agent 真正可训练
长程 Agent 的强化学习,首先要解决训练与推理的一致性。微小数值差异可能在 MoE 路由中变成不同的计算分支,并随网络加深不断累积。官方介绍,在严格 on-policy 条件下,团队通过确定性算子、训练与推理算子逐一对齐,以及优化后的树状归约,使计算结果不受张量并行度影响,实现 bit-wise 对齐,端到端额外开销低于 10%。异步训练中,训练侧复用推理时的计算状态,把逐步长程训练的 logprob 偏差控制在 1e-2 以内







