
中国大模型第一梯队,又杀回来一个老玩家。
9月大模型的一波密集更新,已经把榜单头部分差压缩到一个很窄的区间。
据Artificial Analysis Intelligence Index 的最新结果,阶跃新旗舰模型Step 5 Preview获评44分,位列全球开源前二。阶跃也就此回到中国基模第一梯队。

过去两年,头部大模型玩家已经各自跑出鲜明标签。DeepSeek打开全球开发者市场,千问背靠阿里云和阿里生态,智谱深耕企业服务,Kimi从个人用户和产品体验切入。阶跃走得更重,基础模型之外,还投入语音、视觉、端侧模型和终端量产。
这条路线一度让阶跃显得不够轻快,毕竟当行业还在比参数和单次回答时,终端适配还要经过测试和量产,工程投入重,短期内既很难提升榜单排名,也很难立刻换来市场声量。
但随着竞争重心开始变化,Agent正从办公工具走向手机、汽车等高频使用场景,模型能力、运行效率、全模态和终端工程开始被放进同一张考卷。
这让阶跃过去的重投入开始显出价值。

新旗舰上桌,阶跃跻身全球开源前二
根据公开资料,Step 5 Preview是阶跃面向Agent任务推出的新一代开源旗舰基座模型。
该模型拥有6000亿总参数、270亿激活参数,由92层Transformer构成,原生支持文本和视觉输入,上下文长度达到1M token。
AA榜单中的这项指数,综合了软件工程、工具调用、长上下文、科学推理等十项测试。Step 5 Preview以44分高分进入全球前沿模型最拥挤的梯队。
Step 5 Preview 的6000亿总参数,代表整套专家网络的容量;每次推理只激活270亿,代表每一步真正参与计算的部分。这是Step 5 Preview兼顾速度和成本的第一步。
Agent连续工作时,经常要一次读入大量历史材料、操作记录和工具返回结果。任务越复杂,模型越需要把分散在不同材料中的线索一层层串联起来。
为了提升这方面的能力,Step 5 Preview 采用“窄而深”的架构,将Transformer网络加深至92层(在同类大模型中已属比较激进的深度),为复杂信息在模型内部的逐层传递和关联提供更长的路径。
但网络越深,训练时越容易出现数值爆炸、梯度尖峰等问题。为此,Step 5 Preview 专门做了优化,使92层网络也能保持稳定训练。
接着,Step 5 Preview用1M上下文解决“装得下”,用稀疏计算减少无效计算,用Token合并让计算跑得更快。
1M上下文可以一次容纳更长的财报、代码库、网页材料和Agent操作记录。但如果每一步都重新扫描全部历史信息,材料装得越多,计算量就越大,速度越慢,成本也越高。
Step 5 Preview的单任务成本明显低于Kimi K3和Grok 4.6。AA将其置于智能水平与单任务成本的最优前沿,也就是说,很难找到一款能力更强且更便宜,或者能力相当但成本更低的模型。而这也是很多企业和开发者选择模型时,最关键的考量因素。

从Step 3.5 Flash、Step 3.7 Flash到Step 5 Preview,阶跃一直在探索如何把算力花得更高效。
Flash先提速降本,跑通效率路线。Step 5 Preview又把这条路线延伸到旗舰模型。兼具前沿能力和计算效率,也成为阶跃最硬核的技术标签之一。
公开资料统计显示,Token使用量已经达到数百倍甚至千倍量级的增长,但同期算力增长不足3倍。
等Agent进入更多场景和设备后,这个缺口还会继续扩大。行业必须让模型少走弯路、少做无效计算,让同一批服务器承接更多任务。
这也是为什么最近各家纷纷在flash版本上发力。GLM 5.3 Flash、DeepSeek V4.1 Flash、Gemini 3.8 Flash等模型,都在争取更好的能力与成本平衡。
Step 5 Preview 通过覆盖样本全生命周期的账本机制,将漫长生产链路中的端到端样本丢失率压到1%以下。这说明阶跃的优化不只涉及模型本身,也深入到了样本生产、流转和使用的系统链路。

Agent想进入日常,模型公司得重算总账
与Chatbot的单轮问答不同,Agent的执行链路更长,每一步的等待、错误和无效调用都会传导到最终交付。
因此,模型的智能、工具调用、稳定性和纠错能力都不能有明显短板。
金融是阶跃重点验证的场景。
在公开和内部评估中,Step 5 Preview 在复杂的软件工程任务(包括长程规划任务)、专业知识工作和金融领域等基准测试中,展现出较为均衡的综合能力。
在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance,以及跨领域深度研究评测 DRACO 上,它仅次于 GPT-6 Astra 或 Claude Opus 5,领先其他参评开源模型。

为了测试效果,「市象」让Step 5 Preview完成白酒行业2026年半年报选题初筛。
模型先遍历A股白酒企业,最终纳入19家,读取约41份正式文件和30篇辅助材料。遇到PDF登录、单位不一和同期数据重述等问题时,它会更换信源、统一口径、单列异常。缺失数据留空并标注人工复核,数据处理相当严谨。
全程七分钟,九份文件陆续生成,涵盖原始数据、计算指标、异常日志、选题雷达、采访清单和图表报告。每份文件都能预览、下载、查看源代码,相当于交付了一套可核验、可修改、可复用的研究流程。

B站TOY专区有一款基于Step 5 Preview开发的《荒星疾驰》。悬浮赛车、沙漠建筑和光影氛围完整,碰撞效果也比较出彩。

据开发者凯伦介绍,这款游戏共花费2天制作,1天用来构思、做资产和美术,另1天用来反复调试游戏性、试错。
这就是生产级Agent的价值:能力、速度、成本和稳定性必须一起过关,Agent才有机会从办公工具变成日常大规模使用的服务。

大模型进入体系战,阶跃的重投入开始见效
重新评价阶跃,需要把前沿基模研发能力、全模态能力和终端量产放在一起看。
Step 5 Preview把阶跃的基模能力推回全球前沿,也为更复杂的生产级Agent提供了理解、推理和规划能力。
但Agent面对的世界比办公场景复杂得多。用户可能说一段方言、拍一张元素杂乱的照片,也可能下达一个模糊指令。
如果模型只能处理文字,用户还得先把需求翻译成一段提示词,Agent就很难真正进入日常生活。
因此,能让Agent听见语音、看懂图像和屏幕的全模态能力,是Agent进入日常场景的基础。这正是阶跃“模、软、硬三位一体”开始产生价值的地方。
过去一个季度,阶跃先后更新端侧Step Edge系列和语音StepAudio 3系列,随后发布Step 5 Preview,基模、语音、视觉和端侧模型完成一轮集中升级。
其中,StepAudio 3 Realtime在Artificial Analysis对话动态测试中以98.9%的综合得分位列全球第一,在语音推理测试中以99.7%的准确率位列全球第一。StepAudio 3 ASR以1.7%的词错误率并列全球第一,Step Edge取得29项第一。
不仅要补齐全模态能力,量产检验更是一大难关。
手机和汽车面临的嘈杂环境、弱网、权限冲突、有限算力、功耗和高并发等严苛条件,本身就是对模型与工程能力的长期压力测试。
目前,阶跃已与OPPO、荣耀、中兴、努比亚等品牌合作,覆盖国内超过50%的头部手机品牌,模型装机量超过4200万台,日均服务近2000万人次。
在汽车端,阶跃与吉利、千里科技共同研发超级Eva,并进入吉利旗下多款车型。超级Eva已能理解模糊指令、规划路线并调用车辆系统执行任务。
这正是阶跃“模、软、硬三位一体”最难被复制的地方。毕竟基础模型按月迭代,手机和汽车端的磨合周期往往以年计算。
磨合中,响应速度、安全、功耗和成本可能由不同团队负责,目标之间还会互相牵制。但缺少任何一项,都很难把这条链路跑通。
阶跃的公司标签也由此变得清晰。
作为少数同时拥有前沿基模、全模态和终端量产能力的独立大模型公司,阶跃这套体系能将真实使用中的问题反哺到模型、软件、终端的持续优化中。每轮更新再落地验证,形成能力越用越强的正向飞轮。
如果说Step 5 Preview解决了阶跃能不能重新上桌的问题,那么过去两年押注全模态、端侧和终端量产的重投入,就是它新的筹码。







