Token导航 LogoToken导航TokenDH.com

阶跃甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把开源旗舰的"性价比边界"往外推了一格

更新时间 2026-09-20来源 AIBase正文 1613字阅读约 6分钟2 张图片

阶跃今天全量开放新一代旗舰基座 Step5Preview,定位很明确——一款为真实世界里 Agentic 任务而生的主力模型。它想解决的是 AI 模型里那道经典的"帕累托题":能力、效率、成本三个目标互相拉扯,历史上想在一个维度上往前走,往往得拿另一个维度去换;而推进帕累托前沿,不是让取舍消失,而是用新设计把整条边界往外推。

这次的推法是稀疏 MoE 架构。Step5Preview 总参数600B,但每次只激活27B,原生支持100万 Token 上下文窗口,并且能直接吃文本和视觉两种输入。在 Artificial Analysis 的 Intelligence Index 里,它拿到44分,挤进全球开源模型前三;更狠的是单任务成本只有 Claude Opus5的八分之一——同一笔预算换更强智能,或者同等能力以更低价格落地,两条路它都给铺了。

image.png

硬实力在几个高难度基准上露了脸。在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance,以及跨领域深度研究评测 DRACO 上,Step5Preview 仅次于 GPT-6Astra 或 Claude Opus5,把其他参评的开源模型甩在身后;GDPval-AA v2也采用了截至9月19日的最新结果,DeepSWE v1.1在 SWE-agent harness 下以 temperature=1.0、top_p=0.95评测。

编程这块,阶跃自建了 StepCodeBench,覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言。Step5Preview 在整体成功率和跨场景稳定性上都站得住,Bug 修复、功能开发、重构、环境配置这类真实活儿都能接。一个演示里,它读着 ESP32设备的大量开发文档,把一块 ESP32-S3开发板改造成支持蓝牙按键和语音输入的 Vibe Coding 键盘,过程中自己开 COM 串口、调摄像头、截设备图、模拟鼠标,再根据真实报错连续改代码跑调试,一口气干了三个多小时。

image.png

长周期任务更见真章。第一项实验给24小时、一张 H100,让它从零优化一个 MLA GPU 内核(头维度512、batch1、64个注意力头、8192token)。Step5Preview 自主改代码、跑内核、测吞吐,遇到跑得通却降速的方案就放弃、从最佳版本接着爬,约22小时后把峰值性能顶到508TFLOPS,压过了 Claude Opus5的493TFLOPS。第二项实验同样24小时,让它通过自动化后训练提升一个 Qwen3-30B-A3B 基础模型在 AIME24上的表现,模型自己决定怎么用标注 API、怎么调数据,最终把准确率从53.3% 拉到60%,和 Opus5持平却更省标注 token。

前端与视觉上,它不只会写网页,还能调用 Blender 建并反复改3D 资产,再接进 Three.js 做交互应用和游戏;甚至从一本1922年的《广九铁路旅行指南》里抽信息,做出行程查询、费用计算和路线回放,让小火车沿百年前的线路跑起来,把史料变成可交互产品。

金融被当成综合能力的试金石。阶跃围绕公司研究这一高难度流程建了三项内部评测:FinStepBench-LiveSearch 考随需求变化检索核验金融信息,CorporateValuation 考把数据和假设转成可复现估值,DeepResearch 考从证据收集到完整研究报告的全程;外部基准 FrontierFinance 则用220道专家题、11543项评分标准覆盖六类投资场景。四项里 Step5Preview 都交出强结果。

从 Step3.5Flash、Step3.7Flash 到 Step5Preview,阶跃押的始终是同一件事:下一阶段的 Scaling 不只是堆更多 Compute,更是把 Compute 用得更高效。今天全量开放之后,完整模型权重将在10月15日释放,这款把"能力—成本—效率"重新撮合过一遍的开源旗舰,正等着开发者把它当成 Agent 任务的日常主力。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多