作者:快思慢想研究院 田丰,每日经济新闻记者 郑欣蔚
引言
一道强光,划过2026年初夏的开发者社区
2026年6月初的某一天,一个中国模型的名字悄然出现在海外开发者社区的热搜榜顶端,停留在那里,吸引着全球工程师的目光。
Step 3.7 Flash——阶跃星辰于5月29日发布并开源的最新基座模型——在上线仅两天后,便登上OpenRouter Trending全球排行榜第二位。随后,它在Artificial Analysis权威评测平台的输出速度榜以409 Tokens/s夺得主流模型第一,同时在端到端响应时长、智能效率、速度价格比三项关键指标上全面领跑。一周之内,多个"第一"的标签密集贴上这个名字。
中国大模型,罕见地在海外引发了一场集体注目。

然而,就在聚光灯最亮的那个时间窗口里,竞争对手的牌已悄然落桌。Step 3.7 Flash发布的五天前,同属"AI六小龙"的智谱已率先推出GLM-5.1高速版API,输出速度同样标定在400 Tokens/s;发布仅三天后,MiniMax携全新通用模型M3强势卡位,祭出百万Token超长上下文、前沿编程能力与原生多模态的"完整能力组合"。三家公司,三张牌,在同一个时间窗口内依次落地。
这个窗口本身,已经说明了一切。
快思慢想研究院院长田丰的判断直截了当:400 Tokens/s是当前推理系统工程的技术收敛点,而非任何一家公司的独占优势。
一、稀疏架构的“速度美学”
理解Step 3.7 Flash,需要先读懂阶跃星辰这次押注的完整技术逻辑。
该模型采用稀疏MoE(混合专家)架构,总参数196B加上1.8B的视觉编码器(ViT),但激活参数仅约11B。换言之,每次推理真正被"唤醒"工作的参数量,只占全量参数的约5%。以11B激活参数撑起400 Tokens/s的生成速度,是MoE稀疏激活机制与推理工程协同优化的有效验证,技术上值得认可。
然而阶跃对Flash路线的押注,远不止于追求一个速度数字。
"高效率Flash模型将不再是旗舰模型的补充,而会成为AI生产化时代最重要的基础模型形态之一。"这是阶跃星辰对自身战略方向的核心判断。其背后的逻辑,建立在对Agent时代成本结构的精准洞察之上:在企业级Agent部署场景中,一个端到端工作流通常包含10至50次大模型调用;生产环境的真实约束是总延迟与总成本,而非单次推理峰值。从这一视角出发,阶跃押注"单位成本下的有效智能",具有清晰的工程合理性。

为了让这一判断落地,Step 3.7 Flash围绕生产级Agent场景优化了四项核心能力:
原生多模态理解执行:可识别图表、软件界面、驾驶面板,并拆解实操步骤;
联网与视觉搜索增强:图像与全网检索能力,对不确定信息可自主交叉核验;
高稳定性工具调用与编排:支持浏览器、终端、办公软件等多达66类工具的连贯调用;
全生态适配主流Agent开发框架:兼顾云端商用与本地轻量化部署。
在工具调用的实测数据上,Step 3.7 Flash在τ²-bench(一款面向大语言模型对话智能体的评测基准工具,测试模型在用户、工具、数据库三方交互中的一致性与抗错能力)电信客服场景的低、中、高三档推理难度下,通过率均超过98%。田丰认为,τ²-bench是目前最贴近生产级Agent场景的工具调用基准之一,98%的得分具有真实参考价值。
然而,这里有一盆必要的冷水需要泼下:τ²-bench的测试集中于零售、航空、电信等结构化行业场景,对现实Agent工作流中的长尾挑战——非结构化API调用、动态上下文切换、多工具串联失败后的恢复——覆盖明显不足。OpenRouter数据同样耐人寻味:Step 3.7 Flash发布一周内,周Token消耗量约为566K,属于中等活跃水平,尚不足以判断规模化生产采用是否真正到来。
真正值得追踪的信号,是未来数月内Step 3.7 Flash能否在OpenRouter工具调用模型榜单中稳定跻身前三,并维持持续增长的调用曲线。
Dario Amodei曾将基础模型的竞争比作"能力前沿的集体攀升"——当多个团队同步触及同一技术天花板,先发优势只能以生态密度来兑现。
二、三张牌,三种定价权
速度封神的荣光之下,是三条技术路线的分野,以及各自争夺的市场话语权。
智谱的牌是"快+深绑定"。 5月22日,即阶跃星辰发布Step 3.7 Flash的整整一周前,智谱已悄然推出GLM-5.1高速版API,同样达到400 Tokens/s,并宣称是旗舰级能力与低延迟的首次结合。两家在同一周内达到相同速度上限,田丰锐利解读:"这说明400 Tokens/s已成为当前推理系统工程的技术收敛点,绝非阶跃的独立优势。"
值得关注的是,速度赛道历来不缺追逐者。DeepSeek最新的V4系列模型,已同时推出Pro与Flash两条产品线,两者均支持高达100万Token的超长上下文,旗舰型号主打推理峰值,Flash型号主打效率。Flash产品路线正在迎来全行业的集结。

MiniMax的牌是"能力完整性"。 6月1日正式亮相的M3模型,其战略叙事建立在三个维度的组合之上:基于自研MSA架构,支持1M Token实用上下文,且在1M上下文下每Token计算量仅为上代的1/20;SWE-Bench Pro得分59.0%,超越GPT-5.5与Gemini 3.1 Pro;在BrowseComp以83.5分超越Claude Opus 4.7。最具说服力的是一项可复现的实测展示——M3在AI自主完成论文复现任务中连续运行近12小时,全程产出18次代码提交与23张实验图表,完整跑通核心实验。
这类展示,将M3牢牢锚定在"可信任托付长程复杂任务"的认知位置——这是一个能够支撑更高API单价的定价基础。正如DeepMind联合创始人Demis Hassabis在AlphaCode项目中所揭示的原则:在代码生成领域,能力峰值的差距可以直接换算为程序员节省的时间,而“程序员时间”是企业愿意为之持续付费的硬性成本。MiniMax M3以"Claude Pro五分之一价格、获得等效甚至更强编程与Agent能力"为定价叙事,同时收割两类市场——追求极致能力的开发者,以及追求性价比的企业客户。

阶跃的牌是"高频效率基础设施"。 围绕"单位成本下的有效智能"锚定定位,争夺中低复杂度Agent场景的高频调用市场。
田丰对这三条路线的关系判断清晰:两条路线并非零和博弈,而是各自对应Agent生产化的不同价值层——MiniMax以"能力峰值"争夺复杂任务定价权,阶跃以"速度路线"锁定基础设施调用频率,智谱则以"开发者生态"深耕政企MaaS商业化。
历史上,数据库领域的MySQL与Oracle、云计算领域的低价实例与高性能实例,长期并存而非相互取代。然而历史也清醒地告诉我们,速度与成本的优势可以为阶跃赢得大量中低复杂度Agent场景,但这类场景的迁移成本同样很低。一旦竞争对手在速度上完成收敛——智谱已在一周内完成跟进——护城河便会迅速遭到侵蚀。

田丰直接点出阶跃最需要警惕的陷阱:"廉价但可替代"。这是速度路线在缺乏生态支撑时的宿命。
三、256K的清醒取舍,与它尚未看见的天花板
在技术层面,Step 3.7 Flash还埋下了一个值得长期追踪的结构性隐患:256K的上下文窗口。
这是一个清醒的工程取舍——以相对有限的上下文换取更高的推理速度和更低的运行成本,对多数单任务Agent而言已经够用。但当对比维度切换至竞争对手,这个数字便显出其边界:MiniMax M3在1M上下文下每Token计算量仅为上代的1/20,且将这一能力明确定位为"长程Agent、长程Coding、长视频理解的基础设施"。这一判断与实际生产瓶颈高度吻合——对规模较大的单体代码库(动辄超过500K Token)进行全局分析,或执行多轮深度研究任务,256K将形成不可绕过的硬约束。

更深层的问题浮出水面:从第一性原理分析Agent生产化的核心瓶颈,"工具调用可靠性×上下文长度"的乘积,才是决定Agent任务复杂度理论上限的关键变量。 在当前阶段,大量生产级Agent失败的根本原因是"任务在长流程中丢失上下文",而非"推理速度不够快"。
更值得警惕的是,GitHub Copilot Workspace、Devin等代表性产品的演进方向,正在清晰地指向"长线程自主执行"的Agent主流形态。如果这一方向成为行业共识,速度与工具调用可靠性将更可能是基础设施层的竞争门票,而非构筑产品护城河的差异化优势。
阶跃真正需要回答的问题是:在256K的边界之外,凭什么支撑更高复杂度任务的定价权?
四、生态账单,战略摆动的历史代价,与需求侧闭环的缺失
理解阶跃星辰当下的处境,必须回溯它走过的弯路,以及弯路所形成的时间成本。
阶跃星辰早年深耕C端消费应用,主力产品"冒泡鸭"停运后,公司从"超级模型+超级应用"路线仓促切换至Agent基座研发方向。这一战略摆动在资本市场留下了清晰的估值轨迹:其PS值曾随C端路线接近月之暗面约200倍的高位水平,路线切换后大幅回落至智谱、MiniMax早期的区间——折射出资本市场对其定位一致性的持续质疑。两次押注之间,空置了一段产品积累周期,而产品积累周期的空置,意味着用户触点的系统性缺失。
反观竞争对手,方向的清晰性在IPO前便已奠定。智谱以GLM系列为产品锚,深度绑定企业MaaS市场;MiniMax以Talkie等C端产品为流量飞轮,驱动全球化增长——截至最新披露,MiniMax全球企业和开发者客户数已超百万,较半年前增长5倍,全球用户规模约3亿,过去两个月年化经常性收入增长超过100%;2025年全年实现营收7903.8万美元,其中开放平台B端收入同比增长197.8%,背后是开发者长期沉淀所产生的API调用黏性。

智谱的数字同样触目:2026年3月,其MaaS平台注册用户突破400万,API年度经常性收入飙升至约17亿元,较上年同期提升60倍。CodeGeeX作为其锚定编程开发者的杀手级应用,为智谱在AI编程生态中建立了清晰而持久的心智占位。据接近公司的信源透露,在DeepSeek冲击后,智谱已将GLM下一代研发资源集中投向Coding方向,部分多模态团队并入Coding团队——这种快速的生态敏感性与资源响应速度,正是长期生态密度积累的底层逻辑写照。
阶跃也并非没有意识到生态建设的重要性。其联合华为昇腾、沐曦、壁仞、燧原等近十家芯片厂商成立"模芯生态创新联盟",在国产算力适配上提前布局,方向不能说错。然而,这一联盟目前仍停留于"初步适配运行"阶段,尚未转化为可量化的部署规模或开发者迁移数据。
Andrej Karpathy的判断对此有着直接的针对性:"软件生态的网络效应,比硬件性能的线性提升更难被追赶。"阶跃当前的生态联盟,更接近供给侧的协同整合。诺贝尔经济学奖得主迈克尔·斯宾塞的信号理论同样指向同一结论:真正的竞争壁垒来自难以被模仿的能力积累,而非可量化的单点指标。

真正的生态壁垒,需要以需求侧的开发者黏性作为回路——而这个闭环,目前在阶跃这里尚未形成。
田丰的总结尤为清醒:"阶跃虽有技术信号,却尚缺生态密度;有速度优势,却面临可替代的隐忧。这类短板的弥补周期,远长于技术迭代本身。"
速度之后,是那个最难的问题
一周前,Step 3.7 Flash登上了它能登上的那个榜单。这是阶跃星辰在效率基础设施赛道建立的一个可验证的技术信号,也是中国开源模型在海外开发者社区难得的一次真实高光时刻。
但技术信号,不等于竞争护城河。
行业最终的竞争,从来不会在速度达到收敛之后,继续在速度上分出胜负。就像Karpathy所说的网络效应,就像斯宾塞所描述的信号博弈,真正难以被复制的,是那条将模型能力具象化为用户行为数据的产品链路——是CodeGeeX锁住的编程开发者社区,是Talkie积累的三亿全球用户,是在数百万次API调用中沉淀出来、无法被快速迁走的开发者黏性。
Step 3.7 Flash已经帮阶跃星辰守住了效率赛道的入场资格。但入场资格,从来不是终点,更不是答案。
那个最难的问题,仍然悬在那里等待回答:在Flash之后,在256K的边界之外,在"廉价但可替代"的陷阱旁边,阶跃用什么,支撑那个属于自己的、不可替代的位置?
参考文章:《Step 3.7 Flash冲上海外热榜,智谱、MiniMax同台竞速,阶跃星辰高光背后仍需补齐生态欠账》,每日经济新闻,郑欣蔚

出版社:人民邮电出版社
作者:田丰
帮助你定位AI当下发展坐标的指南针
帮助你洞察AI未来演进趋势的航海图
通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。







