Token导航 LogoToken导航TokenDH.com

一手实测Step 3.7 Flash:目前最快的开源模型

更新时间 2026-05-30来源 沃垠AI正文 1960字阅读约 7分钟16 张图片

大家好,我是冷逸。

兄弟们,我发现了一个神仙模型。

先考你一道题:既然全宇宙都在膨胀,那我变胖是不是符合宇宙规律?

嗯……你是不是要先想一下?在你想的时候,模型已经推理并回答出来了。

图片

是的,就2秒(纯API调用)。

图片

官方说,它的输出速度能拉到400 Token/s。

而且,它还原生支持视觉理解,图片、视频都能看懂。要知道,即使到现在,国内支持视觉理解的模型总共就没几款。

那它一定很贵吧?

并不。订阅Step Plan最低只要38元/月。API直连,输入(缓存命中)0.27 元,缓存未命中是1.35元,输出是8.1元。

图片

单看这个价格,好像并不比DeepSeek v4 Flash(输入1元/输出2元)便宜。但如果你横向对比多模态+超高速这个组合,它的性价比就非常有优势了。

对了,它还开源。

这就是昨天发布的Step 3.7 Flash,原生支持视觉理解,为Agent做了全面优化,超快速度,256k上下文,总参数198B(激活11B)。

图片

一手实测

这是它的benchmark得分。

图片

简单说就是:

  • 对比GPT和Claude还有些差距,但Gemini还是能超一超的;

  • 对比DeepSeek各有胜出;

  • 对比上一代模型,大幅提升;

  • 以及速度上,遥遥领先……因为大多数模型都在100 TPS以下。

比如Artificial Analysis这个速度榜单,之前最快的是GPT-5.3,也只有130多。

图片

而Step 3.7 Flash能冲到400 TPS,也不知道用了什么魔法。。

图片

我实测可以拉到330+TPS

下面我们实测几个Case,带你直观感受一下。

1)视觉编程任务

第一个任务:测试视觉理解+编程能力。

我没告诉它是什么桥,让它自己理解,然后设计一个3D模型。

图片

One shot直出,效果还不错。

图片

而且它识别出了这是旧金山的金门大桥。

但也u1s1,这前端能力和顶级模型k2.6和glm5.1比还有差距。

2)视觉理解任务

我随便在某软件里截了张图,画了个框,问它:我如果要模糊处理,应该怎么操作?

图片

这张图里的信息极多,但是模型还是一眼认出这是Photoshop界面,并告诉我具体操作步骤。

图片

关键是,全程只用6秒,这输出速度快得吓人。

于是我在想:只要速度足够快,是不是可以有实时渲染的新交互产品诞生?AI游戏产品会不会加速到来?

来看几个官方案例。

用户上传一张飞机驾驶舱图片,输入“如何起飞”的指令,模型会以【秒级反应】在图片中寻找如何起飞的关键操作按钮,并生成分步骤教程。

又比如这个浏览网页的场景。

用户输入“这些设计有什么有趣之处”的指令后,模型会自动框选界面、识别信息、理解图片设计,最终生成专业分析。

注意,它不是其他视觉模型经常测的“给一张图,一次性给结果”的那种,而是分步骤、近乎实时地生成,给用户讲解画面内容。

这套交互,玩法非常多。

比如,老师PPT全屏讲课,讲到哪里,模型就自动在哪里画线或圈出来。

你可能会说:PPT自带的画笔功能就能做到啊,干嘛多此一举?

图片

纯AI演示画面,不代表真实情况

但我想反问:那个画笔功能,你是不是得一直用鼠标操作?而老师上课,不可能一直坐在电脑前。她手里可能同时拿着课本和粉笔,甚至正准备敲打瞌睡的你。

又比如,把它接到AI眼镜里,可视之处都可以实时渲染。

对了,好像阶跃的多模态模型一直就跟车企有深度合作。这场景,一下子就通了。

3)Agent长程任务

还是我们的老Case:

提示词:联网搜索、调研Step 3.7 Flash模型的关键信息,尽量从权威信源获取信息。先给我创建一份2000字的word调研报告(含pdf版)。然后调用guizang-ppt skill做一份10页的PPT,页面高级审美。

这个任务涉及联网搜索+word生成+转PDF+skill调用+Coding开发力,还包括页面上线前测试的chrome-devtools-mcp,特别考验模型的长程任务能力。

Ps:我发觉这个模型特别适合干测试。之前用Claude Code做测试,很多模型调用chrome-devtools-mcp只是走个过场,但Step 3.7 Flash会一环一环真正检查——因为它有视觉理解能力,而且速度极快。

图片

所以干测试得心应手。

来看下最终产物。

先是word报告。

图片

然后是PPT。

图片

全部one shot直出,整体都还不错。

4)推理任务

最后,测一个稍微带推理能力的3D编程任务。

提示词:Create a single HTML file containing a fully functional 3D Rubik's Cube simulation using Three.js (via CDN). The cube must be able to automatically solve itself. 

功能做得挺多,UI也很好看。

但是推理能力不太够,导致one shot出来的建模和运算路径都是错的。

图片
可能,这版模型在3D方面没有做针对性训练,所以表现比较一般。
文章标签模型发布开源
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多