
阶跃发了它们新一代的模型,Step 5 Preview,定位智能效率的新一代“帕累托前沿” 。
整体配置非常nice,600B总参数,激活参数27B , 1M上下文 并且还支持多模态 。 AA的分数在44分,

和Kimi K3 并列,开源前三。成本上则比Kimi K3 便宜很多,1百万tokens输入价格在1刀,输出则在2.7刀。

根据AA的测试显示,单任务的成本在0.71刀,非常不错。核算下来,差不多只要GLM-5.3 和Kimi K3 的35%,以及Claude Opus 5的12.5%。
我第一时间拿到手之后,进行了一波测试来和大家分享。和往常不一样的是,这次测试的重心会更贴近实际各种工作岗位中会遇到的case,不像以往都是coding为王。
为了公平点儿比对,这次我们拉来了国产模型的天花板GLM-5.3 进行比对,两个模型都配置在WorkBuddy里进行测试。
开始之前,先叠甲说明,视频里如果看到Water 18的模型,其实就是Step 5 Preview
OKK,那我们直接开始。
01做HTML Slides
最近不是苹果发新机了嘛,但是我也一直忙的没时间具体看自己心水的折叠屏的参数;
所以就正好用这个来作为case 考考两名选手;顺便,让他们做个HTML版本的Slides来看看审美。
提示词非常简单:
深入调研折叠屏手机iPhone Duo,三星Zfold 8, Oppo 和Vivo的最新款,它们的价格,摄像头规格,电池续航,和Mac电脑的软件适配程度,发布时间等参数配置,最后给我做一个HTML 格式的PPT展示,要求样式高级,带有动效,包含有用的信息。
这里我特意没有用任何可以美化PPT样式的Skill,就是想看看这两个模型纯就一把生成的能力。
我们先看Step 5 Preview 的效果:
视频 · 01
然后是GLM 5.3 的作品:
视频 · 02
两个速度都非常快就完成了。从视频里可以看到两个模型在对任务的基础理解上都是没什么问题的,没出现很明显的理解偏差。
GLM-5.3 在整体视觉上会更讨喜一点,但是我对比了下内容,一眼看出它有两个非常严重的问题:

一个是在对比几款折叠手机参数的这个页面,GLM 5.3 把其他三款手机的起始存储容量给列了出来,唯独没列出Find N6 的配置,而且价格也不对。
再对比看一下Step 5 Preview 这个页面的效果:

价格数据比对更加清晰直观,直接看柱状图就行,而且四款手机的价格数据和配置参数比GLM-5.3做的更加完整。
还有一个问题是,GLM-5.3做的第二页对于三星Z fold 8的描述,存在事实性错误。

Z fold 8 明明是人家第8代折叠屏,怎么还给人写第七代呢?!
相比之下,我觉得Step 5 Preview 在这种基础的事实性错误上处理的相对就好一些。美中不足的是我发现的两个小问题 是在倒数第二张Slides 这,

一个是这里明明是六张卡片,不知道为啥它在标题写了四张;还有一个OPPO Find N6 这里存在描述不准确,因为它不是唯一的2亿主摄,Vivo 的那款折叠机也是。
刚刚只是第一轮one shot 测试,然后我又接着刚刚的第一轮的问题,我再让两个模型自行review一下自己前一轮的工作,看看有没有问题,特别是我前面提到的这些问题,它们能不能在第二轮发现,并且进行完善修复。
提示词也非常简单:
review 一下你的内容,是否存在事实错误,或表述不清楚、表述不当,视觉仍然有需要提升的问题,如果有的话,进行完整修复吧
OK, 那我们再来看下二轮修复场景下的结果,看看这两个模型有没有反思出什么问题。
这是GLM-5.3的回答:

我觉得其他都还好其实,只是措辞上的一些问题,我框出来的第一个问题也是我刚刚说的,它也自己review 出来的,但是另一个问题,Oppo 手机售价的问题,仍然存在,没被他自己review出来。
这是Step 5 Preview 的review 结论:

我发现的两个问题它自己在review的时候也都发现了,证明它至少review的能力还是可以的,其他的错误我觉得都是措辞上的一些表达了。
所以这一轮我会觉得虽然视觉上我确实更喜欢GLM-5.3的东西,但是从内容扎实程度上来看,我投Step 5 Preview一票,它没有那么多关于手机的事实性错误。
我如果是一个要买手机的顾客的话,肯定得先保证搜到的手机相关的内容得是精准的吧 。
02深度研究+写作
第二个case 更考验它信息搜集再结合飞书做多维表格数据库的能力以及写作的能力。
最近一直忙着裤裤给我的知识库网站更新,然后想在知识库上更新一些Benchmarks 相关的介绍,

那这里就要做两个事儿:
一是,要放哪些Benchmarks?! 二是,肯定要在知识库网站上写一段文字介绍,为什么Benchmarks 很重要?!
所以我把这两个需求都丢给了我们的模型。

让我们先来看GLM-5.3 的成品:


然后是Step 5 Preview的回答:


我们先从写的文章质量来看的话,老实说我觉得现在的模型很少有拉开差距的感觉,只能说大家都能完成任务。两个模型写的文章我感觉都差不多,说不上谁比谁好很多,一样都喜欢写破折号加引号。
但是从整理的Benchmark清单来看,那Step 5 Preview 的效果就肉眼可见的好很多了。GLM-5.3 列的Benchmark 有一些其实是比较旧的了,比如Terminal Bench 只列到了2.1。
但是Step 5 Preview 不仅内容比较新,而且形式上这里就有很多小巧思了,比如最后它自己加了一列,2026年的引用度。它把每个Benchmark 在今年的热度给自己分类列了出来。
这个是最让我意外的一点。
出于好奇,我倒回去看了看它是怎么想的。

它在WorkBuddy里还触发了子代理来完成这项搜索量巨大的任务。相比之下,GLM-5.3 就简单粗暴很多了,就是直接硬干,干的起飞。 所以完成速度上,GLM-5.3 会快很多。

所以这一轮我觉得写作上两个模型水平半斤对八两吧,但是做的多维表格,反映的信息有效性上来说的话,Step 5 Preview 会好很多我觉得。
03做视频
最后一个case,我想试试让它用Hyperframes做科普视频的效果。这两天Jev 真的非常火,所以我让它做了一个Jev 与LLM 的原理科普对比视频。

先来看看GLM-5.3 做的效果
视频 · 03
然后是Step 5 Preview 的作品:
视频 · 04
两个我觉得内容上都解释的没毛病,都很好的完成了我想要的效果,说明了Jev和LLM的原理区别是什么,并且用了通俗易懂的案例来解释。
但是很明显Step 5 Preview 的内容要更完整一些。
它不仅讲了原理上的区别,还引经据典,最后用了卡尼曼的双系统来进行了升华。 而且还有一个小细节是,Step 5 Preview做的内容是它自己在我没指定的情况下,主动给我配了讲解声音的,而GLM-5.3是没配声音。
这个听感上对比起来就会差很多。
04最后写点儿
好啦,今天的分享就先到这儿了,
又到了放假前,各个厂商卷飞了的时候,
不过越卷,对用户来说总归是受益的。
感兴趣的小伙伴可以多去尝试不同的模型,找到适合自己的,能够日常用在自己工作流中的,那就是好模型。







