前几天不是火山大会吗,
然后我把豆包 2.1 的参数图发了个帖子,
"Gemini 现在真的拉,跑分都比不过豆包了。"

然后我就被喷了。。。
现在想想也确实,市面上的模型超多,
光看宣发和跑分,还挺难判断哪个合适,性价比最高。
所以我就想着,
不如把几个主流模型都拉出来实际跑一遍,
看看它们表现如何。
叠甲: 本次并非严格意义上的 benchmark 评测,测试 Case是一次围绕单个长链路 Agent 任务的体验观察记录,不构成对模型的全面定论捏。
于是我找了几个国内便宜的模型:
MiniMax-M3
DeepSeek-V4-flash
Step-3.7-flash
GLM5.2
这次测试Case是做一个「AI 网站聚合平台」的 HTML 单页。
测试的 Agent工具就用WorkBuddy
方法也很简单,
我让 ChatGPT 生成一段提示词 Prompt,
给这几个模型测试,看最终成果,
这对我来说也挺省事的。。。
请完成一个「AI 工具导航站」的完整开发任务,要求从需求理解到页面生成、数据整理、代码实现、运行检查、问题修复全部独立完成。 任务目标:制作一个完整可运行的 HTML 单页网站,主题为「AI 工具导航站」。页面用于展示不同类型的 AI 工具,适合做成网页 Demo、课程资料或公众号长图。 任务要求:
1. 信息收集 联网搜索并整理 20 个主流 AI 工具,覆盖 AI 写作、AI 编程、AI 图片、AI 视频、AI 搜索、AI 办公等类别。每个工具需要包含:工具名称、所属公司、主要用途、适合人群、官网链接。
2. 数据整理 将工具按类别分组,整理成结构化数据。要求信息准确,避免重复工具,国内外工具都要覆盖。
3. 页面设计 生成一个清爽、现代、科技感的 HTML 页面。页面需要包含顶部标题区、分类筛选区、工具卡片区、推荐工具区、对比表格区和总结说明区。
4. 交互功能 页面需要支持按工具类别筛选、关键词搜索、工具卡片展开详情、返回顶部按钮。
5. 代码实现 使用 HTML、CSS、JavaScript 单文件实现,不依赖后端。可以使用公开 CDN 图标库或轻量图表库,但页面必须能直接运行。
6. 运行与检查 完成后请自行检查页面是否存在代码错误、样式错乱、按钮无效、链接缺失、筛选失败等问题。如果发现问题,请主动修复。
7. 输出结果 最终输出完整可运行的 HTML 文件内容,并附上简短说明:用了哪些数据来源、页面包含哪些模块、有哪些交互功能。 特别要求: 请尽量一次性完成整个任务。过程中如果需要调用搜索、网页读取、代码生成、文件修改、运行检查、错误修复等工具,请按合理顺序连续完成,不要跳步。最终结果以可运行页面为准。无聊的过程就跳过了,直接看结果!!
文末也有省流版总结,可以直接划到底部
MiniMax-M3
多轮工具调用包括搜索资料、整理数据、生成页面代码等。
属于是模型的基本线了,只能说十分正常。

这个是制作完成后的页面效果。




从最终页面来看,没有特别追求视觉上的炫酷,
但胜在流程稳定,任务理解也比较清楚。
Workbuddy里面消耗积分:27点积分左右。
换算一下差不多在1.33元。
Step-3.7-flash
Step-3.7-flash是这次测试里比较符合生产级 Agent定位的模型。
它在多工具调用上的积极性比较高,
会连续完成搜索、读取、整理、生成、修改和检查。

因为 Prompt 里面有"科技感"所以会倾向于赛博霓虹那种色系
AI 很喜欢这种配色,所以 AI 味会比较浓。

如果没有特别说明,大概率都会默认生成深色系的网站页面。
Step在数据整理方面表现比较突出。
它会尽量覆盖写作、编程、图片、视频等
办公等不同类别,不只列几个常见工具。

从页面完成度来看,Step-3.7-flash 的内容密度最高。
本轮测试费用约为:0.7元左右,中规中矩。

如果你的任务是高频、多轮、低延迟,
并且包含搜索、文件、代码多工具链路,
Step是比较值得放进候选列表的模型。
下一个用最便宜的Deepseek-v4-flash,
DeepSeek-V4-flash

DeepSeek生成的速度真的超快,
但速度一快,
那牺牲的必然就是一些精细设计了,
资料搜索、数据校验、细节修复方面,
没有 MiniMax 和 Step-3.7-flash 那么细。


Workbuddy里面消耗4积分左右。
换算一下差不多为0.2元。
我勒个豆,这样太便宜了吧,
还要啥自行车呢。。。
GLM5.2
GLM5.2在跑分上属于是开源第一了,
他们的 Coding Plan 太火了,根本抢不到,
我最后还是在咸鱼上找的黄牛。。。
做一个小网站也是非常稳定,直接看吧:




GLM5.2 的特点是Coding 牛逼,缺点是太贵。
本轮测试费用约为:74点积分左右。
换算一下,差不多在3.66元左右。
最后再测试一个国外的Gemini
Gemini3.5 flash
如果是做前端页面的话,Gemini 的审美还是可以的,

Gemini3.5 flash 最大的优势是页面观感舒适。
它生成的前端页面会更精致,布局更舒服,留白和层次感也更好。

不过 Gemini3.5 flash 也有明显问题,数据收集没有前面的模型多。
比如和阶跃Step对比,Step 收集的数据更全,分类覆盖更完整,工具调用也更积极。
本轮测试费用约为:9元左右,
洋人的模型真是贵。

最后来个省流版总结
这次测下来,
如果只看页面美观,Gemini3.5 flash 的确更强。
如果看工具调用和数据完整度,Step-3.7-flash 的表现更突出。
如果看成本和稳定性,MiniMax-M3 是一个很稳的选择。
DeepSeek-V4-flash 主打便宜。
GLM5.2 则比较均衡,适合做综合型任务。

晓风乾丨 大四 Base北京 AI产品在职
想缩小科技带来的信息差 分享很酷的AI玩法。
希望得到您的点赞转发爱心三连支持,
如果有更多想法或者问题欢迎交流~







