你好,我是蔚公子,ALL in AI,
专注于 AI 提效/企业赋能/教育
点击👇关注我,
分享真正能落地的AI方案,让企业和个人把AI用好
你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么?
我当时写了一句,DeepSeek 这次想测的可能不只是一个更快的 Flash,而是想看看 Flash 能不能顶到 Pro 的位置上去。
9 月 10 号答案来了,而且比我想的还要直接。
V4.1 Flash 正式发布,官方当场宣布 V4 Pro 有序下线,连切流量的时间都定死了,9 月 14 号 12 点。

我本来以为这事就这么定了。
结果只过了一天,官方又改主意了🤔
9 月 11 日,DeepSeek 又宣布:9 月 14 日之后 V4 Pro 不下线了,API 继续提供,计费方式保持不变。
这个后面我单独说,先按顺序把这次发布捋一遍。
废话不多说,咱们一个个看👇

一、新模型是个什么东西
这次更新的是一个552B 参数的 MoE 模型,用的是全新的 Causal-Encoder-Decoder 结构。输入和输出不对称,输入激活 8B,输出激活 16B。
而且这次具备原生多模态视觉理解能力。


不过对着完整成绩表看,GPQA Diamond 这一项 V4.1 Flash 是 90.9,V4 Pro 是 92.4,依然高于4.1 Flash。
二、缓存和价格
跟上一代比,KV Cache 对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8,相对初代已经缩小了 437 倍。
这里说的是缓存,不是整个模型的部署显存。

在 Agent 使用场景中,缓存命中的费用往往占比较高,所以这块压下去,Agent 类任务的成本也就跟着下来了。
价格 9 月 10 号 12 点生效,继续峰谷定价,闲时是高峰的一半。
闲时缓存命中是 0.003 美元每百万 token,折人民币大概两分钱。

三、说好要下线的 Pro 最后留下来了
10 号那天的公告计划有序下线 V4 Pro 模型。
但今天我去翻 API 价格页,V4 Pro 还在。

上面写着:
应用户需求,决定在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro API 服务,计费方式保持不变。
估摸着,这块应该是网友发力了🤔
四、全面实测
上面这些全是官方口径,听着都挺好。
但官方说得再好也是官方的,还是得自己上手跑一跑。
这次我准备了几个 Case,一路从最简单的测到最费劲的。
1. 先看看它这双眼睛,到底好使了没有
第一个必须测视觉,因为这是这次的核心卖点。
不过在测之前我得先说说以前。DeepSeek 刚开始能看图那阵子,说实话是有点近视的。
最出名的就是把梁文锋认成别人,有认成KIMI创始人杨植麟的,还有认成雷军的,当时网上传得挺欢😅

那这次原生多模态来了,咱们就再考一次。
我直接上传了一张梁文锋的照片,提示词只有三个字。

提示词:
他是谁

这回它认出来了。
不光认出来了,还顺手把人物背景和职业经历一并铺开讲了,连出生年份和求学经历都给了。
诶,这就对了嘛。
但只认出人,还不够,我想再来个抽象点的。
最近不是动画电影《牛来》特别火吗,就是那个建模粗糙到离谱、结果反而成了黑马的。那玩意儿的表情包这两天满网飞。

我把牛来的标志性截图丢了进去,提示词同样只有一句。
提示词:
这是什么角色

结果它也认出来了,而且比我想的快。
电影名字、上映时间、导演编剧,还有它为什么会火,连那段拖长声调喊妈的经典片段都给我说明白了👌
两道题当然说明不了全部,但跟它刚上线识图那阵子比,已经明显不是一回事了。
2. 给它一张复杂网页的截图,让它自己复刻
看得懂是一回事,能不能拿眼睛干活是另一回事。
所以第二个我把难度往上抬了一大档。我找了个国外的后台网页,里面图表特别多,还带着一个世界地图模块,然后只给它一张截图,别的什么都不说。
提示词:
我会给你一张复杂网页的参考截图。请只根据这张截图,从零开发一个高度还原、可以实际运行和交互的网页。
**不要向我询问设计稿、尺寸、字体、色值、组件参数或技术栈。**截图里能够判断的信息,全部由你自己识别和决定。
请尽可能准确还原整体页面结构和布局、各区域的尺寸比例和空间关系、字体大小粗细和信息层级、颜色背景边框圆角阴影、图片图标卡片按钮导航等视觉元素、元素之间的对齐间距和留白,以及截图中能够合理推断出的交互功能。
不要只做一张看起来相似的静态页面。导航、Tab、按钮、菜单、切换等明显具有交互属性的组件,都请实现合理的实际交互。
最重要的是:完成第一版以后不要直接结束任务。请实际启动网页,在浏览器中打开你做出的页面并截图,然后重新查看我最初提供的参考图,把你的截图和原图进行视觉对比。
重点检查:整体布局和比例是否一致;主要元素的位置尺寸有没有明显偏差;字体层级间距和对齐是否准确;颜色圆角边框阴影是否接近;有没有遗漏原图中的元素;页面是否存在溢出错位遮挡等明显 Bug;交互是否能够正常工作。
如果存在明显差异,直接修改代码,然后重新运行、重新截图、重新比较。自己重复这个过程,不要中途询问我是否继续,也不要第一版能运行就停止,直到你认为成品已经达到可以正式交付的程度。
最终请交付完整可运行的网页项目和最终页面,并简单告诉我一共进行了几轮视觉检查,每一轮分别发现了哪些主要问题、做了哪些修改。如果还有与参考图明显不一致但暂时没有解决的地方,也请主动指出。
这个跑得是真久,体感接近两个小时🥲
但出来的东西我是满意的。
乍一眼看过去,基本跟原图差不多。
侧边栏、顶栏、上面那排数据卡片、中间的折线图、下面的渠道排行和设备占比,位置和比例都对得上,交互也是真能点的。
唯一拉胯的是那个地图。原图里那块世界地图,它复刻出来有点失真,一眼能看出跟原版不是一个东西。
除了这块,整体我觉得是 OK 的。
3. 让它做一个能玩的多米诺骨牌
前面两个测的都是眼睛,第三个我换个方向,看看它做交互的手感。
我要的是一个真能点、能触发连锁反应的多米诺骨牌网页,不是摆几块方块给你看的样子货。
提示词:
请你从零开发一个多米诺骨牌互动网页作品。要求它不是静态展示,而是一个真正可以操作、可以触发连锁反应的前端交互项目。
页面中要有一组经过合理排布的多米诺骨牌,整体视觉上要完整、美观,不能只是随便摆几块矩形。用户点击任意一块骨牌后,要能够触发自然的连锁倒塌反应。倒塌动画要尽量流畅、具有明显的连续传播效果,而不是简单的统一消失或机械切换。
页面需要有完整的视觉设计,包括背景、留白、层次、配色和整体氛围。如果合适,可以加入重新开始、随机布局、切换场景、调整骨牌数量等交互功能,但不要为了堆功能破坏整体完成度。
请优先保证可玩性和连锁反应效果,不要做成只有视觉没有交互的样子货。
完成第一版之后不要直接结束。请你自己实际运行网页,在浏览器中打开并亲自测试:点击不同位置的骨牌;检查连锁反应是否稳定;检查是否存在骨牌不倒、传播中断、动画卡顿、布局穿帮、遮挡错位等问题;检查页面在视觉上是否完整。
如果发现明显问题,请直接继续修改代码,再运行、再测试、再修复。请自行重复这个过程,不要中途询问我是否继续,直到你认为它已经达到可以正式展示的程度。
最终请交付完整可运行的网页项目和最终页面效果,并告诉我你一共做了几轮自测,每一轮主要发现了什么问题又如何修正。如果还有没有完全解决的问题,也请主动说明。
这个做得相当可以,而且比我想的要干净。
画面上没堆什么花里胡哨的东西,骨牌的形状还做了好几种,看着挺舒服的。
最让我满意的是交互。
你点哪一块都行,点下去后面整排就跟着倒,而且我想从哪儿起头都可以。这个灵活度是真不错,动画也很丝滑,一点不卡。
它还自己加了几个我没明说的东西,骨牌数量能调,倒塌速度也能调。
甚至连倒下去的音效都有👌
整体我是比较满意的。
4. 让它研究一下它自己
最后这个我觉得最有意思。
我让 V4.1 Flash 自己去研究 V4.1 Flash。
不给任何资料,让它自己上网搜、自己读官方公告和技术报告、自己核验,最后回答一个问题:它是不是真像官方说的那样已经能取代 V4 Pro。
而且我特意在提示词里挖了坑,让它专门去查有没有人把缓存显存写成整个模型显存、有没有人把几项第一写成所有第一。
部分提示词:
现在请你完成一次完整的深度研究任务。研究主题:DeepSeek V4.1 Flash 这次到底更新了什么,它是否真的像官方所说的那样已经能够取代 V4 Pro?
我不会给你资料,也不要依赖我提供的任何结论。请你自己从公开网络中搜索、阅读、核验和整理。这不是一篇普通的新闻摘要,我希望你像一个独立的 AI 行业研究员一样完成整个任务。
先建立一手资料库,优先寻找并阅读官方发布公告、技术报告、Hugging Face 模型页、API 定价信息和 Harness 相关文档。在读完主要一手资料之前,不要直接根据媒体文章下最终结论。
然后专门核查全面超过 V4 Pro 这个说法。不要直接接受这句话,也不要为了反驳而反驳,请把官方公布的 Benchmark 和公开证据逐项检查:哪些指标明显超过,哪些接近,哪些 V4 Pro 仍然更高。
在研究过程中特别留意不同来源有没有出现参数数字不一致、价格不一致、把 KV Cache 显存误写成整个模型显存、把某几个 Benchmark 第一写成所有 Benchmark 第一。如果发现冲突,请追溯原始来源,不要自行猜一个答案。
最终交付一份完整研究报告,包括一句话结论、核心更新地图、对比表、事实核查、第三方实测总结、容易被媒体误读的五个点、最终判断和完整来源表。最终判断要分成三类:已经有充分证据确认的、目前证据倾向如此但仍需更多实测的、暂时不能确认的。
这个是真把我小小的惊到了,因为太快了。
我本来做好了等半天的准备,结果三分多钟就交卷了。
而且东西是真不少。它自己出了分析,还给了个完整的文档,我光录屏往下滚就录了一分多钟。
内容也比我想的详尽,来源都留着,中间还专门做了 V4.1 Flash 和 V4 Pro 的逐项对比。
一个模型,自己去查自己,还查得挺认真🧐
五、蔚公子的洞察
几个 Case 跑完,我说说自己的感受。
第一,更新速度是真的越来越快了。
这个是我最大的感受。
你看看这才多久。前脚 Vision Exp 刚开源,我写了一篇。然后 V4.1 Flash 内测,我又写了一篇。
现在正式版直接来了,差点顺手把 Pro 给安排下线了。
这三件事加起来,也就是一个多星期。
以前一个大版本能撑半年,现在一个星期能出三个动静。
而且你看 Pro 这事,前一天还说要下线,第二天又决定留下来。变化快到连官方自己的计划都能一天一变🧐
第二,能力也在慢慢补齐。
多模态这块就是最明显的例子。以前是看不见,后来是看得见但有点近视,到今天原生多模态,眼睛这一关基本算过了。
而且最近 DeepSeek 那边的动静也不小,看得出来是想往更大更好的方向走的。
第三,跟国外比确实还有差距,但也别妄自菲薄。
这个我得说句公道话。你真要拿它跟最顶那几个比,该差的地方还是差。
但你也得看看这个追赶的速度。而且价格摆在那儿,闲时缓存命中一百万 token 两分钱,这个成本优势不是靠嘴吹出来的。
所以,我觉得该给的信心还是要给。
第四,也是我最想说的,一定要多上手。
前两天有个圈友跟我说了一句话,他说现在是真的变得太快了。
没错,就是太快了。
所以我觉得这时候最要紧的反而不是去背哪个工具怎么用。因为工具可能一个月一换,你背了也白背。
真正要抓的是核心的思想和逻辑,同时死死盯住最前沿的变化。
为什么要盯前沿?因为变化太快了,今天落后的那家,可能过两个月就反超了。
所以真正要紧的,可能不是记住谁现在是第一,而是让自己一直待在牌桌边上👌
今天分享就是这些~
也欢迎大家在评论区留下自己的思考,同时如果能点个赞和转发,就是对我最大的鼓励。







