Token导航 LogoToken导航

DeepSeek-V4.1-Flash 底层架构推倒重来

更新时间 2026-09-22来源 搜狐科技正文 2411字阅读约 8分钟3 张图片
DeepSeek-V4.1-Flash 底层架构推倒重来

AI 圈昨夜集体失眠。

就在全行业都默认大模型只剩 “堆参数、刷榜单” 一条路,挤牙膏式更新已成常态时,DeepSeek 直接扔出了一颗深水炸弹 ——DeepSeek-V4.1-Flash

不是小修小补,是底层架构全盘推倒重来。

推特知名 AI 研究员 elie 看完直接感叹:“这是我近几年见过最疯狂、最新颖的架构!”

无数开发者揉着眼睛点开技术报告,越看越沉默:

  • 总参数 5520 亿,外挂 196 亿条件记忆体
  • 45 万亿 Token 巨量语料从头训练
  • 支持 100 万超长上下文
  • 全局 KV 缓存干到了890 字节 / Token

有人在评论区灵魂拷问:改动大到这种程度,为什么叫 V4.1,不直接叫 V5? 答案很残酷:这只是新架构序列里,规格最小的 “先锋轻骑兵”。


压垮大模型的,从来不是算力,是 “草稿纸”

要懂这次升级有多狠,得先戳破所有大模型的共同命门:KV Cache(键值缓存)

你可以把模型推理想象成考生答题: 你每说一句话、模型每写一个字,都会在显存里留下 “草稿记录”。下一个字要接着写,就得把之前所有草稿全翻一遍。

写百字短文的时候,草稿纸没几张,显存毫无压力。 但现在是长程 Agent 时代 —— 读整座代码库、翻上千页财报、连续调用工具,上下文动辄几十万上百万 Token。

草稿纸堆得比山高,再快的算力也白搭。 最贵的 HBM 显存,分分钟被缓存塞爆;服务器账单里,缓存成本早就超过了计算本身。

而 DeepSeek 这篇技术报告的标题,就差把 “我来解决这个” 写在脸上: 《把 KV 缓存压缩推向极限》

刀,直接砍在了行业最痛的死穴上。


读题只用 8B,动笔才开 16B:非对称架构杀疯了

以前的大模型,不管是读你的提示词(Prefill 阶段),还是自己写答案(Decode 阶段),跑的都是同一套完整网络。 相当于不管读题还是答题,都要动用全身 100% 的脑细胞。

DeepSeek 直接拿出了CED 因果编码器 - 解码器架构,把 40 层网络拦腰斩断:

  • 前 20 层是编码器:专门负责读题
  • 后 20 层是解码器:专门负责写答案

✅ 读长文本的时候,只跑前 20 层编码器,每 Token 仅激活8B 参数; ✅ 生成答案的时候,才跑通全部解码器,每 Token 激活16B 参数

说白了就是: 读题的时候快速扫一遍提炼重点,不用全脑开工; 写答案的时候再全力输出,直接继承前面提炼好的结果。

就这一刀,Prefill 阶段的计算量直接砍半。 再搭配 “有界重放” 技术控住滑动窗口的缓存溢出,持久化 KV 缓存直接干到了上一代的1/8

把 “非对称作战” 玩到工业级 MoE 上,DeepSeek 是第一个玩明白的。


抠到每一字节:890 字节 / Token 是怎么炼成的

如果说 CED 是在骨架上动手术,那CSA2 压缩稀疏注意力 2.0就是在细胞层面做微雕。

普通注意力机制,每生成一个字,都要跟前面所有字挨个对一遍,算力随长度平方级暴涨。 CSA2 直接把注意力层分成了三种 “打工人”,能复用绝不多干:

  • Full 主算层:老老实实算主缓存,选出核心候选
  • Reindex 重索引层:复用前面的结果,只在候选池里挑
  • Reuse 纯复用层:连挑都懒得挑,直接抄上一层的答案

一层接一层,能复用的绝不重复算,能抄的绝不多想一步。 再叠上 FP4 超低精度量化感知训练,把缓存数据压到 4bit 级别。

最终结果就是: DeepSeek-V4.1-Flash 的全局 KV 缓存,只有 890 字节 / Token。

对比第一代 DeepSeek-V1,这个数字缩小了整整437 倍。 原先只能存 1 份上下文的显存,现在能塞下 437 份。

这种把显存压榨到物理极限的操作,连硅谷分析师都直呼 “太疯了”。


196B 外挂记忆:把 “死记硬背” 踢出显存

这次参数表里还有个极其扎眼的数字:196B Engram

什么是 Engram?大白话讲,就是模型的「外挂常识词典」。 大模型里很多知识 —— 专有名词、代码套路、历史常识,本质都是 “死记硬背”,不需要每一步都动脑子推理。

以前,这些记忆参数全占在贵得离谱的 HBM 显存里。 DeepSeek 做了个极其大胆的切割: 把这 1960 亿参数的记忆表做成多头哈希结构,直接扔去普通内存甚至高速 SSD 里。

推理的时候需要哪条,瞬间去外挂表里查一行,用完就走,根本不用把整张表常驻在显存里。

把 “思考算力” 留给 GPU,把 “死记硬背” 丢给固态硬盘。

再搭配改良的 Single-Pass mHC 技术,把层间激活值搬运次数砍半,显存带宽的瓶颈被一层层彻底打通。


砍了这么多,模型智商会不会缩水?

这大概是所有人最关心的问题。 评测数据给出了最硬的回答: V4.1-Flash 在代码、数学、世界知识等多项权威基准上,全面超越前代,甚至局部反超了体量更大的上一代旗舰 V4-Pro-Base。

性能不降反升,靠的不是玄学算法,是扎扎实实的工程基本功:

  • 45T 巨量多模态语料预训练
  • 自研 ViT 从零深度融入骨干,原生多模态不是后期 “打补丁”
  • 直接在 64K 长度上做稀疏训练,34T 进度后平滑拉满到 100 万上下文
  • 独立外挂 DSpark 投机解码小模型,生成速度再翻倍

甚至在后训练阶段,DeepSeek 直白地说:“我们这一代没有发明新的对齐算法。” 他们只是把精力全砸在了:海量可验证任务合成、真实交互环境搭建、严苛的难度校准。

把简单的事做到极致,比任何炫技的算法包装都更有杀伤力。


大模型下半场,拼的不再是堆钱

跳出参数和名词,DeepSeek 这次发布,给整个行业上了一课。

过去两年,大模型军备竞赛走的是 “堆硬件、扩集群” 的资源路线,比谁钱多、谁卡多。 而 DeepSeek 走出了另一条路:在明确的硬件与通信边界下,用精妙的算法和系统架构,榨干每一分硬件潜能。

这次所有优化的靶心,都对准了长程 Agent 的核心痛点: 把长文本驻留成本打下来,把复杂长程应用的落地门槛降下来。

当别人还在为显存账单头疼时,DeepSeek 已经把 100 万上下文的推理成本,压缩到了原来的零头。

有人说,这才是大模型工程化的真正魅力。 也有人说,大模型下半场的号角,这才刚刚吹响。

你觉得这次 DeepSeek 的升级,够得上 V5 的名号吗?评论区聊聊~

文章标签DeepSeek大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多