Token导航 LogoToken导航TokenDH.com

DeepSeek 的 10 万亿美金宏伟战略?

更新时间 2026-05-24来源 AI寒武纪正文 6984字阅读约 22分钟20 张图片
图片

DeepSeek 最近的融资的消息大家可能已经听说了,这是未来发展的一步大棋,但更大的棋局可能还在后面,网友GDP写了一篇文章【DeepSeek 的 10 万亿美元宏伟战略】,我觉得挺有意思的,适合周末无聊时阅读,但首先声明一下这篇文章不构成任何投资建议,其中的观点大家各自取舍

文章的核心要点:

DeepSeek 试图通过一系列基础性创新,推动中国 AI 硬件生态成长为 10 万亿美元级产业,并借此冲击 1 万亿美元估值。

它们开发了 MoE、MLA、DSA、CSA、HCA、Engram 和 mHC,大幅降低 KV Cache、HBM 需求和计算需求。

KV Cache 压缩以及“以内存换计算”的权衡,会提升 NAND、SSD 和 LPDDR 的用量,利好 YMTC 和 CXMT。

这些创新降低了 GPU 和 ASIC 的压力,使中国硬件具备可行性,同时支撑长时程智能体和强化学习。

DeepSeek 可能会与硬件厂商建立股权合作,共同打造有竞争力的生态,并实现“AGI for everyone”的目标。

图片

正文

你有没有想过,DeepSeek 到底要怎么赚钱,而且是赚大钱?

它们没有像 GLM、MoonShot 和 MiniMax 那样推出有竞争力的编程订阅方案。它们没有多模态模型,也没有音频、视频模型。到今天为止,它们甚至还没有 harness(最近才开始招聘相关人员来搭建 harness)。DeepSeek 还长期坚持开源,而且很乐意分享自己的“秘方”。这是不是疯了?是不是在纯粹烧钱?那些准备给它们投 100 亿美元的投资人,难道是在把钱往下水道里倒?

不,恰恰相反。在我看来完全不是这样。

下面我会整理一下 DeepSeek 迄今为止做过的事情,以及它们似乎正在遵循的一条战略路径。梁文锋的目标显然远大得多:它们有可能实现 1 万亿美元估值,同时帮助催生一个 10 万亿美元级产业。

图片
TechInAsia 关于 DeepSeek 最新融资轮的新闻

重新审视 DeepSeek 的英雄之旅

DeepSeek 一直在逆风而行。别人都在做“更好一点”的模型,然后急着销售即时应用,比如编程订阅。2025 年 1 月 27 日,我发过一条病毒式传播的推文,谈我眼中的 DeepSeek 的英雄之旅。现在这个故事只会变得更有意思。

  • • 当大家都在尝试训练稠密模型时,DeepSeek 选择了训练难度更高的专家混合模型(Mixture of Experts,MoE)。
  • • 它们采用“第一性原理”的方式,发明了新的 GRPO 算法,用来替代强化学习(RL)中占主导地位、但实现成本更高的 PPO 算法。
  • • 它们找到了基于可验证奖励的强化学习(RLVR)这一关键路径,用来提升模型的推理能力。
  • • 它们提出了通过“多 Token 预测”进行 Speculative Decoding 的简单方案,同时让训练信号更密集。
  • • 它们完善了“零气泡”(ZERO bubble)流水线,提高有限 GPU 资源的利用率。
  • • 它们发布了专家负载均衡器,让大家更容易部署 MoE 模型。尤其是通过“宽专家并行”(Wide Expert Parallel)策略,模型可以用更大的 batch、更低的成本进行服务。
  • • 它们发明了 MLA、DSA、CSA、HCA,用来降低 KV Cache 需求,并让计算需求在上下文长度增长时近乎保持恒定。
  • • 它们发明了 Engram,用内存换计算。
  • • 它们发明了 mHC,让模型规模扩大时训练仍然稳定。类似的清单还可以继续列下去。

在“英雄之旅”这种最普遍的叙事结构里,英雄从来不会一开始就知道自己的旅程是什么。他是在一路前行中学习,并逐渐找到自己的伟大使命,然后克服重重困难把它完成。他会遇到许多贬低者,但他会无视他们。他会遇到许多恶意行动者。他也会有巨大的缺陷或短板,但最终会克服这些缺陷完成使命。他会面对看似无法逾越的挑战,却能弄清楚如何结盟,如何明智地使用宝贵资源。正是这些东西让观众支持这个英雄。也正是这些东西,为 DeepSeek 赢得了粉丝、全球尊重,以及同样大量的反对者。

正如我接下来会详细说明的,DeepSeek 已经在这条路上走了很久,并且似乎已经发现了它的终极使命:不是卖编程订阅,而是打造一个 10 万亿美元级的中国 AI 硬件生态,并让自己实现 1 万亿美元估值。在这个过程中,它们也会让西方硬件生态里的许多新进入者受益。

先用 KV Cache 做一点有趣的计算

先读一下 @SemiAnalysis_ 这条来得正是时候的推文:

图片
DeepSeek 已经比任何人都更好地解决了这个问题!

我们先来做一点有趣的 KV Cache 数学。别担心,就算你不喜欢数学也没关系。我们会用最近发布的 KV Cache 计算器,看看 DeepSeek V4 Pro 能节省多少 KV Cache,并把它和最新的 GLM、Qwen 模型做个比较。

我按 100 万上下文来计算。假设 KV 精度为 8 bit,索引器精度为 16 bit。你也可以自己去玩这个计算器。

https://kvcache.ai/tools/kv-cache-calculator/

图片
你也可以自己玩这个计算器!

在 100 万上下文下:

  1. 1. DeepSeek V4 只需要 5.48GB HBM
  2. 2. GLM5 需要 60GB HBM
  3. 3. Qwen3-235B-A22B 需要高达 89GB

注意:

  1. 1. DeepSeek 是一个 1.6T 参数模型;
  2. 2. GLM5 大约是 700B 参数,并且已经使用了 DeepSeek 的 MLA 和 DSA,只是还没有用上最新的压缩注意力;
  3. 3. Qwen3-235B-A22B 大约是 235B 参数,采用的是 GQA 注意力。

DeepSeek 在缓解内存压力方面做出了基础性贡献。如果这种创新被广泛采用,长时程智能体会变得极其经济,并解锁下一批应用场景。

图片
100 万 Token 上下文下,不同模型规模的 KV Cache 占用对比

“疯狂”背后的方法

KV Cache 规模如此之小,而且不牺牲质量,这正是它们能以离谱低价提供长时间缓存的原因:Sonnet 4.6 Cache hit 价格的不到 3%,而且缓存可以保留数小时。

对于长时程任务来说,少量 KV Cache 使得把缓存卸载到 SSD、再按需加载回来变得非常划算。这降低了对 HBM 的需求,而 HBM 正是中国 AI 硬件产业最短缺、也最难制造的内存。DeepSeek 还开发了能更快从 SSD 加载 KV Cache 的技术,见 Dual Path 论文

https://arxiv.org/pdf/2602.21548

图片
它们新的 DeepSeek V4 把 KV Cache 压缩得如此厉害,甚至可能已经不再需要这种方案。

KV Cache 压缩的直接受益者是谁?

谁能大量供应 SSD?别忘了,YMTC 正在成为 3D NAND 巨头。NAND 让 DeepSeek 可以避免重复计算 KV。反过来,DeepSeek 也在为 NAND 和 SSD 创造一个庞大市场,不只是 YMTC 的市场,也包括其他厂商的市场。

图片
DeepSeek 的 10 万亿美元宏大战略

不过,事情不只是 NAND 和 SSD

LPDDR 内存有很大潜力成为存放权重的地方,在需要时再把权重流式传入 HBM,从而降低 HBM 的需求压力。SGLang 团队发过一篇很棒的博客

https://www.lmsys.org/blog/2025-09-25-gb200-part-2/

我下面用一张图来解释这个方案如何运作。

DeepSeek 虽然没有专门为这件事做什么,但它们的 MoE 架构拥有大量专家,并且使用 4 bit 权重,因此很容易实现这一方案。

图片
示意图:内存可以如何使用,以及权重如何从 LPDDR 流式传入 HBM。强烈建议阅读 SGLang 的博客。

这项创新再叠加极其紧凑的无损 KV Cache,会显著降低 HBM 需求。

中国谁在做 LPDDR?CXMT。它们在 LPDDR 速度上只落后 0.5 代,在密度上落后 1 代,并不算远。再加上充足的 NAND,中国生态在不久的将来会拥有充足的 LPDDR。这能缓解算力压力吗?能。继续看下去。

图片
DeepSeek 的 10 万亿美元宏大战略

巧妙使用内存,也能减轻 GPU/ASIC 压力

使用 NAND 保存 KV Cache,显然可以把 KV Cache 保留更久,降低 HBM 压力,并避免重新计算 KV Cache,从而缓解 GPU 和 ASIC 的计算压力。那么 LPDDR 能不能以类似方式发挥作用,同时作为“即时”流式加载权重的地方?答案是:能。

LPDDR 可以容纳大量所谓的 “Engram”。DeepSeek 在 Engram 论文
https://arxiv.org/pdf/2601.07372

中指出,MoE 通过条件计算扩展容量,但 Transformer 缺少一种原生的知识查找机制。它们被迫通过计算来低效地模拟检索。DeepSeek 引入了 Engram:它把经典 N-gram embedding 现代化为 O(1) 的哈希查找模块,创造出一种互补的稀疏性轴线,称为条件记忆(conditional memory)。这能节省计算,但需要内存来承载可能很大的 embedding 表。本质上,这是一种经典的“内存-计算替换”,但关键洞察在于:按每 bit 检索成本看,“内存”一侧要便宜得多(一次 LPDDR 查找 vs. Transformer 层的一次完整前向传播),因此在规模化时是一笔非常划算的交易。这就是它们通过以内存换计算来节省算力的方式。

图片
DeepSeek 的 10 万亿美元宏大战略

复盘 DeepSeek 的长期布局

从这些创新来看,DeepSeek 的目标似乎不是眼前几亿美元的利润。看看它们做出的所有选择:到现在还没有多模态、没有语音模型、视频模型更是无从谈起。它们玩的是一场有耐心的 10 万亿美元级游戏,目标是打造一个替代性硬件生态。

这不仅是为了让中国内存厂商成为中国乃至全球 AI 硬件舞台上的关键玩家,也是为了降低资源需求本身,让 AI 模型的训练和服务变得更具成本效益。这会让许多 GPU/ASIC 厂商以及网络芯片厂商成为可行选项。所有这些创新,也会帮助西方开源生态以及新的硬件厂商。

迹象已经很明显了。我们来详细回顾一下它们已经做出的这些创新:

1.DeepSeek V2 引入了专家混合(MoE)和 MLA。MoE 让训练高智能模型所需计算量降低了 40% 到 50%。MLA 则让 KV Cache 降低了 90%。这使得把 KV Cache 卸载到 SSD 变得非常高效。这些想法出现在它们 2024 年 5 月的论文 DeepSeek V2 中。后来,它们又解锁了 DeepSeek V3 的训练,而当时只使用了 2048 张被阉割过的 H800 GPU。

图片
DeepSeek 的 10 万亿美元宏大战略

2.DSA(在 DeepSeek V3.2 Exp 中引入)用于降低长上下文场景下的计算量,同时缓解 HBM 带宽压力。它确保计算量不会随着上下文增长而增长。请看下方图表:DeepSeek-v3.2 的处理时间随着上下文变长仍基本保持平坦。

图片
DeepSeek 的 10 万亿美元宏大战略

3.mHC 于 2025 年 12 月在论文 mHC: Manifold-Constrained Hyper-Connections 中提出。mHC 是 DeepSeek 的一种宏架构创新,它重新设计了 Transformer 层之间的信息流动方式。不同于 ResNet 以来一直使用的标准残差连接(x + F(x)),mHC 将残差流扩展为多条并行的信息高速通道,并允许模型学习这些通道之间的混合;但关键在于,它把混合矩阵约束为双随机矩阵(通过 Sinkhorn-Knopp 投影到 Birkhoff 多面体),从数学上保证信号幅度在任意深度下都能被保持。

  • • 这解决了无约束 Hyper-Connections 曾面临的灾难性不稳定问题。后者最初由字节跳动提出,但在 27B 规模时会出现信号放大到 3000 倍、训练完全崩溃的问题。
  • • 计算成本很低:mHC 只增加 6.7% 的墙钟训练开销,因为它不改变注意力层或 FFN 层的 FLOPs,只改变这些层的输出如何在层与层之间路由。
  • • 但性能收益相当可观:在 27B 参数规模下,mHC 在 BIG-Bench Hard 推理上提升 +7.2 分,在 DROP 上提升 +3.2,在 GSM8K 数学上提升 +2.8,在 MMLU 通识上提升 +1.4;模型规模相同,计算预算也几乎相同。

本质上,mHC 通过为跨层信息路由提供更丰富、更有表现力的拓扑结构,让每个参数承载更高智能,而几乎不付出额外 FLOPs 成本。

图片
mHC 是一种复杂架构,但它带来了更稳定的训练,以及更高的单位参数智能

4.CSA、HSA(2026 年 4 月在 DeepSeek V4 中引入)通过压缩 KV tokens,将 KV 需求再次降低 90%,并大幅减少所需 FLOPs,从而同时缓解 HBM 和 GPU/ASIC 压力。

图片
DeepSeek 的 10 万亿美元宏大战略

5.Engram 在 2026 年第一季度提出,在某种意义上,它用内存(LPDDR 内存)交换计算。如下方详细图表所示,在总体参数预算相同的情况下,Engram 带来了性能提升。

图片
DeepSeek 的 10 万亿美元宏大战略

6.DeepSeek 极度重视计算与通信的重叠,Dual Path 这样的创新也可以理解为对资源约束的应对。但 DeepSeek 走得更远:它们还会给硬件厂商的 ASIC 设计提建议,确保宝贵的硅资源不被浪费。下面这张图来自 DeepSeek V4 论文。

图片
这是它们在 DeepSeek V4 论文里给出的建议。我很确定,它们私下会分享更多反馈。

7.对 TileLang 的投入,也指向同一个方向:它们不只是解决自己的算力紧张问题,而是在让中国硬件生态具备与西方生态竞争的能力。借助 TileLang,可以只开发一次 kernel(计算代码),然后让它在所有拥有 TileLang 后端的硬件平台上成功运行。我预计中国其他实验室都会加入进来,帮助中国硬件厂商间接绕开“CUDA 护城河”。这也会解锁 AMD 等更多西方硬件。

图片
DeepSeek 的 10 万亿美元宏大战略

大规模 RL 与 RSI

如果 DeepSeek 能获得更多计算资源(来自更多潜在硬件选项),同时计算需求又下降,那么它就能承担更雄心勃勃的训练项目,尤其是 RL 后训练。RL 需要生成大量轨迹,也就是生成数万亿 tokens,成本会迅速变得非常高。进一步说,如果要训练 100 万上下文模型,就需要生成同样长的轨迹。训练能够处理如此长轨迹的模型,才能支撑长时程任务。

此外,由于硬件选项增加,DeepSeek 可用硬件更多,这也会推动自动化研究(RSI)。RSI 指的是 AI 自己设计并执行实验。这种方法需要大量试错,成本会迅速上升。但 RSI 对探索整个设计空间非常重要。DeepSeek 在迈向 AGI、再迈向 ASI 之前,必须具备 RSI 能力。

DeepSeek 今天做的事,明天整个行业都会跟上

DeepSeek 围绕 MoE、MLA、DSA 的创新,已经被全球其他 AI 实验室以及中国实验室采用。

例如,ZAI,也就是 GLM 系列模型的开发者,使用了 MLA 和 DSA。Kimi(月之暗面)采用了 MLA,并且毫不避讳地表示自己的架构基于 DeepSeek 的架构。DeepSeek 也使用了 Muon 优化器,而 Kimi(月之暗面)是第一个在大规模训练中使用 Muon 的团队。

注:

MoE 是 Google 在 2017 年发明的,关键作者是Naom Shazeer
https://arxiv.org/pdf/1701.06538)。

DeepSeek 将它应用到超大规模,并发明了自己的技巧。

Muon(MomentUm Orthogonalized by Newton-Schulz)优化器由机器学习研究者 Keller Jordan 于 2024 年底创造。Kimi(月之暗面)团队是第一个在大规模训练中使用它的团队。)

那怎么赚钱?

我们来看 OpenAI 这个有意思的例子。OpenAI 获得了以低价购买 AMD 和 Cerebras 股票的认股权证/期权,触发条件基于使用量里程碑。对 AMD 和 Cerebras 来说,这是一笔很好的交易。OpenAI 绑定它们,也会提高它们长期成功的概率。

引用 AMD 公告:“作为协议的一部分,为进一步统一战略利益,AMD 已向 OpenAI 发行最多可购买 1.6 亿股 AMD 普通股的认股权证。这些认股权证将随着特定里程碑达成而分批归属。第一批将在初始 1 吉瓦部署时归属,后续批次会随着采购规模扩大到 6 吉瓦而陆续归属。归属还进一步与 AMD 达成特定股价目标,以及 OpenAI 达成使 AMD 部署能够规模化所需的技术和商业里程碑挂钩。”

图片
DeepSeek 的 10 万亿美元宏大战略

我预测,DeepSeek 会与多家中国内存、ASIC、CPU 和网络栈厂商签署类似协议,并与它们密切合作,让它们的硬件栈能够胜任领先 AI 工作负载。

西方(包括东亚盟友)所有 AI 股票的总估值已经远远超过 10 万亿美元。这种“通过合作获得股权”的方式,可以让 DeepSeek 帮助中国创造一个同等规模的产业,并在其中分得属于自己的那块蛋糕,同时实现自身 1 万亿美元估值。

这会让它们赚到远多得多的钱,同时也实现它们口中的目标:“AGI for everyone”。梁文锋是 Jim Simons 的超级粉丝,也是一位太聪明的资本家,不可能错过这一点。

如果你回看 DeepSeek 迄今为止做过的一切,这是唯一说得通的解释。

图片
这些是关键 AI 股票。图中还没有列出超大规模云厂商和许多其他公司。

source :GDP (@bookwormengr)

https://x.com/bookwormengr/status/2057909493250539891

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

文章标签DeepSeek算力芯片
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多