“照我说得做,封号赔额度”本文写在存储暴跌之日,并非喊你去抄底,之时从一件小事推演未来依旧望不到边际的存储需求。欢迎订阅我的宏观财报日历:https://isnow.ai
顶级大模型的竞逐早已进入白热化:一个多月前,Claude Fable 5 横空出世,令人惊艳,却又因美国商务部一纸出口管制令而全球下架——甚至 Anthropic 内部的非美籍员工也被禁止使用自家模型,“自毁长城”的嘲讽声一度四起。直到两周前禁令解除,Fable 5 才重回大众视野,却又在“洛阳纸贵”般的热度之下叠加诸多限制:订阅用户仅被“仁慈”地允许体验一周,随后再度下架。
在 OpenAI GPT-5.6 步步紧逼之下,顶级模型之间的用户忠诚度几乎为零——这一点 Anthropic 心知肚明。Fable 5 重新上架时,官方承诺的免费窗口原本只有约一周(截至 7 月 7 日)。但随着 GPT-5.6 将于 7 月 9 日正式全量开放,Anthropic 连续两次延长窗口:先延至 7 月 12 日,随后又延至 7 月 19 日。归根结底,还是担心用户流失:一旦对手推出能力接近的新旗舰模型,用户取消订阅、转投他家几乎会在瞬间发生——甚至不必等到下一个订阅周期。
表面上,有来有往,算是打了个平手。坊间隐约还有声音说,Anthropic 的 Fable 5 在工程能力方面略胜一筹。就在这个节骨眼上,Tibo(Thibault Sottiaux,OpenAI Codex 团队负责人)写了一篇推文,教你让两个旗舰模型“左右互搏”:让 OpenAI 的旗舰 ChatGPT 5.6 去指挥 Anthropic 的旗舰干活儿。7 月 12 日,他在 X 上发布了一份三步教程:
- 安装 CLIProxyAPI
- 连接
- 设置 alias

这样做了以后,你就可以在 claude 的小螃蟹界面里面(用 claudex 启动,让 claude 家的旗舰模型指挥openai 家的模型干活儿)他还开玩笑说,如果这套设置被封了,他负责给用户 reset 额度——顺便说下,reset 也是最近的一个梗,当 claude 的旗舰模型不断被宣布延长可用时间之后,openai 不断的在找各种借口慷慨的 reset 用户额度,不但 Tibo 在碰到用户问题的时候,积极排查,响应客户抱怨并 reset 额度,他还在起号的时候,Tibo 多次在用户数突破(5M → 6M → 7M)时同步 reset,并用轻松语气说“Go do things”“Keep the feedback coming and we'll keep shipping”。他还鼓励 Codex 重度用户把 ChatGPT Work 推荐给非技术朋友。
更不用说 Anthropic 在 OpenClaw 等第三方工具接入政策上曾经好几个月的来回反复——4月封禁、5月改成 Agent SDK credits 恢复接入、6月又叫停这套新计费方案,首鼠两端,让人很难对它的长期政策有稳定预期,而 openai 这条推文很快被固化成一个打着 openai 旗号、一键安装的插件——Anthropic 自家的旗舰应用,就这样变成了 OpenAI 算力的一个免费入口。

Tibo最近这几次在X的”极限整活儿”,让 openai 从大半年前深陷舆论泥沼的形象增色不少。
曾几何时,这家全球估值最高的 AI 独角兽,正在悄然流失它的基本盘——硬核开发者群体。核心的争议焦点,直指其掌舵人 Sam Altman。在很多人眼里,Altman 越来越不像一个纯粹的技术理想主义者,而更像一个长袖善舞的“华盛顿政客”。
他频繁出入美国白宫、游走于全球权力中心,俨然一位政治操盘手:在国会听证会上滴水不漏,甚至公开呼吁建立 AI 准入的“牌照制度”。在 2023 年 5 月美国参议院司法小组委员会的听证会上,Altman 展现出极为圆滑、甚至令人惊讶的顺从姿态——他主张政府应当介入人工智能研发,建议设立专门机构来发放与吊销前沿 AI 模型的研发许可证,并制定更严格的安全法规。为此,开源社区和许多中小开发者怒斥这种行为是名副其实的“监管俘获(Regulatory Capture)——原本旨在保护公共利益的监管机构,最终被其所监管的、财力雄厚的行业巨头所左右,转而制定有利于巨头、排挤中小竞争者”——自己上了车,转身就要焊车门。
而正是这种在政客面前显得“极其配合”的姿态,在科技产业与开源社区内部引发了强烈的反感与警惕。经济学中有个概念叫“监管俘获(Regulatory Capture)”。Meta 首席 AI 科学家、深度学习奠基者之一 Yann LeCun 与斯坦福大学客座教授、Coursera 联合创始人吴恩达(Andrew Ng)都曾指出:一些头部公司打着“AI 安全”的旗号推动高门槛监管,实质可能是在抬高准入门槛、挤压开源与初创空间。
这场形象危机在 2023 年 11 月 17 日被进一步暴露于风口浪尖:OpenAI 董事会突然罢免 Altman,理由是其对董事会“不够坦诚”,虽随后复辟,但“失信”的标签从此难以撕掉,后续争议也更容易被归入“权谋、不透明”的叙事。同时,马斯克通过诉讼公开提出了 OpenAI 背离非营利使命等指控,把公司治理纷争升级为长期传播的道德议题;但诉状只代表原告主张,不等于经法院认定的事实。2026 年 5 月,相关请求因诉讼时效问题被驳回,法院并未就 OpenAI 是否在实体上背离原始使命作出最终认定。
在这种信任赤字下,主打“安全、透明”的 Anthropic 乘势而上,Claude 一度成为极客对抗 OpenAI 霸权的“精神避难所”,社区甚至出现了“退订 OpenAI、转投 Anthropic”的呼声(在旗舰模型能力接近的前提下)。
OpenAI 急需一场形象反击。但用公关通稿是赢不回开发者人心的,他们需要用社区最熟悉的语言来对话。于是,Tibo 登场了。
如果说 Altman 像 OpenAI 专门用来和华盛顿打交道的圆滑利己的精明政客,那 Tibo 更像是穿着连帽衫的硅谷极客——他时常从自己连帽衫口袋里摸出一个屡试不爽的小开关来取悦用户:reset。他完全用了一种工程师的公开透明文化来处理用户争议:而频繁 reset “发糖的背后”,究竟又是不是一场新的基于token倾销的“算力战争”呢?
算力战争Anthropic 狂飙的 ARR 与 OpenAI 的帝国反击战
2026 年 6 月至 7 月,Anthropic 的 Fable 5 与 OpenAI 的 GPT-5.6 仍在不同基准上相互超越:Fable 5 在 Anthropic 披露的 SWE-bench Pro 中达到 80.0%,显著高于 Opus 4.8 的 69.2%;OpenAI 则称 GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上达到 80 分,高于 Fable 5 的 77.2 分,同时使用不到一半的输出 Token、耗时不到一半,估算成本低约三分之一。
狂飙
Anthropic 的收入增长速度已经到了近乎失真的程度。
2025 年底,Anthropic 的年化收入运行率约为 90 亿美元;到 2026 年 4 月,这一数字突破了 300 亿美元;5 月初又超过 470 亿美元。换言之,短短五个月,其收入运行率增长到原来的约 5.2 倍。5 月 28 日,Anthropic 又以 9650 亿美元的投后估值完成650 亿美元融资。Anthropic 官方融资公告
需要强调的是,这里更准确的说法是“年化收入运行率”,不等同于经审计的全年 GAAP 收入,也不一定等同于严格会计意义上的合同 ARR。Anthropic 与 OpenAI 对云渠道收入的确认方式也不同,不能不加调整地直接横向比较。
7 月 8 日,SemiAnalysis 的自下而上模型进一步估计,Anthropic 的年化收入可能已经向 600 亿美元以上迈进,并预计其第三季度营业利润可能超过 10 亿美元。但这些是模型估算,不是 Anthropic 已公布的审计结果。SemiAnalysis 分析
因此,Anthropic 当前更准确的矛盾不是“没有客户”,而是“客户增长得太快”。收入越高,企业调用和 coding agent 消耗的 Token 越多,对推理集群的需求也越大。Anthropic 已经签下 SpaceX Colossus 1 数据中心全部产能,获得超过 300 兆瓦、约 22 万张 Nvidia GPU,并另外与 Amazon、Google、Broadcom、Microsoft 和 Fluidstack 签署了数吉瓦级别的算力协议。
Fable 5 的混乱发布,正是这种“爆发式需求撞上有限即时产能”的缩影。模型于 6 月 9 日上线,6 月 12 日因美国政府出口管制指令全球暂停,7 月 1 日恢复。恢复后,Pro、Max、Team 和部分 Enterprise 用户最多只能将每周总额度的 50% 用于 Fable 5;原定的订阅内访问截止日期又从 7 月 7 日连续延至 7 月 12 日和 7 月 19 日。
用户对这种反复调整感到不满完全可以理解:真正影响开发者工作流的,不只是模型强不强,还有下周能否继续使用、额度何时重置、是否需要额外购买 Credits。但把这种容量管理直接解释为“Anthropic 正在烧光现金”,同样缺乏证据。它更像是一家公司在收入狂飙之后,发现芯片、电力、数据中心和产品政策都来不及同步扩张。
这甚至是近期的一个“算力永远不够,存储永不眠”的重要推手。
帝国反击战
OpenAI 的反击则集中在另一个方向:让每一单位算力完成更多工作,并把部分效率收益转化为更低的价格和更高的使用额度。
《The Information》报道称,OpenAI 工程师找到了一套软件层面的推理优化方法,可将部分现有模型的推理成本降低一半以上;在未登录访客流量的一次部署中,所需 Nvidia GPU 数量一度降至数百张。不过,这仍是基于内部消息的报道,而且适用范围主要是访客流量,不能直接写成“OpenAI 所有模型的推理成本都已经减半”。
更能直接观察到的是 GPT-5.6 的产品定价。GPT-5.6 Sol 的 API 价格为每百万输入 Token 5 美元、输出 Token 30 美元,明显低于 Fable 5 的10 美元和50 美元。OpenAI 还表示,最新推理优化将为 GPT-5.6 Sol 订阅用户增加约 10%的使用量,并在发布流量高峰期间多次重置额度、暂时取消五小时限制。
这可以被描述为一场“算力补贴战”,却还不能严谨地称为经济学意义上的“产能倾销”。我们不知道 OpenAI 的完整单位成本,也没有证据证明其正在以低于成本的价格销售服务。相反,OpenAI 拥有超过9 亿周活跃用户,其中约95%不付费;庞大的免费用户群本身就是沉重的推理负担。OpenAI 的优势,是利用消费级分发规模和软件优化摊薄成本,再以更低价格争夺开发者和企业客户。
维度 | Anthropic | OpenAI |
|---|---|---|
收入运行率 | 官方确认2026年5月初超过470亿美元;第三方估算正向600亿美元以上迈进 | 2026年2月底被报道超过250亿美元;此后缺少可直接比较的最新官方数字 |
旗舰 API 定价 | Fable 5:$10输入 / $50输出 | GPT-5.6 Sol:$5输入 / $30输出 |
算力策略 | 高价、高强度的企业和 API 需求;大举采购数吉瓦算力 | 大规模消费级分发叠加软件优化、自研芯片和更低模型定价 |
用户配额 | Fable 5 暂时只能占周额度50%,订阅内优惠延至7月19日 | 暂时取消五小时限制、多轮重置,并增加约10%的 Sol 使用量 |
商业重心 | 企业调用、Claude Code 与按量计费占据更重要位置 | 从消费订阅向企业市场加速进攻,同时维持庞大免费入口 |
Anthropic 并不是一个被高成本拖垮的弱者,而是一个依靠 coding agents 和企业调用实现收入爆发、却不得不追着需求购买算力的挑战者;OpenAI 也不是拥有“零边际成本”的无限算力机器,而是背负庞大免费用户成本,试图通过推理优化、低价模型和配额补贴守住开发者入口的规模型平台。
竞争到这个份儿上,再结合基地的模型切换成本,对于顶级模型的研发而言,我要说出一个反常识的结论:降价救不了任何人。
算力价格战,存储永不眠价格在通缩,账单在通胀。剪刀差的中间,藏着这场战争真正的战场。
AI 研究机构 Epoch AI 追踪了六大基准上的推理价格曲线,得出的结论近乎残酷:在固定性能水平下,推理价格每年下降 9 倍到 900 倍不等;而达到 GPT-4 级别科学问答能力的价格,每年下跌约 40 倍。换句话说,单 token 降价几乎是这个行业的“物理定律”,任何依赖报价单建立的优势,都会在几个月内蒸发。
但同一批学者在最新论文《The Price of Progress》中也指出了硬币的另一面:在 GPQA、AIME 和 SWE-bench 等基准上,达到当时最前沿成绩所需的评测推理成本增长约 3 至 18 倍。这说明部分能力前沿依赖更昂贵的推理,但不能直接外推为全行业推理账单每年增长 18 倍。巴克莱估算,一次 agentic 任务消耗的 token 可能是简单对话的 25 倍;Tirias Research 则预测,全球年推理 token 量将从 2024 年的 677 万亿跃升至 2030 年的 7.7 亿亿。
殊途同归
OpenAI 选择垂直整合——自己造芯片。6 月 24 日,OpenAI 与 Broadcom 共同发布 Jalapeño,官方称其为 OpenAI 的第一颗“智能处理器”:围绕 LLM 推理从零开始设计,端到端仅用 9 个月。OpenAI 总裁 Brockman 承认,自家模型对芯片设计的加速作用“令人惊讶”。据报道,Jalapeño 性能对标英伟达 Blackwell,成本却约为其一半;计划于 2026 年底开始部署,背后是与 Broadcom 规模达十吉瓦、延续至 2029 年的产能协议。用 AI 设计用于 AI 的芯片,再用芯片降低 AI 的成本——这是一台自我强化的通缩机器,为九亿周活用户中 95% 不付费的免费用户而造。
Anthropic 选择“组合采购”——把鸡蛋放进三个篮子。它是唯一同时跑在 AWS Trainium、Google TPU 和英伟达 GPU 三种硬件上,并在三大云(Bedrock、Vertex AI、Azure Foundry)全部上架的前沿模型:以十年 1000 亿美元的 AWS 承诺锁定最高 5 吉瓦 Trainium 产能;与 Google 和 Broadcom 新签的 3.5 吉瓦下一代 TPU 将于 2027 年上线;另有约 300 亿美元的 Azure 用量承诺。它不造芯片,而是“买期权”——用多平台议价权对冲单一供应商的定价权,再以两倍于对手的 API 定价($10/$50 对 $5/$30)让企业客户为高级产能买单。
一个造芯片,一个买期权,但却殊途同归:Jalapeño 将于 2026 年底部署,Anthropic 的 TPU 计划在 2027 年上线,而 SanDisk 与 SK 海力士的 HBF 推理设备也将在 2027 年初送样。2026 年的价格战,是用租来的英伟达算力打的;2027 年的战争,将会部署一部分自研芯片。 到那时,胜负手不再是谁更敢降价,而是谁的每 token 成本曲线更陡。也正因此,Broadcom 成了本轮最特殊的标的:它既是 OpenAI 加速器的代工方,也是 Anthropic TPU 扩产的合作方,堪称唯一同时为交战双方供货的“军火商”。Celestica(系统集成)与台积电(先进制程与封装)则占据相似的“双边收租”位置。英伟达承压的,更多的是定价权而非需求的变化——Broadcom CEO Hock Tan 说客户的算力需求“简直贪得无厌”,直到 2028 年依然如此。
相比算力,存储要更加激进
大模型推理天然分为两个阶段:prefill 重计算、轻带宽;decode 轻计算、重带宽。清华与月之暗面在存储顶会 USENIX FAST ’25 发表的 Mooncake 论文,标题几乎就是一份宣言——《Trading More Storage for Less Computation》:用更多存储换更少计算。论文将闲置的 CPU、DRAM 和 SSD 组织成分离式 KVCache 缓存池,使有效请求容量提升 59% 到 498%,如今每天可处理超过千亿 token。硬件厂商随即跟进:英伟达的 Rubin CPX 为 prefill 配上了比 HBM 便宜约五倍的 GDDR7;随后英伟达又斥资 200 亿美元引入 Groq 的 SRAM 解码架构——GPU 管 prefill,LPU 管 decode,prefill–decode 分离也因此被“焊”进硬件roadmap。
存储行业的演进则更为激进。2026 年 2 月,SK 海力士与 SanDisk 启动 High Bandwidth Flash(HBF)的 OCP 标准化工作:目标是用 HBM 的 TSV 堆叠封装技术去堆 3D NAND,在 HBM 与 SSD 之间建立基于 NAND 的新存储层。按两家公司披露的计划,首批 HBF 样品预计 2026 年下半年出现,采用 HBF 的推理设备预计 2027 年初开始送样,目前仍处于标准化、原型和商业化准备阶段,还不能写成已经封装进商用 GPU 的成熟产品革命。存储行业也因此可能从“DRAM 和 NAND 两种大宗商品”,逐步裂变为一套按带宽/美元排列的完整光谱:SRAM、HBM、GDDR、LPDDR、DDR5、HBF、企业级 SSD、QLC——不同推理阶段,对应不同层级的内存与存储方案。
但供给侧根本追不上这场演化。美光的 HBM 产能已售罄至 2027 年;铠侠 2026 年的 NAND 产量在 1 月就被预订一空,超大规模客户开始要求签 2027–2028 年的长约;SK 海力士董事长警告,全球内存供给到 2030 年可能持续低于需求约 20%。美银把 2026 年定义为“类似 1990 年代的超级周期”,预测 DRAM 收入同比增长 51%、NAND 增长 45%,并测算 AI 优化内存的单位产能消耗是传统内存的 3 到 4 倍。
在赴美上市的 SEC 招股文件里,SK海力士把“agentic AI 与 AI 推理的普及”列为服务器 DRAM 与企业级 SSD 需求加速的核心驱动——这就是最好的证词。
有人会问:推理优化不是在省内存吗?单个请求确实在省——但省下来的每一 GB,都会被更长的上下文、更高的并发、更复杂的 agent 工作流继续消耗。这更像内存版的杰文斯悖论:效率提升不一定缓解饥渴,也可能放大胃口。价格通缩与需求膨胀的剪刀差,最终会有相当一部分沉淀进存储层级。
既然顶级模型之间的用户忠诚度几乎为零,我们现在可以给出一个更谨慎的答案——忠诚度为零,是因为可迁移的使用习惯还没有被更深的工作流锁定。Prompt caching 可以显著降低重复长上下文的短期调用成本,但当前缓存是 5 分钟或 1 小时的临时 KV 表示,不是持久用户记忆;它能解释短期成本优化,不能直接推出“换模型等于格式化一段关系”。真正可能形成迁移壁垒的,是长期记忆系统、工具生态、企业数据连接、权限体系、工作流编排与评测体系。于是,Tibo 的 reset 是获客成本,Swarm 的左右互搏是烟雾弹,token 倾销只是过程——**终局不只是便宜 token,而是谁能把模型能力、数据连接、工具调用与长期记忆编织成难以迁移的工作流。算力在通缩,工作流和记忆系统才可能成为护城河。 *
附:推演链(顶级模型的持续竞争会发生什么)
推演一:2027 年是"自有芯片元年",价格战从下沉到成本结构。 今天的补贴战主要还是用租来的英伟达算力打的;但 Jalapeño 2026 年底部署、Anthropic 的 3.5GW TPU 2027 年上线,两条时间线都指向自研或定制硬件的重要性上升。HBF 则更谨慎地说,是 2026 年下半年样品、2027 年初推理设备送样的潜在变量,尚未完成商业化验证。届时比拼的不再只是报价单,而是谁的每 token 硬件成本曲线更陡。标的传导:Broadcom 是同时卷入 OpenAI 加速器与 Anthropic TPU 扩产叙事的“军火商”,Celestica(系统集成)、台积电(先进制程与封装)同理可能“多边收租”;英伟达承压的更多是定价权,而非绝对需求。
推演二:Red Queen 效应——价格通缩未必能压住总需求。 Epoch 的数据说单 token 价格每年跌一到两个数量级;《The Price of Progress》更准确的结论是,在 GPQA、AIME 和 SWE-bench 等特定基准上,达到当时最前沿成绩所需的评测推理成本增长约 3 至 18 倍,而不是全行业总账单统一每年涨 18 倍。两条曲线放在一起,仍然提示一个方向:效率红利可能被再投资为更长上下文、更多 agent 并发和更复杂任务,但投资结论必须保留不确定性。标的传导:存储寡头会受益于 AI 推理与服务器需求扩张,但这不是“必然躺赢”;更稳妥的表述是,SK 海力士、美光、三星、铠侠/SanDisk 等处在需求弹性较大的中立位置。
推演三:内存按"带宽/美元"谱系物种分化,HBF 仍处在标准化与样品阶段。 推理拆成 prefill(计算密集)和 decode(带宽密集)之后,硬件正在跟进分化:Rubin CPX 用 GDDR7 服务 prefill,SRAM、HBM、GDDR、LPDDR、DDR5、eSSD、QLC 等不同层级也会在不同任务阶段寻找位置。SanDisk 和 SK 海力士推动的 HBF,是试图让 NAND 进入更高带宽封装层级的路线,但目前仍是 OCP 标准化、原型和商业化准备阶段,不能写成已经进入商用 GPU 的既成事实。价值可能向三处迁移:定义接口标准的人、掌握堆叠封装的人,以及做接口 IP 的人;但 NAND、封装和接口 IP 的投资结论需要等待样品、客户验证和量产节奏继续确认。
推演四:终局可能是工作流资产化,而不是把临时缓存误读成长期记忆。 SK 海力士把"agentic AI 驱动存储需求"写进了 SEC 招股文件——当一家内存厂用监管文件向美国投资人陈述这个逻辑时,它已经不只是叙事,也会影响资本开支预期。Anthropic 的缓存输入定价是原价的 1/10,Prompt caching 能显著降低重复长上下文的短期调用成本;但当前缓存默认 5 分钟、扩展 TTL 1 小时,KV 表示存在于内存中,不是持久用户记忆。真正提高迁移成本的,应该是长期记忆数据库、供应商专有工具、API、权限系统、企业数据连接器、工作流编排和评测体系。这直接回扣开头那句"用户忠诚度几乎为零":忠诚度不会由几分钟级缓存自动产生,而要靠长期工作流和数据沉淀形成。
推演 | 驱动证据 | 受益方向 |
|---|---|---|
2027 自有硅元年 | Jalapeño 2026 底部署;Anthropic TPU 2027 上线 | Broadcom、Celestica、台积电(双边军火商) |
剪刀差 | 单价年跌 50 倍;特定基准前沿评测成本约 3–18 倍增长;token 量 2030 年显著扩张 | 内存寡头:SK 海力士、美光、三星、铠侠/SanDisk(中立受益者,但需验证需求与量产节奏) |
内存演进 | Rubin CPX(GDDR7)、SRAM 路线、HBF(标准化与样品阶段) | GDDR7 产线、封装(TSV/混合键合)、接口 IP(Rambus、Synopsys 生态);A 股存储链承接同一逻辑的国产化折射,但商业化仍需验证 |
工作流资产化 | Prompt caching 降低短期重复上下文成本;真正壁垒来自长期记忆、工具生态、数据连接与工作流集成 | 拥有长期记忆系统、企业数据连接和工作流沉淀的模型/平台厂商 |
Photo by Jonathan Kemper on Unsplash
Reference:
Fable 5 于 6 月 9 日发布,6 月 12 日因美国出口管制全球下架,6 月 30 日禁令解除,7 月 1 日恢复。
https://www.anthropic.com/news/redeploying-fable-5https://www.anthropic.com/news/claude-fable-5-mythos-5
订阅内访问期限从 7 月 7 日延至 7 月 12 日,随后延至 7 月 19 日。
https://www.androidauthority.com/claude-fable-5-free-extension-3685103/https://www.androidauthority.com/claude-fable-5-access-extended-3686668/https://openai.com/index/gpt-5-6/
Tibo 发布教程,通过 CLIProxyAPI 在 Claude Code 界面中调用 GPT-5.6。
https://x.com/thsottiaux/status/2076119366647894371https://github.com/router-for-me/CLIProxyAPIhttps://github.com/openai/codex-plugin-cc
Anthropic 在 4 月、5 月、6 月多次改变第三方工具使用订阅额度的政策。
https://support.claude.com/en/articles/15036540-use-the-claude-agent-sdk-with-your-claude-planhttps://www.axios.com/2026/04/06/anthropic-openclaw-subscription-openai
Altman 建议建立能够发放和吊销 AI 研发许可证的监管机构,因此被批评为“监管俘获”。
https://www.judiciary.senate.gov/committee-activity/hearings/oversight-of-ai-rules-for-artificial-intelligencehttps://openai.com/global-affairs/testimony-of-sam-altman-before-the-us-senate/https://techcrunch.com/2023/11/01/metas-yann-lecun-joins-70-others-in-calling-for-more-openness-in-ai-development/https://www.deeplearning.ai/the-batch/keep-open-source-free
2023 年 11 月 17 日,OpenAI 董事会以 Altman“不够坦诚”为由将其罢免;马斯克随后通过诉讼揭露了公司的阴谋。
https://openai.com/index/openai-announces-leadership-transition/https://cand.uscourts.gov/cases-e-filing/cases/424-cv-04722-ygr/musk-v-altman-et-alhttps://apnews.com/article/0b9b0bfaffe96f2c930341f52dfe4f8c
Fable 5 在 SWE-bench Pro 达到 80.0%;GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 达到 80 分,并且价格更低。
https://openai.com/index/gpt-5-6/https://www.anthropic.com/news/claude-fable-5-mythos-5
Anthropic 2026 年 5 月收入运行率超过 470 亿美元,并以 9650 亿美元投后估值融资 650 亿美元;SemiAnalysis 估算其收入运行率可能超过 600 亿美元。
https://www.anthropic.com/news/series-hhttps://newsletter.semianalysis.com/p/anthropic-3q26-profit-over-1b-the
Anthropic 获得 SpaceX Colossus 1 全部产能,并与 Amazon、Google、Broadcom、Microsoft 和 Fluidstack 签订大规模算力协议。
https://www.anthropic.com/news/higher-limits-spacexhttps://www.anthropic.com/news/series-hhttps://www.anthropic.com/news/anthropic-amazon-compute
OpenAI 拥有超过 9 亿周活用户,其中约 95%不付费;其部分推理成本通过软件优化下降一半以上。
https://openai.com/index/accelerating-the-next-phase-ai/https://aiweekly.co/node/4794
固定性能的推理价格每年下降 9 至 900 倍;与此同时,运行前沿模型的总成本每年上涨约 18 倍。
https://epoch.ai/data-insights/llm-inference-price-trendshttps://arxiv.org/html/2511.23455
Agentic 任务可能消耗普通对话 25 倍 Token;全球推理量将在 2030 年达到 77 quadrillion Token。
https://www.forbes.com/sites/tiriasresearch/2025/06/20/the-unstoppable-growth-of-generative-ai-ai-outlook-part-1/https://thefuturemedia.eu/the-ai-agent-revolution-can-the-industry-handle-the-compute-surge/
Jalapeño 在 9 个月内完成设计,2026 年底开始部署,性能对标 Blackwell、成本约为一半。
https://openai.com/index/openai-broadcom-jalapeno-inference-chip/https://openai.com/index/openai-and-broadcom-announce-strategic-collaboration/
Mooncake 把 CPU、DRAM、SSD 和网络资源组成分离式 KV Cache,使有效请求容量提升 59% 至 498%,每天处理超过 1000 亿 Token。
https://www.usenix.org/conference/fast25/presentation/qin
Rubin CPX 使用比 HBM 便宜约五倍的 GDDR7;Nvidia 以 200 亿美元引入 Groq 的 SRAM 路线。
https://nvidianews.nvidia.com/news/nvidia-unveils-rubin-cpx-a-new-class-of-gpu-designed-for-massive-context-inferencehttps://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platformhttps://groq.com/newsroom/groq-raises-usd650m-to-scale-its-ai-inference-cloud-businesshttps://techcrunch.com/2026/06/22/ai-chipmaker-groq-confirms-650m-raise-re-staffs-after-nvidias-20b-not-acqui-hire-deal/
SK 海力士与 SanDisk 在 2026 年 2 月联合发布 HBF,NAND 已经进入 GPU 封装。
https://news.skhynix.com/sk-hynix-and-sandisk-begin-global-standardization-ofnext-generation-memory-hbf/https://www.sandisk.com/en-ca/company/newsroom/blogs/2025/memory-centric-ai
美光 HBM 售罄至 2027 年,铠侠 2026 年产能被预订,SK 海力士预计供应紧张可能持续到 2030 年;美银预测 2026 年 DRAM 收入增长 51%、NAND 增长 45%。
https://investors.micron.com/news-releases/news-release-details/micron-technology-inc-reports-record-results-third-quarterhttps://www.kioxia-holdings.com/en-jp/news/2026/20260602-1.htmlhttps://news.skhynix.com/2026-market-outlook-focus-on-the-hbm-led-memory-supercycle/https://www.bloomberg.com/news/articles/2026-03-17/memory-chip-crunch-to-persist-till-2030-sk-chairman-says
SK 海力士在美国上市文件中把 Agentic AI 和 AI 推理列为服务器 DRAM 与企业级 SSD 需求增长的驱动。
https://www.sec.gov/Archives/edgar/data/2120882/000119312526295501/d32785df1a.htm
Anthropic 缓存读取价格是普通输入的十分之一,cache miss 是生产事故;项目上下文驻留在供应商缓存中,最终形成迁移壁垒。
https://platform.claude.com/docs/en/build-with-cla/prompt-cachinghttps://platform.claude.com/docs/en/build-with-claude/cache-diagnostics
无论 OpenAI 还是 Anthropic 获胜,Broadcom、Celestica、台积电及内存厂商都会受益,Nvidia 主要失去定价权。







