Token导航 LogoToken导航

GPT-6 Sol 降价 50% 背后:Terra 消失与模型梯队平移

更新时间 2026-09-24来源 雷峰网正文 4192字阅读约 14分钟7 张图片
GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移
奥圣上台,梁圣危机了么?

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

OpenAI 也走性价比路线了?别被它的“偷梁换柱”给骗了。
今早,硅谷又热闹了,迎来双雄对决。Anthropic 推出 Claude Opus 5.5,OpenAI 紧接着推出 GPT-6 Sol 与 Luna。和以往模型更新不同的是,行业的讨论点聚焦到了“大家怎么都变便宜了”。
Claude Opus 5.5 较上一代 Opus 5,成本降低 40% ,拥有 Fable 级性能。
而 GPT-6 Sol 降得更狠,性能持平 GPT-5.6 Sol,价格直接腰斩,每百万 Token,输入 2 美元,输出 10 美元,性价比看似要一步踩进 DeepSeek 的腹地。
但如果仔细对照,就会发现 OpenAI 所谓腰斩,是抹掉了一个型号 Terra。
我们都知道,OpenAI之前的模型档位是:旗舰 Sol、中端 Terra、轻量 Luna。现在变成了 Astra、Sol、 Luna。Terra 哪去了?网友戏称变成 Sol了,把整个梯队往上提了一格。
GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移
再重新对比一下 GPT-5.6 Terra,每百万 Token 输入 2 美元、输出 12 美元,和 GPT-6 Sol 对照看,几乎没什么变化。这波降价潮的真相,也就不言自明了。
GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移

01


三家账本摊开看,谁在真降价?

当下AI赛道价格战白热化,各大厂商纷纷下调模型定价,但降价的成色、逻辑和含金量天差地别。
Anthropic 降价最有诚意,DeepSeek 仍有绝对的成本优势,但差距在缩小,OpenAI 更像是商业定价叙事为主,工程优化为辅的策略型降价。
GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移
GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移
先说 Anthropic。
Anthropic 走的是“强模型,真降价”。Claude Fable 5.1 本来定位就是模型天花板,专攻高价值复杂推理场景。而 Claude Opus 5.5在大多数日常任务,性能与之相当,仅在极深度逻辑推导、超大规模代码工程等高难度场景存在差距。
相当于用 40% 价格保留 80% 核心能力。
Claude Opus 5.5真正厉害的是,它解决了长任务里最烧钱的隐形开销——思维链
在大厂的不少工作场景中,像处理长文档分析、多轮工具调用等任务,会让模型会在自我纠错和深度推导中烧掉预算。Opus 5.5 不只把基础价格降了,更将核心的‘缓存读取’费用降了 60%。
这样一来,长任务里“深度思考”的总成本少了近六成,开发者敢频繁调用高阶推理了。
而 DeepSeek 的绝对成本优势仍在。在闲时,还能减半。如果把 DeepSeek 与 OpenAI 的中端模型进行对比的话,可以看出 OpenAI 已经在努力向DeepSeek靠拢了。
再看轻量级战场,不少人会困惑,似乎账面上看,OpenAI 好像是更便宜的那个。 单看高峰时段标价,DeepSeek-V4.1-Flash 的输入费是 GPT-6 Luna 的 1.5 到 3 倍,输出费是 1.2 到 2.4 倍。
不过这两者在性能和体量是不能放一起比较的。GPT-6 Luna 是一个真正意义上的“小模型”,体积可能只有十几 B 参数,专门用来处理极其简单的短文本过滤、分类。DeepSeek-V4.1-Flash 表面上叫 Flash,但它的底层是一个总参数高达 552B 的重型混合专家模型,它在编程、长文本推理、多步逻辑上的智商,相当于前沿的中端大模型。
在这样的智商碾压下,它只比 Luna 贵一点点,这本身就是技术上的奇迹。
DeepSeek 之所以敢把一个 552B 的模型卖到三毛钱,完全是靠它的非对称因果编解码(CED)架构,只激活了 16B 的专家参数,算力损耗极低,且调用量越大、调度优化越充分,成本优势越明显。
不过,DeepSeek 的低价有自己的“特殊门槛”,受制于错峰机制,还高度依赖高前缀重复度。而 Luna 的低价没有门槛,这种“省心价”对中小开发者而言反倒成了感知上的优势。
相较而言,OpenAI 更像是用“商业套路”、长文本加价和缓存命中折扣,实现了价格跳水。
GPT-6 Sol 的 “价格腰斩”,本质是一次非常高明的定价叙事。而隐藏在低价背后的两大规则设计,才是OpenAI真正的布局。
一方面,它还把缓存命中输入价格直接给到1折,每百万Token价格是 0.20美元。从工程落地的角度看,这是一个高明的生态策略。
对于大厂的复杂长程 Agent 任务,其系统前缀 Prompt 往往非常庞大。开发者一旦为了享受这 1 折优惠,把海量的企业基础数据固定挂载在 OpenAI 的缓存里,企业的迁移成本就会高到无法承受。这就像用便宜价格建了一道很难翻出去的墙。
另一方面,GPT-6系列在长本文上全量加价,只要输入超过 272K Token,整笔请求的输入费直接翻倍,输出费也涨 1.5 倍,本质是用价格杠杆调节需求。这也暴露了OpenAI 在长文本上效率不够,它缺少更强的压缩技术,只能靠涨价限制高消耗场景。

02


降价背后,

DeepSeek 和 OpenAI 的不同

在降本这条路上,DeepSeek 和 OpenAI 走了两条完全不同的路。
DeepSeek 最早靠 V2 的 MoE 思路出圈,专家不一定要大,可以拆小,按需激活。这样哪怕总参数很大,每次推理可以只跑一小部分。
在最新的 DeepSeek-V4.1-Flash 中,这套激活思路到了登峰造极的境界,它的因果编解码架构(CED),预填充和解码用不同模块非对称激活,让实际激活参数量不过 8B 到 16B 左右。
Kimi 大神苏剑林曾点透其中的逻辑,大模型读取提示词时,只有最后一个 Token 用来预测下一个词,前面的内容主要用来生成 KV 缓存。传统模型里,前面的 Token 虽然不用算输出头,但最后一层 MLP 依然会完整计算,省的算力微乎其微;而 DeepSeek 用 YOCO “只缓存一次” 的思路,让预填充阶段只负责生成全局缓存,生成完就停止,后续解码阶段直接复用,把原本不起眼的边角优化放大成了核心成本优势。
而在 KV 缓存压缩这件事上,DeepSeek 在迭代过程中把体积压到了极致。
 早在 V2 版本,DeepSeek 就提出 MLA 多头潜在注意力,实现了 KV 缓存的低秩压缩,相当于把完整的缓存拆成内容与位置两部分分别精简存储。到 V4 版本,这套思路进化为压缩稀疏注意力,叠加稀疏编码、全局摘要、低精度存储多重优化,把 KV 缓存降到了每 Token 约 3560 字节。
到了 V4 版本,这套思路进化为压缩稀疏注意力。在压缩的基础上,只存有效信息、用摘要代替全量数据、用更紧凑的精度格式存数据路等优化方式。把 KV 缓存的体积降到了每 Token 约 3560 字节。
V4.1 版本的第二代压缩稀疏注意力(CSA2),则从三个维度再挤水分:一是不同网络层之间共享中间特征,不用每层都单独存一份完整缓存,减少重复存储;二是全量落地 FP4 极限精度存储,进一步压缩数据体积;三是搭配滑动窗口注意力的边界重放机制,不用每次都从慢速存储里读取完整缓存,只调用需要的片段即可。
几层技术叠加下来,全局 KV 缓存最终降到了每 Token 约 890 字节,体积仅相当于标准 Transformer 架构的 2% 左右。
如果把标准 Transformer 的缓存比作一沓 A4 纸,那 DeepSeek 现在不仅把它压缩成了一张便签的大小,还把这张便签反复使用。
在万卡级的大集群调度上,DeepSeek 直接把 GPU 的 “闲置时间” 和 “闲置空间” 几乎榨干,连主机内存、数据总线这些周边硬件都被拉进算力流水线协同干活,把整台服务器的显卡、内存、总线、网络当成一整台精密机器来拧效率。
和 DeepSeek 的极客风格不同,GPT-6 Sol 走的是一条 “务实路线”,尽量不动核心模型架构,主要靠工程优化挖效率、用商业规则控成本。
架构层面,它没有跟进细粒度 MoE 拆分,这会打破它已经规模化、高稳定性的训练计算图体系。OpenAI选择的是更务实的参数蒸馏与稀疏化重构,把上一代模型里部分冗余的稠密层,拆分成更轻量的小 MoE 分支,不用动整体框架,就能大幅降低单 Token 推理的浮点运算量,进而减少一部分成本。
面对长上下文场景的显存压力,OpenAI 选择用阶梯定价,避免超长文本。
它把上下文的节点标注为272K,272K tokens 以内的上下文,靠成熟的类 PagedAttention 虚拟内存技术消化;超过的部分,请求会被强制调度到显存更大的 B200 节点,计费直接翻倍。
而这次大降价真正的核心,其实藏在 Prompt Caching(提示缓存) 的极致优化里。
如果说 DeepSeek 降本的秘诀是把缓存做小,那么 OpenAI 的核心策略就是把缓存用满。
为了把缓存的价值榨干,OpenAI 一边拼命提升缓存命中率,一边努力延长缓存寿命。过去,当你把模型从“简单模式”切换到“深度推理模式”时,之前算好的前缀缓存会直接作废;而现在它支持动态调档,旧缓存可以无缝跨模式反复使用。
OpenAI 还把缓存最短有效期拉长到 30 分钟,只要命中缓存,输入费用立马打一折。
它还开放了显式缓存断点功能,让开发者可以自己决定哪部分内容进缓存,并配有专门的诊断工具来排查“为什么没命中”。
最厉害的是它的预热缓存能力。用户请求还没发过来,系统就提前把固定的系统提示、工具定义、参考文档的 KV 缓存算好等着。连图片输入、工具配置、结构化输出格式这些内容,只要前缀完全一致就能命中缓存。
这种优化效果直接反映在了账单上。根据头部 AI 团队的实测,在 Copilot 交互式代码场景里,大批 Token 无需重复计算,需要重新处理的 Token 数量直接砍掉了一半以上;而在更吃资源的企业级 Agent,如 Manus 等团队的实际落地中,原本 85% 的缓存命中率被硬生生拉高并稳定在 90% 以上。
不仅如此,GPT-6底层重构了推理逻辑,支持工具响应等待期间并行处理其他任务,允许用户中途调整需求。这套灵活的多任务逻辑,本质都是为了延长高价前缀缓存的生命周期,最大化复用已有算力,减少重复消耗。
GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移

03


性价比内卷,奥圣上位

过去两年,大模型行业性价比叙事,一直属于DeepSeek。梁文锋用两代架构把价格打穿地板,被人们直接封为了“梁圣”。
OpenAI 这波降价后,网友开始调侃 “奥圣上位”。只是,这位新晋“奥圣”的上位成色,多少得打个问号。OpenAI讲的性价比故事,一半靠换标,一半靠缓存折扣,二者都建立在“用户不细看价目表”的前提上。
当巨头的竞争开始比拼价格战,既没有万卡集群也没有自研架构的玩家,下一轮拿什么上牌桌?
GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移

上车,雷峰网(公众号:雷峰网)带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多