


先说结论,
得用价差,把用户都赶到夜里去用。
再说建议
我建议DeepSeek搞个『峰谷差千倍』的促销。
再说由来,
当下,DeepSeek空闲档的缓存命中输入是2分钱,
高峰档的输出是8块钱,倍数是400倍。
然而,这还远远不够。
我的促销活动的策划灵感从哪里来的呢?
先看这条国外的推文。


那这条推特在讨论啥?
要好好看这张图,信息量爆炸,
得保存在手机相册里,有空就好好琢磨。

我想,GPU卡有点像发电机了。
只要有,就可以发电(Token),
当然,开源模型反正也不要钱。
这个推特讨论的已知条件是每用户125tok/s,
这个生成速度,这非常高了,
人眼看肯定不用这么高,之所以定得这么高,
是因为场景是Agentic,输出不是给人读的,
一个智能体任务要来回几十轮。
每秒生成token数肯定要高。
第零个前提,你得有电,
用爱发电不行,
还得一吉瓦。
这个问题在中国不难受。
所以是第零个前提。
第一个前提,是有卡。
不谈这个,谈这个伤感情。
第二个前提,这个"P90125tok/s/user",
就是说9成用户的输出速度,
不低于每秒125个token。
所有用户的输出速度从慢到快排队,划一条线,
90%的用户体验不差于这条线,
这样就有P90这个服务水平线了。
现在,业界讲延迟、讲吞吐,
基本都用中位数,因为平均数不行了,
平均数看不到倒霉蛋的体(悲)验(惨)。
简而言之就是,
第三个前提,利用率,"Utilization60%",
只有六成的时间在真正产出token。
剩下四成是闲置和维护。
算力成本是按全年8760小时,
一方面,成本按100%的时间算,
另一方面收入只按60%的时间算,
这个设定其实相当诚实,闲置的卡真浪费。
所以所有卡的这个成本里,
包含了大量"卡在发呆但钱照烧"的时间。
说人话就是,成本的分母是8760小时。
收入的分母是8760×60%≈5256小时。
在保证九成用户都有125token/s的前提下,
每秒实际吐出多少token?
于是,推文是在算这样一笔账:
那些有卡有电的GPU云厂,
把开源模型跑起来,
再照DeepSeek官方的那个价格对外卖token。
到底能赚多少钱?
这个推文,一图顶千言了。
唯有沉默看图了。

答案按卡型有不同的钱数,
比如,B200跑开源的DeepSeekV4.1Flash,
哪怕按官方定价卖token,
每一吉瓦电一年能收上来约多少钱。

咱们看怎么算的?
先说梁文锋和梁文谷。
我发现这门生意的盈亏,
和"高峰时段"这一个变量关系极大。
因为缓存命中输入的时候,真便宜。
梁文谷时的缓存命中输入,
大约是每百万token人民币两分钱(0.02元)。
BGM响起来,2分钱,买不到吃亏,
买不到上当。
还有,缓存命中和未命中之间差50倍。
咱就讨论B200这个型号的卡。
B200的收入152 亿、成本89 亿、利润63 亿,
都印在柱子上。
成本是$1.73/卡/小时。
卡数由电力决定,1吉瓦。
1吉瓦体感多大呢?
三峡电站总装机22.50万千瓦,
相当于22.5台1吉瓦的机组。
B200 的全包功耗约1.7千瓦,
1吉瓦除以B200每张卡分到1.7千瓦,
一吉瓦电只能养活58.7万张B200。
成本是怎么来的?
公式是:
成本=卡数 × 单卡每小时成本 × 8760小时
所以成本是89亿美元。
最后,推文里有句话,
用Engram DRAM卸载,省钱了,为啥?
V4.1Flash里有个著名的记忆模块,
(叫Engram,有1960亿参数,大小约189GB)。
跑推理的时候,把模型里那块"查表数据",
从昂贵的显存搬到便宜的内存甚至硬盘上,
省下了昂贵的HBM。

证据都说完了,别废话,怎么赚大钱?
一眼看上去,两条:
能选对卡,人生赢家。
能让用户错峰出行,人生赢家。
你再深入好好看看,
好玩的附加题来了,
当下,既然空闲档的缓存命中输入是2分钱,
高峰档的输出是8块钱,差400倍。
看在钱的面子上,
让我做智能体做成本优化时,注意什么?
第一,好好设计前缀,
因为『缓存命中』这一档,太便宜了。
第二,尽量在谷时用,
谷时,便宜了好多。
第三,输出永远是最贵的一档,
输出长了太费钱了,
而且智能体场景是给程序看的,
怎么好好设计一下,好好控制下,
程序看懂就行了。
附加题我就不会了,
我只能提个小建议,
建议DeepSeek搞个『峰谷差千倍』的促销。
差距400倍根本不够,
用价差,把价格敏感的用户,
都赶到夜里去。

1.独家深度丨夸克健康大模型调研报告
2.熬夜三年肝损害,AI博主也靠AI学“续命”医学知识
3.为什么AI能预警心脏主动脉“血管炸弹”?
4.对话作者:全球首个开源手术视频大模型SurgMotion
5.阿里达摩院:做胸腹部CT,顺便筛了肠癌|独家对话和睦家医院朱刚主任
6.我用剧烈腹痛两周,读懂了阿里达摩院《科学》论文RADAR
7.阿里达摩院又又又发布食管癌AI模型
《AI产品和技术模块》
1.Kimi Agent产品很厉害,然后呢?
2.搞懂“记忆”必看|吃透Engram
3.实属踩踏了?深水炸弹Seedance掩盖Seed2.0
4.Harness内心OS:大模型只管想,剩下烂摊子全我的
5."纠缠软件"是什么?Agent?还是Harness?
6.排行榜是别人的,手感是自己的:Kimi K2.6体感报告
7.Agent才不会"赢家通吃",证据来了……
8.央企OPC的玩法和困境:让Agent能跑,还要改造费?
9.Agent大战,赢家暗自在哪下功夫?
《具身智能》
1.“26年具身智能,根本做不过来”:含陶大程教授独家
2.漫画:大模型“强控”具身智能机器人?
2.英伟达:照抄者死,阿里华为:AI集群狂飙『全解耦』
3.阿里华为『血战』英伟达AI超节点
4.抢在英伟达护城河合拢前,硅光的冲刺与最后窗口
5.OCP现场 l 北美AI巨头罕见共识ESUN,为利益握手
6.为什么有些『闪断的锅』,硅光不背?
7.为了Token,阿里云竟然出了一个TPN?
8.杀死Token成本:靠的不仅是更强的芯片
9.独家深度 | 光互连战争:CPO还没有赢,NPO怎么继续活?







