Token导航 LogoToken导航

海外Token工厂业务可行性分析

更新时间 2026-10-08来源 虎嗅网正文 6278字阅读约 20分钟

Token工厂业务可行性报告:从成本测算到销售策略

本文来自微信公众号: 云算计 ,作者:曹亚孟

本文同样是《一文谈清Token工厂》的扩展材料。

我之前写过多篇技术可行性分析文章,这篇文章在做的是业务可行性分析。

本文较长,所以列出目录:

目录

  1. 资料够多,可以测算成本

  2. Token成本的硬核计算过程

  3. Token售价和售出可行性

  4. 新团队可以成为Token工厂

  5. 工程师能学会Token生产技术

1.资料够多,可以测算成本

AI行业还处于基础理论快速刷新的阶段,我最近拿到了一些真实数据,开始写这个议题——"生产Token能赚钱吗"?

•全社会对Token的爆发式需求,始于今年3月,这是个全新的技术、产品和业务模式。

•某些人所谓的"深厚AI经验",大多在故意混淆"AI应用""模型训练""Token生产"等等毫无相干性的工作。除了品牌商誉之外,没有什么老玩家长期积累,大家都是从零开始的。

•现阶段是"缺卡+满负载"环境,该环境的生产token和调度资源的技术,未来并不一定适用。

我从下列口径拿到了一些真实数据。但我一直有保密的声誉,所以我只能写明口径和模糊值,没必要也不能直接公开精确数字:

•某Token生产团队,两批不同技术员工的口头描述,都介绍了类似的Token生产相关的指标数据。

•两个Token生产团队,给投资人的BP和财务数据中,介绍和规划的Token生产相关的指标数据。

•一些硬件团队、商业软件团队、开源软件团队的公开资料中,给出了可参考的Token生产数据。

•做过云计算的人,很容易搞清楚IDC、带宽、施工的大致成本;AI业务抬高了IDC的标准(液冷+大功耗),但对IDC资源的需求没有本质性变化。

本文强调"在海外做",是因为国内的B300价格过于荒诞,这让国内生产Token的成本难以计算。我有点出海经验,中国工程师去海外卖Token给老外,是一个更有典型分析意义的场景。等到国内供应稳定了,本文提及的所有测算方法,同样适用于在国内生产Token。

2.Token成本的硬核计算过程

我在《上一篇文章》就写过Token成本的计算口径,本节把Token生产的数据也代入进来。

•已知Token成本="软硬件成本÷Token生产数量"。其中Token生产数量是"每秒最大Token生产能力"和"实际资源利用率"决定的动态数值。我近期主要精力就是在搜集这两类数值。

•本文公开代入的都是低标准数字,大家的实际生产中能做到更低成本、更高生产能力和更高的资源利用率。

2.1 8卡B300的软硬件日摊销约为900美元

软硬件成本包括"硬件摊销+IDC租金+施工摊销+平台软件开销+研发摊销"。

•一台8卡B300服务器,加上网络布线成本和拖沓延误的周期,海外售价算65万美元就够了。我知道国内B卡的售价炒到天上了,但是那个价格通过出售Token很难回本,更多是虚空喊价和倒卖给下一个接盘侠,不在本文探讨范围内。

•硬件摊销真正的难题是,该按照多少个月进行折旧摊销?据说某Token原厂按照18个月进行摊销计算,但是第三方Token工厂都是按照36–48个月计算摊销周期。本文按照40个月折算,每月硬件摊销成本就是1.6万美元。

•这台服务器的功耗要给到15千瓦,全球各地的机柜价格差异很大,但按"每千瓦每月450美元"计算,能买下大部分机柜。这样计算,每月的机柜月租就是6700美元。

•服务器的部署和日常维护的施工摊销,平台软件开销,研发费用开销,这些摊销我们简单算作每台服务器每月3000美元。一大堆人会说这预留太少了,但客户买Token的时候,不想为技术团队付款,只要友商能够压低相关成本,你也得压到一样低。

•上述成本汇总结果是1.6+0.67+0.3=2.57,可以认为8卡B300服务器每月摊销26000美元,每天摊销900美元。接下来我们就要测算,每天生产的Token能不能覆盖这900美元成本了。

2.2 8卡B300每秒生产3万个Token

本段先看Token生产能力,这是个纯技术议题,保守数据是:8卡B300,每秒能无缓存生产至少3万个GLM5.2的Token。

•普通天资和正常认知水平、常规努力程度的工程师,通过阅读SGLang/vLLM的在线文档学习相关技能,对Token引擎做常规优化后,单机8卡B300,10万以内的上下文,可无缓存生产30000个以上的GLM5.2Token。

•这是个可公开的有缓存生产案例,SGLang的blog https://www.lmsys.org/blog/2026-07-13-glm52-optimization,文档中明确介绍:8卡B300,输入8万Token,输出220个Token,连续13轮追加提问,缓存命中率约为92%,Token生产量能达到单卡2.5万,8卡20万。

•实际生产中,特别是AI编程场景,缓存命中率都能超过90%;但是缓存命中的Token收费也很便宜。本文是重点探讨成本收益问题,所以主要采信无缓存生产3万个token的数据。

•上述提到的测试数据,都是以生产GLM5.2为基准的,如果换成更轻量的模型,可以生产更多的Token,但那种token的成本和售价都会降低。

•上述测试的上下文都小于10万,这种测试标准更符合实际情况。模型原厂虽然宣传支持百万上下文,但实际使用过程中,因为注意力中间迷失、响应缓慢乃至异常退出等问题,客户自己都会主动将上下文长度控制在小于20万。

•PD分离会小幅增加网络硬件投入,但会大幅提高Token生产效率,还会让客户感知(ITL/TPOT)更稳定。根据不同业务的Prefill和Decode需求差异,实测可增加20%–50%的Token产出。

2.3实际资源利用率决定成本能不能降下来

Token生产集群的实际资源利用率,不是个技术问题,而是看销售部门能不能找来"在计划时段内使用+用量很大"的客户。

•倒卖GPU的炒家,或者toSBVC的梦想家,都喜欢预估资源利用率达到100%。每天8万秒,每秒生产3万个无缓存Token,一天就能生产2400M的Token。因为每天硬件成本900美元,产量是2400M,这让每MToken的成本是$0.375(约¥2.5),生产Token就是个暴利生意。

•实际Token售出比例并不可能达到100%。我多方打探、反复脱敏斟酌后,认为Token工厂大约能售出50%的资源。在这个预估口径下,每MToken的成本是$0.75(约¥5),这依旧是个利润达标的生意。

•我们可以看OpenRouter网站上,一堆中立厂商对某个开源模型的公开售价。这些报价和本文预估的$0.375–$0.7的成本,相差并不大。这些专业销售商还在压低硬件成本,提高Token生产效率,灵活调度提高资源利用率,进而将成本压低到能够实现足额盈利。

•提高资源利用率是个复杂的客户运营问题,不同Token生产商,同一个生产商的不同节点,实际资源利用率的差距都很大。未来随着技术追平,随着算力和电力资源不再稀缺,Token工厂的核心竞争力就是能否保持比友商更高的资源利用率。

3.Token售价和售出可行性

做Token工厂想要盈利,就要用售价减去成本。上一章节介绍了Token的大致成本,本节就介绍Token售价和售出可行性。

3.1定价标准很简单

Token产品没有差异,Token的定价上限是"原厂媒体价上浮10%",Token的定价下限是"逼近公允的Token成本,最多倒贴个10%"。

•大家生产的Token都来自模型原厂,开源模型本就是公开给全球,而闭源模型也很难拿到独家排他授权。因此,我们可以说各家供应的Token没有差异。如果想给Token涨价,那就要做诸如私有部署、定制项目方案等方式,搭售而非主售Token。

•无论是商业Token还是开源Token,用户都能查到原厂公开价格。因为Token毫无差异,用户会选择原厂或者最便宜的供应商,但是实际操作中,用户考虑到便利性、账期、税费等原因,可以接受在原厂媒体价的基础上,价格上浮不超过10%。

•Token工厂报价的下限,基本就是贴着公允的成本下限。就算你没能力卖Token给客户,你总可以按照成本价卖给模型原厂或者其他友商吧?如果你实在是销售能力太差了,你降价到比公允成本低10%,一堆友商会抢着买这种廉价资源。

•很多卖不出去Token的团队,根因是自家资源和人力成本远超了"公允成本"。你失误买了昂贵资源,你失误投入了大量沉没的研发成本,这不是客户要接受高价、友商友情接盘的理由。一个团队如果没能力把成本压下来,那就不适合从事Token生产工作。

3.2模型原厂的新手保护

现阶段,模型原厂是客户购买Token的主要渠道。但对于第三方Token工厂来说,模型原厂不是拦路猛虎,而是个新手保护。

•首先,Token工厂不仅想运行开源模型,也想支付授权费后运行闭源模型。随着开源模型的能力冲击,那几个闭源模型就算为了回收研发成本,也会推动授权分销给第三方token工厂。

•第三方Token工厂大多缺乏品牌知名度和产品包装推销能力,很难从零独立拓客。但是如果客户认可了原厂模型的能力,就很容易接受第三方Token。而第三方Token工厂确实很容易做到比原厂更便宜、服务好,最终原厂是在帮Token工厂完成了教育客户。

•模型原厂要更早抢购昂贵资源去训练模型,在售卖token时需要收回研发成本,他们的Token必然比第三方Token更贵。原厂制定的媒体价和成交价,就是撑起了客户对Token价格的心理预期价值。前段时间DSv4报价从¥2调到¥6,普通用户的反应是"梁圣变牢梁"了,但第三方Token工厂的反应是"梁圣滑动变祖"了。

•这些模型原厂吸引来大量的主动客户,他们自己的资源池无法承载这么多需求(或者因某些原因无法持有高端硬件),也会采购第三方Token工厂的token。虽然他们的采购价格不高,但低价总比空置好。前文3.1说Token定价下限,正源于这类交易。

3.3客户推销的简单展望

在具体推进Token售卖的场景定义、包装宣发和售前销售工作时,Token产品和云主机、CDN、对象存储等产品实在是太像了。历史是惊人相似的,Token推销刚刚遇到或将要遇到的问题,都在10年前云计算行业上演过的。

•首先,云计算行业发展初期(2014–2016)赶上了4G普及,拥有大量使用对象存储产品的小微开发者客户。现在Token行业也是发展初期,也有大量小微开发者客户。Token工厂如果想开拓开发者生态,就应该学习对象存储。但是,我真正的忠告是:无论大家是否成功获取了开发者,Token主战场依旧是企业客户,而服务开发者和服务企业客户两者毫无相似性。

•Token和云主机都是售卖的重载算力资源,这类产品的共同特点是,希望客户能"大量+准时的使用资源"。我在书稿和公众号中多次介绍,云主机产品想要低价就得放弃弹性。到了Token场景也一样,销售想给客户申请低价Token,不仅要关注Token的采购量级,更要约束客户尽量准时使用资源。

•很多人都说"Token很像CDN",这种类比只能证明——这些人既不懂Token也不懂CDN。CDN作为一个过于成熟的行业,其职场分工和其他云产品有很大的差异,盲目类比极易误导外行。

4.新团队可以成为Token工厂

介绍可行性后,再看一个新议题,什么团队适合进入Token生产这个行业,这个行业能引进新玩家吗?

  • Token生产当然欢迎新玩家。你们能看到的那些“历史悠久的Token工厂”,绝大多数去年还基本没有Token营收。他们表面上是经验丰富的老团队,其实只比我们早入行几个月。

  • Token生产是个典型的互联网在线业务。但这些老玩家多是做模型训练、一体机、系统集成起家的。人的思维是有定式的,一帮做软件和集成的人,他们能做好兼具性能、容量和稳定性的在线服务吗?

前些年云厂商增收乏力的时候,一群云主机厂商都想进入CDN行业。当时我解答这些战略可行性问题时,特地在书稿中写明,要做成CDN需要评估"技术-资源-销售能力"三个条件。

现在做Token工厂,同样是需要"技术-资源-销售能力"这三个条件。新玩家至少要能满足两个条件,才能主导相关工作;如果参与者只能满足一个要求,那就必须和其他玩家合作。下文是详细介绍:

•第一个条件,拥有高效率生产token的技术实力。生产token的入门功能性技术很简单,真正的难点就是性能和效率。同样的硬件和模型,别人的团队能每秒生产3万个token,你的团队能每秒生产5万个token,那你就可以通过参与token生产来放大自己的能力。相关技术团队要求靠谱,但不用太豪华,后文我会从技术工程师的角度介绍,Token生产的技术难度并不太大。

•第二个条件,拥有低成本资源。总有一些神通广大的团队,拥有便宜的资金、便宜硬件和便宜机柜,能够发掘冷门闲置资源,或者独揽某些资质和稀缺资源。这些神奇套路吹起来是漫天云霞,但实际上都是水到渠成和锦上添花。

•第三个条件,拥有强悍的Token销售能力。Token的销售能力和其他云产品差不多,不仅仅要看销售总量够不够大,还要看产品价格是否合理——不能是最低价亏损刷营收。如果销售和售前能引导客户,让客户将准时定量的优质需求使用自家Token,把突发峰值流量都丢给竞品,这种销售能力就很完美了。

5.工程师能学会Token生产技术

本文标题是"海外生产Token能赚钱"。对技术人员来说,硬件和客户在哪里是无所谓的。我们可以远程维护,也可以肉身出海,都能生产海外Token。对客户和用人单位来说,经过中式互联网锤炼的中国工程师,无论是技术水平还是敬业精神,都远超当地工程师的。

Token工厂是个新行业新生态,因为扩张迅猛,对新鲜血液的要求比较低。我鼓励泛互联网行业的IT工程师们,大家快来学习token生产技术,我可以很严肃的介绍,这个技术的门槛并不算高。

•AI天价融资和几个AI天才的高薪,并不能证明AI技术有多难。从技术角度看,Token生产就是个"前端无状态随便迁移,后端大负载低速度、前后端没有强依赖"的Web应用,这种应用能有多高的技术难度吗?

•大家都是面向工资编程。我接触过很多Token生产工程师,也看过一些团队的人力构成和研发预算,这些工程师的天资、认知水平和努力程度,就是普通的正常人。如果你在一个在线服务类的后端技术团队中,不看背景和资历,不靠管理和运气,仅凭IT技术在一线城市能拿到月薪3万,那你的资质肯定足以快速学习Token生产那点技能。

•具体到技术学习中,我们就直接学vLLM和SGLang的官方文档和官方blog,如果做PD分离就再看看Mooncake。这些服务的官方文档都简单易读,Token生产(含高阶调优)总共也就三四十个含义明确的参数。AI确实频频技术进步,但这些进步都是工程上简化难度了——比如我半年前学Kvcache时它还是一座大山,但近期新模型都大幅度给Cache瘦身了。

•硬件需要学习,但硬件原厂会主动降低学习门槛,让硬件不会太难。我见过一个老网工学会IB网络后,只能加薪3k,而你学会GPU配置后,会发现这点技能根本谈不上加薪。我们也愿意拥抱非N卡新硬件,但新硬件厂商需要主动引导和培训客户。学Token缺乏高端GPU实验环境,那就去云端租赁。

结束语

我多年前就看轻AI算力云、模型训练等工作的技术难度,那是因为缺乏应用场景,而那些团队就爱吹自己技术多难(其实是场景冷门)。

现在Token生产已然成势,必然也会像十几年前的云计算行业一样高速发展。这是个朝阳行业,值得我们共同努力。

文章标签出海应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多