Token导航 LogoToken导航

企业AI多模型调用进入算账阶段

更新时间 2026-09-24来源 智猩猩正文 6257字阅读约 20分钟5 张图片

打开 AI 工具、输入问题、回车——看起来,企业使用大模型就是一次愉快的'提问'。但很少有人知道,这轻轻一问的背后,数据可能正穿过多家服务商、跨越若干系统,在你看不见的地方流转。

当内部代码、客户资料、经营数据甚至核心知识被送进模型,这些数据经过了谁?在哪里被处理?会不会被保存?

除了上边的安全问题之外,还有另一笔越来越难算的账。

模型越来越多,Agent 越来越多,不同部门调用不同模型、占用不同算力,Token 消耗也跟着一路往上走。月底账单来了,企业还得继续追问这些 Token 到底是谁用的?花在哪个业务上?为什么突然涨了这么多?

当 AI 真正进入企业生产流程,这两件事最终都指向同一个问题:企业能不能把数据流向,以及 Token 的生产、调度、计量和运营,掌握在自己手里。

这也是 Token Factory 开始出现的原因。

在这一背景下,超聚变在 2026 国际探索者大会上给出了一套 FusionOne AI 企业级Token Factory解决方案

01 为什么企业现在需要自己的Token Factory?

当 AI 真正进入企业生产环境,问题开始变得越来越复杂。从超聚变自身实践来看,企业面临的压力主要集中在三个方面。

(1)资源焦虑:算力不少,但资源越来越分散。

不同部门可能分别建设资源池、部署自己的模型,同一个企业内部同时运行几十个模型版本,重复部署、重复运维的问题随之出现。

资源总量看似越来越大,但哪些算力正在被使用、哪些模型存在重复建设、哪里还有空闲资源,并不清晰。

(2)经济焦虑:AI 用得越多,Token 需求增长得越快。

企业扩大 AI 应用之后,Token 需求持续增长,但简单增加算力并不能解决全部问题。

比如一些简单任务同样调用大模型、旗舰模型,不同业务没有匹配合适的模型和算力资源,就可能造成大量算力浪费。

企业需要摸清同样一份算力到底能够生产多少 Token。

(3)价值焦虑:Token 用了很多,但这笔账很难算清楚。

不同系统可能都有自己的 Token 看板,但缺少统一的运营视图。没有统一的计量计费机制,Token 也很难进入企业预算,更难把成本准确分摊到具体部门、应用和业务。

这三类焦虑表明,企业需要一套属于自己的 Token Factory (Token工厂),来支撑 AI 应用的规模化落地。

Token Factory,是把基础设施、模型、服务与运营,熔铸成一套生产系统,而不是又一个 AI 产品的拼盘。建 Token Factory 的目的,从来不是“多产 Token”,而是在对的成本、对的结果上,产出对的 Token。

它不只是提供算力,还要把资源管理、Token 生产、计量结算和持续运营纳入同一套体系,让企业能够统一管理算力、持续提升 Token 产能,并把 Token 的成本和价值算清楚。

每家企业的工厂形态可以各不相同,但核心能力应当一致——不是同样的形状,而是同样的能力。

02 FusionOne AI,开始管理Token

过去,AI 基础设施软件更多解决的是模型怎么部署、算力怎么调度。而超聚变的 FusionOne AI 企业级 Token Factory 解决方案,则进一步从模型服务走向 Token 生产运营。

FusionOne AI 是超聚变基于自身 Token Factory 001 号客户实践沉淀出来的企业级 Token 工厂解决方案。它遵循新的 AI 价值链——Watt 到 FLOPS,FLOPS 到 Token,Token 到业务价值。

用一套统一的平台把算力基础设施、模型服务与 Token 运营三层连接起来,从数据中心到桌面、再到边缘,最终让 Token 进入具体业务创造价值,让每个企业都能"从业务所在之处起步。

那么如何能将 Token "产得出、管得住、算得清"呢,FusionOne AI有如下六大能力:

(1)把企业内部原本分散的算力组织起来

生产系统不仅要比别人快,更要护得住关键业务——核心负载,永远排在第一位。

总部、分支机构、部门乃至个人终端可能使用不同类型的 AI 硬件。FusionOne AI 可以统一接入服务器和 AI 资源池,对异构算力进行池化和调度,并通过更细粒度的资源管理,让不同模型和业务按需获得算力。

它支持 75+ AI 异构卡,并通过 1% 细粒度池化、拓扑调度等方式提高资源利用率。

(2)用同一份算力生产更多有效 Token

FusionOne AI 加入了 Smart 系列推理优化能力。

一方面,通过 SmartDecoding、SmartKVSparse、SmartKVCache 等技术针对不同模型和推理场景进行加速。另一方面,通过 SmartQoS 对不同请求进行优先级和并发管理,避免超长上下文任务拖住整个系统,也让核心业务在高并发情况下获得更稳定的服务。

双Smart技术引擎的目标并非单纯追求跑分更高,重点是把优化转化为生产级 SLA,让同等算力能够产出更多有效 Token,同时保证核心负载永不排在后面。

借助Smart系列推理加速能力,超聚变给出的测试数据显示,部分场景下首字时延最高降低 90%、有效吞吐提升 30%,超长上下文性能提升 100%+。

(3)新模型 Day0 适配

还有一个企业很在意的点是推理引擎和模型迭代得太快。于是,FusionOne AI 加入了 ModelEver Day0,把新模型的获取、验证、镜像打包和部署尽量做成标准流程,让新模型发布后能更快进入生产环境。模型可以以周为单位更新,但企业的验证一步都不能省——“跟上变化”与“守住稳定”,是同一枚硬币的两面。

(4)从模型服务走向 Token 生产运营

在 TokenOps 的世界里,每一个 Token 都被计量、被管理、被优化。

计量解决“谁用了多少”的问题,通过覆盖 多个主流模型的全链路埋点,让 Token 消耗变得清晰可见。

治理解决“怎么避免失控”的问题,通过身份、配额隔离和超支预警,管理不同部门和用户的 Token 使用。

优化则进一步回答“这些 Token 花得值不值”,根据质量和成本进行模型路由,让不同任务调用更合适的模型。

(5)让 Agent 安全稳定进入企业流程

随着 Agent 真正进入企业业务,还需要考虑越权操作、数据泄露、上下文断片和执行过程不可见等风险。

FusionOne AI 提供 FusionXray Agent Infra ,支持 Harness 型 Agent、工作流型 Agent 和自定义 Agent 接入,并通过安全沙箱、全局观测、Agent 治理和智能记忆等能力,让 Agent 更安全、稳定地进入企业流程。

(6)让 Token Factory 更快落到业务里

除了基础设施和 Token 运营本身,FusionOne AI 还通过 AI Lab 和 FusionXplay 补齐生态落地环节。

其中,AI Lab 主要承担方案验证和调优,FusionXplay 则沉淀模型、Agent、Skill 以及 AI Coding、企业办公、行业 Agent 等方案资产,让经过验证的能力可以更快复用到具体业务中。

由此,FusionOne AI 把算力调度、模型服务、Token 运营、Agent 治理和生态落地串到了一起,形成一套完整的 Token Factory 生产运营体系。

03 超聚变FusionServer “无极”架构,升级Token Factory的中心算力底座

FusionOne AI 解决的是 Token 怎么生产、调度和运营。再往下一层,Token Factory 还需要一套稳定、高效的中心算力底座。

面向 Token 时代,服务器正在同时面对三方面变化:一是 GPU、LPU、Agentic CPU 等不同类型 xPU 快速涌现,异构计算越来越普遍;二是单芯片功耗、互联带宽持续提升,对供电、散热和互联能力提出更高要求;三是算力从数据中心不断向企业本地和边缘延伸,服务器需要适配更多形态和部署场景。

超聚变9月21日刚发布的全新的超聚变FusionServer “无极”架构(后文简称无极架构)即是为了应对变化而生的,或者说以不变应万变。

图片

无极架构并不是某一款具体服务器,而是一套面向下一代计算基础设施的服务器架构。

其核心思路,是通过三段式模块解耦、统一接口标准以及更广泛的异构兼容能力,降低不同计算平台、不同部件和不同产品形态之间的适配成本。同时,架构还采用全新独立 BMC 模块,并实现约 90% 部件共享,支持统一管理和一站式运维。

在此基础上,无极架构面向通用计算、AI 计算和存储三大场景展开,并强调效率、可靠、灵活和多样化四项核心价值。按照超聚变公布的数据,其目标能力包括内存带宽提升 167%、AI 推理性能提升 100%、全闪存储 IOPS 提升 100%。

为了支撑越来越高的芯片功耗和系统密度,无极架构还在散热、供电和互联三个底层方向进行了系统级升级。

而此次同步发布的超聚变FusionServer 2158H V9 和 FusionServer 2258H V9,正是无极架构下率先落地的两款全新FusionServer V9 通用计算服务器

图片

两款产品的定位有所不同。

FusionServer 2158H V9 是 2U 单路服务器,单路最高支持 256 核、600W,兼顾主流云化和通用计算场景,并支持 AMD Venice SP8 与 SP7 双平台灵活组合,更强调性能与 TCO 之间的平衡。

FusionServer 2258H V9 则面向更高强度的计算任务,采用 2U 双路设计,最高可提供 512 核、1024 线程,聚合内存带宽达到 1.6TB/s,重点面向 HPC 超算、Agentic AI智能体 和 Cloud 等场景。

除了核心数提升,V9 这一代还进一步补强了内存、存储和 I/O。

其中,AMD Venice SP7 平台整体性能与能效较上代提升超过 80%;FusionServer 2258H V9 是率先支持PCIe 6.0 E3.s NVMe的AMD双路服务器,单盘读速约14GB/s;在IO扩展方面,双路提供最多8个PCIe槽位(含2×PCIe 6.0 x16),为400G网络与下一代加速卡预留充足通道;在散热上实现单路与双路600W高功耗稳定承载,并预留液冷演进空间。

在 Token Factory 体系中,FusionServer V9 是中心侧的重要算力支点,与 GPU 加速算力形成互补,共同托举云化业务和智能体应用的算力需求。

04 TokenBox™,把Token Factory从数据中心搬进办公室

企业并不是所有 AI 请求都适合送往远端数据中心,像内部代码、知识库、研发资料、办公数据等内容,更强调本地处理和数据不出域。

而传统数据中心服务器需要机房、供电、散热和专业运维,较难直接搬进办公室。

因此,TokenBox™ 希望在数据中心服务器与传统工作站之间补上一层。

TokenBox™ 采用软硬一体设计,把算力、模型和应用一起交付,强调免机房、开箱即用、低噪音和本地部署。

其在主流业务负载下噪音可低至 35dB,并支持通过 Pack 方式扩展 GPU、CPU、内存和存储;单机最高可支持 1.6T 参数模型,同时支持新模型 Day0 适配和 Smart 推理加速。

图片

TokenBox™ 主要面向 AI Coding、全流程AI(OPC)和 Token运营服务等场景。比如,一个研发团队可以用它部署自己的代码模型和知识库。对于小型企业或 OPC,也可以承载从研发、客服到财务、行政等一系列 AI 工作流。同时,它还支持 Token 计量计费、模型选择和弹性扩展。据测算,相比主流大模型云 API,TokenBox™ 约 2.5~3 年可以回本。

TokenBox™ 的这些能力在探索者大会上被搬到了现场。

在"AI Coding"场景中,8 位数字员工按 9 个阶段完成需求拆解、设计、并行编码、真实部署与自动化测试,并在发现缺陷后自动修复、复测、验收,每一步交付的文件都在大屏右侧的成果面板中实时列出、可点开查看。

图片

在"AI 一人公司"场景中,一位总指挥同时派发六大业务工作流,50 位数字员工并发协作,右侧成果面板逐份累积六条产线的交付物,其中公众号工作流真实调用微信官方接口完成素材上传、草稿创建与发布。

整套平台基于本地部署的推理服务,支持流式输出、按角色配置模型与中英文切换。

图片

这也让 TokenBox™ 的定位更加直观,不只是单纯把一台服务器缩小,它把 Token Factory 的生产能力从数据中心进一步下沉到办公室和边缘场景,让企业能够在更靠近数据和业务的位置,本地生产和使用 Token。

05 超聚变以自身实践成为Token Factory的001号客户

一套 Token Factory 到底有没有用,最终还是要放进真实企业环境里验证。

超聚变选择先以身作则成为 Token Factory 的001号客户。在生产环境中打通“场景—Agent—Token—算力”的完整链路。

超聚变内部已经在研发场景下落地了49个AI智能体用例、约10款模型服务,日均 Token 消耗超过 300亿。

在AI Coding 场景,超聚变内部人均 E2E 代码产出率累计提升 44%,连续两年增长。除此之外,Token Factory 也已经进入硬件研发、投标、合同、报销、招聘等企业流程。

而上述这些数字,来自超聚变自己那座在真实生产中运转的 Token Factory。方案是经过一一验证后,才敢交付的。

Token Factory 真正跑起来之后,超聚变发现,买机器、部署平台、上线模型只是起点。

首先面临的是规划阶段的账怎么算。业务部门往往不知道自己到底会消耗多少 Token,更不知道需要多少算力。

超聚变因此做了场景化 Token 用量测算工具,根据并发人数、调用频率、输入输出长度估算 Token 需求;再结合不同模型和硬件的实测性能基线,反推出需要多少卡、多少台服务器,让预算和容量规划都有据可依。

到了建设和运行阶段,问题又变成算力怎么真正用起来。不同资源池之间需要统一调度,大模型要跨卡、跨节点运行,老旧算力也要尽可能继续发挥价值。

超聚变一方面通过多算力统一管理打破资源烟囱,用自研推理加速引擎优化路由、调度与KV Cache;另一方面自研AI网关,解决开源网关在稳定性、协议兼容和故障定位上的问题。

再往后,则是Token 怎么管、钱怎么算。

超聚变把不同部门、项目、模型和场景的 Token 消耗统一归集到一张全局看板,同时通过分级配额、实时熔断和超支预警控制预算;再用智能路由根据任务复杂度、成本和性能自动选择更合适的模型,避免改个错别字也调用最贵大模型。

最后还有一个持续治理的问题,模型越来越多、更新越来越快,怎么避免越用越乱?

一方面通过 Day0 能力让新模型发布后更快完成适配和上线;另一方面持续做模型治理,将重复版本和实例收敛,超聚变内部就将 40+ 模型版本精简到 10+ 精选模型目录,减少无效算力占用。

因此,001 号项目的价值,也在于将真实生产环境中暴露的问题沉淀成一套可复用的方法。

06 AI 基础设施的竞争,正在从“堆算力”走向“提高 Token 产能”

过去企业建设 AI 基础设施,最直观的衡量方式是服务器数量、GPU 数量和峰值算力。

但当 AI 真正进入 Coding、办公、客服、经营分析等生产场景后,企业则更关心这些算力到底能生产多少 Token,以及 Token 能不能被更高效地生产和使用。

因此,超聚变把算力基础设施、模型服务、Token 生产与 Token 运营放进同一套体系里。FusionOne AI 、FusionServer V9 和 TokenBox™分别从软件管理、中心算力和边缘场景切入,最终要解决的,其实还是文章开头那个问题:企业的 Token,到底能不能看得见、管得住、算得清。

智能,不再是企业“买来”的东西;真正赢得未来的,是那些把 Token 生产率与治理能力掌握在自己手中的企业。你的 Token Factory,始于你的业务所在之处——不用从数据中心开始,从你当下真实负载起步即可。

文章标签算力智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多