Token导航 LogoToken导航

中科曙光发布AI推理原生存储FN Neo

更新时间 2026-09-21来源 TechWeb正文 2742字阅读约 9分钟1 张图片

【TechWeb】9月21日消息,在2026年CCF全国信息存储技术学术会议上,中科曙光正式发布全新迭代升级的AI推理原生存储FN Neo。

实测数据显示,FN Neo单阵列带宽可达160GB/s、亚毫秒级时延,延迟表现、吞吐量和多请求并发数相比传统本地NVMe方案均有约2倍提升。这套方案实现模型首Token响应时间缩减73%,整体Token吞吐能力提升150%。

图片

在随后的媒体沟通会上,中科曙光集中式存储产品部总经理郭照斌围绕智能体时代KV Cache的落地、集中式存储在AI推理中的新价值、产品架构与实测表现,与媒体进行了深入交流。

智能体把KV Cache推上“核心数据资产”

郭照斌认为,智能体出现后,AI推理需求激增,推理占比持续走高。更关键的变化在于,智能体的作业方式从“单次命令”变成“连续任务”,由此带来持续、连续的上下文。上下文不断增长,KV Cache如果不卸载,GPU就会重复计算,成本非常高。

“像典型的AI Coding工程,上下文甚至达到上百兆量级。KV Cache如果不落地,即使算力再强,Token输出效率也会非常低。”郭照斌表示,这催生了KV Cache真正落地的核心需求。与此同时,推理过程中还有模型参数、容器环境、共享数据等需求,都对存储提出新要求。在存储成本上涨的背景下,用户需要同等算力、同等存储硬件下更具极致性价比的融合存储方案。

集中式存储不是“不适合”,而是被误解

行业内长期存在一种认知:集中式存储不适合AI推理,推理更依赖本地盘性能。郭照斌回应称,集中式存储的池化共享能力,早已在金融、通信等对稳定性要求严苛的关键业务中经过大规模验证。无论是大规模共享集群,还是中小规模算力集群,后端硬件框架本身往往并不被用户直接感知。

“服务器也好,双控阵列也好,在当前AI数据中心和AI存储里都占有一定比重,本来就是并行存在的,并不需要去纠正用户的使用习惯。”郭照斌说,集中式硬件叠加横向扩展、纵向扩展和协议处理能力,同样可以支撑超大规模集群。

一台存储直出SAN/NAS/KV三协议

FN Neo的定位,是用一套存储或一台存储,解决中小规模算力集群的本地化部署需求,同时兼顾未来扩展。郭照斌介绍,基础款为2U、25盘位双控阵列,搭载两颗国产高主频CPU,支持标准IB卡、NVMe网络,以及曙光基于IB协议自研的原生RDMA和RoCE协议。

产品具备四大核心能力:一是原生三协议一体化直出,在统一数据存储池基座上直接提供SAN、NAS和KV原生语义,协议栈最短,避免层层叠加带来的时延;二是高性能,单阵列25盘位可输出160GB/s带宽、300万综合业务IOPS;三是极致可靠性,继承FlashNexus系列集中式全闪能力;四是灵活扩展,控制器可扩展至1024个,支持数据中心级大规模推理应用。

郭照斌特别提到“超级隧道”技术。它一方面对CPU核心、内存、网络、硬盘等硬件资源做极致编排和隔离,避免热点和木桶效应;另一方面通过去除不可控操作系统、ByPass、自定义内存操作、协程、无锁原生语义和看板机制,解决软件竞争与排队问题。再叠加XNIO、XDIO零拷贝和三级负载均衡,用户只需定义一个卷,就能发挥整个阵列的极致性能。

原生KV语义:300ns内定位,兼容主流推理框架

在KV Cache实现上,FN Neo选择从存储直出原生KV语义。相比通过文件系统接口回读回写KV Cache,原生KV协议更极简,操作可控制在纳秒、亚毫秒级别。郭照斌介绍,产品通过高效空间管理机制,让元数据基本保持在缓存中,基于cache line检索加速,一次KV定位可在300ns以内完成。

同时,原生KV协议不仅适配曙光ParaCache组件,也可对接LMCache、HiCache,或作为Mooncake的KV后端。客户端为全用户态组件,对计算节点应用基本无感知。结合GPU对后端存储的GDR能力,类似GPU访问GDS,可实现GPU直通后端存储的极简快速访问。

实测:AI Coding场景Token输出效率提升约6倍

FN Neo单阵列带宽可达160GB/s、亚毫秒级时延,延迟、吞吐量和多请求并发数相比传统本地NVMe方案均有约2倍提升;方案实测首Token响应时间缩减73%,整体Token吞吐能力提升150%。

郭照斌还进一步披露了多组实测数据:单节点8卡计算节点测试DeepSeek R1模型,通过KV Cache卸载,可实现7-12倍不同上下文的性能提升;两个节点、每节点8卡的集群采用千问2.5模型,卸载与不卸载相比也有6-10倍提升。在AI Coding这类上下文持续增长、轮数多、对存储依赖最强的场景,Token输出效率相比完全不卸载可提升6倍以上。

共享能力还带来资源效率改善。郭照斌表示,使用共享NAS单卷可提供至少70GB/s文件协议访问能力,块协议单卷可达160GB/s,相比本地盘7—10GB/s的上限提升10倍以上。原先10个节点各存一份模型数据,可能浪费9份,共享后可只存一份。

开放与性价比:让中小企业先用起来

面向生产级AI业务,FN Neo提供99.999%高可靠运行保障,通过全局镜像缓存、RAID-OC、自动缩列修复、亚健康盘和慢盘自动隔离等机制,保障推理业务7×24小时不间断运行,并针对P99、P99.9等尾延迟敏感需求提供稳定可预测的低延迟。

生态方面,产品坚持“三重开放”:推理框架层面兼容vLLM、SGLang、LMCache、HiCache、Mooncake等主流框架;组网层面适配RoCE/IB/国产400G IB/FC/IP SAN,可同时服务“N卡+MLX IB”与“D卡+CIB”;操作系统层面兼容多种主流系统。郭照斌强调,产品不改内核态,提供纯轻量级用户态客户端组件,作为中间件连接存储与大模型,企业无需大规模改造现有推理环境。

郭照斌直言FN Neo“打的就是极致性价比”。分布式方案通常三个节点起,而FN Neo一台基础版即可满足核心KV Cache卸载诉求,同时原生直出NAS和块协议,覆盖推理过程中其他数据需求。对于私有化部署的中小规模算力企业,尤其是智能体推理和AI Coding场景,可先配一台存储跑起来,后续再横向或纵向扩展。典型场景如搭配曙光自研scaleX40超节点,10个计算节点、40卡规模,先配置一台FN Neo作为后端存储支撑。

郭照斌表示,当前FN Neo已经很好满足AI推理对存储的需求和能力,会成为用户比较好的选择方向。从“共享数据”到“共享KV Cache”,FN Neo将集中式存储的池化共享能力延伸至推理运行时缓存这一动态高频场景。它补齐了AI推理场景下集中式存储的能力拼图,也为Agent、长上下文大模型等业务的大规模落地,提供了一套经过工程验证的存力新选择。

文章标签算力应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多