Token导航 LogoToken导航TokenDH.com

华为开源昇腾NPU原生LLM推理系统,端到端吞吐最高提升95%!

更新时间 2026-07-17来源 智猩猩正文 2011字阅读约 7分钟6 张图片
智猩猩AI整理
编辑:BugMaker
LLM在自然语言处理和计算机视觉等领域广泛应用,但伴随巨大的计算成本和延迟。
即随着模型规模扩大和输入序列变长,不可预测的输入输出长度加剧了工作负载的可变性,使得在AI加速器上保持高效运行极为困难。
由此,华为团队联合清华大学等研究团队开源了面向华为昇腾(Ascend)NPU 的生产级推理系统XY-Serve。

XY-Serve提出了一种端到端生产级推理系统,通过将动态计算分解为硬件友好的元原语,在保持与vLLM生态兼容的同时,实现了高达95%的端到端吞吐量提升,Linear内核平均提速14.6%,Attention内核平均提速21.5%。

就在今年3月,这篇名为《XY-Serve: End-to-End Versatile Production Serving for Dynamic LLM Workloads》的重磅论文,成功斩获了计算机体系结构领域的顶会 ASPLOS'26 录用荣誉,并在美国匹兹堡正式发表。
图片
  • 论文标题:

     XY-Serve: End-to-End Versatile Production Serving for Dynamic LLM Workloads

  • 论文链接:

     https://doi.org/10.1145/3760250.3762228 

  • 代码链接:

     https://gitee.com/openeuler/GVirt/tree/master/xlite

01

动态LLM推理的挑战 

LLM推理通常包含预填充和解码两个阶段。

在预填充阶段,模型处理用户输入以生成初始 token,并同时缓存键值(K/V)数据供后续使用。

解码阶段则以自回归方式生成token。不可预测且变化的输入输出token长度,使得在线推理效率面临挑战。

图片

在生产系统中,关键挑战在于如何在缺乏友好SIMT编程模型的AI加速器上高效集成所有这些优化。

动态性对LLM计算构成重大挑战,特别是在Linear和Attention模块中。

输入长度的不确定性导致矩阵形状任意,使得优化变得复杂。

图片

在SIMT架构中,硬件可以自动重组或停用未使用的线程,在基于块的架构中,对处理不规则数据模式的解决方案涉及复杂的填充或掩码操作,导致额外开销。

02

XY-Serve的核心架构与机制  

为应对上述挑战,XY-Serve 采用 token 级调度机制,并通过三个核心组件处理任务:任务分解、任务重排与元内核(Meta Kernels,含 Meta-Attention 与 SmoothGEMM)。

图片

一、 基于Token的调度与任务分解

当请求进入系统,首先通过自动前缀缓存模块匹配现有提示,实现token级重用。未匹配的token加入调度队列。

系统提出动态分解机制,将动态工作负载转换为硬件友好的、基于块的计算单元。

二、 任务重排机制

分解后需要重排这些块单元并生成任务表,以提升性能。

对于Attention模块,计算负载定义为面积,块根据计算负载从大到小排序,随后以对称轮询方式分配给AI核心。

这种机制确保跨AI核心的平衡计算,最大化硬件利用率。

对于Linear模块,任务重排是提高L2缓存局部性和缓解bank冲突的有效方法。

三、 Meta-Attention与SmoothGEMM优化

图片

对于Attention模块,系统提出元内核来高效并行计算GEMM-Softmax-GEMM模式,无需区分其P/D/V阶段来源。

对于Linear模块,系统设计并实现了一组具有固定块大小的高效元内核。

为动态处理任意输入形状,采用片上内存级别的虚拟填充,结合选择性HBM读写,不引入实际填充开销。

03

实验评估与性能表现 

在评估部分,XY-Serve展示了卓越的性能指标。

Attention内核在所有生产工作负载中实现更高效率,平均比当前SOTA实现高出21.5%。

Linear内核不仅支持任意矩阵形状,而且比现有基线平均提速14.6%。

图片

在端到端评估中,XY-Serve在公开数据集上比Ascend-vLLM实现了高达89%的提升,在内部行业工作负载上实现了95%的提升。

在固定QPS测试中,XY-Serve在各类工作负载下实现了高达79%的QPS提升,平均TTFT降低64%,平均TBT延迟降低57%。

启用动态调度优化后,QPS进一步提升高达89%,平均TBT延迟降低69%。

此外,团队将 Meta-Attention 与 SmoothGEMM 迁移至 GPU 平台验证通用性。

Meta-Attention 在 coding 与 conversation 场景分别平均降低延迟 11% 与 15%,SmoothGEMM 平均提升硬件利用率 18%。

04

结论与展望 

XY-Serve作为端到端生产服务系统,旨在解决动态LLM工作负载的挑战。

它集成了任务分解、任务重排和元内核。凭借其处理各种动态工作负载的灵活性,XY-Serve为生产级LLM推理系统的效率和适应性设定了全新基准。

该研究不仅解决了现有痛点,也为未来AI加速器上的推理系统优化指明了方向。

文章标签模型发布开源芯片大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多