XY-Serve提出了一种端到端生产级推理系统,通过将动态计算分解为硬件友好的元原语,在保持与vLLM生态兼容的同时,实现了高达95%的端到端吞吐量提升,Linear内核平均提速14.6%,Attention内核平均提速21.5%。

论文标题:
XY-Serve: End-to-End Versatile Production Serving for Dynamic LLM Workloads
论文链接:
https://doi.org/10.1145/3760250.3762228
代码链接:
https://gitee.com/openeuler/GVirt/tree/master/xlite
01
动态LLM推理的挑战
LLM推理通常包含预填充和解码两个阶段。
在预填充阶段,模型处理用户输入以生成初始 token,并同时缓存键值(K/V)数据供后续使用。
解码阶段则以自回归方式生成token。不可预测且变化的输入输出token长度,使得在线推理效率面临挑战。

在生产系统中,关键挑战在于如何在缺乏友好SIMT编程模型的AI加速器上高效集成所有这些优化。
动态性对LLM计算构成重大挑战,特别是在Linear和Attention模块中。
输入长度的不确定性导致矩阵形状任意,使得优化变得复杂。

在SIMT架构中,硬件可以自动重组或停用未使用的线程,在基于块的架构中,对处理不规则数据模式的解决方案涉及复杂的填充或掩码操作,导致额外开销。
02
XY-Serve的核心架构与机制
为应对上述挑战,XY-Serve 采用 token 级调度机制,并通过三个核心组件处理任务:任务分解、任务重排与元内核(Meta Kernels,含 Meta-Attention 与 SmoothGEMM)。

一、 基于Token的调度与任务分解
当请求进入系统,首先通过自动前缀缓存模块匹配现有提示,实现token级重用。未匹配的token加入调度队列。
系统提出动态分解机制,将动态工作负载转换为硬件友好的、基于块的计算单元。
二、 任务重排机制
分解后需要重排这些块单元并生成任务表,以提升性能。
对于Attention模块,计算负载定义为面积,块根据计算负载从大到小排序,随后以对称轮询方式分配给AI核心。
这种机制确保跨AI核心的平衡计算,最大化硬件利用率。
对于Linear模块,任务重排是提高L2缓存局部性和缓解bank冲突的有效方法。
三、 Meta-Attention与SmoothGEMM优化

对于Attention模块,系统提出元内核来高效并行计算GEMM-Softmax-GEMM模式,无需区分其P/D/V阶段来源。
对于Linear模块,系统设计并实现了一组具有固定块大小的高效元内核。
为动态处理任意输入形状,采用片上内存级别的虚拟填充,结合选择性HBM读写,不引入实际填充开销。
03
实验评估与性能表现
在评估部分,XY-Serve展示了卓越的性能指标。
Attention内核在所有生产工作负载中实现更高效率,平均比当前SOTA实现高出21.5%。
Linear内核不仅支持任意矩阵形状,而且比现有基线平均提速14.6%。

在端到端评估中,XY-Serve在公开数据集上比Ascend-vLLM实现了高达89%的提升,在内部行业工作负载上实现了95%的提升。
在固定QPS测试中,XY-Serve在各类工作负载下实现了高达79%的QPS提升,平均TTFT降低64%,平均TBT延迟降低57%。
启用动态调度优化后,QPS进一步提升高达89%,平均TBT延迟降低69%。
此外,团队将 Meta-Attention 与 SmoothGEMM 迁移至 GPU 平台验证通用性。
Meta-Attention 在 coding 与 conversation 场景分别平均降低延迟 11% 与 15%,SmoothGEMM 平均提升硬件利用率 18%。
04
结论与展望
XY-Serve作为端到端生产服务系统,旨在解决动态LLM工作负载的挑战。
它集成了任务分解、任务重排和元内核。凭借其处理各种动态工作负载的灵活性,XY-Serve为生产级LLM推理系统的效率和适应性设定了全新基准。
该研究不仅解决了现有痛点,也为未来AI加速器上的推理系统优化指明了方向。






