Token导航 LogoToken导航

Qwen刘大一恒提出PID-Ba稀疏MoE负载均衡方法

更新时间 2026-10-08来源 智猩猩正文 3492字阅读约 11分钟8 张图片

智猩猩AI整理

编辑:林夕

MoE的专家越来越多,但每个Token实际激活的专家却越来越少。

这让模型获得更大参数规模的同时,也把一个老问题推到了更极端的场景:专家负载怎么均衡?

9月30日,Qwen团队研究者刘大一恒(Dayiheng Liu)等人提交了一篇新论文 《ID Balancing: Stable Training of Extremely Sparse MoE via PID-Based Load Control》,提出了一种新的MoE负载控制方法——ID Balancing。

图片

这套方法把MoE的专家负载问题,与经典控制理论中的PID控制联系起来。

论文在768个专家的极稀疏MoE设置下进行了实验。当路由从Top-10进一步变成Top-5、Top-3时,ID Balancing依然能够保持较稳定的专家负载。

在Top-3-of-768设置下,ID Balancing将最差情况下的 MaxVio降低超过50%,训练过程中平均的 MinVio降低超过12%,同时保持了具有竞争力的语言模型和下游任务表现。

01

ID Balancing,

到底怎么给专家负载做控制?

MoE的核心机制,是把不同Token分配给不同专家。

假设模型拥有768个专家,一个Token并不需要让全部专家参与计算,而是通过Router选择Top-K个专家。

这样可以在保持超大参数规模的同时,把每个Token的实际计算量控制在较低水平。

但随着专家数量增加、Top-K降低,专家之间的负载差距也会越来越明显。

有些专家可能收到大量Token,成为训练中的热门专家;另一些专家则长期处于低负载状态。

过去比较常见的办法,是增加辅助负载均衡损失,让Router尽量把Token平均分配给不同专家。

但这类方法也存在一个问题:负载均衡本身是一个随着训练不断变化的动态过程,固定的辅助目标未必能够很好地适应不同训练阶段。

因此,近年来也出现了不依赖辅助损失的方案。

论文重点分析了两种代表性方法:DeepSeek的Loss-Free方法,以及Kimi K3中的Quantile Balancing。

团队发现,这两种方法实际上都可以放进一个不完整的PID控制框架中理解。

DeepSeek Loss-Free更接近一个固定步长的积分控制器,而Quantile Balancing则可以看作一种广义比例控制器。

在此基础上,论文提出ID Balancing,也就是Integral-Derivative Balancing。

它加入了积分项和微分项。

  • 积分项负责根据当前的负载误差进行持续修正,而且误差越大,调整幅度越大。

  • 微分项则关注负载误差的变化趋势:如果当前的失衡正在进一步恶化,就提前加大修正力度;如果负载已经趋于稳定,则减少额外干预。

简单理解,就是让Router不仅知道现在谁太忙,还知道谁正在越来越忙。

论文首先验证了积分项的作用。

在18.9B模型、Top-3-of-768路由、120B Token的训练设置下,团队将幅度感知的积分控制与DeepSeek Loss-Free方法进行比较。

结果表明,如果积分更新幅度能够随着负载误差大小变化,就能更有效地降低训练早期的专家过载,同时减少部分专家持续处于低负载的情况。

图片

进一步的消融实验也表明,积分增益 (K_i) 会直接影响负载控制效果。

但仅仅知道当前差多少还不够。

如果某个专家当前已经超载,而且超载程度还在快速增加,系统需要更早进行干预。

这正是微分项发挥作用的地方,团队比较了加入微分项前后的训练过程。

结果显示,加入微分控制后,可以进一步降低早期专家过载,同时减少Token向少数热门专家集中的情况。

图片


因此,ID Balancing最终形成了一套比较清晰的控制机制:积分项负责持续纠偏,微分项负责抑制正在扩大的失衡。


这也是这篇论文和此前无辅助损失方法相比,一个比较核心的区别。

02

768个专家,

Top-3路由依然能稳住

方法提出之后,真正需要验证的问题是:当专家数量达到768个,每个Token只选择其中3个专家时,这套方法还能不能真正控制住负载?

论文给出的结果比较明确。

团队首先在18.9B模型上进行实验,固定使用768个专家,并分别测试Top-10、Top-5和Top-3三种路由方式,训练数据规模为120B Token。

图片


Figure 1实际上同时回答了两个问题。

在图1(a)和图1(b)中,团队比较了Top-10、Top-5、Top-3-of-768三种设置下的负载情况。

其中,MaxVio用于衡量最严重的专家过载程度,MinVio则反映专家欠载情况。

随着Top-K从10降低到5,再降低到3,路由越来越稀疏,但ID Balancing依然保持了较稳定的负载控制。

尤其是在最极端的Top-3-of-768设置下,它仍然明显优于其他方法。

图1(c)则进一步把模型规模扩大。

团队将总参数量从18.9B增加到69.9B,激活参数规模从约1.03B增加到3.2B,同时固定使用Top-10-of-768路由。

随着模型不断扩大,ID Balancing的最坏Backbone MaxVio基本没有明显恶化。

相比辅助损失方法,其最坏负载偏差降低了约89.6%。

图片


从具体数字来看,Top-3-of-768设置下,ID Balancing的Worst Backbone MaxVio为15.33。

相比之下,Quantile Balancing为31.11,DeepSeek Loss-Free达到211.19。

在平均欠载指标上,ID Balancing的Avg. MinVio为0.5480,也低于辅助损失方法的0.6232、DeepSeek Loss-Free的0.7441以及Quantile Balancing的0.6373。

与此同时,语言建模损失并没有因为负载控制而明显恶化。Top-3设置下,ID Balancing的LM loss为1.7426。

图片


论文还进一步测试了MMLU、MMLU-Pro、SuperGPQA、MATH、GSM8K、BBH、MMMLU、EvalPlus、MultiPL-E等下游任务。

整体结果显示,ID Balancing在负载控制方面取得明显优势的同时,下游任务表现仍然具有竞争力。

团队还观察了训练过程中的动态变化。

图片


在18.9B模型、Top-3-of-768路由下,Figure 2进一步比较了训练过程中的MaxVio和MinVio。

ID Balancing能够降低训练过程中出现的瞬时专家过载,同时减少部分专家长期处于低负载的情况。

图片


团队还测试了更高学习率等不同训练条件。

在这些设置下,ID Balancing依然保持了较好的负载控制能力,说明这套机制并不只依赖某一种固定训练配置。

从这些实验可以看到,ID Balancing的优势随着MoE稀疏程度增加而更加明显。

这也正是它最有价值的地方。

因为当768个专家中每个Token只选择3个专家时,Router犯下的任何一次偏差,都更容易被放大。

热门专家不断吸收更多Token,冷门专家则可能越来越难获得训练信号。

ID Balancing通过持续反馈,让这种偏差在训练过程中不断被纠正。

03

Qwen对MoE负载均衡

的研究还在继续

事实上,负载均衡并不是Qwen团队第一次研究的问题。

此前,Qwen团队就曾提出 Global Load Balancing,尝试从更大的全局范围处理MoE中的专家负载分配。

传统的局部负载均衡方式,虽然能够让不同专家之间的Token数量更加接近,但也可能限制专家逐渐形成自己的专业化能力。

Global Load Balancing则希望在更大的范围内进行负载管理,在计算效率与专家专业化之间取得更好的平衡。

这次ID Balancing关注的则是另一个层面:

当MoE已经极度稀疏,专家数量进一步增加之后,怎样让这个庞大的路由系统本身保持稳定。


从这个角度看,两项工作关注的问题并不完全相同。

一个更强调全局范围内的负载分配,一个则进一步把专家负载视作动态系统进行控制。

而这背后其实指向了同一个趋势:MoE正在从增加专家走向管理越来越多的专家。

未来的大模型可能拥有更多专家、更大的参数规模,以及更低的激活比例。

到了那个阶段,如何设计路由器、如何控制专家负载、如何避免热门专家成为瓶颈,都会直接影响MoE模型能否继续向更大规模扩展。

这也是ID Balancing这项工作的意义所在。

它没有改变MoE最基本的稀疏计算范式,而是从一个看似基础、却越来越重要的问题入手——让大量专家在极稀疏条件下更稳定地工作。


对于正在不断扩大的MoE模型来说,专家数量可以继续增加,但如何让这些专家真正被高效利用,可能才是下一阶段更值得解决的问题。

文章标签Qwen阿里云大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多