Token导航 LogoToken导航TokenDH.com

ACL 2026 | 计算开销下降49%!腾讯混元提出生成式奖励建模框架,告别全量CoT冗余

更新时间 2026-06-15来源 智猩猩正文 4306字阅读约 14分钟18 张图片

腾讯混元投稿

智猩猩AI整理

生成式奖励模型(GRM)依托思维链(CoT)提升大模型评估能力,但现有方案存在两大痛点:

(1)效率低下:对所有输入强制执行完整CoT推理,简单问题也消耗大量算力;

(2)评估不准:依靠多数投票筛选推理结果,无法区分 “逻辑严谨的正确答案” 与 “瞎猜蒙对的答案”。

腾讯混元联合新南威尔士大学等机构在ACL 2026提出一种基于模型内部不确定性的高效生成式奖励建模框架E-GRM,用两套核心方案同时解决效率与精度问题:通过模型多次采样的共识度,仅对复杂问题启动CoT推理;依靠轻量化判别式评分器替代投票,精准筛选优质推理链。


在MATH数据集上,这套动态触发机制可跳过58%的完整推理链,同时将整体准确率从 75.1% 提升至 78.4%。在多类推理基准测试中,E-GRM不仅大幅降低推理算力与延迟,还持续提升答案准确率,兼顾效率与效果。
图片
  • 论文题目: Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty

  • 论文链接: https://arxiv.org/abs/2604.10072

01

动态CoT触发:

用共识度判断推理必要性

CoT推理算力开销大,标准CoT-GRM在MATH数据集上单次推理延迟3.6秒、算力23.7T FLOPs,难以落地高吞吐场景。

E-GRM核心思路:利用模型多次并行解码的输出一致性判断问题难度。

一、核心逻辑

E-GRM在动态触发环节引入了一个关键洞察:对于同一个输入,模型的多次解码行为直接反映了其对问题的把握程度。
如果多次采样(每次采用略微不同的解码参数如温度、top-p值)都收敛到同一个答案,说明模型对这个问题的认知很确定——无需完整推理。
反之,如果多次采样的答案分歧严重,说明问题确实需要深入思考。
图片
图1 E-GRM框架的多领域应用全景,展示了动态推理触发与精细评分的协同架构。
二、数学表达
对输入x执行M次并行解码得到响应集合,计算答案层面的共识度,
图片
共识度的计算发生在答案层面,因此不依赖对推理过程的建模,计算开销极低。从理论上看,共识度可以视为对条件响应分布熵的近似:
图片

其中,共识度高对应较低熵,表示模型输出更加确定;共识度低则对应较高熵,说明模型在多个候选答案之间存在分歧。

与直接估计熵不同,共识度仅基于离散答案的出现频率统计,无需显式建模完整概率分布,因此在计算上更高效,适合在推理阶段进行轻量级不确定性估计与路由决策。

三、 路由逻辑


基于共识度,进行二元路由,


(1)短路径(共识度≥0.8,占58%):直接输出最高频答案,完整跳过CoT(2)长路径(共识度<0.8,占42%):触发完整的逐步推理生成。

四、路由决策的统计稳定性


一个关键问题在于:在仅进行次并行解码的情况下,共识度估计是否足够稳定,从而支撑可靠的路由决策。

从统计角度看,共识度作为基于采样频率的估计量,其误差随采样次数的增加而减小,但同时也带来额外计算开销。因此,E-GRM在效率与稳定性之间选择了 作为默认配置。

理论分析表明,在二元近似假设下,共识度的标准误可以表示为:

图片

在该设置下,简单样本被误判为复杂样本的假阳性率可控制在约3%以内。

进一步实验显示,当 增大至10时,标准误下降至约0.13,但由于并行解码成本线性增加,整体收益呈现明显的边际递减趋势。因此,在实际系统中实现了较优的“精度—开销”平衡。

表1:MATH上不同路由策略的效率-精度对比
图片

五、阈值敏感性与鲁棒性


研究者进一步对路由阈值 的选择进行了系统分析,以评估动态推理机制的稳定性与可部署性。

(1)当阈值较高()时,大量样本被分配至长路径,短路径比例下降至30%以下,导致效率优势显著削弱;

(2)当阈值较低()时,部分本应进入长链推理的复杂样本被误分至短路径,从而引起整体准确率下降。

在 区间内,E-GRM表现出稳定的效率与精度折中,说明该方法对阈值选择具有较强鲁棒性。


六、 与其他自适应方法的对比

E-GRM的动态触发与几种相关方法有本质区别:

(1)vs. 早停(Early Exit),早停在单次前向传播中逐层判断是否提前退出,E-GRM在完整的解码过程后通过多次采样的共识进行判断。前者利用的是层级的中间表示,后者利用的是输出层面的全局一致性。

(2)vs. 自适应CoT(AdaCoT等),这些方法基于问题长度、关键词、困惑度等特征判断推理深度,需要领域知识和人工调参。E-GRM完全不需要任何人工设计特征。


02

判别式评分:

替代投票的精细评估

传统投票机制只看最终答案,忽略推理过程优劣。E-GRM为长路径样本设计了判别式评分器,输入问题与推理链,输出连续质量分数,实现细粒度排序。

一、评分器模块
为了从多条候选推理链中选出质量最高的结果,E-GRM引入了判别式评分器。
该模块接收原始问题和候选推理链作为输入,输出一个连续质量分数,用于衡量推理过程的正确性、逻辑性和可靠性。
相比传统多数投票只能判断“哪个答案出现次数更多”,评分器能够对不同推理链进行细粒度质量评估,从而更准确地识别最佳推理路径。
二、混合损失训练
评分器训练的核心在于混合损失函数:
图片
两个分量的分工明确,
(1)Huber损失:负责回归任务,让预测分尽可能准确。它处理异常值的能力来自其分段定义:小误差区为二次型(像MSE),大误差区退化为线性(像MAE)。
(2)铰链损失:负责排序任务,给定一对正负样本,强制正样本得分至少高出ϵ。若差距不足,产生惩罚梯度。
混合损失使评分器既能有准确的绝对评分,又能进行可靠的相对排序。
三、 评分器在训练中的双重角色
评分器不仅在推理阶段用于选优,在训练阶段也是扩展GRPO的核心部件。在奖励函数中,正负样本的评分器差值直接作为优化信号——差值越大,优化梯度越强。
图片
 图2 E-GRM完整管道,包含训练(SFT和GRPO)和推理(动态路由+评分选优)两个阶段。

03

训练机制:从数据划分到策略优化

一、SFT阶段
在监督微调(SFT)阶段,E-GRM延续了推理阶段的动态触发思想,首先利用共识度判断样本是否需要深度推理,并据此将训练数据自动划分为短路径样本长路径样本两类。
(1)对于短路径样本,模型直接学习从问题到答案的映射关系,优化目标为:
图片
(2)对于长路径样本,模型则需要先生成推理过程再给出最终答案,优化目标为:
图片
通过这种“双轨训练”机制,模型能够在训练阶段同时学习直接作答链式推理两种能力,为后续根据问题难度动态选择推理路径奠定基础。
最终,模型不再对所有问题一视同仁,而是学会在简单任务上快速响应、在复杂任务上展开深度推理。
二、扩展GRPO阶段
在偏好优化阶段,E-GRM扩展了标准GRPO。其配对奖励函数包含两个信号:
图片
第一项确保正确性(正样本答案必须匹配真实标签),第二项利用评分器差值提供质量梯度。整体优化目标为:
图片
图片
 图3 Coupled-GRPO通过成对对比信号驱动策略优化的机制。

三、扩展GRPO的β超参数分析

在扩展GRPO中,超参数 决定了奖励函数中“答案正确性约束”与“评分器对比信号”的相对权重。

(1)当  较低(<0.3)时,模型更依赖评分器信号,可能忽略答案正确性的硬约束,从而倾向生成“推理质量高但答案不一定正确”的结果;

(2)当 较高(>0.7)时,评分器信号作用被削弱,训练目标退化为接近标准GRPO,仅依赖答案监督。

实验结果表明,当 时,扩展GRPO整体性能优于标准GRPO,其中 达到最佳效果。同时,KL散度系数 在稳定策略更新与保持适度探索之间取得了良好平衡。

02

实验结果与分析

为验证E-GRM在奖励建模质量与推理效率上的有效性,实验在RM-Bench、RMB和RewardBench三项主流基准上进行了全面评测,并进一步通过效率测试与消融实验分析各模块贡献。


一、 基准测试表现


(1)RM-Bench跨领域泛化表现


在RM-Bench上取得79.2%平均得分,在Chat、Math、Code和Safety等多个领域均达到领先水平,展现出较强的跨领域泛化能力。

从7B到32B的性能提升规律显示:模型规模越大,E-GRM的效率优势越明显。32B相对7B在效率指标上的提升幅度显著大于在精度上的提升幅度。
表2 RM-Bench——跨领域泛化评估
图片


(2)RMB基准测试

在RMB基准测试中,E-GRM在帮助性(Helpfulness)无害性(Harmlessness)两项核心对齐指标上均表现优异。


其中,Qwen-Instruct-32B版本取得0.743的总体得分,超越GPT-4o(0.738),达到测试集最佳水平。尤其在无害性维度上,其BoN和Pairwise指标分别达到0.6960.823,均位居榜首。

表3 RMB——帮助性与无害性

图片

(3)RewardBench基准测试

在RewardBench基准测试中,E-GRM展现出领先的综合对齐能力。基于Qwen-Instruct-32B构建的E-GRM取得91.5%的总体得分,超过GPT-4o(86.7%)、DeepSeek-GRM-27B(86.0%)等强基线。

表4 RewardBench——综合对齐能力

图片

二、效率数据

在MATH数据集上,E-GRM展现出显著的效率优势:

58%的样本无需进入长链推理阶段,可直接通过短路径完成求解;平均推理延迟由3.8秒降至2.2秒,降低约42%;计算开销由23.7T FLOPs降至15.7T FLOPs,减少约49%;与此同时,准确率还从75.1%提升至78.4%(+3.3个百分点)。

三、消融验证

在MATH数据集上,完整E-GRM取得最高准确率78.4%。

(1)移除动态CoT触发后,FLOPs增加49%、延迟增加55%,说明该模块是效率提升的关键;

(2)移除判别式评分器后,准确率下降5.6个百分点,成为性能损失最大的单项消融;

(3)两者同时移除时,模型准确率进一步降至69.1%。

表5 MATH消融实验

图片

在保持动态推理与评分机制不变的情况下,引入扩展版GRPO后,模型在MATH、HelpSteer2和RMB等指标上均获得稳定提升。

表6 GRPO策略消融

图片

03

总结

E-GRM提出了一种基于模型内部不确定性的动态推理框架,通过共识度驱动的路由机制实现“按需推理”,并结合混合损失评分器对候选推理链进行精细化选择,从而构建统一的端到端生成式奖励建模系统。

总体来看,E-GRM的核心价值在于将模型内部信号转化为计算资源调度依据,使推理过程从“统一计算”走向“自适应分配”。

这一范式为生成式奖励模型与高效推理系统设计提供了新的思路,也表明未来AI系统优化的关键不在于“更强推理”,而在于“更智能的推理决策”。

文章标签混元腾讯学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多