腾讯混元投稿
智猩猩AI整理
生成式奖励模型(GRM)依托思维链(CoT)提升大模型评估能力,但现有方案存在两大痛点:
(1)效率低下:对所有输入强制执行完整CoT推理,简单问题也消耗大量算力;
(2)评估不准:依靠多数投票筛选推理结果,无法区分 “逻辑严谨的正确答案” 与 “瞎猜蒙对的答案”。
腾讯混元联合新南威尔士大学等机构在ACL 2026提出一种基于模型内部不确定性的高效生成式奖励建模框架E-GRM,用两套核心方案同时解决效率与精度问题:通过模型多次采样的共识度,仅对复杂问题启动CoT推理;依靠轻量化判别式评分器替代投票,精准筛选优质推理链。
在MATH数据集上,这套动态触发机制可跳过58%的完整推理链,同时将整体准确率从 75.1% 提升至 78.4%。在多类推理基准测试中,E-GRM不仅大幅降低推理算力与延迟,还持续提升答案准确率,兼顾效率与效果。

论文题目: Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
论文链接: https://arxiv.org/abs/2604.10072
01
动态CoT触发:
用共识度判断推理必要性
CoT推理算力开销大,标准CoT-GRM在MATH数据集上单次推理延迟3.6秒、算力23.7T FLOPs,难以落地高吞吐场景。
E-GRM核心思路:利用模型多次并行解码的输出一致性判断问题难度。
一、核心逻辑



其中,共识度高对应较低熵,表示模型输出更加确定;共识度低则对应较高熵,说明模型在多个候选答案之间存在分歧。
与直接估计熵不同,共识度仅基于离散答案的出现频率统计,无需显式建模完整概率分布,因此在计算上更高效,适合在推理阶段进行轻量级不确定性估计与路由决策。
三、 路由逻辑
基于共识度,进行二元路由,
(1)短路径(共识度≥0.8,占58%):直接输出最高频答案,完整跳过CoT(2)长路径(共识度<0.8,占42%):触发完整的逐步推理生成。
四、路由决策的统计稳定性
一个关键问题在于:在仅进行次并行解码的情况下,共识度估计是否足够稳定,从而支撑可靠的路由决策。
从统计角度看,共识度作为基于采样频率的估计量,其误差随采样次数的增加而减小,但同时也带来额外计算开销。因此,E-GRM在效率与稳定性之间选择了 作为默认配置。
理论分析表明,在二元近似假设下,共识度的标准误可以表示为:

在该设置下,简单样本被误判为复杂样本的假阳性率可控制在约3%以内。
进一步实验显示,当 增大至10时,标准误下降至约0.13,但由于并行解码成本线性增加,整体收益呈现明显的边际递减趋势。因此,在实际系统中实现了较优的“精度—开销”平衡。

五、阈值敏感性与鲁棒性
研究者进一步对路由阈值 的选择进行了系统分析,以评估动态推理机制的稳定性与可部署性。
(1)当阈值较高()时,大量样本被分配至长路径,短路径比例下降至30%以下,导致效率优势显著削弱;
(2)当阈值较低()时,部分本应进入长链推理的复杂样本被误分至短路径,从而引起整体准确率下降。
在 区间内,E-GRM表现出稳定的效率与精度折中,说明该方法对阈值选择具有较强鲁棒性。
六、 与其他自适应方法的对比
E-GRM的动态触发与几种相关方法有本质区别:
(1)vs. 早停(Early Exit),早停在单次前向传播中逐层判断是否提前退出,E-GRM在完整的解码过程后通过多次采样的共识进行判断。前者利用的是层级的中间表示,后者利用的是输出层面的全局一致性。
(2)vs. 自适应CoT(AdaCoT等),这些方法基于问题长度、关键词、困惑度等特征判断推理深度,需要领域知识和人工调参。E-GRM完全不需要任何人工设计特征。
02
判别式评分:
传统投票机制只看最终答案,忽略推理过程优劣。E-GRM为长路径样本设计了判别式评分器,输入问题与推理链,输出连续质量分数,实现细粒度排序。


03
训练机制:从数据划分到策略优化





三、扩展GRPO的β超参数分析
在扩展GRPO中,超参数 决定了奖励函数中“答案正确性约束”与“评分器对比信号”的相对权重。
(1)当 较低(<0.3)时,模型更依赖评分器信号,可能忽略答案正确性的硬约束,从而倾向生成“推理质量高但答案不一定正确”的结果;
(2)当 较高(>0.7)时,评分器信号作用被削弱,训练目标退化为接近标准GRPO,仅依赖答案监督。
实验结果表明,当 时,扩展GRPO整体性能优于标准GRPO,其中 达到最佳效果。同时,KL散度系数 在稳定策略更新与保持适度探索之间取得了良好平衡。
02
实验结果与分析
为验证E-GRM在奖励建模质量与推理效率上的有效性,实验在RM-Bench、RMB和RewardBench三项主流基准上进行了全面评测,并进一步通过效率测试与消融实验分析各模块贡献。
一、 基准测试表现
(1)RM-Bench跨领域泛化表现
在RM-Bench上取得79.2%平均得分,在Chat、Math、Code和Safety等多个领域均达到领先水平,展现出较强的跨领域泛化能力。

(2)RMB基准测试
在RMB基准测试中,E-GRM在帮助性(Helpfulness)与无害性(Harmlessness)两项核心对齐指标上均表现优异。
其中,Qwen-Instruct-32B版本取得0.743的总体得分,超越GPT-4o(0.738),达到测试集最佳水平。尤其在无害性维度上,其BoN和Pairwise指标分别达到0.696和0.823,均位居榜首。
表3 RMB——帮助性与无害性

(3)RewardBench基准测试
在RewardBench基准测试中,E-GRM展现出领先的综合对齐能力。基于Qwen-Instruct-32B构建的E-GRM取得91.5%的总体得分,超过GPT-4o(86.7%)、DeepSeek-GRM-27B(86.0%)等强基线。
表4 RewardBench——综合对齐能力

二、效率数据
在MATH数据集上,E-GRM展现出显著的效率优势:
约58%的样本无需进入长链推理阶段,可直接通过短路径完成求解;平均推理延迟由3.8秒降至2.2秒,降低约42%;计算开销由23.7T FLOPs降至15.7T FLOPs,减少约49%;与此同时,准确率还从75.1%提升至78.4%(+3.3个百分点)。
三、消融验证
在MATH数据集上,完整E-GRM取得最高准确率78.4%。
(1)移除动态CoT触发后,FLOPs增加49%、延迟增加55%,说明该模块是效率提升的关键;
(2)移除判别式评分器后,准确率下降5.6个百分点,成为性能损失最大的单项消融;
(3)两者同时移除时,模型准确率进一步降至69.1%。
表5 MATH消融实验

在保持动态推理与评分机制不变的情况下,引入扩展版GRPO后,模型在MATH、HelpSteer2和RMB等指标上均获得稳定提升。
表6 GRPO策略消融

03
总结
E-GRM提出了一种基于模型内部不确定性的动态推理框架,通过共识度驱动的路由机制实现“按需推理”,并结合混合损失评分器对候选推理链进行精细化选择,从而构建统一的端到端生成式奖励建模系统。
总体来看,E-GRM的核心价值在于将模型内部信号转化为计算资源调度依据,使推理过程从“统一计算”走向“自适应分配”。
这一范式为生成式奖励模型与高效推理系统设计提供了新的思路,也表明未来AI系统优化的关键不在于“更强推理”,而在于“更智能的推理决策”。







