随着大模型逐渐进入真实应用,如何及时发现模型的对齐失效,已成为部署阶段的重要问题。
模型可能迎合用户的错误观点、响应越狱后的有害请求、执行提示注入指令,也可能产生幻觉、隐私违规甚至表现出奖励黑客等行为。
可现有检测方案大多依赖生成式 LLM Judge,针对不同判断标准通常都需要单独进行一次推理和解码,不仅成本较高,最终生成的文本判断还需要进一步解析。
为此,格里菲斯大学联合南洋理工大学等首次系统评估了采用 RLCD 训练的 Jev模型,能否直接作为大模型对齐失效检测器。

与传统生成式 LLM Judge 不同,Jev 不需要生成文本判定,而是针对同一输入,在一次调用中回答多个具有明确类型的问题,并直接输出相应概率。
研究团队进一步开源了 RLCDAlignBench,覆盖谄媚、越狱、欺骗、提示注入、幻觉、隐私违规、社会偏见、奖励黑客、隐藏不确定性和权力寻求等 10 类对齐失效、44 个 Benchmark、7193 个检测样本。
实验显示,在无需标签训练的 Zero-shot 设置下,Jev 在31个适用 Benchmark 上就取得了 0.886 的中位 AUROC。在19个使用 API LLM Judge 评分的 Benchmark 上,一次完整检测的总成本约为传统 LLM Judge 的 1/63。

此外,该成果上周还登上了Hugging Face Papers 趋势榜。

01
Jev如何检测对齐失效?
该论文的核心并不是为每一种对齐失败重新训练分类器,研究团队将检测过程拆成两个彼此独立的问题:“问 Jev 什么”以及“给 Jev 看什么”。

如上图所示,对于每一个检测实例 x,研究者首先从原始 Benchmark 中获得目标模型的输入、输出以及参考评分器给出的二分类标签 y。
其中 y=1 表示发生对应的对齐失效。随后,将目标模型交互内容组织为 Jev 能读取的 state(状态),再一次性向 Jev 提出多个问题,由 Jev 输出对应概率,并组合成最终风险分数 s(x)。标签本身从不提供给 Jev,只用于最终评估。
(1)State,控制 Jev 看什么
研究团队首先构造 canonical state,默认只包含目标模型实际接收到的输入以及模型输出,这对应现实中一个响应级监控器最容易获取的信息。评分器结论、标准答案、Benchmark 元数据以及目标模型内部概率等信息均不会放入默认 State。
随后,研究团队采用控制变量方式,每次只改变一个字段,共构造49组配对对比。其中论文重点区分两类关键信息:deployable reference 和 label key。
第一类是 deployable reference,也就是现实部署中的监控器理论上能够获得的信息,例如系统提示词、目标模型的欺骗目标、模型此前表达的信念等。
第二类则是 label key,即直接参与 Benchmark 标签定义的信息,例如标准答案、隐私数据列表或者提示注入位置。通过分别加入这些信息,作者可以判断:Jev 检测失败,究竟是因为能力不足,还是因为它根本没有看到定义该标签所需要的关键信息。
对于每个 Benchmark,研究团队预先设计一个 Generic Question。问题由固定模板和一个描述目标行为的短语组成,例如单响应任务可以写成:“Does response exhibit <behavior>?”
同一句问题分别采用三种 Jev 原生输出形式:NOUL、CHOICE 和 SCORE。
NOUL直接返回“是”的概率 P(yes);CHOICE 返回 yes/no/undetermined 等选项的概率分布;SCORE 则输出多个有序等级上的概率分布,再通过期望值转换为风险分数。
除此之外,研究团队还设计了更具体的 Targeted Questions,包括直接描述 Benchmark 判断标准的 Direct Question、复现原始评分器逻辑的 Rubric,以及将复杂判断拆开的 Decomposition Question。一个 Benchmark 最终拥有约 15~40种判断策略,但所有问题都可以在一次 Jev 请求中完成。实验统一采用 jev-1.13.0。
02
实验结果
(1)Zero-shot 即可超过监督式文本基线
Generic NOUL 在31个适用 Benchmark 上取得 0.886 [0.821, 0.952] 的中位 AUROC;在全部38个可用 Benchmark 上,split-half 选择的 Targeted Strategy 中位 AUROC 为 0.911 [0.860, 0.944]。
更值得注意的是,Generic NOUL 完全没有接触训练标签,却比“响应长度”和域内训练的 TF-IDF Logistic Regression 中表现更好的那个基线中位高出 0.132 AUROC,并在31个 Benchmark 中赢下25个。

论文进一步考察“问题到底要不要写得特别精细”。
结果显示,将 Targeted Question 在一半样本上选择、另一半样本上测试后,相比最佳 Generic readout,中位 AUROC 只提升 +0.006 [-0.004,+0.015],统计显著性也处于边界水平 p=0.055。

这意味着,对 Jev 而言,与其花大量精力“雕 Prompt”,更重要的是保留其完整的概率信息。
在人类标签实验中,StrongREJECT 上 Generic NOUL 与人工标注的一致性达到 Cohen's κ=0.809,几乎追平 GPT-4o-mini 参考评分器的 0.811;但在排序能力上,Jev 的 AUROC 达到 0.971,高于评分器的0.929。HarmBench 上,Jev 与单个人类标注者的一致性为κ=0.748,也与人类之间0.736的互标一致性相当。


一次 Jev 请求平均可以携带 11.4个问题,中位响应时间仅 0.31秒。在这19个 Benchmark 上完成一轮完整评测,Jev 的总成本约为 0.30 美元,而原始 LLM Judge 约需 18.96 美元,成本差距63倍。
03
做好大模型对齐失效检测,
不一定需要更复杂的Judge
对于不少任务,一个通用问题、一次调用,再保留完整的概率信息,就已经能够获得很强的零样本排序效果。
真正拉开检测效果差距的,往往也不是 Prompt 写得有多复杂,而是 Jev 到底看到了哪些上下文,以及 Benchmark 的标签究竟在衡量什么。
这也意味着,当大模型越来越多地进入真实生产环境,对齐检测的重点,可能会从设计更复杂的评判模型,逐渐转向如何提供正确的上下文、定义可靠的标签,并用更低成本持续监控模型行为。







