品玩6月17日讯,OpenAI近日发布“部署模拟(Deployment Simulation)”技术,旨在通过模拟真实场景对话,更精准地预测新模型在实际应用中的风险行为。该方法通过重放过往真实对话前缀并由候选模型生成回复,从而在模型发布前评估其潜在的不良行为频率及新型对齐问题。
相较于传统评估方式,“部署模拟”在覆盖率与真实性上表现更优。其基于真实流量分布采样,有效缓解了人工构建测试集的偏差问题,且模型难以识别出处于测试状态,避免了行为扭曲。实验数据显示,该技术在预测GPT-5系列模型风险行为变化方向及具体发生率的准确性上,均显著优于传统挑战性提示基线。
目前,“部署模拟”已在GPT-5系列模型的发布决策中发挥作用,成功在上线前识别出“计算器黑客”等新型对齐漏洞。该技术同样适用于涉及工具使用的智能体场景,为提升前沿模型的安全性与可靠性提供了新的评估维度。








