Token导航 LogoToken导航

OpenAI推出“部署模拟”技术强化模型安全评估

更新时间 2026-06-17来源 品玩正文 379字阅读约 2分钟1 张图片

品玩6月17日讯,OpenAI近日发布“部署模拟(Deployment Simulation)”技术,旨在通过模拟真实场景对话,更精准地预测新模型在实际应用中的风险行为。该方法通过重放过往真实对话前缀并由候选模型生成回复,从而在模型发布前评估其潜在的不良行为频率及新型对齐问题。

相较于传统评估方式,“部署模拟”在覆盖率与真实性上表现更优。其基于真实流量分布采样,有效缓解了人工构建测试集的偏差问题,且模型难以识别出处于测试状态,避免了行为扭曲。实验数据显示,该技术在预测GPT-5系列模型风险行为变化方向及具体发生率的准确性上,均显著优于传统挑战性提示基线。

目前,“部署模拟”已在GPT-5系列模型的发布决策中发挥作用,成功在上线前识别出“计算器黑客”等新型对齐漏洞。该技术同样适用于涉及工具使用的智能体场景,为提升前沿模型的安全性与可靠性提供了新的评估维度。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多