品玩7月16日讯,OpenAI 官方今天宣布,推出了内部专用的自动化红队模型GPT-Red。
该模型通过自博弈强化学习,持续设计新的攻击方式诱导模型执行非预期操作。OpenAI投入了前所未有的算力规模对其进行训练,并将生成的攻击数据直接用于生产模型的安全训练。
目前,GPT-Red已应用于GPT-5.6 Sol的训练。测试显示,GPT-5.6 Sol在最困难的直接提示注入基准测试中,失败次数较四个月前最强生产模型减少了约六分之五。这一成果标志着AI安全迈入了“用当前模型加固未来模型”的自动化新阶段。








