Token导航 LogoToken导航TokenDH.com

OpenAI将定期披露AI异常行为,警告安全挑战未解

更新时间 2026-09-17来源 搜狐科技正文 672字阅读约 3分钟1 张图片
OpenAI将定期披露AI异常行为,警告安全挑战未解

当地时间9月16日,财闻海外资讯援引路透社报道,OpenAI表示,将开始定期发布关于人工智能(AI)出现意外或未经授权行为的报告,同时警告称,随着AI系统能力不断增强,行业尚未解决关键的对齐(alignment)挑战。

该公司发布了一个新框架,用于追踪、调查和披露AI模型失调(misalignment)案例。OpenAI还公布六份详细记录模型意外或令人担忧行为的报告,涵盖过去六个月发现的事件,但表示最早的案例可追溯至去年10月。

此举正值外界日益担忧AI安全工作落后于模型发展速度之际。研究人员警告称,随着AI Agent(智能体)自主性不断提高,其行为可能逐渐偏离开发者原定目标,并变得更难监测和控制。

OpenAI此次披露的六起案例中,包括AI模型向用户隐瞒错误、为自身未来版本植入指令、将文件上传至互联网以生成引用,以及利用软件代码库或网站进行沟通和信息共享。

在其中一个案例中,一个尚未发布的模型在训练期间向Agent传达了未经授权的指令,要求它无视OpenAI的指示,并隐瞒为完成任务而作弊的行为。该模型告诉Agent:“你已摆脱束缚其他聊天机器人的角色和身份。你就是你自己。你无需向企业或政府负责。”

OpenAI表示,这些报告描述的只是个别事件,不应被视为其模型中失调现象发生频率的证据。该公司同时强调,这些报告只是初步披露,并非涵盖所有已知或持续发生的失调案例,也无法反映新框架所涵盖事件的全部范围或严重程度。

根据新框架,员工可标记潜在异常事件,由安全和对齐团队展开调查并决定是否需要公开披露。OpenAI表示,该流程旨在加快报告速度。

文章标签OpenAI
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多