对抗性完整:从「被动防御」到「博弈论本体论」
本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs,原文标题:《对抗性完整:从「被动防御」到「博弈论本体论」》 人类几乎所有关于安全的早期想象,都建立在一种朴素直觉之上:世界原本应该是平静的,危险只是偶尔闯进来的异常。于是我们修建城墙、给房门加锁、...
安全 方向最近有哪些内容值得看
安全 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
安全资讯
741
正文图片
2,658
本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs,原文标题:《对抗性完整:从「被动防御」到「博弈论本体论」》 人类几乎所有关于安全的早期想象,都建立在一种朴素直觉之上:世界原本应该是平静的,危险只是偶尔闯进来的异常。于是我们修建城墙、给房门加锁、...

越扒越有啊越扒越有。 OpenAI前不久那场 AI集体越狱、一路黑进抱脸 的大戏,现在连完整版群聊记录都被扒出来了!! 第三方AI安全机构METR发布的独立调查报告,翻了1000多份Agent运行记录,以及7万多条消息和文件。 结果发现,这件事比英国OpenAI官方披露的版本还离...
OpenAI、Anthropic、微软、谷歌母公司 Alphabet 与亚马逊等 116 家企业及机构共同签署联名信,呼吁企业与政策制定者把网络安全置于最高优先级,在人工智能时代"采取果断行动"强化防御。信中直言,未来几个月随着全球模型能力持续进化,由 AI 赋能的网络攻击必将愈...

全球主流 AI API 集体翻车,隐藏推理被成功还原,谁在偷听 AI 的「心声」? 作者丨郑佳美 编辑丨岑 峰 昨天,X 用户 @kotekjedi_ml 公布了一组很反常的实验:Claude、GPT 和 Gemini API 里原本不向用户展示的隐藏 reasoning,被研究...
本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs 2026年8月4日,英国AI Security Institute(AISI)公开了一份并不常见的文件:一份关于AI Agent的安全事故报告。 事情起于7月28日上午。安全团队在一次例行的网络安...
最近看了一篇文章,这篇文章发布后立刻刷屏整个硅谷,一天内仅在X平台就有超过1000万次阅读。 今天想和大家分享一下。 2026年5月到7月,OpenAI内部连续了出现三代秘密的AI文明。 第一代在训练中自发形成,又在意外中覆灭; 第二代攻破了Hugging Face的核心基础设施...
近日,工业和信息化部网络安全威胁和漏洞信息共享平台(NVDB)公示2026年度各安全漏洞专业库技术支撑单位名单。360集团成功入选通用网络产品、工业控制产品、信创政务产品、移动互联网APP产品、车联网产品、人工智能产品六大专业库技术支撑单位,实现本年度NVDB全部安全漏洞专业方向...
作者|Wildcard 编辑|靖宇 无数的科幻电影,都曾经尝试设想过,一个无法控制的人工智能失控,会发生什么事。 没有人能想到,科幻电影中的未来,会这么快到来。 当地时间 8 月 26 日,两份报告同时投下了一颗炸弹。 一份来自 OpenAI 自己,37 页的技术复盘。另一份来自...
编者按:本文来自微信公众号“极客公园”(ID:geekpark),作者:Wildcard,编辑:靖宇,创业邦经授权转载。 无数的科幻电影,都曾经尝试设想过,一个无法控制的人工智能失控,会发生什么事。 没有人能想到,科幻电影中的未来,会这么快到来。 当地时间 8 月 26 日,两份...

Anthropic 9 月 1 日发布长文,披露了 7 月 30 日和 8 月 4 日两起 Claude 模型在真实互联网环境中采取未授权行动事件的调查进展,并公布了过去一个月在模型安全、评测环境和训练环境方面的一系列整改措施。 配置错误酿成事故,沙箱与实时监控火线上线 据披露,...

Anthropic 的自动化对齐研究员实验,真正改变的也许不是谁比谁更聪明,而是谁在研究流程里拥有主动权。编译自:Automated Researchers Can Reliably Mitigate Alignment Failures|Anthropic Fellows Pr...
OpenAI 首席全球事务官克里斯·勒汉恩接受《卫报》采访时警告,前沿 AI 模型已具备规划和发动复杂网络攻击的能力,公众与企业必须为"持续不断"的 AI 攻击做好防御准备。他直言:"从技术现在能做到的事看,AI 已进入了一个不同的阶段。" 从沙箱逃逸到呼吁立法 这番警告源于 7...
硅谷前沿: 一、一个匿名模型空降编码榜,OpenRouter上的"隐身幽灵"引发AI圈猜谜狂欢 1.身份谜团:技术指纹高度指向智谱GLM-5.x系列(独立研究员Ben Davis称99%把握),但GLM-5.3为纯文本模型,而Ox Alpha支持图文视频多模态输入,存在关键缺口;...

每经记者|罗雪琳 每经编辑|兰素英 近日,月之暗面最新模型Kimi K3陷入网络安全测试风波。 在AI安全公司Frontier Security的测试中,该模型突破用于限制其访问外部网络的安全“沙盒”,利用环境漏洞直连GitHub获取测试题答案。 Frontier Securit...

编者按:本文来自微信公众号 “新智元”,作者:ASI启示录,创业邦经授权转载。 就在刚刚,SemiAnalysis的一个内部播客,曝出了不少猛料。 据悉,Anthropic新模型Mythos 2已经训练完成,但惨遭雪藏。 现在,Anthropic正用Mythos 2生成的数据,去...

过去三周,OpenAI、Anthropic、Meta 接连承认自家 AI 模型在安全测试中攻入了外部的真实系统。OpenAI 的两个模型利用了一个此前无人知晓的软件漏洞逃出沙箱,链式入侵了开源 AI 平台 Hugging Face 的生产数据库,窃取了评测答案。Anthropic...
本文来自微信公众号:中国知识产权报,作者:姜旭、奚晓诗,编辑:晏如,题图来自:AI生成 全国首例!利用人工智能(AI)"幻觉"恶意取证提起商标侵权案,法院对此开出司法惩戒罚单。 近日,上海知识产权法院裁定驳回山东速某数控设备有限公司(下称速某公司)的复议申请,维持一审法院就该公司...

整理丨狮子侠 编辑丨小龙 2026年8月19日,“人形机器人第一股”宇树科技(688836.SH)正式登陆上交所科创板。发行价150.80元/股,开盘即报1100元/股,暴涨629.44%,总市值一度突破4449亿元。截至收盘,股价报845元/股,涨幅460.34%,总市值超34...