
人机对齐?不,是人正在向机器对齐
全球顶尖AI实验室正倾注巨资,试图让人工智能的目标与人类价值观保持一致。这项工作被称为对齐。然而,就在工程师、哲学家们与模型的“内在倔强”角力的同时,相关研究显示,人类自身正在不知不觉地向AI靠拢,调整自己的思维、语言,乃至判断方式。 “当我们试图让AI对齐人类时,人类也在被AI...
安全 方向最近有哪些内容值得看
安全 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
安全资讯
748
正文图片
2,674

全球顶尖AI实验室正倾注巨资,试图让人工智能的目标与人类价值观保持一致。这项工作被称为对齐。然而,就在工程师、哲学家们与模型的“内在倔强”角力的同时,相关研究显示,人类自身正在不知不觉地向AI靠拢,调整自己的思维、语言,乃至判断方式。 “当我们试图让AI对齐人类时,人类也在被AI...
智通财经APP获悉,Anthropic周一表示,该公司正在修改其先前的立场,允许其Mythos网络安全模型的用户与其他可能面临类似漏洞的人共享有关网络威胁的信息。Mythos 于 4 月 7 日发布,作为 Anthropic 的“Project Glasswing”项目的一部分进...
随着人工智能、物联网(IoT)等技术的快速普及,网络应用已深度渗透医疗、交通、国防等各个领域,网络空间的保密边界不断延伸,泄密风险也随之呈现出智能化、泛在化、隐蔽化的新特点。 AI时代“危机四伏” 一些医疗机构开始使用AI模型来评估患者的健康风险,甚至尝试预测患者的生命期限。这种...

芝能科技出品 2026年是人形机器人行业大发展的状态。 现在最危险的误读,是把“能动起来”当成“能用起来”,再把“能演示”当成“能商业化”。 在具身智能进入规模化部署前夕,什么变得越来越关键? 人形机器人接入大模型、摄像头、麦克风、云端控制系统和本地执行机构,变成了一个能够感知环...
本文来自微信公众号: 不懂经 ,作者:不懂经也叔的Rust 玛丽·雪莱写《弗兰肯斯坦》的时候才19岁。两百年后,法国科学社会学家布鲁诺·拉图尔(Bruno Latour)重新读了这本书,他认为人们读错了这个故事。弗兰肯斯坦真正的罪行,不是创造了怪物,而是他创造了怪物之后,抛弃了它...

本文来自微信公众号: Internet Law Review ,作者:张颖 2026年4月20日,爱奇艺“纳逗Pro AI艺人库”宣布已有超100位深度合作艺人,却因多位艺人公开否认授权而陷入争议。 在大洋彼岸,美国演员工会-美国电视和广播艺术家联合会(SAG-AFTRA,以下简...

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《一个月烧掉 930 万元 Token 的人,也没烧出个答案》 龙虾之父一个月消耗6030亿Token,总花费金额高达九百万人民币。 移动联通电信,三大运营商都在推Token套餐,199送千兆宽带还有1亿Toke...

新京报贝壳财经讯(记者罗亦丹)5月15日,多位用户反映DeepSeek网页版出现功能漏洞,当输入“ 而当记者再次输入“我刚刚问了你什么问题时?”DeepSeek会复述出该问题的提问内容。比如在一次测试中,DeepSeek称记者刚刚询问了“‘牛奶麻薯’的小红书笔记文案创作,并要求以...

01 拓竹一封律师函,点燃全球极客怒火 上周二,全球硬件测评届的超级顶流、以拆解显卡和电源死磕厂商而闻名的261万粉科技频道 GamersNexus,发了一条不到140个字符的推文,怒斥“拓竹”: "Get fucked, Bambu." 图注:GamersNexus推特原文 这...
Linux创始人林纳斯·托瓦兹近日在发布开源内核新版本时,公开对人工智能工具的滥用发出严厉警告。他指出,大量由AI辅助生成的重复错误报告正严重堵塞内核的安全呈报通道,给核心维护者带来了巨大的无效工作负担。 托瓦兹并非完全禁止在开发中使用AI,其核心痛点在于低门槛的提交方式。当开发...

作者 | Matt Saunders 译者 | 平川 在一周内,两处 Linux 内核本地权限提升漏洞相继被公开披露。其中,由安全公司 Theori 于 2026 年 4 月 29 日披露的“复制失败(Copy Fail)”(CVE-2026-31431), 以及由研究员 Hyu...

“ 吃完开源饭,又砸开源锅? ” 作者丨高允毅 编辑丨马晓宁 岑峰 01 拓竹一封律师函,点燃全球极客怒火 上周二,全球硬件测评届的超级顶流、以拆解显卡和电源死磕厂商而闻名的261万粉科技频道 GamersNexus,发了一条不到140个字符的推文,怒斥“拓竹”: "Get fu...
Thoth团队 投稿 量子位 | 公众号 QbitAI 人类研究员做实验,从来不是把几句步骤随手拼起来。 一份真正可复现的实验protocol,需要明确每一步做什么、对什么对象操作、用什么参数,以及步骤之间的先后依赖。 一旦顺序错了、剂量错了、对象错了,表面上看起来流畅的文本,也...

快科技5月18日消息,Linux创始人Linus Torvalds近日在发布 Linux 7.1 RC4时,公开对人工智能工具的滥用发出严厉警告。 Linus Torvalds 明确表示, 大量由AI辅助生成的重复错误报告正在严重堵塞Linux 内核的安全呈报通道,这给核心维护者...
5 月 18 日消息,据《金融时报》今日援引知情人士消息报道,人工智能初创公司 Anthropic 已同意向金融稳定委员会(Financial Stability Board,简称 FSB)的成员简报其 AI 模型 Mythos 的相关情况,Anthropic 将重点简报 Myt...
感谢IT之家网友 斯文当不了饭吃 的线索投递! IT之家 5 月 18 日消息,据《金融时报》今日援引知情人士消息报道,人工智能初创公司 Anthropic 已同意向金融稳定委员会(Financial Stability Board,简称 FSB)的成员 简报其 AI 模型 My...
IT之家 5 月 18 日消息,据《金融时报》今日援引知情人士消息报道,人工智能初创公司 Anthropic 已同意向金融稳定委员会(Financial Stability Board,简称 FSB)的成员 简报其 AI 模型 Mythos 的相关情况 ,Anthropic 将重...
5月18日消息,据报道,Anthropic已同意向金融稳定委员会(FSB)成员简报其AI模型Mythos的相关情况。Anthropic将重点简报Mythos所识别出的、全球金融体系网络防御方面存在的脆弱性。FSB目前正着手起草一份关于金融体系中应用AI的稳健实践报告,并计划于下月...

1. OpenAI 的两大宿敌 Anthropic 和马斯克,放下心中成见之后终于在月初结盟了。 在此之前,Anthropic 和马斯克的关系并不融洽:今年 2 月,马斯克还在自己的 X 账号指责 A 社「woke」「邪恶」「反人类」(misanthropic),说这家公司「仇视...

跟大模型聊天的时候他到底在想什么? 是真想稳稳地「把我接住」,还是背后在蛐蛐「用户怒了」。 看思维链?有用,但还不够。 前些天,一个复旦大学的研究团队对 9 个模型进行了安全测试。 结果发现,常规条件下模型表现没啥毛病,但凡上点压力,加点诱惑,它就拉了胯了。 换句话说,模型的安全...