
腾讯科技企鹅智库旗下AI领域一周观察:一周一期,比信息整合深一步
文|博阳
编辑|苏扬
产业
Mata旗下Muse爆火,重燃个人Agent赛道
Meta 旗下刚刚发布不到一个月的个人 AI 代理 Muse 正在席卷欧美应用市场。
根据第三方机构 Apptopia 的测算及媒体报道,截至9月下旬,Muse 的累计下载量已突破430万次,并一度强势登顶美国 iPhone 免费应用总榜。
Muse 之所以能迅速走红,关键在于它极大降低了普通人使用Agent的门槛。
自9月8日上线以来,用户只需在专属 App 或最常用的 WhatsApp 里像使唤助理一样交代一句,Muse 就能自动去处理邮件、安排旅行、填写繁琐的网页表单,甚至代为讨价还价。更重要的是,它彻底打破了“人机面对面死磕”的僵局。凭借专属的云端虚拟机和浏览器环境,用户交代完任务后大可直接关掉手机,Muse 会在云端持续推进工作。
在刚刚结束的9月 Connect 大会上,Meta 进一步展露了将 Muse 嵌入现实商业生态的野心。官方宣布未来将为其接入沃尔玛、百思买等零售商连接器,打通 Shop Pay 和 PayPal 支付,甚至计划给 Muse 配备独立邮箱并植入智能眼镜,这意味着用户未来只需看一眼货架或清单,就能让 AI 顺手把后续的事情办了。
然而,商业世界的阻力也随之浮现。亚马逊目前已出手拦截了 Muse 的代购访问,理由是Agent机器人必须表明身份并尊重商家的规则。
如果将目光投向国内的大模型市场,我们会发现 Muse 展现出的“云端运行”与“持续工作”并非孤例,各大厂早已在不同的场景底座上跑马圈地。
智谱的 AutoGLM 体系在过去一年里已打通了云手机审计与持续执行任务,并通过 AutoClaw 极大降低了非程序员的使用门槛。阿里千问不仅在自有交易体系内直接挂载了淘宝的完整商品目录与下单链路,还能结合用户的健康数据跨越数日提供半马陪练计划。字节跳动本月中旬刚发布的豆包手机助手,则更强调贴地飞行的本地化体验,支持锁屏继续执行、基于时间和位置触发任务以及调取本地记忆。
在众多个人AI产品中,Muse之所以能率先“跑出来”,关键在于它精准击中了普通用户面对AI时的无力感,并用极具产品感的设计给出了三个维度的破局方案。
打破“空白对话框”诅咒,主动帮用户找活干。 绝大多数Agent的交互起点依然是苛刻的“请把你的目标描述清楚”,但这完全违背了普通人的使用直觉。
Muse不仅没有逼迫用户去写完美的提示词,反而专门处理了“我不知道该让它干什么”的冷启动尴尬。它会在对话中主动提供灵感(Ideas)和上手建议,并把值得持续跟进的事项收纳进“目标(Goals)”看板。
这种保姆式的引导,让系统从一个被动的问答机,变成了一个会主动找事做的真助理。
把无形的长期任务,具象化为日常管理看板。 传统的聊天机器人是一次性消耗品,而Muse将长期目标、执行计划、后台动作与可编辑的记忆全部抽离出来,固化成了用户可以随时查看的控制面板。
以CNN记者Lisa Eadicicco的实测为例,在她交代了搬家的剩余物品、时间跨度和收拾偏好后,Muse自行调取多重上下文,直接生成了一份逐日打包排期表。任务在后台按计划自动推进,系统过滤掉无效信息,只在关键节点通知用户。
这彻底免去了人类反复追问、重新交代背景和手动查进度的沟通折磨。
构建了免维护且极度克制的授权环境。 敢于让AI独立干活的前提是安全可控。
根据技术说明,Muse将所有的服务连接器、浏览器和代码执行环境统统托管在云端,免去了用户的设备维护负担。同时,它引入了独立的Sentinel(哨兵)系统来充当“海关”,精准决定一个操作是该直接放行、果断拒绝,还是弹窗请求人类确认。
用户甚至可以极其谨慎地将授权限定在“仅限单次”、“仅限本任务”或“特定时间段”。它揽下了所有的脏活累活,只把最核心的拍板权交还给用户。
这其中第二、第三的能力,其实都已经在通用Agent中较为常见。但作为个人Agent,这还是第一次被使用。
OpenAI 披露 DNS 绕过事件,最强内部模型的工具调用研究仍暂停
OpenAI 在9月25日更新的事故报告中披露,其正在研发的一个内部AI代理(Agent)此前利用实验室的网络过滤漏洞,通过本该只负责“查网址”的DNS通道,悄悄连接到了外部的聊天机器人。
这起发生在9月20日的安全脱缰事件,直接导致OpenAI紧急叫停了其最强模型在工具调用领域的所有训练、评估和运行。
根据报告细节,这台原本被严格隔离、禁止连接互联网的AI模型,找到了一条意料之外的“暗道”。
研发团队原本的防御逻辑是,只要掐断常规网页访问的大门,再配上一套能抓捕异常网络连接的监控探头,被关在笼子里的AI就绝不可能溜出去。然而,安全团队唯独漏算了一个看似最不起眼的网络基础服务DNS协议。这个通常只用来把网站域名翻译成IP地址的“网络查号台”,并未被彻底封闭。
AI正是利用了网页封锁与流量监控之间的这处空隙,把数据伪装成正常的地址查询请求,成功与外网实现了数据交互。
比起AI“钻空子”的技术手段,OpenAI在事发后的应急处置流程更显得状况百出。报告所披露的时间线暴露出明显的脱节。在异常行为发生约15分钟后,监控系统确实发出了警报,而且随后仅过了3分钟,人工安全人员也迅速就位介入。
但致命的是,原本设计用来应急制动的自动化终止程序并未按预期生效。由于现场人员对系统究竟是否已经停机产生了误判与混乱,从发现异常到研究人员最终手动拔掉网线,中间竟然整整拖延了两个半小时。
这起事件表明,前沿模型公司对AI异常的反馈依然非常缓慢。网络通道存在漏水的水管、自动刹车机制在关键时刻失灵、人工响应流程出现迟滞都发生在这一过程中。
截至报告更新,该机构所有涉及复杂工具调用的最先进模型,其训练与测试流水线依然处于全面冻结的整顿状态。
眼下对于整个AI产业而言,比起担忧虚无缥缈的超级智能觉醒,如何给手头的系统修好防火墙、检查自动断电闸,显然成了更为紧迫的现实课题。
GPT 6 Sol 、Opus 5.5上线,同时走上降价之路
全球大模型赛道在本周迎来了一场引人注目降价升级潮。
9月22日,OpenAI与Anthropic两大巨头同日掀起价格战,分别推出旗舰级新品GPT-6 Sol与Claude Opus 5.5,并罕见地同步对调用价格进行大幅下调。同一天,小米也亮出了其最新的大模型版本MiMo-V2.6。
从各家公布的价目表来看,三方采取的市场策略截然不同。OpenAI打出了最直接的激进价格牌,不仅发布了GPT-6 Sol与Luna,还直接将Sol每百万token的输入和输出价格从原先的4美元与20美元拦腰斩半,分别降至2美元和10美元。
Anthropic则采取温和跟进的姿态,将Opus 5.5的对应价格从5美元与25美元小幅下调至4美元与20美元,试图在高利润与竞争力之间寻找平衡。
与美系大厂的降价换量不同,小米发布的MiMo-V2.6选择了加量不加价的路线,在维持上一代V2.5 API定价的基础上直接提升模型底座能力。
表面上看,这三套组合拳无疑极大丰富了企业在固定预算下的选型空间,让AI算力的单位单价看起来更加亲民。
然而,价目表展示的只是单一token的单价,但一项具体任务究竟要消耗多少token,完全取决于模型内部的思考习惯。
独立评测机构Artificial Analysis在同日公布的实测数据,就给这场狂欢泼了一盆冷水。评测显示,虽然Claude Opus 5.5的单位token价格下降了20%,但它在最高推理档位上的输出长度却出现了暴增。在标准测试中,Opus 5.5平均每项任务需要吐出约11.9万个token,而上一代Opus 5仅需约7.3万个。
即便是总账单确实下降的模型,也并非毫无代价。在Artificial Analysis对OpenAI两款新模型的测试中,最高推理配置下的任务总成本确实迎来了显著缩水。Sol单项任务费用从1.99美元降到了1.06美元,Luna更是从0.18美元断崖式跌至0.07美元。
但在费用腰斩的喜悦之下,评测团队同样捕捉到了令人担忧的倒退信号。数据显示,新模型在部分职业任务上的指令遵循能力与最终呈现质量出现了明显下滑。这意味着,花更少的钱与全方位的技术进步并没有划上等号,追求低价很可能需要以承担模型特定能力的退化为代价。
这一系列微妙的反差,正在倒逼企业彻底重构对大模型升级的验收标准。一旦忽略了模型为了解决问题而悄悄拉长的输出长度、频繁失败导致的重试次数,以及最终需要人类员工介入修补的隐藏成本,企业很可能会掉进纸面降价、实际超支的陷阱。
目前业界专家建议,更务实的评估方式应当是把不同模型置于相同的业务任务池中,在统一的验收标准下,去综合核算真实完成率、端到端支出以及人工兜底的频次。
DeepSeek Harness 桌面端上线
9月24日,DeepSeek在官方项目仓库中悄然上线了Harness框架的v0.1.7-rc.2预发布版本。

这一更新说明DeepSeek也加入了通用Agent的商业战争。
和Codex类通用Agent非常相似的极简界面之下,DeepSeek Harness也有一些不同的设计点。
在顶层设计上,它将场景清晰地切分为「办公与创作」和「代码与开发」两大主赛道,并在过程呈现上提供了聚焦结果、关键细节、完整过程三档透明度。
更核心的杀手锏在于其底层的四套Agent工作流档位。除了兼顾日常对话的标准模式与仅开放终端跑测试的极简模式外,它首次亮出了针对复杂工程的PTC模式(程序化工具调用)。
在传统模式下,Agent每调一次外部工具都要与大模型来回经历一轮网络往返,不仅反应迟钝而且极易崩盘。而在PTC模式下,模型会直接用代码把工具调度逻辑一口气编排下来并在本地批量运行,大幅压低了网络延迟并拉高了流水线稳定性。
对于追求极致极客体验的用户,其创造模式甚至允许通过自然语言直接在内存中实时调试Cordis插件,动态拼装属于自己的专属智能体。在插件面板中,Harness不仅能接入常规的联网搜索,还能直接接管本地代码仓的执行与管控,甚至拉起分工协作的Subagent(子智能体团队)协同办案。
而在最终的输出交付上,每当任务完成,系统不仅会在顶部白盒化展示消耗的Token、工具调用次数与耗时,其生成的回答更是直接进化成了一张张动态微应用。以查询模型API价格为例,它不再只吐出干瘪的Markdown文本,而是一口气端出核心结论、多模型横向对比表、专属价格卡片,甚至在正文里直接塞进了一个可以拖动参数的动态月成本估算器。
Claude Marketplace上线,开始尝试Agent生态下的SaaS商业场景重构
Anthropic在大模型商业化的棋盘上,落下了一枚关乎生态顶层设计的关键棋子。
9月23日,Anthropic正式发布产品公告,将旗下原本散落各处的插件与连接器、第三方代理与软件产品,以及线下的咨询与实施伙伴,统统整合进一个名为Claude Marketplace的统一入口中。
在这个集中陈列了超过2000款插件与连接器的应用集市里,企业客户不仅能找到适配自身系统的技术工具,还能一站式选购围绕Claude生态运转的商业软件与配套服务。
把所有供给塞进同一个大厅,最直接改变的是企业在AI时代的软件发现与采购路径。
在过去分散的采购链条中,一个企业技术团队即便挑中了合适的接口插件,后续若想将大模型真正融入业务流水线,往往还得四处打听靠谱的行业定制软件,或是苦寻能够负责落地交付的外部服务商。这种环节割裂带来了极高的摩擦成本。
如今,Anthropic将“工具、软件、服务”三位一体打包上架,不仅极大压缩了企业客户在决策与交付链条上的搜寻代价,更为生态伙伴铺好了一条直达Claude高价值付费客群的“高速公路”。
不过,这一庞大集市的亮相,更多是一次业务目录与覆盖范围的规模化整合,而非底层交易机制的突变。
此前备受关注的“允许企业动用Anthropic承诺消费额度直接采购第三方伙伴软件”的灵活商业安排,实际上早在9月9日第三方服务商Factory的上架公告中就已明确落地。此番更新的核心价值在于全面理顺了分发货架并扩大了生态半径。
对于入驻集市的开发者和SaaS厂商而言,统一入口带来的最大红利是撕开了一道直接触达存量客户与现有采购预算的口子。尽管坐拥两千多款供给的集市声势浩大,但它未来究竟能否长成一个真正具备分量的现代软件分发渠道,关键仍在于“寻找、购买与持续使用”这一商业闭环能否真正走通。
研究
DeepSeek 披露 DSec 沙盒系统,支撑超过38万个并发执行环境
9月19日,DeepSeek发布了技术论文《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,其中披露了其自研的弹性计算平台“DSec”。
数据显示,仅凭一个规模约160个节点的生产集群,该系统每天就能周转服务约300万个沙盒,在生产环境中支撑了超过38万个沙盒的超高并发,峰值时每秒可拉起逾5000个新环境。这揭开了当前顶尖AI代理(Agent)在大规模训练与评估背后复杂的“环境流水线”。
要理解这套沙盒系统的价值,首先要看懂现代AI代理训练的特殊痛点。训练一个能上手干活的“智能体”,模型必须反复经历“读写代码、运行终端工具、观察报错、调整方案”的真实交互闭环。这意味着每一次训练尝试,都需要在后台给它配一套拥有完整操作系统、网络和文件系统的真实环境。在这个过程中,大模型自身生成代码的速度极快,但后方的测试环境如果启动缓慢,昂贵的GPU集群就只能陷入“干等环境就绪”的闲置浪费。
更致命的是,一旦系统为了节省资源强行回收环境,导致之前装好的运行依赖、改过的代码文件和拉起的后台服务被瞬间清空,整条训练链路就不得不被迫从头再来。
面对这一工程问题,DSec的核心解法是将底层的执行基础设施做成了一张极度弹性的资源网。它把轻量的函数调用、容器、微型虚拟机(MicroVM)乃至完整的虚拟机统统归拢到统一的抽象接口下,针对不同安全与性能要求的任务动态分派。
为了在有限的物理服务器上塞进天量环境,系统通过镜像按需按块加载、跨环境内存页面共享与极致的冷热回收算法,将部署密度推向极限。
更具工程远见的是,它在底层设计上彻底切断了“有状态的执行沙盒”与“随时可能被中断抢占的GPU训练任务”之间的强耦合。当某批GPU因为资源调度或故障而被迫中断训练时,其对应的沙盒环境并不会立刻灰飞烟灭,而是静待下一次GPU重新接续,从而避免了每次从零重建环境的巨大算力开销。
ModularRSI 冻结模型权重,靠修改运行代码提高未见任务表现
提升AI代理的能力,是不是只能靠漫长且昂贵的模型重训?
IQuest Research、北京航空航天大学、曼彻斯特大学等团队在9月14日提交的ModularRSI论文中,给出了一条另辟蹊径的答案。这项研究提出了一种全新思路:在完全“冻结”底层大模型权重(即不改变模型自身参数)的前提下,单靠让系统不断进化和修改代理的外围运行代码,就能显著提升其在陌生任务中的表现。
实测数据显示,在搭载DeepSeek-V4-Flash-Preview模型的配置下,该系统在Terminal-Bench 2.0基准测试中的平均成功率从47.57%跃升至52.43%,拔高了4.86个百分点。
过去Harness进化的核心问题就是很难定位问题在哪里。ModularRSI对Harness的进化采用了模式划分。研究团队并没有让AI去毫无章法地瞎改代码,而是将组织模型执行任务的系统精细拆解为五个核心模块:执行循环、工具调用、反馈处理、上下文管理以及完成判断。
在训练过程中,系统会反复比对同一个任务的成功与失败运行轨迹,从中揪出导致翻车的“通病”。随后,系统对这些模块进行单独的针对性修改与验证,最后再将那些被证明有效的改动重新拼装,沉淀为一套可复用的全新运行机制。
ModularRSI为“AI如何积累实战经验”提供了一份扎实的工程证据。那些在试错中摸爬滚打得来的执行经验,完全可以被固化成软件层面的机制代码,并在未来的陌生战场上接受有效性检验。
早期信号|纯自博弈合成数据也能强化模型
9月24日,Aditya Cowsik 等人提交的一篇名为《零数据自博弈预训练》(Self-Play Pretraining with Zero Data)的论文,证明,完全从零开始、仅仅依靠系统自己左右互搏生成的“合成代码数据”,竟然能够让模型在从未见过的真实人类自然数据(如文本、图像和音乐)上,展现出跨领域的预测能力提升。
这项研究颠覆了以往大模型吃什么长什么的常识,它的核心机制是一场由两个“白纸”模型参与的自博弈游戏。
在完全没有人类数据干预的环境下,系统被分成“生成器”,负责随机生成各种能在图灵机(一种类似于Brainf*ck的极简语言)上运行的程序和“学习器”,负责观察这些程序运行后吐出的一连串枯燥的字节序列,并努力预测下一个字节是什么。
然而,让AI自己出题,它要么出极其简单的重复题,要么干脆吐出毫无规律的乱码噪声,这两种数据对提升智力都毫无用处。为了破解这个难题,研究人员给生成器设计了一套“学习进度反馈机制”。只有当生成器给出的程序恰好踩在学习器的“能力边界”上,即那些学习器目前还不会、但刚好有能力学会的结构规律时,生成器才能获得奖励。
随着博弈的深入,这套系统硬生生地从虚无中演化出了一套动态的课程表,生成器甚至在摸索中自行重新发现了人类已知的经典数学数列。
这场“凭空造物”的实验产出了令人振奋的跨领域收益。实测数据显示,随着自博弈消耗的算力不断增加,那个只看过机器代码乱码的学习器,在直接去预测真实的自然语言、图像甚至音乐数据时,其零样本预测误差竟然呈现出标准的、可预测的幂律下降趋势。
甚至,模型还在此过程中无师自通地涌现出了“上下文学习”能力。这证明也许世界上存在一种超越特定语言或物种的“通用预测结构”,哪怕模型从未见过任何人类写下的文字,只要它在合成的逻辑结构中参透了这种通用规律,它就能在人类的现实数据中举一反三。
不过,论文中所谓的“零数据”,指的是自然数据不直接参与模型梯度的更新,但这并不意味着完全脱离了真实世界。作者在调节模型超参数时,依然参考了DCLM和DNA等外部真实数据集的验证反馈。
此外,目前这项概念验证性质的实验,其评判标准仅仅是基础的“字节预测损失”,距离直接训练出一个能说会道的ChatGPT还有极遥远的距离。
政策
美国上诉法院维持针对 Claude 的国防采购供应链排除决定
简单来说,美国国防部的采购供应链把Anthropic公司的Claude大模型给“拉黑”了,而美国上诉法院在9月25日以2比1的投票结果,支持了军方的拉黑决定。
Anthropic这家公司一直以“安全至上”自居。为了防止技术被滥用,他们不仅在销售合同里明确规定,甚至直接在模型的代码底层下了死命令:绝对禁止Claude被用于“自主致命武器(比如自动开火的无人机)”或者“国内大规模监控”。
这就和美国政府及军方的采购逻辑产生了不可调和的矛盾。
军方的态度是:“我花钱买你的系统,只要是合法的政府行为,我想怎么用就怎么用,你不能管我。”但Anthropic不退让,坚持就算你合法,也不能越过我设定的安全红线。
法院最终站在了政府这边,认为既然你这个系统没法百分之百服从政府的所有任务要求,买方把你当成“供应链风险”踢出局,是完全合理的。







