Token导航 LogoToken导航

Meta个人智能体Muse爆火 持久记忆成Agent关键

更新时间 2026-09-30来源 白鲸实验室正文 3771字阅读约 12分钟1 张图片
图片

Meta个人智能体Muse的爆火让95后沈俊潇有些兴奋。

三年前沈俊潇曾在Meta reality部门,负责为Meta Raybon背后的AI助手提供智能服务。当时还没有Muse这个项目,但是能看出Meta做消费级个人助手的想法早有迹可循。

这几年随着大模型能力的突飞猛进,应用爆发只是时间问题。一定程度上,Muse的火爆可以看成应用爆发的前兆,上线5天,下载量突破73万,第10天登顶美国App Store免费应用总榜第一,上涨的速度超过早期的ChatGPT。

沈俊潇博士毕业于剑桥大学,是Memories.ai的创始人,他现在做的事和Muse有一定的关联。2024年底Memories.ai创立,押注的赛道是为个人助手以及其他硬件,构建视觉记忆层。不同于当前大模型的记忆主要还是上下文窗口,偏向短期的文本记忆,沈俊潇想让AI像人一样真正看见物理世界,并形成持久记忆。

沈俊潇认为,未来个人助手有三大壁垒,视觉记忆、智能和action。action就是各种Agent,相当于人的手和脚,智能是模型,这些都是大厂、大公司的射程范围,而视觉记忆相比文本记忆,更像人类真正意义上的情景记忆。况且视觉信息更原始,一直是AI看见和检索上需要攻克的难题。

过去两年多,Memories.ai在视觉记忆上已经取得一些进展。发布全球首个视频理解模型LVMM,随后不到半年,相继签下高通、英伟达两个大单。今年9月,全模型栈已经可以在高通骁龙平台上原生运行,实现手机、PC与智能眼镜上的端侧持续感知。

这也意味着,搭载骁龙芯片的手机、可穿戴设备等上的AI智能体,都可以较低的成本“看见”物理世界”,从而辅助做出满足用户个性化需求的决策和建议。

01 

AI助手为什么一定需要“视觉记忆”

今年3月,沈俊潇从硅谷出差来到中国。还在倒时差的他,抽出时间和我们做一个差不多两小时的连线。他当时给我的最大感受是极具野心,但也十分务实。

创业初始,他们没有向投资人讲述多么酷炫的故事,也没有紧跟热门的概念,甚至自创了一个词,视觉记忆。沈俊潇说,他们是全球第一个提出视觉记忆概念的团队。

早在2023年时,沈俊潇所在的Meta Reality Labs,就在为AI眼镜Meta Raybon背后的AI助手提供时序视觉理解。当时他们就有预判,未来会是个Agent大爆发的时代,会有数百万个智能体,取代掉APP和网站。但这些智能体最大缺陷是没有个性化。

他们据此提出一个非传统互联网范式的解法。在终端用户与各种Agents之间,必须存在一个足够个性化的中间层。这个中间层可以承接用户的记忆、context,再去调度背后百万级Agents完成任务。

AI进入物理世界已经是大势所趋,无论是戴在脸上的AI眼镜,还是走进工厂和家庭的人形机器人,AI终将不再只活在屏幕里,要 "看见" 真实世界。

而一旦进入物理世界,记忆的形态就变了,它不再是你敲下的文字,而是你眼睛看到的画面,走过的场景,接触过的物体。

换句话说,终局的记忆一定是视觉记忆。"如果终局就是视觉记忆的话,不如现在就开始做视觉记忆。"沈俊潇说。

不过,当前距离终局尚需时间,这也是为什么当时的市场押注视觉记忆赛道几乎是个空白。因为大部分Agent的核心交互和任务执行靠的是文本,用户打字或语音下达指令、Agent读文档 、邮件 、日程、输出文字结果、调用API完成任务。

只有极个别的场景会利用到视觉,比如看一眼截图,识别一下画面里的物体,比对一下监控画面。

沈俊潇说,但凡拥有20%的视觉记忆,对AI能力提升效果都会非常显著。

AI行业进展正在超出他们的预期,原本他们期待沿途下蛋的商业思路也在发生变化,按照过去的设想,短期商业化落地场景包括安防、监控摄像头,工厂、零售的运营巡检和媒体视频创作。但后来发现具身、个人助手比想象中进展更快。

02  

持续感知落地端侧

关键节点是2025年11月,Memories.ai团队发布视觉模型LVMM2.0 。团队首次将视觉模型参数量做到只有几B级别,这意味着世界模型具备在端侧运行的可能。

但真正落地还有许多工程难题。想象一下,一个可穿戴设备或终端若要观察一个人的一整天,每天会产生数小时视觉输入,而运行在终端的AI想要通过数小时的视频实现理解和搜索,帮助AI做出更个性化的决策,还要求能在算力和的功耗都更小的终端原生运行。这在以往几乎不可能。

硬件设备行业有一个不可能三角定律,算力、功耗、效果,很难同时实现最好。沈俊潇团队就是试图把这个“不可能三角”掰弯,在算力和功耗变低的情况下,还能达到视觉快速检索的效果。

这个过程充斥大量的工程难题,比如模型最初只能跑在通用处理器(CPU )上,能耗比很差,电池很难撑得住。若要设备7×24小时低功耗持续运行,只有 NPU 能扛住这种续航预算。NPU 的速度是CPU的数十倍,能耗只有其几十分之一。

为此,高通派驻工程师和Memories.ai一起做算子对齐的工作。

Memories.ai最终的思路是,将模型栈将感知拆成两个成本结构截然不同的阶段。一个是在采集时刻运行的高效视频语言模型OmniCaptioner,它把设备所见所闻转化为紧凑、结构化、带时间锚点的瞬间描述。

另一个是多模态检索模型OmniRetriever,负责把这些描述索引成可查询的个人记忆,并以交互级延迟响应自然语言查询。

这种架构设计,可以实现视觉信息采集时,成本做一次性摊销,而不必在每次查询时重复支付。下游的索引、检索与答案合成,处理的都是紧凑表示而非视频本身。

9月24日,在2026年骁龙峰会上,高通和Memories.ai共同官宣,视觉模型栈已经实现手机、PC与智能眼镜上的端侧持续感知。

这意味着在个人助手、智能体越来越走进人们生活的当下,保证了终端设备的持续感知能力,并具备了经济可行性。用户无需按下拍摄按钮,设备可以每天低耗的方式持续感知到周围的环境。

沈俊潇在峰会上演示,当用户对硬件智能体询问租车地点和酒店时,无需上传文件或者输入文字,智能体能够自动利用此前接触过的信息作答。比如智能体看见这一天发生的事情后,会记住早上已经喝过一杯咖啡,下午你点饮料时会记住这一信息,做出更符合个人想法的决策。

用户也无需担心个人隐私画面被设备泄露,因为给画面信息索引标注时,这些画面信息从架构上确保不会离开设备本身。

03 

个性化体验时代

有意思的是,相比端侧infra层的进展,进入9月,个人消费端应用也迎来爆发。

自从年初OpenClaw爆火后,中间很长一段时间被AI办公的话题统治,如今Muse把Personal Agent带到了舆论中心。和大家已经熟悉的千问、豆包、元宝等聊天助手工具不同,Muse主打的主动替你干活的能力。

AI办公是面向职场的智能体,Muse则是主打的生活场景。比如帮助用户发邮件,网购,取消流媒体订阅,比价,打电话和保险公司讨价还价,协商处理停车罚单等。在这些应用场景里,Meta已经梳理出近400种Muse应用场景。

Muse的突然走红,带动了全球对个人Agent的追捧。截至9月29日,OpenAI、字节豆包、阿里千问等大厂都已被爆出正在加速推进个人Agent产品计划,AI办公赛道尚未杀出稳定格局,大厂又疲于奔命地加入新赛道继续厮杀。

除了大厂,创业公司也加速布局。Manus于9月28日,推出个人Agent应用CUE,前豆包PC端负责人齐俊元创办的Today AI正式开启了公测。

在沈俊潇看来,Memories在终端实现可持续感知,有助于个人应用的真正爆发。

扎克伯格在播客节目《Sources》中的言论,也充分说明个人应用的未来发展,需要真正理解用户,而真正理解用户,离不开终端设备的持续感知能力。扎克伯格对Muse的设想是,“给世界上每一个人配备足够强大的个人智能体,它能理解用户的目标,并全天候代表用户工作”。

Meta Connect 2026宣布把Muse延伸到AI眼镜,一旦Agent长在眼镜上,第一人称视觉的持续感知与记忆就成了必须解决的问题。所以Meta 把Muse戴上眼镜的那一刻,就等于替 Memories.ai的赛道盖了章。

不只个人Agent赛道,沈俊潇称,物理智能整体上需要的,也正是同一套技术栈。对于可穿戴设备、机器人同样如此,拥有持续感知技术栈的机器人,相当于拥有了视觉记忆的大脑。机器人看到用户早上喝了杯咖啡,晚上会提醒你早上已经喝过咖啡了,晚上可以不用喝咖啡。戴上AI眼镜,出门忘记钥匙放哪里了,它会帮你快速找到钥匙。

随着物理智能应用端的发展,强大的记忆系统对AI越来越重要。今年3月的GTC大会上,Memories.ai的视觉记忆技术被接入英伟达的 Cosmos-Reason 2和Metropolis平台。

这两个平台分别是视觉语言模型VLM和视频智能应用框架。相当于Memories.ai作为视觉记忆的infra层面,已经成为芯片厂商卡位生态的重要伙伴。

两年前,"给视频做记忆"听上去像个基础设施里的苦活。如今当Muse们纷纷站上App Store榜首,机器人和AI眼镜开始走进真实世界,视觉记忆越来越被行业关注到。

这块所有人都需要,却少有人愿意低头去修的地基,正是Memories.ai 做的。它未必会成为下一个家喻户晓的助手品牌,但很可能悄悄成为个人助手、机器人和眼镜共同需要的一块拼图。

作者|柳嘉

编辑|八尺

文章标签智能体大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多