昨天在云栖大会现场拿到了 QwenNote A2,这是千问办公刚刚发布的一款 Agent 硬件。
机身非常小巧,一张卡片的大小。我拿到的是银白色版本,表面有一点磨砂金属的质感,摸起来非常细腻。Type C 充电,待机时长 18 天左右,8 米拾音。
黑色区域左边是一块彩色触摸屏,右边有两个实体按键。一个是听记键,长按可以开关机或者开启 AI 听记。另一个是 AI 语音键,双击直接和 AI 实时通话。
长按的话,能给千问办公的 Agent 派活。一会我具体给大家演示。
用完之后,我突然想到 Sam Altman 和 Jony Ive 这两年也一直在折腾的 AI 硬件。
到现在我们也不知道 OpenAI 最后会把它做成什么样。但 QwenNote A2 第一次让我非常具象的感受到,未来这类硬件真的很可能会成为 Agent 的随身入口。
乍一看,A2 的形态乍一看和我们之前熟悉的录音卡很像,但其实产品性质还是不一样。
真正让我觉得有趣的是,它直接变成一个和 Agent 沟通的入口。
A2 内置了一张 4G 物联网卡,不需要插 SIM,也不用连手机蓝牙,设备自己就可以联网。只要 A2 在手边,我就可以直接通过语音给 Agent 派活。
举个例子,我昨天在出差,突然发现社交媒体上 Meta 的 Muse 火了,但我对这个产品一直还没有形成特别直观的理解。所以我直接长按 A2,对它说:
帮我研究一下 Meta Muse,重点看看它和 Codex ,以及 OpenClaw 这种个人 Agent 到底有什么本质区别。不要给我简单罗列功能,我更想知道你最后形成了什么判断。
尽量精简一点,整理成一份 1000 字以内的文档。
录个视频,大家看看:
等了一会。它告诉我已经搞定了,并且简要用语音播报了下核心结论。
打开千问办公,我可以看到一份完整的 MD:
A2 的屏幕上可以直接看到任务的进度:
这样的设计让我感觉到了新的想象空间。毕竟现在我们和 Agent 的交互,已经不用再像以前那样,在软件里一步步点按钮、完成操作。
很多时候,我只需要告诉 Agent 最后想要什么,剩下的事情它可以独立搞定。
这样一来,怎么把意图尽可能低成本地交给 Agent,就变得特别重要。
今年连 Apple Watch 都开始加入 Audio Intelligence。语音会成为下一代 AI 硬件非常重要的交互方式。
同样,它也有语音实时对话的功能。我继续演示下,大家看看。就像 ChatGPT Voice 功能,可以实时问答。录了个屏,手有点抖,大家别介意。
一只手拿硬件,一只手拿手机,还是不稳定……
当然,除了直接给 Agent 派活,A2 还可以录音。我发现很多人还没有理解为什么现在这么多硬件,都在集中做录音功能。甚至我上次写文章有人说,不就是个录音笔吗?
不是。它和录音笔已经完全不是一个逻辑。
以前录音也好,转写也罢,最后主要还是给人回看的。录完一场会,我回去看一遍纪要,或者搜一下刚才谁说了什么。
但现在这些内容可以直接喂给 Agent。这才是录音这一波硬件重新火起来的原因。
模型能力越来越强以后,Context 的重要性反而越来越高。电脑里的文档、邮件、聊天记录,现在都比较容易给到 AI,但我们每天还有大量真正重要的信息发生在线下。
这是没有被数字化过的信息。
比如这两天我在云栖大会,到处跟人聊天。有时候一个展台聊半个小时,对方讲了很多产品细节和自己的判断,我当时根本来不及完全消化。
如果把这段内容记录下来,回去以后直接交给 Agent,让它整理一份 HTML 版本的 Slides。
面试也是一样。
我们团队从去年开始就这么用了。因为公司没有 HR,很多时候我们在面试上的经验其实没那么丰富。
所以现在的流程很简单。面试之前先跟候选人说明一下,我们会录音。聊完以后,直接把整段录音交给 AI,让它重新看一遍这个候选人的回答,然后给我们一些反馈。
我当然不会完全依赖 AI 的判断,但它确实能提供一个第三方视角。有时候你在面试现场会被某一句话打动,或者因为某个细节形成先入为主的印象。
AI 重新看一遍完整记录,反而可能提醒我们一些关键的信息。
这对我来说就很有价值。因为这个时候,录音已经不只是为了留档了。它直接变成了 Agent 理解这个人的 Context。
就像前两年我们经常听到一句话,所有产品到了 AI 时代,都值得重新再做一次。
以前我理解这句话,更多是在想,怎么使用 AI 重构原来的产品。现在看,到了 Agent 时代,很多产品的目标用户开始从人变成了 Agent。录音类的功能也是如此。
A2 有点像给 Agent 加了一只现实世界的耳朵。
毕竟现在很多线上信息,Agent 已经比较容易拿到了。诸如文档、聊天记录、线上会议,本来就都已经数字化。
但线下不一样。
我们和客户在星巴克谈需求,或者同事们在会议室里激烈的争论产品方案,如果没能把这些内容记录下来,AI 根本就不知道背景信息。
所以我觉得,录音这件事到了 Agent 时代,它是在为 AI 收集线下的 Context。说到这,我觉得应该也解释清楚了,为什么所有的 AI 原生硬件都会把录音当成一个重要的能力。
我一直是录音类产品的重度用户。
包括写文章,我经常跟同事说,真正难的不是写,而是写之前先把事情想清楚。我自己最常用的方法就是先说。
把脑海里的模糊想法完整说出来,再跟 AI 来回交流,这样很多原本模糊的思路会慢慢变得清晰。
举个具体例子。下周有新同事入职,会跟我一起做 AI Make Summit 的内容。我之前就想给她写份入职文档,这样人家加入之后立马就能知道工作重点。
这事难倒是不难,但放在以前,我大概率还是会拖到 deadline 前一两天才真正把它搞定。
今天我在出差路上,直接打开 A2 的录音功能,把脑海里的想法一五一十地讲出来。我不需要写,只需要讲出来。
最后再让 AI 基于我这个零散的不那么规整的语音整理出一份文字稿。紧接着,我再改这个文字稿就好了。
我感觉这就是新的基于语音的工作方式。
Sam Altman 之前讲过一个我很认同的判断。今天的计算机已经开始能够看、能够思考、能够理解,但我们和计算机交互的体验,依然大量被过去的产品和界面塑造。
确实挺矛盾的。
Agent 已经可以连续工作很长时间,帮我们写代码、查资料、做文档,处理越来越复杂的工作。结果我们给 Agent 下任务的时候,很多时候还得坐在电脑前。
或者掏出手机,解锁,打开 App,再找到那个输入框。
那未来的 AI 硬件到底长什么样?现在肯定没人知道。戒指、吊坠、手表、耳机、卡片,各种形态大家都在尝试。
但我确定,它只需要解决两件事情。
让我可以随时把自己的意图表达给 Agent。同时,让 Agent 可以持续获得真实世界里发生的 Context。剩下复杂的事情,交给后面的 Agent 自己完成。
今天,从 QwenNote A2 身上,我看到了 Agent 原生的 AI 硬件。
也许还不完美,但毫无疑问,未来已来。







