本文来自微信公众号: 爱范儿 ,作者:关注明日产品的,编辑:肖钦鹏,原文标题:《眼镜这么轻,为何压得苹果抬不起头?|AI 器物志》
智能手机统治了过去十几年的数字生态,它是注意力的黑洞,是我们最私密的随身之物。但手机从设计之初就是为「人盯着它」而生的——它的全部逻辑,都止于屏幕。
AI的需求却恰恰相反:它需要持续感知物理世界——见你所见,听你所闻,随时在场,而非等你解锁屏幕才醒来。
当AI真正成为一种基础能力,它迟早要从屏幕里破壳而出,寻找属于它自己的形状。这将是一个漫长的探索和演化过程。
「AI器物志」栏目由此而来,爱范儿想和你一起持续观察:AI如何改变硬件设计,如何重塑人机交互,以及更重要的——AI将以怎样的形态进入我们的日常生活?
这是「AI器物志」的第26篇文章。
几天前,苹果新任CEO特努斯在法国节目Clique中遇到了一个并不太客气的提问:
Vision Pro究竟是一场测试、一次失败,还是未来计算的第一步?
特努斯的回答是:「It is the early days of a long journey.」(这是一段漫长旅程的起点)
不过确实,第一代Vision Pro至少证明了一件事:今天的技术,已经可以把一台性能强大的计算机戴到脸上。
做到这一步之后,问题也开始变得复杂。

图|Hypebeast
科技公司,开始重新学习眼镜
就在不久前举行的Meta Connect上,Meta与依视路宣布,到2026年底,双方将在Ray-Ban、Oakley和Meta Glasses等产品线上提供超过100种眼镜的款式选择。Meta称,这是迄今规模最大的一次AI眼镜产品线扩张。
超过100种SKU选择,这种规模放在我们常见的服装或者饰品行业里确实不算稀奇,不过这在消费电子市场确实少有。

图|Meta
毕竟,科技公司最熟悉的是标准化生意。
几种颜色就可以让一台iPhone卖到世界各地。用少数几个硬件型号覆盖大多数用户,再把个性化交给软件和配件,这套方法支撑了过去几十年的消费电子产业。
饰品不是这样的。
一个包或一块手表,会因为材质和颜色衍生出几十种产品。同一套功能如何进入不同的设计,本身就是生意的一部分。
因为人的脸没有标准答案。眼镜也是如此。
方框还是圆框,粗框还是细框,这些问题在手机上只是换个不同颜色的手机壳的事儿,到了眼镜上,直接成为了产品本身的问题。
再者,眼镜直接参与一个人的个人形象。消费者面对它时,很难像面对手机或耳机那样,用功能参数来简单地抉择。
所以,我认为Meta与Ray-Ban的合作不只是通常意义上的科技联名。Meta借来的是一个品牌标识,同时还有消费电子公司过去并不熟悉的产品方法论。
眼镜不是一个等待功能填满的硬件容器。它首先必须是一件人愿意戴在脸上的东西,之后才谈得上视觉计算设备。
这种思路也体现在Meta的另一款产品上——Meta VR Glasses。
这可能是今年Meta最不像一副普通眼镜的「眼镜」。
Meta VR Glasses依然是一台完整的VR设备。它有沉浸式显示和空间感知,也支持眼动追踪与手势交互。从它想实现的体验来看,甚至可以把Meta VR Glasses理解成Meta版本的Vision Pro。
两者有一个很关键的区别。
Vision Pro的思路,是尽可能把完成这套体验所需要的计算能力整合进头显本身。即使第一代已经把电池单独外置,主要的计算、显示和传感系统仍然集中在头部设备里。
Meta又往前走了一步,开始拆解整台「头戴计算机」。
Meta VR Glasses的眼镜本体重约100克,主要保留显示和传感器。处理器、电池与存储都被放进一个独立的puck,通过光纤与眼镜连接。我可以将它别在腰间,也可以放到桌子或包里。
换句话说,Meta没有为了轻而放弃了VR的核心体验,它选择了先接受作为一个「眼镜」形态的物理边界,再去重新分配这些体验所需要的计算。
一副真正需要戴在脸上的设备,能容纳多少重量和体积,不是一个无限扩张的工程参数,最终都要由人的鼻梁、耳朵和头部承担。
这好比一笔有限的预算。
Meta将这笔预算优先留给了显示、光学和传感器;计算、电池和存储对位置没有那么敏感,于是被移到了口袋里。Meta保留了VR的主要体验,也把原本集中在头部的重量重新分配到了身体的其他位置。

这或许是理解今天视觉计算产品形态变化的一种方式:「眼镜」既是一种产品形态,也是一套决定功能如何取舍、计算如何分配的标准。
苹果最近的动向,似乎也在印证这个思路。
据彭博社记者Mark Gurman报道,苹果内部正在探索代号N224的新一代Vision设备,目前有大约四种设计方案。
其中一个方案保留了现有Vision Pro的大致形态,通过塑料、钛等材料继续减重。另一个方案则接近Meta VR Glasses,计算单元与电池会一起离开头部,进入独立的外置设备。
这个方案或许仍处在很早期的阶段,苹果内部对外置puck也存在不小的分歧。不过,连苹果也开始考虑重新安排计算的位置,已经说明了一件事。
下一代头戴设备需要回答的,不只是性能还能提升多少。还有:
脸上的「预算」,应该花在哪里
既然脸上的预算有限,接下来的问题就是,应该把它花在哪里。
从当今视觉计算行业给出的答案,大致可以看成三种。
最直接的一种,是干脆砍掉功能。Ray-Ban Meta是这个路径最典型的代表。
直到最新一代,它依然没有显示屏。Meta把有限的空间留给摄像头、麦克风、扬声器和电池,摄像头负责记录用户看到的画面,麦克风和开放式扬声器承担交互,Meta AI则可以根据镜头捕捉到的内容回答问题。
它可以拍照、录制视频和播放音乐,也可以告诉你眼前的建筑是什么。

少了一块显示,也就少了一套光学系统。Ray-Ban Meta可以维持接近普通眼镜的形态,把拍摄、音乐和AI交互放进一副适合日常佩戴的镜框里。
普通眼镜的外形,以及低功耗,意味着你可以真的把它戴在脸上一整天,不需要不断意识到自己正在使用一台计算设备。
从目前的出货量看,这也是最成熟的一条路线。
Counterpoint Research的数据显示,2026年上半年,无显示屏AI眼镜占全球AI眼镜出货量的96%。带有光学透视显示的AR&AI眼镜只占约4%,出货量却同比增长了449%。
另一条路线,是控制能力的边界。在我看来,目前大部分AR&AI眼镜都可以放进这条路线。
Rokid Glasses就是一个典型的例子。
它重约49克,同时保留了摄像头、扬声器和双目MicroLED显示。它可以拍照、播放音频,也可以把导航、翻译和提词直接放到眼前。
乐奇的选择像是尽量把这些能力都留下来,但每一项都有所克制。显示采用单色MicroLED,视场角控制在30度,分辨率为480×640,主要用来呈现文字和简单的信息提示。
它有显示,却没有继续追求更大的视场角和复杂的空间画面;不过仍然保留摄像头和扬声器,让拍摄、音频和AI交互都能留在一副日常眼镜里。
雷鸟在RayNeo iO上用了另一种取舍。既然一副眼镜的空间有限,与其让每一种能力都占据一部分预算,不如干脆决定哪些事情不需要由眼镜来做。
它同样使用透明的单色MicroLED显示,却把重量进一步压到了33克。摄像头和扬声器都被拿掉,只留下麦克风负责声音输入。眼镜不负责拍摄,也不负责播放音乐,功能集中地用来承担字幕、翻译、通知和提词这些视觉信息。
这也是这个产品形态有意思的地方。
有限的脸上空间没有让这些产品走向同一种答案。厂商在同一副眼镜里留下什么、拿掉什么,又把每项能力控制到什么程度,最终带来了完全不同的产品定义。
乐奇选择保留更多能力,再限制每一种能力的规模;雷鸟则直接缩小眼镜需要承担的任务,只留下完成视觉信息提示所需要的硬件。
于是,同样是MicroLED、光波导和日常眼镜的形态,仅仅因为留下什么、拿掉什么不同,两款产品就有了完全不同的定义。
最后一种路线,是把这笔预算拆开,分配到不同的设备上。
当一副眼镜想要承担的能力越来越多,镜框本身很快就会到达极限。厂商于是开始重新安排整台计算机,把必须贴近眼睛的显示和传感留下,再将位置没有那么敏感的部分移到别处,也就正如上述Vision Pro和Meta VR Glasses的方案。
至此,我们其实可以大致看清视觉计算市场正在生长的轮廓。
有限的空间,厂商无法把所有功能同时留下。每一次取舍,都会改变产品适合的使用场景,也会改变它最终呈现出来的形态。
摄像头与显示之间的选择,区分了感知和呈现。全天佩戴与沉浸体验之间的选择,又把产品推向了普通眼镜和空间计算设备的两端。有人希望眼镜理解自己看到的世界,有人在意信息能否直接出现在视野里。
到了完整VR体验这一级别,计算和电池究竟放在头上还是口袋里,又会带来另一套产品结构。

今天智能眼镜之间的分野,就是从这些具体的取舍中逐渐形成的。
有限的空间没有让智能眼镜变成一个能力有限的品类,反而成为塑造这个品类的力量。
现在,轮到计算适应眼镜
接受眼镜的边界,不意味着只能不断做减法。
今年的Snapdragon Summit上,PrismML展示了Bonsai,一款面向智能眼镜设计的2B视觉语言模型。它可以直接运行在搭载Snapdragon AR1 Gen 1的智能眼镜上。
作为一个多模态的模型,它能够在本地理解佩戴者看到的内容,并实时给出回答。
相比模型本身的能力,我认为值得留意的是PrismML解决问题的方式。
曾经,当眼镜跑不动一个模型的时候,最自然的解决方式是把计算交给别的地方。
手机、云端…眼镜只需要负责收集信息,再把结果呈现回来。
这也是过去很多可穿戴设备默认的计算架构:真正强大的计算发生在远处,戴在身上的设备只是一个入口。
当然,这是的确是一种适应眼镜形态的做法。但这种适应,只是在既有计算体系里给眼镜找位置。
模型依然可以按照服务器或者手机的条件设计,只是在真正需要运行它的时候,眼镜把任务交给另一个拥有更充足算力、内存和功耗的设备。
某种程度上,眼镜仍然处在整套计算系统的末端:它负责感知和交互,真正的计算由其他设备完成。
Bonsai有意思的地方,是它把这种适应继续往前推进了一步。
它没有继续要求眼镜去适应一个原本为服务器、PC或手机设计的模型,反而开始要求模型适应眼镜。
模型的精度、大小、内存占用和运行方式,都围绕一副眼镜所拥有的几瓦功耗、有限内存和散热能力重新设计。
Bonsai的语言模型部分被压缩到1-bit,并针对Snapdragon的Hexagon NPU进行优化,本质上都是为了让原本很难发生在眼镜上的计算,能够留在眼镜上。
于是,眼镜不再只是决定「计算应该发生在哪里」,也开始决定「计算应该以什么样的方式发生」。
回头看,John Ternus所说的「漫长旅程」,也可以有另一种理解。
我们可以将其看作科技公司重新学习克制与取舍的过程。
技术进步当然会让眼镜容纳新的能力。芯片会继续缩小,模型会继续轻量化,显示和电池也会持续进步。可这些变化不会替产品做出选择。
每增加一项功能,都会重新改变重量和续航,进而影响一副眼镜最终看起来是什么样子,人又愿意戴它多久。
眼镜离人太近了。
它停留在视线里,压在鼻梁和耳朵上,也直接成为个人形象的一部分。计算进入这样一个位置以后,衡量进步的标准也会发生变化。
强大的性能仍然重要,不过设备能否舒服地停留在人身上,同样是各个厂商需要探索的课题。
当计算来到脸上,缩小只是第一步。下一步,是学会成为一副眼镜。







