本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《OpenAI 买下 iPhone 人像模式幕后功臣,要给 AI 装上一双新眼睛》
过去一周之内,连着两台新手机产品刷屏,一台是Apple新出的iPhone 18,一台则是豆包手机助手消费者版发布——首款搭载机型努比亚NaviX Ultra在今日开售,AI将进入手机系统,我们也做过详细测评。

AI开始看见屏幕,也开始伸手触碰屏幕。与此同时,《华尔街日报》透露,OpenAI已经以超过3亿美元收购相机技术公司Glass Imaging。

交易尚未得到OpenAI公开确认,但这块新拼图出现的位置十分微妙:去年,OpenAI花65亿美元收购了Jony Ive创办的硬件公司io后,还没有做出大名堂,工业设计师和相机工程师就已经先后到位。
是AI,但不是修图AI
Glass Imaging由Ziv Attar和Tom Bishop创办,两人此前都曾在苹果从事计算摄影工作,并参与过iPhone人像模式的开发。
不过,Glass Imaging研究的不是今天最常见的AI修图,是用AI反过来影响相机硬件的设计逻辑。
手机按下快门后,传感器最先得到的并不是一张可以直接观看的照片,而是一堆原始光信号。传统的图像信号处理器需要完成降噪、校色、锐化等工序,才会在屏幕上生成最终图像。
Glass Imaging试图用一套针对具体镜头和传感器训练的神经网络接管这条流水线。它的技术底层还是Neural ISP,传统ISP会把RAW数据依次交给去马赛克、降噪、多帧融合、锐化等模块,每一步由独立算法处理,也会在过程中丢掉一部分信息。
GlassAI则从传感器的RAW连拍数据出发,把去马赛克、降噪、去模糊、多帧融合放进同一个联合训练的网络,同时加入传统ISP不擅长的镜头像差反卷积和传感器串扰校正,最后直接输出成品RGB图像。

以Neural ISP为基础,Glass Imaging吸收并重写了传统ISP的大量核心环节。它需要学的是,一台相机如何产生误差,再在图像形成时把误差倒推回去。Glass Imaging的思路是,镜头只要把足够的信息送到传感器,剩余的模糊、色差和畸变可以交给专门训练的网络修复。

但这里所谓的「修复」并不是指AI修图那种意义上的「修」,生成式修图,的确可以把远处模糊的文字、月亮和人脸「猜」得更加清晰,但清晰不等于真实。Glass Imaging的资料称,其网络针对具体光学系统和RAW数据训练,目标是恢复传感器实际捕捉到的信息,而不是凭常识和推论生成新的纹理。
相比于AI目前在图像处理中的主要作用,这很不一样,原因在于:如果摄像头只是为了拍朋友圈,照片好看即可;可如果图像要交给Agent判断现实并采取行动,那么凭空补出来的物体和文字就可能导致错误操作——这才能理解OpenAI为何会对它感兴趣。
AI设备的两种「观看权」
对手机厂商来说,Neural ISP技术可以让更小的镜头拍出更清晰的照片;但对一家正在制造AI硬件的公司来说,它还有另一层意义:模型看到的世界,首先取决于摄像头交给它什么。
AI设备需要两种「观看」能力。第一种发生在屏幕以内,AI要看懂用户正在浏览什么,读取哪些本地信息,还要获得调用不同App的权限。在这个基础之上,理解整个操作系统里的上下文。

第二种发生在屏幕以外:菜单上的文字、桌上的物品、眼前的道路和房间里的设备,无法只靠聊天记录就让AI「知道」,需要先拍下一张照片,再把照片交给AI。
照片是人观看的终点,却可能只是Agent工作的起点。未来的AI设备若要及时行动,就必须缩短「人看见、拍摄、上传、询问」这一整条链路。
摄像头的身份也因此发生了变化,过去它替人保存值得回看的画面,在未来,将变为向机器提供判断下一步行动的依据。
GlassAI的变焦技术已经进入荣耀600系列,说明它至少完成了从模型、手机芯片到量产设备的适配;公司还曾在骁龙8 Elite Gen 5参考设备上展示实时4K视频处理和20倍以上变焦增强。
这些能力目前是被用来让人把远处拍得更清楚,在未来,当摄像头连接的不是相册,而是一个准备采取行动的Agent,成像的评价标准就会发生变化。
照片不只要看起来漂亮,还要尽可能真实、稳定、及时地呈现文字、物体和空间关系,因为模型接下来可能据此识别商品、操作设备,甚至规划行动。
倒不是说,GlassAI会让相机自动变成智能体,却补上了智能体进入现实之前最底层的一环:尽量把传感器实际看到的信息,准确地交给模型。
Glass Imaging揭示的第一种变化,是硬件与软件之间的分工被重新划定。过去,相机厂商先尽量用镜头和传感器解决像差、模糊与噪声,再让ISP修饰最终图像;GlassAI则允许硬件保留一些能够被计算逆转的缺陷,只要传感器还捕捉到了足够的信息,专门训练的网络便可以在成像过程中将其恢复。镜头因此可以更小,像素可以继续缩小,一部分原本需要增加镜片、厚度和成本才能解决的问题,被转移给了神经网络。

那么就有可能,未来AI设备的硬件,不必得被完整设计出来之后,再往里面「塞一个模型」。镜头、传感器、NPU、内存和模型会从一开始共同设计,传感器负责保留哪些原始信号、神经网络能够修复哪些误差、设备需要多大的本地算力、能否在低功耗状态下持续理解环境……这些问题都将反过来影响硬件的形状。
比如说,假设工程师提前知道,某些光学缺陷能够被神经网络稳定修复,下一代相机在选择镜头数量、像素尺寸、传感器和机身厚度时,就可以包容过去无法接受的缺陷。可能是不再通过堆叠更多镜片彻底消除像差,也可能是确保传感器仍然保留足够的原始信息,再交给AI恢复。

同样的逻辑也可能延伸到麦克风、空间传感器和其他感知部件。过去,硬件负责把世界尽量完整地记录下来,软件只在事后处理;未来,硬件只需要捕捉模型能够理解和还原的信息,模型则从一开始参与影响硬件应该怎样观看世界。
模型不负责决定摄像头看什么,却会改变相机必须用多少硬件,才能得到一幅足以被还原和理解的图像。







