施柏鑫在北京大学攻读硕士期间,读到了日本东京大学池内研究室关于吴哥窟数字化重建的论文:为了对这座庞大的寺庙群进行三维建模,团队曾用热气球将三维扫描仪吊上高空采集几何数据。这篇论文让他觉得三维视觉很酷,促使他申请了东京大学,并把光度法三维重建作为了自己的博士研究课题。他的学术路径一路延伸:计算摄像、事件相机、脉冲相机、视频生成、具身智能,表面看跨度很大,内核却始终如一。
在他看来,“成像管线上的任何一个环节都可以被颠覆”——这正是计算摄像学的核心方法论:从光源、镜头、传感器到算法,把整条成像管线重新定义一遍。
作为IJCV新任主编,他也在思考:当投稿量激增、AI生成内容大量涌入,期刊应该鼓励什么样的研究?他的答案很明确:经过完整实验、长远来看值得存档的工作。在他看来,计算机视觉的研究远没有结束——物理AI时代带来了更多有挑战的视觉问题,从传感器到模型都存在持续创新的空间。
在这篇专访中,施柏鑫将分享他从事计算机视觉研究近20年的完整学术历程,以及他对计算摄像学、具身智能和学术生态的系统性思考。
采访&编辑:梦佳 程赞 熊宇轩
要点速览
计算摄像学的核心方法论:“成像管线上的任何一个环节都可以被颠覆”——从光源、镜头、传感器到后处理算法,要把整条成像管线重新定义一遍。
与计算机视觉的区别:CV是接收图像,产出其他东西;计算摄像关注的是“往前移”的过程——从JPEG到传感器上的RAW信号,再到物理世界里的光照和反射率。
具身智能的瓶颈判断:机器人看到的世界不是人看到的,相机输出的RGB图像只是物理世界经过成像与处理后的表征,并非原始物理信号本身。机器人不该用人眼习以为常的图像看世界,“什么才是最适合机器人的感知方式?”这里有底层创新的空间。
下一阶段的突破方向:把视觉感知、物理建模和主动探索结合起来,从成像到几何材质到物理到动作,打通第一性原理和数据因果链条,是有可能产生核心突破的方向。
对学术生态的反思:所有事情都变得越来越高效的时候,记得给科研和生活留一点“低效”。可能就是这些看似低效的行为,恰恰帮你找到了“什么问题值得深入、什么研究值得投入”。
对年轻学者的建议:不要过度追求数量和指标。真正有区分度的判断,一定是经过深入思考的,而不是让AI草率地替你决定。
智源专访栏目意在展现行业顶尖技术研究者和创业者的研究经历和故事,记录技术世界的嬗变,激发当代AI从业者的创新思维,启迪认知、关注突破性进展,为行业注入灵感光芒。本次专访为总第42期。
简介:施柏鑫,北京大学研究员(长聘副教授、博导),计算机学院视频与视觉技术研究所副所长,相机智能实验室(http://camera.pku.edu.cn)负责人;科技部重大专项首席科学家,基金委重点项目负责人,北京市领军人才(高聚工程入选者),智源学者,北大-智平方具身智能联合实验室主任。日本东京大学博士,麻省理工学院媒体实验室博士后。研究方向为计算摄像学与人工智能,发表TPAMI论文38篇,计算机视觉三大顶级会议论文125篇。论文获评CVPR24/ICCP15最佳论文亚军、CVPR26/3DV26/ICCV15最佳论文候选,获得日本大川研究助成奖(2021)、中国电子学会青年科学家奖(2024)。担任国际顶级期刊IJCV主编、TPAMI编委。
01
从北邮到北大,从东大到MIT——一条计算机视觉底层的探索之路
Q1:可以先聊聊您早期的求学经历吗?
施柏鑫:我本科在北邮信息工程学院,硕士在北大,师从许超教授。硕士期间,查红彬老师的三维视觉课是把我带入计算机视觉领域的启蒙课。通过这门课,我了解到东京大学池内克史(Katsushi Ikeuchi)研究室在做高精度三维重建——以巴戎寺为起点,逐步攻克大规模、高复杂度石造建筑的三维数字化难题。
在完成这门课的期末作业时,我认真读了一篇PAMI 2006年的论文,花了一星期逐字读完。这篇文章对我冲击很大——周围同学大多在学习模式识别和图像分类,但我发现原来还有这么具体、直观、有视觉冲击力的研究方向。从那时起,我对三维重建产生了浓厚兴趣,博士申请时便选择了东大这个实验室。当时它在国际上的研究成果非常领先,加上北大与东大有合作项目、提供奖学金,当然(有硕士学位的情况下)三年即可获博士学位,这也是一个重要考量。
图注:施柏鑫在东京大学和MIT Media Lab求学和工作时的照片
我真正接触相机研究,是到MIT做博士后开始的。我当时在Media Lab工作,更具体的是在"Camera Culture"组,是计算摄像领域国际顶尖的实验室。后来我回国给实验室取名"Camera Intelligence",多少受了Media Lab课题组命名风格的影响——他们喜欢用两个单词的组合,辨识度很高。在MIT之后,我还在新加坡科技设计大学(SUTD)工作了一段时间,得到了新加坡政府和MIT合作的项目资助,全球所有方向只选10人,按照教职的标准培养,所以我当时独立建设并讲授了一门本科生课程,同时在MIT和SUTD也都协助指导过一些研究生。回国前,我在日本产业技术综合研究所人工智能中心工作,那是一份相对独立的职位,以PI身份主持过日本政府的项目。
博士毕业到入职北大,中间隔了四年——在CS领域,这时间不算短。但这四年让我在不同国家、不同学校积累了上课、带学生、独立主持项目的经验,让我回国建组时少走了不少弯路。
Q2:为什么三维重建会选择佛像、吴哥窟这些对象?
施柏鑫:池内研究室的吴哥窟项目,是一个自2003年启动并持续十余年的长期计划。当时的背景是,像吴哥窟这样的世界遗产,随着时间推移会越来越脆弱,是有倒塌的风险的。当时柬埔寨在遗产数字化保护方面的科研与经费条件有限,因此项目采用了国际合作的方式,日本、德国等团队参与其中。当时无人机尚未像今天这样普及,吴哥窟规模很大,于是团队用热气球把三维扫描仪吊上去采集几何数据。这部分内容是池内研究室几何(Geometry)组的主要工作,采用的是激光扫描方法加上多视点几何做三维重建的方法。除了几何细节,表面的多光谱反射率恢复也很关键,这个就是我所在的光度(Photometry)组承担的任务。
我的导师后来将这一方向命名为E-Heritage,在CVPR等顶会还组织过Workshop,还由Springer出版了一本专门的书,名为Digitally Archiving Cultural Objects,完整记载了整个项目的研发历程。
Q3:在辗转多个机构的早期经历中,对您影响很深的人有哪些?
施柏鑫:在北大读硕士时,我的导师是许超老师,一位很有智慧的学者。研一结束后,我决心出国但目标未定,许老师很尊重我的想法,给了我充分的自由去探索。包括现在我们实验室平等、尊重学生的氛围,也延续了那段经历的影响。
硕士期间,我在微软亚洲研究院实习,跟随松下康之老师接触到了光度三维重建方向,读博期间一直得到他的指导。十多年来我们一直保持着合作,他后来去大阪大学任教,我也和他共同指导过那边的学生。构成我博士论文的几篇关键论文,共同作者的阵容还是很“强大”的——汇集了Physics-based Vision/Photometric Stereo领域跨越几代的代表性研究者——论文只有四个作者:我是第一作者,后面是现在香港科技大学的谭平老师、松下老师,最后是我的导师池内先生。三位老师来自不同学术世代,研究经历跨越数十年。
当时实验室只有我一个人在做这个方向,而合作老师都不在东京。每周的讨论,别的同学都分小组线下进行,只有我的名字被单独列在导师的日程里。周会要同时面对三位老师,压力不小,但每位老师在我的每一项工作中都给予了不同角度的帮助:谭平老师在公式细节上讨论最多,松下老师把控研究方向和论文叙事,池内先生虽然很忙,每天早上4、5点开始回邮件、日程排到晚上(我们实验室的大组会基本都在晚上),甚至中间经常没有吃饭的时间,仍坚持每周与所有学生开会;先生当时已经是国际上最资深的计算机视觉教授之一了,还能保持如此的勤勉和专注,这种工作态度一直影响着我。
Q4:2017年回国之后,实验室是如何从0到1搭建起来的?
施柏鑫:刚回国到北大时,我组里一个学生都没有,当年的博士名额也比现在紧张很多,我自己名下的学生是2019年才入学的。但幸运的是,当时北大和新加坡南洋理工大学有个联合研究所,我回国的前两年比较深入地参与了这个项目,有幸得到了高文院士和Alex Kot院士的共同指导。那两年CVPR截稿前的集中攻关,我都是在新加坡进行的。这段经历让我在自己实验室尚未完成组建的情况下,科研进展仍得到了很好的延续,当时培养的学生、博后,有人在香港拿到了教职,也有人获得海外优青项目支持后回国工作。
在独立建组的方向选择上,当时国内做计算摄像的团队相对较少。美国顶校2009年左右就有了这类方向和课程,在MIT同样主题的课程有两三门;国内做计算机视觉的老师虽多,但研究多集中在高层视觉,专注底层成像与计算结合的团队相对较少。这是个相对“高冷”的方向——引用量不高,门槛不低,发文周期长,还要动硬件。我本科和研一接触过电路设计,一直觉得软硬结合的方向很有意思。
但要从头建这样的综合实验室,难度确实大。我初期没有直接铺开光学平台和暗室搭建,而是先从偏算法、相对“短平快”的方向入手,先让自己和学生建立起信心。积累多了以后,从自己最熟悉的光度法开始,发布了该领域的一系列基准数据集,有了一定的积累之后,才逐步开始尝试新方向——关注事件相机及其与计算成像问题的结合。在学校和国家工程研究中心的支持下,目前实验室已经建成了包含众多先进设备的专业相机研发平台。
图注:Camera Intelligence实验室首页
02
计算摄像学的创新空间:“成像管线上的任何一个环节都可以被颠覆”
Q5:计算摄像学这个学科的研究重点和现状是怎样的?
施柏鑫:从胶卷时代到数码相机,再到计算摄像,以及现在AI的广泛使用,成像过程始终可以抽象为从光源到最终图像的一条模块化处理链路;这个流程里的任何一个环节,都可以再创新、甚至被颠覆。
光线进入成像系统,首先经过镜头聚光,投射到一个承接面上——以前是胶卷,现在是CMOS或CCD等数字图像传感器。之后还要经过一系列处理,从模拟时代的“洗照片”,到数码时代的ISP流程,再到现在的AI修图,本质上都是把光强信号转换成适合人眼观看的图像。我要求我的学生必须把这个流程刻在脑子里,带着这个习惯去思考相关科学问题,思路就清晰很多。
计算摄像就是在上述环节中的一处或者几处进行创新:经典镜头可以换成透镜阵列或光学调制模块;传感器可以是脉冲相机、红外、光谱等新形态传感器,甚至毫米波雷达、太赫兹传感器都可以——它们都可以作为不同物理信号的感知前端。算法的空间更大,前面各类传感器输出的信号如何预处理、如何变换、如何后处理,每个环节都有不同的可能性。
跟计算机视觉的区别也很好理解:CV是接收图像,产出其他东西;计算摄像关注的是“往前移”的过程——从JPEG到传感器上的RAW信号,再到物理世界里的光照和反射率。从源头重新“发现”整条管线,才能挖掘出超越图像平面、但本就蕴含在场景中的物理属性,进而打破瓶颈、突破性能。
大模型出来的时候,我跟学生说不用太焦虑——拍照的目的是固定光线,把精彩的瞬间变成“永恒”,只要人们还需要记录光线、跟物理世界打交道,我们这个方向就不会这么快被模型取代。
Q6:计算摄像学、事件相机、生成式AI和具身智能这些方向在您的研究体系中是什么关系?
施柏鑫:虽然计算摄像门槛较高、略显小众,我们也仍积极拥抱AI、大模型和具身智能带来的新变化。随着团队扩大,研究兴趣更广泛的同学们也在推动我去探索更“通用”的方向。
我写过一本教材叫《计算摄像学:成像模型理论与深度学习实践》,如题目所述,希望兼顾理论和实践。教材来源于我在北大开设“计算摄像学”课程的讲义积累。起初设计这个课程的时候(2016-2017年),深度学习在成像领域还没有像今天这样广泛应用,所以我一边讲课、一边思考,成像中哪些环节可以“学出来”、哪些不能。这个课在北大开了8年了,现在每讲一个主题,我都会在课上用最新的AI技术去尝试,发现有些问题已经被颠覆,然而也有些问题当下的AI还无能为力。这个过程也让我看到,求解一些问题的根本思路其实并没有变。
我们实验室有一些同学在做视频生成和世界模型的研究,这个方向跟智源的合作最多。视频生成被一些研究者视为“世界模拟器”或“世界模型的分支”,既然它有如此强大的建模能力,在拍照的构图、影调等问题上能否派上用场,也是我们最近关注的方向。
对于具身智能,虽然技术路径还没有统一答案,但有一点大家逐渐形成了共识:未来的智能终端不能只停留在屏幕中的二维世界,而必须进入真实环境,弥合感知与物理世界之间的鸿沟。机器人要完成日常任务,除了语义理解之外,如何感知三维形状、材质、光照、摩擦、透明、反光等底层物理属性,并据此与复杂环境交互,这里面有不小的挑战。
现有研究的关注点多在模型上,而传统RGB成像与处理过程会压缩甚至丢失场景中的绝大多数物理信息。让机器更好地理解真实世界,成像底层可能不是一个边缘问题,而是机器人能否可靠行动的基础。
传统相机的瓶颈始终存在。可以类比RGB-D相机在2010年代初给计算机视觉带来的变革——从二维走向三维,影响深远。特斯拉的FSD技术路线高度依赖摄像头,但具身智能面向的任务和环境通常比自动驾驶更开放、多样。只依赖传统图像会不会造成不可跨越的鸿沟?有没有更高效的面向Physical AI的视觉信息采集方式?深度适配Physical AI复杂环境的原生数据模态是什么?例如,事件相机和脉冲相机用稀疏的表达来捕捉光影变化和高速运动,但是这种优势仅仅意味着“看得”更快吗?能否进一步帮助机器人感知几何、材质等更多物理属性,并对应产出更高效的token表征和模型架构?上述问题,从感知的源头寻找答案,可能会有新的突破。
Q7:如果选2-3篇代表作,您会选哪几篇?背后是否存在一个核心的科学问题?
施柏鑫:第一篇是2019年TPAMI上的光度立体数据集DiLiGenT,它是2016年CVPR论文的扩展版。这个工作延续了从2009年我在北大读硕士就开始的光度立体方向。当时做这个方向时,这个领域缺少带真实值的实拍物体基准数据集。我博士期间的论文,实拍实验都是从实验室找几个物体放到暗室里拍摄;由于缺少真实值,实拍结果主要做定性展示,定量结果则依赖合成数据测试。我一直想改变这种状况。后来在新加坡几位老师的帮助下,最终完成了这项工作。我们对当时一批代表性方法做了系统评测,从而深刻意识到这个领域还有哪些问题需要解决。这个数据集为光度立体实拍数据建立了标准化评测基准,成为该领域广泛使用的benchmark之一,并推动了深度学习技术在光度立体方面的应用。在此基础上,我们与国内其他高校合作,又连续推出了DiLiGenT的一系列“续集”光度立体基准数据集。
图注:“相机智能”实验室网站部分论文展示(https://camera.pku.edu.cn/publication)
第二类工作是2020年CVPR的两篇文章,展示的是同一个系统,用在两个不同的应用上。我们把事件相机和传统RGB相机通过分光镜同步采集信号:一篇做高动态范围成像,另一篇用图像信息给事件信号去噪。这是大陆高校较早在事件相机方向发表于视觉顶会的工作之一,后来国内外也有多个团队沿用或发展了这类混合成像思路。
当时我的想法是:主流事件相机虽然具有高动态范围等优势,但当时多为单色、分辨率也较低,不符合我心目中“拍照”应该追求的效果。所以我借鉴了计算摄像里经典的“混合相机”思路——把两个相机拼在一起,据我们当时的调研,还没有看到同类的混合系统设计。后来,我们用这个系统先后探索了事件引导的卷帘快门矫正、焦点堆栈拍摄等问题。相关研究得到了国际顶尖专家的关注,事件相机领域先驱、早期DVS核心研发者Tobi Delbrück教授邀请我在他组织的研讨会上做报告,我给这一系列研究起了个名字叫做 “神经形态辅助摄像”。
第三篇是2024年CVPR的最佳论文亚军——EventPS,也是北大历史上首次获得这个奖项。这个成果不是偶然,恰好是把我们两个最有积累的方向结合在了一起:事件相机+光度立体。
当时组里的同学提了个想法:让光源动起来,用事件相机拍。我一开始觉得像一个A+B的问题,但跟大家推导下去发现完全不一样——事件差分模式使我们建立了区别于传统帧式方法的光度成像模型。我们发现了三条非常优美的性质,最后把问题变成了一个Ax=0的线性方程求解。
这是一篇2024年的文章,我们主体方法没有用深度学习,也没有生成式模型。通过光源和相机的联合设计,仅仅通过求解Ax=0就产生了性能突破。配合快速旋转的定制光源,我们把事件相机的数据吞吐推到了带宽极限——最终呈现了一秒钟30帧的物体法线视频。
这里的核心科学问题是,如何从光源到传感器到算法,把整个流程重新定义,产生性能突破。相比纯被动采集,主动光可以为几何、材质、反射率、光谱以及机器人与物体的相对位姿等属性提供更多可观测信息。我们也在尝试把这类思路延伸到具身智能等方向,并探索改进这种结构,从光源到最终输出,不只是输出几何形状,还希望输出能够跟真实世界交互的行动信息。
03
具身智能的下一站:从成像底层重新理解机器人感知
Q8:软硬件协同设计是否是一种克服CV领域"topic枯竭"的新范式?这对研究者提出了哪些更高要求?
施柏鑫:我个人感觉软硬件协同非常重要——要深入物理世界,就得有软硬件配合的系统。但研究方向的取舍,不能只盯着“好发文章”,还得看这个课题是否能产生实际价值。
成像方向门槛略高,但论文命中率比较稳。我们沿着EventPS的思想做了一系列后续工作,在实验室内部形成了传承,最新的成果是一篇被SIGGRAPH Asia接收、发表于ACM TOG的论文。在当前顶会审稿存在较大不确定性的环境下,目前这几篇后续工作都被录用(几乎都是一次中稿),其中多篇为Oral或Spotlight。
软硬件协同设计的文章研发周期比较长,很考验同学们的耐心,尤其是在这个科研产出“飞速”的时代。当然,门槛高、多打磨也有好处——充分打磨也更容易体现工作的完整性和区分度。上面那篇SIGGRAPH Asia的文章,牵头的同学投入了一年多时间,从大三进组做到了博士入学,跟组里有些方向三个月一篇的周期相比,肯定不算快。我曾经问过这位同学,看着进组的其他本科生都已经发表了论文,有人还不只一篇,着急不着急?他最后用实际行动证明:保持专注、把底层算法和代码优化到极致,最终搭建出可以实时运行的演示系统,就可以产出一篇一次投稿即被录用、且有区分度的论文。上面这些工作的产出过程,可能就是对软硬件协同设计研究提出的更高要求。
补充一个题外话,这位同学曾是代表北大参加全球超算竞赛并获得总冠军的队伍成员。高性能计算与系统优化在AI时代是当下很有“钱途”的方向,但他加入我们实验室时跟我说,感觉研究软硬件协同的成像问题会有更高的“上限”。另外,指导他一起做这个工作的是EventPS的一作,这位同学是NOI的金牌,但是特别爱折腾硬件,宿舍都有烙铁。
Q9:如何判断一个研究问题是真正重要的,而不是短期刷榜?
施柏鑫:我个人经历的学术训练比较传统,就是推导公式、求解优化、仿真实验、实拍数据,一步步做下来的。早期带学生,也是手把手推成像公式,求解优化可能变成了设计神经网络,但是从仿真到实拍的实验验证流程基本是不变的,这套完整的实验验证流程也让我很有成就感。现在很多问题,我也很难解释清楚——模型太大了,但“大力出奇迹”确实也解决了很多以前解决不了的问题。
我们团队在保持现有“品味”的同时,从来不排斥新的方向。扩散模型刚出来的时候,实验室几乎全员都在尝试,手头的问题能不能都“扩散”一遍。而我们的研究方向也一直在随着技术的进步发生调整。有些同学在成像方向已经做得比较扎实、积累了足够的高水平成果之后,我会鼓励他们尝试更热门的方向——比如多模态大模型,去在工业界做一些工程上的探索,短期不发表论文。我最近也特别爱跟同学们讨论:大模型时代的科研应该怎么做下去?
所以很难说什么问题真正重要,但一个实验室可以要求它一直保持足够高的“品控”。
Q10:具身智能存在传统控制、数据驱动以及两者结合等不同路线,您个人更倾向于哪条路径?最大的瓶颈是什么?
施柏鑫:技术路线方面,我不是控制方向的专家,但数据驱动我从2016年就开始做,肯定认为它还是挺重要的。
我们与智平方成立了具身智能的联合实验室,研究布局涵盖了具身智能的多个方向,但我们团队的课题主要还是专注于涉及第一性原理、三维视觉和软硬件结合的底层方向,比如今年被ECCV接收的数字孪生辅助数据聚合方法,以及刚刚被CoRL录用的新型视触觉传感器技术。
当前联合实验室进入了第二年,我们的思路也越来越开阔:根基在传感器,从第一性原理出发做具身是我们团队很自然的出口。同时也在整合团队内部在视频生成和世界模型方面的能力,打通完整的技术链路。
至于瓶颈,我的观点可能有些偏颇。当前很多具身工作是把语言视觉模型、强化学习、模仿学习接到机器人上,按图像和指令执行任务,确实在推动领域进步。但机器人看到的世界不是人看到的,相机输出的RGB图像只是物理世界经过成像与处理后的表征,并非原始物理信号本身。什么才是最适合机器人的感知方式?这里有底层创新的空间。
下一阶段的突破,不一定是把VLA做得更大,而是让它能接收主动光、事件信号等更丰富的物理感知模态,把视觉感知、物理建模和主动探索结合起来。我们不会忽视模型在语义泛化方面的能力,但几何、光学、力学这些物理约束也绕不过去。从成像到几何材质到物理到动作,打通第一性原理和数据因果链条,是有可能产生核心突破的方向。以光源、传感器、算法、模型软硬一体的协同设计,从源头主动采集物理信号,作为具身智能的新模态,打通“感知—物理—行动”链条,让机器人不再用人眼习以为常的图像看世界。
Q11:听说您在CSIG 3DV专委会的一次活动上分享视频生成工作后,有同行问您"什么时候叛变的",这种团队内部的方向分化带来了什么挑战?
施柏鑫:在CSIG 3DV专委会组织的一次闭门研讨会讲完视频生成的工作后,不少同行问我:“你什么时候开始做视频生成了?跟原来的研究思路完全不一样。”
这类方向扩展带来的最大挑战,其实在于团队管理——做模型方向的同学,就业优势很明显;做硬核成像,收益确实比不上能做好大模型或具身智能的。但如果真想做成像,能选的实验室不多。我们团队在这条路上有积累、有延续性,反而能吸引到真正感兴趣的同学。尤其是北大的学生,大多有自己的想法,知道自己真正喜欢什么。
04
“慢下来,做真正重要的研究”——AI时代的长期主义
Q12:恭喜您当选IJCV新任主编。对未来3-5年CV领域的发展,您认为哪些方向会成为基础性的突破,哪些被高估了?
施柏鑫:谢谢!主编,意味着更多的是一种责任和一项服务。这个问题很难直接下结论。现在文章产出速度太快,想想以前的CVPR是能把纸质会议论文集背回来的,现在开会连扫一遍poster的题目都根本看不完。
图注:北京大学发布施柏鑫当选IJCV主编相关新闻
IJCV的定位一直很明确——为快速发展的领域提供高质量原创成果的发表平台,更侧重“存档”价值,即那些经得起历史检验的工作。像SIFT论文、ImageNet挑战赛的总结报告,都是很有影响力的文章。
具体哪个方向更重要,我说不准。但规划研究时,可以往“触及本质、值得存档”的方向去想。前期追热点没问题,但积累到一定程度,必须有代表性成果。文章太多了,区分度才是关键。
国内科研环境对热点方向的响应往往很快;与此同时,在国际社区中,也能看到一些长期活跃的研究群体,十几年、二十年持续深耕一个方向。热点不断变化不一定是坏事儿,说明领域有活力。只是大家不妨多追问一句:这些研究解决了什么本质问题?
我不认同“计算机视觉不存在了”这种说法。大模型的普及和具身智能的应用反而让视觉计算的核心问题更复杂了,内涵和外延都还能深挖。机器人在真实环境中的可靠感知与行动,仍受到光照、材质、运动、遮挡等底层问题的制约。
Q13:在投稿量激增、AI生成内容介入的学术生态中,IJCV如何鼓励更可靠、更有长期价值的研究?
施柏鑫:9月1日,在北大计算机学院开学典礼上,我分享了一个观点:当所有事情都变得越来越高效的时候,记得给科研和生活留一点“低效”。AI帮你查文献、写代码、做实验,甚至投稿前用AI模拟审稿人——如果审稿人也这么做,最后就形成了一个闭环。
但至少以现在AI的能力,我认为它还没有替代科研中最核心的问题发现与判断。你低效一点——读一篇暂时用不上的论文,跟其他领域的人聊一聊,做些最终被证明错误的实验——回过头看,这些看似低效的行为,恰恰帮你找到了真正值得深入的问题。短期内不一定有回报的、但是你还能保持兴趣的事情,可能就是最值得投入的。
不要过度追求数量和指标。真正有区分度的判断,一定来自深入思考,而不是让AI替你决定。
IJCV方面,我和其他几位资深主编也交流过:在会议论文高速增长的时代,维持期刊的吸引力和影响力已经很不容易。我们的工作是要维护好标准,选出经过完整实验、长远来看值得存档的文章。
近年的CVPR/ICCV已经实行更严格的审稿责任政策:对严重不负责任或逾期不交审稿的审稿人,其作为作者的投稿可能被desk reject。但期刊的机制目前还不完全一样——编委和审稿工作主要依靠学术共同体的志愿服务。如果大量准备不充分、研究完成度不足的稿件涌入,对整个生态都是负担。建议大家首先要做有意义的研究工作,在投稿的时候也要选对场合,对于顶级期刊,最好把真正花时间做的、希望被长期记录、具有长期价值的工作投过来。
Q14:作为中国计算机视觉发展的亲历者和推动者,您怎么看这十年的变化?
施柏鑫:这十年的进步非常明显,我们整体上经历了从追赶到深度参与的角色转换,甚至在很多方向上已经能够走进国际前沿。早期我们的研究更多强调数量增长,但现在一些方向上出现了开创性甚至引领性的工作。
以IJCV为例,我从内部的统计可以看到,近年来自中国的投稿量和录用量都在上升,但更重要的是我们的中稿率也在上升,这在一定程度上反映了我们的研究质量提升。
从数量的增长到高质量、原创性工作的持续涌现,整体趋势是好的。但是关键问题在于:我们的研究还能不能更深入?能否产生更有长期影响力的、值得存档的贡献?这应该是一个努力的方向。
中国学者在计算机视觉社区服务方面的参与度也在进步。近年来,CVPR/ICCV等顶级会议的程序主席中也有来自中国大陆高校的学者。我出任IJCV主编,以及更多中国学者参与编委工作,也体现了这种变化。借此机会也想呼吁大家:除了享受论文被录用的快乐,也请积极参与审稿和编委工作——从“发得多”变成“做得强”,贡献要做大,服务要做好,影响要做深。
Q15:对刚入行的年轻学者有什么建议?
施柏鑫:我的建议听起来可能有点“既要又要”——既要拥抱新范式和模型进步带来的能力提升,也要保持问题意识,深入思考什么样的问题值得做;既要能用好规模化的智能,也不能放弃对第一性原理的思考;短期发表可以追,但要适可而止,关键是积累长期方向。
从期刊的角度来看,IJCV和PAMI这类顶刊应该鼓励有深入思考、经得起时间检验的工作。有些场合适合发表短平快的结果,但如果一项研究触及了领域方法的边界、能长期推动学科进步,就应该用顶级期刊的标准去衡量。
AI时代,计算机视觉的研究远没有结束,而是需要我们重新回答:还有什么问题是真正不可替代的、值得进一步探索的?







