
CVPR 2026 3D 视觉前沿梳理:模型正在学会理解、生成和构建世界
3D 视觉正从重建生成,走向空间理解、动态模拟与工程化应用。 作者丨郑佳美 编辑丨岑 峰 如果说过去几年的视觉 AI 主要是在回答“模型能不能看懂一张图”,那么到 CVPR 2026,一个更清晰的趋势正在浮现: 模型正在被要求理解图像背后的三维世界。 二维图像只是现实世界在某个视...
学术研究 方向最近有哪些内容值得看
学术研究 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
学术研究资讯
1,643
正文图片
8,217

3D 视觉正从重建生成,走向空间理解、动态模拟与工程化应用。 作者丨郑佳美 编辑丨岑 峰 如果说过去几年的视觉 AI 主要是在回答“模型能不能看懂一张图”,那么到 CVPR 2026,一个更清晰的趋势正在浮现: 模型正在被要求理解图像背后的三维世界。 二维图像只是现实世界在某个视...

很多人在使用文生图工具时都会遇到类似的情况,输入一段很清晰的描述,希望画面中人物站在左边、动物在右边,或者希望海报上出现一段完整可读的文字,但生成结果却常常让人失望。 要么位置关系混乱,要么文字变形,要么整体画面看起来不自然。继续调整参数,有时结果会更接近描述,但画面质量却明显下...

一、研究背景 从视频中准确理解并重建人体3D运动是计算机视觉的重要研究方向,在体育赛事分析、VR/AR、人机交互以及医疗康复等领域具有广泛应用价值。然而,在真实复杂场景中,该任务仍面临三大严峻挑战: 首先是身份关联不稳定——多人交互时,频繁的遮挡和快速运动容易导致ID Switc...

很多人第一次觉得图像生成模型已经足够强,往往是在它能快速画出一张看上去不错的图的时候。但真正开始频繁使用之后,又会慢慢发现另一面。 比如做一张活动主视觉,前几次生成里主体、色调、氛围都对了,可一放大细节就会发现手部、材质、边缘关系经不起看。再比如给一篇文章配封面,模型明明理解了主...

在今天的 AI 叙事里,“世界模型”几乎成了通往具身智能的必经之路。 它被期待理解物理规律、预测环境变化,并为机器人决策提供依据。但一个尖锐的问题是:当一个模型能生成一段足够逼真的未来视频时,我们究竟该相信它真的理解了世界,还是只是更擅长复刻世界的表象? 咬了一口的苹果会自动愈合...

如果回看过去十年的计算机视觉发展,其主线其实非常清晰:从早期以 ImageNet classification 为代表的“识别范式”,到以检测、分割为核心的“结构理解”,再到扩散模型推动的“生成范式”,视觉研究始终围绕一个核心目标展开——让机器更准确地“看见世界”。 然而,这一路...

过去一段时间,AI 视频最让人惊艳的,往往都是前几秒。人物状态自然,光影氛围到位,动作也足够流畅,很容易让人产生一种感觉,视频生成已经离真正可用不远了。 但行业越往前走,问题也越清楚,真正难的从来不是做出一小段漂亮画面,而是能不能把这种质量稳定地延续下去。一旦视频时长被拉长,很多...

在过去几年中,视频生成技术取得了令人瞩目的进展。从基于扩散模型的方法到大规模视频基础模型,生成结果在视觉质量上已经逐渐逼近真实世界。然而,当我们进一步审视这些模型时,一个更本质的问题开始显现:它们究竟是在“理解世界”,还是仅仅在“拟合像素分布”? 传统视频生成方法大多建立在 2D...

过去两年,视频生成的发展几乎是指数级的。从最早只能生成模糊片段,到如今可以生成具有叙事结构、光影一致性甚至风格控制的长视频,行业表面上已经接近一个阶段性成熟。 但如果把评价标准从“能不能生成一段视频”稍微提高到“能不能控制镜头”,问题就会完全暴露出来。当前大多数模型仍然停留在一种...

很多人都经历过这样一种落差。现实里的空间是立体的,是包围人的,是可以转身、抬头、回望的,可一旦被手机或相机拍成视频,世界立刻被压缩成一个窄窄的取景框。 暴雨来临前的天空并不只在镜头正前方,深夜街区的压迫感也不只来自路面,商场中庭、地下车站、展馆大厅、建筑内部,这些真正让人产生现场...

这几天,TurboQuant 几乎成了 AI 学术圈里最热的争议事件之一。 一边是 Google Research 高调发博文,把它包装成能显著降低大模型推理成本、并将在 ICLR 2026 亮相的“突破性”工作,另一边则是先行工作RaBitQ的作者——高健阳以知乎答主身份在社区...

近日,在第二届浦江AI学术年会上,上海人工智能实验室(上海AI实验室)联合北京智源研究院、中国科学院计算技术研究所、北京开源芯片研究院、商汤科技、IDEA数字经济研究院等机构,共同发起“国产软硬件适配验证合作计划”。该计划拟推出覆盖AI全流程的软硬件验证平台及自主生态社区,并预计...

本文来自微信公众号: 动察Beating ,作者: Sleepy,头图来自:AI生成 Anthropic发布过一份两万多字的文件,叫《Claude的宪法》,不是产品说明书,不是用户协议,也不是晦涩的底层代码。它更像是一份写给一个人的成长指南,只不过这个“人”,是一个大语言模型,每...

本文来自微信公众号: 机器之心 ,编辑:Panda,作者:关注RL的 2024年底,一篇题为「流式深度强化学习终于跑通了」的论文(arXiv:2410.14606)在学界引发广泛讨论。作者来自阿尔伯塔大学的Mahmood团队,他们花了大量篇幅描述一个令人尴尬的现实:强化学习作为一...
本文来自微信公众号: 人人都是产品经理 ,作者:周周粥粥 每次看到某个AI Agent产品发布demo,评论区清一色“太强了”“颠覆认知”,过两周再看,同一批人在骂“垃圾”“根本不能用”“又是智商税”。 这个循环从2024年延续到2026年,好像从来没有真正被打破过。 很多人把原...

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《中国拿下这届 AI 顶会半壁江山,清华一家单挑斯坦福加 MIT》 全球AI顶会,快成中国卷王的专场了。 每年AI顶会放榜,各大机构都会暗戳戳地发喜报,比拼谁家被收录的论文多。但今年ICLR(国际学习表征会议)放...

作者|桦林舞王 编辑| 靖宇 4 月 9 日,一篇来自 Anuttacon 团队的论文悄悄出现在 arXiv 上。论文展示了一个叫 LPM 1.0 的视频模型——全称 Large Performance Model,注意,是 Performance(表演)...

作者| Moonshot 编辑| 靖宇 试想一个场景。 你在闲鱼上挂出了一辆吃灰两年的旧自行车,并在后台设定了 300 元的心理底价。十分钟后,手机弹出通知,你的专属 AI 助手已经与另一位买家的 AI 助手,完成了三轮讨价还价,最终以 400 元的价格将自行车卖出,快递正在上门...

编者按:本文来自微信公众号 雷科技(ID:leitech),编辑:定西,创业邦经授权发布。 昨晚,AI新贵Anthropic (后文简称为 A 社)并没有发布Claude新模型,而是推出了一个看起来特别「无聊」的东西:The Anthropic Institute(Anthrop...

不是哥们,这年头AI也溜冰了? 就在这几天,Github上出现了一篇名为《AI Wellbeing: Measuring and Improving the Functional Pleasure and Pain of AIs》的论文,论文主题就是,如何量化与提升AI的功能性愉...