
西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026
过去一段时间,AI 视频最让人惊艳的,往往都是前几秒。人物状态自然,光影氛围到位,动作也足够流畅,很容易让人产生一种感觉,视频生成已经离真正可用不远了。 但行业越往前走,问题也越清楚,真正难的从来不是做出一小段漂亮画面,而是能不能把这种质量稳定地延续下去。一旦视频时长被拉长,很多...
学术研究 方向最近有哪些内容值得看
学术研究 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
学术研究资讯
1,604
正文图片
7,997

过去一段时间,AI 视频最让人惊艳的,往往都是前几秒。人物状态自然,光影氛围到位,动作也足够流畅,很容易让人产生一种感觉,视频生成已经离真正可用不远了。 但行业越往前走,问题也越清楚,真正难的从来不是做出一小段漂亮画面,而是能不能把这种质量稳定地延续下去。一旦视频时长被拉长,很多...
“如果说谁是下一个DeepSeek,我认为是盛大。” 一位接近代季峰的资深业者向雷峰网 (公众号:雷峰网) 笃定地预测,不过这是半年前。 DeepSeek的成功,被业界总结为三个条件:不以短期商业化为目的、拥有一群极致纯粹的人、以及深不见底的钱袋子。 在大厂受困于KPI压力、明星...

过去几年,视觉生成与视觉理解领域的技术推进,整体上始终沿着一条相对明确的路径展开:当一套建模范式被验证有效之后,后续的大量工作往往都会围绕这套既有框架持续做模型扩容、训练增强、采样优化与局部模块修补,以此换取更高的性能上限。 无论是扩散生成、视频 world model,还是动作...

你可能遇到过这样一种情况,一个模型原本只做一件事的时候表现很好,但一旦不断往里面加新任务,它反而开始变差了。不是彻底失效,而是变得不稳定,有些能力开始下降,有些结果开始波动。问题不在于模型不会,而在于它原本会的东西,被后来加入的任务“挤掉了一部分”。 这背后其实有一个很少被说清楚...

如果回看过去十年的计算机视觉发展,其主线其实非常清晰:从早期以 ImageNet classification 为代表的“识别范式”,到以检测、分割为核心的“结构理解”,再到扩散模型推动的“生成范式”,视觉研究始终围绕一个核心目标展开——让机器更准确地“看见世界”。 然而,这一路...

LegoOcc:无需语义体素标注,也能识别开放类别。 作者丨郑佳美 编辑丨岑 峰 真正的室内空间智能,并不只是让机器认出画面里有一张桌子,而是让它理解真实三维物理空间内:哪里可以通行、哪里存在遮挡、哪些物体能够交互。 对于未来的家庭机器人和护理机器人来说,理解一个房间并不只是完成...

在过去几年中,视频生成技术取得了令人瞩目的进展。从基于扩散模型的方法到大规模视频基础模型,生成结果在视觉质量上已经逐渐逼近真实世界。然而,当我们进一步审视这些模型时,一个更本质的问题开始显现:它们究竟是在“理解世界”,还是仅仅在“拟合像素分布”? 传统视频生成方法大多建立在 2D...

在过去两年的大模型工业化进程中,安全审计始终遵循着一套 “猫鼠游戏” 的默认设定:开发者微调模型以增强能力,而安全专家则通过红队测试(Red Teaming)或白盒探测来寻找潜在的 “后门” 或 “偏见”。这套逻辑的前提是:模型是一个被动的受访者,它的行为必须由外部观测者通过穷举...

在今天的 AI 叙事里,“世界模型”几乎成了通往具身智能的必经之路。 它被期待理解物理规律、预测环境变化,并为机器人决策提供依据。但一个尖锐的问题是:当一个模型能生成一段足够逼真的未来视频时,我们究竟该相信它真的理解了世界,还是只是更擅长复刻世界的表象? 咬了一口的苹果会自动愈合...

很多人在使用文生图工具时都会遇到类似的情况,输入一段很清晰的描述,希望画面中人物站在左边、动物在右边,或者希望海报上出现一段完整可读的文字,但生成结果却常常让人失望。 要么位置关系混乱,要么文字变形,要么整体画面看起来不自然。继续调整参数,有时结果会更接近描述,但画面质量却明显下...

很多人都经历过这样一种落差。现实里的空间是立体的,是包围人的,是可以转身、抬头、回望的,可一旦被手机或相机拍成视频,世界立刻被压缩成一个窄窄的取景框。 暴雨来临前的天空并不只在镜头正前方,深夜街区的压迫感也不只来自路面,商场中庭、地下车站、展馆大厅、建筑内部,这些真正让人产生现场...

这几天,TurboQuant 几乎成了 AI 学术圈里最热的争议事件之一。 一边是 Google Research 高调发博文,把它包装成能显著降低大模型推理成本、并将在 ICLR 2026 亮相的“突破性”工作,另一边则是先行工作RaBitQ的作者——高健阳以知乎答主身份在社区...

近日,在第二届浦江AI学术年会上,上海人工智能实验室(上海AI实验室)联合北京智源研究院、中国科学院计算技术研究所、北京开源芯片研究院、商汤科技、IDEA数字经济研究院等机构,共同发起“国产软硬件适配验证合作计划”。该计划拟推出覆盖AI全流程的软硬件验证平台及自主生态社区,并预计...

本文来自微信公众号: 动察Beating ,作者: Sleepy,头图来自:AI生成 Anthropic发布过一份两万多字的文件,叫《Claude的宪法》,不是产品说明书,不是用户协议,也不是晦涩的底层代码。它更像是一份写给一个人的成长指南,只不过这个“人”,是一个大语言模型,每...

本文来自微信公众号: 机器之心 ,编辑:Panda,作者:关注RL的 2024年底,一篇题为「流式深度强化学习终于跑通了」的论文(arXiv:2410.14606)在学界引发广泛讨论。作者来自阿尔伯塔大学的Mahmood团队,他们花了大量篇幅描述一个令人尴尬的现实:强化学习作为一...
本文来自微信公众号: 人人都是产品经理 ,作者:周周粥粥 每次看到某个AI Agent产品发布demo,评论区清一色“太强了”“颠覆认知”,过两周再看,同一批人在骂“垃圾”“根本不能用”“又是智商税”。 这个循环从2024年延续到2026年,好像从来没有真正被打破过。 很多人把原...

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《中国拿下这届 AI 顶会半壁江山,清华一家单挑斯坦福加 MIT》 全球AI顶会,快成中国卷王的专场了。 每年AI顶会放榜,各大机构都会暗戳戳地发喜报,比拼谁家被收录的论文多。但今年ICLR(国际学习表征会议)放...

作者| Moonshot 编辑| 靖宇 试想一个场景。 你在闲鱼上挂出了一辆吃灰两年的旧自行车,并在后台设定了 300 元的心理底价。十分钟后,手机弹出通知,你的专属 AI 助手已经与另一位买家的 AI 助手,完成了三轮讨价还价,最终以 400 元的价格将自行车卖出,快递正在上门...

作者|桦林舞王 编辑| 靖宇 4 月 9 日,一篇来自 Anuttacon 团队的论文悄悄出现在 arXiv 上。论文展示了一个叫 LPM 1.0 的视频模型——全称 Large Performance Model,注意,是 Performance(表演)...

不是哥们,这年头AI也溜冰了? 就在这几天,Github上出现了一篇名为《AI Wellbeing: Measuring and Improving the Functional Pleasure and Pain of AIs》的论文,论文主题就是,如何量化与提升AI的功能性愉...