Token导航 LogoToken导航TokenDH.com

哈尔滨工业大学左旺孟教授团队 | 基于扩散模型的零样本图像指代分割

更新时间 2026-09-19来源 中国科学杂志社正文 1394字阅读约 5分钟

#人工智能,#生成模型,#图像分割,#跨模态理解,#零样本学习

研究团队
倪旻恒,张亚博,冯开来,李晓明,左旺孟:哈尔滨工业大学
郭怡文:字节跳动

引用本文

Ni M H, Zhang Y B, Feng K L, et al. Ref-Diff: zero-shot referring image segmentation with generative models. Sci China Inf Sci, 2026, 69(8): 182104, https://doi.org/10.1007/s11432-024-4985-y

研究意义

在现实世界中,用户往往希望通过自然语言告诉计算机“画面中的某个物体”,比如“图中穿红衣服的女孩”,计算机则要自动圈出对应的区域。这一任务被称为“指代图像分割”(Referring Image Segmentation)。然而,以往的方法严重依赖大量人工标注的图像-文本-掩膜数据,既昂贵又不灵活,难以扩展到新场景。本研究从另一个角度切入,首次系统探索了“生成模型”在零样本指代图像分割中的潜力。也就是说,不依赖任何对应训练样本,模型也能“理解语言,找到目标”。
图1 指代图像分割任务示例

本文工作

为了解决传统指代图像分割方法对大量人工标注数据的依赖,本文提出了一种新颖的零样本指代图像分割方法——Ref-Diff。该方法依托扩散生成模型的多模态理解能力,实现无需任何训练样本即可进行高质量的图像分割。具体而言,Ref-Diff的核心思路是:在给定一张图像和一段文本描述(如“穿蓝衣服的男孩”)的情况下,直接通过生成模型的注意力机制计算图像中各个区域与文本之间的匹配关系,进而定位出最符合描述的目标区域。与以往方法不同,它不再依赖外部目标提议模块,而是从生成模型内部“自我生成”候选区域,具备更强的端到端处理能力和灵活性。在此基础上,本文进一步提出了增强版本Ref-Diff+,它融合了生成模型和判别模型(例如CLIP)的优势,提升了候选区域的筛选准确性。生成模型负责提出可能的目标区域,而判别模型则从语义层面对这些区域进行精准判断。整个过程无需任何任务特定的训练,真正实现了“看图找物”的零样本学习。
此外,本文还系统探讨了以下关键问题:
生成分辨率对分割性能的影响:研究发现更高分辨率的生成图像能带来更精细的注意力分布,从而提高分割精度;
生成与判别得分的融合策略:通过调节生成与判别模型的权重比例,Ref-Diff+可进一步优化性能,达到最佳平衡;
消融实验验证模块贡献:系统评估了各个模块的独立效果,证实了生成模型自身已具备较强的分割能力,而两者结合则效果更佳。
整体而言,Ref-Diff不仅提供了一种全新的零样本指代图像分割路径,也展示了生成模型在图像理解领域的巨大潜力。该方法特别适用于数据稀缺或场景变化频繁的实际应用场景。
图2 Ref-Diff的整体结构

实验结果

研究团队在RefCOCO、RefCOCO+和RefCOCOg等多个基准数据集上验证了该方法的有效性。即使在完全不使用训练样本和分割器的“纯零样本”设定下,Ref-Diff的表现也超过了多个现有弱监督方法。在加入预训练分割器和判别模型后,Ref-Diff+更是在多个指标上提升10个百分点以上。
更有趣的是,本文还展示了不同分辨率、模块组合、融合比例等对性能的影响,系统验证了生成模型在图像理解任务中的巨大潜力。
表1 总体oIoU性能
表2 总体mIoU性能
文章标签应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多