哈尔滨工业大学左旺孟教授团队 | 基于扩散模型的零样本图像指代分割
发布时间:2026-09-19来源:中国科学杂志社
#人工智能,#生成模型,#图像分割,#跨模态理解,#零样本学习
倪旻恒,张亚博,冯开来,李晓明,左旺孟:哈尔滨工业大学引用本文
Ni M H, Zhang Y B, Feng K L, et al. Ref-Diff: zero-shot referring image segmentation with generative models. Sci China Inf Sci, 2026, 69(8): 182104,
研究意义
在现实世界中,用户往往希望通过自然语言告诉计算机“画面中的某个物体”,比如“图中穿红衣服的女孩”,计算机则要自动圈出对应的区域。这一任务被称为“指代图像分割”(Referring Image Segmentation)。然而,以往的方法严重依赖大量人工标注的图像-文本-掩膜数据,既昂贵又不灵活,难以扩展到新场景。本研究从另一个角度切入,首次系统探索了“生成模型”在零样本指代图像分割中的潜力。也就是说,不依赖任何对应训练样本,模型也能“理解语言,找到目标”。为了解决传统指代图像分割方法对大量人工标注数据的依赖,本文提出了一种新颖的零样本指代图像分割方法——Ref-Diff。该方法依托扩散生成模型的多模态理解能力,实现无需任何训练样本即可进行高质量的图像分割。具体而言,Ref-Diff的核心思路是:在给定一张图像和一段文本描述(如“穿蓝衣服的男孩”)的情况下,直接通过生成模型的注意力机制计算图像中各个区域与文本之间的匹配关系,进而定位出最符合描述的目标区域。与以往方法不同,它不再依赖外部目标提议模块,而是从生成模型内部“自我生成”候选区域,具备更强的端到端处理能力和灵活性。在此基础上,本文进一步提出了增强版本Ref-Diff+,它融合了生成模型和判别模型(例如CLIP)的优势,提升了候选区域的筛选准确性。生成模型负责提出可能的目标区域,而判别模型则从语义层面对这些区域进行精准判断。整个过程无需任何任务特定的训练,真正实现了“看图找物”的零样本学习。生成分辨率对分割性能的影响:研究发现更高分辨率的生成图像能带来更精细的注意力分布,从而提高分割精度;生成与判别得分的融合策略:通过调节生成与判别模型的权重比例,Ref-Diff+可进一步优化性能,达到最佳平衡;消融实验验证模块贡献:系统评估了各个模块的独立效果,证实了生成模型自身已具备较强的分割能力,而两者结合则效果更佳。整体而言,Ref-Diff不仅提供了一种全新的零样本指代图像分割路径,也展示了生成模型在图像理解领域的巨大潜力。该方法特别适用于数据稀缺或场景变化频繁的实际应用场景。研究团队在RefCOCO、RefCOCO+和RefCOCOg等多个基准数据集上验证了该方法的有效性。即使在完全不使用训练样本和分割器的“纯零样本”设定下,Ref-Diff的表现也超过了多个现有弱监督方法。在加入预训练分割器和判别模型后,Ref-Diff+更是在多个指标上提升10个百分点以上。更有趣的是,本文还展示了不同分辨率、模块组合、融合比例等对性能的影响,系统验证了生成模型在图像理解任务中的巨大潜力。复旦大学黄萱菁团队 | 大语言模型代码生成问题的系统调研与分析北大&厦门大学合作研究 | Orpaint:甲骨文拓片修复的零样本学习新方法北京科技大学方治屿,祝晓斌等 | 基于增强表征对齐的泛化零样本学习山东大学张彩明教授团队 | 迈向可靠学习:用“锚定与控制”让半监督医学图像分割更稳定
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。