科研成果 | 网络信息体系技术重点实验室 2 篇论文被多媒体与人工智能领域顶会 ACM MM 2026 接收
来源:数智地球
原文链接:https://mp.weixin.qq.com/s/6beKkoxnLeyz-RxUsWeCPA

近日,网络信息体系技术重点实验室团队的2篇研究论文被
ACM MM 2026
接收。
ACM International Conference on Multimedia(ACM MM)是国际计算机多媒体与人工智能领域的
顶级会议
之一,也是中国计算机学会
CCF-A
类学术会议。第34届 ACM MM 将于2026年11月10日至14日在巴西里约热内卢举行,共收到来自全球的
7053
篇有效投稿。
此次接收的两篇论文分别聚焦于
无人机视角下的细粒度跨模态理解
与
多时相遥感变化理解
:前者提出细粒度跨模态理解框架
GRASP
,通过区域聚焦对齐与语义扰动增强匹配,提升复杂背景和相似目标条件下的图文匹配能力;后者构建多时相遥感变化问答数据集
Delta-QA
,并提出统一变化检测与变化理解的多模态大语言模型
Delta-LLaVA
,实现多时相变化理解与像素级定位。
无人机视角下的细粒度跨模态理解
GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习
GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views
作者:崔嘉辉,赵妍,魏刊,朱恩泽,张培溶,王磊,汪奕汝

无人机视角下,大范围背景容易干扰图文对齐,不同目标又常具有相似的俯视几何结构,仅在颜色、材质和纹理等细粒度属性上存在差异,导致跨模态关注错位和视觉同构问题。
本文提出细粒度跨模态理解框架
GRASP
。
区域聚焦对齐机制
在全局场景和局部目标两个粒度建立图文对应关系,通过区域级对比学习与跨模态排序约束抑制背景干扰;
语义扰动增强匹配策略
通过属性词替换和语义原型码本,分别构造文本与视觉困难负样本,增强模型对结构相似目标细微属性差异的判别能力。两项机制均仅用于训练,不增加推理开销。
实验结果表明,GRASP 在 GeoText-1652 和 ERA 数据集上均取得领先的细粒度图文检索性能,并具有较好的跨数据集泛化能力。

本文第一作者是博士生崔嘉辉,2024年保送至中国科学院空天信息创新研究院,导师为王磊研究员。通讯作者为指导导师汪奕汝助理研究员。
多时相遥感变化理解
解码变化:基于多模态大语言模型统一遥感变化检测与理解
Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models
作者:李肖赫,李佳浩,张开心,方与强,林蕾蕾,王洪,吴浩华,樊子德


现有遥感变化检测方法主要面向固定类别的像素级判别,多模态大语言模型则缺少显式的跨时相比较与精确空间定位能力,难以统一完成变化检测和变化理解。
本文构建多时相遥感变化问答数据集
Delta-QA
,包含约18万条双时相和三时相样本,支持文本、点和边界框等交互形式,并将变化问答与像素级掩膜统一组织;进一步提出多模态大语言模型
Delta-LLaVA
,通过
变化增强注意力
强化跨时相差异,利用
变化先验嵌入
形成显式变化表征,并以
局部因果注意力
减少跨时相特征混淆,实现变化理解与像素级定位的统一。
实验结果表明,Delta-LLaVA 在双时相与三时相变化检测、变化理解及跨数据集泛化方面均取得领先性能。

本文第一作者是李肖赫助理研究员。学生一作为硕士生李佳浩,2024年保送至中国科学院空天信息创新研究院,导师为王洪副研究员。通讯作者为樊子德副研究员。
