大模型驱动的空天微波成像专题 | 让AI读懂"合成孔径雷达": SAR基础模型系统性综述
发布时间:2026-08-18来源:中国科学杂志社
研究团队
孙显等:中国科学院空天信息创新研究院目标认知与应用技术全国重点实验室等
引用本文
Hou Y Y, Wu H R, Zhang Y L, et al. SAR foundation models: a comprehensive review of data, models, and applications. Sci China Inf Sci, 2026, 69(8): 180301, doi: 10.1007/s11432-026-5040-3研究意义
合成孔径雷达(SAR)依托主动微波成像机制,不受光照与天气条件限制,可实现全天时、全天候的对地连续观测,在灾害监测、资源勘查、海洋态势感知与国防安全等领域具有重要应用价值。然而,SAR图像由后向散射微波信号相干叠加而成,其成像机理与光学影像存在本质差异:相干斑噪声、叠掩、透视收缩与雷达阴影等固有特性使图像难以直观解译,标注成本高且高度依赖专业知识。近年来,基于Transformer架构的基础模型通过大规模自监督预训练,在自然语言处理与计算机视觉领域展现出通用表征能力与良好的迁移性能。Sentinel-1、高分三号等卫星持续产出海量无标注SAR数据,为该范式的引入提供了数据基础。在这一背景下,相关研究近年来快速涌现(见图1),但该领域仍处于探索阶段,缺乏系统的技术分类与深入分析。为此,本文提出面向SAR基础模型的首个统一分类体系,梳理了该领域由任务特定的监督学习向大规模自监督预训练演进的脉络,为后续研究提供了参考框架。图1 2016~2025年SAR基础模型相关论文数量逐年攀升,该领域正快速发展。数据基于Google Scholar搜索结果intitle: (SAR OR “synthetic aperture radar”) AND (“foundation model” OR “large-scale pre-training”)。数据检索日期:2026年4月22日与已有综述相比,本文首次面向SAR基础模型构建了统一分类体系,并纳入了物理机理、数据规模、跨传感器评测与推理成本等实用维度的讨论(见表1)。表1 本文与已有综述的对比(✓:涉及;✗:未涉及)本文工作
本文对 SAR 基础模型进行了系统综述。作者首先给出 SAR 基础模型的形式化定义与纳入标准,随后依据核心功能目标与数据模态,将现有工作归纳为三类范式,并沿由单模态特征表示、跨模态语义对齐至数据生成的技术演进主线展开论述(见图2)。图2 本文提出的 SAR 基础模型统一分类体系:视觉、多模态、生成三大范式及其代表性工作该类模型面向单模态表征学习,目标是从大规模无标注SAR图像中学习鲁棒且可泛化的通用特征,可进一步分为两条技术路线。掩码图像建模(MIM)类方法强调重建:SUMMIT在经典掩码重建之外引入去噪与边缘—散射点辅助任务,在抑制相干斑的同时保留边缘与散射结构;SAR-JEPA则放弃像素级回归,转而在特征空间预测被掩码区域,利用多尺度梯度特征引导模型关注目标轮廓,天然对乘性相干斑更鲁棒。对比学习类方法强调判别,关键在于构造符合物理规律的正样本对:PIS利用同一地点不同时相构造正样本以降低对环境扰动的敏感性;LDCL针对 SAR 高类间相似性引入低置信度判别,缓解过度自信带来的错误梯度。针对SAR影像语义信息稀疏、缺乏色彩纹理的特点,该类模型引入光学影像或文本作为辅助模态,涵盖三个方向。在SAR–光学协同方面,CROMA、DeCUR等通过跨模态对比与掩码重建在保留模态特异信息的同时学习共享表征。在视觉—语言方向,SAR-CLIP通过大规模图文对比对齐视觉与语言特征,支持检索与零样本识别;FUSAR-KLIP则引入地学与物理先验以强化SAR-文本对齐。在多模态大语言模型方向,EarthGPT、Falcon等将SAR图像作为视觉词元送入大语言模型,支持视觉问答、推理与对话,推动SAR解译由感知走向认知(见图3)。该类模型借助扩散模型的分布建模能力,围绕两条路径缓解数据与标注稀缺问题。文本到 SAR路径通过CLIP等文本编码器解析自然语言提示,生成指定目标类别与场景属性的图像,实现开放词汇生成;GeoDiff-SAR、Physics-Informed DM等进一步注入几何或物理条件以提升可控性。图像到 SAR 路径以布局掩码、噪声图或光学底图为条件,涵盖布局引导合成、去斑复原与跨模态转换,在增广训练数据的同时尽量保留物理细节。值得注意的是,本文指出当前文本到SAR生成仍存在语义—物理错配、提示欠约束、复杂场景幻觉三类失效模式,提示此类数据应谨慎用于对散射统计有严格要求的场景。基础模型的能力在很大程度上取决于数据的规模、多样性与质量。本文将现有SAR数据资源划分为面向预训练的大规模数据与面向下游评测的标注基准两类,覆盖单模态SAR、SAR–光学配对与SAR图文对三种主流模态(见图4),并汇总了代表性数据集(节选见表2)。图4 SAR基础模型研究中的主要数据模态:单模态SAR、SAR–光学配对与SAR图文对在评测方面,本文指出随机同分布划分容易高估泛化能力,倡导采用更严格的分布外、跨传感器与跨几何评测协议,并针对视觉、多模态与生成三类模型分别构建面向感知、语义认知与物理一致性的评测体系。如何将预训练获得的通用表征迁移到具体任务,是基础模型落地的关键。本文将该领域适配策略组织为从推理干预到参数重构的连续谱系:零样本推理与上下文学习不更新参数,依赖提示引导;参数高效微调(如LoRA、Adapter)仅更新少量参数以注入SAR领域知识;全参数微调则进行最充分的特征重塑。不同策略在适配能力、数据需求、计算成本与遗忘风险之间存在权衡(见表3)。表3 面向 SAR 基础模型的适配策略对比(数值为典型配置范围)为便于复用,本文还汇总了代表性模型的骨干网络、参数规模与代码/权重的公开情况(见表4)。●提出统一分类体系:将 SAR 基础模型系统划分为视觉、多模态与生成三类范式,填补了该领域缺乏统一技术框架的空白。●结合物理机理的深入分析:分析了MIM与对比学习针对相干斑噪声、成像几何与极化等 SAR 特性的改造方式,并讨论了跨模态对齐中光学分支主导、生成结果物理可信性等关键问题。●面向实践的选型与评测建议:给出模型与适配策略的选择依据,并建议建立面向散射统计与辐射一致性的物理感知评测协议,以补充现有光学域感知指标的不足。●梳理未来研究方向:涵盖大规模高质量数据集构建、多模态SAR智能体、物理可解释性,以及极端成像条件下的鲁棒性等方向。结论
综述在梳理证据的基础上得出如下结论:其一,对于依赖散射特性的任务,通用光学预训练主要起参数初始化作用,关键性能提升源于后续的SAR领域预训练。其二,SAR与光学的互补性可带来稳定收益,低标注条件下CROMA与DeCUR均报告明显提升;但若将所有特征强制映射至共享子空间,会抑制模态独有信息并降低下游性能。其三,现有生成模型的评测指标(如FID、CLIP Score)对SAR成像物理缺乏敏感性,存在视觉合理但物理失真的风险。总体而言,SAR基础模型领域正逐步由方法探索转向严谨、可复现且具备物理约束的评测阶段。在保持模型可扩展性与通用性的同时,兼顾散射可解释性、鲁棒性与辐射一致性,是实现全天时、全天候智能对地观测的关键。
相关阅读
SCIS专题 | 融合AI大模型的6G通信网络专题SCIS专题 | 面向5GA和6G网络的分布式卫星系统专题SCIS专题 | 毫米波/太赫兹相控阵与系统集成技术专题北邮牵头14家单位联合撰写 | 面向6G的人工智能与通信融合大综述
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。