清华大学:大脑启发的开放世界环境视觉传感-感知芯片系统
开放世界环境中的视觉感知面临着极端成像条件(如高速、高动态范围和频闪)带来的数据退化挑战。相比之下,人类视觉系统(HVS)通过由视觉基元构建的组合表示来保持其卓越的鲁棒性。
2026年7月15日,清华大学施路平教授、赵蓉教授等人提出了一种受脑启发的两阶段学习框架,用于在开放世界场景中实现自适应的视觉感知。在自下而上的阶段,该框架将结构化的视觉先验嵌入到中间表示(I
Rs
)中,使内部模型能够通过自监督学习融合互补的视觉线索。在自上而下的阶段,从该内部模型中提取的视觉知识会被用于自适应地调节下游感知
算法
,从而显着增强系统的泛化能力。该框架使用受脑启发的视觉
传感器
“天眸”(
Ti
anmouc)进行了实例化评估,实验表明该方法在面临严重视觉干扰时,大幅提升了单目深度估计(MDE)和视频实例分割(VIS)等任务的性能。
【正文内容】

图1 | 人类视觉系统与类脑视觉系统。a.传统
机器视觉
难以应对开放世界的挑战,而人类可以获取良好估计的视觉基础事实(VGT)。 b.总结了HVS的关键原理,并据此构建类脑视觉系统。 c.提出了包含自下而上学习和自上而下调节的框架,包含
编码器
、解码器和记忆模块。
图1中,当前机器视觉在处理高动态范围、高速运动和光照剧变时常面临传感器信息丢失和后续语义理解困难的双重瓶颈。受人类视觉系统的启发,研究团队设计了一种系统化的双阶段类脑视觉感知框架。在自下而上的学习中,框架首先将天眸传感器收集的多通路原始
信号
转化为具备特定视觉先验的中间表示。随后,通过自监督训练内部模型来估计缺失的视觉基础事实(VGT),生成统一的鲁棒表征。最后,通过自上而下的迁移学习,将这些特征应用于下游任务,从而在极端开放环境下赋能机器感知。

图2 | Tianmouc-R数据集及IGFNet评估。a.内部模型通过自监督VGT估计任务学习整合IRs中的先验。 b.Tianmouc-R数据集的极端场景分布与数据长度统计。 c.IGFNet在闪烁、HDR及高速混合场景下均能生成高质量VGT。 d.解码过程中的平均注意力热力图,显示了模型在不同状态下的自适应加权机制。
图2中,为了验证内部模型,构建了信息引导融合网络(IGFNet),并采集了包含多种极端工况的Tianmouc-R真实数据集。由于现实中难以获取完美的视觉监督信号,模型采用了基于不同中间表示间相互预测的自监督训练策略。实验证明,IGFNet能根据指导信息自适应地分配跨通路注意力。例如,在高速场景中它会依赖快速通路弥补运动模糊,在强光频闪中则切换至积分先验。这种动态资源分配使模型输出的估计视觉事实(e-VGT)在各类评价指标上均优于现有的图像恢复基线算法。

图3 | 单目深度估计(MDE)任务。a.深度估计器由IGFNet编码器与深度解码器组成,利用伪
标签
进行训练。 b.基于e-VGT的视觉大模型标注质量显着优于原始RGB数据标注。 c.在极端场景下的视差图对比显示,IGF-BSNet能够提供完整且一致的深度估计。
图3中,在自上而下调节的验证中,研究利用底层的泛化特征来应对高度依赖视觉线索的单目深度估计任务。针对极端环境缺乏语义真值的问题,研究利用IGFNet生成的e-VGT结合大型视觉模型(如DAM-V2-L)自动生成了高质量的像素级深度伪标签。结果表明,e-VGT克服了原始
光学
的局部失效,为模型提供了完整的几何先验。将IGFNet预训练编码器结合至下游BSNet架构中得到的IGF-BSNet,在严重模糊或过度曝光区域依然能够保持深度的结构连续性,成功实现了基础模型与类脑视觉的知识对接。

图4 | 视频实例分割(VIS)任务。a.算法利用高质量VGT自动获取高帧率像素级标注的流水线。 b.为高密度与高速度特征定制的YOLO-CVS双分支算法模板。 c.混合数据训练与纯
仿真
训练的性能-速度对比。 d.YOLO-CVS-L在极端干扰下的实例分割可视化结果展示。
图4中,对于标注难度极高的视频实例分割任务,研究开发了一条基于e-VGT与目标跟踪大模型的高效自动标定管线,构建了Tianmouc-VIS数据集。此外,为兼顾高帧率推理与多通路对齐,研究提出了端到端的YOLO-CVS实时感知架构,其内部拆分为处理高动态密度的HDR分支和捕捉即时信号的高速分支。评估发现,依赖混合真实数据进行自上而下的监督训练后,模型检测与分割精度大幅跃升。全通路融合的YOLO-CVS成功消除了单模态造成的分割遮挡与形变,在维持超高帧率的同时提供了鲁棒的语义理解。
来源:
半导体
日记
视觉传感
视觉传感
+关注
关注
1
文章
26
浏览量
9341
