再登Nature系列期刊封面,基于原语的双通路互补机器视觉感知芯片

如果打开在Nature官网的报道中,针对AI与芯片两大领域,我国大陆的研究机构作为第一完成单位,登上封面的论文,到目前为止一共有三篇:分别于2019年发表了天机芯论文,2024年发布了天眸芯论文,以及2025年的DeepSeek-R1论文。其中,清华大学类脑计算研究中心的研究团队贡献了两篇论文。
此外,清华大学的博士毕业生、晰见科技创始人杨哲宇先生,曾先后参与天机芯和天眸芯的研发工作,并担任了天眸芯论文的共同第一作者。2025年夏日之初,清华大学类脑计算研究中心成功孵化了一家新企业,晰见科技该企业正式成立,致力于承接并不断推进天眸芯类脑视觉技术的产业化进程。这家企业的核心业务,简而言之,便是研发一款专为人工智能设计的视觉系统。。

- 清华大学博士毕业生,晰见科技创办人杨哲宇
摄像头原本并非专为AI而设计
光线穿过镜头,传感器随后将光信号转化为数字信号,并以此生成一系列连续的图像帧。这些帧图像随后经过后端处理和编码,最终形成可存储与播放的视频。这种基于帧记录世界的方法,自CCD与CMOS图像传感器问世以来,已沿用将近半个世纪。

- 来源:资料图 -
传统摄像头起初是为人类观察而打造的,其核心宗旨在于尽可能地还原画面的每一个细节与色彩,然而,这也带来了庞大的数据负担。即便是一台普通的监控摄像头,其一天内连续录制的视频数据量即可达到数十个GB;而对于装备了十余个摄像头的自动驾驶测试车辆来说,一天内产生的原始数据量往往以TB为单位。
然而,随着摄像头逐渐转变为机器人、自动驾驶等领域实时感知物理世界的窗口,这种传统的模式逐渐暴露出了其固有的问题。为了降低对类似画面的反复处理,同时确保不遗漏任何关键性的变化,传统摄像头一般以固定的帧率捕捉完整的画面,导致相邻帧中天空、路面与护栏等元素常常高度相似。然而,如前车突然减速、行人横穿马路或光线突然变化等关键事件,往往仅在一瞬之间出现在局部的场景中。前者所提供的信息关乎道路的布局、目标的形态以及空间关系,而后者则直接关联到迅速做出反应的能力。这两类信息虽然同等重要,却并不需要以相同的频率、相同的数据量进行采集、传输和加工。
换句话说,AI所追求的并非仅仅是抛弃静态信息,而是寻求一种更契合机器认知的信息组织模式。实际上,如此高效的视觉处理机制,人类早已具备。
杨哲宇在清华类脑中心读博的时候,实验室里有一句流传很广的话:“大脑,一个仅需20瓦功率的通用智能系统。”这里的20瓦,相当于一盏节能灯泡的功率,而人类正是凭借如此微小的能耗,实现了视觉感知、空间定位以及决策规划等功能。和运动控制在处理输入信息时,我们依赖的并非如摄像头那般,对每一帧画面采取相同的方式进行全面处理。
人眼视网膜内蕴藏着数亿个感光细胞,而最终,这些信息仅通过百万级别的视神经纤维传输至大脑,这相当于在感知阶段就完成了超过百倍的信息压缩与编码。这并非仅仅是“只传输变化的部分,而静止的部分则不传输”这么简单,而是借助不同类型的细胞和神经通路,对颜色、空间结构以及时间变化等视觉信息进行分解、重新组合,并以此种互补模式进行传递。
天眸芯所专注的,便是将上述机制巧妙地转化为芯片级的产品。
把视觉拆成原语
在构建两条互补的传输路径时,
天眸芯与常规图像传感器的显著差异并不在于输出通道的简单扩充,而是在于它首先将视觉信息细致地分解为 RGB、时间差分(TD,即Temporal Difference)以及空间差分(SD,即Spatial Difference)和空间差分两大类别,三类视觉原语,再将它们组织成两条互补通路:认知导向路径保留了RGB信息的完整性,而动作导向路径则同步采集高速、稀疏的时间差分与空间差分数据。
本架构的设计并非是让AI在三个通道中择一而用,而是旨在让这三种信息相互补充:其中,RGB通道负责记录色彩与外观,空间差分技术则着重于突出边缘与结构特征,而时间差分技术则专注于捕捉运动和变化。即便RGB图像因过曝或运动模糊而造成失真,其他两个通道仍能保留部分结构和变化信息。
依托这套基于原语表示和互补通路的架构,天眸芯能够在传输带宽缩减高达90%的情况下,依然能够实现每秒10,000帧的高速感知、10位的高精度以及130分贝的宽广动态范围。传统图像传感器领域,各类元件间相互制约与影响。帧率、分辨率、动态范围和带宽在如此架构的支撑下,我们取得了新的平衡。
这些指标究竟蕴含着怎样的含义?以车辆穿越隧道时遭遇的剧烈光线变化为例,传统的RGB画面可能会在瞬间出现过曝或欠曝的情况。在天眸芯的运作之下,空间差分技术依旧能够捕捉到部分边缘与结构细节,而时间差分技术则擅长捕捉瞬息万变。即便其中一路信号遭遇干扰,剩余的两路亦有机会保留下可供后续算法分析的线索。
2024年5月,一篇论文荣登《Nature》杂志的封面。在这张引人注目的封面上,一块芯片被巧妙地分解成多种色彩斑斓的光束,每一束光都象征着一种独特的视觉元素。

- 源自:Nature -
芯片仅负责采集互补信息,然而,真正的挑战在于:在高速运动、过度曝光、频闪等视觉缺陷交织出现的情况下,不同感知通路所提供的信息可能会相互矛盾。那么,算法应如何甄别哪些线索更为可信,并将它们整合成适用于识别与决策的视觉表征?围绕这个问题,研究团队随后又投入了两年时间进行研究。
无完美画面之时
AI如何习得观察能力?
在全球范围内,致力于视觉算法研究的团队普遍遭遇一个共同的挑战:视觉算法往往依赖于大量标注明确、具有标准答案的数据集,即所谓的真值数据。在常规的光照条件和缓慢的运动状况下,研究者们较易获取清晰的图像和精确的标注;但在高速运动、强光过曝、频闪影响以及恶劣天气如暴雨和大雾等复杂场景中,图像可能发生结构扭曲或信息缺失,现实世界中很难找到一张完美无瑕、可作为参考的连续画面。这些真实退化数据因而难以融入传统的监督学习流程,同时亦容易沦为AI训练中的盲点。
围绕这个问题,杨哲宇所在的天眸芯团队选择了另一条路径。他们取法于人类视觉系统构建内部模型的方式:人类视觉系统无需为每一帧图像配备一个外部的“标准答案”,而是通过不同线索间的相互关系进行预测、验证,并在持续的交互过程中塑造对世界的内在认知。
他们将这一机制成功移植至算法设计之中。团队初期便着手利用天眸芯所采集的互补数据,构建了数组关键的中间表征:其中一组针对快速变化的光照条件进行了优化,另一组旨在缓解高速运动造成的模糊,而第三组则专注于处理图像的过曝与欠曝区域。这些表征各有其独特的优势与不足。为此,团队精心设计了一套机制,自监督学习框架,使它们能够相互预测和校验,并依据不同场景判断哪些信息更为可靠。
结果发现,即便在没有理想完美画面作为参考的情况下,该算法也能从多种不完整的信息中构建出更为完整的视觉图像,并最终解码出一张清晰度、动态范围以及时空对齐均达到最佳效果的画面。论文把它称作“估计视觉真值”。单目深度估计和视频实例分割任务,”应用于后续处理,显著提升了效果,与直接使用原始RGB数据相比。2026年8月,相关研究成果荣登Nature旗下首本专注于传感领域的期刊——Nature Sensors的封面,恰与天眸芯的封面论文相隔两年。
从光子到Token
这是物理AI领域不可或缺的桥梁。
在2025年博士学成之后,杨哲宇并未选择步入高校的讲台。尽管国内外多所知名高校向他伸出了教职的橄榄枝,他均礼貌地予以拒绝。在接受采访时,他表示:“在我的理解中,创业意味着全力以赴,倾注一切。”在当时,对于杨哲宇而言,接受教职或许更像是束缚而非助力。
创业之后,杨哲宇为该公司打造了一支由科研精英领航、融合了国际知名企业量产经验的年轻化工程技术团队。首席科学家赵蓉教授长期致力于清华大学类脑计算研究中心的感知研究方向;首席技术官王韬毅博士则长期参与天眸芯的研发工作,曾荣获全国中学生物理竞赛金牌,并在Nature等国际顶尖期刊上发表了13篇论文。
公司研发团队中博士与硕士学历者所占比例,已超过八成。核心工程团队成员具备十年至二十年凭借在图像传感器及芯片领域的丰富从业经验,曾服务于索尼、英伟达、安森美及国内领军级的网络安全解决方案提供商;至于产业化与市场团队,他们则深耕行业 20 余年曾主持年营业额达数亿美元的庞大业务。团队的能力贯穿于原创研究、芯片设计、工程量产以及市场落地的全过程。
目前,我国天眸芯一代芯片已成功实现点亮,同时,面向大规模生产的二代芯片亦已顺利完成流片阶段。按照设计指标,这款新一代芯片的像素分辨率将从二十万像素飞跃至五百万像素,其功耗与传统传感器相比更是降低约八成;同时系统还具备在感知前端直接提取用于大型模型的高信息密度视觉Token的能力,且首次Token的生成延迟被控制在数十毫秒以内。

- 来源:资料图 -
杨哲宇的观点是,英伟达正致力于将数据中心中的电子转化为Token;而他追求的目标,则是将感知前端的光子转换为Token,以便更直接地将外界光线转化为AI能够解读的视觉信号。前者主要服务于支持离身智能的文本聊天、网页问答等功能,而后者则着眼于机器人、无人机和自动驾驶那些需要实时解读物理世界的交互场景。
在晰见科技的官方网站上,有这样一行引人深思的文字:“明晰毫微,洞见万象。”这便是杨哲宇为公司精心构思的标语。自2019年起,天机芯迈向 2024 年之际,天眸芯从现在起,直至2026年,自然界之感应器,历经七载光阴,他们不仅将类脑计算从单纯的算力提升至感知层面,更将之推进至可学习系统框架的构建,紧接着,他们又将全情投入于物理AI的浪潮之中。

- 源自:Nature Sensors -
未来,杨哲宇及其团队的研究成果能否获得更广泛的认可,将依赖于这套视觉范式在实践中的应用验证。该范式有望成为大模型与世界模型探索物理世界的新突破口。他们正致力于将这一潜在的可能性转化为现实,为物理人工智能在视觉感知领域增添一种新的可能选择。
免责声明:本文版权归原作者所有。本文所用视频、图片、文字如涉及作品版权问题,请第一时间告知,我们将根据您提供的证明材料确认版权并按国家标准支付稿酬或立即删除内容!本文内容为原作者观点,并不代表本公众号赞同其观点和对其真实性负责。


为您发布产品,请点击“阅读原文”
