飞利信实现GTCRN架构全量移植至XMOS XU316边缘芯片
远程会议、TWS耳机、车载语音、具身
机器人
大规模普及,语音交互场景对降噪提出双重诉求:既要把各类环境噪声有效抑制,又要控制算法延时、完整保留人声保真度。长期以来,低延时与保真是端侧语音降噪难以平衡的行业矛盾。
近日,飞利信声学实验室端侧
AI
研发团队完成重大工程突破:实现GTCRN架构全量移植至XMOS XU316边缘芯片,完成端侧定点推理引擎全流程落地,在资源受限的硬件平台上达成16kHz/32bit实时流水线处理。这意味着超低延时AI语音降噪技术正式具备量产交付能力。
突破端侧算力桎梏,小模型释放边缘芯片算力
传统AI降噪
算法
大多依赖云端算力或者高性能
GPU
,很难部署在耳机、会议终端这类存储、功耗资源紧张的边缘设备。飞利信声学实验室从算法量化优化与硬件协同两个维度攻坚,充分挖掘XMOS XU316微算力平台潜力。
混合精度量化,极致压缩模型体积
采用int16整型+BFP块浮点混合精度量化方案,在几乎无损保留浮点推理精度前提下,模型权重压缩至约60KB,整体算法体积仅280KB。整套算法可完整载入XMOS XU316片上S
RAM
,规避外部存储器读取带来的额外延迟。
硬件指令深度适配,实现毫秒级推理
团队针对XMOS VPU向量处理单元定制专用内核,最大化发挥硬件并行计算优势。实测在256帧长处理流水下,单次完整推理耗时仅11.3ms,为终端带来近乎无感的实时降噪体验。
七层GTCRN网络,降噪不“伤声”
不同于RNNoise等传统轻量级降噪算法,在压制噪声过程中容易造成人声失真、音色受损,GTCRN采用Preprocessing → Enc/Dec Conv2d → GTConv → DPGRNN → Post七层轻量化网络结构,在时频域完成精细化噪声分离。
通过Babble人声噪声、键盘噪声、白噪声、雨声等多组5dB信噪比条件下测试,语谱图直观对比可见:GTCRN可以高效抑制稳态、非稳态各类环境干扰,最大程度保留语音谐波结构,输出语音清晰度与人声自然度表现优异,充分满足商务会议等高标准
音频
场景要求。
GTCRN(Grouped
Te
mporal Convolu
ti
onal Recurrent Network)由南京大学现代声学教育部重点实验室与地平线机器人联合研发,成果发表于语音领域顶会ICASSP 2024,属于业内参数量小、端侧推理效率领先的语音增强网络。
全链路工程落地,多场景开启商业化空间
本次并非单纯算法验证,而是一套完整商业级工程交付。团队打通算法训练、定点化
仿真
、硬件指令集适配全链路,打造出高可移植的端侧AI音频能力底座。技术能力可快速复用到多个高增长赛道:
智能会议终端
本地完成AI降噪运算,无需云端传输音频数据,兼顾拾音效果与企业数据隐私,适配全向麦、会议麦克风等设备。
TWS
蓝牙
耳机
在极小内存与功耗预算内实现通话降噪、环境音增强,改善通勤、嘈杂环境下的通话质量。
车载语音交互
有效抑制行车风噪、胎噪、发动机噪音,为智能座舱提供干净语音
信号
,提升车机
语音识别
成功率。
具身智能机器人
家庭、工业嘈杂环境下实现高质量远场拾音,解决机器人“听不清”的痛点,助力语音交互能力落地。
飞利信声学实验室后续将把GTCRN封装为标准化软件模组与IP产品矩阵,向行业开放输出,帮助各类硬件厂商快速为终端设备搭载高性能AI降噪能力。
写在最后
GTCRN在XMOS XU316平台的全量移植量产落地,验证了“小模型、大效果、快落地”的边缘AI商业化路径。既为会议音频设备提供可靠的端侧降噪底座,也将持续赋能车载、机器人等新兴产业,助力国内端侧音频AI产业链构筑核心竞争力。
关于飞利信声学实验室
飞利信声学实验室是北京飞利信科技股份有限公司(300287.SZ)旗下核心研发机构,二十余年深耕智能语音信号处理、远场拾音、AI降噪以及
嵌入式
音频系统。坚持全栈自研、场景驱动、量产验证,面向政务会议、企业协作、车载交互、具身智能机器人等行业输出成熟音频解决方案。
机器人
机器人
+关注
关注
215
文章
33113
浏览量
230379
耳机
耳机
+关注
关注
29
文章
3126
浏览量
87182
AI
AI
+关注
关注
92
文章
45436
浏览量
306184
原文标题:GTCRN 全量移植 XMOS XU316,端侧 AI 超低延时降噪实现量产落地
文章出处:【微信号:PHILISENSE,微信公众号:飞利信】欢迎添加关注!文章转载请注明出处。
