声网联手爱芯元智,为机器人装上“实时互动”的耳朵和嘴巴
声网与爱芯元智近日联合推出了一套面向
机器人
的实时互动方案,把声网在实时音视频
通信
领域的技术积累,和爱芯元智在端侧
AI
芯片上的算力优势结合起来,让机器人拥有了低延迟、高自然度的实时对话能力。这个方案瞄准的,正是服务机器人、陪伴机器人、导览机器人等需要与人频繁交互的场景。
先
拆解
一下这套方案解决的核心问题。机器人要和人实时对话,技术上需要同时跑通好几件事:把人说的话准确识别成文字,理解这句话的意思,生成合适的回复,再把回复文字转成自然流畅的语音播放出来。这中间任何一个环节慢了,对话就会出现令人不适的停顿,体验大打折扣。更麻烦的是,机器人通常工作在商场、餐厅、医院、家庭等真实环境中,背景噪音、多人说话、远距离拾音等情况都会给语音交互增加难度。
声网在这套方案里主攻的是实时音视频传输和远程协同能力。声网在实时通信领域深耕多年,其
SD
K已经被广泛应用于视频会议、直播连麦、在线教育等对延迟要求极高的场景。在机器人实时互动方案中,声网的技术主要负责两个层面:一是机器人本体的
音频
采集和处理,包括回声消除、噪声抑制、自动增益控制等,确保机器人在嘈杂环境中也能清晰拾取人声;二是当机器人本地的端侧AI处理能力不够时,可以借助声网的低延迟传输通道,把音频数据实时送到云端的大模型进行处理,再把结果近乎实时地传回来,整个过程延迟可以控制在毫秒级别,用户几乎感觉不到是在和云端交互。
爱芯元智在这套方案里提供的则是端侧AI芯片的算力支撑。爱芯元智专注于边缘AI芯片的研发,其芯片产品在视觉感知、语音处理等方面有较强的性能表现,同时功耗控制出色,适合部署在对散热和续航有要求的机器人设备上。在联合方案中,爱芯元智的芯片负责处理机器人本地的语音唤醒、降噪、
语音识别
等轻量级AI任务,让机器人在不联网的情况下也能完成基本的语音指令响应。当遇到复杂对话需求时,再通过声网的通道调用云端大模型,做到“简单任务本地处理,复杂任务云端协同”的分级计算模式。
这种端云协同的架构设计,兼顾了实时性和智能化程度。完全依赖云端处理,延迟和网络稳定性是硬伤;完全依赖端侧处理,芯片算力有限,跑不动大模型,对话能力会显得笨拙。声网和爱芯元智的方案把两者结合起来,日常的唤醒、简单
问答
在本地芯片上快速完成,保证响应速度;复杂对话、情感识别、多轮交互等重任务上云端,保证回答质量。这种分工让机器人在不同网络条件下都能保持较好的交互体验,即使在网络
信号
不好的角落,也不会完全变成“哑巴”。
从应用场景来看,这套方案有很广的落地空间。在酒店里,服务机器人可以用自然语言和客人对话,完成送物、问询、导航等任务;在商场里,导览机器人能听懂顾客的询问,给出店铺位置和促销信息;在养老院,陪伴机器人可以和老人聊天、提醒吃药、紧急呼叫;在家庭中,扫地机器人、桌面机器人也能从简单的指令执行升级为更自然的语音交互。这些场景对实时性的要求都很高,没有人愿意对着机器人说一句话后等两三秒才得到回应,声网和爱芯元智的方案正是瞄准了这个体验痛点。
声网和爱芯元智的这次合作,也反映出机器人行业一个正在发生的趋势:产业链分工越来越细,单打独斗越来越难。做通信的、做芯片的、做
算法
的、做整机的,各自在自己最擅长的环节做到极致,再通过深度整合形成完整的解决方案,正在成为行业主流。对于机器人厂商来说,直接采用这种联合方案,可以省去大量底层技术研发和适配调试的时间,把精力集中在产品定义、场景深耕和用户体验打磨上,产品上市周期能明显缩短。
随着大语言模型和语音合成技术的快速进步,机器人的对话能力正在发生质的飞跃,从过去只能理解固定指令,变得越来越接近真人交流。但要让这种能力从实验室演示走进千家万户,还需要解决实时性、稳定性、成本控制等一系列工程化问题。声网和爱芯元智联合推出的这套方案,正是在工程化落地上迈出了扎实的一步,让“会说话的机器人”离普通人的生活更近了一些。
智能化
智能化
+关注
关注
15
文章
5310
浏览量
60817
音视频
音视频
+关注
关注
4
文章
646
浏览量
31716
AI芯片
AI芯片
+关注
关注
17
文章
2226
浏览量
37206
爱芯元智
爱芯元智
+关注
关注
1
文章
157
浏览量
5680
