无联网能力的设备怎么快速增加 AI 语音交互能力
很多做硬件的同行最近都在琢磨同一件事。手里的产品,血压计也好、电子锁也好、老一代小家电也好,本来没带联网模块,可用户现在就想要能对话。问题卡在一个很现实的地方,设备自己没网,怎么让它听得懂、答得出。
设备没有网络,不代表不能加
AI
语音。在唯创知音的在线
语音识别
方案里,这件事已经跑通,而且给了两条不同的路,区别只在产品想做到多聪明。
第一条路最省事,不联网,纯本地。
WT2606A 是一颗专为语音交互做的 SoC 芯片,QFN42 4×5mm 的封装,可以直接焊进现有的主控板。它把唤醒、识别、降噪、回声消除、语音播报都集成在片内。本地离线就能完成听到指令、认出意思、念出回复这一串动作,不需要云端,也不需要任何网络。规格书里写得很清楚,端侧识别支持 200 条自定义词条,AEC、ANS、AGC、V
AD
一整套
音频
算法
都在芯片里跑。
这套算法管的是同一件事,把麦克风收来的声音收拾干净。AEC 负责消掉设备自己喇叭放出来的回声,不然它会对着自己播的音乐误唤醒。ANS 压的是风扇、空调、
电机
这类环境噪声,信噪比低了识别率就垮。AGC 把音量拉平,人贴着设备说和隔三米喊,后端收到的幅度都差不多。VAD 判断哪一帧才是人声,平时让芯片休眠,听到人说话才醒、才送识别,功耗和误唤醒率都靠它压。
电子锁就是这么做的。WT2606A负责识别加一颗 2606B 负责驱屏,锁具就能当 AI 管家使,开门报天气、留语音留言、摆个 Q 萌表情,全程不依赖网络。
本地方案有个边界得说清楚。200 条词条以内、回复走预录语音或简单规则,它应付得很稳。你要让它像人一样自由聊天、查知识库、答开放问题,本地就不够了,那得把脑子放到云端。
第二条路更彻底,给设备自己装一张网卡。
WT3000A-M08 是一颗
4G
Cat.1 语音模组。它最实用的一点是免配网,开机即用。设备原本没有 WiFi 也不怕,模组自带蜂窝网络,一上电就直连云端大模型,不用用户去进行配网操作用起来更方便。
规格书里的血压计案例走的就是这条路。4G
通信
无需配网,老人按一下就开始测,测完直接问"我这血压和上周比咋样",云端把数据拉出来分析,再用语音念回给他。声纹识别能认出是谁在问,声音克隆还能把家人的声音存进机器里。这些体验本地芯片给不了,必须靠云端算力。
两条路接到老设备上的方式其实一样。
规格书里写得很直白,"面向无网络通信能力的产品,通过集成第三方
MCU
/SOC,快速打通语音交互控制链路"。翻译成人话,两颗芯片都通过
UART
串口对接你现有的主控,硬件改动很小,软件有现成的通信协议和
SD
K,厂商不用自己从头写语音算法。
这也解释了方案为什么叫 1+1 架构。本地一侧负责把声音收干净、把唤醒词认出来,云端一侧负责听懂语义、生成回答。两边分工,弱网的时候本地先顶着,网络顺了云端接着聊,多轮对话才稳。
那到底选哪条路。
我的判断很直接。产品指令固定、本来就不想养流量费、只想让用户动口不动手,WT2606A 本地方案就够了,成本和功耗都压得低。产品要做健康
问答
、知识库、陪聊这类吃大模型的能力,就上 M08 的 4G 模组,它把最劝退的让客户连 WiFi 这一步直接删掉了。两条路都不用把老产品推倒重来,焊一颗芯片或者插一个模组,它就会听会说了。
