谷歌DeepMind发布SL2T模型:手语转文本功能落地消费级产品助听障群体交流
发布时间:2026-08-13来源:互联网编辑
谷歌旗下人工智能实验室近日发布了一项突破性成果——一款大规模多语言手语转文本(SL2T)翻译模型。该模型首次将手语识别技术应用于消费级产品,为听力障碍群体带来重大便利。谷歌Pixel 11系列手机的Gboard键盘和Live Transcribe实时转录应用已率先支持美国手语转文本功能,未来计划扩展至更多语种和设备。
据统计,全球约7000万听力障碍者使用超过200种手语进行交流。传统输入方式难以满足他们的需求,而新功能通过模拟语音输入的便捷性,让用户能以更自然的方式完成文字交互。测试表明,使用美国手语输入的速度、流畅度和体验均优于传统英语键盘输入。
研发团队强调,手语作为独立自然语言,具有独特的语法结构和词汇体系。其翻译过程需要真正的机器翻译能力,而非简单的手势-文字对应。SL2T模型通过计算机视觉技术,可同步解析使用者手部、面部及躯干的复合动作,精准捕捉手语表达的完整语义。
该模型在训练阶段采用了创新方法:基于50余种手语的10万小时视频数据,通过提取关键姿势特征点生成位置信息,既确保翻译精度又保护用户隐私。与以往依赖"中间注释"的方案不同,新系统直接解析空间动态信息,显著提升了处理效率和准确性。
技术实现上,模型将手语视频转化为由3D坐标点构成的数字序列,这些点位对应人体关节的运动轨迹。这种处理方式避免了原始视频数据的传输,所有计算均在设备端完成,有效防止了个人生物信息的泄露风险。
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。
