谷歌DeepMind推出多语言手语转文本模型,助听障人士畅享灵活“打字替代”体验
发布时间:2026-08-13来源:互联网编辑
谷歌旗下人工智能实验室近日宣布,正式推出一款具备大规模多语言处理能力的手语转文本(SL2T)翻译模型。这项技术突破首次将手语识别功能引入消费级产品,谷歌Pixel 11系列智能手机的Gboard键盘和Live Transcribe应用已率先支持美国手语转文本输入,未来计划扩展至更多语种和设备平台。
据技术团队介绍,全球现有约7000万听力障碍者使用超过200种手语进行日常交流。传统输入方式难以满足这部分人群的沟通需求,而新功能通过实时转换手语动作,为用户提供了堪比语音输入的便捷体验。初步测试表明,使用美国手语进行文本输入的效率显著高于传统英文键盘输入,且操作过程更符合自然表达习惯。
研发团队特别强调,手语作为独立的自然语言体系,具有独特的语法结构和词汇系统。这要求翻译模型必须具备真正的机器翻译能力,而非简单地将动作序列对应为文字符号。为实现精准识别,系统需要同步解析使用者手部、面部及躯干的复合运动轨迹,这对计算机视觉处理技术提出了极高要求。
该模型通过分析超过10万小时的多语种手语视频数据进行训练,覆盖50余种手语体系。在隐私保护方面,系统采用创新方案:将原始视频流转化为由数百个关键身体节点构成的运动轨迹数据,既确保翻译精度又避免原始影像上传。这种处理方式还突破了传统模型依赖"中间注释"的局限,直接解析空间运动信息进行语义转换。
此前有科技媒体曾披露谷歌正在开发手语输入功能,此次官方公告证实了相关传闻。随着消费级设备首次集成专业手语翻译技术,听力障碍群体的数字沟通方式将迎来重要变革,这项突破也为跨语言交流技术开辟了新的发展方向。
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。
