Google重磅发布Gemini 3.5 Transcribe,嘈杂环境也能精准转文字
Google近日正式发布了Gemini系列最新的语音转文字模型Gemini3.5Transcribe,并将其定位为该系列迄今为止准确度最高的语音识别模型。该模型全面面向开发者、企业及广大普通用户开放,重点攻克了嘈杂环境、复杂专业术语以及自然口语表达等长期困扰行业的识别痛点。
在核心技术与应用场景方面,Gemini3.5Transcribe展现出了强大的泛化能力。新模型不仅能够有效过滤背景噪声,还对专业领域的复杂词汇提供了卓越支持。目前,该模型已率先为macOS平台的Gemini应用以及Android平台Gboard键盘的Rambler功能带来了显著性能改进。对于开发者而言,则可以借助这一工具高效构建语音智能体、实时字幕工具以及通话后分析流程等创新应用。
针对人类日常对话的复杂性,新模型在功能设计上进行了多项精细化优化。它能够更好地捕捉说话者的自然语义意图、识别自定义词汇,并辅助用户通过语音顺畅完成各种任务。同时,该模型原生内置了多项实用功能,包括自动自我修正、智能过滤并删除“嗯”、“啊”等口语填充词,以及对输出文本进行自动格式化。更具想象力的是,它还能将文件分析、图像生成等更复杂的长链条任务委派给其他Gemini模型处理,从而为用户带来全链路的多模型协作体验。
在客观的转写准确率表现上,Google公开的数据显示,Gemini3.5Transcribe在流式语音识别场景中的平均词错误率(WER)仅为4.0%,而在非流式场景中更是大幅降至2.6%。即便在噪声较多的复杂环境中,它依然能保持极高的识别稳定性,并且在识别由字母和数字交织组成的关键信息(如订单编号、邮政编码等)时更加精准无误。
在多语言与个性化适应性上,该模型同样表现亮眼。目前其语言支持已全面覆盖85种语言,并能完美适应不同地区的口音与方言变体。针对预处理音频,它支持为最多三名不同的说话者提供带时间戳的语音归属识别。模型还高度支持用户自定义词汇表,能够完美应对各行各业的专业术语、特殊拼写及专属名称。
在开放节奏与产品生态串联方面,开发者目前已经可以通过Google AI Studio和Google Antigravity中的Gemini API,以公开预览的形式抢先体验Gemini3.5Transcribe,而普通用户则可直接在Android和macOS平台进行日常体验。未来,Google还计划将其无缝引入Chrome浏览器,让用户能够在任意网页输入框中实现便捷的语音直接输入。伴随此前Gemini3.7Flash的推出、Gemini in Chrome面向美国全量安卓用户开放以及助手接入Waymo自动驾驶出租车,Google正在以极高的节奏持续完善其全场景AI产品矩阵。
