Google发布Gemini3.5 Transcribe:其为迄今为止“最精准”的语音转文本模型-AITOP100,AI资讯
当地时间8 月 26 日,Google 正式发布 Gemini 3.5 Transcribe,这是 Gemini 音频(Gemini Audio)产品线的最新语音转文本模型。Google 称其为迄今为止“最精准”的语音转文本模型。
模型地址:谷歌Gemini官网 (海外网站需要科学上网)

一、模型定位:从“逐字记录”到“理解式转录”
与传统语音识别模型不同,Gemini 3.5 Transcribe 并非简单地逐字记录,而是将原始音频直接转换为经过清理和格式化的文本。Google 官方博客将其定位为“专为智能语音交互设计的精确语音转文本模型”。
该模型与此前发布的 Gemini 3.5 Live Translate 同属 Gemini Audio 产品线。据 Google 透露,Gemini 3.5 Transcribe 相比上一代转录模型 Chirp 3 实现了“重大进步”,尤其在多语言性能和词错率方面提升显著。从用户说话到最终生成转录文本,整体速度预计可提升约 70%。
二、核心功能:自我修正、填充词删除、函数调用
Gemini 3.5 Transcribe 的核心能力可概括为五个方面:
1. 智能转录(Smart Transcription)
模型可无缝处理说话过程中的自我纠正——例如用户说“我们周二见面——不,还是周三吧”,模型会自动识别并输出正确的“周三”。同时自动删除“嗯”“呃”“啊”等填充词,并对输出文本进行自动格式化。
2. 函数调用(Function Calling)
模型可将图像生成、文件分析等复杂任务委派给其他 Gemini 模型执行。这一能力目前已在 macOS 版 Gemini 应用中上线。
3. 自定义词汇(Custom Vocabulary)
用户可向模型提供自定义词汇表,使其识别专业术语、特殊拼写及行业专有名称。
4. 多语言支持
模型自动检测并转录超过 85 种语言,并支持地区口音和不同方言。
5. 多说话者识别
在预录音频场景中,模型可为最多三名说话者进行带时间戳的语音归属识别。Google 表示对三名以上说话者的支持目前为实验性功能。
三、性能数据:流式 4.0%、非流式 2.6%
Google 公布了由第三方机构 Artificial Analysis 测量的词错率(Word Error Rate, WER)数据:
| 场景 | 词错率(WER) |
|---|---|
| 实时流式 | 4.0% |
| 非流式(预录音频) | 2.6% |
在 FLEURS 多语言基准上,模型同样全面优于上一代 Chirp 3。Google 还表示,模型在噪声较多的真实环境中具备更好的转写表现,能够准确识别邮政编码、订单号等字母数字实体。
四、应用落地:Gboard Rambler、macOS Gemini、Chrome 即将上线
Gemini 3.5 Transcribe 已进入多条 Google 产品线:
- Android — Gboard Rambler:该模型已为 Android 平台 Gboard 键盘的 Rambler 功能提供支持。Rambler 是 Google 在 5 月宣布的语音输入功能,可将口述想法转化为精炼文本,并支持语音编辑、纠正拼写错误、更改写作风格。目前 Rambler 支持阿拉伯语,需在 Pixel 11 上使用,并在部分国家和地区逐步推出。
- macOS — Gemini 应用:模型已向所有 macOS Gemini 应用用户以英语推出。用户可通过语音让 Gemini 生成图像、查询信息、总结文本、分析文件等。
- Chrome 浏览器(即将上线):Google 计划将模型引入 Chrome 浏览器,届时用户可在任意网页输入框中直接通过语音输入文字。
此外,模型还将扩展至 Search Live、Gemini Live、Docs、Keep 和 Gmail 等产品。
五、开发者入口:AI Studio 与 Antigravity 公开预览
开发者现可通过以下渠道以公开预览形式使用 Gemini 3.5 Transcribe:
- Google AI Studio:通过 Gemini API 访问
- Google Antigravity:Google 的代理式开发平台
- Gemini Enterprise Agent Platform:企业用户入口
模型通过两套 API 提供服务:
- Live API(
gemini-3.5-transcribe-live):实时流式接口,支持双向流式传输,延迟低于一秒 - Interactions API(
gemini-3.5-transcribe):处理预录音频,支持会议、通话录音转写,提供词级时间戳
六、关于 Gemini 3.5 Live 的说明
部分早期报道提及 Google 同时发布了 Gemini 3.5 Live 和 Gemini 3.5 Live Experimental 两款模型。但据 The Verge 后续更新,Google 方面澄清仅 Gemini 3.5 Transcribe 于 8 月 26 日正式发布,另外两款模型并未同步推出。
Gemini 3.5 Transcribe 以 2.6% 的非流式词错率、85+ 语言支持、自我纠正与填充词自动删除等能力,将语音转文本从“听写工具”升级为“理解式转录”方案。配合函数调用能力,模型不仅转写语音,还能将语音指令转化为跨模型的任务执行。随着 Rambler、macOS Gemini 和即将到来的 Chrome 集成逐步铺开,这一模型正在从开发者工具走向广泛的消费级应用场景。
更多信息请参阅官方博客:blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:


