字节跳动SeedRealtime大模型上线 音视频实时交互更自然
近日,字节跳动正式对外发布原生音视频全双工大模型SeedRealtime。这款采用统一架构原生融合
音频
、视频与文本能力的全新大模型,实现了在连续多模态信息流上的实时流畅交互,给用户带来了“边看、边听、边说”的全新体验,目前已经在豆包App里全量上线,所有用户都能直接体验到它的能力。
很多人之前用过多模态
AI
对话工具,或多或少都遇到过不少糟心的小问题:自己话还没说完,AI就急着打断开始回复;等自己说完了,AI要愣好几秒才慢吞吞给出回应;有时候只是背景里传来一阵杂音,或是随口说了两句无关的闲聊,AI就误以为是指令开始瞎接话;要是同时开着摄像头让AI看着画面实时交流,画面、声音、文字之间还经常不同步,交互起来总觉得卡顿又生硬,完全没有和真人聊天那种自然流畅的感觉。SeedRealtime这款新模型,就是专门瞄准这些长期困扰用户的交互痛点做的定向突破。
和过去常见的把音频、视频、文本几个独立模型拼接起来的级联方案不同,SeedRealtime从最开始设计的时候,就用一套统一的底层架构把三种模态的能力原生融合在了一起。它不用先把声音转成文字、再单独处理视频画面、最后拼接生成回复,而是直接把连续的音频流、视频流当成完整的信息流同步处理,从根源上避免了多个独立模型拼接带来的延迟高、不同步的问题,整个交互过程的响应速度和流畅度都得到了质的提升。
根据字节跳动公开的端到端人工评测结果,和传统的级联多模态模型相比,SeedRealtime的音视频对话节奏相关的问题直接减少了一半。它对人类说话时机的把握变得特别自然,就像和熟悉的朋友聊天一样,能精准判断你什么时候是真的说完了、什么时候只是短暂停顿思考,再也不会出现话没说完就被AI抢断的尴尬情况,也不会在你话音落下之后半天没反应,让场面陷入冷场。同时它的抗干扰能力也强了很多,背景里的环境杂音、你随口和身边人说的无关闲聊,都不会误触发它的回复,不会出现莫名其妙接错话的情况。
除此之外,SeedRealtime还大幅提升了长对话的流畅度,单次连续交流过程里,能一直保持逻辑连贯、回应顺畅的概率有了非常明显的提升。哪怕你连着和它聊十几分钟,一边展示手里的实物、一边对着它提问,它也能全程跟上你的思路,不会出现聊着聊着就跑偏、忘记之前对话内容的情况,整个交互过程的体验感非常贴近真人实时交流的状态。
现在这款全新的SeedRealtime大模型已经在豆包App里全量上线,所有用户打开最新版本的豆包,就能直接体验到这种流畅自然的音视频实时交互能力。后续字节跳动还会基于这款模型持续优化交互细节,把更自然的实时多模态体验落地到更多日常使用的场景里。
APP
APP
+关注
关注
33
文章
1597
浏览量
76725
音视频
音视频
+关注
关注
4
文章
647
浏览量
31732
字节跳动
字节跳动
+关注
关注
0
文章
359
浏览量
10249
大模型
大模型
+关注
关注
2
文章
4170
浏览量
5663
