谷歌相册上线Gemini Omni视频混剪,AI Agent生态转向运行时竞争
近日,谷歌正式宣布在谷歌相册中推出由Gemini Omni多模态大模型驱动的智能视频混剪功能,该功能率先面向特定国家的谷歌
AI
Plus、PRO和Ultra订阅用户逐步开放。同步推出的Managed Agents A
PI
重大更新,标志着谷歌的AI战略正从单纯的模型参数竞赛,全面转向Agent运行时控制能力的生态竞争,为
开发者
提供更完善的后台执行、远程MCP集成等全链路托管服务。
长期以来,普通用户处理
手机
里的海量生活视频始终是一件耗时费力的事:想要把旅行、家庭聚会的零散片段剪成一条完整的纪念视频,需要手动挑选素材、拼接片段、搭配BGM和字幕,不仅门槛高,还要耗费大量时间,绝大多数用户手机里的视频拍完之后就再也不会二次翻看。谷歌相册依托Gemini Omni强大的多模态理解能力打造的智能视频混剪功能,彻底解决了这一痛点,用户只需要用自然语言说出简单的需求,比如“把上周海边旅行的片段剪成一条3分钟的vlog,搭配轻快的背景音乐”,AI就能自动从相册的海量素材中筛选出符合主题的高光片段,自动完成剪辑转场、配乐匹配、字幕生成,几分钟内就能生成一条完整流畅的专业级视频。
Gemini Omni的多模态深度理解能力是这项功能的核心支撑,模型不仅能识别视频中的人物、场景、动作,还能读懂视频背后的情感脉络,自动筛选出最有纪念意义的高光时刻,避免把模糊、重复的无效片段放进成片里。同时功能还支持用户随时用自然语言调整细节,比如“把这段孩子奔跑的片段延长,换成更活泼的配乐”,AI就能实时修改剪辑结果,全程不需要用户掌握任何专业剪辑技巧,让普通用户零门槛就能把日常随手拍的零散视频变成值得分享的完整作品。
而同期发布的Managed Agents API更新,则展现了谷歌更深层的战略转向:过去行业的竞争焦点始终集中在模型参数、跑分性能等基础能力上,而谷歌这次直接把竞争维度升级到了Agent运行时控制层面。新的API提供了完善的后台执行托管能力,开发者打造的智能体可以在谷歌的云端后台长时间稳定运行,无需开发者自行搭建复杂的运行服务器,同时支持远程MCP协议集成,让智能体可以安全便捷地对接各类第三方服务与内部数据系统,大幅降低了企业级智能体应用的开发门槛。
从消费端的谷歌相册新功能,到面向开发者的Agent运行时服务升级,谷歌正在构建从C端用户场景到B端开发生态的完整AI闭环。这一系列动作不仅让普通用户能直接感受到多模态大模型带来的体验升级,也为整个行业的智能体应用落地提供了更成熟的基础设施,推动全球AI产业从“比拼模型性能”的上半场,正式迈入“落地真实场景”的全新发展阶段。
谷歌
谷歌
+关注
关注
27
文章
6284
浏览量
112763
Agent
Agent
+关注
关注
0
文章
299
浏览量
29491
智能视频
智能视频
+关注
关注
1
文章
54
浏览量
15601
大模型
大模型
+关注
关注
2
文章
4036
浏览量
5450
