3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?

7 月 31 日,MiniMax H3 和字节跳动 Seedance 2.5 同日发布。3 天后,MiniMax H3 正式开源;8 月 7 日,Seedance 2.5 开放 api。
H3 主打开源、便宜,生成最长 15 秒、2K 视频 API 定价每秒 0.8 元;Seedance 2.5 则把单次生成时长从 15 秒拉到 30 秒,一次最多接收 30 张图片、10 段视频和 10 段音频,共 50 份多模态参考素材,还加强了时间戳控制、定向编辑和白模参考。
模型越来越好了,但产品能把它用好吗?
某种意义上,7 月份发布的这两个模型,反向证明了一件事:视频模型越强,产品反而越能够创造更多的价值。
⬆️关注 Founder Park,最及时最干货的创业分享
我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。
如果你正在做 AI 相关的事,欢迎和我们聊聊。
01
模型变强了,
产品层要做的事反而更多了
MiniMax 最近在 reddit 社区开了一场 AMA,分享了不少关于 H3 模型的信息。团队提到了一个在模型训练过程中发现的现象:模型的泛化能力在变强,一个只训练过「根据首帧和文字描述预测末帧」任务的模型,在没有接受图像编辑专项训练的情况下,也能在多个图像编辑测试中取得较好的结果。
换句话说,模型在训练一类任务的过程中,自发地学会了另一类任务。
这也意味着,一些过去需要专项模型或者搭配工作流才能完成的能力,已经开始被通用模型吸收了。只靠多接入几个模型形成的产品功能的差异,随着模型的泛化能力的提升,已经不复存在了。
抢先接入新模型,打时间差的优势,今天其实也没有了。
H3 开源后,主流的模型托管平台、开源工具和多家芯片厂商在几天之内就完成了适配。而作为业界瞩目的旗舰视频模型,Seedance 2.5 的同步接入已经是各类视频 Agent 产品的标配动作了。

LibTV 同步上线了 H3 和 Seedance 2.5
我们从 LibTV 了解到,H3 上线后,部分原本调用 Seedance 2.0 的电商和影视任务开始尝试 H3,主要考虑的是价格和具体任务表现。创作者会根据结果、价格和生产效率,在不同模型之间切换。
有些人已经摸索出一套跨模型工作流:先用 H3 打草稿,确认构图和节奏,满意后再换 Seedance 2.5 出终稿。草稿阶段可以确定提示词、参考素材组合和节奏。画面本身未必能直接带到下一个模型,但这套做法可以省下一部分试错成本。
很明显,模型选择本身正在成为一项需要产品来承接的能力。
什么任务需要调更贵的模型,什么场景用便宜模型就够了,这些都需要判断。产品还要考虑已有项目是否需要迁移。换掉底层模型后,原有的角色、场景和历史素材能否继续使用,也会影响选择。目前,这些判断仍然经常由创作者手动完成。长远看来,选择合适的模型这件事不应该是创作者要掌握的能力,这应该是产品和模型编排层要解决的问题。
除了选择模型,随着模型的变强,创作者还要管理更多变量。
首先是素材,一支广告、短剧或 MV,可能同时需要不同角色的正面与侧面参考,以及服装、场景、道具等等。Seedance 2.5 一次可以接收 50 份素材。用户要先找到正确版本,再把它们放进剧本和提示词的正确位置。输入上限提高后,素材的管理成为了新的瓶颈。

一个测试视频的素材管理,复杂一些的任务,素材会更多
然后是任务返工。视频从 15 秒延长到 30 秒,修复局部错误的代价也会变大。重新生成整条视频,token 花出去了,原本正确的部分也可能发生变化。
单条视频变长后,一次返工浪费的时间和费用也更多。能否只改坏掉的几秒,能否在正式生成前用较低成本验证方向,会直接影响项目的实际花费。Seedance 2.5 已经支持按时间戳定向编辑,并会尽量保持修改前后的连续性。模型提供了编辑能力,但产品要把它变成一套顺手的修改流程。
生成长视频还有另一层复杂度。H3 社区里有开发者分享过自己的办法:先让模型生成一段,再把上一段的尾部作为下一轮参考。生成时,他会持续提供同一张主体图片,以此维持角色一致性,最终拼出约 60 秒的连续视频。
MiniMax 技术团队对此回应道,这种续写能力确实存在。模型目前还没有原生训练过由多段续写组成的长视频,真正的连续长视频生成仍未实现。
这意味着,现阶段使用 H3 或 Seedance 2.5 生成长视频,仍要由应用层拆分片段、管理前后衔接,并维持角色和场景的一致性。模型提供续写能力,应用负责把这些片段组织成一个完整项目。
模型扩大的是生成空间,模型能力提升带来的这些工程复杂度,本来就应该由视频 Agent 和产品层来解决。
02
比起更快接入模型,
更好驾驭模型才是壁垒
今天的视频 Agent,已经在尝试解决这些实际的生产问题了。
LibTV 上的 AI 短剧《被裁掉的女孩》上线不到 30 天,第一季累计播放量已破亿。前 6 集主要由 3 个人完成,每集平均需要 2 到 3 天。技术门槛已经很低了,但生产上出现了一些新的瓶颈。
导演菲菲飞在采访中说,最耗费时间的环节往往是场景、服装、妆造和视觉基调的建立。团队需要逐一确认光比、色彩搭配、场景元素和人物服饰,再反复测试不同方案,直到画面接近他们想要的状态。为了让同一批角色连续出演十余集,电脑桌面上经常堆着几千张图片、几百条视频。只是要去找到某套服装或者某个场景,就需要花费不少功夫。
项目一旦进入连续生产,核心的瓶颈就从「能不能更快生成」转向了「能不能更好管理」。
SD2.5 和 H3 发布后,LibTV 核心的产品动作,基本也是围绕这些生产问题展开的。
首先是生成前的素材组织。逐帧拉片 Shot Breakdown 可以分析参考视频中的画面风格、关键帧、运镜、叙事节奏和背景音乐,再整理成可继续使用的参考素材组,这一过程不会扣除视频生成积分。
AutoLink 会读取剧本和画布素材,尝试把角色、场景和道具对应的参考自动放进提示词。用户仍然可以检查和替换,但不必从几十份素材中逐个查找和手动引用。它们的作用很实际,先替用户准备好输入,再交给模型。

第二个环节是生成后的局部修改。Seedance 2.5 本身提供按时间段定向编辑的接口,LibTV 把这项能力封装成时间轴上的选区、修改和回填流程。用户选中需要调整的区间,重新描述人物、动作或画面要求,再把新片段放回完整视频。
如果 30 秒里只有 2 秒出错,就只用重做这 2 秒,不用整条视频重跑。单条视频越长,局部修改能力的价值就越明显,能够显著降低重复生成的成本。
第三个环节是把多个片段组织成一个完整作品。Seedance 2.5 的单次生成上限是 30 秒,官方也支持多轮延长。LibTV 则支持把长任务拆成多个片段,保留中间节点和生成关系。用户可以展开、修改某个镜头,再同步回最终作品,最终可生成时长 5 分钟的视频。
用户可以展开查看、单独修改任一镜头,再同步更新最终视频
Seedance 2.5 API 上线当天,LibTV 就交付了这些功能。之所以能够同步上线,是因为画布、节点关系、资产库和时间线这套底座早就准备好了,新模型只需要接入既有结构。
反过来看,如果一个产品只有一个对话框和一个模型下拉列表,那么新模型再强,最终呈现的变化也只是模型选项里多了一个而已。
模型之上的竞争,比起谁先接入新模型,更关键的是谁能在新模型发布时,就已经准备好配套的生产系统,让模型能力真正快速交付用户想要的结果。
03
视频 Agent 之间的竞争,
开始走向模型层之上
模型迭代这么快,行业里始终有一种担心,Agent 应用会不会沦为单个模型的二道贩子?现有能力会不会被模型逐步吸收?
H3 和 Seedance 2.5 从不同维度提升了模型的能力空间:更强的任务泛化、更长的视频时长、更多的参考输入、更细的编辑控制。这些能力让单个镜头的生成变得更强,也让完整项目的管理变得更复杂。从这个角度来看,视频 Agent 的竞争优势和壁垒,也在随之变化。
新模型上线后,平台需要尽快判断它适合什么任务,哪些流量应该迁移,什么场景应该继续使用旧模型。H3 上线后的任务迁移,考验的就是这层响应速度。快很重要,但快是可以被追上的。
模型真正进入生产后,许多摩擦才会暴露出来。Seedance 2.5 支持更多参考,产品就得处理素材组织和匹配的问题。视频时长更长,产品就要降低局部错误带来的返工成本。生成素材越来越多,产品还得继续承接混剪和交付。
第三层涉及的是项目资产和团队流程的持续积累。一个项目做完,会沉淀下角色、场景、道具和历史镜头。团队还会形成审核与修改习惯,积累不同模型在具体任务上的效果数据。这些信息可以帮助下一个作品更快完成,也更难被复制。
视频 Agent 的素材管理,不管是模态还是复杂度上,都比代码 Agent 要更难管理。代码有 Git,写到一半的项目 clone 一下就能整体搬走,视频生产至今没有通用的状态格式。主角的面部参考、不同情绪下的表情设定,以及十几集积累下来的服装和场景资产,很多时候都与具体工具绑定。单个功能可能随时被模型厂商吸收,但这套持续积累的生产状态很难在一夜之间被取代。
过去的视频编排,更多是在图像、视频、配音之间传递结果。H3、Seedance 2.5 这样的模型出现后,编排的内容扩大了。Agent 还要处理剧本拆解、模型选择、素材继承、镜头状态和局部返工,以及决定人应该在何时介入。
未来的模型一定会吸收今天的一部分产品功能,靠单纯接入模型形成的差异也会继续缩小。但创作者最终要交付的内容不会变,他们面临的那些难题,素材组织、成本控制、局部修改和项目管理,也不会随着模型升级自动消失。
模型在变强,但模型编排没有消失,只是编排的对象从模型转向了作品。
今天视频 Agent 之间的竞争,也真正进入了模型层之上。好的模型,能决定第一条片子有多惊艳。一款好的 Agent 产品,最终决定了作品能否准时、高质量地交付。


和四位一线创业者聊聊:ToC Agent 那么卷,ToB 的机会在哪、落地卡点在哪?
对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场
对话景鲲:AI 产品的 All in One,是上下文的 All in One
Alphaist 陈哲对谈蓝驰陈维广:AI 应用的机会在哪里?具身到底怎么投?
Genspark 发布 GenOffice:AI 时代的 Office,免费、开源,抢占办公人群的第一工作入口
转载原创文章请添加微信:founderparker
