ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态
当听到「把双手举过头顶,然后向前走」,人可以在脑中补出一整段动作;当看到一段无声的人体轨迹,也能判断人物是在行走、转身还是踉跄。连续运动既可以被语言描述,也可以作为生成、预测和编辑的条件。
今天的多模态大模型已经能够理解和生成文本、图像,却很少把「人怎样连续运动」作为独立模态。动作从单帧延伸到数秒后,模型还需处理顺序、速度、方向、重心转移与全身协调。
北京大学、东华大学与华南理工大学的研究团队提出 UniMotion,将连续运动纳入统一多模态模型(Unified Multimodal Model,UMM),在同一框架中连接 Motion、Text 与 RGB。论文已被 ECCV 2026 录用。
图 1|UniMotion 在同一框架中覆盖运动理解、生成、预测与编辑等七项任务。
论文标题:UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
论文链接:https://arxiv.org/abs/2603.22282
项目主页:https://wangzy01.github.io/UniMotion
代码链接:https://github.com/wangzy01/UniMotion
统一多模态建模中的运动模态缺口
人体运动领域,「单帧」Pose 描述某一帧的人体构型,「多帧」Motion 则记录身体结构怎样随时间演化。逐帧姿态看起来合理,不代表连成序列后依然自然:脚掌落地后继续平移会形成脚滑,关节角度跳变会产生抖动,动作阶段顺序错误则会破坏完整语义。
现有 Motion–Text 方法多将轨迹量化为离散 token,便于接入语言模型,却可能损失细粒度变化和时间连续性;视觉大模型的人体建模又主要围绕静态 Pose 展开。UniMotion 则让连续运动以完整模态进入统一理解与生成过程。

表 1|代表性方法的任务覆盖与运动表示。UniMotion 是表中唯一覆盖七项任务的方法。
连续运动接口与跨模态对齐
UniMotion 建立在 Show-o2 1.5B 上。Text、Motion 和 RGB 进入共享 LLM backbone;文本继续使用离散 token 与自回归生成,Motion 和 RGB 则编码为连续 latent,并由各自的 flow head 完成生成。统一发生在语义与推理主干,模态专属接口仍被保留。
图 2|Motion 与 RGB 通过平行连续通路进入共享骨干,Text 保留自回归接口。运动 latent 经过语义与生成双路径嵌入器:前者概括动作含义与阶段,后者保留局部关节和时间位置;Hybrid Attention 与按模态路由的 LoRA 负责协调连续信号和文本的不同建模需求。
Cross-Modal Aligned Motion VAE(CMA-VAE)把运动编码为连续 latent。训练时,DPA 将带图像语义的后验对齐到只读取运动的 Motion Encoder;推理时视觉融合编码器被移除,纯运动任务无需额外图片。
图 3|CMA-VAE 通过训练期视觉后验对齐连续运动表示,两条编码通路共用 Motion Decoder。连续表示建立后,新运动通路仍需预校准。LRA 使用 motion latent 作为稠密条件,让 flow head 从噪声重建目标 latent,共同校准嵌入器、主干适配分支和生成头。Motion-to-Motion 只提供预训练信号,简单但清晰地提升下游任务上的能力。
图 4|LRA 以 Motion-to-Motion 自监督任务预校准运动生成通路。理解、生成与编辑能力

图 5|文本生成连续动作:左侧为「a person throws something then moves forward」,右侧为「a man jumps and brings both arms above his head as he spread his legs and then moves them back into the original position」。
Text-to-Motion 需要把语言展开为完整时序,Motion-to-Text 则从连续轨迹中概括动作含义和阶段顺序。
图 6|UniMotion 根据连续动作生成英文描述。Motion Editing 同时接收源运动与文本指令。下图中,源动作「挥手」被改为「喝咖啡」,动作语义发生变化,轨迹仍保持连续。
图 7|源动作在「not waving drink coffee」指令下被编辑为喝咖啡。Motion Prediction 则根据已观察前缀延续未来轨迹。样例提供 1.05 秒动作,模型继续预测随后 4.35 秒的变化。
图 8|模型根据 1.05 秒动作前缀预测后续 4.35 秒轨迹。同一接口还支持从图像恢复人体姿态、为图像或视频生成描述,并让参考运动参与人物图像编辑。运动由此可以充当输入、输出和跨模态生成条件。
实验结果
实验覆盖 HumanML3D、MotionFix、Human3.6M、MoVid 等数据集。雷达图显示,UniMotion 是对比方法中唯一覆盖全部任务方向的模型。
图 9|七项任务的跨任务结果概览论文在 Text-to-Motion、Motion-to-Text、动作预测、动作编辑和视觉人体恢复等任务上分别报告了有竞争力的结果;其中 Text-to-Motion 的分布指标并非全部最优,专用人体恢复模型也仍有更低误差。Text-to-Motion 的完整定量比较见论文表 3。
表 2|HumanML3D 上的 Text-to-Motion 结果。项目页还给出了同一复杂提示下的定性比较。在「a person stomps up some stairs」案例中,动作需要连续抬腿、转移重心并表现踏步力度;UniMotion 对这些阶段的执行更完整。
图 10|MoMask、MotionGPT 与 UniMotion 在同一英文提示下的生成结果。UniMotion 展示了统一多模态大模型接入连续、结构化非原生模态的一种方式:共享语义与推理能力,同时保留专属表示和生成接口。这一思路可服务于通用人体行为理解、数字人和内容创作,也为其他连续信号提供设计参照。
作者介绍
王梓懿、王鑫舜,北京大学深圳研究生院在读博士,研究方向为多模态大模型与人类运动;陈爽,东华大学在读本科生,研究方向为世界模型;丛杨,华南理工大学教授,研究领域为机器人自主操作、端侧智能与学习等等;刘梦源,北京大学深圳研究生院博导,研究领域为人类行为理解与机器人技能学习。
