ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态
北京大学、东华大学与华南理工大学的研究团队提出 UniMotion,将连续运动作为独立模态纳入统一多模态模型,连接 Motion、Text 与 RGB,覆盖理解、生成、预测与编辑等七项任务。论文已被 ECCV 2026 录用,并已发布代码与项目主页。
北京大学、东华大学与华南理工大学的研究团队提出 UniMotion,将连续运动作为独立模态纳入统一多模态模型,连接 Motion、Text 与 RGB,覆盖理解、生成、预测与编辑等七项任务。论文已被 ECCV 2026 录用,并已发布代码与项目主页。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
当多模态大模型还在文本、图像之间切换时,北大、东华与华南理工团队把「连续运动」作为独立模态接入统一框架,用连续 latent 而非离散 token 表示动作,试图在同一模型里完成理解、生成、预测与编辑。
今天的多模态大模型能理解和生成文本、图像,却很少把「人怎样连续运动」作为独立模态。单帧 Pose 只描述某一帧的人体构型,多帧 Motion 则记录身体结构随时间演化;逐帧姿态合理不代表连成序列后自然——脚掌落地后继续平移会形成脚滑,关节角度跳变会产生抖动,动作阶段顺序错误会破坏完整语义。
现有 Motion-Text 方法多将轨迹量化为离散 token,便于接入语言模型,却可能损失细粒度变化和时间连续性;视觉大模型的人体建模又主要围绕静态 Pose 展开。UniMotion 的出发点正是让连续运动以完整模态进入统一理解与生成过程。
UniMotion 建立在 Show-o2 1.5B 上。Text、Motion 和 RGB 进入共享 LLM backbone;文本继续使用离散 token 与自回归生成,Motion 和 RGB 则编码为连续 latent,并由各自的 flow head 完成生成。统一发生在语义与推理主干,模态专属接口仍被保留。
运动 latent 经过语义与生成双路径嵌入器:前者概括动作含义与阶段,后者保留局部关节和时间位置;Hybrid Attention 与按模态路由的 LoRA 负责协调连续信号和文本的不同建模需求。Cross-Modal Aligned Motion VAE(CMA-VAE)把运动编码为连续 latent,训练时用 DPA 将带图像语义的后验对齐到只读取运动的 Motion Encoder,推理时移除视觉融合编码器,纯运动任务无需额外图片。
连续表示建立后,LRA 使用 motion latent 作为稠密条件,让 flow head 从噪声重建目标 latent,共同校准嵌入器、主干适配分支和生成头。Motion-to-Motion 只提供预训练信号,简单但清晰地提升下游任务能力。
同一接口支持文本生成连续动作、从连续轨迹概括动作描述、按文本指令编辑源运动(如把「挥手」改为「喝咖啡」)、根据已观察前缀延续未来轨迹(样例提供 1.05 秒动作,预测后续 4.35 秒),以及从图像恢复人体姿态、为图像或视频生成描述、让参考运动参与人物图像编辑。运动由此可以充当输入、输出和跨模态生成条件。
实验覆盖 HumanML3D、MotionFix、Human3.6M、MoVid 等数据集。雷达图显示 UniMotion 是对比方法中唯一覆盖全部任务方向的模型;论文在 Text-to-Motion、Motion-to-Text、动作预测、动作编辑和视觉人体恢复等任务上分别报告了有竞争力的结果。
但论文也承认,Text-to-Motion 的分布指标并非全部最优,专用人体恢复模型仍保持更低误差。在「a person stomps up some stairs」这类复杂提示下,UniMotion 对连续抬腿、重心转移与踏步力度的执行比 MoMask、MotionGPT 更完整。
本文信息全部来自机器之心对论文的报道,属于二手转述;论文细节(如具体指标、数据集结果)未提供第一手数据,相关结论应视为来源声称而非已证实事实。
UniMotion 展示了一种把连续、结构化非原生模态接入统一多模态大模型的方式:共享语义与推理能力,同时保留专属表示和生成接口。这一思路可服务于通用人体行为理解、数字人和内容创作,也为其他连续信号提供设计参照。
主报道
主报道来源