首页 /研究 /掩码视觉动作:统一世界建模的新方法
MANIPULATION

掩码视觉动作:统一世界建模的新方法

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

发表年份
2026
访问权限
开放获取

摘要

本文提出掩码视觉动作,一种像素空间控制接口,通过视频中部分揭示的任意实体轨迹来表达动作,使视频模型能够作为前向动力学模型预测场景对低层机器人动作的响应。仅需15小时真实视频和模拟中的掩码示例微调,单个检查点即可在多种场景和多个实体上实现强视觉保真度和可控性,并用于下游操作任务中的策略评估和基于模型的规划。

关键词

masked visual actionsworld modelingrobotic manipulationpixel-space controlforward dynamics

相关论文

查看 MANIPULATION 分类全部论文