Turning Video Models into Generalist Robot Policies · MIT CSAIL 2026 · arXiv:2605.27817
← 返回 Study Hub让 14B 视频生成模型保持"零动作(action-free)"当作梦想未来的世界模型,再训一个基于图像空间雅可比场的逆动力学模型(J-IDM),通过光流把"梦到的未来画面"反解成机器人动作。 一个视频规划器,多个 IDM——通往零样本、跨本体机器人控制的路线。
~/projects/VERA 仓库代码。公式(雅可比场/伪逆)、实验数字来自论文;"与 IBVS 类比""差异化空间"为学习者解读。原文:arXiv:2605.27817 · 项目页 · 代码。| 项 | 内容 |
|---|---|
| 团队 | MIT CSAIL (Sizhe Lester Li, Evan Kim, Xingjian Bai 等), CMU, Amazon |
| 核心思路 | 解耦"视频规划器(本体无关)" + "J-IDM(本体特异)" |
| 视频模型 | Wan-14B 开源视频扩散 Transformer,LVP 初始化 |
| J-IDM 骨干 | VGGT(真机) / DINOv2+DPT(仿真) |
| 机器人 | Franka Panda(7-DoF) + Allegro Hand(16-DoF) |
| 数据 | DROID 39,816 episodes(Panda真机);Allegro真机仅 60-217 |
| 关键结果 | Panda-Sim 94% vs UniPi 0%;真机挑战任务(遮挡/位置) 60-80% vs DreamZero/π0.5 都是 0% |
| 开源 | 是(HuggingFace 有模型;Wave1 已放 MimicGen+PushT) |
VERA = Action-free 视频世界模型(规划器) + Jacobian IDM(翻译器)。二者独立训练:
[观测历史 o≤t + 文本指令 g]
│
▼
┌─────────────────────────┐
│ 视频世界模型(规划器) │ Wan-14B, Diffusion Forcing
│ Action-Free! │ 输入 N=6 context帧, 输出 M=4 future帧
│ 本体无关, 训一次 │ 只 commit K=1 前缀
└──────────┬──────────────┘
│ 梦到的未来帧 ô_{t+1..t+K}
▼
┌─────────────────────────┐
│ 光流估计器(现成) │ RAFT / AllTracker
└──────────┬──────────────┘
│ dense flow v_t(p) ∈ R^{H×W×2}
▼
┌─────────────────────────┐
│ Jacobian IDM(翻译器) │ VGGT / DINOv2+DPT
│ 本体特异, 每机器人训一个 │ 输出 dense per-pixel Jacobian
│ δa = J†·v (正则化伪逆) │
└──────────┬──────────────┘
│ 动作块 â_{t:t+K}
▼
执行 → 拿新观测 → 重新查询规划器(闭环 receding-horizon)
把经典机器人学的雅可比概念推广到图像空间——学习一个 dense per-pixel Jacobian field,表达"动作微增量如何驱动每个像素运动"。
给定图像 o,image-conditioned transformer J 对每个像素 p 输出一个矩阵,满足线性化关系:
其中 δa∈R^n 是动作增量,δp 是该像素的运动,J(p,o)∈R^(2×n)。
即对所有像素的雅可比方程做 ridge 正则最小二乘,闭式解:
本质是把"所有像素怎么动"这海量约束,最小二乘地压回到低维动作 δa 上。
VERA 的数学形式与经典的 基于图像的视觉伺服 (IBVS) 高度相似:
| 经典 IBVS | VERA | |
|---|---|---|
| 误差 | 手工特征误差 e = s* − s | dense optical flow v(p) = Flow(o_t, ô_{t+1}) |
| 雅可比 | 解析图像雅可比 / 交互矩阵 L | 学习的 dense per-pixel 雅可比场 J(p,o) |
| 求解 | 相机速度 v = L† e | 动作 δa = J† v (ridge 正则) |
| 目标来源 | 人工给定目标特征 s* | 视频生成模型"想象"出的未来画面 |
| 评测块 | Benchmark / 平台 | 任务与数据 | 为什么这样测 | 复现状态 |
|---|---|---|---|---|
| 仿真低/中/高 DoF | PushT / Panda-Sim / Allegro-Sim | 2-DoF、7-DoF、16-DoF 三档动作空间;比较 UniPi 和 J-IDM。 | 验证 J-IDM 的图像雅可比反解是否随 DoF 增大仍可用,避免只在低维 PushT 上成立。 | 未本地复现。 |
| 数据效率/DoF 扩展 | J-IDM scaling analysis | 固定 DoF 改数据量、固定数据量改 DoF,报告 reconstruction / action recovery。 | 证明 J-IDM 比 Direct-IDM 更适合高维机器人动作,不只是多一个网络名字。 | 未复现。 |
| 真机基础任务 | 真实机器人 push/pick | 与 DreamZero、π0.5 对比,基础任务 DreamZero 更高。 | 暴露 VERA 的短板:video-to-action 翻译仍是瓶颈,基础控制不一定最强。 | 未复现;真机数据不可用。 |
| 真机推理/OOD | Hidden Button / Location-based / Semantic-based | 遮挡按钮、位置条件、语义条件等任务。 | 检验冻结/微调视频 planner 的视觉推理能力是否能通过 J-IDM 转成动作;这部分 VERA 明显强于 DreamZero/π0.5。 | 未复现。 |
| 视频模型初始化 | Random / Wan-14B / LVP-14B | 比较 validation MSE。 | 证明 VERA 的 planner 依赖视频预训练和机器人视频 warm-start,不是随机初始化即可。 | 未复现。 |
| Model | Allegro-Sim (16-DoF) | Panda-Sim (7-DoF) | PushT (2-DoF) |
|---|---|---|---|
| UniPi* | 0.0 | 0.0 | 74.4 |
| J-IDM (VERA) | 70.0 | 94.0 | 92.5 |
(成功率 %) UniPi 在高 DoF 完全失败,VERA 稳定完成。
| 任务类型 | VERA | DreamZero | π0.5 |
|---|---|---|---|
| Push/Pick 基础 | 60% | 90% | 30% |
| 遮挡(隐藏按钮) | 80% | 0% | 0% |
| 基于位置 | 60% | 0% | 0% |
| 初始化 | Val MSE ↓ |
|---|---|
| Random(14B) | 0.40 |
| Wan-14B 预训练 | 0.13 |
| LVP-14B warm-start | 0.10 |
VERA = action-free 视频世界模型(梦想未来) + Jacobian IDM(用学习的图像雅可比场把光流反解成动作),是神经版、视频驱动的 IBVS,走"解耦规划+忠实翻译"路线实现零样本跨本体控制。
来源:VERA 论文附录 A.1(架构与训练配方)。核心是基于 Wan 家族视频模型的两个规模变体,混合精度训练。
| 模型变体 | 用途 | 训练硬件 | 初始化 |
|---|---|---|---|
| Wan-1.4B(文中亦记作 Wan-1.3B) | 开发 & 视频模型消融 | 单张 H100 | Wan-family checkpoint |
| Wan-14B | 主实验(main results) | 1 个节点 8× H200 | Wan-family / LVP checkpoint |
所有运行使用混合精度。VERA 分两部分:video world model(上表,是资源大头) + 轻量的 Jacobian IDM(把预测帧对反解成动作,参数远小于视频模型)。