显式 vs 隐式预测 · 视觉-触觉矩阵 · 开环/闭环 · MPC+CEM 规划 · 基于 30+ 篇论文分析
← 返回 Study Hub世界模型(World Model)是一个能预测"未来会怎样"的模型。在机器人里它回答的核心问题通常是两类之一:
| 类别 | 预测什么 | 典型 |
|---|---|---|
| ① 显式可解码预测 | 直接预测可解码的未来观测(图像/视频/触觉图/力/音频)。即使在 VAE/video-token latent 里去噪,目标仍是可解码的未来观测 | Cosmos, DreamZero, DreamTac, VTAM, UniPi, LVP |
| ② latent/embedding 预测 | 预测紧凑状态(DINO/V-JEPA/触觉encoder latent/TD-MPC state),控制/规划直接在 latent 空间算代价,不还原像素 | V-JEPA2, DynaGuide, ContactWorld, FOWM, DDP-WM |
| ③ 混合 / 边界 | 训练时带可解码未来预测、推理时主要出动作;或是 benchmark/survey | Fast-WAM, DeFI, LAPA, World-VLA-Loop |
| # | 数据集/平台 | 被引 | 类型 |
|---|---|---|---|
| 1 | DROID / Isaac 系列 | 31 | 真机数据 / 仿真器 |
| 3 | LIBERO(含变体) | 29 | 仿真 benchmark |
| 4 | Open X-Embodiment | 21 | 跨本体预训练 |
| 5 | BridgeData V2 | 18 | 真机预训练 |
| 6 | RoboCasa(含365) | 15 | 仿真 benchmark |
| 7 | CALVIN | 13 | 仿真(ABC→D 为 OOD) |
| 8 | SimplerEnv | 12 | 仿真评测(真机对标) |
共同点:预测目标常写成 latent video token / VAE latent,但最终语义是"未来画面/视频"。
| 方法 | 年份 | 预测目标 / 用途 |
|---|---|---|
| UniPi | 2023 | 文本条件未来视频 → inverse dynamics 转动作 |
| Genie | 2024 | 离散视频token+latent action,交互式下一帧(可交互生成环境) |
| Cosmos | 2025 | 未来视频/动作条件下一帧,world foundation model |
| LVP | 2025 | 规划用未来视频(video-as-plan),再接 action model |
| DreamVLA | 2025 | 生成式未来视觉/动作表征,增强 VLA |
| DreamZero | 2026 | 未来视频latent+动作(world-action model),零/少样本策略 |
| tau0-WM | 2026 | 统一 video-action,动作条件视频模拟/规划 |
| Cosmos3 | 2026 | 图像/视频/音频/动作多模态未来观测(omni-modal) |
| CosmosPolicy | 2026 | 未来视频帧+动作+未来状态/价值 latent frame |
| RISE-WM / DreamDojo / EgoWM / GigaWorld-0 | 2026 | 动作条件未来视频,作想象环境/策略基座 |
| 方法 | 预测目标 | VAE 类型 |
|---|---|---|
| OmniVTA | 未来视觉序列 + TacVAE 触觉 latent,用于接触概率+门控融合 | TacVAE |
| DreamTac | 统一预测未来视觉/触觉 latent/动作,可 VAE 解码可视化 | Vision-Tactile VAE |
| VTAM | 未来多视角视觉帧 + GelSight 触觉帧/latent,flow matching | Video VAE |
| MMVP | 早期,未来 RGB + haptic/audio/vibration 多模态信号 | — |
核心不是"生成给人看的画面",而是学一个服务控制的状态动力学;预测结果是 feature/latent,规划代价也在这个空间算。
| 方法 | 预测 | 控制 |
|---|---|---|
| FOWM | 下一 latent state z(TD-MPC 风格) | MPC/TD learning + online fine-tune |
| V-JEPA2 | 未来 V-JEPA embedding | CEM/MPC 在 feature space 规划到 goal |
| DynaGuide | 未来 DINOv2 patch feature | gradient guidance / feature-space 规划 |
| DDP-WM | 下一 DINO feature(稀疏前景+低秩背景) | MPC cost in feature space |
| 方法 | 预测 | 控制 |
|---|---|---|
| MvM | 触觉膜形变 latent、wrench/pose | MPPI/MPC |
| TS-NVAE | NewtonianVAE 物理对齐 latent | latent-space 比例控制 |
| ContactWorld | 下一 multimodal latent(JEPA) | CEM/MPC 接触规划 |
| VTWM | 视觉 token + Sparsh-X 触觉 embedding 的未来状态 | CEM 有限时域规划 |
| DreamTacVLA / TacForeSight | 未来触觉 latent(策略前瞻) | 注入策略精炼动作 |
口径:强显式=可解码为图像/视频/触觉图/形变场/haptic;弱显式=模态专属 token/embedding 预测目标但控制在 latent 空间;隐式=只进共享 latent,不单独输出该模态未来观测;N/A=不涉及该模态。
| 方法 | 视觉 | 触觉 |
|---|---|---|
| MMVP | 强显式:未来RGB | 强显式:haptic/audio/vibration |
| OmniVTA | 强显式:未来视觉序列 | 强显式:TacVAE 未来触觉 |
| DreamTac | 强显式:未来视觉latent(可视化) | 强显式:未来触觉latent(可视化) |
| VTAM | 强显式:未来多视角视觉帧 | 强显式:未来GelSight触觉帧 |
| VTWM | 弱显式:未来视觉state/token | 弱显式:Sparsh-X触觉embedding |
| 方法 | 视觉 | 触觉 |
|---|---|---|
| DreamTacVLA | 隐式(进VLA hidden) | 弱显式:未来触觉embedding |
| TacForeSight | 隐式(DINOv2编码) | 弱显式:未来触觉latent |
| ViTacFormer | 隐式:视觉token融合 | 弱显式:自回归未来tactile token |
| PACE | 隐式:进ACT策略 | 弱/结构显式:未来触觉/contact delta |
| MvM | N/A | 弱显式:触觉膜形变latent+wrench/pose |
| 方法 | 说明 |
|---|---|
| ContactWorld | JEPA 式隐空间,只预测下一 multimodal latent,CEM/MPC 在 latent 规划 |
| TS-NVAE | NewtonianVAE 控制 latent,不生成未来视觉/触觉 |
MMVP, UniPi, Cosmos, LVP, DreamVLA, GigaWorld-0, EgoWM, DreamTac, VTAM(未来触觉主要是辅助输出/可视化), PACE(pred head 只训练时用,推理移除), Fast-WAM, DeFI, LAPA, Cosmos3
| 方法 | 闭环方式 |
|---|---|
| MvM / DDP-WM / FOWM | latent dynamics + MPPI/MPC/TD-MPC |
| V-JEPA2 | CEM/MPC 在 feature space 规划 |
| DynaGuide | 推理时 gradient/action guidance |
| ContactWorld | JEPA latent + CEM/receding-horizon MPC 接触规划 |
| OmniVTA | 预测接触概率调节融合 + RLTC 60Hz 触觉闭环 |
| DreamTacVLA | Think-Dream-Act:草案动作→预测未来触觉→精炼动作 |
| TacForeSight / ViTacFormer | 预测未来触觉 latent/token 反馈进动作生成 |
| RISE-WM / World-VLA-Loop | 世界模型作想象环境,策略在rollout中自改进 |
| 方法 | 为什么是边界 |
|---|---|
| VTWM | 用 CEM 有限时域规划,但 best sequence 在真机open-loop trajectory chunks执行,非高频闭环 |
| DreamZero | 异步闭环(执行chunk后用真实观测替换预测),但不是 MPC 搜索 |
| tau0-WM | 可直接出动作,ACVS 模式评估候选rollout再修正(test-time computation) |
| CosmosPolicy | 直接策略 + model-based planning(N=5候选+价值) |
| DreamDojo | 候选动作→预测未来视频→外部value model重排(best-of-N,非CEM/MPC) |
| 模型 | CEM 采样对象 | 用法 |
|---|---|---|
| ContactWorld | 未来 H 步动作序列(horizon=6, candidates 64-100, topk=8, iter=4) | 编码当前观测→CEM采样→latent rollout→目标latent距离打分→只执行第一步→重规划 |
| V-JEPA2 | 动作候选(80 samples × 10 refine) | feature space CEM 搜索,使预测 embedding 接近 goal embedding |
| 模型 | 说明 |
|---|---|
| VTWM | H=2秒,36 particles,10 iter;但 best sequence open-loop 执行,论文明说 CEM 昂贵导致 open-loop trajectory chunks |
| MultimodalPretraining | N=120,8-step horizon,LPIPS 目标图像代价;未说明 receding-horizon replanning |
| 模型 | 实际是什么 |
|---|---|
| MvM / DDP-WM | MPPI/MPC,不是 CEM |
| FOWM | TD-MPC 风格,无 CEM elite 更新证据 |
| DynaGuide | gradient/action guidance,不是 CEM 规划器 |
| CosmosPolicy | N=5候选+价值+majority voting,不是 CEM elite 重拟合 |
| DreamDojo | best-of-N / value reranking,不是 CEM |
| 范式 | 代表 | CEM | MPC |
|---|---|---|---|
| CEM + receding-horizon MPC | ContactWorld, V-JEPA2 | ✓ | ✓ |
| CEM 有限时域/开环chunk | VTWM, MultimodalPretraining | ✓ | ✗ |
| MPPI/MPC/TD-MPC latent | MvM, DDP-WM, FOWM | ✗ | ✓ |
| Best-of-N / value reranking | DreamDojo, CosmosPolicy, tau0-WM | ✗ | ✗ |
| Gradient/action guidance | DynaGuide | ✗ | ✗ |
| 策略内部前瞻/动作精炼 | DreamTacVLA, TacForeSight, ViTacFormer, PACE | ✗ | ✗ |
| Video-as-plan / inverse dynamics | UniPi, LVP, DeFI, VERA | ✗ | ✗ |
| 想象环境/训练闭环 | RISE-WM, World-VLA-Loop | ✗ | 训练侧 |
| 工作 | Benchmark / 平台 | 任务与评测重点 | 为什么重要 | 本地复现状态 |
|---|---|---|---|---|
| VERA | PushT、Panda-Sim、Allegro-Sim、Panda/Allegro Real | 2/7/16 DoF、隐藏按钮、位置/语义条件;测 video planner + J-IDM。 | 代表“视频计划 + 逆动力学”路线,和 IBVS/图像雅可比式 VLMGuide 最接近。 | 未复现;已有专页分析。 |
| DiT4DiT | LIBERO、RoboCasa-GR1、Unitree G1 | 标准仿真、人形桌面、七个 G1 真机任务、物体/数量/替换 OOD。 | 代表“视频去噪中间 hidden feature 条件化动作”的联合训练路线。 | 已做代码/配置核对;未全量复现。 |
| ImageWAM | LIBERO、LIBERO-Plus、RoboTwin 2.0、Dobot XTrainer | 标准 benchmark、七类 OOD、双臂随机化、四个真机任务。 | 代表“图像编辑中间 KV cache 作为世界-动作上下文”,强调高效不解码。 | 已本地复现 LIBERO:97.9% vs 论文 98.4%,基本对齐。 |
| MaskWAM | LIBERO、RoboTwin 2.0、Dual-arm Xtrainer | 语言清晰/语言歧义、干扰物、新实例、光照;测首帧 mask 和未来 mask 预测。 | 代表“空间提示 + 未来 mask 预测”解决文本空间歧义。 | 未复现。 |
| DynaGuide | CALVIN、ARX 真机 | 目标偏好、遮挡杯子、新行为引导;测冻结策略的 runtime guidance。 | 代表低成本外部动态模型梯度引导,适合 VLMGuide/ForeTac 借鉴。 | 未复现;复现成本相对低。 |
| π0.7 | Physical Intelligence 真机平台 | 灵巧任务、指令跟随、跨本体、coaching、数据/上下文消融。 | 代表“子目标图像世界模型 + VLA 上下文条件化”的工业级闭源路线。 | 未复现;不开源主数据/代码。 |
本页是综述整理,不同世界模型范式的算力门槛差异极大。下表按"骨干类型"给出常见资源量级,具体数字来自本站已核对的对应专页(标 🟢 者),其余为该类方法的普遍量级(🩷)。
| 范式 / 骨干 | 代表工作 | 训练资源量级 | 推理 |
|---|---|---|---|
| 视频生成 WAM(大视频 DiT) | VERA(Wan-14B) 🟢、Cosmos、GigaWorld | 最重:14B 级视频模型,单节点 8× H100/H200 起;开发用 1.4B 变体单卡(VERA 用单 H100) | 稠密时空 token 去噪+解码,延迟高(如 FastWAM 1081ms) |
| 图像编辑 WAM | ImageWAM 🟢 | 中:8× H20,LIBERO 单实验约 18h、RoboTwin 约 5 天 | 只取一步编辑 KV cache,单 A6000 约 263ms |
| VLA + 世界模型子目标 | π0.7 🟢 | 主模型训练规格未公开(大集群);世界模型 14B | 主策略单 H100(38ms);子目标 4× H100(1.25s/次,每 4s 一次) |
| 引导冻结策略(training-free / 外部引导) | DynaGuide 🟢、DynaGuide 类 | 最轻:dynamics model ≈15M 参数,单张 RTX 3090(24GB),24–48h 收敛,占 ~4GB 显存 | 推理时在去噪回路里加引导;单卡 |
| Diffusion Policy / latent WM(小策略网络) | Diffusion Policy 🟢、FOWM | 轻:策略网络 ~15M–上百 M 参数,常见单卡即可,部分 benchmark 固定 ~12h | DP 在 3080 上 0.1s;latent WM 视规模 |