Bai et al. 2026 · arXiv:2607.02195 · World-change priors for robotic action
Bridge-WA 把大视频/未来变化模型蒸馏成三个机器人可用的世界变化先验:future tokens 表示意图结果,change map 表示哪里会变,motion-flow map 表示怎么变。推理时不跑大生成模型,而是把这些 compact priors 注入 WorldBridge action transformer。
| 组件 | 作用 | 推理时是否需要大模型 |
|---|---|---|
| Future-change teacher | 基于 Wan2.2-5B,学习从当前图像/语言预测未来变化 | 否,teacher 被移除 |
| Future tokens Tf | 抽象目标/预期结果 | 是,compact prior |
| Change map Mc | 机器人应该影响的空间区域 | 是 |
| Motion-flow map Mo | 局部位移方向和幅度 | 是 |
| WorldBridge | Action transformer,用 multi-source memory 和 spatial-temporal bias 接收三类先验 | 是 |
priors = distill_teacher(obs, instruction)
Tf, Mc, Mo = priors.future_tokens, priors.change_map, priors.motion_flow
h = encode(obs, instruction)
h = worldbridge_layers_early(h, memory=Tf)
h = worldbridge_layers_mid(h, spatial_bias=Mc)
action = action_decoder(h, flow_bias=Mo)| Benchmark | 测试内容 | 为什么适合 Bridge-WA |
|---|---|---|
| VLABench | 多任务 VLA 操作,含复杂对象交互和任务成功率/过程指标 | 验证“世界会在哪里/如何变化”的先验能否提升通用操作 |
| RoboTwin2.0 | 仿真双臂/多任务,Easy/Hard 分 split | 考察复杂多物体、多阶段场景下的泛化 |
| LIBERO-Plus | 基于 LIBERO 的更难变体/OOD 操作评测 | 验证先验对分布外目标、布局和任务变化是否有用 |
| Dobot 真机 | 真实桌面操作 Easy/Hard | 检查世界变化先验是否能迁移到真实机器人 |
| 评测 | Bridge-WA | 强基线 | 结论 |
|---|---|---|---|
| VLABench Table 1 Avg SR | 52.8 | π0-Fast(delta chunk) 43.1 | 明显领先 |
| VLABench Table 2 | Avg IS/PS 71.2 / 64.0 | — | 不只成功率,过程指标也强 |
| RoboTwin2.0 | Easy 79.7 / Hard 37.7 / Mean 58.7 | X-VLA 52.3 | Hard 仍难,但均值领先 |
| LIBERO-Plus | Avg 72.1 | OpenVLA-OFT 69.6, RIPT-VLA 68.4, π0-Fast 61.6, π0 53.6 | 在较难 OOD 类评测上领先 |
| Dobot 真机 | Easy 73.6%, Hard 69.1% | X-VLA Easy 69.6, Hard 58.0 | Hard 真机提升明显 |
| 变体 | 结果 |
|---|---|
| no-world | 46.3 |
| Future only | 47.2 |
| Change only | 48.4 |
| Flow only | 45.2 |
| Future+Flow | 48.6 |
| Layered conditioning | 50.4 |
结论:单个先验有用但有限,关键是三类先验与网络层级的匹配。
| Bridge-WA 已覆盖 | 我们应避免/转向 |
|---|---|
| 世界变化先验作为 policy conditioning | 候选动作的 progress/rejection/reranking,而不是先验注入 |
| change map / flow map | object-centric relation progress score:是否朝正确关系变化 |
| 大 teacher 蒸馏 compact world priors | runtime verification,可插拔,不依赖重训大 VLA |