核心结论
现在已经有不少工作能部分解决 OOD,但没有一篇干净地同时解决 新物体 OOD + 方位/空间 OOD + 接触丰富操作 + 真机高成功率。
最强重训式路线
Qwen-RobotManip:靠大规模多源数据、动作/相机/行为对齐、OOD-first 评测来提高泛化。它不是小补丁,而是基础模型训练范式。
最强冻结 VLA 竞品
VLS / OmniGuide:都在推理时引导 frozen VLA。VLS 走 VLM 生成 reward + keypoint 几何;OmniGuide 走 3D attractor/repeller 能量场。
最强 object-centric 替代路线
Goal-VLA:用图像生成 VLM 想象目标状态,再用语义匹配和点云配准反解 3D 位姿。强在刚体位姿,不是修复 VLA。
真正未被干净解决的组合
新物体 grounding 进入动作生成 + 方位修正 + 接触/触觉闭环。现有视觉几何方法对接触力、滑移、插入角度、触觉确认仍弱。
工作能力矩阵
| 工作 | 主要数据集 / 任务 | 新物体 OOD | 方位/空间 OOD | 机制 | 判断 |
|---|---|---|---|---|---|
| ScaleQwen-RobotManip | LIBERO / LIBERO-Plus、RoboTwin-C2R/IF/XE、RoboCasa365、EBench、CobotMagic ALOHA OOD、RoboChallenge | 强 | 强 | 大规模多源数据 + H2R 合成 + 统一动作/相机坐标对齐 + OOD-first 评测 | 当前最强的“重训基础模型式”OOD 解法之一;复现成本极高,无触觉/力闭环。 |
| GoalGoal-VLA | RLBench 8 任务;真机 xArm 4 任务 | 中-强 | 强 | 生成目标图像,再用语义匹配和点云配准反解物体 3D 变换。 | 适合 rigid object-centric 操作;但绕过 VLA,用几何 pipeline。 |
| GuideVLS | LIBERO-PRO、CALVIN、Franka 真机 OOD | 中-强 | 中-强 | VLM 生成可微 reward,SAM/DINO/depth grounding 成 keypoint 几何约束,引导冻结 π0.5/OpenVLA。 | 与 VLMGuide 最直接相关;主要覆盖可 keypoint 化的几何 OOD。 |
| GuideOmniGuide | RoboCasa 仿真;DROID/Franka 真机 9 任务 | 中 | 很强 | 3D attractor/repeller 能量场,在 flow matching 去噪中引导冻结 π0.5/GR00T。 | 几何/空间 OOD 很强;语义目标要先被 VLM 转成 3D 点。 |
| LALA4VLA | DROID → LA-33K;MetaWorld、LIBERO、xArm 真机语言目标任务 | 弱 | 中-强 | language-action pretraining,削弱视觉捷径,强化语言条件动作先验。 | 对方向词和低层动作语义有帮助;不解决“选哪个新物体”。 |
| LALAP | OXE + MolmoAct 训练;LIBERO;DROID/Custom Franka/YAM/Kinova 真机 | 弱-中 | 中 | 把低层动作表达成自然语言,提升跨本体与动作语义对齐。 | 更像 cross-embodiment/action representation 解法,不是新物体 grounding 解法。 |
| WMVERA | DROID、PushT、MimicGen、Allegro-Sim/Real、Panda-Real | 中 | 中-强 | 视频世界模型生成未来视觉,J-IDM 学图像空间雅可比,把视觉误差反解成动作。 | 像“视觉误差 → 动作修正”的世界模型路线;但需要目标本体 IDM。 |
| WMDynaGuide | CALVIN play data / benchmark;ARX 真机 cup preference | 中 | 中 | DINOv2 latent dynamics + diffusion guidance。 | 对 goal/preference OOD 有用;不直接解决 open-vocabulary 目标选择。 |
| VLAG0.5 | LIBERO、RoboTwin 2.0、SimplerEnv、BEHAVIOR-1K、DROID、PP Bench、R1 真机 | 中-强 | 中 | VLM-as-actor,自回归 CoT、BBox、Trace、ActionHint 与动作共享权重。 | 泛化结果强,但更多是重训路线;不是专门隔离验证新物体/方位 OOD。 |
| VLAπ0.5 / π0.7 | 真实家庭长程任务、多本体机器人数据、web/VQA/检测数据;π0.7 另含子目标图像与 RL 专家蒸馏数据 | 中 | 中 | π0.5 靠大规模 VLA 预训练;π0.7 加记忆和子目标图像。 | 可作为强 baseline,但不能说已解决;π0.5 仍可能偏向旧物体。 |
| VerifyDWYS | LIBERO-10-R / LIBERO-100-R reasoning 标注扩展;LIBERO OOD 变体 | 弱 | 弱-中 | runtime reasoning-action alignment verification。 | 更像验证器/拒绝器;候选动作里没有正确动作时,它不能生成 OOD 解法。 |
为什么要单独看数据集 / 任务设计
OOD 论文的说服力不只来自方法,还来自评测协议。一个数据集到底在测“新物体”“方位”“语言条件”“跨本体”还是“长程组合”,会直接决定这篇论文的 claim 是否成立。
逐篇论文的评测与复现状态总表
| 论文 | 核心 Benchmark / 任务 | 主要 OOD 轴 | 论文证据强度 | 本地复现状态 |
|---|---|---|---|---|
| VLS | LIBERO-PRO、CALVIN、Franka 真机 OOD | 新物体、物体位置交换、任务规格改变、铰接件/可移动物体 | 强:同一 frozen policy 上做 runtime reward guidance,能清楚归因 OOD 修正收益。 | 未本地复现;当前为论文级分析。 |
| Qwen-RobotManip | LIBERO-Plus、RoboTwin-C2R/IF/XE、RoboCasa365、EBench、CobotMagic、RoboChallenge | 视觉域随机化、语言目标、跨本体、长程组合、真机扰动 | 很强:benchmark 覆盖广,且有真机 OOD;但完整预训练复现成本极高。 | 未本地复现;本地只做论文分析。 |
| LAP | LIBERO fine-tuning、DROID seen、Custom Franka/YAM/Kinova unseen | 跨本体、相机/夹爪/DoF/控制接口变化 | 强:controlled baselines 只换 action representation,适合支撑跨本体 claim。 | 已读本地官方代码;未跑完整训练/真机。 |
| LA4VLA | MetaWorld、LIBERO、xArm6 三个语言条件真机任务 | 语言条件、视觉捷径、空间/方向泛化 | 中强:真机任务设计好,但官方代码未实质发布。 | 未复现;本地 LA4VLA 仓库当前无实质代码。 |
| VERA | PushT/Panda/Allegro 仿真,Panda-Real/Allegro-Real | DoF 扩展、视觉推理 OOD、遮挡/位置/语义条件 | 中强:证明 J-IDM 可把视频 planner 转动作,但基础任务仍弱于 DreamZero。 | 未复现;本地仅论文分析。 |
| DynaGuide | CALVIN、ARX 真机 cup preference/hidden/novel behavior | 目标偏好、遮挡目标、新行为引导 | 中强:清楚证明 runtime latent guidance,但任务相对简单。 | 未复现;可作为低成本 guidance 复现候选。 |
| Goal-VLA / OmniGuide | RLBench、RoboCasa、DROID/Franka 真机任务 | 目标状态、空间关系、碰撞/语义/轨迹 guidance | 中:适合 OOD guidance 思路对照,但不同论文对感知 oracle 依赖不同。 | 未复现。 |
| OOD 类型 | 常用数据集 / 任务 | 为什么用 |
|---|---|---|
| 新物体 / 目标选择 | LIBERO-PRO Object/Task、CobotMagic ALOHA OOD、VLS 真机 mug 替换、Goal-VLA 真机物体任务 | 打破“训练时总抓旧物体”的动作先验,检查语言目标是否真正进入动作生成。 |
| 方位 / 位置 / 空间关系 | LIBERO-PRO Spatial/Position、Goal-VLA RLBench 物体位姿任务、OmniGuide RoboCasa clutter / 3D semantic target | 检查策略是否能跟随目标位置、空间关系、障碍和轨迹约束,而不是记忆固定布局。 |
| 语言条件 / 指令跟随 | RoboTwin-IF、LA4VLA 真机按钮/书架/九宫格任务、DWYS reasoning LIBERO 扩展 | 同一视觉场景里只改语言目标,看模型是否真的听语言,而不是视觉捷径。 |
| 跨本体 / 坐标对齐 | RoboTwin-XE、LAP 的 Custom Franka/YAM/Kinova、VERA Panda/Allegro | 检查动作表示、相机坐标和动力学适配是否能跨机器人泛化。 |
| 长程 / 组合泛化 | LIBERO-10/Long、CALVIN、RoboCasa365、BEHAVIOR-1K | 检查多阶段任务中是否能切换阶段、避免局部 reward 卡死、处理组合任务。 |
VLS:为什么用 LIBERO-PRO / CALVIN / 真机 OOD
1. LIBERO-PRO:专门制造语义与空间 OOD
| 组成 | 任务 / 扰动 | 为什么这样测 | 对 VLS 的意义 |
|---|---|---|---|
| 4 个 suite | Goal / Spatial / Object / 10-Long,每个 suite 10 个任务,每任务 20 episodes | 覆盖目标变化、空间关系、物体选择、长程任务四类能力。 | 能区分 VLS 是只会单阶段抓放,还是能处理多阶段和长程。 |
| Position / swap | 交换或移动物体位置,语言指令不变 | 打破“目标总在固定位置”的视觉记忆。 | 直接测试方位/空间 OOD;VLS 若有效,应把动作拉向新的正确位置。 |
| Task 扰动 | 同时改语言、目标完成状态、关注物体 | 比同义改写更强,要求模型重新 grounding 新目标和新任务。 | 测试 VLM reward 能否重写 frozen policy 的旧任务先验。 |
| Object suite | 单阶段抓放,只换目标物体 | 结构最干净,失败主要来自“抓错物体/旧物体偏置”。 | 最适合证明 VLS 的 object grounding guidance 有用。 |
| Goal / 10-Long | 多阶段和长程串联任务 | 检查 stage recognition 和长期规划,而不是单步目标吸引。 | 暴露 VLS 边界:没有可靠 stage 切换时,reward 可能卡在错误阶段。 |
VLS 使用 LIBERO-PRO 的关键不是“LIBERO 很常见”,而是 LIBERO-PRO 把原本容易被记忆的桌面任务改造成可控 OOD:同一底层策略、同一套任务,只改变位置或任务规格,从而能清楚归因“baseline 崩溃是因为 OOD”。
2. CALVIN:检验可移动物体和铰接件上的空间 reward
| 任务组 | 测什么 | 为什么用 |
|---|---|---|
| MovableObjects | 随机放置的彩色方块等可移动目标 | 目标位置随 episode 变化,固定 goal policy 或简单坐标引导容易失败;适合验证 VLM reward 是否能表达当前场景目标。 |
| ArticulatedParts | door / drawer / button / switch 等铰接或交互部件 | 目标不是简单抓点,而是空间方向、接触点和部件 affordance;能检验 reward 是否比 DynaGuide/ITPS 更任务特定。 |
CALVIN 的作用是补 LIBERO-PRO 的不足:它更强调长程语言条件操作和可交互部件,能展示 VLS 在“几何 reward 可表达”的动态目标上优于固定目标条件化或启发式 latent guidance。
3. 真机 Franka OOD:验证不是仿真技巧
| 真机 OOD | 具体设计 | 验证意图 |
|---|---|---|
| 外观偏移 | 未见黄盘等外观变化 | 看 grounding 是否能承受视觉外观变化。 |
| 位置偏移 | 交换两个盘子位置,指令不变 | 看策略是否仍按旧位置执行,还是能根据当前图像更新目标。 |
| 物体偏移 | 把 banana 换成未见 mug | 测试新物体 OOD;报告中最难的 mug 替换 baseline 0%,VLS 40%。 |
其他关键 OOD 论文的数据集选择
| 工作 | 用了哪些数据集 / 任务 | 为什么用这些 | 任务在验证什么 |
|---|---|---|---|
| Qwen-RobotManip | 训练:OXE、AgiBotWorld、RoboMIND、Galaxea、RoboCOIN、DROID、RH20T、RDT-1B、InternData-A1、人手视频 EgoDex/VITRA/EgoVerse、H2R 合成、28M VL 样本。评测:LIBERO、LIBERO-Plus、RoboTwin-C2R/IF/XE、RoboCasa365、EBench、CobotMagic ALOHA OOD、RoboChallenge。 | 它的 claim 是“对齐释放规模化”,所以必须覆盖多机器人、多场景、多任务、跨本体、语言指令和真实扰动。单个 LIBERO 高分不能证明 foundation model 质量。 | LIBERO/标准 RoboTwin 测 ID;LIBERO-Plus 测多扰动鲁棒;RoboTwin-C2R 测 clean-to-random 视觉 OOD;RoboTwin-IF 测同场景不同语言目标;RoboTwin-XE 测跨本体;RoboCasa365 测厨房长程组合;CobotMagic OOD 测真机扰动。 |
| Goal-VLA | RLBench 8 任务:Pick Up Cup、Open Wine Bottle、Put Shoe On Box、Take Plate Off Dish Rack、Take Frame Off Hanger、Plug Charger In Supply、Place Cup on Cabinet、Close Box;真机 xArm 4 任务:Tomato Placement、Table Sweeping、Weighing Duck、Bottle Stand-Up。 | 它要证明 training-free object-centric world model 能 zero-shot 操作,因此选择可由“目标状态图像 → 物体位姿变换 → motion planning”串起来的任务。 | RLBench 测不同物体重定位、开合、插入供电口等几何目标;真机任务暴露深度、朝向、高度估计误差,尤其 Weighing Duck / Bottle Stand-Up 对几何精度敏感。 |
| OmniGuide | RoboCasa 仿真:pick-and-place、TurnSinkSpout、clutter、Multi-Choice;真机 DROID/Franka 9 任务:碰撞 static/dynamic/reactive,语义 Pictures/Objects/Trash Cans,人类模仿 Drawer/Cabinet/Oven。 | OmniGuide 要证明“任意 guidance source 都能变成 3D 能量场”,所以任务按 guidance 类型分组,而不是按单一 benchmark 分组。 | 碰撞任务测 repeller;语义任务测 VLM pointing → 3D target attraction;人类模仿测 trajectory attraction。仿真用 ground-truth depth/object pose 是为了隔离感知误差,专测 guidance 机制。 |
| LA4VLA | 数据构造:DROID 9,560 episodes → VLM 分段 56,899 候选 → 人工校验 33,116 段 LA-33K。评测:MetaWorld Easy/Medium/Hard/Very Hard,LIBERO Spatial/Object/Goal/Long,真机 xArm 三任务:按 4 个按钮之一、把书插入 3 个书架位之一、把饮料放到 9 宫格之一。 | 它要证明“去视觉的 language-action pretraining 能减少视觉捷径,强化语言条件动作先验”。因此训练数据来自真实 DROID 演示,但预训练时故意去掉视觉。 | MetaWorld 空间大、连续控制多,能放大动作先验收益;LIBERO Spatial 直接测方向/空间指令;真机三任务保持初始场景近似相同,只靠语言区分目标,专门测语言条件能力。 |
| LAP | 训练:OXE + MolmoAct,多数来自 DROID。评测:LIBERO fine-tuning,seen DROID setup,三个 unseen embodiments:Custom Franka、YAM、Kinova;真机任务包括 Pick and Place、Sort、Tissue、Put Towel、Pour,微调任务包括 Hang Tape on Rack、Fold Towel and Place in Basket。 | LAP 的 claim 是 language-action 表示带来 zero-shot cross-embodiment transfer,所以必须用未见机器人本体验证,而不能只用同一本体仿真。 | LIBERO 测标准 VLA fine-tuning;DROID/Custom/YAM/Kinova 测本体、相机、夹爪和动力学变化下,语言动作表示是否比 FAST/action token 更稳。 |
| VERA | DROID 39,816 episodes 做 Panda-Real video post-training;PushT-Sim、MimicGen Panda-Sim、Allegro-Sim、Panda-Real、Allegro-Real 60-217 episodes。 | VERA 要证明 action-free video planner + J-IDM 能跨 DoF 和机器人工作,所以从 2-DoF PushT 到 7-DoF Panda 再到 16-DoF Allegro。 | PushT/MimicGen/Allegro-Sim 测 J-IDM 随 DoF 扩展和 action reconstruction;Panda-Real 的 basic/occlusion/location/semantic 任务测视频模型的语义/空间想象能否通过 J-IDM 落成动作。 |
| DynaGuide | CALVIN play data / benchmark;真机 ARX cup preference pick-place。 | DynaGuide 要证明独立 dynamics model 可以在扩散去噪中引导预训练策略,因此选择有现成 play data、桌面物体和铰接件的 CALVIN 训练 latent dynamics。 | CALVIN 测 drawer、switch、button、cabinet、彩色方块等目标条件和低质量目标鲁棒;真机杯子偏好任务测 preference guidance 是否能改变已有策略行为。 |
| G0.5 | 评测:LIBERO、RoboTwin 2.0、SimplerEnv-Bridge、BEHAVIOR-1K、DROID zero-shot、PP Bench、R1-Lite/R1-Pro 真机微调。 | G0.5 是 generalist VLA,不是单一 OOD 修复模块,所以需要广覆盖:仿真、真机、移动操作、长程家务、零样本和微调。 | BEHAVIOR-1K 测长程家务组合;PP Bench 和 Air Fryer/Cook Bacon 未见任务测 CoT/prompt 是否能 test-time steer 行为;R1 真机任务测同等微调预算下是否优于 π0.5。 |
| DWYS / SEAL | LIBERO-10-R、LIBERO-100-Basket-R、LIBERO-100-R;OOD 变体 Lang-Rephrase、Lang-Object-Property、Visual-Scene、Visual-Viewpoint;组合任务 10-Compose / 100-Basket-Compose / 100-Compose。 | 它要证明 reasoning-action alignment verification 能减少“说一套做一套”,所以需要 reasoning 标注数据和可并行 forward rollout 的仿真 oracle。 | ID 测 plan 是否正确、动作是否忠实;语言/视觉 OOD 变体测验证器能否从候选动作里挑出与文字 plan 对齐的一条。注意:这是验证/重采样路线,不是新物体/方位的主生成解法。 |
新物体 OOD:谁真正相关?
如果“新物体 OOD”指的是训练没见过或分布外目标物体,模型要根据语言选对并操作,那么问题不只是识别,而是 grounding 是否进入 action head。
- Qwen-RobotManip:最强基础模型式答案。它在 LIBERO-Plus、RoboTwin-Clean2Rand、RoboTwin-IF、RoboCasa365、CobotMagic ALOHA OOD 上都明显强于 π0.5/StarVLA。它说明新物体/新场景 OOD 可以被“规模化数据 + 对齐正确的训练范式”缓解。
- VLS:最直接对 frozen VLA 有威胁。真机中 banana 换成未见 mug,baseline 0%,VLS 到 40%。这证明外部 VLM/视觉基础模型 grounding + 推理时引导可以把一部分新物体 OOD 从失败拉回来。
- Goal-VLA:如果任务是刚体物体的目标状态变化,它很强。图像生成式 VLM 直接想象完成后的目标图,再通过语义匹配和点云配准求物体位姿变换。
- G0.5 / VERA / DynaGuide:可算第二梯队。G0.5 通过自回归 CoT/BBox/Trace/action 共享权重提升 broad generalization;VERA 依赖视频模型想象正确未来;DynaGuide 依赖目标图或偏好条件。
新物体 OOD 的真正难点
1. 目标选择
在多个干扰物里把语言目标 grounding 到正确物体。VLM 认得物体不等于 policy 会去抓它。
2. Action head 偏置
即使 backbone 识别正确,action head 仍可能沿用训练中旧物体/旧轨迹先验。这与你之前对 π0.5 的 probe 结果一致。
3. 新 affordance
面对新物体形状、功能、接触属性时,选择合理抓取和操作策略。现有视觉几何方法对此覆盖不足。
方位 / 空间 OOD 必须继续拆分
语言方向词
left/right/up/down/clockwise/counterclockwise、move/tilt/rotate 等低层动作语义。
相关工作:LA4VLA、LAP。
物体位姿 / 空间关系
目标位置、目标姿态、放置关系、障碍、轨迹形状等。
相关工作:Goal-VLA、OmniGuide、VLS。
相机 / 本体坐标变化
同一个视觉运动在不同机器人、相机外参、动作空间下如何对齐。
相关工作:Qwen-RobotManip。
图像误差到动作
从目标视觉状态或视觉差异反推出机器人动作修正。
相关工作:VERA、DynaGuide。
方位 / 空间 OOD 强竞品排序
- OmniGuide:最强 3D 几何能量场,引导冻结 VLA。适合碰撞、目标点、轨迹形状、空间吸引/排斥。
- Goal-VLA:最强 object-centric goal pose 反解,但绕过 VLA。
- VLS:最强 VLM-generated reward + frozen VLA 竞品,在 LIBERO-PRO position perturbation 和 CALVIN 可移动/铰接物体上有收益。
- Qwen-RobotManip:最强重训基础模型式空间/坐标对齐,camera-frame EEF、CaPE、统一动作模板都直接针对坐标和本体 OOD。
- LA4VLA / LAP:更相关于语言方向动作先验,不是精确 3D 几何解法。
- VERA / DynaGuide:更相关于世界模型/动态模型式视觉误差引导。
哪些不能过度解释为“解决 OOD”
π0.5 / π0.7
它们是强 baseline,但不能直接说已经解决 OOD。π0.5 的 web data 提升物体识别,但你自己的 probe 已显示它会偏向旧物体;这说明“VLM backbone 认得物体”不等于“action head 会指向新物体”。
DWYS
它是 runtime reasoning-action alignment verification,更像 verifier / rejection / reranking 模块。如果底层 policy 没有生成正确候选动作,验证器不能凭空产生正确 OOD 动作。
LA4VLA / LAP
它们对语言动作、方向词、跨本体动作语义有价值,但不能被说成“解决新物体 grounding”。不要把 action representation 的收益扩大成 object grounding 的收益。
Goal / Preference Guidance
DynaGuide、SuSIE/GHIL-Glue 等依赖 goal/subgoal/偏好条件。它们能帮助高层目标或偏好 OOD,但低层执行是否能泛化仍受 policy 训练分布限制。
对 VLMGuide / 新课题的直接判断
更可防守的差异化
- 从几何 keypoint 引导升级到动作后果预测 / 视觉动态模型引导。VLS/OmniGuide 多数是把目标几何化后直接写 reward;如果我们预测动作导致的视觉后果,再与正负目标比较,叙事更接近世界模型/能量模型。
- 显式建模正负目标。尤其是负目标、错误目标、旧物体偏置。VLS 有正 reward,OmniGuide 有 repeller,但不等于系统性做“旧物体偏置拒绝”。
- 做闭环失败诊断和不确定性收手。不是恒定加引导,而是判断是否 OOD、是否要引导、引导多强、何时 abstain。
- 在组合 OOD 上证明现有视觉几何方法不够。新物体 + 方位 + 接触/触觉闭环,是更难被 VLS/OmniGuide/Goal-VLA 完整覆盖的区域。
论文写法建议
| 如果研究新物体 OOD | 必须讨论 Qwen-RobotManip、VLS、Goal-VLA、G0.5。问题表述不要说“VLA 不认识物体”,而要说“VLM 认识,但 action head 不跟随,仍受旧物体/旧轨迹先验支配”。 |
|---|---|
| 如果研究方位 OOD | 必须讨论 OmniGuide、Goal-VLA、VLS、LA4VLA/LAP、VERA。要明确是哪种空间泛化:方向词、目标位姿、3D 几何约束、相机/本体坐标,还是接触方位。 |
| 如果研究世界模型引导 | 必须和 VERA / DynaGuide / Goal-VLA 划界:是生成目标状态、预测动作后果、还是从视觉误差反解动作。 |