P0_探针实验_执行记录.md §9 与竞品主文档 §6.6。
| # | 失败现象 | 失败本质 | 所在层 | 能否推理时引导治 |
|---|---|---|---|---|
| 1 | 新旧物体混合时,模型偏向抓见过的旧物体,忽略指令要的新物体 | Object grounding 断裂 指令指代的新物体没 ground 到对应 patch(P0:指令拉不动新物,非"被旧物抢") | 感知→动作的注意力/grounding层 | ✓ 有戏 |
| 2 | 训练没见过的行为(如开抽屉),测试做不出 | 行为先验缺失 动作分布里根本没有该技能 | 动作先验层(真盲区) | ✗ 治不了 |
| 3 | 方位指令("放左边")跟随不了 | 语言-空间 grounding 缺失 训练没有方位映射 | 语言→空间 grounding | ⚠ 部分可治 |
| 4 | 夹爪开合不匹配(小→大物体) | 数据覆盖不足(二值化可绕过) | 动作细节 | — |
| OOD 类型 | 来源论文 | 描述 |
|---|---|---|
| 推理-动作执行落差 | DWYS/SEAL (2026) | VLA 的文字 plan 100% 正确,但动作没执行对 plan |
| 视觉干扰(背景/干扰物/换本体) | ARRO (2026) | 像素层 mask 即可解决,无需进 VLA 内部 |
| 空间/几何偏移 | VLS/OmniGuide (2026) | 位置偏移/障碍物/视角变化,在动作空间加梯度可解 |
| 语义-可供性 OOD | DynaGuide (2025) | 新物体/新场景的行为选择,动态模型梯度引导 |
| 行为组合/新行为 | VERA/InSight (2026) | 需视频世界模型/数据飞轮+retrain,大机构主战场 |
| 方法 | 引导层 | 引导信号 | 解决哪类 OOD | 真机 | 边界/没做什么 |
|---|---|---|---|---|---|
| DynaGuide 2025 Stanford | 动作空间(梯度) | 独立动态模型梯度 | 分布内行为选择 | ✓ | 目标人工给定、开环、假设可信 |
| VLS 2026 UW | 动作空间(梯度+FK) | VLM 写 reward 代码 | 几何/空间 | ✓ | 无负目标、无可信度收手 |
| OmniGuide 2026 UPenn | 动作空间(3D能量梯度) | VLM点+3D模型 | 几何/空间 | ✓ | 恒定开环引导、语义 collapse 为单点 |
| DISCO 2024 NUS | 动作分布(投影) | VLM 3D keyframe | 几何/分布 | ✓ | 固定阈值γ被动、DDPM |
| DWYS/SEAL 2026 NVIDIA/CMU | 动作空间(重采样) | VLM 验证执行对齐 | 推理-动作落差 | ✗ 纯仿真 | 依赖 forward rollout oracle、二值丢弃 |
| ARRO 2026 UTN | 像素层(mask) | Grounding DINO+SAM2 | 视觉干扰 | ✓ | 目标物体不能 mask,新物体 OOD 够不到 |
| Goal-VLA 2026 NUS | 替代 VLA(几何planner) | VLM 生成目标图 | 语义(零样本) | ✓ | rigid-grasp 假设,做不了接触丰富任务 |
| LA4VLA 2026 Lin等 | 训练时(去视觉 LA 预训练) | 重构数据+预训练范式 | 视觉捷径/方向鲁棒性 | ✓ | 需重训;自认不解决物体定位/目标选择 |
| VERA 2026 MIT | 替代 VLA(14B 视频+Jacobian IDM) | 视频 rollout + 图像雅可比反解 | 行为泛化(大算力) | ✓ | 14B 重型,替代而非引导冻结 VLA |
| SuSIE/GHIL-Glue 2023-24 Berkeley | 目标层(生成+过滤) | 图像编辑 subgoal | 语义+低层精度 | ✓ | 需训低层策略、SuSIE 不检验可达性 |
解决的 OOD:第 1 类(指令指代 OOD 新物体抓不到)+ 第 3 类(方位指令跟随不了)——统一为 Instruction Grounding Failure,真机高频、全竞品空白
2026-06-29 重写:原"familiarity-bias steering"经 P0 四重证据证伪(要旧物时注意力本就在旧物上、未被劫持;要新物时是"拉不动"而非"被抢")。新方向打在真正的病灶上。
| 维度 | 预期 |
|---|---|
| 第 1 类 | 指令指 OOD 新物体场景:注入后正确抓取目标物的成功率 / 降低 wrong-object rate 显著改善 |
| 第 3 类 | 方位指令("放左边")执行正确率从接近 0 提升到可用水平(第二阶段,可能用 action-target bias) |
| 对比竞品 | 在 ARRO mask 不了、VLS/OmniGuide 动作空间几何引导不解决的"指令-grounding 断裂"上胜出 |
| 成本 | 不重训 VLA,本机 3090 可验证,复用开源检测器 + 冻结 π0.5 |
| 会议 | 概率 | 前提 |
|---|---|---|
| CoRL 2027 | 中 | P0.5 写回因果通过 + P1 注入降 wrong-object + P4 真机,且统一框架覆盖第1+3类 |
| RSS 2027 | 中 | 同上,且故事讲好(grounding 断裂诊断 + training-free 注入修复) |
| ICRA 2027 | 中高 | 仿真+简单真机验证即可 |
| RA-L | 高 | P0 诊断 + 一个注入方法 + 真机验证 |
下一道 go/no-go:P0.5 写回因果验证——注入 attention 后 action 是否对注入方向有可重复、可解释、非随机的变化。不过则转 feature steering / visual prompt / action-target bias / 轻量 adapter。
| 竞品 | 操作层 | 我们的差异 |
|---|---|---|
| DynaGuide / VLS / OmniGuide | 动作空间梯度 | 它们在动作空间加几何/能量 reward;我们在 VLA 内部注意力层注入指令 grounding,正交且更轻 |
| DWYS/SEAL | 行为层(重采样+验证) | 它们靠 forward rollout 验证 CoT 忠实度(纯仿真);我们不需 rollout,直接在 attention 层源头修复 grounding |
| LA4VLA | 训练时(去视觉预训练) | 同病不同药:它训练时重构数据+重训、且不管目标选择;我们推理时注入、不重训,正补它放弃的物体/空间 grounding |
| ARRO | 像素层 mask | ARRO mask 任务无关像素;我们注入任务核心目标的 grounding |
| Goal-VLA / VERA | 替代 VLA | 我们保留冻结 VLA 学习先验,轻量注入不替代 |
| SuSIE / GHIL-Glue | 目标层 | 我们不生成子目标,直接在 VLA 内部注入 grounding(不需训低层策略) |
| NLP Activation Steering | LLM 内部 | 首次从 NLP 迁移到 VLA/机器人,修复物理 OOD 的指令 grounding 而非 safety 对齐 |
这是 P3 阶段的探索内容(非必须),主方案 P0-P2 不依赖它。