从 VLM 语义理解到 Action 生成:哪些中间表示真的在加强关联?
构建中间表示确实可以加强 VLM 和 action 之间的关联。这不是一个孤立想法,而是近两年 VLA、机器人世界模型、VLM-guided manipulation 论文里反复出现的主线。
VLM 表征通常擅长回答“图里有什么、语言是什么意思”。动作头需要的是“该动哪个物体、相对谁、朝哪里、现在处于什么阶段、这段动作会不会让世界变对”。中间表示的价值就在于把语义压缩成动作可用的控制变量。
大方向可以叫:VLA 的中间表示探索。具体切入建议叫:基于物体角色理解的 VLA 动作生成。
本课题不是泛泛研究所有中间表示,
而是验证“物体角色理解”能否作为 VLM 语义理解与 action 生成之间的有效中间表示。
物体角色包括:
target 目标物体
anchor 参照物 / 容器 / 放置基准
relation inside / on / left-of / upper-left 等空间关系
distractor 无关干扰物
stage approach / grasp / transport / release
| 类别 | 中间表示 | 回答的问题 | 进入 action 的方式 | 典型论文 |
|---|---|---|---|---|
| 语言动作 | language-action / atomic action text | 低层动作如何转成 VLM 熟悉的语言分布? | 预训练、action token、language-action supervision | LAP, LA4VLA |
| 角色语义 | target / anchor / relation / stage / action hint | 指令里的哪个对象和关系应该控制动作? | VQA auxiliary、structured fields、adapter、role bottleneck | Qwen-RobotManip, G0.5, Robo2VLM, CAST 相关方向 |
| 视觉提示 | bbox / crosshair / point / mask prompt | 目标在哪里,低层策略应该看哪里? | 把提示画进图像或作为条件 token | VP-VLA, Goal-VLA, SuSIE, VoxPoser |
| 视觉轨迹 | visual trace / point track / projected trajectory | 物体或末端刚才怎么运动,接下来应该往哪走? | 历史轨迹提示、轨迹 token、监督时空感知 | TraceVLA, VERA, SwiftVLA |
| 几何位姿 | SE(3) trajectory / pose token / pose anchor | 图像空间如何对齐机器人动作空间? | 轨迹预测辅助 loss、pose token pretraining、attention anchor | OASIS, PoseVLA, PosA-VLA |
| 任务进度 | progress score / stage score | 动作是否让任务更接近完成? | diffusion guidance、progress loss、采样梯度 | ProgressVLA, VLS 类 progress/guidance 方法 |
| 世界变化 | future mask / change map / motion flow / world-change tokens | 动作会让世界哪里变、怎么变? | world model latent、future mask loss、action transformer 条件 | MaskWAM, Bridge-WA, DynaGuide |
| 动态 latent | video hidden feature / image-editing KV / dynamics latent | 不解码未来图像,能否用隐表示指导动作? | Video/Image model hidden states 条件化 action DiT/flow | DiT4DiT, ImageWAM, DynaGuide |
| 可行性/价值图 | affordance map / value map / skill feasibility | 哪个技能或位置可执行、成功概率更高? | planner + policy selection,value map,skill routing | SayCan, VoxPoser, VLS, OmniGuide |
| 论文/系统 | 中间表示 | 它连接了什么 | 数据/监督来源 | 怎么影响 action | 对当前课题的启发 |
|---|---|---|---|---|---|
| LAP | Natural language action | 连续低层动作 ↔ VLM 语言分布 | 把 robot action chunk 转写为自然语言动作 | language-action pretraining / action learning | 证明“动作表示语言化”有效,但正样本方向已被占据。 |
| LA4VLA | Atomic language-action segments | 轨迹片段 ↔ 语言动作先验 | DROID trajectory 切分与 language-action 描述 | LA-only / LA-to-VLA / mixed pretraining | 说明数据构造要服务训练范式,不是只造数据。 |
| Qwen-RobotManip | VQA / reasoning / alignment fields | VLM 语义推理 ↔ 操作阶段和动作监督 | 大规模数据清洗、VQA、行为/运动/表征对齐 | co-training 与数据过滤,提高 OOD 操作 | 普通 VQA 不够,要让 VQA 信息能影响动作。 |
| G0.5 | Subtask / Stage / ActionHint 等结构化字段 | 长程指令 ↔ 可执行阶段和动作提示 | 结构化任务字段、长程家务任务 | 统一自回归 VLA 条件化 | 可借鉴字段设计,但不能只做 instruction 结构化。 |
| Robo2VLM | Robot trajectory QA | 机器人轨迹 ↔ 可审计问答/诊断 | trajectory-to-QA | 主要用于理解与诊断,不一定直接控制 | 可用于生成 role/action QA,但必须接回 action。 |
| CAST / counterfactual labels | Counterfactual instruction labels | 同一行为/场景 ↔ 不同语言条件 | 反事实重标注 | 增强 instruction following | 提醒我们不能泛泛说 counterfactual data,必须有动作依赖约束。 |
| VP-VLA | Crosshair / bbox visual prompt | System-2 VLM grounding ↔ System-1 VLA 控制 | Qwen3VL planner + SAM3 visual prompt + grounding loss | 把提示画进图像,让控制器直接读 | “目标提示”已经被做过;我们要更强调 role 对 action 的绑定。 |
| TraceVLA | 2D visual trace | 历史运动轨迹 ↔ 当前动作决策 | CoTracker 轨迹,历史帧 visual trace | 作为视觉提示输入 OpenVLA | 2D 轨迹提示已占位,不要只做“画轨迹”。 |
| ProgressVLA | Progress score / progress gradient | 视觉状态 ↔ 任务完成度 ↔ diffusion action | DINOv2 progress estimator + action-conditioned world model | classifier guidance 注入 diffusion policy 采样 | 单标量 progress 已有强工作;role 表示应更结构化。 |
| Bridge-WA | Future tokens / change map / motion-flow map | 当前观测 ↔ 未来世界变化 ↔ action transformer | 大 world-change teacher 蒸馏 | future tokens 与 map 分层注入 WorldBridge | “哪里变/怎么变”已被占据;我们要聚焦语言角色依赖。 |
| MaskWAM | Future mask / object-centric mask prompt | 物体 mask ↔ 未来物体变化 ↔ action | mask prompt 与未来 mask prediction | mask 既是输入提示又是未来监督 | 说明 object-centric 表示很强;我们的 role 表示可建立在 object tokens 上。 |
| ImageWAM | Image-editing KV / hidden cache | 图像编辑动态 latent ↔ action expert | 图像编辑模型隐表示 | 推理取 KV/cache,不解码未来图 | 中间 latent 比最终图像更适合动作。 |
| DiT4DiT | Video DiT hidden feature | 视频动态去噪表征 ↔ Action DiT | dual flow matching / tri-timestep | 用 Video DiT 中间 hidden 条件化 Action DiT | 支持“中间生成表征比重建帧更有用”的判断。 |
| DynaGuide | Dynamics latent / action-conditioned guidance | 候选动作 ↔ 动态后果 ↔ guidance | action-conditioned dynamics model | 推理时 latent guidance | action-conditioned guidance 已常见,不宜作为唯一创新。 |
| VLS | Verifier / guidance score | 候选动作 ↔ 任务/语言一致性 | VLM/VLS 打分与 guidance | 推理时修正/选择 action | 仅做 scorer/reranker 容易撞车。 |
| OmniGuide | 3D energy / guidance field | 语言目标 ↔ 3D 引导能量 ↔ action | 3D/空间目标与能量函数 | 推理时 action-space guidance | 如果转 3D energy,会进入已有强竞争区。 |
| VERA | Visual error + Jacobian / inverse dynamics | 目标视觉误差 ↔ 动作求解 | 视频/视觉误差与动作模型 | 类似 IBVS:误差 + 动作映射 | 强调“误差表征”可以连接视觉和动作,但不是 role 语义。 |
| OASIS | Camera-frame SE(3) trajectory | 视觉观察 ↔ 末端轨迹 ↔ 动作空间 | SE(3) 轨迹预测辅助监督 | 轨迹中间表示对齐 action decoder | 几何中间表示路线很强,但依赖 depth/pose 假设。 |
| PoseVLA | Pose tokens / 3D grounding tokens | 非机器人 3D 数据 ↔ robot trajectory/action | Omni3D/BOP/Agibot/InternData-A1 等 3D 与轨迹数据 | pose-centric pretraining + action expert | 证明中间表示可把非机器人数据迁移到控制。 |
| PosA-VLA | Pose-conditioned anchor attention | 末端 pose ↔ 图像 attention ↔ action | EE pose 投影成 task/end-effector anchor map | attention loss + flow matching action loss | “pose anchor attention”已占位;我们的 role 表示应避开 pose anchor 主张。 |
| SwiftVLA | 4D spatiotemporal feature / distilled temporal feature | 时空视觉知识 ↔ 轻量 VLA action | 4D geometry transformer + mask-and-reconstruct distillation | 训练时引入 4D,推理时丢弃 | 说明中间表示也可作为训练期蒸馏信号。 |
| Goal-VLA | Goal image / subgoal representation | 语言目标 ↔ 可视化目标状态 ↔ action | VLM/生成模型产生目标图或子目标 | 用 subgoal/goal image 指导策略 | 目标图像路线已存在,role 表示要强调对象角色而非整图目标。 |
| SuSIE | Subgoal image | 高层语言 ↔ 视觉子目标 ↔ 低层策略 | 图像编辑/目标图生成 | 策略追踪生成的子目标 | 证明视觉目标是强接口,但不直接解决 target/anchor 依赖。 |
| VoxPoser | 3D value map / affordance field | 语言约束 ↔ 3D 空间可执行目标 | LLM/VLM 生成 affordance/value maps | 规划器在 value map 上求解动作 | 空间价值图很强,但偏 3D planning,和 VLA co-training 不同。 |
| SayCan | Skill feasibility / value | 语言任务 ↔ 技能选择 ↔ 可执行性 | LLM 概率 + affordance value | 选择技能序列,不直接预测连续动作 | 早期证明“语义可行性”需要接机器人可执行性。 |
| SpatialVLA / CoT-VLA / WorldVLA | spatial reasoning / CoT / world knowledge fields | 语义推理 ↔ VLA action | 空间推理、CoT、世界知识监督 | 增强 VLA 表征或推理链 | 如果只做 CoT/VQA 容易被归为这一类,必须证明 action 依赖改变。 |
| GR00T / π0 / π0.5 系列 | VLM prefix + flow/action expert hidden | 大规模 VLM 表征 ↔ continuous action expert | 大规模机器人数据和 flow matching action loss | prefix 条件化 action expert | 强 base,但 task language 可能是弱接口;需要显式中间表示增强 steerability。 |
| 判据 | 说明 | 反例 |
|---|---|---|
| 动作相关 | 能影响“抓谁、放哪、何时松手、朝哪个方向动”。 | 只回答图里有什么,但不改变 action。 |
| 可监督 | 能从现有 benchmark metadata、轨迹、mask、pose、未来帧中自动构造监督。 | 完全依赖人工标注,规模上不去。 |
| 可接入 action | 进入 action loss、action head、adapter、diffusion/flow guidance 或 policy rollout。 | 只训练独立 VQA head 或 offline classifier。 |
| 比 heuristic 强 | 需要超过 mask-only、distance heuristic、random augmentation、普通 VQA auxiliary。 | 简单 centroid distance 就能达到同样效果。 |
| 能解释失败类型 | 能对应 wrong-object、wrong-region、no-progress、stage mismatch 等。 | 只报告总 success rate,没有机制证据。 |
对实习生课题而言,优先应走“辅助监督 + 轻量 adapter/LoRA + rollout 验证”。只做推理时 rerank 容易撞 VLS/DynaGuide/ProgressVLA;只做 VQA 辅助又容易太弱。
推荐标题:
面向动作生成的 VLA 中间表示探索:物体角色理解
更短的内部名称:
基于物体角色理解的 VLA 动作生成
| 角色 | 含义 | 为什么对 action 重要 |
|---|---|---|
| target | 指令要求操作的目标物体 | 决定抓谁、移动谁。 |
| anchor | 参照物、容器、放置基准 | 决定放哪、相对谁。 |
| relation | inside/on/left/right/upper-left 等关系 | 决定目标区域和运动方向。 |
| distractor | 不应影响动作的干扰物 | 用于约束 action invariance。 |
| stage | approach/grasp/transport/release | 决定当前动作类型和停止条件。 |
| 数据 | 构造方式 | 训练目标 | 必须验证 |
|---|---|---|---|
| Role grounding data | 从 instruction、metadata、mask 中标 target/anchor/relation/distractor。 | L_role:预测对象角色。 | 角色预测高不够,还要看 action 是否受影响。 |
| Counterfactual intervention data | 遮挡/替换/移动 target、anchor、distractor;或换 instruction target。 | L_sensitivity / L_invariance。 | target/anchor 变化 action 变,distractor 变化 action 稳。 |
| Relation perturbation data | 改变 target-anchor 相对位置或 left/right/up/down 关系。 | L_equivariance。 | 空间 OOD、方位 OOD 成功率提升。 |
| Action rollout data | 记录 base policy 成功/失败、action chunk、mask、stage。 | L_action 与失败类型分析。 | wrong-object/wrong-region/no-progress 下降。 |
L = L_action
+ λ1 L_role
+ λ2 L_invariance
+ λ3 L_sensitivity
+ λ4 L_equivariance
核心不是多加一个 VQA loss,而是让这些损失塑形 action 的依赖结构:target/anchor/relation 改变时 action 应变,distractor 改变时 action 不应乱变。
| 风险 | 为什么危险 | 规避方式 |
|---|---|---|
| 只做 VQA+VLA co-training | 已有大量类似工作,创新不足。 | 强调 action-sensitive losses 和 rollout 改善。 |
| 只做 instruction parser | 结构化指令不是新贡献。 | parser 只作为接口,贡献在 action 依赖塑形。 |
| 只做 mask / bbox prompt | VP-VLA、Goal-VLA、SuSIE 已有视觉提示路线。 | 将 mask/object token 用于 role-conditioned action training。 |
| 只做 action reranking | VLS、DynaGuide、ProgressVLA 等已有推理引导。 | 优先融入训练,rerank 只能做补充。 |
| 只报告 offline accuracy | 不能证明中间表示加强了 VLM-action 关联。 | 必须做 rollout、action sensitivity、failure reduction。 |
| 题目叫 instruction-following | 范围过大,容易被要求解决所有语言控制问题。 | 收窄为“物体角色理解作为中间表示”。 |