项目分析 · 代码精读 · 架构对比 | 随时随地学习
什么是 VLA、动作/观测长什么样、模仿学习、术语表(starVLA 页"新手入门"tab)
2Backbone + Action Head 分解,四种动作头(FAST/OFT/GR00T/PI)
DDPM 去噪、条件化、Receding Horizon、FiLM,代码逐行精读
4三者原理/关系/衍生,DDPM↔DDIM↔FM,DiT 架构,统一 ODE 视角
5π₀ 双 Gemma vs StarVLA DiT,逐行对照
6损失/微调/协同训练KI/动作表示/推理加速/RTC/部署
多模态上下文条件化 + 世界模型子目标 + 跨本体泛化
8视频世界模型 + Jacobian IDM,神经版 IBVS
9显式/隐式、视触觉、开环/闭环、MPC+CEM 规划
10图像编辑替代视频生成,KV cache 当世界-动作上下文
11Video DiT hidden feature 条件化 Action DiT,dual FM + tri-timestep
12把低层动作写成自然语言,支撑零样本跨本体迁移
13去视觉 Language-Action 预训练,减少视觉捷径
14mask 既当输入提示又当预测目标,消除 WAM 空间歧义
15训练时学 4D、推理时丢 4D,边缘 18× 加速
16用 SE(3) 轨迹把中间表示对齐到动作空间
💡 卡在术语随时回 starVLA 页"新手入门"tab 查词典;每页底部有自测题检验掌握。
主流 VLA 四种 Action Head (FAST/OFT/GR00T/PI) 的模块化设计、数据流、方法对比。含自测 Quiz。
VLAπ₀ 双 Gemma 架构 vs StarVLA DiT 架构的逐行代码精读,总分总形式,含对比总结。
World ModelDynaGuide 项目的代码结构分析与学习笔记。
World Model已采集真机数据如何用 DynaGuide 部署:训练 vs 梯度引导的区别、扩散策略与动态模型分别用什么数据、Phase 0-4 详细规划。
VLA 实战损失函数/微调策略/协同训练&KI/动作表示&tokenization/推理加速/实时控制&RTC/server-client部署。含8题自测。
VLAVision-Language Steering 解决 VLA 的 OOD 问题:背景·创新·代码·部署·评测结果一站式。含真实评测图表与可播放 rollout 视频。
从原理到代码逐行精读:DDPM 去噪、条件化、Receding Horizon、FiLM 注入。含 10 题自测。
Diffusion三者原理、公式、代码逐行精读,关系与衍生脉络。含自测。
覆盖 202 篇论文,按 benchmark 分组的全量测试结果:LIBERO/LIBERO-Plus/CALVIN/RoboTwin/SimplerEnv/RoboCasa/RLBench/ManiSkill 等 20+ 榜单,每表按论文分组、逐方法列出成功率,支持标签切换与表内筛选。数值均各论文自报。
World ModelHKUST/腾讯/清华 2026。mask 既当首帧空间提示(输入)又当未来预测目标(输出),用未来 mask 做语义正则化、用首帧 mask 消除语言歧义。LIBERO 98.4、RoboTwin 92.2、真机语言歧义 84.9(超最强 baseline 33.2)。含代码印证与7题自测。
World ModelSJTU/EIT/腾讯 2026。用图像编辑模型替代视频生成当 WAM backbone,推理只取去噪 KV cache 不解码图,FLOPs 降至 1/6、延迟 1/4 仍追平视频 WAM。含代码印证与8题自测。
World ModelMondo/HKUST 2026。不是生成未来视频再执行,而是用 Video DiT 去噪中间 hidden 条件化 Action DiT;LIBERO 98.6%、RoboCasa-GR1 50.8%,并关联 ImageWAM/DynaGuide/VLMGuide。
VLAQwen Team 2026。三重对齐(表征/运动/行为) + Human-to-Robot 合成 + OOD-first 评测,用 38,100h 开源数据实现真泛化。含8题自测。
World ModelBai et al. 2026。把大未来变化 teacher 蒸馏成 future tokens、change map、motion-flow map,并分层注入 WorldBridge action transformer;覆盖 VLABench、RoboTwin2.0、LIBERO-Plus 和 Dobot 真机。
横向对比横向比较 Bridge-WA、ProgressVLA、TraceVLA、VP-VLA、SwiftVLA、OASIS:它们分别占据哪些 idea 空间、用哪些 Benchmark、对 2D-RPF/CAPE 造成哪些碰撞风险,以及最终如何差异化。
VLA · 中间表示群览 LAP、LA4VLA、Qwen-RobotManip、VP-VLA、TraceVLA、ProgressVLA、MaskWAM、DiT4DiT、OASIS、PoseVLA 等工作:哪些中间表示在连接 VLM 语义和 action 生成。
VLA · ProgressYan et al. 2026。用 DINOv2 progress estimator + action-conditioned world model,把任务进度梯度注入 diffusion policy 采样;含 CALVIN、LIBERO、真机实验和对 RPF/CAPE 的碰撞分析。
VLA · 2D TraceICLR 2025。用 CoTracker 从历史帧生成 2D visual trace,再和原图一起输入 OpenVLA;证明视觉轨迹提示比多帧拼接更有效。含 SimplerEnv、WidowX 真机、LIBERO 和消融。
VLA · Visual Prompt2026。System-2 Qwen3VL 负责任务分解和 SAM3 视觉提示,System-1 QwenOFT 负责控制,并用 grounding loss 学会跟随 crosshair/bbox;重点覆盖 RoboCasa、SimplerEnv 和真实 OOD 指令跟随。
VLA · Pose AnchorLi et al. 2025。把末端执行器 pose 投影到 head/wrist camera 的 2D 图像平面,生成 task/end-effector anchor 监督 VLA 注意力;真实抓取 Avg 55.3、长程盒子任务 61.1、训练仅 20 GPU hours。
VLA · Pose PretrainLin et al. 2026。用相机系 3D pose tokens 统一非机器人 3D 数据和机器人轨迹数据,PaliGemma + flow matching action expert;RoboTwin w/o depth 79.5、LIBERO 96.0、真机 81.25%。
VLA · 效率GigaAI/北大 2025。冻结4D几何Transformer从RGB增量提时空特征,mask-and-reconstruct把4D知识蒸馏进0.45B小模型,推理丢弃4D分支;Jetson Orin 比π0快18×省显存12×。含与OASIS对比、可复用trick与创新方向。
VLA · 几何西安交大 2026。预测相机系SE(3)末端轨迹,用位姿监督隐状态把中间表示对齐到动作空间,为动作解码提供几何归纳偏置;LIBERO 97.6%、真机89.2%、OOD 90.8%。含与SwiftVLA对比、可复用trick与创新方向。
VLA把 action chunk 转成自然语言动作,使 VLA 动作监督对齐 VLM 语言分布;详解原理、数据、OpenPI代码、训练、部署、LIBERO和真机跨本体实验。
VLA从 DROID 构造 LA-33K,去视觉学习 language-conditioned action priors;系统比较 LA/VLA/LA-VLA/MixPT,并分析真机和视觉扰动鲁棒性。
OOD综合 Qwen-RobotManip、Goal-VLA、VLS、OmniGuide、LA4VLA、VERA 等工作,区分新物体 OOD 与方位/空间 OOD,并补充各论文数据集和任务设计逻辑。
VLAPhysical Intelligence 2026。多模态上下文条件化(子任务/子目标/元数据) + BAGEL世界模型 + 从RL专家蒸馏,实现开箱即用组合泛化与跨本体迁移。
World ModelMIT CSAIL 2026。action-free 视频世界模型梦想未来 + Jacobian IDM 用图像雅可比场反解动作,神经版 IBVS,零样本跨本体。
World Model基于 30+ 篇论文:显式vs隐式预测、视触觉四象限、开环/闭环、MPC+CEM 规划范式总表、选题结论。
VLANVIDIA/CMU 2026。Embodied CoT Faithfulness Gap:推理VLA言行不一→Best-of-N采样+VLM Verifier运行时引导,行为组合+15%、OOD+17%,无需重训练。含代码印证与6题自测。
VLA横向对比 OpenVLA/π0.5/OASIS/GR00T 等主流 VLA 论文的技术选型。OpenVLA 是 test-time adaptation 工作的首选 base;π0.5 KV-cache 限制了 injection;OASIS 自研架构最优雅。含选型建议与 5 题自测。
编辑 ~/study-hub/index.html,复制一个 card 块,修改 href/标题/描述即可。