π0.7 — 可操控的通用机器人基础模型

a Steerable Generalist Robotic Foundation Model with Emergent Capabilities · Physical Intelligence 2026

← 返回 Study Hub
速览
动机
方法与架构
多模态上下文
实验
评价与启发
资源配置
自测

一句话

用丰富的"提示词"(上下文)让机器人基础模型开箱即用地泛化到新任务。 π0.7 的创新不在网络结构,而在一套"多模态上下文条件化"训练方法——给每条数据不仅标注"做什么",还标注"怎么做/做得好不好",让模型能从极其多样(含次优、失败、跨本体、非机器人)的数据里学习,并在推理时通过选择性提示精确控制行为。

本页可靠性:内容整理自 Physical Intelligence 官方论文 π0.7 及本地深度分析笔记。架构参数(5B/860M/BAGEL 14B 等)、实验数字来自论文原文;"可借鉴/启发"部分为学习者解读。原文:pi.website/pi07 · 团队:Physical Intelligence。

速览卡片

内容
团队Physical Intelligence (Bo Ai 等,Sergey Levine/Chelsea Finn 在列)
问题现有 VLA 无法组合技能泛化到新任务,缺开箱即用灵巧操作
基座基于 π0.6-MEM 改造;VLM=Gemma3 4B;动作专家 860M;世界模型=BAGEL 14B
总参数~5B (4B VLM + 860M 动作专家 + 400M ViT)
核心手段子任务指令 + 子目标图像 + episode 元数据 + 控制模式,四类上下文随机丢弃训练
关键结果灵巧任务匹配甚至超越 RL 专家吞吐量;零样本跨本体折 T 恤 80% (≈人类首次 80.6%);14 个未见环境指令跟随显著超 π0.5/π0.6
实验纯真机(移动双臂/BiPi/UR5e/单臂),无仿真,无触觉
开源

它在 π 系列中的位置

π0     Flow Matching 动作专家 (PaliGemma)
π0-FAST 自回归离散动作 token
π0.5   加语言层级、开放世界泛化
π0.6   VLA + RL 后训练 (π0.6* 是 RL 专家)
π0.6-MEM 加 MEM 多尺度记忆(视频历史编码)
  │
  ▼
π0.7   ★ 多模态上下文条件化 + BAGEL世界模型子目标 + 从RL专家蒸馏
       → 开箱即用泛化 / 跨本体 / 组合泛化

为什么做 π0.7

灵感来自语言模型的组合泛化:LLM 不只是记事实,还能把知识以新方式组合来解决新问题。但机器人 VLA 在"以新方式组合技能泛化到新任务"上仍很弱。作者受图像/视频生成领域"提示词扩展(prompt expansion)"启发,认为给训练数据更丰富的上下文条件,就能让机器人像语言模型那样组合泛化。

现有 VLA 的痛点

  • 此前 VLA(π0/π0.5/OpenVLA/RT-2)只用简短文本描述做条件,无法区分同一任务的不同执行策略和质量
  • 朴素地混用多样化数据会让模型"平均化"不同模式 → 次优结果
  • 最强性能通常要任务特定微调或 RL 后训练,失去通用性
  • 跨本体迁移困难,尤其形态差异大时

核心假设

如果为每条训练数据提供足够详细的上下文(不仅"做什么",还"怎么做"),模型就能从多样化、混合质量的数据中有效学习,并在测试时通过选择性提示实现精确行为控制和组合泛化。

整体架构数据流

训练:
4相机×6历史帧 [B,4,6,448,448,3]
  │ MEM 视频编码器(时空可分离注意力,任意历史帧→固定token数)
  ▼
视觉 tokens ──┐
语言指令 ℓ ───┤
子任务指令 l̂ ─┤  各以 dropout 概率随机丢弃
episode元数据 m┤  (速度/质量/错误)
子目标图像 g ─┤  (25%样本含, 由BAGEL生成)
控制模式 c ───┘  (joint / ee)
  │
  ▼
┌────────────────────────────┐
│ VLM Backbone (Gemma3 4B)   │ ← KI知识隔离:梯度不回传VLM
│ 输出 context tokens         │   VLM用FAST token离散交叉熵监督
└──────────┬─────────────────┘
           │ cross-attention
           ▼
┌────────────────────────────┐
│ Action Expert (860M)       │ Flow Matching + adaRMSNorm
│ 50 action tokens, 5步去噪   │ CFG β∈{1.3,1.7,2.2}
└──────────┬─────────────────┘
           ▼
Action chunk [B,50,D] (实际执行 15 或 25 步)

世界模型(异步生成子目标):
当前观测+任务 → BAGEL 14B(flow matching) → 子目标图像 (每4秒刷新)

关键组件

组件规格作用
VLM 骨干Gemma3 4B + 400M ViT理解图像+语言+各类上下文,输出 context tokens
MEM 视频编码器时空可分离注意力把任意数量历史帧压成固定 token 数(4视角×6帧, 1秒步长, 0.3概率整体丢弃)
动作专家860M TransformerFlow Matching 预测 50 步连续动作,adaRMSNorm 注入时间步
世界模型BAGEL 14B生成子目标图像,为策略提供视觉规划引导

知识隔离 (Knowledge Insulation, KI)

动作专家可以 attend 到 VLM 的所有激活,但梯度不回传到 VLM 骨干。VLM 用 FAST token 的离散交叉熵损失单独监督。这样保住 VLM 的语言/视觉能力不被动作训练"冲垮",同时动作专家仍能利用 VLM 的丰富表征。(继承自 π0.6-MEM)

核心创新:四类上下文条件

传统 VLA 的上下文只有语言指令 ℓ("清理厨房")。π0.7 大幅扩展为四个组件,训练时各以概率随机丢弃,推理时可灵活用任意子集:

上下文是什么作用 / 来源
子任务指令 l̂中间层语义子任务,如"打开冰箱门"继承 π0.5;推理时由高层策略自动生成,或人类实时"coaching"
子目标图像 g多视角的期望近未来场景图本文核心架构创新;由 BAGEL 世界模型生成;把动作预测变成"逆动力学"问题,加速训练
episode 元数据 m速度(500步区间离散)+质量(1-5人工评分)+错误标记让模型区分同一任务的不同执行质量,从而能利用次优/失败数据
控制模式 cjoint(关节) / ee(末端执行器)训练时学两种控制空间,推理按需选

为什么元数据这么关键

朴素混用混合质量数据会让模型"平均化"好坏策略。加了 episode 元数据后:训练时保留所有数据(好的坏的都学,但打上标签),推理时提示"最高速度、最高质量、无错误",模型就只输出好的行为。这让 π0.7 能从 RL 专家(π0.6*)的 rollout 甚至失败数据里"蒸馏"知识 + 扩大状态分布多样性。消融显示:有元数据时数据越多性能越好;没元数据时数据越多性能反而下降

子目标图像:世界模型引导

子目标图像 g 由 BAGEL(14B 图像理解/编辑/生成模型)用标准流匹配损失训练生成。它比纯语言更能表达空间细节。推理时每 Δ=4 秒或语义意图变化时异步刷新;训练用真实未来帧 + 世界模型生成图的混合(25%样本含)。

加入子目标后,动作预测从"看指令想动作"变成"看指令+目标图想动作"——即逆动力学问题(已知起点和目标,求中间动作),显著加速训练。

语言 Coaching:教会新长任务

对从未见过的复杂长任务,人类可以用语言分步"指导"(coaching):一步步告诉机器人子任务("现在打开空气炸锅""放入食物")。然后把这些 coaching 数据蒸馏成自主高层策略,下次就能自己生成子任务指令。这是 π0.7 组合泛化获取新技能的关键链路。

实验设置

  • 纯真机,无仿真:移动双臂平台 / BiPi 静态双臂 / UR5e 双臂+Robotiq / 单臂 6DoF
  • 相机:前视+双腕部(移动平台加后视);无触觉/力传感器
  • 推理:5 步去噪,CFG β∈{1.3,1.7,2.2},448×448,动作块 50 步执行 15/25 步,RTC 处理延迟

评测协议矩阵

评测块平台 / 任务具体设置为什么这样测复现状态
开箱即用灵巧性双臂移动平台等真机折衣、制作咖啡、组装盒子、做三明治、翻衬衫、切菜、削皮、扔垃圾等。检验单一 generalist policy 是否能接近/超过任务专用 RL 或 SFT 专家,而不是只会简单 pick-place。未复现;数据和机器人闭源。
语言指令跟随4 个未见厨房 + 2 个未见卧室14 个未见环境场景,3-6 步开放指令;含复杂参考指令和打破数据偏差任务。检验 π0.7 是否比 π0.5/π0.6 更会组合语言、视觉和动作,而不是复读训练分布。未复现。
跨本体迁移BiPi / UR5e / 单臂 6DoF 等如折 T 恤从 BiPi 零样本迁移到 UR5e,报告 task progress 和 success。测试多模态上下文、子目标图像和控制模式标识是否能跨硬件迁移。未复现。
组合泛化新短任务 + coaching 长任务按法压壶、舀米饭、擦拭、旋转;空气炸锅、烤面包机等长时任务由语言 coaching 引导。验证“可操控”不是普通 instruction following,而是能通过人类提示逐步教会新任务。未复现。
数据/上下文消融metadata / subgoal / eval data / diversity ablation去 episode 元数据、去自主评估数据、去子目标图像、去最多样 20% 数据。证明 π0.7 的收益主要来自上下文条件化和数据多样性,不只是模型更大。未复现;页面基于论文。
π0.7 没有仿真 benchmark。它的证据完全来自 Physical Intelligence 的真机平台和自有数据,外部实验室短期只能做概念借鉴,难以复现主结果。

关键结果

能力结果
开箱即用灵巧性折衣/制咖啡/组装盒子等匹配 RL 专家成功率,折衣和盒子组装吞吐量超过专家
指令跟随14 个未见环境场景显著超 π0.5/π0.6;复杂参考指令也更好;能打破数据偏差执行反转任务
跨本体迁移折 T 恤从 BiPi 零样本迁移到 UR5e:85.6% 任务进度 / 80% 成功率,≈人类遥操作首次(90.9%/80.6%)
组合泛化开箱即用做新短任务(按压壶/舀米/擦拭/旋转);通过 coaching 做新长任务(空气炸锅/烤面包机)

消融要点

  • 去 episode 元数据 → 所有灵巧任务吞吐量显著下降;且数据越多性能反降
  • 去自主评估数据 → 性能明显下降
  • 去子目标图像 → 反转偏差任务和跨本体任务尤其受损
  • 去掉最多样化的 20% 数据 → 组合泛化显著下降

优点

  1. 开箱即用能力强:单一通用模型匹配甚至超越专门微调的 RL 专家(前所未有)
  2. 跨本体涌现迁移:零样本折衣匹配人类首次操作,自发适应目标机器人运动学
  3. 组合泛化链路完整:短任务开箱即用 + 长任务 coaching 获取 + coaching 数据蒸馏为自主策略
  4. 严格消融验证了每个设计动机

局限

  • 零样本泛化成功率 60-80%,明显低于分布内 90%+
  • 无仿真实验,无法与仿真基准公平对比
  • 元数据人工标注成本/一致性未讨论
  • 世界模型失败模式未分析;不开源;无触觉/力反馈

可借鉴的思想

① Episode 元数据条件化:给混合质量数据打"质量/错误"标签,让模型区分好坏执行,不必丢弃次优数据——对遥操作采集的参差数据很有用。

② 世界模型子目标引导:训练一个模型预测"期望的下一步状态图/信号"作为策略条件,比纯文本更能表达细节。

③ 语言 coaching + 高层策略蒸馏:先用语言(而非遥操作)教机器人任务流程,再蒸馏为自主策略,快速适应新任务。

一句话总结

π0.7 = π0.6-MEM 架构 + 多模态上下文条件化(子任务/子目标/元数据/控制模式) + BAGEL 世界模型子目标 + 从 RL 专家蒸馏,用"丰富提示词"实现开箱即用的组合泛化与跨本体迁移。

训练/评测资源配置 🟢论文核对

来源:π0.7 论文附录 C(世界模型训练)、附录 D(推理速度与优化)。π0.7 主体与高层策略均基于 Gemma3 4B

推理硬件

组件硬件说明
π0.7 主策略 + 高层策略单张 NVIDIA H100均基于 Gemma3 4B;最小变体 38ms(3 相机输入、5 步去噪、训练时 RTC)
世界模型(子目标图生成)4× H10014B 模型(BAGEL 初始化),序列近 1 万 token;用 4-way 张量并行 + 8-bit 量化 + SageAttention,25 步去噪 1.25s;测试时每 Δ=4s 重生成一次子目标

训练

诚实说明:论文未公开 π0.7 主模型的训练集群规格(卡数/型号/时长)。世界模型"largely 沿用 BAGEL 训练配方",在机器人数据+第一视角人类视频子集+若干开源图像编辑/视频数据上训练,但同样未给具体 GPU 数。Physical Intelligence 的基础模型训练属大规模集群量级(🟠 推断)。
门槛解读:π0.7 最值得注意的是部署侧极其友好——主策略单张 H100 就能 38ms 实时推理,这是它作为"可部署通用基础模型"的核心卖点。重头在世界模型(4×H100 生成子目标),但子目标每 4 秒才更新一次,且可选关闭。若资源有限,可只用主策略(不开世界模型子目标)在单卡上运行。

自测:5 题检验理解