# Benchmark 结果汇总(按 benchmark 重组)
本文档由 8 份抽取文件(out_00 ~ out_07)按 benchmark 重新分组汇总。
通用声明:所有数值均为各论文自报(取自各自 `深度分析.md` / `中文翻译.md`),跨论文同名方法(如 π0、π0.5、OpenVLA-OFT)的数值可能不同,因为训练配置、评测协议、随机种子各异。缺失/占位/图估数值保持原标注(`—` 缺失、`~` 近似/图估、`(图估)`)。数值绝对忠实,未做任何修改或推算(除各批注明的"反推值",已保留原注)。
论文分组排序:每张统一大表内,论文按发表时间倒序(arXiv 号大者在前;无 arXiv 号者排最后)。同一论文多行方法共用一个论文名,后续行论文列留空。
按模型视图:从下方各 benchmark 表格自动抽取常见对比模型行;ckpt 来源列基于原表标注/方法名归纳,若原汇总未保留下载路径则明确标为未记录;协议列会单独标出训练域、测试域和分布关系,未能从当前汇总/深度分析确认的行标为“未确认”。
协议口径:Benchmark 名称不等于训练/测试协议。下面的速查只覆盖当前最容易误读的设置;模型视图会逐行补充更细的协议说明。
| Benchmark / 设置 | 训练域 / ckpt | 测试域 | 分布关系 | 证据口径 |
|---|
| RoboTwin Clean / Randomized | Clean/Randomized 列是测试环境列,不自动说明训练 split;ImageWAM/Motus 明确含 clean + randomized 训练数据,其他论文未逐行保存。 | Clean 和/或 Randomized test split | mixed / split eval | ImageWAM、Motus 深度分析记录训练数据;其余按当前汇总保守标注。 |
| RoboTwin-Clean2Rand | Clean 训练或 clean-domain policy | Randomized Hard 测试 | OOD: Clean2Rand | Qwen-RobotManip Table 5 / §2.4 标题。 |
| RoboTwin Easy / Hard | 目标 benchmark 训练/后训练或各论文 baseline 设置;训练 split 未逐 baseline 保存。 | Easy / Hard ID benchmark split | ID / IID-ish | Qwen-RobotManip 深度分析将 Table 3 标为 ID benchmark。 |
| LIBERO-Plus | 无 “+” 行按 OOD 扰动评测阅读;带 “+ / 用 LIBERO-Plus 训练” 的行是目标域训练。 | Camera / Robot / Lang. / Light / Background / Noise / Layout 等扰动 | OOD or target-trained | MINT 深度分析明确区分无 LIBERO-Plus 训练和有 LIBERO-Plus 训练。 |
| LIBERO-PRO | base policy 冻结;π0.5-LeRobot ckpt 来自 huggingface.co/lerobot/pi05_libero_finetuned;VLS 本身 training-free。 | LIBERO 四套件的 Task / Position 扰动,每任务 20 episodes | OOD perturbation | VLS 深度分析 Table I 与代码仓库记录。 |
| LIBERO reasoning / SEAL | LIBERO reasoning 标注扩展或 runtime steering 设置,按行内方法区分。 | ID、Compose、Lang/Visual OOD 列混合出现 | ID + OOD mixed | §16 表头直接列出 ID / Compose / OOD 维度。 |
| GenBench | 16 train tasks | 44 test tasks,L1-L4 四级泛化 | generalization | ActiveVLA / §17 标注 16 train + 44 test。 |
1. LIBERO(标准四套件)
指标:Spatial / Object / Goal / Long 四套件成功率(%),Avg 为四套件平均。共 21 篇报告标准 LIBERO。数值均为各论文自报,跨论文同名方法数值可能不同。多篇论文只报聚合 Avg(分套件填 —)。粗体为该论文所提方法。
| 论文 | 方法 | 原表标注 | Spatial | Object | Goal | Long | Avg |
|---|
| LA4VLA (2606.27295, Table 4) | No pretrain | baseline | — | — | — | — | 92.85 |
| VLA | 消融 | — | — | — | — | 94.40 |
| LA | 消融 | — | — | — | — | 95.30 |
| MixPT | 所提方法 | — | — | — | — | 95.75 |
| LA-VLA | 所提方法 | — | — | — | — | 96.28 |
| ImageWAM (2606.19531, Table 2) | π0.5 | baseline | — | — | — | — | 96.9 |
| Fast-WAM | baseline | — | — | — | — | 97.6 |
| Motus | baseline | — | — | — | — | 97.7 |
| LingBot-VA | baseline | — | — | — | — | 98.5 |
| ImageWAM | 所提方法 | — | — | — | — | 98.4 |
| MaskWAM (2606.13515, Table 1) | WorldVLA | VLA | 87.6 | 96.2 | 83.4 | 60.0 | 81.8 |
| GR00T-N1 | VLA | 94.4 | 97.6 | 93.0 | 90.6 | 93.9 |
| π0 | VLA | 96.8 | 98.8 | 95.8 | 85.2 | 94.1 |
| π0.5 | VLA | 98.6 | 98.2 | 98.0 | 92.4 | 96.8 |
| Motus | WAM | 96.8 | 99.8 | 96.6 | 97.6 | 97.7 |
| FastWAM | WAM | 98.2 | 100.0 | 97.0 | 95.2 | 97.6 |
| Ours (RGB-only) | WAM 消融 | 96.8 | 99.6 | 97.0 | 95.8 | 97.3 |
| Ours (Mask-only) | WAM 消融 | 97.2 | 99.8 | 97.4 | 96.0 | 97.6 |
| Ours (MaskWAM) | 所提方法 | 98.8 | 100.0 | 98.2 | 96.4 | 98.4 |
| Qwen-VLA (2605.30280, 正文表) | 最佳 Specialist | ABot-M0/StarVLA-OFT | — | — | — | — | 98.6 |
| Qwen-VLA-Instruct | 所提(通用) | — | — | — | — | 97.9 |
| OASIS (2605.25829, Table 1) | SpatialVLA | 空间特征/预训练 | 88.2 | 89.9 | 78.6 | 55.5 | 78.1 |
| WorldVLA | 未来视觉状态 | 85.6 | 89.0 | 82.6 | 59.0 | 79.1 |
| ThinkAct | 2D 监督特征/预训练 | 88.3 | 91.4 | 87.1 | 70.9 | 84.4 |
| π0 | 多模态特征/预训练 | 96.8 | 98.8 | 95.8 | 85.2 | 94.1 |
| QDepth-VLA | 空间特征/预训练 | 97.6 | 96.6 | 95.2 | 90.0 | 94.9 |
| UniVLA | 空间特征/预训练 | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 |
| Unified-VLA | 未来视觉状态/预训练 | 95.4 | 98.8 | 93.6 | 94.0 | 95.5 |
| OASIS | SE(3)监督/无预训练 | 99.0 | 98.8 | 97.4 | 95.2 | 97.6 |
| StarVLA (2604.05014, 正文) | π0+FAST | baseline | — | — | — | — | 85.5 |
| GR00T-N1.5 | baseline | — | — | — | — | 86.5 |
| OpenVLA-OFT | baseline(175K步) | — | — | — | — | 97.1 |
| StarVLA-FAST | 本文变体 | — | — | — | — | 95.4 |
| StarVLA-π | 本文变体 | — | — | — | — | 95.7 |
| StarVLA-GR00T | 本文变体 | — | — | — | — | 96.5 |
| StarVLA-OFT | 本文变体 | 97.8 | 98.6 | 96.2 | 93.8 | 96.6 |
| FutureVLA (2603.10712, 正文) | OpenVLA-OFT | baseline | — | — | — | — | 76.5 |
| π0 | baseline | — | — | — | — | 94.2 |
| GR00T-N1.5 | baseline | — | — | — | — | 93.9 |
| UniVLA | baseline | — | — | — | — | 95.2 |
| FutureVLA-OT | 所提(变体) | — | — | — | — | 98.2 |
| FutureVLA-GT | 所提方法 | — | — | — | — | 98.3 |
| DiT4DiT (2603.10448, 正文) | Qwen3DiT | 参数匹配基线 | 98.0 | 98.8 | 96.0 | 93.6 | 96.6 |
| CogVLA | baseline | — | — | — | 95.4 | 97.4 |
| π0.5 | baseline | — | — | — | 92.4 | 96.9 |
| OpenVLA-OFT | baseline | — | — | — | 94.5 | — |
| GR00T-N1.5 | baseline | — | — | — | — | 94.1 |
| DiT4DiT | 所提(SOTA) | 98.4 | 99.6 | 98.6 | 97.6 | 98.6 |
| MINT (2603.08602, Table I) | Diffusion Policy | 无预训练 | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| MDT | 无预训练 | 78.5 | 87.5 | 73.5 | 64.8 | 76.1 |
| WorldVLA | 无预训练 | 87.6 | 96.2 | 83.4 | 60.0 | 81.8 |
| SmolVLA | 无预训练 | 93.0 | 94.0 | 91.0 | 77.0 | 88.8 |
| MINT-30M | 无预训练(本文) | 98.6 | 99.2 | 97.4 | 93.2 | 97.1 |
| LAPA | 有预训练 | 73.8 | 74.6 | 58.8 | 55.4 | 65.7 |
| OpenVLA | 有预训练 | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| π0-FAST | 有预训练 | 96.4 | 96.8 | 88.6 | 60.2 | 85.5 |
| π0 | 有预训练 | 90.0 | 86.0 | 95.0 | 73.0 | 86.0 |
| UniVLA | 有预训练 | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 |
| OpenVLA-OFT | 有预训练 | 96.9 | 98.1 | 95.6 | 91.1 | 95.4 |
| π0.5 | 有预训练 | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| MINT-4B | 有预训练(本文) | 97.4 | 99.6 | 98.2 | 97.8 | 98.3 |
| ForeAct (2602.12322, 仿真表) | OpenVLA | baseline | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| CoT-VLA | baseline | 87.5 | 91.6 | 87.6 | 69.0 | 83.9 |
| π0 | baseline | 96.8 | 98.8 | 95.8 | 83.2 | 94.2 |
| π0.5 | baseline | 97.3 | 98.8 | 96.9 | 94.2 | 96.8 |
| CogVLA | baseline | 97.3 | 99.8 | 96.6 | 95.4 | 97.4 |
| ForeAct (w/ π0.5) | 所提方法 | 97.3 | 99.8 | 97.3 | 95.4 | 97.5 |
| LAP (2602.10556, Table 3) | LAP-3B | language-action | — | — | — | — | 96.8 |
| LAP-3B + VQA Co. | +VQA 共训 | — | — | — | — | 97.2 |
| mimic-video (2512.15692, Table 4.2) | Diffusion Policy | scratch | 78.1 | 92.5 | 68.5 | — | 79.7 |
| Octo | finetuned | 78.9 | 85.7 | 84.6 | — | 83.1 |
| DiT Policy | finetuned | 84.2 | 96.3 | 85.4 | — | 88.6 |
| OpenVLA | finetuned | 84.7 | 88.4 | 79.2 | — | 84.1 |
| OpenVLA-OFT | finetuned | 96.2 | 98.4 | 96.2 | — | 96.9 |
| pi0.5-style VLA | scratch | 79.2 | 94.0 | 84.4 | — | 85.9 |
| mimic-video | 所提(scratch) | 94.2 | 96.8 | 90.6 | — | 93.9 |
| SwiftVLA (2512.00903, Table 3) | GR00T-N1 | 大 VLA | — | — | — | — | 93.9 |
| π0 | 大 VLA (3B) | — | — | — | — | 94.1 |
| OpenVLA-OFT | 大 VLA (7B) | — | — | — | — | 97.1 |
| SwiftVLA | 0.45B | — | — | — | — | 94.7 |
| SwiftVLA (4D input) | 1.65B | — | — | — | — | 95.1 |
| ContextVLA (2510.04246, Table 1) | GROOT N1.5 | 1-frame | — | — | — | — | 76.6 |
| ContextVLA | 8-frame | — | — | — | — | 79.0 |
| DreamVLA (2507.04447, Table 2) | DreamVLA | 所提方法 | 97.5 | 94.0 | 89.5 | 89.5 | 92.6 |
| Fast-WAM (2503.17543, Table 1) | OpenVLA | baseline | — | — | — | — | — |
| π0 | baseline | — | — | — | — | — |
| Fast-WAM w/o video co-training | 消融 | — | — | — | — | 82.6 |
| Fast-WAM-Joint | 消融 | — | — | — | — | 90.4 |
| Fast-WAM-IDM | 消融 | — | — | — | — | 90.6 |
| Fast-WAM | 所提方法 | — | — | — | — | 91.9 |
| CosmosPolicy (无 arXiv, Table 1) | OpenVLA-OFT | 次优基线 | — | — | — | — | ~95 |
| Cosmos Policy | 所提(SOTA) | — | — | — | — | 98.5 |
| G0.5 (无 arXiv, Table 4) | G0.5 | 所提方法 | — | — | — | — | 98.9 |
| Qwen-RobotManip (无 arXiv, Table 3) | π0 | baseline | — | — | — | — | 94.4 |
| π0.5 | baseline | — | — | — | — | 97.6 |
| StarVLA | baseline | — | — | — | — | 98.0 |
| Abot-M0 | baseline | — | — | — | — | 98.6 |
| Being-H0.7 | baseline | — | — | — | — | 99.2 |
| Qwen-RobotManip-scratch | 本文(从零) | — | — | — | — | 98.2 |
| Qwen-RobotManip | 本文 | — | — | — | — | 99.1 |
| Qwen-RobotManip-Context | 本文(context) | — | — | — | — | 99.2 |
| World-VLA-Loop (无 arXiv) | SFT baseline | baseline | — | — | — | — | 83.9 |
| World-VLA-Loop (首轮RL) | 所提方法 | — | — | — | — | 93.1 |
| Xiaomi-Robotics-0 (无 arXiv) | OpenVLA | baseline | — | — | — | — | 82.1 |
| OpenVLA-OFT | baseline | — | — | — | — | 86.0 |
| Xiaomi-Robotics-0 | 所提方法 | — | — | — | — | 90.8 |
异常/备注:
- MINT 的 LIBERO 原表另有 L90(LIBERO-90)列:MINT-30M 97.4、π0.5 96.0、MINT-4B 98.7(未纳入标准五列)。
- LA4VLA 原抽取行含 "87.8(Spatial:No)→95.8(LA-VLA)" 的勘误式表述,Spatial 逐列不可靠,此处分套件统一填 —。
- World-VLA-Loop 另有"LIBERO 平均 87.5%"(设置不同)的速览值,与主表 93.1 口径不同。
- 同名方法跨论文数值差异明显,例如 OpenVLA-OFT 的 Avg 在不同论文中为 95.4 / 96.9 / 97.1;π0.5 为 96.8 / 96.9 / 97.6 等——均为各论文自报,未统一。
2. RoboTwin(2.0 及变体)
共 11 篇(Motus、SwiftVLA、Fast-WAM、GigaWorld-Policy、ImageWAM、MaskWAM、StarVLA、LingBot-VLA、G0.5、Qwen-RobotManip、Qwen-VLA)。RoboTwin 2.0 标准指标为 Clean / Randomized 环境下的成功率(SR,部分论文用 0–1 分数,部分用百分数,保留原样);另有 Easy/Hard、Clean2Rand、指令跟随(IF)等变体设置。数值均为各论文自报。
协议提醒:Clean / Randomized 是测试环境列,不自动等价于“clean 训练 / randomized 训练”。ImageWAM 与 Motus 的深度分析保留了 clean + randomized 训练数据;Qwen-RobotManip Table 3 属于 ID benchmark,Table 5 是 Clean2Rand,Table 8 是 IF。未保留训练 split 的行在模型视图中标为“未确认”。
2.1 RoboTwin 2.0(Clean / Randomized 成功率)
| 论文 | 方法 | 原表标注 | Clean | Randomized |
|---|
| ImageWAM (2606.19531, Table 1) | π0.5 | baseline | — | 79.75 |
| Motus | baseline | — | 87.80 |
| FastWAM | baseline | — | 91.83 |
| LingBot-VA | baseline | — | 92.20 |
| ImageWAM (FLUX.2 4B) | 所提方法 | 93.20 | 93.56 |
| MaskWAM (2606.13515, Table 2, 6随机化任务Avg) | π0 | VLA | — | 72.8 |
| FastWAM | WAM | — | 87.7 |
| Ours (RGB-only) | 消融 | — | 87.3 |
| Ours (Mask-only) | 消融 | — | 88.8 |
| Ours (MaskWAM) | 所提方法 | — | 92.2 |
| StarVLA (2604.05014, 50任务) | π0 | baseline | 65.9 | 58.4 |
| X-VLA | baseline | 72.9 | 72.8 |
| Lingbot-VLA | baseline | 88.6 | 86.7 |
| StarVLA-GR00T | 本文变体 | 88.0 | 88.5 |
| StarVLA-π | 本文变体 | 88.1 | 88.8 |
| LingBot-VLA (2601.18692, Table 2) | Ours w/o depth | 本文(无深度) | 82.74 | 76.76 |
| Ours w/ depth | 本文(深度蒸馏) | 88.56 | 86.68 |
| Motus (2512.13030, 4.1, 50任务) | π0.5 | VLA | 42.98 | 41.64 |
| X-VLA | VLA | 72.90 | 72.44 |
| Motus (Stage 1 only) | 消融 | 77.00 | 82.86 |
| Motus (full) | 所提方法 | 85.66 | 86.48 |
备注:LingBot-VLA 另报 Process Score(Clean PS 86.90 / Random PS 85.54,w/o depth);MaskWAM 逐任务(Hammer/Bell/Card/Burger/Stand/Shoe)见 out_06 原表。
2.2 RoboTwin 2.0(仅报聚合 SR,无 Clean/Randomized 拆分)
| 论文 | 方法 | 原表标注 | SR |
|---|
| GigaWorld-Policy (2603.17240, 4.1, 仿真SR) | π0.5 | baseline | 0.48 |
| Motus | baseline | 0.88 |
| GigaWorld-Policy | 所提方法 | 0.86 |
| SwiftVLA (2512.00903, Table 1, post-training) | TinyVLA | 小 VLA | 0.07 |
| SmolVLA | 小 VLA (0.5B) | 0.29 |
| GO-1 | 大 VLA | 0.46 |
| π0 | 大 VLA (3.3B) | 0.47 |
| SwiftVLA | 0.45B | 0.53 |
| SwiftVLA (4D input) | 1.65B | 0.55 |
| Fast-WAM (2503.17543, Table 2) | Fast-WAM w/o video co-training | 消融 | 84.8 |
| Fast-WAM-Joint | 消融 | 80.5 |
| Fast-WAM-IDM | 消融 | 81.3 |
| Fast-WAM | 所提方法 | 91.5 |
| G0.5 (无 arXiv, Table 4) | G0.5 | 所提方法 | 93.3 |
备注:GigaWorld-Policy 正文另处提 π0.5 仿真 0.44,与速度卡 0.48 略有出入(本表采速度卡值)。SwiftVLA 边缘部署(Jetson Orin) SR:SmolVLA 0.30 / π0 0.48 / SwiftVLA 0.76(见 out_03 Table 4)。单位口径(0–1 分数 vs 百分数)沿用各论文原文。
2.3 RoboTwin(Easy / Hard 设置)
| 论文 | 方法 | 原表标注 | Easy | Hard |
|---|
| Qwen-VLA (2605.30280, 正文表) | 最佳 Specialist | ABot-M0/StarVLA-OFT | 86.0 | 85.0 |
| Qwen-VLA-Instruct | 本文(通用) | 86.1 | 87.2 |
| Qwen-RobotManip (无 arXiv, Table 3) | π0 | baseline | 65.9 | 58.4 |
| π0.5 | baseline | 82.7 | 76.8 |
| StarVLA | baseline | 85.7 | 87.3 |
| Abot-M0 | baseline | 86.1 | 85.1 |
| Being-H0.7 | baseline | 90.2 | 89.6 |
| Qwen-RobotManip-scratch | 本文(从零) | 88.7 | 88.4 |
| Qwen-RobotManip | 本文 | 93.4 | 92.5 |
| Qwen-RobotManip-Context | 本文(context) | 93.7 | 94.0 |
2.4 RoboTwin-Clean2Rand(Hard 设置,成功率%)
| 论文 | 方法 | 原表标注 | Hard |
|---|
| Qwen-RobotManip (无 arXiv, Table 5) | StarVLA | baseline | 10.6 |
| π0.5 | baseline | 47.9 |
| Qwen-RobotManip (EEF) | 本文 | 60.8 |
| Qwen-RobotManip (joint) | 本文 | 62.6 |
| Qwen-RobotManip-Context (joint) | 本文 | 69.4 |
2.5 RoboTwin-IF(指令跟随,平均成功率%)
| 论文 | 方法 | 原表标注 | Avg |
|---|
| Qwen-RobotManip (无 arXiv, Table 8) | GR00T-N1.7 | baseline | 16.6 |
| StarVLA | baseline | 29.4 |
| π0.5 | baseline | 49.6 |
| Qwen-RobotManip-Context | 本文 | 72.0 |
| Qwen-RobotManip | 本文 | 72.2 |
3. SimplerEnv
共 11 篇。子环境:Google-Robot(Fractal,多用 Visual Matching / Variant Aggregation)、WidowX-Bridge(多任务平均成功率)、OOD。指标为成功率(%)。数值均为各论文自报,跨论文同名方法可能不同。
3.1 Google-Robot(Fractal)
| 论文 | 方法 | 原表标注 | Visual Matching (Avg %) | Variant Aggregation |
|---|
| StarVLA (2604.05014) | CogACT | baseline | 74.8 | 61.3 |
| SpatialVLA | baseline | 75.1 | 70.7 |
| StarVLA-OFT | 本文 | 76.0 | 70.2 |
| FutureVLA (2603.10712) | OpenVLA-OFT | baseline | 47.5 | — |
| π0 | baseline | 52.7 | — |
| GR00T-N1.5 | baseline | 35.2 | — |
| Villa-X | baseline | 59.6 | — |
| FutureVLA-OT | 所提(变体) | 77.6 | — |
| FutureVLA-GT | 所提方法 | 80.1 | — |
| DeFI (无 arXiv, ICLR 2026) | OpenVLA | baseline | 27.7 | — |
| TraceVLA | baseline | 42.0 | — |
| DeFI | 所提(SOTA) | 51.2 | — |
| Xiaomi-Robotics-0 (无 arXiv) | GR00T-N1 | baseline | 53.7 | — |
| Xiaomi-Robotics-0 | 所提方法 | 68.5 | — |
DeFI 逐任务(Visual Matching):Pick Coke Can 54.2 / Move Near 60.7 / Open-Close Drawer 38.6(DeFI);TraceVLA 28.0/53.7/57.0;OpenVLA 16.3/46.2/35.6。
3.2 WidowX-Bridge
| 论文 | 方法 | 原表标注 | WidowX-Bridge Avg SR(%) |
|---|
| Qwen-VLA (2605.30280) | 最佳 Specialist | baseline | 64.6 |
| Qwen-VLA-Instruct | 本文 | 73.7 |
| StarVLA (2604.05014) | SpatialVLA | baseline | 42.7 |
| CogACT | baseline | 51.3 |
| GR00T N1.5 | baseline | 61.9 |
| StarVLA-OFT | 本文变体 | 64.6 |
| StarVLA-GR00T | 本文变体 | 65.3 |
| FutureVLA (2603.10712) | OpenVLA-OFT | baseline | 30.2 |
| π0 | baseline | 20.9 |
| GR00T-N1.5 | baseline | 61.9 |
| UniVLA | baseline | 47.9 |
| Villa-X | baseline | 40.8 |
| FutureVLA-OT | 所提(变体) | 63.6 |
| FutureVLA-GT | 所提方法 | 71.9 |
| mimic-video (2512.15692) | OpenVLA | finetuned | 14.6 |
| Octo | finetuned | 16.0 |
| ThinkAct | pretrained | 43.8 |
| FLOWER | finetuned | 45.0 |
| pi0.5-style VLA | scratch | 35.4 |
| mimic-video | scratch | 46.9 |
| mimic-video (τv-tuning) | 所提方法 | 56.3 |
| ContextVLA (2510.04246) | GROOT N1.5 | 1-frame | 41.9 |
| ContextVLA | 8-frame | 56.2 |
| FSD / SeeingToDoing (2505.08548) | RoboPoint | 零样本 baseline | 17.7 |
| OpenVLA-OFT | 端到端 VLA | 41.8 |
| FSD-13B | 本文(零样本) | 40.6 |
| LAPA (2410.11758) | Scratch | baseline | 0.7 |
| LAPA (Human Videos) | 所提方法 | 45.8 |
| OpenVLA (2406.09246, BridgeData V2 17任务) | RT-1-X | 35M | 18.5 |
| Octo | 93M | 20.0 |
| RT-2-X | 55B | 50.6 |
| OpenVLA | 7B | 70.6 |
| G0.5 (无 arXiv) | G0.5 | 所提方法(SimplerEnv-Bridge) | 87.3 |
mimic-video 逐任务(WidowX-Bridge):Put Carrot/Put Spoon/Stack Blocks/Eggplant,见 out_02 原表。OpenVLA 该表原文标注为"真机 out-of-the-box, SimplerEnv 风格多平台评估",同时报 Google Robot(12任务):RT-1-X 33.3 / Octo 26.7 / RT-2-X 78.3 / OpenVLA 85.0。
3.3 SimplerEnv-OOD
| 论文 | 方法 | 原表标注 | SR(%) |
|---|
| Qwen-VLA (2605.30280) | π0.5 | baseline | 12.6 |
| Qwen-VLA | 本文 | 32.0 |
4. CALVIN
共 8 篇(含 ABC→D 7 篇、ABCD→D 1 篇)。指标:连续链式 1/2/3/4/5 条指令的成功率,Avg.Len 为平均完成任务链长度(满分5)。数值均为各论文自报;注意 SuSIE 原文用 0–1 分数,其余多数用百分数,均保留原样,故跨论文数值不可直接比较。
4.1 CALVIN(ABC→D,零样本泛化)
| 论文 | 方法 | 原表标注 | 1 | 2 | 3 | 4 | 5 | Avg.Len |
|---|
| OASIS (2605.25829, Table 2) | SuSIE | 未来视觉状态/预训练 | 87.0 | 69.0 | 49.0 | 38.0 | 26.0 | 2.69 |
| 3D Diffuser Actor† | 3D 特征(多视图RGB-D) | 93.8 | 80.3 | 66.2 | 53.3 | 41.2 | 3.35 |
| ReconVLA | 空间特征/预训练 | 95.6 | 87.6 | 76.9 | 69.3 | 64.1 | 3.95 |
| Seer-Large | 未来视觉状态/预训练 | 96.3 | 91.6 | 86.1 | 80.3 | 74.0 | 4.28 |
| VPP | 未来视觉状态/预训练 | 96.5 | 90.9 | 86.6 | 82.0 | 76.9 | 4.33 |
| Unified-VLA | 未来视觉状态/预训练 | 98.9 | 94.8 | 89.0 | 82.8 | 75.1 | 4.41 |
| DreamVLA | 未来视觉状态/预训练 | 98.2 | 94.6 | 89.5 | 83.4 | 78.1 | 4.44 |
| OASIS | SE(3)监督/无预训练 | 98.1 | 94.9 | 91.7 | 88.9 | 83.3 | 4.57 |
| DreamVLA (2507.04447, Table 1) | DreamVLA | 所提方法 | — | — | — | — | — | 4.44 |
| GHIL-Glue (2410.20018, Table I) | LCBC Diffusion Policy | baseline | 68.5 | 43.0 | 22.5 | 11.0 | 6.8 | 1.52 |
| SuSIE | baseline | 89.8 | 75.0 | 57.5 | 41.8 | 29.8 | 2.94 |
| GHIL-Glue (SuSIE) | 仅Aug De-sync | 95.2 | 84.0 | 69.5 | 56.0 | 46.2 | 3.51 |
| GHIL-Glue (SuSIE) | 仅Subgoal Filtering | 88.5 | 75.5 | 56.2 | 43.0 | 32.5 | 2.96 |
| GHIL-Glue (SuSIE) | 完整 | 95.2 | 88.5 | 73.2 | 62.5 | 49.8 | 3.69 |
| UniPi | baseline | 56.8 | 28.3 | 12.0 | 3.5 | 1.5 | 1.02 |
| GHIL-Glue (UniPi) | 仅Aug De-sync | 60.2 | 29.5 | 12.5 | 5.5 | 1.8 | 1.1 |
| GHIL-Glue (UniPi) | 仅Subgoal Filtering | 69.5 | 40.0 | 15.8 | 6.5 | 4.2 | 1.36 |
| GHIL-Glue (UniPi) | 完整 | 75.2 | 44.8 | 19.7 | 11.2 | 5.5 | 1.56 |
| DISCO (2406.09767, 表6.2) | RT-1 | | 53.3 | 22.2 | 9.4 | 3.8 | 1.3 | 0.90 |
| RoboFlamingo | | 82.4 | 61.9 | 46.6 | 33.1 | 23.5 | 2.48 |
| SuSIE | | 87.0 | 69.0 | 49.0 | 38.0 | 26.0 | 2.69 |
| DeeR-VLA | | — | — | — | — | — | 2.90 |
| 3D Diffuser Actor | | 92.2 | 78.7 | 63.9 | 51.2 | 41.2 | 3.27 |
| Vanilla inpt. | | 92.9 | 78.6 | 64.9 | 51.4 | 41.9 | 3.30 |
| DISCO | 所提方法 | 94.7 | 82.9 | 71.0 | 58.8 | 49.4 | 3.57 |
| SuSIE (2310.10639, 深度分析6.1, 0–1分数) | AugLC | 语言条件基线 | 0.69 | 0.43 | 0.22 | 0.09 | 0.05 | — |
| UniPi (Ours 复现) | 论文复现的 UniPi | 0.56 | 0.16 | 0.08 | 0.08 | 0.04 | — |
| SuSIE | 图像编辑subgoal+GCBC | 0.87 | 0.69 | 0.49 | 0.38 | 0.26 | — |
| DeFI (无 arXiv, ICLR 2026) | DeFI (多视角) | 所提(SOTA) | 97.9 | 94.2 | 90.7 | 87.0 | 81.2 | 4.51 |
| VPP (多视角) | 基线 | 96.5 | 90.9 | 86.6 | 82.0 | 76.9 | 4.33 |
| Seer (多视角) | 基线 | 96.3 | 91.6 | 86.1 | 80.3 | 74.0 | 4.28 |
| π0.5 (多视角) | 基线 | 94.8 | 87.4 | 78.2 | 71.7 | 64.3 | 3.97 |
| DeFI (单视角) | 所提 | 92.9 | 87.2 | 81.2 | 75.0 | 68.4 | 4.05 |
| UP-VLA | 基线 | — | — | — | — | — | 4.08 |
| UniVLA | 基线 | — | — | — | — | — | 3.80 |
| CLOVER | 基线 | — | — | — | — | — | 3.53 |
| OpenVLA | 基线 | — | — | — | — | — | 3.27 |
| Xiaomi-Robotics-0 (无 arXiv) | GR00T-N1 | | — | — | — | — | — | 4.70 |
| Xiaomi-Robotics-0 | 所提方法 | — | — | — | — | — | 4.78 |
备注:DreamVLA 消融(Fig.6/Table 5):Vanilla VLA Avg.Len 3.64、+Dynamic Region 4.32。SuSIE 只报 1–5 分步成功率(0–1),无 Avg.Len。
4.2 CALVIN(ABCD→D)
| 论文 | 方法 | 原表标注 | 1 | 2 | 3 | 4 | 5 | Avg.Len |
|---|
| MINT (2603.08602, Table I) | RT-1 | baseline | 84.4 | 61.7 | 43.8 | 32.3 | 22.7 | 2.45 |
| Robo-Flamingo | baseline | 96.4 | 89.6 | 82.4 | 74.0 | 66.0 | 4.09 |
| π0.5 | baseline | 94.2 | 89.3 | 82.7 | 78.5 | 70.3 | 4.15 |
| RoboVLMs | baseline | 96.7 | 93.0 | 89.9 | 86.5 | 82.6 | 4.49 |
| MINT-4B | 本文 | 97.4 | 94.2 | 91.7 | 88.2 | 86.1 | 4.57 |
备注:CALVIN 的 D→D 设置在 8 份抽取中无论文报告。VLS(2602.03973) 的 CALVIN 未按 1–5 链长报告(仅报 MovableObjects 94 / ArticulatedParts 87 任务组成功率),归入 §16 附注/其他,不并入本节。
5. RoboCasa
共 7 篇(GR00T-N1、MimicDroid、UniT-Humanoid、CosmosPolicy、DIAL、DiT4DiT、HSAT-AT)。RoboCasa 有多种设置:Franka 20 任务 / 厨房 24 任务 / GR1 桌面 24 任务 / Few-Shot L1-L3 / ICL。指标为成功率(部分论文 0–1,部分百分数)。数值均为各论文自报,任务集与本体不同,不同小节间不可直接比较。
5.1 RoboCasa(Franka 20 任务 / 厨房 24 任务,平均 SR)
| 论文 | 方法 | 原表标注 | Avg SR |
|---|
| CosmosPolicy (无 arXiv, Table 2, 24厨房任务) | 次优 | 基线 | ~60 |
| Cosmos Policy | 所提(SOTA) | 67.1 |
| GR00T-N1 (无 arXiv, Table 2, 20任务) | Octo | baseline | 28.8 |
| OpenVLA | baseline | 31.2 |
| π0 | baseline | 55.6 |
| GR00T N1 (2B) | 所提方法 | 61.6 |
5.2 RoboCasa-GR1(24 tabletop 任务,Full Data 平均 SR)
| 论文 | 方法 | 原表标注 | Avg SR |
|---|
| DiT4DiT (2603.10448) | Qwen3DiT | 参数匹配基线 | 36.2 |
| GR00T-N1.6 | 基线 | 40.8 |
| GR00T-N1.5 | 基线 | 41.8 |
| DiT4DiT | 所提(SOTA) | 50.8 |
| DIAL (无 arXiv) | Diffusion Policy | 基线 | 29.5 |
| UWM | 基线 | 40.9 |
| FAST-Qwen3 | 基线 | 43.9 |
| GR00T-N1.6 | 基线 | 47.6 |
| pi0 (π-Qwen3) | 基线 | 47.8 |
| FLARE | 基线 | 55.0 |
| DIAL | 所提(SOTA) | 70.2 |
| UniT-Humanoid (无 arXiv, Fig.9) | GR00T baseline | 同架构无UniT | 47.8 |
| FLARE | 未来潜在对齐 flow | 55.0 |
| VLA-UniT | 所提(+UniT token) | 66.7 |
备注:三篇 GR1 结果的 baseline 数值差异大(DiT4DiT 报 GR00T-N1.5=41.8、自身 50.8;DIAL 报 pi0=47.8、自身 70.2;UniT-Humanoid 报 GR00T=47.8、自身 66.7),源于各自任务配置/数据量不同。UniT-Humanoid 分项:Pick&Place 67.3 / Articulated 64.7。
5.3 RoboCasa Few-Shot
MimicDroid (2509.09726, Table I, L1/L2/L3)
| 方法 | 原表标注 | 本体 | L1 | L2 | L3 |
|---|
| MimicDroid w/o Visual Masking | 消融 | Abstract | 39 | — | — |
| MimicDroid | 所提方法 | Abstract | 73 | 39 | 27 |
| MimicDroid | 所提方法 | GR1 | 59 | 44 | 26 |
DIAL (无 arXiv, Few-Shot 100 traj = 10% 数据, 平均 SR)
| 方法 | 原表标注 | Avg SR |
|---|
| 冻结VLM 无世界建模 | 消融 | 21.8 |
| 微调VLM 无世界建模 | 消融 | 30.6 |
| DIAL-DINO (替换ViT) | 消融 | 47.2 |
| +SEER 拼接 | 消融 | 49.6 |
| +FLARE 辅助loss | 消融 | 51.9 |
| DIAL | 完整 | 58.3 |
| DIAL +EgoDex 人类数据 (ID) | 跨体 | 61.1 |
5.4 RoboCasa ICL / Zero-shot(HSAT-AT, 2504.15215)
| 设置 | 方法 | 原表标注 | Avg SR |
|---|
| ICL (7任务, Table 1) | ICRT+MLP | baseline | 0.85 |
| LfpVQ-VAE | baseline | 0.96 |
| HSAT-AT | 所提方法 | 0.99 |
| Zero-shot (unseen, Table 5) | LfpVQ-VAE | baseline | 0.84 |
| HSAT-AT | 所提方法 | 0.88 |
6. RLBench
共 4 篇。指标为平均成功率(%),任务数各异(18/8/12),已在原表标注注明。数值均为各论文自报。
| 论文 | 方法 | 原表标注 | Avg Success(%) |
|---|
| ActiveVLA (2601.08325, Table 1, 18任务) | RVT / PerAct | 基线 | — |
| 3D Diffuser Actor | 基线 | — |
| BridgeVLA | 基线 | 84.0 |
| RVT-2 | 基线 | 88.3 |
| ActiveVLA | 所提(Avg Rank 1.22) | 91.8 |
| Goal-VLA (2506.23919, 8任务, zero-shot) | π0 | baseline | 0.0 |
| SUSIE | baseline | 0.0 |
| OpenVLA | baseline | 0.2 |
| VoxPoser | baseline | 5.8 |
| MolmoAct | baseline | 11.3 |
| MOKA | baseline | 26.0 |
| Goal-VLA | 所提方法 | 59.9 |
| SAM2Act (2501.18564, Table 5.1, 18任务) | PerAct | baseline | 49.4 |
| RVT | baseline | 62.9 |
| SAM-E | baseline | 77.6 |
| RVT-2 | 前 SOTA | 81.4 |
| SAM2Act | 所提方法 | 86.8 |
| SynthICL (arXiv 2026.06, 12任务) | ICRT | baseline | 66.1 |
| IP (Instant Policy) | baseline | 72.4 |
| SynthICL (full) | 所提方法 | 75.8 |
备注:SAM2Act Avg Rank 1.8(18任务中9个第一);ActiveVLA Avg Rank 1.22。SynthICL 的 "arXiv 2026.06" 非标准编号,排序按无号处理置末。
7. LIBERO-Plus
共 3 篇(ImageWAM、MINT、Qwen-RobotManip)。LIBERO-Plus 为 LIBERO 多维泛化扰动基准。各论文报告的扰动维度列不完全一致,统一以 Avg 汇总,逐维数值列于备注。数值均为各论文自报。
协议提醒:无 “+” 的行按 LIBERO-Plus OOD 扰动评测阅读;MINT 表中带 “+” 或原表标注“用 LIBERO-Plus 训练”的行是目标域训练,需要和无 “+” baseline 分开比较。ImageWAM / Qwen-RobotManip 的训练域细节若当前汇总未保存,模型视图会标为“未确认”。
| 论文 | 方法 | 原表标注 | Camera | Light | Avg |
|---|
| ImageWAM (2606.19531, Table 3) | WorldVLA | baseline | — | — | 25.0 |
| FastWAM | baseline | 16.4 | — | 51.5 |
| π0-Fast | baseline | — | — | 61.6 |
| OpenVLA-OFT | baseline | — | — | 69.6 |
| ImageWAM (FLUX.2 4B) | 所提方法 | 80.8 | 98.1 | 83.1 |
| ImageWAM (FLUX.2 9B) | 所提方法 | — | — | 85.2 |
| MINT (2603.08602, Table II, 7维) | OpenVLA | baseline | 0.8 | 8.1 | 16.3 |
| UniVLA | baseline | 1.8 | 69.0 | 45.9 |
| π0 | baseline | 13.8 | 85.0 | 56.1 |
| π0-FAST | baseline | 65.1 | 73.2 | 62.5 |
| OpenVLA-OFT | baseline | 56.4 | 88.7 | 71.4 |
| π0.5 | baseline | 53.0 | 83.1 | 65.0 |
| MINT-30M | 本文 | 61.4 | 92.2 | 69.5 |
| MINT-4B | 本文 | 72.2 | 96.6 | 80.1 |
| OpenVLA-OFT+ | 用 LIBERO-Plus 训练 | 92.8 | 94.9 | 80.7 |
| π0.5+ | 用 LIBERO-Plus 训练 | 67.2 | 75.8 | 65.3 |
| MINT-4B+ | 用 LIBERO-Plus 训练 | 95.6 | 95.1 | 84.1 |
| Qwen-RobotManip (无 arXiv, Table 4) | π0 | baseline | — | — | 53.6 |
| π0.5 | baseline | — | — | 84.4 |
| Qwen-RobotManip | 本文 | — | — | 89.0 |
| Qwen-RobotManip-Context | 本文 | — | — | 91.4 |
备注:MINT LIBERO-Plus 7 维(Camera/Robot/Lang./Light/Back./Noise/Layout)逐维数值见 out_06 Table II(此处仅摘 Camera、Light 两列)。
8. ManiSkill
共 3 篇(LRM、HSAT-AT、ViTaS)。指标为成功率(部分 0–1,部分百分数),任务数各异。数值均为各论文自报。
| 论文 | 方法 | 原表标注 | Avg SR |
|---|
| LRM (2603.16065, 3.6, 长视野) | Qwen3-VL-8B zero-shot | baseline | 56.88 |
| LRM (Task Completion Reward) | 所提方法 | 60.93 |
| ViTaS (2602.11643, Table I, 12任务IL) | ACT | | 65.7 |
| DP | | 71.5 |
| ViTaS | 所提方法 | 91.4 |
| ViTaS (2602.11643, Table III, 泛化) | DP | | 54.9 |
| ACT | | 67.8 |
| ViTaS | 所提方法 | 85.7 |
| HSAT-AT (2504.15215, Table 2, 3任务) | LfpVQ-VAE | baseline | 0.84 |
| HSAT-AT | 所提方法 | 0.89 |
9. COLOSSEUM
共 2 篇(SAM2Act、ActiveVLA)。两篇指标不同:ActiveVLA 报平均成功率(%);SAM2Act 报平均性能下降(%)(越接近 0 越鲁棒)。数值均为各论文自报。
| 论文 | 方法 | 原表标注 | 指标值 |
|---|
| ActiveVLA (2601.08325, Table 2, 14场景, Avg SR%) | 前 SOTA | 基线 | 64.0 |
| ActiveVLA | 所提(Avg Rank 1.3) | 65.9 |
| SAM2Act (2501.18564, Table 5.2, 20任务, 性能下降%↓) | RVT-2 | baseline | -19.5 |
| SAM-E | baseline | -19.1 |
| SAM2Act | 所提方法 | -4.3 (std 3.6) |
备注:ActiveVLA 分项 MO-SIZE 72.4 / Camera Pose 78.3。
10. Meta-World
共 2 篇(MINT、LA4VLA;含 "MetaWorld" 拼写)。指标为分难度成功率(%),Avg 为难度档均值。数值均为各论文自报。
| 论文 | 方法 | 原表标注 | Easy | Medium | Hard | Very Hard | Avg |
|---|
| LA4VLA (2606.27295, Table 4) | No pretrain (Base) | baseline | — | — | — | — | 69.73 |
| VLA | 消融 | — | — | — | — | 79.78 |
| LA | 消融 | — | — | — | — | 83.00 |
| LA-VLA | 消融 | — | — | — | — | 86.75 |
| MixPT | 所提方法 | — | — | — | — | 87.53 |
| MINT (2603.08602, Table I) | Diffusion Policy | baseline | 23.1 | 10.7 | 1.9 | 6.1 | 10.5 |
| TinyVLA | baseline | 77.6 | 21.5 | 11.4 | 15.8 | 31.6 |
| π0 | baseline | 77.9 | 51.8 | 53.3 | 20.0 | 50.8 |
| MINT-4B | 本文 | 82.1 | 72.4 | 58.3 | 56.0 | 67.2 |
11. Push-T
共 2 篇(DCDP、DDP-WM)。DCDP 报动态仿真三设置成功率;DDP-WM 报 DINO-WM 框架下 MPC 成功率(单值)。数值均为各论文自报。
| 论文 | 方法 | 原表标注 | 静态 | 恒定扰动 | 随机扰动 |
|---|
| DCDP (2603.01953, Table I) | Open-loop (H=8) | 开环基线 | 88.4 | 58.2 | 52.8 |
| Closed-loop (H=1) | 单步重推理 | 84.6 | 76.1 | 61.6 |
| Temporal Ensemble | 加权平均 | 81.0 | 65.8 | 57.3 |
| DCDP (H=8) | 所提方法 | 92.5 | 77.6 | 71.9 |
| DDP-WM (无 arXiv, Table 1, MPC SR 单值) | DINO-WM | 密集 SOTA 基线 | 91% | — | — |
| DDP-WM | 所提方法 | 98%+ | — | — |
备注:DCDP 推理延迟(ms/step):Open-loop 7.05 / Closed-loop 53.60 / Temporal Ensemble 53.74 / DCDP 7.39(Table II)。DDP-WM 报 MPC 决策提速 ~9.2×。
12. LIBERO-10 / LIBERO-LONG
共 2 篇(UWM、Cosmos3),均为非标准四套件设置(LIBERO-10 / LONG 的具体子任务或快速适应)。数值均为各论文自报。
UWM (2504.02792, LIBERO-10/LONG 5 子任务, 3seed 均值)
| 方法 | 原表标注 | Book-Caddy | Soup-Cheese | Bowl-Drawer | Moka-Moka | Mug-Mug | 平均 |
|---|
| DP | Diffusion Policy | 0.73±0.10 | 0.88±0.02 | 0.77±0.02 | 0.65±0.03 | 0.53±0.05 | 0.71±0.12 |
| PAD | 共享timestep扩散 | 0.78±0.04 | 0.47±0.04 | 0.74±0.05 | 0.59±0.08 | 0.25±0.04 | 0.57±0.19 |
| GR1 | masking token 生成 | 0.77±0.03 | 0.65±0.05 | 0.62±0.03 | 0.46±0.04 | 0.38±0.05 | 0.58±0.14 |
| UWM | 所提方法 | 0.91±0.07 | 0.93±0.01 | 0.80±0.02 | 0.68±0.02 | 0.65±0.01 | 0.79±0.11 |
Cosmos3 (2606.02800, LIBERO(-10) 快速适应, SR%)
| 方法 | 原表标注 | 成功率 |
|---|
| Cosmos3 MT-init (2000 iter) | 所提 | 97.4 |
| Cosmos3 MT-init (500 iter) | 消融 | 24.6 |
| Cosmos3 PT-init (500 iter) | 消融 | 0.0 |
13. LIBERO-90
共 1 篇(KI-VLA,无 arXiv)。LIBERO-90 单策略聚合成功率(0–1)。
| 方法 | 原表标注 | Avg (LIBERO-90 聚合) |
|---|
| OpenVLA-OFT | 自回归离散动作基线 | ~0.50 |
| HybridVLA | 混合离散+连续 | ~0.50 |
| π₀-FAST | 自回归VLA+FAST | 0.73 |
| KI-VLA (Ours) | 知识隔离+co-train | 0.815 |
备注:四子集逐项数字文档为占位,无法提取。
14. LIBERO-Object
共 1 篇(ICLR / Visual Reasoning ICL,2603.07530)。Object 套件的 4 环境 ICL 变体,平均成功率(%)。
| 方法 | 原表标注 | Avg |
|---|
| ICRT | baseline | 44.44 |
| TO (仅推理用推理) | 消融 | 54.00 |
| TD (Teacher Dropout) | 消融 | 54.44 |
| ICLR (Ours Dropout) | 所提方法 | 70.89 |
15. LIBERO-PRO
共 1 篇(VLS,2602.03973)。LIBERO 的 OOD 扰动变体,报 Task 扰动 / Position 扰动 / Overall 平均(%)。
协议提醒:这里不是“LIBERO-PRO 训练后在 LIBERO-PRO 测试”。VLS 使用冻结 base policy 做 training-free 推理时 steering;π0.5-LeRobot ckpt 来源为 huggingface.co/lerobot/pi05_libero_finetuned。测试为 LIBERO 四套件上的 Task / Position 扰动,每任务 20 episodes。
| 方法 | 原表标注 | Task扰动 Avg | Position扰动 Avg | Overall Avg |
|---|
| OpenVLA | | 0.00 | 0.00 | 0.00 |
| π0 | | 0.00 | 0.00 | 0.00 |
| π0.5 | | 0.75 | 20.75 | 10.75 |
| π0.5 (LeRobot) | | 23.13 | 24.25 | 23.69 |
| π0.5 (LeRobot) + VLS | 所提方法 | 38.50 | 35.13 | 36.81 |
16. LIBERO(reasoning/OOD 变体,SEAL)
共 1 篇(DWYS / SEAL,2510.16281v2)。使用 LIBERO 的 reasoning 标注扩展与自建 OOD/Compose 变体,非标准 Spatial/Object/Goal/Long 四分类,按原表设置列出,SR%。
协议提醒:本节同时包含 ID、Compose 和 LIBERO-10 OOD 维度,不能把整节统一看成 IID 或 OOD;模型视图会保留列名并按行/小节标注分布关系。
ID & Compose (Fig. 2a)
| 方法 | 原表标注 | 10-R(ID) | 10-Compose | 100-Basket-R(ID) | Basket-Compose | 100-R(ID) | 100-Compose |
|---|
| π0 | vanilla VLA | 90 | 14 | 85 | 11 | 85 | 16 |
| π0-V-GPS | runtime steering | 92 | 18 | 89 | 13 | 87 | 16 |
| π0-reason | reasoning VLA | 96 | — | 86 | 23 | 89 | 38 |
| SEAL | 所提方法 | 96 | — | 94 | 26 | 97 | 53 |
LIBERO-10 OOD 鲁棒性 (Fig. 4)
| 方法 | 原表标注 | ID | Lang-Rephrase | Lang-Object-Property | Visual-Scene | Visual-Viewpoint |
|---|
| π0 | vanilla VLA | 85 | 73 | 81 | 84 | 28 |
| π0-V-GPS | runtime steering | 87 | 71 | 81 | 83 | 24 |
| π0-reason | reasoning VLA | 89 | 86 | 91 | 91 | — |
| SEAL | 所提方法 | 97 | 95 | 91 | 98 | 45 |
附:VLS(2602.03973) 的 CALVIN 变体(任务组 MovableObjects 94 / ArticulatedParts 87,非 1–5 链长)亦为非标准设置,详见 §20。
17. GenBench
共 1 篇(ActiveVLA,2601.08325)。4 级泛化(16 train + 44 test),SR%。
协议提醒:L1-L4 是泛化等级,不是同一个 IID 测试集;Avg 混合了不同泛化难度。
| 方法 | 原表标注 | L1 | L2 | L3 | L4 | Avg |
|---|
| 3D-LOTUS | 基线 | 90.0 | — | — | — | — |
| ActiveVLA | 所提方法 | 93.4 | 92.4 | 46.3 | 45.1 | 53.1 |
备注:ActiveVLA L1 数值由 "比 3D-LOTUS +3.4pp" 反推(原注)。
18. DexMimicGen
共 1 篇(GR00T-N1,无 arXiv)。灵巧手 10 任务平均,SR%。
| 方法 | 原表标注 | Avg SR |
|---|
| GR00T N1 (2B) | 所提方法 | 72.8 |
19. 真机实验(按论文/平台)
各论文真机平台与任务各异,不合并,每篇一小块。数值均为各论文自报,成功率单位/形式(%、x/N、0–1)保留原文。近似/图估值保留 `~`/`(图估)` 标注。粗体为所提方法。
ACT (2304.13705) — ALOHA 双臂 ViperX(成功率%)
| 方法 | 原表标注 | Slide Ziploc | Slot Battery | Open Cup | Thread Velcro | Prep Tape | Put On Shoe | 平均 |
|---|
| ACT | 每任务50演示 | 92 | 100 | 100 | 96 | 72 | 64 | 87 |
SuSIE (2310.10639) — WidowX 250 / BridgeData V2(成功率)
| 方法 | 原表标注 | Scene A | Scene B(未见) | Scene C |
|---|
| LCBC | 语言条件 BC | — | 0.20 | — |
| RT-2-X | 55B VLA(18×数据) | — | 0.00 | 0.75 |
| SuSIE | 1/18 数据 | 0.87 | 0.50 | 0.88 |
UniPi (2302.00111) — WidowX / BridgeData V2(视频质量+成功率)
| 方法 | 原表标注 | CLIP↑ | FID↓ | FVD↓ | Success↑ |
|---|
| UniPi (No Pretrain) | 无预训练 | 24.43 | 17.75 | 288.02 | 72.6 |
| UniPi (Pretrain) | 14M 视频文本预训练 | 24.83 | 18.45 | 244.66 | 77.1 |
SayCan (2204.01691) — Everyday Robots 移动操作臂(规划/执行 SR%)
| 方法 | 原表标注 | Mock Plan | Mock Exec | Real Plan | Real Exec |
|---|
| No VF | 仅 LLM 打分 | 67 | — | — | — |
| Generative | 生成式 LLM+USE | 74 | — | — | — |
| BC NL | 端到端 BC | — | 0 | — | — |
| SayCan | LLM×价值函数 | 84 | 74 | 81 | 60 |
DiffusionPolicy (2303.04137) — UR5 单臂 / Franka 双臂(20 trials/任务)
| 方法 | 任务 | 成功率 | 副指标(vs人类) |
|---|
| IBC | Push-T | 0% | — |
| LSTM-GMM | Push-T | 20% | — |
| Diffusion Policy | Push-T | 95% | IoU 0.80 vs 0.84 |
| Diffusion Policy | Mug Flip | 90% | — |
| Diffusion Policy | Sauce Pour | 79% | 覆盖率0.74 vs 0.79 |
| Diffusion Policy | Sauce Spread | 100% | 覆盖率0.77 vs 0.79 |
| Diffusion Policy | Egg Beater(双臂) | 55% | — |
| Diffusion Policy | Mat Unrolling(双臂) | 75% | — |
| Diffusion Policy | Shirt Folding(双臂) | 75% | — |
DISCO (2406.09767) — Franka 抓取(20 trials/物体)
| 方法 | 单物体-Seen | 单物体-Unseen | 多物体-Seen | 多物体-Unseen |
|---|
| GoalDiff | 0.10 | 0.00 | 0.05 | 0.00 |
| Vanilla inpt. | 0.55 | 0.15 | 0.30 | 0.05 |
| DISCO | 0.85 | 0.65 | 0.65 | 0.25 |
GHIL-Glue (2410.20018) — Bridge V2 / WidowX250 zero-shot(x/30)
| 方法 | Sushi On Towel | Red Bell Pepper in Bowl | Open Drawer | Sushi in Bowl |
|---|
| OpenVLA (7B) | 22/30 | 14/30 | 23/30 | 15/30 |
| SuSIE | 19/30 | 12/30 | 19/30 | 15/30 |
| GHIL-Glue (SuSIE) | 28/30 | 16/30 | 22/30 | 18/30 |
HATO (2404.16823) — 2×UR5e + 2×Psyonic Ability Hand(10 trials)
| 方法 | 原表标注 | Handover | Stacking | Pouring | Serving |
|---|
| Visuotactile DP | Success | 10/10 | 10/10 | 9/10 | 5/10 |
| Visuotactile DP | Pickup | 10/10 | 10/10 | 10/10 | 10/10 |
(模态/相机消融见 out_01 Table II–IV:w/o Vision 在稀有初始化 0/10;仅第三视角 0/10 等。)
MimicTouch (2310.16917) — peg-in-hole(25 trials)
| 方法 | 原表标注 | 成功率 | ActionMSE |
|---|
| NN-based (本文) | 人手触觉演示 | 40% (10/25) | 0.21 |
| MULSA | 人手触觉演示 | 16% (4/25) | 1.53 |
| NN-based | SpaceMouse遥操作 | 12% | — |
| 人手触觉+RL (本文) | 3h 残差RL微调 | 96% (24/25) | — |
| SpaceMouse+RL | 3h | 32% | — |
| Hand-guided+RL | 3h | 60% | — |
OpenVLA (2406.09246) — Franka-Tabletop(微调/量化对比)
| 方法 | 原表标注 | 成功率 | 训练参数 | VRAM |
|---|
| Full FT | 全量微调 | 69.7 | 7.2B | 163.3 GB |
| Last layer only | 仅最后层 | 30.3 | 465K | 51.4 GB |
| Frozen vision | 冻结视觉 | 47.0 | 6.8B | 156.2 GB |
| Sandwich | — | 62.1 | 914.2M | 64.0 GB |
| LoRA r=32 | — | 68.2 | 97.6M | 59.7 GB |
| bfloat16 | 量化对比 | 71.3 | — | 15 GB |
| int4 | 量化 | 71.9 | — | 7.0 GB |
MS-Bot (2408.01366) — 倒豆误差(g,越小越好) / 键槽装配(表1)
| 方法 | 倒豆·初始90 | 倒豆·初始120 | 倒豆·目标40 | 倒豆·目标60 | 装配成功率 |
|---|
| Concat | 4.80±1.14 | 8.72±2.39 | 8.40±2.21 | 6.54±2.14 | 5/10 |
| Du et al. [63] | 4.32±1.22 | 7.79±2.11 | 8.54±2.04 | 6.26±2.01 | 5/10 |
| MULSA [11] | 3.05±1.01 | 6.42±1.98 | 7.12±1.66 | 4.19±1.24 | 6/10 |
| MS-Bot | 1.60±1.10 | 5.58±1.79 | 6.48±1.55 | 1.80±0.95 | 8/10 |
ViSk (2410.17246) — xArm 7(得分/10, 每配置30次)
| 任务 | Vision-only(最佳) | ViSk(最佳) |
|---|
| Plug Insertion | 3.6 | 6.6 |
| USB Insertion | 2.3 | 5.6 |
| Card Swiping | 3.3 | 7.0 |
| Book Retrieval | 3.3 | 5.3 |
Vid2Robot (2403.12943) — Google Robot(整体 SR)
| 方法 | Robot prompts | Human prompts |
|---|
| BC-Z | 32.9% | 14.5% |
| Vid2Robot | 54.2% | 34.5% |
ViTaL (2024, 无 arXiv) — Franka + GelSight(USB Plugging / Cube Stacking,文中散述)
| 方法 | 原表标注 | 成功率 |
|---|
| Vision-only(无预训练) ACT | USB | 20% |
| Vision-only+预训练 ACT | USB | 45% |
| Vision+Tactile+预训练 ACT | USB | 95% |
| Vision+Tactile+预训练 DP | USB | 95% |
| Vision-only+预训练 ACT | Cube Stacking | 30% |
3D-ViTac (2410.24091) — 双臂遥操作(长horizon 完成率,Table 1)
| 方法 | Egg Cooking | Fruit Prep | Hex Key | Sandwich |
|---|
| PC w/ Tactile Points (Ours) | 0.85 | 0.80 | 0.95 | 0.85 |
(3 基线文档中为定性,填 —。)
AdapTac (2505.13982) — Flexiv Rizon 4 + Leap Hand(Table I)
| 方法 | 原表标注 | Open Box | Reorientation | Flip | Avg |
|---|
| RISE | vision only | 90% | 90% | 40% | 73% |
| 3DTacDex-P | concat | 30% | 60% | 30% | 40% |
| FoAR | threshold | 20% | 90% | 40% | 50% |
| AdapTac (Ours) | — | 100% | 90% | 90% | 93% |
AnyPlace (2502.04531) — 单臂 eye-in-hand RGBD(物体放置)
| 方法 | Insert vial | Hang ring | Stack battery |
|---|
| NSM | 0% | 60% | 0% |
| RPDiff | 0% | 60% | 0% |
| AnyPlace | 80% | 80% | 80% |
ConRFT (2502.05450) — 单臂 + Octo-small VLA(8任务平均)
| 方法 | 原表标注 | 平均成功率 |
|---|
| SFT | 监督微调基线 | 39.4% |
| Cal-ConRFT (仅离线) | — | 39.4% |
| ConRFT | offline+online | 96.3% |
DreamVLA (2507.04447) — Franka Panda(Table 3, pick/place/drawer)
| 方法 | Pick Avg | Place Avg | Drawer Avg | Task Avg |
|---|
| Diffusion Policy | 60.0 | 45.0 | 37.5 | 50.8 |
| Octo-Base | 55.0 | 45.0 | 35.0 | 45.0 |
| OpenVLA | 45.0 | 25.0 | 35.0 | 35.0 |
| DreamVLA | 82.5 | 80.0 | 67.5 | 76.7 |
ContextVLA (2510.04246) — Franka Research 3 / Realman RM-65B(Table 4)
| 任务 | 单帧 baseline | ContextVLA |
|---|
| PnP Twice (full success) | 25 | 65 |
| CoverNStack (partial) | 60 | 80 |
DexNDM (2510.08556) — LEAP Hand in-hand rotation(Palm-Down,Rot,rad)
| 方法 | Regular | Small | Irregular |
|---|
| Direct Transfer | 9.84 | 4.71 | 4.41 |
| DexNDM | 11.36 | 5.24 | 6.35 |
DualActor (2509.13774) — bolt 三阶段(3 tasks avg,Table I)
| 方法 | 原表标注 | Avg Success(%) |
|---|
| HiL-CorRFT [12] | 单任务 RL 微调 | 12 |
| HG-DAgger [18] | BC 修正 | 22 |
| DSRL [20] | latent RL 精修 | 40 |
| DualActor | ours (101min 在线) | 100 |
Motus (2512.13030) — AC-One 单臂(11任务) / Agilex-Aloha-2 双臂(6任务)(部分成功率)
| 方法 | 单臂 部分SR | 双臂 部分SR |
|---|
| π0.5 | 40.60 | 48.60 |
| Motus w/o Pretrain | 67.43 | 49 |
| Motus | 80.48 | 59.30 |
mimic-video (2512.15692) — 双臂灵巧手 Franka×2 + 16-DoF hand
| 方法 | Packing | Package handover |
|---|
| DiT-Block Policy | 11.0 | 50.0 |
| DiT-Block Policy [+wrist cams] | 42.6 | 74.1 |
| mimic-video | 72.0 | 93.0 |
LAPA (2410.11758) — Franka Emika Panda(3任务 Avg SR)
| 方法 | 原表标注 | Avg SR |
|---|
| Scratch | baseline | 21.2 |
| OpenVLA (Open-X) | baseline | 43.9 |
| LAPA (Open-X) | 所提 | 50.1 |
| ACTION VLA (Bridge) | baseline | 32.6 |
| OpenVLA (Bridge) | baseline | 30.8 |
| LAPA (Bridge) | 所提 | 36.8 |
| LAPA (Human Videos) | 所提 | 34.0 |
ForceVLA (2505.22159) — Flexiv Rizon 7-DOF(5 contact-rich 任务)
| 方法 | Insert USB | Insert Plug | Pump Bottle | Wipe Board-1 | Wipe Board-2 | Peel Cucumber | Average |
|---|
| pi0-base w/o F | 45 | 25 | 67 | 25 | 5 | 20 | 37.3 |
| pi0-base w/ F | 45 | 30 | 64 | 25 | 5 | 33 | 40.2 |
| pi0-fast w/o F | 25 | 25 | 60 | 45 | 0 | 31 | 31.0 |
| pi0-fast w/ F | 0 | 0 | 9 | 45 | 0 | 27 | 14.2 |
| ForceVLA | 100 | 80 | 93 | 83 | 10 | 40 | 60.5 |
(泛化实验见 out_02 4.2:ForceVLA Average 63.78。)
OmniVTLA (无 arXiv) — UR5 + 夹爪 / DexH13 灵巧手(pick-and-place SR)
| 方法 | 原表标注 | UR5+夹爪 SR | UR5+DexH13 SR | DP backbone SR |
|---|
| π0 (VLA) | baseline | 75.0 | 93.8 | — |
| VTLA-Pre | 消融 | 84.4 | — | — |
| VTLA-SA | 消融 | 87.5 | — | — |
| DP (视觉) | baseline | — | — | 59.4 |
| DP + 触觉 | 所提 | — | — | 78.1 |
| OmniVTLA | 所提 | 96.9 | 100 | — |
pi0.5 (2504.16054) — 双臂移动操作臂(未见家庭多阶段家务,近似值)
| 方法 | items in drawer | dishes in sink | laundry basket | make bed |
|---|
| π0.5 | ~70 | ~65 | ~55 | ~40 |
baseline 逐任务数值文档未给(原注)。
FACTR (2502.17432) — Franka Panda(4 contact-rich,未见物体泛化)
| 方法 | Box Lift | Pivot | Fruit | Dough | 平均 |
|---|
| ACT (Vision-Only) | 19/60 | 21/50 | 4/15 | 0/10 | 21.3% |
| ACT (Vision+Force) | 35/60 | 38/50 | 11/15 | 7/10 | 61.2% |
| FACTR | 55/60 | 38/50 | 14/15 | 8/10 | 87.5% |
FBI (2508.14441) — Shadow Hand 灵巧手内操作(Table II)
| 方法 | In-hand Reorientation | In-hand Push | Average |
|---|
| DP3 | 10.0 | 25.0 | — |
| ManiCM | 25.0 | 10.0 | — |
| FBI (Vision-Only) | 45.0 | 30.0 | — |
| FBI (Visuotactile) | 45.0 | 20.0 | 35.0 |
FoAR (2411.13753) — Rokae Rizon(contact-rich ASR)
| 方法 | Wiping | Wiping(General) | Peeling |
|---|
| ACT | 0.275 | — | — |
| Diffusion Policy | 0.400 | — | — |
| DiffuseBot | 0.500 | 0.500 | — |
| RISE (force-token) | 0.575 | 0.400 | 0.487 |
| RISE (force-concat) | 0.425 | 0.400 | 0.523 |
| FoAR (3D-cls) | 0.475 | 0.200 | — |
| FoAR | 0.875 | 0.850 | 0.756 |
ICRT (无 arXiv, ICRA 2025) — Franka Panda(Pick-and-Place distractor 泛化)
| 方法 | 1 distractor | 2 distractors | 3 distractors | Average |
|---|
| Goal Condition | 33.3 | 9.7 | 20.0 | — |
| Octo | 30.0 | 13.3 | 5.7 | — |
| OpenVLA | 11.7 | 33.3 | 73.3 | — |
| ICRT | 60.0 | 53.3 | 79.3 | 75.2 |
LVP (2512.15840) — Franka + G1(逐任务成功次数/试验数)
| 方法 | Pick Objects | Pick A into B | Open Drawer | Press Button |
|---|
| OpenVLA | 0/10 | 0/10 | 0/10 | 0/10 |
| pi0 | 3/10 | 1/10 | 1/10 | 0/10 |
| LVP | 5/10 | 3/10 | 2/10 | 4/10 |
MimicDroid (2509.09726) — GR1 人形双臂 few-shot(320k 帧)
| 方法 | L1 | L2 |
|---|
| MimicDroid (128 帧) | 35 | 21 |
| MimicDroid (320k 帧) | 59 | 45 |
pi0.6 / RECAP (无 arXiv) — Café/Box/Laundry(Figure 图读数,正文无精确表)
| 方法 | 关键读数 |
|---|
| RECAP (π₀.6) | Laundry T-shirt ~60%→~90%;Box assembly ~50%→~90%;Espresso 连续运行15h |
π₀ 预训练 / offline RL 基线正文无精确数字。
FAST (2501.09747) — 多真机任务(Figure 6/9/11)
| 方法 | 关键数值 |
|---|
| Naive binning | 高频任务(Table Bussing 20Hz, T-Shirt Folding 50Hz) 0% 成功率 |
| π₀-FAST | 匹配 diffusion π₀,训练省 5× GPU hours;DROID 首个 zero-shot(无精确成功率) |
HiRobot (无 arXiv) — Bimanual ARX, Table Bussing(Instruction Accuracy)
| 方法 | 原表标注 | IA |
|---|
| GPT-4o(高层)+flat VLA | 未微调通用VLM | ~62% |
| Flat VLA with synthetic data | | ~62% |
| Hi Robot without synthetic data | 分层无合成 | ~79% |
| Hi Robot (full) | 层级+合成数据 | 93% |
HumanToRobotVLA (无 arXiv) — 桌面操作(4项泛化平均,图读数)
| 方法 | 平均成功率(4基准) | Eggs 排蛋 |
|---|
| robot-only | ~35% | 57% |
| co-training (human+robot) | ~71% | 平均多放4个蛋 |
KI-VLA (无 arXiv) — static single-arm + mobile manipulator(图占位,无精确数)
| 方法 | 数值 |
|---|
| KI-VLA (Ours) | items in drawer 性能与语言跟随均超所有 baseline(无精确数字) |
RTC (无 arXiv, NeurIPS 2025) — 双臂6-DoF(吞吐 tasks/min)+ Kinetix 仿真(solve rate,图读数)
| 方法 | +0ms | +200ms | Kinetix Solve Rate |
|---|
| Synchronous | ~0.75 | ~0.55 | — |
| TE | — | 停机 | ~0.45 |
| Naive async | — | — | ~0.50 |
| BID | — | — | ~0.60 |
| RTC | ~0.85 | ~0.80 | ~0.70 |
RDP (2503.02881) — Flexiv Rizon 4(整体 All 分数)
| 方法 | Peeling | Wiping | Lifting |
|---|
| DP | 0.44 | — | — |
| DP + tactile emb | 0.48 | — | — |
| DP + tactile img | 0.48 | — | — |
| RDP (GelSight) | 0.71 | 0.95 | 0.93 |
| RDP (MCTac) | 0.63 | 0.94 | — |
| RDP (force) | 0.59 | 0.65 | 0.90 |
RDT-1B (2410.07864) — ALOHA 双臂(成功率%,零/少样本)
| 方法 | Wash Cup(seen/u1/u2) | Pour Water | Handover(5-shot) | Fold Shorts(1-shot) | Robot Dog |
|---|
| ACT | 0/0/0 | 0–12.5 | 0 | 0 | 32 |
| OpenVLA | 0/0/0 | 0–12.5 | — | — | — |
| Octo | 0/0/0 | 0–12.5 | — | — | — |
| RDT-1B | 50/75/50 | 62.5/100/62.5 | 40 | 68 | 48 |
SAM2Act (2501.18564) — Franka Emika Panda(成功试次 ID/OOD,Table 5.4)
| 任务 | RVT-2 (ID/OOD) | SAM2Act (ID/OOD) |
|---|
| Turn on lamp | 0/0 | 6/6 |
| Push buttons | 4/1 | 9/9 |
| Stack cubes | 8/3 | 8/3 |
| Push same button | 4/2 | 7/6 |
| 总计 | 16/6 (43%) | 30/24 (75%) |
SaTA (2510.14647) — RealMan + Sharpa Wave(SR/FC,Table I)
| 方法 | Card Sliding | USB-C Mating | Bulb Install | Avg (SR/FC) |
|---|
| Vision-Only | 50/10 | 0/0 | 45/35 | 31.7/15.0 |
| Tactile-Flat | 60/45 | 0/0 | 70/40 | 43.3/28.3 |
| Tactile-Global | 65/30 | 10/0 | 65/45 | 46.7/25.0 |
| SaTA | 95/55 | 35/30 | 100/60 | 76.7/48.3 |
SparshX (2506.14754) — Franka + Allegro + 4×Digit360(Peg Insertion, Fig.8)
| 方法 | 成功率 |
|---|
| Vision-only | ~0% |
| Sparsh-X (全模态) | ~90% |
STS-IL (2311.01248) — Franka + STS(4门操作,消融相对提升)
| 配置 | 平均成功率变化 |
|---|
| + Tactile Force Matching | +62.5% |
| + Learned Mode Switching | +30.4% |
| + STS 作为策略输入 | +42.5% |
| STS-IL (综合) | +64.2%(最佳配置绝对值 ~85% 估读) |
SwiftVLA (2512.00903) — AgileX PiPER 单臂(SR)
| 方法 | Clean the Desk | Throw the Bottle | Stack Bowls | Avg | Fold the Cloth |
|---|
| SmolVLA | — | — | — | 0.34 | 0.05 |
| π0 | — | — | — | 0.61 | 0.45 |
| SwiftVLA | 0.86 | 0.80 | 0.74 | 0.80 | 0.60 |
| SwiftVLA (4D) | — | — | — | 0.82 | 0.65 |
TacThru (2512.09851) — 改装 UMI + TacThru/GelSight(5任务成功率)
| 方法 | PickBottle | PullTissue | SortBolt | HangScissors | InsertCap | Avg |
|---|
| Wrist | 95% | 40% | 36% | 50% | 55% | 55.4% |
| GS-M | 95% | 50% | 55% | 60% | 55% | 66.3% |
| TT | 100% | 90% | 79% | 60% | 55% | 76.8% |
| TT-M | 100% | 90% | 83% | 80% | 75% | 85.5% |
TactileAloha (无 arXiv, RA-L 2025) — ALOHA 双臂 + GelSight(子任务 SR%,Table I)
| 方法 | Zip Tie G | Zip Tie A | Zip Tie I | Velcro G | Velcro A | Velcro F |
|---|
| Diffusion Policy | 60 | 20 | 0 | 70 | 30 | 15 |
| ACT | 80 | 30 | 5 | 90 | 45 | 30 |
| ACT with Normals | 75 | 35 | 5 | 85 | 40 | 30 |
| ACT with Tactile | 80 | 75 | 25 | 95 | 95 | 85 |
| Ours | 90 | 90 | 35 | 100 | 100 | 90 |
TactileVLA (2507.09160) — Franka Panda(USB/Charger 插入,Table 1)
| 方法 | USB | Charger |
|---|
| π₀-base | 5 | 40 |
| π₀-fast | 0 | 25 |
| Tactile-VLA | 35 | 90 |
TA-VLA (2509.07962) — Cobot Magic ALOHA(接触丰富/常规任务, x/20,Table 5)
| 方法 | 接触丰富(x/20) | 常规(x/20) |
|---|
| ACT | 0 ~ 12 | 12 ~ 16 |
| RDT | 0 ~ 10 | 12 ~ 17 |
| π₀ | 0 ~ 16 | 14 ~ 17 |
| π₀ + obs | 13 ~ 19 | 13 ~ 18 |
| π₀ + obj | 10 ~ 19 | 14 ~ 17 |
| π₀ + obs + obj | 15 ~ 19 | 17 ~ 19 |
可确证:Charger Plugging π₀ 0/20 → 17/20;Door Handle Turning 0/20 → 15/20。
TiW (2507.15062) — XArm 850 + 柔性压阻触觉阵列(20 试验/任务)
| 任务 | Vision-Only | 完整方法(w/ Pretraining) |
|---|
| Test Tube Collection | 25 | 85 |
| Pencil Insertion | 45 | 85 |
| Fluid Transfer | 55 | 90 |
| Whiteboard Erasing | 55 | 70 |
TLA (2503.08548) — GelStereo 2.0 + 夹爪(peg 插入,Table III/IV)
| 方法 | 总成功率(%) | 总平均步数 |
|---|
| BC | 31 | 3.68 |
| DP | 40 | 3.83 |
| SP-TLA | 88 | 3.76 |
| MP-TLA | 90 | 3.56 |
UniSkill (2505.08787) — Franka Panda 桌面(5任务)
| 方法 | Franka prompt | Human prompt |
|---|
| GCBC | 60 | 61 |
| XSkill | 11 | 0 |
| UniSkill | 83 | 81 |
(厨房基准 Franka/Human/Anubis prompt:GCBC 33/33/33;UniSkill 87/54/48。)
UniT (2408.06481) — ALOHA 双臂模仿学习(成功次数,Table V)
| 方法 | Chicken Legs Hanging | Chips Grasping | Allen Key Insertion |
|---|
| Vision-Only | 9/15 | 8/15 | 15/30 |
| Visual-Tactile (from Scratch) | — | — | 17/30 |
| UniT (Visual-Tactile) | 13/15 | 14/15 | 23/30 |
UWM (2504.02792) — DROID / Franka Panda(成功率,a→b = pretrain→co-train,ID/OOD)
| 方法 | Stack-Bowls | Block-Cabinet | Paper-Towel | Hang-Towel | Rice-Cooker |
|---|
| Diffusion Policy | 0.48/0.36 | 0.60/0.26 | 0.52/0.48 | 0.64/0.28 | 0.35/— |
| PAD | 0.08→0.20/0.08→0.12 | 0.00→0.00/0.00→0.00 | 0.42→0.42/0.34→0.44 | 0.52→0.54/0.30→0.38 | 0.00/0.00 |
| GR1 | 0.66→0.62/0.48→0.38 | 0.66→0.74/0.44→0.64 | 0.60→0.46/0.60→0.46 | 0.66→0.66/0.48→0.44 | 0.40/0.25 |
| UWM | 0.86→0.92/0.76→0.84 | 0.76→0.84/0.60→0.72 | 0.78→0.86/0.78→0.84 | 0.82→0.86/0.64→0.76 | 0.60/0.65 |
ViTacFormer (2506.15953) — Realman 双臂 + SharpaWave(短horizon,次/10,Table 1)
| 方法 | Peg Insertion | Cap Twist | Vase Wipe | Book Flip |
|---|
| DP | 2/10 | 0/10 | 3/10 | 1/10 |
| ACT | 4/10 | 4/10 | 3/10 | 2/10 |
| HATO | 3/10 | 1/10 | 4/10 | 3/10 |
| ACTw/T | 6/10 | 6/10 | 4/10 | 4/10 |
| ViTacFormer | 10/10 | 10/10 | 9/10 | 9/10 |
(长horizon 做汉堡 11阶段 HNS:w/o Touch 0.61;ViTacFormer 0.88。)
ViTaLPrecise / ViTaL (2506.13762) — xArm 7 + AnySkin(In-domain,次/10,Table 1)
| 方法 | Plug Socket | USB Insert | Card Swipe | Key Lock | Pick Bread |
|---|
| BAKU | 4/10 | 4/10 | 1/10 | 5/10 | 10/10 |
| ViSK | 7/10 | 3/10 | 4/10 | 5/10 | 10/10 |
| RLPD | 3/10 | 0/10 | 2/10 | 1/10 | 10/10 |
| ViTaL-BC | 7/10 | 4/10 | 5/10 | 5/10 | 10/10 |
| ViTaL | 9/10 | 9/10 | 10/10 | 9/10 | 10/10 |
ViTaMIn (2504.06156) — Rokae xMate ER3PRO + AllTact(5任务,20 trials,Table II)
| 任务 | Vision-only | w/o Pre-training | Ours (Full) |
|---|
| Orange Placement | 0.65 | — | 0.90 |
| Test Tube Reorientation | 0.40 | 0.70 | 0.70 |
| Dynamic Peg Insertion | 0.10 | 0.45 | 0.85 |
| Scissor Hanging | 0.10 | 0.45 | 0.70 |
| Knife Pulling (双臂) | 0.60 | 0.80 | — |
V-JEPA2 (2506.09085) — Franka Emika Panda 零样本(Avg)
| 方法 | Grasp Reach | Grasp Cup | Grasp Box | Reach w/ Obj | Pick-&-Place |
|---|
| Octo | 100% | 13% | 0% | 13%/70% | 13%/10% |
| V-JEPA2-AC | 100% | 63% | 73% | 23%/80% | 63% |
VTInsertion (无 arXiv, RA-L 2025) — Kinova Gen3 + OpenHand + AllSight(11物体,成功率范围)
| 方法 | 成功率范围 |
|---|
| Teacher | ~92.4% (仿真, 上界) |
| Visual-PCL | 55–80% |
| Visuotactile | 80–95%(训练物体) / 75–90%(新物体) |
VTLA (2505.09577) — UR3 + GelStereo 2.0 Sim2Real 零样本(peg-in-hole,20 trials)
| 设置 | 成功率 | 平均步数 |
|---|
| VTLA (方形 1.6mm) | 100% | 1.60 |
| VTLA (方形 1.0mm) | 100% | 1.95 |
| VTLA (方形 0.6mm) | 95% | 4.31 |
| VTLA (三角 0.6mm) | 95% | 3.94 |
| VTLA (五边 0.6mm) | 100% | 1.85 |
| VTLA (OOD 五边 0.6mm) | 100% | 5.20 |
| VLA (无触觉, 三角0.6mm) | 90% | 4.06 |
| TLA (无视觉, 三角0.6mm) | 30% | 2.00 |
VT-Refine (无 arXiv, RSS 2025 WS) — 双 Franka + 3D-ViTac(plug-socket 装配)
| 方法 | Tabletop | Bimanual |
|---|
| Vision-Only (Pre-Train) | 0.20/0.35 | — |
| Vision-Only + Fine-Tune | 0.65 | — |
| Visuo-Tactile (Pre-Train) | 0.40/0.50 | — |
| Visuo-Tactile + Fine-Tune | 0.80 | 0.75 |
VT-TermRL (无 arXiv, Frontiers 2025) — Franka + XENSE G1-WS(PLC 终端装配,100 随机位姿)
| 方法 | 成功率 | 训练时间 | 示范数 |
|---|
| RLPD+VT (Ours) | 100/100 | 55 min | 30 |
| RLPD w/o demo | 32/100 | 265 min | 0 |
| BC | 9/100 | 105 min | 150 |
| TD3 | 0/100 | 285 min | 0 |
AdaVTF (2604.01414) — Franka Panda + 关节力矩(3接触任务,Table I)
| 方法 | Egg Boiler | Bottle | Connector | 平均 |
|---|
| Vision-only | 8/20 | 7/20 | 12/20 | 30.9% |
| Feature Concat | 3/20 | 9/10 | 12/20 | 53.3% |
| Torque Gating | 14/20 | 5/10 | 15/20 | <1% |
| Auxiliary Goals | 8/20 | 1/10 | 7/20 | 28.6% |
| MoE | 5/20 | 1/10 | 11/20 | 24.0% |
| MoE w/o torque enc | 18/20 | 1/10 | 11/20 | 54.0% |
| Ours | 6/20 | 8/10 | 19/20 | 82% |
原表"平均"列为作者加权平均,Torque Gating 的 <1% 保留原文标注。
AHEAD (2606.02486) — UFactory xArm 7(5动态任务,Table 4)
| 方法 | 传送带(静→移) | 传送带(移→静) | 球拍打球 | 停滚球 | 接抛射物 |
|---|
| AHEAD | 30/30 | 29/30 | 23/30 | 30/30 | 19/30 |
| 所有 baseline | — | — | — | — | 0/30 |
ARRO (无 arXiv, RA-L 2026) — FR3 域偏移评测(成功/相对性能,Table I/Fig.6-7)
| 方法/设置 | 成功率 |
|---|
| real-to-real vanilla (DP) | 90% |
| real-to-real vanilla (Octo) | 50% |
| real-to-real vanilla (OpenVLA) | 40% |
| real-to-real vanilla (π0) | 100% |
| real-to-sim vanilla (OpenVLA) | 0% |
| real-to-sim ARRO (OpenVLA) | 55% |
| real-to-sim masking (π0) | 94% |
| π0 语言引导 vanilla / Masked / ARRO | 30% / 70% / 90% |
AT-VLA (2605.07308) — AgBot Genie1 双臂(4接触任务,Table 1)
| 方法 | Unzip Bag | Stamp | AVG(contact) |
|---|
| GO-1 | 0.20 | 0.13 | 0.22 |
| τ0.5 | 0.20 | 0.20 | 0.13 |
| VTLA | 0.00 | 0.13 | 0.13 |
| RDP | — | 0.40 | 0.40 |
| AT-VLA | 0.33 | 0.46 | 0.50 |
(非接触任务 Pick&Place/Open Drawer:GO-1 与 AT-VLA 均 0.93/0.87。)
CRAFT (2602.12532) — leader-follower 双臂(Table I/II)
| 方法 | Wipe Whiteboard | Shaft-to-Hole | 平均/相对 |
|---|
| π0-base | 13.5% | — | 基线 |
| π0-base + CRAFT | 66.7% | — | +35.36pp |
| RDT | — | 8.5% | 22.66% |
| RDT + CRAFT | — | 38.1% | 48.32% |
| 泛化: 基线 VLA → +CRAFT | — | — | 22.50% → 88.75% |
DECO (2602.05513) — Unitree H1-2 双臂灵巧手(4场景,Table 1)
| 方法 | 全任务平均 | 接触密集任务平均 |
|---|
| ACT | 57.25% | 19.38% |
| DP | 51.25% | 28.13% |
| DPt | 56.75% | 33.13% |
| DECO (无触觉) | 72.25% | 53.13% |
| DECO_p (+触觉adapter) | 82.50% | 73.13% |
DIAL (无 arXiv) — IRON-R01-1.11 人形(跨体学习)
| 方法 | ID SR | OOD SR |
|---|
| GR00T-Qwen2.5 | 17.5 | ~0 |
| GR00T-Qwen2.5 +FLARE | 50.0 | — |
| DIAL 去人类数据 | 55.0 | 26.7 |
| DIAL | 77.5 | 58.3 |
DeFI (无 arXiv) — Franka Panda(8 tasks,成功率%)
| 方法 | Place | Open | Close | Cut | Stack Bowl | Stack Cube | Stack Bottle | Pour | Avg |
|---|
| DeFI | 90 | 75 | 100 | 80 | 80 | 70 | 80 | 75 | 81.3 |
| DP | 70 | 40 | 70 | 50 | 45 | 35 | 40 | 35 | 48.2 |
| OpenVLA | 50 | 40 | 65 | 40 | 30 | 35 | 45 | 45 | 43.8 |
DiT4DiT (2603.10448) — Unitree G1 人形(7任务,成功率%)
| 方法 | Arrange Flower | Stack Cup | Move Spoon | Drawer | Box Packing |
|---|
| DiT4DiT | 75 | 60 | 40 | 90 | 50 |
| GR00T-N1.5 | 25 | 25 | 15 | — | — |
| Qwen3DiT | 0 | <10 | <10 | 0 | 0 |
DiffusionVS (2606.19397) — AUBO-i5 视觉伺服(30 trials)
| 方法 | SR(%) | TE(cm) | RE(°) |
|---|
| Regression | 0 | – | – |
| Diffusion (Ours) | 93.3 | 6.17 | 3.76 |
DreamTac (2606.08737) — Franka Panda + Xeno Photon(6接触任务平均)
| 方法 | 平均成功率 |
|---|
| π1 | 15.4% |
| Common Policy | 31.6% |
| ForceVLA | 68.7% |
| Dream-Tac | 83.3% |
DreamTacVLA (无 arXiv) — Dobot X-Trainer 双臂 + GelSight(100 trials/task,Table 1)
| 方法 | Peg-in-Hole | USB Insert | Gear Assembly | Tool Stabilization | Avg |
|---|
| ACT | — | — | — | — | 35.2 |
| Diffusion Policy | — | — | — | — | 35.5 |
| π₀ | — | — | — | — | 45.7 |
| No HSA, Dream-Only | — | — | — | — | 75.4 |
| HSA-Only, No Dream | — | — | — | — | 60.8 |
| DreamTacVLA | 95.0±0.2 | 85.7±0.6 | 81.1±0.4 | 74.6±0.5 | 95.0 |
(IsaacSim 数字孪生 Table 4:DreamTacVLA 98.6/97.9/95.2/94.7。)
DreamZero (无 arXiv) — AgiBot G1 / DROID-Franka(Task Progress %,Fig.8/9)
| 方法 | Seen Tasks | Unseen Tasks | DROID TP / SR |
|---|
| GR00T N1.6 / π0.5 (scratch) | 27.4 | <1 | — |
| pretrained VLA | 27.4 | 16.3 | — |
| DreamZero (WAM) | 62.2 | 39.5 | 49 / 22.5 |
(跨具身:Robot-to-robot 54.3、Human-to-robot 55.4。)
EDIL (无 arXiv, IEEE TII) — 2×RealMan 6-DOF 双臂(SR%)
| 方法 | AirPods All | AirPods Avg | iWatch All | iWatch Avg |
|---|
| ACT | 16 | 38.4 | 16 | 42.4 |
| InterACT | 28 | 50.4 | 20 | 47.2 |
| EDIL | 52 | 65.6 | 40 | 64.8 |
Ego-Pi (2506.03071) — Galaxea R1 Pro 双臂灵巧手(SR%)
| 方法 | 番茄分拣 | 装箱 | 包装 |
|---|
| 纯机器人数据 | 40 | 25 | 30 |
| 简单 co-train | 92 | 72 | 76 |
| + Subtask | 92 | 85 | 90 |
| Ego-Pi (+ Skeleton) | 96 | 90 | 96 |
EgoScale (无 arXiv) — Galaxea R1Pro 22-DoF 灵巧手(Task Completion)
| 方法 | 平均完成率 |
|---|
| 无预训练 (from-scratch) | ~0.30 |
| EgoScale (20K h) | ~0.71 |
(one-shot:Fold Shirt 0.85、Unscrew Bottle 0.92;跨具身 Unitree G1:Pen in Bin 0.88、Dish in Rack 0.50。)
FAVLA (无 arXiv, ICML 2026) — Moto 单臂 + 6轴力传感器(SR%,Table 1)
| 方法 | USB Insertion | Gear Assembly | Board Wiping | Avg |
|---|
| π₀ | — | — | — | 43.7 |
| ForceVLA | — | — | — | 66.7 |
| FAVLA | 85 | 80 | 75 | 80.5 |
π₀≈43.7、ForceVLA≈66.7 为反推值(原注)。
FG-CLTP (无 arXiv) — Insta Y1 + 双 DM-Tac M(SR%,Table IV)
| 方法 | Tube Insertion | Wipe Board | Handwriting |
|---|
| ACT | 45.9 | 65.0 | 45.9 |
| DP | 75.0 | 65.0 | 50.0 |
| 3D-TLA (FG-CLTP) | 85.9 | 75.9 | 60.0 |
ForceVLA2 (2603.15169) — Flexiv Rizon 4s + 6D力传感器(SR%,Table 1)
| 方法 | Press bottle | Clean vase | Clean board | Retrieve plate | Assemble gears | Avg |
|---|
| π0 | 35.0 | 20.0 | 35.0 | 0.0 | 0.0 | 18.0 |
| π0.5 | 45.0 | 30.0 | 45.0 | 15.0 | 20.0 | 31.0 |
| ACP | 25.0 | 30.0 | 25.0 | 0.0 | 0.0 | 16.0 |
| π0 w/ F | 30.0 | 25.0 | 20.0 | 10.0 | 0.0 | 17.0 |
| ForceVLA | 70.0 | 25.0 | 55.0 | 15.0 | 10.0 | 35.0 |
| ForceVLA2 | 80.0 | 75.0 | 70.0 | 35.0 | 70.0 | 66.0 |
ForeAct (2602.12322) — Galaxea R1 Lite(11任务平均 SR%)
| 方法 | π0 backbone | π0.5 backbone |
|---|
| π0 / π0.5 | 46.7 | 70.3 |
| VLM + π0 | 57.1 | — |
| ForeAct | 87.4 | 88.2 |
G0.5 (无 arXiv) — R1-Lite / R1-Pro(6设定平均)
| 方法 | Avg SR | Process Score |
|---|
| GR00T-N1.7 | 24.4 | 68.9 |
| π0.5 | 53.3 | 105.2 |
| G0.5 | 76.7 | 129.2 |
(G0.5 另报 BEHAVIOR-1K 31.4 / DROID 零样本 82.5,见 §20。)
GigaBrain-0.5M* (2602.12099) — RoboChallenge(30任务,20台真机,SR%)
| 方法 | Avg |
|---|
| π0.5 | 42.67 |
| GigaBrain-0.1 (中间版) | 51.67 |
(内部评估 Juice Prep:GigaBrain-0 90 → GigaBrain-0.5 100。)
GigaWorld-Policy (2603.17240) — AgileX PiPER(4任务真机 SR)
| 方法 | 真机 SR |
|---|
| Cosmos-Policy | 0.58 |
| GigaBrain-0 | 0.68 |
| π0.5 | 0.69 |
| Motus | 0.76 |
| GigaWorld-Policy | 0.83 |
Goal-VLA (2506.23919) — UFACTORY xArm 7(4任务 SR%)
| 方法 | Tomato Placement | Table Sweeping | Weighing Duck | Bottle Stand-Up | Avg |
|---|
| OpenVLA | 0 | 0 | 0 | 0 | 0 |
| MOKA | 50 | 10 | 30 | 0 | 22.5 |
| MolmoAct | 50 | 0 | 60 | 0 | 27.5 |
| Goal-VLA | 90 | 40 | 70 | 40 | 60.0 |
HapTile (2606.04825) — UR5e + Robotiq 2F-85 + 定制触觉(模态消融 SR%,Table 2)
| 方法 | 原表标注 | Turning bottle | Wiping whiteboard | Pouring liquid | Peg insertion |
|---|
| Diffusion Policy | V-only | 80 | 80 | 40 | 40 |
| Diffusion Policy | V+T | 80 | 80 | — | 90 |
| Diffusion Policy | V+TM | 90 | 50 | — | — |
| Diffusion Policy | V+T+TM | 60 | 50 | 0 | 60 |
| π0 | V-only | 0 | 0 | — | 0 |
| π0 | V+T | 65 | 0 | — | — |
| π0 | V+TM | — | 100 | — | — |
数据集论文,多处配置未测试填 —,按原表登记。
HTD (2604.13015) — 全身人形 + 双灵巧手触觉(5任务,Table II/Fig 6)
| 方法 | Insert-T |
|---|
| ACT (Visual+Proprio+Touch) | 50.0 |
| HTD | 93.3 |
HumanEgo (2605.24934) — Trossen WidowX AI 双臂(4任务 SR%)
| 方法 | Serve Bread | Downstack Cups | Water Flowers | Adjust Table | 平均 |
|---|
| EgoZero | 5.0 | 0.0 | 10.0 | 0.0 | 3.8 |
| SPOT | 45.0 | 35.0 | 47.5 | 45.0 | 43.1 |
| ACT (Robot Teleop 30min) | 62.5 | 45.0 | 45.0 | 52.5 | 51.2 |
| HumanEgo-15 | 82.5 | 75.0 | 75.0 | 67.5 | 75.0 |
| HumanEgo-30 | 95.0 | 87.5 | 95.0 | 92.5 | 92.5 |
ICLR (2603.07530) — Franka Research 3(SR%,Table II)
| 方法 | Pick-and-Place | Poking |
|---|
| ICRT | 48.33 | 25 |
| ICLR (Ours Dropout) | 56.67 | 70 |
InSight (2606.24884) — UFactory xArm(25 trials,主结果)
| 方法 | Twist Cap Open | Pour Beans | Twist-then-Pour(14 prim) |
|---|
| π0.5 (base) | 0 | 0 | — |
| CaP-X | 32 | 16 | 4 |
| InSight | 92 | 96 | 80 |
LA4VLA (2606.27295) — xArm6(3语言条件任务,20 trials,Table 5)
| 方法 | Press Button | Place Book | Place Drink | Avg |
|---|
| No pretrain | 60.0 | 15.0 | 40.0 | 38.3 |
| VLA | 50.0 | 40.0 | 55.0 | 48.3 |
| LA | 85.0 | 65.0 | 95.0 | 81.7 |
| MixPT | 75.0 | 85.0 | 90.0 | 83.3 |
LingBot-VLA (2601.18692) — GM-100(100任务×3平台,SR/PS %,Table 1)
| 方法 | Agibot G1 SR | AgileX SR | Galaxea R1Pro SR | Avg SR | Avg PS |
|---|
| WALL-OSS | 2.99 | 2.26 | 6.89 | 4.05 | 10.35 |
| GR00T N1.6 | 5.23 | 3.20 | 14.29 | 7.59 | 15.99 |
| Ours w/o depth | 12.82 | 15.50 | 14.95 | 15.74 | 33.69 |
| Ours w/ depth | 30.47 | 36.30 | 32.46 | 35.41 | — |
OASIS (2605.25829) — Franka Research 3 + Kinova Gen3(SR%,Table 4)
| 方法 | Goal | Spatial | Long | Avg |
|---|
| ACT | 58.3 | 45.0 | 18.3 | 40.5 |
| Seer-Large | 73.3 | 55.2 | 46.7 | 58.4 |
| RDT | 81.7 | 66.7 | 60.0 | 69.5 |
| π0.5 | 95.0 | 78.3 | 71.6 | 81.6 |
| OASIS | 98.6 | 85.8 | 83.3 | 89.2 |
OmniVTA (无 arXiv) — xArm7 视触觉(6类70+任务,O+G 平均 SR%,Table III)
| 方法 | Avg SR (O+G) |
|---|
| ACT | 65.3 |
| KineDex | 64.0 |
| ForceMimic | 64.8 |
| DP+tactile | 73.8 |
| OmniVTA | 83.5 |
PACE (无 arXiv, CoRL 2026 投稿) — Realman RM75 插入(成功数/30,Table 1a)
| 方法 | Key | 2-pin | 3-pin | USB | Eth | Avg(%) |
|---|
| Vision-only ACT | 4/30 | 4/30 | 2/30 | 1/30 | 4/30 | 10.0 |
| Vision-only DP | 5/30 | 6/30 | 4/30 | 3/30 | 5/30 | 15.3 |
| ACT + Tactile Cross-Attn | 10/30 | 15/30 | 11/30 | 9/30 | 14/30 | 39.3 |
| ACT + Tactile Concat | 13/30 | 17/30 | 15/30 | 13/30 | 14/30 | 48.0 |
| PACE | 27/30 | 28/30 | 28/30 | 27/30 | 25/30 | 90.7 |
Qwen-RobotManip (无 arXiv) — CobotMagic ALOHA(ID 成功数/5,Table 10)
| 方法 | table-cleanup | three-bowl-stacking | melon-in-bowl | towel-folding | block-in-drawer | yellow-disc-insertion | three-block-stacking | Avg(%) |
|---|
| π0.5 | 4/5 | 5/5 | 2/5 | 4/5 | 0/5 | 0/5 | 0/5 | 42.9 |
| StarVLA | 0/5 | 4/5 | 0/5 | 3/5 | 0/5 | 0/5 | 0/5 | 20.0 |
| Qwen-RobotManip | 5/5 | 5/5 | 5/5 | 4/5 | 5/5 | 2/5 | 5/5 | 88.6 |
(OOD Table 11:π0.5 37.5、StarVLA 0.0、Qwen-RobotManip 87.5;RoboChallenge Table30-v1 Table 14:Qwen-RobotManip 成功率45 / process 59.83。)
Qwen-VLA (2605.30280) — ALOHA(平均 SR%)
| 方法 | In-domain Avg | OOD Avg |
|---|
| GR00T N1.6 | 28.6 | — |
| π0.5 | 71.6 | 41.5 |
| Qwen-VLA | 83.6 | 76.9 |
REMAC (2601.20130) — Franka Research 3(DROID grasp-and-place 完成进度)
| 方法 | Grasp-Easy | Grasp-Medium | Grasp-Hard |
|---|
| Synchronous | 0.805 | 0.718 | 0.670 |
| RTC | 0.823 | 0.848 | 0.753 |
| REMAC | 0.903 | 0.943 | 0.812 |
ReTac-ACT (无 arXiv) — Realman RM75-6F(NIST ATB M1 轴孔装配,SR%)
| 方法 | 0.1mm 间隙 | Level 2 |
|---|
| DP | 0 | — |
| pi0 | 0 | — |
| ACT | 15 | — |
| ReTac-ACT | 80 | 100 |
RISE-WM (2602.11075) — AgiBot 双臂(3任务 成功率/评分,Table I)
| 方法 | Brick Sorting | Backpack | Box Closing |
|---|
| π0.5 | 35.00 / 8.28 | 30.00 / 4.25 | 35.00 / 7.50 |
| +ε-Dagger | 15.00 / 6.19 | 30.00 / 7.00 | 40.00 / 7.50 |
| +PPO | 10.00 / 7.68 | 35.00 / 5.88 | 10.00 / 4.75 |
| +DSRL | 10.00 / 6.65 | 10.00 / 3.50 | 10.00 / 4.75 |
| RECAP | 50.00 / 9.00 | 40.00 / 6.13 | 60.00 / 8.13 |
| RISE (Ours) | 85.00 / 9.78 | 85.00 / 9.50 | 95.00 / 9.88 |
SeeingToDoing / FSD (2505.08548) — xArm 6(8任务平均 SR%)
SelectivePerception (2602.15543) — 6-DoF 单臂多模态(3任务 SR%)
| 方法 | Task1(电池) | Task2(线缆) | Task3(阀门) | Avg |
|---|
| Base Policy (仅RGB) | — | — | — | 10.0 |
| w/ Multimodal (无路由器) | — | — | — | 30.69 |
| w/ Router (本文) | 90.0 | 90.0 | 70.0 | 83.33 |
SynthICL (arXiv 2026.06) — Franka Research 3(16任务平均 SR%)
| 方法 | Avg |
|---|
| ICRT | 55 |
| IP (Instant Policy) | 57 |
| SynthICL (full) | 77 |
TacFiLM (2603.14604) — Franka Panda + DIGIT(ID 任务 SR%)
| 方法 | Circle-Peg 3mm | Circle-Peg 2mm | USB Cable |
|---|
| OpenVLA-OFT | 73.33 | 53.33 | 50 |
| TactileConcat | 86.67 | 53.33 | 66.67 |
| TacFiLM | 93.33 | 63.33 | 83.33 |
(OOD:Square-Peg 2mm TacFiLM 100、Pentagon-Peg 93.33、HDMI 80。)
TacForeSight (2606.11184) — xArm7 + Robotiq + 双指Xene触觉 + F/T(5类接触任务,平均完成率%,Table I)
| 方法 | 平均完成率 |
|---|
| DP | 30 |
| DP+Tactile+Force | 38 |
| KineDex | 35 |
| FoaR | 50 |
| RDP | 65 |
| TacForeSight | 79.0 |
TacVLA (2603.12665v1) — Franka Panda + 15×8 触觉阵列(SR%,Table II)
| 方法 | Disassembly Avg | In-Box Picking |
|---|
| 3D Diffusion Policy + Tactile | 11.25 | 5 |
| Diffusion Policy + Tactile | 48.75 | 0 |
| Finetuned Pi0.5 | 63.75 | 10 |
| TacVLA | 83.75 | 70 |
TacVLA2 (2603.12665v2) — Franka Panda(同论文 v2,SR%,Table II)
| 方法 | 拆卸平均 | 装箱 |
|---|
| 3D Diffusion Policy + Tactile | — | 5 |
| Diffusion Policy + Tactile | — | 45 |
| Finetuned Pi0.5 | 63.75 | 10 |
| TacVLA | 83.75 | 70 |
TaF-VLA (2601.20321) — Franka FR3 + VBTS/GelSight + ATI Axia80(8任务平均 SR%,Table I)
| 方法 | 平均成功率 |
|---|
| ACT | 26.7 |
| DP | 29.5 |
| pi0.5 | 37.1 |
| FreeTacMan | 42.8 |
| DP + TaF-Adapter | 44.7 |
| ACT + TaF-Adapter | 47.6 |
| TaF-VLA | 64.8 |
τ₀-WM (2605, 未标全ID) — AGIBOT-G01/ARX/dual-arm Franka(Test-Time Computation 消融,成功率)
| 方法 | Time→Box | Pin→Box | Avg |
|---|
| w/o TTC | 0.55 | 0.50 | 0.43 |
| + CFG | 0.25 | 0.15 | 0.30 |
| + ACG | 0.40 | 0.15 | 0.38 |
| + RCS | 0.65 | 0.35 | 0.50 |
| + RCS + LAR | 0.76 | 0.50 | 0.60 |
主对比表为条形图估读,τ₀-WM 标注为"最优"无精确数字,主结果填 —(原注)。
TouchGuide (无 arXiv) — Bi-Arx5 双臂 + Flexiv Rizon4(5任务平均 SR%,Table I)
| 方法 | DP3 base 平均 | π0.5 base 平均 |
|---|
| Diffusion Policy (base) | 16.3 | 35.9 |
| DP w/ Tactile Observation | 19.2 | — |
| TouchGuide (Force) | 35.3 | — |
| TouchGuide (Tactile Img.) | 36.2 | 58.0 |
T-Rex (2606.17055) — Dexmate Vega-1 双臂 + Sharpa Wave 22-DoF×2(12任务平均 SR%,Table 1)
| 方法 | Avg |
|---|
| ViTacFormer | 3 |
| RDP | 6 |
| π0.5 + tactile | 6 |
| Tactile-VLA | 15 |
| π0.5 | 17 |
| EgoScale | 35 |
| T-Rex | 65 |
UniDex (2603.22264) — Franka + Inspire/Wuji/Oymotion 灵巧手(5工具使用任务,SR%)
| 方法 | Average Task Progress | Final Success Rate |
|---|
| DP | 29.0 | 22.0 |
| DP3 | 35.0 | 30.0 |
| pi_0 | 38.0 | 35.0 |
| UniDex-VLA (No Pretrain) | 32.5 | 23.0 |
| UniDex-VLA | 81.0 | 76.0 |
UniVTAC (无 arXiv) — Franka/Taoxy + GelSight/ViTa sim-to-real(纯仿真训练直迁,SR%,Table IV)
| 方法 | Insert USB | Insert Tube | Bottle Upright |
|---|
| ACT + UniVTAC Encoder | 85.0 | 55.0 | 60.0 |
VERA (2605.27817) — Franka Panda(Fig.6,SR%)
| 方法 | Push/Pick(Basic) | Occlusion(Hidden Button) | Location-based | Semantic-based |
|---|
| π0.5 | 30 | 0 | 0 | 0 |
| DreamZero | 90 | 0 | 0 | 0 |
| VERA | 60 | 80 | 60 | — |
(仿真闭环 Table 1 见 §20。)
ViTaL-Steering (2606.14981) — Franka + GelSight Mini(3任务整体 SR%,图估)
| 方法 | Wiping | Insertion | Pipette | Avg |
|---|
| Base Policy | ~40 | ~35 | ~25 | ~33 |
| Visual Lookahead(16步) | ~60 | ~55 | ~45 | ~53 |
| Tactile Sampling | ~50 | ~40 | ~35 | ~42 |
| Tactile Guidance | ~55 | ~45 | ~40 | ~47 |
| Naive Combination | ~60 | ~50 | ~40 | ~50 |
| ViTaL (Ours) | ~85 | ~75 | ~70 | ~77 |
ViTaS (2602.11643) — Galaxea R1 双臂 + 3D-ViTac(3任务 SR%,Table IV)
| 方法 | Dual Arm Clean | Table Pick Place(TPP-1) | Fridge Pick Place |
|---|
| DP | 20 | 72 | 76 |
| ViTaS | 90 | 94 | 90 |
VLA-Touch (无 arXiv, RA-L 2026) — Franka Panda + GelSight Mini(完整任务 SR%,Table I)
| 方法 | Full Cup | Full Wipe | Full Peel |
|---|
| RDT | 30 | 46.2 | 30 |
| RDT+Tactile | 34 | 31 | 34 |
| RDT+Residual Controller | 44 | 38.6 | 44 |
| VLA-Touch (Interpolant) | 46 | 64 | 46 |
原表 Full Cup/Full Peel 数值疑似转录重复,保留原样。
VLAW (2602.12063) — Franka/DROID(5任务成功率,Table 2)
| 方法 | Stacking | Wiping | Open Book | Scooping | Drawing | Mean |
|---|
| Base model (π0.5) | 0.62 | 0.46 | 0.56 | 0.44 | 0.22 | 0.460 |
| DSRL | 0.70 | 0.40 | 0.50 | 0.60 | 0.30 | 0.500 |
| Filtered BC-1 | 0.80 | 0.42 | 0.72 | 0.64 | 0.46 | 0.608 |
| Filtered BC-2 | 0.88 | 0.76 | 0.82 | 0.74 | 0.56 | 0.752 |
| Ours-1 | 0.80 | 0.80 | 0.80 | 0.72 | 0.60 | 0.744 |
| Ours-2 | 0.92 | 0.86 | 0.86 | 0.92 | 0.78 | 0.868 |
VLS (2602.03973) — Franka 单臂(Fig.5,SR%)
| 方法 | In-Distribution | 物体OOD(mug替换) |
|---|
| baseline | 50 | 0 |
| VLS | 69 | 40 |
VTAM (2603.23481) — xArm6 + GelSight Mini(主实验 SR%,Table 1)
| 方法 | Chip Pick-and-Place | Cucumber Peeling | Whiteboard Wiping |
|---|
| Genie Envisioner (GE) | 0 | 0 | 2.5 |
| π₀.₅ (Vision-Only) | 10 | 0 | 0 |
| π₀.₅ + Naive Tactile | 5 | 0 | 0 |
| VTAM | 90 | 85 | 95 |
VTWM (2602.06001) — Franka + Digit 360(新任务迁移,20 demos,SR%)
| 方法 | plate-in-rack |
|---|
| V-WM (纯视觉世界模型) | 28 |
| VT-WM | 78 |
World-Gymnast (2602.02454) — WidowX/Bridge AutoEval(SR%)
| 方法 | Open Drawer | Close Drawer | Eggplant→Sink | Eggplant→Basket | 平均 |
|---|
| SFT (OpenVLA-OFT) | 34 | 74 | 32 | 40 | ~45 |
| SIMPLER RL | 58 | 62 | 4 | 72 | ~49 |
| World-Gymnast | 58 | 62 | 10 | 78 | ~52 |
(WorldGym held-out:SFT 58 → World-Gymnast 74,变体 79/81/81。)
World-VLA-Loop (无 arXiv) — Franka(RL/闭环迭代)
| 方法 | 真机成功率 |
|---|
| SFT baseline | 13.3% |
| World-VLA-Loop (两轮迭代) | 首轮RL基础上再 +13.5% |
Xiaomi-Robotics-0 (无 arXiv) — 自有人形双臂(成功率/吞吐)
| 方法 | Lego Disassembly(LA+LM %) | Towel Folding(件/min) |
|---|
| π₀.₅ | 97.0 | 0.9 |
| Xiaomi-Robotics-0 | 99.7 | 1.2 |
20. 其他 / 自研 benchmark
一次性 / 自研 / 触觉表征专用基准,每篇一小块,按原名保留。数值均为各论文自报。
IndustReal(IsaacGym 紧配合插入)— MBCtrl-RL-Insertion (2505.11858, Table I, Easy)
| 方法 | 0mm | 1mm | 5mm |
|---|
| IndustReal | 92.48±2.87 | ~89 | 崩溃 |
| 本文 (PF+Residual RL+Curr) | 100 | 98.44±0.87 | 90.25±2.22 |
CGP 仿真(Unreal Engine FEM, Allegro V5, 5任务平均)— CGP (2503.08587, Table II)
| 方法 | Avg 成功率 |
|---|
| Visuomotor DP | 53.2% |
| Visuotactile DP | 58.9% |
| CGP (Ours) | 74.9% |
ContactWorld(Isaac Gym+TacSL, 12接触任务)— ContactWorld (2606.13877, Table 1)
| 方法/表征 | 平均成功率 |
|---|
| Wrist-view | 20.7% |
| Front-view | 22.0% |
| PointCloud | 32.1% |
| PointCloud + TacFF | 36.1% |
VERA 仿真闭环(Table 1, Success/Task Progress %)— VERA (2605.27817)
| 方法 | Allegro-Sim | Panda-Sim(MimicGen) | PushT-Sim |
|---|
| UniPi* | 0.0/0.0 | 0.0/0.0 | 74.4/84.8 |
| J-IDM (VERA) | 70.0/70.0 | 94.0/94.0 | 92.5/95.5 |
RoboLab-120(120语言条件任务)— Cosmos3 (2606.02800, Table 19)
| 方法 | Specific SR |
|---|
| DreamZero | 25.2% |
| π0.5 | 28.1% |
| Cosmos3-Super | 39.7% |
BEHAVIOR-1K / DROID 零样本 — G0.5 (无 arXiv, Table 4)
| 方法 | BEHAVIOR-1K | DROID(零样本) |
|---|
| π0.5 | 26.3 | — |
| 挑战赛冠军(4 ckpt) | 26.1 | — |
| G0.5 | 31.4 | 82.5 |
TLA 仿真(Isaac Gym, Single-Peg, GCR%)— TLA (2503.08548, Table I)
| 方法 | GCR(%) | L1 x(mm) | L1 y(mm) | L1 rz(deg) |
|---|
| BC | 10.4 | 0.803 | 0.302 | 0.205 |
| DP | 8.5 | 0.370 | 0.382 | 0.568 |
| SP-TLA | 12.5 | 0.079 | 0.122 | 0.173 |
(Multi-Peg Table II:MP-TLA ID GCR 18.4,OOD 无退化。)
VTLA 仿真(Isaac Gym TacFlex peg-in-hole, GCR)— VTLA (2505.09577)
| 方法 | ID-GCR | OOD-GCR |
|---|
| VTLA | 47.5% | 31.2% |
| VLA | 46.1% | 29.5% |
| TLA | 15.3% | — |
| DP | 7.8% | — |
UniVTAC 仿真(触觉专用, Franka+GelSight-Mini, 6任务)— FTP-1 (2606.13102, Table 1)
| 方法 | Avg | Avg w/o Lift |
|---|
| ViTaL | 36.33 | 34.5 |
| UniVTAC-ACT | 43.00 | 39.5 |
| π0.5 | 49.16 | 31.5 |
| Tactile-VLA | 41.83 | 34.75 |
| FTP-π0.5 (无预训练) | 45.16 | 42.0 |
| FTP-1 | 66.66 | 59.5 |
Sparsh-X 自研物理属性基准(材质-数量估计, Fig.5)— SparshX (2506.14754)
| 方法 | 准确率 |
|---|
| E2E | 84.9% |
| Sparsh-X | 87.5% |
UniT 触觉位姿估计(USB Plug, MAE↓, Table I)— UniT (2408.06481)
| 方法 | MAE↓ |
|---|
| BYOL | 0.171 |
| MAE (ViT-Base) | 0.137 |
| UniT | 0.128 |
AnyTouch2 触觉分类(Object Bench, 准确率%)— AnyTouch2 (2602.09617)
| 方法 | TAG(材质) | Cloth(纺织) |
|---|
| AnyTouch 1 | 80.82 | 36.84 |
| AnyTouch 2 | 76.97 | 42.31 |
DISCO 多任务仿真环境(Diffusion Policy 环境, Seen, 50 trials)— DISCO (2406.09767, 表6.1)
| 方法 | Push-T | Push-block | Kitchen-Single | Kitchen-Multi | Mug | Bottle | Ham. | Fork |
|---|
| No cond. | 0.54 | 0.50 | 0.12 | 0.03 | 0.47 | 0.31 | 0.40 | 0.48 |
| LangDiff | 0.98 | 1.00 | 1.00 | 0.31 | 0.91 | 0.84 | 0.78 | 0.96 |
| GoalDiff | 0.96 | 1.00 | 1.00 | 0.27 | 0.88 | 0.95 | 0.70 | 0.93 |
| Vanilla inpt. | 0.82 | 1.00 | 0.71 | 0.35 | 0.90 | 0.88 | 0.85 | 0.96 |
| DISCO | 0.87 | 1.00 | 0.71 | 0.42 | 0.92 | 0.92 | 0.97 | 0.97 |
UniPi Language-Table 变体(任务完成率%)— UniPi (2302.00111, Table 1)
| 方法 | Seen Place | Seen Relation | Novel Place | Novel Relation |
|---|
| State + Transformer BC | 19.4 | 8.2 | 11.9 | 3.7 |
| Image + Transformer BC | 9.4 | 11.9 | 9.7 | 7.3 |
| Image + TT | 17.4 | 12.8 | 13.2 | 9.1 |
| Diffuser | 9.0 | 11.2 | 12.5 | 9.6 |
| UniPi | 90.1 | 53.2 | 40.1 | 46.3 |
其他仅登记(数值为图估/相对/世界模型指标,无标准操作成功率表):DreamDojo(FVD/策略评估 Pearson r=0.995)、EgoWM(SCS 结构一致性)、Cosmos3 前向动力学 PSNR、UniT-Humanoid 世界模型(PSNR/SSIM/LPIPS/FVD/EPE,见 out_03)、AnyTouch2 TouchHD 力预测(RMSE)、FG-CLTP 离线接触分类(F1 97.5)。VLS 的 CALVIN 任务组(MovableObjects 94 / ArticulatedParts 87)见 §16 附注。
按模型分类
这里按常见对比模型重排已有 benchmark 表格。每个模型 tab 内列出“哪些论文/benchmark 比较了该模型、结果是什么、ckpt/权重来源如何标注、训练域/测试域和 IID/OOD 关系是什么”。为避免误导,未在当前汇总中出现明确下载路径或训练步数的行,会在 ckpt 来源列写明“当前汇总未记录”;未能确认训练/测试协议的行,会在协议列写明“未确认”。
附:处理中发现的异常与说明
1. 同名 benchmark 列不一致
- RoboTwin:主流用 Clean/Randomized(Motus/ImageWAM/StarVLA/LingBot 等),但 SwiftVLA/Fast-WAM/G0.5 只报单一聚合 SR,Qwen 系列用 Easy/Hard,另有 Clean2Rand、IF 变体——已拆为 §2.1–2.5 五个子表。
- SimplerEnv Google-Robot:StarVLA 用 Visual Matching / Variant Aggregation 双列,其余多只报 Visual Matching Avg 或直接给 Avg——已在表内区分列并加备注。
- COLOSSEUM:ActiveVLA 报 Avg SR(%),SAM2Act 报"性能下降(%)",指标方向相反,已分行注明。
- LIBERO 多篇只报聚合 Avg(分套件填 —);MINT 原表另含 L90 列(非标准五列,已移入备注)。
- CALVIN:SuSIE 用 0–1 分数、其余用百分数;DreamVLA 仅报 Avg.Len;VLS 用任务组而非 1–5 链长。
2. 明显重复 / 转录问题
- VLA-Touch Table I 的 Full Cup / Full Peel 数值疑似转录重复,按原表保留。
- TacVLA 与 TacVLA2 为同一论文 v1/v2,触觉阵列描述不同(15×8 vs 15×5),核心平均一致,已分别列出。
- AdaVTF 的 Torque Gating 平均列标注 "<1%" 与逐任务不自洽,保留原文。
- MBCtrl-RL-Insertion 原文 Easy/Hard 归属自相矛盾,按其第 4d 节取 Easy(原注)。
3. arXiv 缺失 / 编号异常
- 大量 2025–2026 技术报告/项目页论文无 arXiv 号(CosmosPolicy、G0.5、Qwen-RobotManip、DIAL、KI-VLA、HiRobot、World-VLA-Loop、Xiaomi-Robotics-0、OmniVTA、UniVTAC、DDP-WM 等),排序时统一置于各表末尾。
- SynthICL 标注为 "arXiv 2026.06"、τ₀-WM 标注 "2605(未标全ID)"、LRM 标注 "2603.16065"、AdaVTF "2604.01414"、AHEAD "2606.02486"、AnyTouch2 "2602.09617"、Cosmos3 "2606.02800"、ContactWorld "2606.13877" 等为 2026 年(含疑似占位/未来)编号,一律按原文保留、按数字大小排序。
4. 反推值:FAVLA(π₀≈43.7、ForceVLA≈66.7)、FutureVLA(π0≈43.3)、ActiveVLA(GenBench L1、RLBench 部分)等由"相对提升"反推,均在对应位置保留原注。
5. 图估 / 近似值:pi0.6、HiRobot、HumanToRobotVLA、RTC、STS-IL、ViTaL-Steering、τ₀-WM、World-Gymnast、pi0.5 等的部分或全部数值来自条形图/图注估读,保留 `~`/`(图估)` 标注,未臆造精确值。