具身操作 Benchmark 深度教程9 章独立 · 研究者版 · 由原始长评论全文转排(长文版一章一页)

把 16 万字原始讨论,整理成一座研究者能直接选型、复现、写论文的教程站

原始资料 benchmark-comments-combined.md(D49–D58)每篇都按「任务集 — 引擎与本体 — 评估指标 — Harness 优化」展开。本教程保留该结构与关键版本、路径、配置原文,全文转排、补齐对比,9 个 benchmark 各自独立成章。

受众:具代码经验的研究者全收录 9 个多页可离线阅读对照原始 commit 使用

00 · 总览

9 个 benchmark 一张表:先选对,再深入

一句话选型:做终身/持续学习看 LIBERO 与 RoboCasa;做语言长时序看 CALVIN 与 BEHAVIOR;做真实策略排名看 SimplerEnv;做大规模 RL 并行看 ManiSkill;做双臂模仿看 RoboTwin;做能力剖面看 RoboDojo;做横向扫榜用 VLA-Harness。

Benchmark一句话定位引擎 / 本体任务规模核心指标适合的研究问题
LIBERO终身机器人学习的任务注册与遗忘度量MuJoCo + robosuite 1.4 / Franka Panda OSC_POSESpatial/Object/Goal 各 10 + LIBERO-10 + LIBERO-90sparse success + confusion matrix + forward transfer知识迁移、灾难性遗忘、多任务 vs 顺序学习
CALVIN语言条件长时序操作协议PyBullet + PlayTable / 7-DoF + EGL约 34 类原子操作 × 5 步序列 × 1000 条SR_1…SR_5 + 平均成功链长语言理解、误差累积、跨环境泛化 ABC→D
SimplerEnv真实策略的 real-to-sim 排名复现SAPIEN + ManiSkill2_real2sim / Google Robot · WidowX6+4 任务 × 外观/位姿变体成功率 + Pearson + MMRV仿真评估是否保序、视觉匹配有效性
RoboCasa365厨房原子→组合的泛化阶梯MuJoCo 3.3.1 + robosuite ≥1.5.2 / 移动操作平台65 atomic + 300 compositeseen/unseen 组合成功率、lifelong phase组合泛化、预训练规模效应
ManiSkillGPU 并行的大规模操作基准SAPIEN 3 + PhysX CUDA + Vulkan / 多形态桌面/双臂/移动/四足/人形/灵巧手/HABsuccess_once / success_at_end / return大规模 RL、GPU 吞吐、跨本体
BEHAVIOR-1K完整家务活动的符号化定义Isaac Sim + OmniGibson / 移动双臂1000 活动;Challenge 100 任务/20k 轨迹BDDL 谓词满足 + 效率分长时程规划、状态变化、技能组合
RoboTwin 2.0双臂数字孪生的数据工厂SAPIEN 3.0 timestep 1/250 / Aloha·ARX·Franka50 评测任务;10 万+ 预采集轨迹任务成功率 + 视觉/指令泛化剖面双臂协作、VLA 泛化、数据规模
RoboDojo按能力维度剖分的评测集Isaac Sim 5.1 + IsaacLab 2.3 / 多机器人42 canonical + 12 random = 54;另 18 真机五维能力成功率记忆、精度、长时程、开放理解短板定位
VLA-Harness一次接入、处处评测的矩阵WebSocket+msgpack;各 benchmark Docker 隔离约 18 个 benchmark 适配器episode→task→benchmark 聚合跨模型横评、复现榜、吞吐调优

选型三问

1. 你的自变量是什么?算法(ER/EWC/PackNet)→ LIBERO;指令/环境 → CALVIN;外观/位姿 → SimplerEnv;数据规模 → RoboCasa/RoboTwin。
2. 你的因变量是什么?遗忘与迁移 → confusion matrix;链式鲁棒 → SR_k;保序性 → Pearson/MMRV;吞吐 → ManiSkill bench。
3. 你的对照是什么?顺序微调 Base 与多任务 Multitask 必须同时报告;仿真分必须附真实分或复现报告链接。
版本声明(必读):LIBERO 的 suite 注册、CALVIN 数据 split 大小、ManiSkill Small Set 条目等在原文中均注明“以具体 commit 与配置文件为准”。本教程保留该提醒,引用路径均为原始评论中的仓库相对路径,复现前请先固定 commit。

长文版 · 一章一页

9 章长文:接近原文全文,仅排版加工

以下 9 页由原始 benchmark-comments-combined.md 对应 FULL_D* 节全文转排生成:论述、举例、代码块与表格全部保留,只做标题锚点、表格框内滚动与代码换行处理。点击进入各章长文页。

01 · LIBERO:终身学习的任务注册表Spatial / Object / Goal / LIBERO-10 / LIBERO-90:知识迁移、遗忘度量与持续学习评测框架全文。

进入长文版 →

02 · CALVIN:语言长时序的链式成功率协议语言条件连续操作:数据集、PyBullet 仿真、MCIL 基线与 LH-MTLC 评估全文。

进入长文版 →

03 · SimplerEnv:真实策略的 real-to-sim 排名复现Google Robot / WidowX 真机映射、Pearson 与 MMRV 保序性评估全文。

进入长文版 →

04 · RoboCasa365:65 原子 × 300 组合的厨房泛化阶梯Atomic→Composite、seen/unseen 组合与 lifelong 阶段全文。

进入长文版 →

05 · ManiSkill:GPU 并行的大规模操作基准SAPIEN + PhysX 并行仿真、桌面/双臂/移动/灵巧手与基准执行器全文。

进入长文版 →

06 · BEHAVIOR-1K:千种家务活动的符号化定义BDDL 目标状态、Isaac Sim 真实感场景与 Challenge 子集全文。

进入长文版 →

07 · RoboTwin 2.0:双臂数字孪生的数据工厂双臂运动规划、10万+演示轨迹与 VLA 泛化评测全文。

进入长文版 →

08 · RoboDojo:按能力维度剖分的统一评测42 canonical + 12 random + 18 真机:记忆、精度、长时程剖面全文。

进入长文版 →

09 · vla-eval:模型、环境、协议三解耦的评估矩阵18 Benchmark × 十余模型适配器:编排、聚合、复现与榜单全文。

进入长文版 →

阅读建议:总览选型 → 目标长文章节精读 → 术语与复现清单核对 commit 与配置。

10 · 附录

术语表与复现清单

术语

BDDL/BDDL3:任务符号定义(对象/初态/目标逻辑);LH-MTLC:5 步链式评估;SR_k:至少连成 k 步的序列比;MMRV:排错的最大真实代价;Visual Matching:真背景叠加;Variant Aggregation:多变体汇总;SubprocVectorEnv:多进程向量环境;EGL:GPU 离屏渲染;XPolicyLab:策略服务与评测适配层。

复现清单(开跑前逐项勾)

① 固定 commit 与依赖版本;② 固定渲染后端(EGL/CPU/RTX)与分辨率;③ 固定初态/seed/instance;④ 同时跑 Base 与 Multitask(或对应上界);⑤ 按推荐统计量报(SR 序列/once+at_end+return/矩阵);⑥ 留视频、配置与结果文件;⑦ 跨库比较注明 ✓/◇ 状态。

整理说明:本教程由原始长评论全文转排,保留仓库路径、配置键与版本约束原文;凡原文明确“以 commit/论文/榜为准”处均未补写具体分数。深入某章时建议对照原始 md 的对应 FULL_D* 节阅读。