把 16 万字原始讨论,整理成一座研究者能直接选型、复现、写论文的教程站
原始资料 benchmark-comments-combined.md(D49–D58)每篇都按「任务集 — 引擎与本体 — 评估指标 — Harness 优化」展开。本教程保留该结构与关键版本、路径、配置原文,全文转排、补齐对比,9 个 benchmark 各自独立成章。
00 · 总览
9 个 benchmark 一张表:先选对,再深入
一句话选型:做终身/持续学习看 LIBERO 与 RoboCasa;做语言长时序看 CALVIN 与 BEHAVIOR;做真实策略排名看 SimplerEnv;做大规模 RL 并行看 ManiSkill;做双臂模仿看 RoboTwin;做能力剖面看 RoboDojo;做横向扫榜用 VLA-Harness。
| Benchmark | 一句话定位 | 引擎 / 本体 | 任务规模 | 核心指标 | 适合的研究问题 |
|---|---|---|---|---|---|
| LIBERO | 终身机器人学习的任务注册与遗忘度量 | MuJoCo + robosuite 1.4 / Franka Panda OSC_POSE | Spatial/Object/Goal 各 10 + LIBERO-10 + LIBERO-90 | sparse success + confusion matrix + forward transfer | 知识迁移、灾难性遗忘、多任务 vs 顺序学习 |
| CALVIN | 语言条件长时序操作协议 | PyBullet + PlayTable / 7-DoF + EGL | 约 34 类原子操作 × 5 步序列 × 1000 条 | SR_1…SR_5 + 平均成功链长 | 语言理解、误差累积、跨环境泛化 ABC→D |
| SimplerEnv | 真实策略的 real-to-sim 排名复现 | SAPIEN + ManiSkill2_real2sim / Google Robot · WidowX | 6+4 任务 × 外观/位姿变体 | 成功率 + Pearson + MMRV | 仿真评估是否保序、视觉匹配有效性 |
| RoboCasa365 | 厨房原子→组合的泛化阶梯 | MuJoCo 3.3.1 + robosuite ≥1.5.2 / 移动操作平台 | 65 atomic + 300 composite | seen/unseen 组合成功率、lifelong phase | 组合泛化、预训练规模效应 |
| ManiSkill | GPU 并行的大规模操作基准 | SAPIEN 3 + PhysX CUDA + Vulkan / 多形态 | 桌面/双臂/移动/四足/人形/灵巧手/HAB | success_once / success_at_end / return | 大规模 RL、GPU 吞吐、跨本体 |
| BEHAVIOR-1K | 完整家务活动的符号化定义 | Isaac Sim + OmniGibson / 移动双臂 | 1000 活动;Challenge 100 任务/20k 轨迹 | BDDL 谓词满足 + 效率分 | 长时程规划、状态变化、技能组合 |
| RoboTwin 2.0 | 双臂数字孪生的数据工厂 | SAPIEN 3.0 timestep 1/250 / Aloha·ARX·Franka | 50 评测任务;10 万+ 预采集轨迹 | 任务成功率 + 视觉/指令泛化剖面 | 双臂协作、VLA 泛化、数据规模 |
| RoboDojo | 按能力维度剖分的评测集 | Isaac Sim 5.1 + IsaacLab 2.3 / 多机器人 | 42 canonical + 12 random = 54;另 18 真机 | 五维能力成功率 | 记忆、精度、长时程、开放理解短板定位 |
| VLA-Harness | 一次接入、处处评测的矩阵 | WebSocket+msgpack;各 benchmark Docker 隔离 | 约 18 个 benchmark 适配器 | episode→task→benchmark 聚合 | 跨模型横评、复现榜、吞吐调优 |
选型三问
长文版 · 一章一页
9 章长文:接近原文全文,仅排版加工
以下 9 页由原始 benchmark-comments-combined.md 对应 FULL_D* 节全文转排生成:论述、举例、代码块与表格全部保留,只做标题锚点、表格框内滚动与代码换行处理。点击进入各章长文页。
10 · 附录
术语表与复现清单
术语
BDDL/BDDL3:任务符号定义(对象/初态/目标逻辑);LH-MTLC:5 步链式评估;SR_k:至少连成 k 步的序列比;MMRV:排错的最大真实代价;Visual Matching:真背景叠加;Variant Aggregation:多变体汇总;SubprocVectorEnv:多进程向量环境;EGL:GPU 离屏渲染;XPolicyLab:策略服务与评测适配层。
复现清单(开跑前逐项勾)
① 固定 commit 与依赖版本;② 固定渲染后端(EGL/CPU/RTX)与分辨率;③ 固定初态/seed/instance;④ 同时跑 Base 与 Multitask(或对应上界);⑤ 按推荐统计量报(SR 序列/once+at_end+return/矩阵);⑥ 留视频、配置与结果文件;⑦ 跨库比较注明 ✓/◇ 状态。
整理说明:本教程由原始长评论全文转排,保留仓库路径、配置键与版本约束原文;凡原文明确“以 commit/论文/榜为准”处均未补写具体分数。深入某章时建议对照原始 md 的对应 FULL_D* 节阅读。