Observe · Act · Diagnose · Recover
Sensor-grounded skill learning and recovery for a mobile dual-arm robot.
面向移动双臂机器人的传感驱动技能学习、执行监控与主动恢复研究平台。
T04:抓取并放置,11.05 s 仿真任务时间。固定重试基线 + UKF,独立评分确认释放与稳定支撑。单回合演示,不代表总体成功率。
- 完整机器人装配:四轮独立转向底盘、升降机构、双 7 自由度机械臂、双 Robotiq 2F-85,以及头部 D455 / 双腕 D405 RGB-D。
- 统一传感边界:策略、奖励与规划使用编码器、夹爪码、IMU、RGB-D、已发指令和名义运动学;仿真真值由独立评分器使用。
- 四技能学习链路:Reach、Grasp & Lift、Place & Release、Push & Slide;提供传感示教、DAgger/BC、SAC/RLPD 与 AWAC 式训练实现。
- 可审计的执行闭环:UKF 状态估计、自我/物体预测、失败诊断、三态完成判定,以及观察、探测、适配与重规划接口。
- 面向复现的验证:分离传感认证与物理成功,记录模型/资产哈希,支持同布局配对、扰动评测与检查点恢复。
推荐 Linux + Python 3.12;无窗口 RGB-D 渲染需要可用的 EGL/OpenGL 驱动。仓库已包含必需网格和精选四技能推理权重,无需先训练。
git clone https://github.com/susongyuan/Mujoco-agentic-robot.git
cd Mujoco-agentic-robot
python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install -r requirements.txt
export MUJOCO_GL=egl PYTHONNOUSERSITE=1 OMP_NUM_THREADS=1 PYTHONPATH=.
python -m metarobot.checks
python -m metarobot.rl_checks
python -m metarobot.demo_gif --tasks T04@nominal --output results/v4/my_demo演示输出 GIF、传感轨迹和独立评分 results/v4/my_demo/summary.json。安装、GPU 与训练用法见 复现指南。
flowchart LR
A[任务模板与目标] --> B[任务执行器]
B --> C[四技能策略]
C --> D[独立 MuJoCo 仿真进程]
D -->|SensorFrame| E[UKF · RGB-D 感知]
E --> C
E --> F[预测残差 · 三态目标判定]
F --> G[诊断 · 恢复选择]
G -->|观察 / 探测 / 适配 / 重规划| B
D -.->|回合后私有真值| H[独立物理评分]
COMPLETE / INCOMPLETE / UNCERTAIN 区分“已完成”“未完成”和“证据不足”。学习侧不能以物体真值位姿、接触身份或故障标签代替传感观测。
当前演示使用冻结 BC 技能与固定重试。恢复选择、记忆及学习调度代码可用于研究对照;可学习 VOI/SMDP 行为选择仍在开发,尚未证明端到端收益。
抓取技能的冻结评测:5 种条件 × 30 回合,评测种子 277;AWAC 式候选各训练 20k 在线步。
| 指标 | 初始 BC | AWAC s130 | AWAC s131 | AWAC s132 |
|---|---|---|---|---|
| 独立评分成功 / 150 | 117 | 123 | 122 | 120 |
| 编码器偏置条件 / 30 | 20 | 25 | 25 | 24 |
| 传感认证误报 | 0 | 0 | 0 | 0 |
收益主要集中在编码器偏置条件;该抓取评分使用历史 any-lift 口径,未锁定原目标实例。三训练种子共享评测布局,不能当作 450 个独立样本。完整系统、四技能 RL 和真机泛化尚未验收,详见 结果与边界 和 原始结果摘要。
| 入口 | 内容 |
|---|---|
contract.py · bridge.py · simulator.py |
传感契约、进程通信与物理仿真 |
kinematics.py · perception.py · self_ukf.py |
名义运动学、RGB-D 感知与状态估计 |
skills/ · train_skill.py · dagger.py |
四技能环境、强化学习与模仿学习 |
executive.py · system2.py · memory.py |
任务执行、诊断恢复与情景记忆 |
object_world.py · multi_decision_scheduler.py |
动作条件物体预测与 SMDP 数据/学习对照 |
frozen_validation.py · placement_truth.py |
冻结协议与释放/支撑/稳定性评分 |
- 完整仿真装配、传感隔离、四技能训练与独立评测。
- UKF / 指令坐标系控制、限位感知 IK、抓取 AWAC 三种子评测。
- 提高 Place 运动/支撑可观测性与 Push 连续任务覆盖。
- 学习并验证 VOI/SMDP 观察与恢复行为选择。
- 扩展移动操作、双臂交接与真机验证。
研究方案与审计记录见 文档索引,可运行性验证见 发布检查。本仓库保留必要资产、小型推理模型与结果摘要;原始训练数据、回放缓冲区、临时脚本和大体积日志不随 Git 分发。模型清单见 MODEL_CARD.md,第三方资产来源见 THIRD_PARTY_NOTICES.md。