机器人研发开源算法与工具全景图

1. 机器人研发开源算法与工具全景图

机器人研发开源算法与工具全景图

伴随 AI 的快速演进,机器人研发目前正处于一个开源红利期。

在之前,步态控制、全身平衡、精细操作能力需要博士级团队攻关数年。

现在,个人开发者或小团队可在数周内借助成熟的开源框架,跑通从仿真训练到真机部署的完整闭环。

不过,在 GitHub 上,强化学习、模仿学习、VLA 大模型、传统 MPC 控制等多条机器人研发技术路线并行,相关仓库数以万计。

大伙在环境配置和框架选型上,一开始会有点无从下手,后续也不易形成正反馈。

本文按技术栈把机器人开发相关资源分成足式强化学习、模仿学习、VLA 具身大模型、传统动力学求解、仿真模型库等层次,保留经过工程验证、社区活跃、文档相对完整的项目,并标注其真实定位与相互关系。

机器人技术栈层次关系图

1.1. 足式强化学习

四足/人形步态,行业工程基线

这是当前人形与四足运动控制最主流的技术路线,核心是 PPO+大规模并行仿真+域随机化+Sim-to-Real。

rsl-rl(ETH 苏黎世,PPO 标准训练框架,必学)

ETH 苏黎世 RSL 实验室维护的轻量级、GPU 加速的强化学习库,代码精简、扩展点清晰,支持多 GPU 训练和 PPO/Student-Teacher 蒸馏等机器人学习方法。它被 Isaac Lab、Legged Gym、MuJoCo Playground 等主流仿真环境广泛采用,是当前足式机器人步态训练事实上的算法后端。

AMP(对抗运动先验,拟人步态)

Adversarial Motion Priors 通过引入一个判别器来区分“专家动捕数据”和“策略生成的运动”,用风格奖励替代繁琐的手工奖励设计,让机器人学会自然的行走、跑跳姿态。

  • 地址https://github.com/facebookresearch/amp
  • 说明:当前足式机器人中更活跃的实现通常基于 UC Berkeley 版本(AMP_for_hardware),直接构建在 legged_gym 之上,使用少量参考数据(约 4.5 秒)即可 grounding 技能。

TienKung-Lab(北京人形,国产高速人形基线)

北京人形机器人创新中心开源的运动控制框架,基于 IsaacLab 开发,首次融合模仿学习与强化学习,采用 AMP 风格化奖励+周期性步态奖励,让机器人在复杂地形上兼具高稳定性和人类相似的优雅姿态。搭载该框架的天工 Ultra 以2小时40分42秒获全球首届人形机器人半程马拉松冠军。

  • 地址:https://github.com/Open-X-Humanoid/TienKung-Lab
  • 亮点:支持 MuJoCo Sim2Sim 交叉验证,已在天工 2.0 全尺寸人形上验证了高泛化行走与奔跑
  • 开源现状:Sim2Real 部署示例已可用,官方持续增加传感器与感知控制支持

unitree_rl_gym(宇树官方 RL 工程)

宇树官方发布的强化学习运动控制示例仓库,支持 Go2、H1、H1_2、G1 四款机器人,提供从训练到真机部署的完整脚本。代码基于 legged_gym+rsl_rl 构建,是快速在宇树硬件上复现 RL 步态的最短路径。


1.2. 模仿学习(动捕回放、遥操作、行为克隆)

适配遥操作采集、动捕回放、精细操作等场景,常与强化学习结合使用。

ALOHA-ACT(斯坦福 Action-Chunking-Transformer)

斯坦福提出的低成本双臂遥操作硬件 + ACT 模仿学习算法组合。ACT 的核心思想是预测动作序列,非单步动作,将有效决策时域从 T 缩短至 T/k,缓解行为克隆中的复合误差问题。配合 CVAE 和 temporal ensembling,50~100 次演示可学会精细操作。

Diffusion-Policy(扩散策略)

将扩散模型的去噪过程用于机器人动作生成,擅长处理多模态动作分布。当同一观测下存在多种合法动作策略时,扩散策略不会像 ACT 那样取平均导致失败,而是能采样出不同的合理轨迹。在灵巧手精细抓取、接触丰富的任务中表现突出。

补充建议:若需做模仿学习基准测试与对比,可关注 robomimic 标准化框架,集成了包括 Diffusion Policy 在内的多种算法。


1.3. VLA 视觉-语言-动作具身大模型

让机器人“看懂画面、听懂指令、输出动作”的前沿方向。

OpenVLA(斯坦福 7B 开源机器人大模型)

由斯坦福、UC Berkeley、Google DeepMind 等联合开发的 7B 参数视觉-语言-动作模型,基于 Llama 2 构建,在 970K 条 Open X-Embodiment 机器人数据上预训练。它将动作视为语言 token 直接由 LLM 生成,支持 LoRA 微调和 INT8 量化,可在消费级 GPU 上微调部署。

Octo(轻量化 VLA,93M,低配设备优先尝试)

仅 27M/93M 参数的轻量级 VLA 模型,采用条件扩散 Transformer 生成连续动作序列,在单张 RTX 4090 上即可流畅推理,微调成本远低于 OpenVLA。代价是语言理解能力弱于基于 LLM 的方案,指令跟随的泛化性有限。

LingBot 蚂蚁灵波(长时序世界模型)

蚂蚁灵波推出的具身原生世界动作模型,基于自回归架构从零预训练,采用因果预训练范式和 MoE 架构,实现单卡 150Hz 实时推理。其世界模型 LingBot-World 2.0 支持小时级实时生成和 720p/60fps 输出,首次将 Agent 机制引入世界模型。


1.4. 一站式封装框架(降低环境配置成本)

LeRobot(HuggingFace)

HuggingFace 推出的端到端机器人学习平台,统一管理数据集、训练 BC/ACT/Diffusion 等策略,并支持仿真评估与权重导出。平台集成 NVIDIA Isaac GR00T 1.7 人形 VLA 模型和 Isaac Teleop 框架,提供从数据采集到部署的标准工作流。


1.5. 传统动力学、运动学求解库(雅克比、逆解、MPC、WBC 全身控制)

Pinocchio

面向刚体系统的高效运动学与动力学计算库,提供正向/逆向运动学、雅克比矩阵、惯性矩阵、科里奥利项等核心算法的实现。对于多自由度机器人,它用递归算法替代解析推导,让开发者无需从零实现复杂的动力学计算。

Acados(MPC 求解器)

面向实时最优控制的高性能求解器,专为模型预测控制设计,支持序列二次规划和约束优化。在传统人形步态控制和 WBC 全身控制中,Acados 常用于求解带约束的 QP 问题。


1.6. MuJoCo 仿真与机器人模型库

mujoco_menagerie(DeepMind 官方模型仓库)

DeepMind 维护的 MJCF 模型集合,收录了大量经过验证的机械臂、人形、四足机器人模型文件,可直接用于 MuJoCo 仿真,省去从零编写 XML 描述的工作量。

unitree_mujoco

宇树官方提供的 MuJoCo 仿真支持,包含 H1、Go2 等机型的完整 URDF/MJCF 模型和地形生成脚本,是 unitree_rl_gym 进行 Sim2Sim 验证的配套资源。


1.7. 学习索引合集(Awesome 资源清单)

awesome-legged-locomotion-learning

足式运动学习资源清单,汇总了四足与双足机器人论文、开源工程、仿真环境和部署工具,按主题分类组织。

awesome-physical-ai

面向物理 AI 的综合性资源索引,覆盖机器人基础模型、世界模型、仿真器、遥操作、Sim-to-Real 工具和具身数据集。收录了 RSL-RL、TienKung-Lab、LeRobot、Diffusion Policy 等本清单中的多个项目,可视为本清单的上位参考。

1.8. 最简上手顺序

步骤 内容 目标
第一步 rsl-rl + unitree_mujoco 吃透 PPO 步态训练闭环
第二步 LeRobot + ALOHA-ACT 掌握动捕回放、模仿学习流水线
第三步 Pinocchio 理解运动学,看懂雅克比矩阵
第四步 Octo → OpenVLA 先做轻量化 VLA 推理实验,再尝试微调