一套面向研发的、完全开源的人形机器人无监督强化学习控制(Unsupervised RL Control)开发框架,覆盖训练基础设施、数据管线、算法研究和推理部署全流程。
框架致力于降低无监督强化学习控制的研发门槛,使研究者能够快速复现 SOTA 方法、探索新的行为表示(representation)、适配不同机器人平台,并实现从训练到真实机器人遥操作部署的一体化开发。
快速训练 Infra
UFO 利用更轻量级的 MJLab 作为 backend,兼容单卡与多卡并行训练。在 8 张 RTX 4090 GPU 上,不到 12 小时即可完成 BFM-Zero 算法训练,摆脱对单张大显存 GPU 的依赖;在 8 张 H200 GPU 上,约 6–8 小时即可完成训练,性能也持续优于 BFM-Zero。
通用可扩展框架
统一的 codebase 不再受限于特定机器人,可无缝适配不同机器人形态,大幅降低新平台的迁移成本。框架支持来自不同来源的数据混合训练(data mixture),并提供灵活的数据调度与配比机制。通过合理的数据分布设计,无监督强化学习不仅能够学习稳定的通用运动,还已展现出侧手翻等高动态动作的学习能力。
新表征集成
除集成经典 BFM-Zero(FB Representation)外,框架支持多种行为表示(representation)的无监督学习研究。我们已探索 TeCH(Temporal Distance Modeling via Contrastive Representation Learning for Humanoid Whole-Body Control)等新型表示,并取得良好的控制效果,为更通用的无监督控制算法提供统一实验平台。
真实世界遥操作
首次开源无监督强化学习控制的遥操作(Teleoperation)代码及完整验证方案,支持真实机器人部署。机器人能够自然完成深蹲、半蹲、跪地、打滚、跌倒恢复以及抗外力扰动等复杂全身动作,为无监督强化学习在真实场景中的应用提供完整参考实现。