UFO无监督强化学习框架

Beyond FB,从训练到真机的开源无监督控制框架。

一套面向研发的、完全开源的人形机器人无监督强化学习控制(Unsupervised RL Control)开发框架,覆盖训练基础设施、数据管线、算法研究和推理部署全流程。

框架致力于降低无监督强化学习控制的研发门槛,使研究者能够快速复现 SOTA 方法、探索新的行为表示(representation)、适配不同机器人平台,并实现从训练到真实机器人遥操作部署的一体化开发。

快速训练 Infra

UFO 利用更轻量级的 MJLab 作为 backend,兼容单卡与多卡并行训练。在 8 张 RTX 4090 GPU 上,不到 12 小时即可完成 BFM-Zero 算法训练,摆脱对单张大显存 GPU 的依赖;在 8 张 H200 GPU 上,约 6–8 小时即可完成训练,性能也持续优于 BFM-Zero。

通用可扩展框架

统一的 codebase 不再受限于特定机器人,可无缝适配不同机器人形态,大幅降低新平台的迁移成本。框架支持来自不同来源的数据混合训练(data mixture),并提供灵活的数据调度与配比机制。通过合理的数据分布设计,无监督强化学习不仅能够学习稳定的通用运动,还已展现出侧手翻等高动态动作的学习能力。

新表征集成

除集成经典 BFM-Zero(FB Representation)外,框架支持多种行为表示(representation)的无监督学习研究。我们已探索 TeCH(Temporal Distance Modeling via Contrastive Representation Learning for Humanoid Whole-Body Control)等新型表示,并取得良好的控制效果,为更通用的无监督控制算法提供统一实验平台。

TeCH · 抗扰动控制
TeCH · 全身动作跟踪

真实世界遥操作

首次开源无监督强化学习控制的遥操作(Teleoperation)代码及完整验证方案,支持真实机器人部署。机器人能够自然完成深蹲、半蹲、跪地、打滚、跌倒恢复以及抗外力扰动等复杂全身动作,为无监督强化学习在真实场景中的应用提供完整参考实现。