
摘要
人形机器人凭借其环境适应能力,成为理想的通用 AI 平台,但其高自由度使得可扩展的运动学习变得复杂。传统的 on-policy 强化学习方法(如 PPO)依赖手工设计的奖励函数,存在训练成本高昂、状态覆盖有限、泛化能力差等问题。为解决这些缺陷,无监督表征学习已被广泛应用于人形机器人控制。现有方案主要包括 Forward-Backward(FB)表征学习与基于对比度量学习的 TemporaL Distance Representation(TLDR)。FB 受线性 MDP 假设的限制,在富接触复杂场景下表现不稳定且表征退化。本文提出一种新的无监督人形机器人控制方法 TeCH,基于 TLDR 的对比学习框架构建。该方法通过隐空间时间距离建模构造密集奖励,引导结构化探索,提供简洁稳定的训练流程与组织良好的隐空间。它能够实现高精度的零样本运动跟踪与目标到达,具备出色的样本效率,并可无缝部署到物理机器人上。大量仿真与真机实验验证了本方法在跟踪精度和泛化能力上的优越性,展现出其在实际人形机器人控制中的巨大潜力。
引言
人形机器人因与人类环境的天然兼容性,成为通用 AI 的理想物理平台。其高自由度支持灵活的全身 loco-manipulation,但也使可扩展的运动学习复杂化。使用手工设计奖励的传统方法仅在有限任务上表现良好,缺乏在复杂场景中的鲁棒性与泛化能力。为此,研究者转向学习通用的行为先验以获取可复用的底层运动技能,而非为单独任务进行优化。
近年来,强化学习推动了人形机器人 sim-to-real 的运动技能迁移。以全身运动跟踪为核心,这些方法使机器人能够学习用于 locomotion 和 loco-manipulation 任务的动态、可复用技能。然而,主流方法大多采用 PPO 等 on-policy 优化器,并结合手工设计的跟踪奖励或任务特定奖励,存在两个关键缺陷。其一,它们需要海量高维运动数据和大规模并行环境,导致训练成本难以承受。例如,SONIC 23 需要 128 块 GPU 连续训练三天。其二,受限的数据集覆盖无法涵盖高自由度人形机器人的完整控制空间。缺乏结构化且平滑的表征,现有方法限制了技能的泛化与复用,难以针对外部扰动高效生成鲁棒响应。
为应对上述局限,基于表征学习的无监督强化学习方法开始应用于人形机器人控制。其中一个代表性分支采用基于 successor feature 的值分解,例如 Forward-Backward(FB)表征学习 35,通过学习可组合的隐表征实现无监督技能发现和行为复用。off-policy 无监督强化学习具有高样本效率、强复用性以及与大规模 replay buffer 的兼容性,在构建人形机器人行为基础模型方面极具前景。BFM-Zero 18 将 FB 学习引入人形机器人控制,通过结构化探索获取平滑、可组合的运动基元,借助行为流形建模提供良好的技能插值、鲁棒性与泛化能力。然而,FB 在高维人形机器人系统中存在关键局限:它建立在隐嵌入空间的线性 Markov Decision Process(linear MDP)假设之上,在复杂接触动力学下失效,导致表征不稳定与退化。总体而言,现有的无监督技能学习方法不可避免地要在表征表达力、训练稳定性与任务可扩展性之间权衡。
另一类无监督强化学习分支利用对比度量学习来学习状态表征,通过对时序相关性和行为距离建模,产生密集、稳定的优化信号。作为通过对比学习习得的代表性范式,TemporaL Distance Representation(TLDR)1 与 FB 方法不同:它放弃值函数分解,直接使用时间距离目标学习时间可达性与系统动力学。
在此基础上,本文提出 TeCH(如图 1 所示),一种基于时间距离表征 1 构建的人形机器人无监督控制框架。该方法利用隐空间中的距离变化构造密集的过程奖励,赋予自主探索更清晰的方向性,并自然建立状态与目标之间的对应关系。得益于更直接的优化目标和简洁稳定的训练流程,TeCH 在全局目标控制任务中展现出更好的可扩展性和优化稳定性。我们还观察到,TeCH 能够构造结构良好的隐空间,以更高精度支持零样本运动跟踪和目标到达。它在训练阶段表现出卓越的数据效率,并在部署到物理人形机器人时展现出有前景的性能。

作为两大主流无监督强化学习范式,FB 与 TLDR 框架都已被证明能够将习得的能力迁移到真实人形机器人。本文的主要贡献概括如下: • 方法创新:我们提出一种基于时间距离学习的新型人形机器人控制方法 TeCH,通过产生密集的隐奖励进行结构化探索,提升无监督强化学习的跟踪精度。 • 对比基准:我们首次在人形机器人上开展无监督强化学习的系统性对比,为未来设计提供实用洞见。 • 实验验证:大量仿真与真机实验验证了 TeCH 在实际部署中实现高精度全身跟踪与目标到达的能力。
相关工作
人形机器人全身控制
近年来,基于学习的方法在人形机器人全身控制方面取得显著进展。尽管强化学习可以在仿真中有效生成复杂动态行为 28, 21, 22, 34, 33,sim-to-real 迁移仍是真机部署的关键瓶颈。研究者提出了包括域随机化和系统辨识在内的多种策略,但多数现有工作聚焦于行走、奔跑、起立等特定行为的单任务学习 29, 30, 3, 32, 39, 15, 27。自 2025 年起,多任务与通用人形机器人控制受到越来越多关注,旨在用单一策略处理多样任务 12, 13, 41, 40, 38, 4, 11, 14, 5, 6, 8。这些方法通常在仿真中训练跟踪策略,再通过基于 VAE 的隐学习或扩散模型 12, 38, 40, 4, 41, 19 蒸馏为统一的多任务策略。然而,它们本质上受限于运动数据集质量,且普遍采用 on-policy 强化学习。与此不同,本方法利用 off-policy 强化学习直接学习通用策略,得到更丰富、更结构化的技能空间,且不受运动数据集约束。
无监督强化学习
无监督强化学习使智能体能在没有任务特定奖励的情况下学习多样、可控的行为。基于互信息的技能发现方法(包括 DIAYN 7、VIC 9 和 VALOR 16)通过最大化隐变量与状态轨迹之间的互信息来提升技能可区分性。但这些方法主要在简单的 locomotion 场景下验证,且通常采用 on-policy 训练,限制了它们在高维人形机器人系统中的可扩展性。
常见的对比与表征学习方法(如 CIC 20 和 Proto-RL 37)通过 InfoNCE 与原型匹配学习结构化的状态与技能嵌入,获得更稳定的表征。与此同时,内在动机类方法(包括 RND 2、ICM 26 和 SMM 17)通过奖励状态新颖性和覆盖率来促进探索。然而,这些范式缺乏显式的目标进度建模,对目标到达行为的监督较弱。
Forward-Backward(FB)表征学习 36 通过将值函数分解为前向状态嵌入和后向技能嵌入,提供结构化的行为建模,支持可组合的技能表征与零样本泛化。尽管有这些优势,FB 依赖严格的 successor feature 分解假设,并需要对偶映射的联合优化,且在高维、富接触的人形机器人控制场景中验证不足。
作为另一种有效的对比学习范式,TemporaL Distance Representation(TLDR)1 放弃了 forward-backward 分解,通过时间距离感知编码器 ϕ_ψ 显式建模时间可达性,将时间相邻的状态嵌入到相近位置,并产生与过程对齐的密集奖励 r_tldr。这一设计带来更简单、更稳定的 off-policy 优化目标。在本工作中,我们将 TLDR 扩展到真实人形机器人,并对通用运动跟踪与目标到达任务进行系统评估。
TeCH 预训练
TeCH 由两个核心组件构成:无监督预训练阶段和零样本推理流程(第 IV 节)。本章概述其无监督预训练流程,包括仿真环境中的训练过程以及面向真机迁移的设计细节。在第 III-A 节给出问题建模,并在第 III-B 与 III-C 节介绍基于时间距离表征框架的 TeCH 无监督强化学习框架。
对 TeCH 而言,学习目标有两个方面:1) 一个能够捕捉行为轨迹时间结构的隐表征空间。在该空间中,具有时间邻近性和相似行为模式的状态或轨迹被映射到相邻位置,使策略能够基于轨迹级别的行为语义进行泛化(第 III-B 节);2) 一个以隐任务表征为条件的策略。我们可将宏观机器人姿态映射到该结构化空间,实现对多样运动目标和行为模式的统一控制(第 III-C 节)。
为实现策略的零样本 sim-to-real 迁移,我们遵循 18 在训练期间引入对抗目标,使人形机器人行为与人类数据分布对齐(第 III-D 节);我们还加入辅助训练目标以强制施加 sim-to-real 迁移所需的关键约束,例如关节限位合规性和有界的动作变化率。TeCH 的完整预训练流程与伪代码在第 III-E 节进一步展开。
问题建模
我们将真实世界的人形机器人控制问题形式化为部分可观测 Markov Decision Process(POMDP),定义为五元组 (S, O, A, P, γ),其中 S 表示完整状态空间,O 为观测空间,A 为动作空间,P(s_{t+1} | s_t, a_t) 为状态转移动力学,γ∈(0,1) 为折扣因子。
对于一个具有 29 个自由度的人形机器人,动作 a∈A⊂R^29 由所有自由度的 PD 控制器目标值组成。特权状态信息 s∈R^463 包括根部高度、本体位姿、本体朝向、线速度与角速度。可观测量定义为 o_t = {q_t − q̄, q̇_t, ω^root_t / 4, g_t} ∈ R^64,其中 q_t ∈ R^29 表示相对于标称位姿 q̄ 归一化的关节位置,q̇_t ∈ R^29 表示关节速度,ω^root_t ∈ R^3 表示根部角速度,g_t ∈ R^3 表示根部坐标系下的投影重力向量。我们进一步定义观测历史 o_{t,H} = {o_{t−H}, a_{t−H}, …, o_t} ∈ R^{93·H+64},由本体感知状态和动作组成。除根部高度外,所有状态分量都相对于当前朝向和根部位置进行归一化。
在预训练阶段,智能体可访问无标签运动数据集 M={τ},其中每条轨迹同时包含观测序列和特权状态序列,即 τ = (o_1, s_1, …, o_{l(τ)}, s_{l(τ)}),l(τ) 表示轨迹 τ 的长度。
时间距离表征学习
形式上,给定状态转移 (s_t, s_{t+1}),我们通过时间滚动构造伪目标: g_t = roll(s_{t+1}),(1)
该时间滚动操作将未来状态扩展到单步转移之外,超越瞬时相邻性,建模更长距离的时间依赖。因此,所学表征在对比学习范式下被优化以捕捉多步环境动力学,而非仅仅拟合瞬时状态转移。
随后,我们通过共享编码器将所有观测状态和构造的伪目标映射到统一的隐空间: ϕ_x = ϕ_ψ(s_t), ϕ_y = ϕ_ψ(s_{t+1}), ϕ_g = ϕ_ψ(g_t).(2)
编码器使用双目标对比损失进行训练,以正则化隐空间几何: L_TE(ψ, λ) = −J_dist(ϕ_x, ϕ_g) + λ C_step(ϕ_x, ϕ_y),(3)
其中核心项 J_dist 作为对比目标,强制在隐空间中时间相距较远的状态对之间进行显式特征分离,区分可达与不可达的时间状态关系;作为补充,步级平滑项 C_step 作为连续状态之间的正则约束,防止特征突变并保持隐演化的连续性。两者联合优化塑造了物理上一致的隐几何,使隐空间距离显式反映真实机器人轨迹的时间可达性与多步转移逻辑。
基于时间距离的目标进度奖励
对策略 π_θ 而言,关键目标是衡量朝向隐目标 z 的进度。令 z̄(·) 表示投影后的隐表征,奖励定义为: r_tldr(s_t, s_{t+1}, z) = ‖z − z̄(s_t)‖2 − ‖z − z̄(s{t+1})‖_2.(4)
该形式具有清晰的直观含义:若下一状态在隐空间中更接近目标,则奖励为正;否则为负。因此,策略被持续驱动朝目标接近的方向优化,得到密集且具方向信息的学习信号。
TeCH 真机迁移
将无监督强化学习部署到人形机器人面临真实观测有限、sim-to-real 动力学鸿沟、运动不稳定以及无约束探索导致的异常行为等问题。为解决这些问题并增强 sim-to-real 迁移,我们采用四个训练组件:使用非对称训练处理部分可观测性;利用域随机化降低仿真过拟合;引入辅助目标保证运动稳定性与安全性;使用以隐变量为条件的风格判别器,正则化策略生成类人行为。上述模块的详细实现均遵循 BFM-Zero 18。
预训练流程
如图 2 所示,预训练流程由三个迭代模块组成:在线交互(online interaction)、经验回放(experience replay)和 multi-objective optimization。这些组件构成一个闭环训练回路,在并行仿真环境中持续运行。

在在线交互阶段,策略以隐变量 z 为条件执行动作,并收集形如 (s_t, o_{t−k:t}, a_t, s_{t+1}, z_t) 的转移,存入在线 replay buffer。重要的是,隐变量 z 并非来自单一来源,而是由三种互补信号混合构造,共同平衡探索多样性、目标可达性和行为先验:
- 随机采样的隐变量(例如来自高斯或超球面先验),扩大隐任务空间覆盖并鼓励行为多样性;
- 与在线样本相关联的隐表征,将学习对齐到当前策略可达的目标;
- 来自专家轨迹的隐表征,注入人类运动先验并在隐空间中提供稳定锚点。
值得注意的是,TeCH 通过利用所学的时间距离度量实现更灵活的探索策略。除 18 采用的混合目标采样方案(包括随机目标、回放高价值目标和专家目标)外,TeCH 还估计当前状态与候选目标状态之间的时间可达性,并在整个训练过程中根据该可达性估计动态调整目标采样概率。
具体而言,在训练早期阶段,TeCH 为时间相距较远且不常访问的目标分配更高的采样概率,从而鼓励更广泛的探索。随着策略逐步稳定,采样分布逐渐转向与更高期望回报相关联的区域,使学习聚焦于精炼与任务相关的技能,提升整体策略性能。
在经验回放阶段,学习器同时从在线 replay buffer 中采样转移批次,并从无标签专家演示中采样轨迹片段,分别用于构造判别器学习信号和表征学习目标。
随后训练进入 multi-objective optimization 阶段,参数按 判别器 → 编码器(ϕ_ψ) → 主 Critic 与辅助 Critic → Actor → 目标网络软更新 的顺序依次更新。该闭环过程重复直至收敛。
从优化角度看,Actor 由三个互补学习信号驱动:由 r_tldr 诱导的表征目标 Q_REP、风格目标 Q_D,以及辅助目标 Q_R。将这些项组合得到最终 Actor 目标: L(π) = − E_{(o_{t,H}, s_t)∼D, a_t=π(o_{t,H}, z), z∼ν} λ_REP Q_REP + λ_D Q_D + λ_R Q_R.(5)
TeCH 的完整预训练过程见算法 ??。为简洁起见,与并行环境仿真和分布式训练相关的实现细节被省略。
TeCH 零样本推理
在测试阶段,TeCH 可以 zero-shot 方式求解多种任务,无需任何额外的任务特定学习、规划或微调。我们首先将不同的下游任务嵌入到隐空间,并考虑两类代表性任务。 • 目标到达(Goal Reaching):给定不连续的目标状态,将其映射为多个策略条件 z,使机器人能够在不同目标姿态之间切换。 • 轨迹跟踪(Trajectory Tracking):在参考轨迹窗口内聚合未来状态,并将其映射为隐条件序列 {z_t},使策略能够逐步跟踪目标运动。
TeCH 不属于基于 successor feature 的无监督强化学习范式,因此不提供统一的基于值的推理接口。这导致它通常无法直接支持如 18 中那样的奖励优化任务。相比之下,TeCH 引入了时间距离感知表征,显式编码相对于当前状态的时间可达性关系。因此,在零样本跟踪场景下,TeCH 常常表现出更快、更紧致的轨迹跟踪行为。
目标到达。对于目标到达任务,对应的隐向量形式化为: z_g = ϕ(s_g),(6) 其中 ϕ(·) 表示 TeCH 的时间距离编码器。
跟踪。对于运动轨迹跟踪,给定轨迹 τ = {s_1, …, s_n},策略的隐变量序列 {z_t} 定义为: z_t = Σ_{t′=t}^{t+H} w_{t′} ϕ(s_{t′}),(7) 其中 H 表示前瞻时间窗口,w_{t′} 为满足 w_{t′} ≥ 0 且 Σ_{t′=t}^{t+H} w_{t′} = 1 的折扣权重。
实验
实验设置
本节在仿真和真机平台上全面评估 TeCH。我们基于 IsaacLab 25 在 Unitree G1 人形机器人仿真环境 43 中训练两种方法。仿真频率设为 200 Hz,控制频率为 50 Hz。运动数据集采用 LAFAN1 10,已重定向到 Unitree G1 机器人,包含约 40 段各数分钟的运动片段。
仿真结果
运动跟踪
该评测衡量运动序列的模仿精度。我们在训练数据集(LAFAN1 10,40 段片段,总计约 2–3 小时)和测试数据集(100-Style 24,3–4k 段片段,总计约 18–19 小时)上评估策略,所有运动均重定向到 G1 机器人。我们使用关节位置误差作为评估指标: E_mae(e, m) = (1/|e|) Σ_^{|e|} ‖q_t(e) − q_t(m)‖,(8) 其中 m 表示目标运动轨迹。最终结果报告为所有运动片段的平均误差。
不同于 SONIC 等依赖任务特定运动跟踪奖励和模仿学习的框架,BFM-Zero 和 TeCH 探索无监督强化学习进行人形机器人控制,学习统一的可复用技能隐空间,从而支持不连续的目标到达和分层规划。
尽管如此,我们仍与最先进的通用运动跟踪控制器 SONIC 23 进行对比。我们在相同环境和测试集上评估公开发布的模型,报告 E_mae 及其在运动片段上的标准差。为公平起见,BFM-Zero、TeCH 和 SONIC 23 均不启用 early termination,即指标在完整轨迹上计算。由于 SONIC 在严重失败或跌倒后通常难以快速恢复,我们额外报告 SONIC (TER.),其指标仅在终止前的片段上计算。
表 I. TeCH 与基线方法在训练集和测试集上的运动跟踪误差(E_mae)(↓)(均值 ± 标准差)。
| Method | LAFAN1 | 100-Style |
|---|---|---|
| SONICb | 0.2916 ± 0.1887 | 0.1522 ± 0.1049 |
| SONIC (TER.)a | 0.1081 ± 0.0213 | 0.1355 ± 0.0351 |
| BFM-Zerob | 0.1510 ± 0.0255 | 0.1674 ± 0.0459 |
| TeCHb | 0.1318 ± 0.0329 | 0.1474 ± 0.0405 |
a SONIC (TER.) 仅在终止前的片段上评估。 b SONIC、BFM-Zero 与 TeCH 均在完整轨迹上评估。
从跟踪结果可以看出,SONIC 23 在跌倒恢复和地面过渡期间表现较差,这显著降低了其在测试集上的整体跟踪表现。在完全分布外条件下(例如外部扰动、跌倒或随机初始化),BFM-Zero 和 TeCH 通常能够更自然地恢复平衡并继续稳定跟踪,而 SONIC 往往无法回到稳定的运动状态。我们将这一优势主要归因于 off-policy 的无监督探索。与依赖大规模运动模仿监督的方法相比,像 TeCH 这样的无监督 RL 框架在训练期间覆盖了更广泛的非标准状态和动态转移,从而得到更平滑、更连续的技能空间。
即便仅就跟踪精度而言,TeCH 也达到了与 SONIC (TER.) 相当的水平,如表 I 所示。值得注意的是,SONIC 在其原始评估中已经优于 GMT 4、Any2Track 42 和 BeyondMimic 19。我们还要强调训练效率上的显著差异:SONIC 23 使用 128 块 GPU、大规模运动数据集和海量并行环境进行训练;而本方法仅用单卡 GPU 和数小时的 LAFAN1 数据完成训练,将 GPU 小时和环境样本数降低了近两个数量级。
为更细致地比较这两种无监督 RL 方法,我们在图 3 中给出定性的运动跟踪结果。TeCH 实现了高精度的运动跟踪,生成的轨迹在关节层面与参考运动紧密对齐,表明所学表征有效捕捉了局部姿态结构。此外,TeCH 始终优于 BFM-Zero,尤其是在缓解全局根部旋转漂移方面,如图 4 的定量结果所进一步支持,特别是在快速旋转场景下。这一性能差距源于 BFM-Zero 的局限:它通过间接的 forward-backward 分解学习表征,在 successor measure M 中引入近似误差,限制了其对全局朝向、长时序相位信息和累积根部漂移的建模能力。相比之下,TeCH 更直接地构造跟踪目标,在保持精确局部关节精度的同时获得更优的全局姿态一致性。


目标到达
我们从训练数据集(即 LAFAN1)中人工提取 21 个“稳定”姿态,定义为速度为零的状态。为衡量智能体与目标姿态之间的接近程度,我们将关节误差定义为: E_mae(e, g) = (1/|e|) Σ_^{|e|} ‖q_t(e) − q(g)‖,(9) 其中 e 表示一个 episode,q(·) 表示关节配置(即 29 维向量)。最终结果报告为所有目标姿态的平均值。每个 episode 的固定 horizon 为 H = 500。
图 5(a) 比较了 BFM-Zero 与 TeCH 在目标到达任务上的关节级平均绝对误差。结果显示两种方法精度相当,而 TeCH 在精度略有下降的情况下能更高效地到达目标。图 5(b) 展示了三个随机选取的目标姿态,体现其多样性与复杂度。图 5(c) 给出定性结果,机器人成功从躺下过渡到坐立再到站立,展现出鲁棒的恢复行为。

值得注意的是,即便在具有挑战性的恢复场景中,TeCH 也能产生连贯的轨迹到达目标。相比之下,如 SONIC 23 等基于跟踪的方法在不连续目标过渡上表现挣扎,凸显出纯跟踪驱动目标在不连续目标到达上的局限。
TeCH 真机实验结果
如图 6 与图 7 所示,TeCH 部署到真实硬件后在运动跟踪和目标到达上同样表现出色。当大型外力扰动推搡机器人时,TeCH 能像 BFM-Zero 一样在跌倒后自主站起,而基线 SONIC 23 则无法从跌倒状态恢复。这是因为我们的统一隐目标空间在预训练中编码了全身恢复运动,使策略无需单独的跌倒恢复微调即可生成自扶正轨迹。
然而,两种无监督 RL 方法在真机测试中表现出不同的行为特性。与 BFM-Zero 相比,TeCH 倾向于更直接地执行目标运动,响应更激进,有时会导致行为略微不平滑。这是因为我们的表征损失以最小化隐目标之间的转移步数为优化目标,将快速状态切换优先于运动平滑性;而 BFM-Zero 的运动模仿判别器损失则使策略偏向从 mocap 数据集中提取的更缓慢、渐进的运动。


随机采样运动
我们进一步研究从隐动作空间 Z 中采样的无条件随机 rollout 的质量,如图 8 所示。我们观察到,完全随机的隐样本即可在没有任何任务引导或运动先验的情况下产生连贯、类人的人形机器人运动序列。人形 avatar 在多样平衡姿态之间平滑过渡,从深蹲到大开站位重心转移以及四肢伸展,展现出自然的人类般流畅性,避免了在正则化不足的隐表征中常见的关节痉挛或漂浮伪影。

隐空间插值
如图 1 右侧绿色虚线轨迹所示,在两个目标隐嵌入之间进行线性隐空间插值,可产生平滑、物理一致的人形机器人运动序列。沿插值路径的中间机器人姿态连续且渐进地演化,没有扭曲或破碎的异常运动。这验证了我们学到的隐目标空间具有有效的连续结构:嵌入空间中直接的线性插值即可映射到机器人平滑的顺序状态转移,同时支持运动跟踪和目标到达规划。
消融实验
隐空间维度
无监督行为基础模型的性能在很大程度上取决于隐空间 Z⊆R^D 的表征能力:当 D 过小时,任务嵌入和 successor feature 可能无法区分不同技能;当 D 过大时,优化变得更困难、样本效率下降,并可能因冗余表征和估计方差增大而出现训练不稳定。
为分析该超参数的影响,我们固定其他所有训练设置(网络架构、学习率、域随机化和判别器奖励权重),在 Unitree G1 仿真环境中评估 BFM-Zero 和 TeCH。我们扫描隐维度 D∈{32, 64, 128, 256, 384, 512, 1024},并以 LAFAN1 数据集上的 Earth Mover's Distance(EMD)31 作为动作分布匹配的指标(越低越好,表示与参考运动分布更接近)。
如图 9 所示,两种方法的 EMD 都随 D 增大而下降,表明动作分布拟合改善,但收益递减。性能在 D≥256 时基本饱和。在所有设置下,TeCH 始终取得低于 BFM-Zero 的 EMD,表明在相同容量下它能更准确地捕捉目标运动分布。当 D 足够大时,采用 successor feature 分解的 BFM-Zero 也能达到相当的性能。综合考虑性能、计算成本和训练稳定性之间的权衡,我们在所有主实验中采用 D=256 作为默认隐维度。

TeCH 编码器学习率
对 TeCH 中的编码器学习而言,过大的学习率可能导致隐几何不稳定,而过小的学习率可能导致进度信号稀疏和策略更新滞后。为研究其对运动分布拟合的影响,我们固定 D=256 及其他所有超参数,扫描编码器学习率 lr∈{5×10^{−5}, 3×10^{−6}, 10^{−5}, 3×10^{−6}, 10^{−6}, 8×10^{−7}, 10^{−9}}。我们报告训练过程中的 EMD(越低越好)。
如图 10 所示,较大的学习率(lr≈3×10^{−5})使 EMD 在早期迅速下降,但很快在较高水平饱和且波动较大,表明时间距离结构没有得到充分精炼。较小的学习率(3×10^{−6} 和 10^{−6})带来更平滑的收敛和更好的性能,在大约 100M 步后达到稳定区间,但仍属次优。最佳性能出现在 lr=8×10^{−7},在标准训练预算内取得最低 EMD。进一步降至 10^{−9} 可缓慢改善性能,但显著拖慢收敛。总体而言,收敛速度与最终性能之间存在明显权衡,我们在所有实验中采用 lr=8×10^{−7} 作为默认设置。

在线隐目标更新频率
除编码器学习率外,TeCH 还依赖于在线交互期间周期性刷新隐目标 z(对应 update-z-every 超参数)。该间隔决定一个被采样的隐变量在重新采样之前保留多少环境步。过短的间隔可能削弱长时序一致性,而过长的间隔可能降低技能多样性并使 replay 数据在隐空间过度集中。我们固定 D=256 和上述最优学习率,扫描 update-z-every∈{5, 10, 50, 100, 200}。
如图 11 所示,所有曲线在早期迅速下降,并在约 40M 步后开始分化。每 5 或 10 步更新一次 z 带来最快的收敛和最平滑的曲线,在 110M 步时取得最低 EMD(约 0.70)。update-z-every=50 略差,最终 EMD 约 0.78;而 100 和 200 分别为 0.81 与 0.83–0.85。总体而言,更频繁的 z 重采样通过在并行环境中增加行为覆盖同时保持稳定的时间表征,改善了动作分布拟合。然而,当间隔从 50 增加到 100 和 200 时,性能增益饱和。
update-z-every=5 与 =10 之间的差异在 80M 步后变得可忽略。综合所有消融结果,我们在主实验中采用 lr=8×10^{−7} 与 update-z-every=10 作为默认设置。

结论
本文提出了一种基于对比学习 TLDR 框架构建的新型无监督人形机器人控制方法。与依赖严格线性 MDP 假设的现有 FB 表征不同,TeCH 直接在隐空间中建模时间可达性,产生稳定、密集的奖励信号并支持有效的 off-policy 训练。结合一系列实用的训练策略(包括非对称训练、域随机化、辅助目标与风格正则化),本方法很好地解决了部分可观测性、sim-to-real 鸿沟以及不稳定或异常运动等问题。大量仿真和物理机器人实验验证了本方法以高数据效率和强泛化能力实现高精度零样本跟踪与目标到达,展现出在真实人形机器人部署方面的巨大潜力。
参考文献
- Junik Bae, Kwanyoung Park, and Youngwoon Lee. Tldr: Unsupervised goal-conditioned rl via temporal distanceaware representations, 2024. URL https://arxiv.org/abs/ 2407.08464.
- Yuri Burda, Harrison Edwards, Amos Storkey, and Oleg Klimov. Exploration by random network distillation, 2018. URL https://arxiv.org/abs/1810.12894.
- Zixuan Chen, Xialin He, Yen-Jen Wang, Qiayuan Liao, Yanjie Ze, Zhongyu Li, S. Shankar Sastry, Jiajun Wu, Koushil Sreenath, Saurabh Gupta, and Xue Bin Peng. Learning smooth humanoid locomotion through lipschitz-constrained policies.CoRR, abs/2410.11825, 2024.
- Zixuan Chen, Mazeyu Ji, Xuxin Cheng, Xuanbin Peng, Xue Bin Peng, and Xiaolong Wang. GMT: general motion tracking for humanoid whole-body control.CoRR, abs/2506.14770, 2025.
- Xuxin Cheng, Yandong Ji, Junming Chen, Ruihan Yang, Ge Yang, and Xiaolong Wang. Expressive wholebody control for humanoid robots.arXiv preprint arXiv:2402.16796, 2024.
- Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, and Alan Fern. Learning multi-modal wholebody control for real-world humanoid robots, 2025. URL https://arxiv.org/abs/2408.07295.
- Benjamin Eysenbach, Abhishek Gupta, Julian Ibarz, and Sergey Levine. Diversity is all you need: Learning skills without a reward function, 2018. URL https://arxiv.org/ abs/1802.06070.
- Zipeng Fu, Qingqing Zhao, Qi Wu, Gordon Wetzstein, and Chelsea Finn. Humanplus: Humanoid shadowing and imitation from humans, 2024. URL https://arxiv.org/abs/ 2406.10454.
- Karol Gregor, Danilo Jimenez Rezende, and Daan Wierstra. Variational intrinsic control, 2016. URL https: //arxiv.org/abs/1611.07507.
- F ´elix G. Harvey, Mike Yurick, Derek Nowrouzezahrai, and Christopher J. Pal. Robust motion in-betweening. ACM Trans. Graph., 39(4):60, 2020.
- Tairan He, Zhengyi Luo, Wenli Xiao, Chong Zhang, Kris Kitani, Changliu Liu, and Guanya Shi. Learning humanto-humanoid real-time whole-body teleoperation.arXiv preprint arXiv:2403.04436, 2024.
- Tairan He, Wenli Xiao, Toru Lin, Zhengyi Luo, Zhenjia Xu, Zhenyu Jiang, Jan Kautz, Changliu Liu, Guanya Shi, Xiaolong Wang, Linxi Fan, and Yuke Zhu. HOVER: versatile neural whole-body controller for humanoid robots. CoRR, abs/2410.21229, 2024.
- Tairan He, Jiawei Gao, Wenli Xiao, Yuanhang Zhang, Zi Wang, Jiashun Wang, Zhengyi Luo, Guanqi He, Nikhil Sobanbab, Chaoyi Pan, Zeji Yi, Guannan Qu, Kris Kitani, Jessica K. Hodgins, Linxi Fan, Yuke Zhu, Changliu Liu, and Guanya Shi. ASAP: aligning simulation and realworld physics for learning agile humanoid whole-body skills.CoRR, abs/2502.01143, 2025.
- Tairan He, Zhengyi Luo, Xialin He, Wenli Xiao, Chong Zhang, Weinan Zhang, Kris M Kitani, Changliu Liu, and Guanya Shi. Omnih2o: Universal and dexterous human-to-humanoid whole-body teleoperation and learning. InConference on Robot Learning, pages 1516–1540. PMLR, 2025.
- Xialin He, Runpei Dong, Zixuan Chen, and Saurabh Gupta. Learning getting-up policies for real-world humanoid robots, 2025. URL https://arxiv.org/abs/2502. 12152.
- Jongmin Kim, Youngwoon Lee, Pieter Abbeel, and Guanya Shi. Variational curriculum reinforcement learning for unsupervised discovery of skills, 2023. URL https://arxiv.org/abs/2303.16342.
- Lisa Lee, Benjamin Eysenbach, Emilio Parisotto, Eric Xing, Sergey Levine, and Ruslan Salakhutdinov. Efficient exploration via state marginal matching, 2020. URL https://arxiv.org/abs/1906.05274.
- Yitang Li, Zhengyi Luo, Tonghe Zhang, Cunxi Dai, Anssi Kanervisto, Andrea Tirinzoni, Haoyang Weng, Kris Kitani, Mateusz Guzek, Ahmed Touati, Alessandro Lazaric, Matteo Pirotta, and Guanya Shi. Bfm-zero: A promptable behavioral foundation model for humanoid control using unsupervised reinforcement learning, 2025. URL https://arxiv.org/abs/2511.04131.
- Qiayuan Liao, Takara E. Truong, Xiaoyu Huang, Guy Tevet, Koushil Sreenath, and C. Karen Liu. Beyondmimic: From motion tracking to versatile humanoid control via guided diffusion, 2025. URL https://arxiv. org/abs/2508.08241.
- Hao Liu and Pieter Abbeel. Cic: Contrastive intrinsic control for unsupervised skill discovery, 2022. URL https://arxiv.org/abs/2202.00161.
- Zhengyi Luo, Jinkun Cao, Alexander Winkler, Kris Kitani, and Weipeng Xu. Perpetual humanoid control for real-time simulated avatars. InICCV, pages 10861– 10870. IEEE, 2023.
- Zhengyi Luo, Jinkun Cao, Josh Merel, Alexander Winkler, Jing Huang, Kris M. Kitani, and Weipeng Xu. Universal humanoid motion representations for physicsbased control. InICLR. OpenReview.net, 2024.
- Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Sirui Chen, Fernando Casta ˜neda, Zi-Ang Cao, Jiefeng Li, David Minor, Qingwei Ben, Xingye Da, Runyu Ding, Cyrus Hogg, Lina Song, Edy Lim, Eugene Jeong, Tairan He, Haoru Xue, Wenli Xiao, Zi Wang, Simon Yuen, Jan Kautz, Yan Chang, Umar Iqbal, Linxi ”Jim” Fan, and Yuke Zhu. Sonic: Supersizing motion tracking for natural humanoid whole-body control, 2025. URL https://arxiv.org/abs/2511.07820.
- Ian Mason. 100STYLE: A motion capture dataset of 100 locomotion styles, 2023. URL https://www.ianxmason. com/100style/.
- Mayank Mittal, Calvin Yu, Qinxi Yu, Jingzhou Liu, Nikita Rudin, David Hoeller, Jia Lin Yuan, Ritvik Singh, Yunrong Guo, Hammad Mazhar, Ajay Mandlekar, Buck Babich, Gavriel State, Marco Hutter, and Animesh Garg. Orbit: A unified simulation framework for interactive robot learning environments.IEEE Robotics Autom. Lett., 8(6):3740–3747, 2023.
- Deepak Pathak, Pulkit Agrawal, Alexei A. Efros, and Trevor Darrell. Curiosity-driven exploration by selfsupervised prediction, 2017. URL https://arxiv.org/abs/ 1705.05363.
- Xue Bin Peng, Marcin Andrychowicz, Wojciech Zaremba, and Pieter Abbeel. Sim-to-real transfer of robotic control with dynamics randomization.CoRR, abs/1710.06537, 2017. URL http://arxiv.org/abs/1710. 06537.
- Xue Bin Peng, Pieter Abbeel, Sergey Levine, and Michiel van de Panne. Deepmimic: example-guided deep reinforcement learning of physics-based character skills. ACM Trans. Graph., 37(4):143, 2018.
- Ilija Radosavovic, Tete Xiao, Bike Zhang, Trevor Darrell, Jitendra Malik, and Koushil Sreenath. Real-world humanoid locomotion with reinforcement learning.Sci. Robotics, 9(89), 2024.
- Ilija Radosavovic, Bike Zhang, Baifeng Shi, Jathushan Rajasegaran, Sarthak Kamat, Trevor Darrell, Koushil Sreenath, and Jitendra Malik. Humanoid locomotion as next token prediction.CoRR, abs/2402.19469, 2024.
- Yossi Rubner, Carlo Tomasi, and Leonidas J. Guibas. The earth mover’s distance as a metric for image retrieval. International Journal of Computer Vision, 40(2):99–121, 2000.
- Younggyo Seo, Carmelo Sferrazza, Haoran Geng, Michal Nauman, Zhao-Heng Yin, and Pieter Abbeel. Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control.CoRR, abs/2505.22642, 2025.
- Agon Serifi et al. Vmp: Versatile motion priors for robustly tracking motion on physical characters.Computer Graphics F orum, 43(8), 2024. doi: 10.1111/cgf.15175. URL https://doi.org/10.1111/cgf.15175.
- Chen Tessler, Yunrong Guo, Ofir Nabati, Gal Chechik, and Xue Bin Peng. Maskedmimic: Unified physics-based character control through masked motion inpainting. ACM Trans. Graph., 43(6):209:1–209:21, 2024.
- Ahmed Touati and Yann Ollivier. Learning one representation to optimize all rewards. InNeurIPS, pages 13–23, 2021.
- Ahmed Touati and Yann Ollivier. Learning one representation to optimize all rewards, 2021. URL https: //arxiv.org/abs/2103.07945.
- Denis Yarats, Rob Fergus, Alessandro Lazaric, and Lerrel Pinto. Reinforcement learning with prototypical representations, 2021. URL https://arxiv.org/abs/2102.11271.
- Kangning Yin, Weishuai Zeng, Ke Fan, Zirui Wang, Qiang Zhang, Zheng Tian, Jingbo Wang, Jiangmiao Pang, and Weinan Zhang. Unitracker: Learning universal whole-body motion tracker for humanoid robots.CoRR, abs/2507.07356, 2025.
- Kevin Zakka, Baruch Tabanpour, Qiayuan Liao, Mustafa Haiderbhai, Samuel Holt, Jing Yuan Luo, Arthur Allshire, Erik Frey, Koushil Sreenath, Lueder A. Kahrs, Carmelo Sferrazza, Yuval Tassa, and Pieter Abbeel. Mujoco playground.CoRR, abs/2502.08844, 2025.
- Weishuai Zeng, Shunlin Lu, Kangning Yin, Xiaojie Niu, Minyue Dai, Jingbo Wang, and Jiangmiao Pang. Behavior foundation model for humanoid robots, 2025. URL https://arxiv.org/abs/2509.13780.
- Zhikai Zhang, Chao Chen, Han Xue, Jilong Wang, Sikai Liang, Yun Liu, Zongzhang Zhang, He Wang, and Li Yi. Unleashing humanoid reaching potential via real-worldready skill space.CoRR, abs/2505.10918, 2025.
- Zhikai Zhang, Jun Guo, Chao Chen, Jilong Wang, Chenghuai Lin, Yunrui Lian, Han Xue, Zhenrong Wang, Maoqi Liu, Jiangran Lyu, Huaping Liu, He Wang, and Li Yi. Track any motions under any disturbances, 2025. URL https://arxiv.org/abs/2509.13833.
- . G1, 2025. URL https://www.unitree.com/cn/g1/.