01 / 研究问题

学会每个动作,只是开始。

想象两条机械臂正在叠碗。在训练时的流程里,一条机械臂先抓取并放好碗,另一条再接着做。现在,要求它们交换先后顺序,或者同时抓取,再按新的顺序放置。物体和基本动作都很熟悉,改变的是两条机械臂之间的关系。

这就是逐臂组合泛化(Arm-wise Compositional Generalization):在训练时未见过的协作要求下,复用熟悉的机械臂级技能。这条路径有望让机器人扩展自身行为,而无需为每一种可能的组合都采集示范。

动作熟悉,协作却依然脆弱。在这组 Dual π0.5 示例中,两个独立策略能完成熟悉的串行流程,却在新的同步要求下发生碰撞。两个片段分别以 8 倍速和 4 倍速播放。

为每条机械臂分别配置策略,并不会自动解决协作问题。两条机械臂共享同一个工作空间:对单臂而言合理的动作,可能阻碍另一条机械臂;完成一部分目标,也不意味着整个组合能够成功。

02 / ACG-Bench

保留技能,改变组合。

ACG-Bench 覆盖 8 个任务族,共有 23 个「任务—条件」组合,其中包含 6 个域内条件和 17 个留出组合。留出条件不提供训练示范。我们从以下四个方面改变熟悉技能的协作方式。

Reorder

4 个条件

保持技能与任务目标不变,改变哪条机械臂先执行。

熟悉的顺序

左臂
抓取放置
右臂
抓取放置

时间 →

未见的组合

左臂
抓取放置
右臂
抓取放置

时间 →

示意事件顺序。间距不代表实际动作时长;同步依据基准规定的事件时间容差判定。

仿真中的四类留出组合:顺序重排、同步、同步与重排、跨任务组合。每个画面展示一次选取的 AE-VLA 执行过程,并标明播放倍速。

怎样才算成功?

最终物体摆放状态只是评测的一部分。满足约束的成功,还要求完成规定的物理里程碑,并遵守事件顺序和时序要求。机械臂碰撞会被判为失败。同步条件依据任务指定的完成事件及时间容差评分,并不要求两条机械臂的轨迹完全一致。

所有方法都从同一个基于规则的阶段调度器接收相同的逐臂原子指令,因此评测能够聚焦于给定技能组合的执行能力。基准中的策略无需自行推断高层计划。

跨任务组合让这一问题更加直观:从不同源任务学到的碗操作与方块放置技能,需要在「方块入碗」中共同完成目标。左侧为 Dual π0.5,右侧为 AE-VLA,均以 8 倍速播放。

03 / AE-VLA

一个共享策略,三个设计选择。

我们从与基线相同的预训练 π0.5 骨干出发。AE-VLA 保留共享的视觉语言骨干与动作专家,在动作表示、技能专属参数和注意力连接三个层面引入结构。

全局视角 + 腕部视角 + 逐臂指令与状态共享视觉语言骨干
01

Arm-token grouping

为每条机械臂划分明确的动作 token 组。两组 token 通过同一个动作专家,分别负责对应机械臂的动作输出。

02

SkillLoRA

在机械臂和任务之间共享包含 10 个技能专属低秩适配器的参数库。每条机械臂的可学习路由器根据指令和状态特征选择适配器。

03

Arm-wise attention

将动作注意力限制在各自的机械臂信息流内,同时保留对共享全局上下文的访问。全局特征仍能汇集来自两条机械臂的观测。

一个共享动作专家 → 左臂动作 + 右臂动作

这些设计希望在复用技能的同时,保留协作所需的场景信息。逐臂注意力阻断动作 token 之间直接的跨臂注意力连接,但策略仍通过共享全局特征保持联系。它也改变了各动作组内部的时序注意力,因此实验考察的是这套完整注意力设计的效果。

关键在于组合。

仅对 token 分组,提升较小。单独加入 SkillLoRA 或逐臂注意力,也只能带来有限改善。将三者结合,泛化成功率达到 21.53%。在这组受控对比中,这些设计体现出了更强的协同作用。

仿真消融 · 17 个未见条件的平均成功率
策略设计成功率
Token Group3.82%
Token Group + SkillLoRA6.00%
Token Group + AWA5.82%
AE-VLA · 三者结合21.53%

来源:论文表 2。SkillLoRA 同时增加参数与路由器监督,本消融未单独区分这两项变化的贡献。

04 / 从仿真到真机

用实验衡量泛化。

我们比较 Single π0.5、采用相同 π0.5 初始化的适配版 MA-VLA、每臂一个独立策略的 Dual π0.5,以及 AE-VLA。在每种实验设置中,各方法使用相同的源数据和评测指令。仿真评测中,每种方法在每个条件下运行 100 个回合;真机评测中,每个条件进行 20 次试验。

仿真17 个未见条件
21.53%

较 Dual π0.5 提升 16.00 个百分点

真机 · SO1015 个未见条件
39.00%

较 Dual π0.5 提升 29.00 个百分点

满足约束的成功率,对各条件等权平均。仿真与真机的评测集合不同,这两组百分比不构成直接的仿真到真机迁移对比。来源:论文第 5.2 节及表 2–3。

双 SO101 真机演示。四屏画面分别展示域内、同步与重排,以及两次同步执行,播放速度为 1.5 倍;随后是 2.4 倍速的「方块入碗」。这些选取的片段用于展示行为;上方汇总结果来自论文规定的 5 个未见评测条件。

在真机的「叠碗 / 同步」条件下,AE-VLA 在 20 次试验中成功 12 次,三个基线均为 0 次。在留出的「方块入碗」任务中,AE-VLA 成功 10 次,Dual π0.5 成功 4 次。真机的 5 个未见条件由 2 个重排、2 个同步和 1 个跨任务条件组成。

仍待解决的问题

纯同步仍然困难:仿真成功率为 8.67%。泛化提升也伴随域内成功率下降:AE-VLA 在仿真中为 27.17%,Dual π0.5 为 41.33%;真机中分别为 60% 和 70%。在真机「推方块 / 同步」条件下,Dual π0.5 成功 6/20 次,AE-VLA 为 2/20 次。整体提升较大,但并非每个任务都同样受益。

05 / 下一步

走出固定的协作流程。

这项研究探索了具身智能的一项基础能力:当机械臂之间的协作关系改变时,策略仍能复用每条机械臂已经掌握的技能。明确的逐臂表示、可复用的技能参数和有结构的信息共享,有助于机器人走出固定的协作流程。

下一步,是将组合执行能力与高层规划器连接:把新任务分解为熟悉技能,分配给不同机械臂,决定顺序与时序,再根据执行反馈修正计划。ACG-Bench 研究的是给定计划下的执行能力,完整的规划—执行闭环仍有待探索。

深入学习。
灵活泛化。