Arm-wise Compositional Generalization in Dual-Arm Vision-Language-Action Models
AE-VLA lifts dual-arm generalization to 21.53% in simulation and 39% on SO101 robots.
ACG-Bench tests arm-wise compositional generalization for dual-arm vision-language-action policies, with 23 task-condition pairs across eight families: six in-domain conditions and 17 unseen compositions of reordering, synchronization, and cross-task skills. Using pi0.5 as a shared backbone, the authors compare augmentation and architectures including arm-token grouping, SkillLoRA, and arm-wise attention. Combined as AE-VLA, these choices reach 21.53% simulation success versus 2.94% for a single pi0.5 policy, 3.06% for MA-VLA, and 5.53% for two independent pi0.5 policies. On physical SO101 robots, AE-VLA averages 39% success across five unseen conditions versus 10% for the strongest baseline.
- ACG-Bench covers 23 conditions in eight dual-arm families, 17 of them unseen.
- AE-VLA pairs SkillLoRA adapters with arm-wise attention on a pi0.5 backbone.
- Simulation success is 21.53%, versus 2.94% for a single pi0.5 policy.
- SO101 robots reach 39% mean success versus 10% for the strongest baseline.
Full article217 words · extracted from huggingface.co · click to collapse
Generalization in multi-arm collaboration can be studied as composing familiar atomic skills in new ways across arms. However, existing evaluations offer limited insight into which training and architectural choices support this ability under different coordination requirements. We introduce ACG-Bench, a benchmark for Arm-wise Compositional Generalization that provides a common testbed for studying skill recomposition in dual-arm policies. It contains 23 task--condition pairs across 8 task families, with 6 in-domain conditions and 17 unseen compositions covering reordering, synchronization, their combination, and cross-task composition. All methods receive the same per-arm atomic prompts, and success requires achieving the task goal while satisfying physical milestones and specified order or timing constraints. Using π_{0.5} as a common vision-language-action backbone, we compare representative data-augmentation and architectural strategies with shared source data and a common evaluation protocol. Our architectural study examines arm-token grouping, skill-specific LoRA adapters (SkillLoRA), and arm-wise attention (AWA), highlighting the complementarity of skill-conditioned parameters and attention structure. Combining these choices yields AE-VLA, which achieves 21.53\% generalization success in simulation, compared with 2.94\% for Single π_{0.5}, 3.06\% for MA-VLA, and 5.53\% for two independently controlled π_{0.5} policies. On physical SO101 robots, AE-VLA reaches 39.00\% mean success across five unseen conditions, compared with 10.00\% for the strongest baseline. These findings provide empirical guidance for designing dual-arm policies that generalize beyond fixed training routines.
Text extracted automatically; images, tables and formatting may be missing. Original: https://huggingface.co/papers/2610.06184