Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization
DRIVE, a diversity-based RL fine-tune, lifts vision-language-action out-of-domain success, including +9.2 points on real dual-arm robots.
The paper introduces DRIVE, which turns diversity among successful behaviors into an intrinsic reward during reinforcement-learning fine-tuning of vision-language-action policies. Across LIBERO-Plus, ManiSkill3, and RoboTwin 2.0, average out-of-domain performance rises by 5.3 points on pi0 and 2.0 points on pi0.5 versus vanilla RL fine-tuning. On a dual-arm AgileX PiPER-X platform, average out-of-domain success increases from 64.1% to 73.3%.
34