arXiv cs.AI / cs.LG / cs.CL·12d agoLearning Multimodal One-step Flow Policy via Value-weighted Optimal Transport#flow-matching#multimodal#offline-rlAI research1