A Zeroth-Order Paradigm for LLM Preference Alignment
Researchers propose ComPO, a zeroth-order comparison-based preference alignment method with convergence guarantees that mitigates likelihood displacement in LLMs.
ComPO extracts directional information from preference pairs via comparison oracles instead of optimizing a differentiable preference loss, addressing likelihood displacement in direct alignment methods. The paper establishes convergence guarantees for the offline scheme and introduces an online variant with reverse-KL control using unlabeled policy generations. Experiments on Mistral, Llama, Gemma-2, Gemma-3, and Qwen3 models show improvements over existing direct alignment methods, including length-controlled win rates.