Hugging Face daily papers·13d agoBellman Policy Optimization#bellman-equations#llm-reasoning#policy-optimization