arXiv cs.AI / cs.LG / cs.CL·12d agoBellman Policy Optimization#llm-reasoning#math-reasoning#policy-optimizationAI research
Hugging Face daily papers·13d agoBellman Policy Optimization#bellman-equations#llm-reasoning#policy-optimization
arXiv cs.AI / cs.LG / cs.CL·18d agoThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR#grpo#prompt-selection#qwen2.5-mathAI research1
Hugging Face daily papers·19d agoDifficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR#llm-training#pass-at-k#reasoning2
Hugging Face daily papers·20d agoCARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation#chain-of-box#coronary-angiography#explainability
Hugging Face daily papers·22d agoDataFlex-RL: An Evaluation Platform for RLVR Data Policies#data-policy#evaluation#grpo