arXiv cs.AI / cs.LG / cs.CL·4d agoBeyond Repeated Sampling: Learning Search Policies for LLM Reasoning#llm#reasoning#test-time-computeAI research
Hugging Face daily papers·19d agoDifficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR#llm-training#pass-at-k#reasoning2