Hugging Face daily papers·12d agoEvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents#evolvetrade#finance#llm-agents
arXiv cs.AI / cs.LG / cs.CL·12d agoBellman Policy Optimization#llm-reasoning#math-reasoning#policy-optimizationAI research
Hugging Face daily papers·13d agoBellman Policy Optimization#bellman-equations#llm-reasoning#policy-optimization
arXiv cs.AI / cs.LG / cs.CL·18d agoEntropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation#arxiv#code-generation#entropy-regularizationAI research1