Hugging Face daily papers·5d agoThe Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks#benchmarking#decision-making#llm-agent
Hugging Face daily papers·5d agoGameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay#gameplay#benchmark#dataset 2 sources
arXiv cs.AI / cs.LG / cs.CL·5d agoEmergent Collusion in Long-Horizon LLM Agent Interaction#llm-agents#collusion#multi-agentAI safety & security 2 sources
arXiv cs.AI / cs.LG / cs.CL·12d agoStellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science#agents#competitive-programming#geminiAI research
Hugging Face daily papers·13d agoCADWorld: Computer-Use Benchmark for Long-Horizon Computer-Aided Design#agents#benchmark#cad
Hugging Face daily papers·25d agoSimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models#long-horizon#manipulation#memory