arXiv cs.AI / cs.LG / cs.CL·19d agoxDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems#agentic-settings#benchmark#frontier-modelsAI research