arXiv cs.AI / cs.LG / cs.CL·3d agoCan LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark#llm#benchmark#code-reasoningAI research