arXiv cs.AI / cs.LG / cs.CL·11d agoJustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management#inference#kv-cache#llm-servingAI research
arXiv cs.AI / cs.LG / cs.CL·15d agoRethinking Heterogeneous System Disaggregation for Subquadratic Attention#disaggregated-inference#energy-efficiency#heterogeneous-computingAI research
arXiv cs.CR·19d agoHoneyRoute: Honeypot-Model Routing for Adversarial LLM Serving#adversarial-detection#gcg#honeypotAI safety & security