arXiv cs.AI / cs.LG / cs.CL·3d agoLearning the Cost of Reliable Inference#llm-inference#pricing#auctionAI research
arXiv cs.AI / cs.LG / cs.CL·9d agoTo Copy or Not to Copy: Controlling Speculative Decoding via Intrinsic Model Signals#eagle3#inference-optimization#llamaAI research1
arXiv cs.CR·13d agoSpliTEE: Improving LLM Inference on Trusted Hardware with Differentially Private GPU Outsourcing#differential-privacy#gpu-outsourcing#intel-tdxResearch
CERT/CC Vulnerability Notes·15d agoVU#369611: ExLlamaV3 contains Denial of Service vulnerability via insufficient bounds checking on kernel dispatch index#cert-cc#cuda#denial-of-serviceCVE-2026-84286 2 min1
Hugging Face daily papers·24d agoUnlocking Lossless Speedups in LLMs via Discrete Diffusion#discrete-diffusion#distillation#llm-inference
Hugging Face daily papers·Aug 27, 2026HyQuant: Hybrid-Precision Quantization for LLM Attention#attention#efficiency#kv-cache1
Hugging Face daily papers·Aug 11, 2026A Three-Layer Caching Architecture for Low-Latency LLM Web Search on Commodity CPU Hardware#answer-engine#caching#cpu2