arXiv cs.AI / cs.LG / cs.CL·9d agoOn-Demand Attention: Language Models Know When to Recall#attention#decoding#inference-optimizationAI research
arXiv cs.AI / cs.LG / cs.CL·9d agoTo Copy or Not to Copy: Controlling Speculative Decoding via Intrinsic Model Signals#eagle3#inference-optimization#llamaAI research1
Hacker News · AI·10d agoDeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression#deepseek#deepseek-v4.1-flash#fp4Model release 15 min1
MarkTechPost·10d agoNunchux AI Introduces VC-Attention: A Training-Free Low-Bit Attention Kernel That Speeds Up Video Diffusion Transformers#attention-kernel#inference-optimization#low-bit 5 min1
arXiv cs.AI / cs.LG / cs.CL·10d agorMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference#caching#edge-ai#embodied-aiAI tools & infra1
Hugging Face daily papers·12d agoFathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches#decoding#host-memory-offload#inference-optimization1
Hugging Face daily papers·13d agoVC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention#diffusion-transformers#fp8#gpu-kernels1
Hugging Face trending models·18d agoukisai/Swift-Qwen3.8-27b — new model trending #30 on Hugging Face#fine-tune#gguf#inference-optimizationModel release 13 min1
Hugging Face daily papers·20d agoOnline Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training#context-parallelism#inference-optimization#nvidia1
Hugging Face daily papers·23d agoBeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference#chain-of-thought#inference-optimization#kv-cache1
Help Net Security·Aug 13, 2026DataGrout helps enterprises control AI usage, governance and LLM costs#ai-governance#datagrout#finopsAI tools & infra 3 min1