arXiv cs.AI / cs.LG / cs.CL·4d agoFlash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs#diffusion-llm#kv-cache#inferenceAI research 2 sources1
arXiv cs.AI / cs.LG / cs.CL·9d agodQwen3.5: Hybrid-Attention Diffusion Language Models#diffusion-language-models#efficiency#hybrid-attentionAI research1
Hugging Face daily papers·24d agoUnlocking Lossless Speedups in LLMs via Discrete Diffusion#discrete-diffusion#distillation#llm-inference