Hacker News · AI·1d agoA single function Jev-like wrapper for LLMs, including vision models#logprobs#vision-llm#jev 9 min
arXiv cs.AI / cs.LG / cs.CL·4d agoMeasuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation#tool-use#evaluation#ollamaAI research 2 sources
Hugging Face Blog·5d agoTransformers now runs llama.cpp quants#transformers#llama.cpp#quantizationAI tools & infra
MarkTechPost·8d agoGGUF vs GPTQ vs AWQ vs EXL2: LLM Model Formats Explained (2026)#awq#exl2#gguf 13 min1
MarkTechPost·8d agoPrismML Releases Ternary Bonsai 2 27B: A 5.9 GB Apache 2.0 Model Retaining 98.2% of Qwen3.8 27B Performance#edge-deployment#gguf#llama.cpp 4 min
Simon Willison·9d agoBonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint#bonsai#ternary#ggufModel release
Hugging Face trending models·10d agoprism-ml/Ternary-Bonsai-2-27B-gguf — new model trending #29 on Hugging Face#gguf#llama.cpp#mlxModel release 2 sources 15 min1
arXiv cs.CR·10d agoThe Illusion of Local Privacy: Confidentiality Boundary Failures in Consumer LLM Serving Systems#llama.cpp#llanalyzer#local-llmAI safety & security
Hacker News · AI·18d agoBenchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses#benchmarking#gguf#llama.cpp 6 min1
Hugging Face trending models·19d agoISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF — new model trending #30 on Hugging Face#apache-2.0#gguf#ista-daslabModel release 12 min1
MarkTechPost·21d agoNous Research Adds One-Click Local Model Setup to Hermes Desktop#hermes-agent#hermes-desktop#llama.cpp 3 min1
NVIDIA Blog·23d agoSparks Fly: NVIDIA Accelerates Local AI at IFA 2026#dgx-spark#hermes-agent#llama.cpp 10 min1
Hugging Face trending models·29d agoXHToken/Spark-X2.5-4B-GGUF — new model trending #30 on Hugging Face#apache-2.0#gguf#llama.cppModel release 2 min1