arXiv cs.AI / cs.LG / cs.CL·8d agoBrainWideBench: Benchmarking large-scale pretraining and across-animal transfer in multi-region neural recordings#brainwidebench#benchmark#neural-recordingsAI research
arXiv cs.AI / cs.LG / cs.CL·8d agoAbstention and Noise Filtering: Two Missing Primitives of Softmax Attention#attention#softmax#gatingAI research
Hugging Face daily papers·9d agoHuRo: Robotizing Human Videos for Scalable VLA Pretraining#data-scaling#human-video#manipulation
arXiv cs.AI / cs.LG / cs.CL·9d agoHow Does Distribution Shift Shape Pretraining Gains in Neural PDE Surrogates?#cfd#distribution-shift#fine-tuningAI research1
arXiv cs.AI / cs.LG / cs.CL·10d agoHow Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents#compute-efficiency#looped-transformers#model-growthAI research
Hugging Face daily papers·12d agoLimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence#causal-inference#foundation-models#in-context-learning
arXiv cs.AI / cs.LG / cs.CL·12d agoDisentangling Representation Evolution in Transformers through Directional Decomposition#interpretability#model-editing#pretrainingAI research1
Hugging Face daily papers·13d agoMoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup#efficient-inference#interpretability#memory-embeddings2
Hugging Face daily papers·13d agoDisentangling Representation Evolution in Transformers through Directional Decomposition#compression#interpretability#model-editing
Hugging Face daily papers·23d agoGE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation#embodied-ai#ge-act#manipulation
Hugging Face daily papers·25d agoGraph Machine: Towards Better Pretraining via Edges#architecture#efficiency#graph-machine