arXiv cs.AI / cs.LG / cs.CL·9d agoCross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models#cross-modal-attention#image-corruption#llava-onevisionAI research1
arXiv cs.AI / cs.LG / cs.CL·16d agoCan Edge-Deployable Vision-Language Models Identify Species?#benchmark#bioclip#camera-trapsAI research1
arXiv cs.AI / cs.LG / cs.CL·16d agoMindTopo: Can Foundation Models Reason in Topological Space?#agentic-evaluation#benchmark#multimodal-llmAI research
Hugging Face daily papers·26d agoEmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents#embodied-ai#libero#openpi1