arXiv cs.AI / cs.LG / cs.CL·2d agoJev-Mobile: Jev as an Executor for Mobile GUI Agents#jev-mobile#gui-agents#androidworldAI research
Hugging Face daily papers·3d agoWorld Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal#robotics#vlm#agents1
arXiv cs.AI / cs.LG / cs.CL·3d agoAnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios#autonomous-driving#vlm#datasetAI research
Hugging Face daily papers·8d agoSpatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World#spatial-reasoning#vision-language-models#curriculum-learning
Hugging Face daily papers·8d agoTransferring the Intelligence of VLMs to Robotic Control#robotics#vlm#robodawn
arXiv cs.AI / cs.LG / cs.CL·8d agoDiaVLo: Diagnosing Behaviours of Vision-Language Models#vision-language-models#diagnostics#alignmentAI research
arXiv cs.AI / cs.LG / cs.CL·9d agoPerception, Layout, and Validation: Calibrated Confidence for Reliable Straight-Through Processing of Financial Documents#confidence-calibration#conformal-risk-control#document-processingAI research
arXiv cs.CR·10d agoRobot Visions: Breaking reCAPTCHA at Zero Cost and Zero Shot#bot-mitigation#captcha-solving#clipAI safety & security1
Hugging Face daily papers·11d agoIn-Context Robot Learning with VLM Agents#embodied-ai#gpt-policy#in-context-learning1
Hugging Face daily papers·12d agoRiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation#benchmark#fraud-detection#obfuscation
Hugging Face daily papers·13d agoModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs#audit#evaluation#medgemma1
arXiv cs.AI / cs.LG / cs.CL·17d agoShow-Harness: Just a VLM Agent Can Play Robots#agent-harness#embodied-ai#fine-tuningAI research
arXiv cs.AI / cs.LG / cs.CL·17d agoCan Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization#benchmark#bluesky#content-moderationAI research1
arXiv cs.AI / cs.LG / cs.CL·18d agoCanonical Color as a Lens into Concept Decodability in Vision Encoders and VLMs#concept-representation#interpretability#multimodalAI research1
arXiv cs.AI / cs.LG / cs.CL·19d agoVoT: Vision-of-Thought for Unified Multimodal Representation Alignment#diffusion-transformers#interpretability#multimodalAI research1
arXiv cs.AI / cs.LG / cs.CL·22d agoSame Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models#benchmark#paraphrase-invariance#reward-modelsAI research1
Hugging Face trending models·23d agoTaichuAI/ZDTaichu5.0-9B — new model trending #30 on Hugging Face#agentic#embodied-ai#multimodalModel release 15 min1
arXiv cs.CR·23d agoRepeat-After-Me: Black-Box Adaptive Visual Prompt Injection#ai-agents#black-box-attack#gptAI safety & security
Hugging Face daily papers·23d agoSceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution#3d-scene-generation#agentic#embodied-ai
Hugging Face daily papers·24d agoUnfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning#benchmarks#factosr#multimodal
Hugging Face daily papers·24d agoENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation#3d-reconstruction#instance-tracking#open-source
Hugging Face daily papers·24d agoAdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition#adaptcities#computer-vision#data-augmentation