CANOPY: Adaptive-Granularity Evidence Compression for Multimodal RAG
CANOPY compresses multimodal RAG evidence at mixed granularities, cutting reader tokens without hurting answer accuracy.
CANOPY compresses retrieved text, tables, images, and video after multimodal retrieval by representing items as hierarchies and scoring regions with a node encoder fine-tuned on gold evidence. Parent-relative refinement selects multiple regions at different granularities without LLM calls for node pruning, and a critic can request targeted follow-up retrieval when evidence looks insufficient. Across five QA benchmarks on a 33-million-item corpus, it beats the evaluated retrieval baselines, with extra retrieval driving most multi-hop gains. Using unrouted Qwen3-VL-8B-Instruct, compression reduces reader-input tokens by 14.2-27.7% versus the same iterative pipeline without compression, with comparable accuracy.