arXiv cs.AI / cs.LG / cs.CL·19d agoVoT: Vision-of-Thought for Unified Multimodal Representation Alignment#diffusion-transformers#interpretability#multimodalAI research1