Hugging Face daily papers·12d agoFLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation#contrastive-learning#cross-modal-retrieval#image-captioning1