Cross-Modal Comprehensive Multi-Level Granularity Alignment for Vision-Language Pre-Training
Vision-Language Pre-training (VLP) aims to convert vision-language tasks into image-text matching challenges, necessitating robust interaction between visual and textual modalities. However, current research often faces a trade-off: methods pursuing fine-grained alignment typically rely on computationally expensive obj...