arXiv cs.AIOctober 7, 2026
MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval
Excerpt
arXiv:2510.15543v2 Announce Type: replace-cross Abstract: Multimodal retrieval, which seeks to retrieve relevant content across modalities such as text or image, supports applications from AI search to contents production. Despite the success of separate-encoder approaches like CLIP aligning modality-specific embeddings with contrastive learning, recent multimodal large language models (MLLMs) enable a unified encoder that directly processes composed inputs. While flexible and advanced, we ident