MINER: Multi-crop INference-time Enhancement for Rare-Object Retrieval with Frozen Dual Encoders
Text-to-image retrieval with frozen dual encoders degrades when the query names a small, visually subordinate object in a cluttered scene: a single global image embedding underrepresents the localized visual evidence. We present MINER, a training-free inference framework that augments a frozen dual encoder's global ima...