Preprint
Jul 2026
MIRROR: Learning from the Other View for Multi-Modal Reasoning
Modality-Informed Reciprocal Reasoning Optimization (MIRROR), a reinforcement learning approach for improving multimodal reasoning via self supervision, is developed and improves over standard RL and yields more accurate and consistent behavior across modalities.
Wen Ye, Yuxiao Qu, Aviral Kumar et al.
· 0 citations