Preprint
Aug 2026
PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
Perception-Enhanced Alignment DPO (PEA-DPO), a framework for multimodal LLMs alignment, which explicitly leverages visual preference signals to overcome visual insensitivity is proposed, which demonstrates that PEA-DPO enhances sensitivity to visual context while preserving the language modeling capacity of the base model.
Jiawei Feng, Jiancan Wu, Xingyu Zhu et al.
· 1 citation