Robust Audio-Visual Question Answering with Missing Modality in Training and Testing.
An AVQA-specific two-stage framework that adapts established cross-modal reconstruction and dependency-modeling principles to the supervision constraints of TM-AVQA is developed, a setting in which modality-complete, audio-missing, and visual-missing samples may occur during both training and testing.