Preprint
Jul 2026
Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation
Experimental evaluation on the PoliMemeDecode1 dataset shows that the attention-based fusion significantly outperforms unimodal baselines and standard concatenation methods, achieving a state-of-the-art Macro-F1 of approximately 0.94.
Musa Tur Farazi, Nufayer Jahan Reza
· 0 citations