From Vision to Language: Investigating Causal Information Flow in Multimodal Decision-Making
This work investigates cross-modal information flow in a video-based generative multiple-choice-like setting by applying a layer-wise causal intervention on video-text attention pathways and identifies a distinct pattern in temporal reasoning.
Davide Testa, Hugh Mee Wong, Alessandro Lenci et al.
· 0 citations