What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability
Audio-based Multimodal Large Language Models (MLLMs) can generate detailed natural-language descriptions of complex acoustic scenes, yet it remains unclear which parts of the input audio support each generated token. This is particularly challenging because acoustic evidence is distributed across time and frequency, an...