Preprint
Jul 2026
Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts
A multimodal solution that integrates audio and text information via cross-modal transformers, where text transcripts are automatically generated via an automatic speech recognition (ASR) tool and multiple text modalities are created via a cascaded architecture comprising cross-modal transformer blocks that integrate modalities one by one.
Andrei-George Durdun, V. Constantinescu, R. Ionescu
· 0 citations