Open access
2026
Cross-Modal Temporal Alignment for Action Grounding in Videos
A cross-modal temporal alignment framework that combines a multi-scale temporal convolutional encoder with capsule-based dynamic routing, jointly optimizing temporal boundary prediction, cross-modal semantic alignment, and capsule diversity is proposed.
Gengtian Shi, Chenhao Wu, Shaofei Wang et al.
· IEEE Access · 0 citations