Preprint
Jul 2026
GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs
This work proposes GMoT, a Gated Motion-Aware Tokenization module that explicitly distills sparse kinematic evidence into a compact sequence prior to temporal modeling, and introduces Body-Region Grounding (BRG) Recall as an anatomical-grounding proxy conditioned on correct predictions.
Taorui Wang, Wei Xia, Hui Ma et al.
· 0 citations