SeRV: Semantic-Aligned Residual Vector Quantization for American Sign Language Generation
SeRV (Semantic-Aligned Residual Vector Quantization), a semantic-aligned RVQ tokenizer for ASL generation, achieves state-of-the-art pose accuracy on both How2Sign and YouTube-ASL datasets, while producing semantically consistent 3D ASL motion directly from text.
Hong-Yu Wu, Xu-Ying Wu, Tian-Hao Wu et al.
· 0 citations