M2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
Recent advancements have successfully adapted autoregressive language models to process multimodal signals, such as images and actions. Since raw action signals are continuous, effective tokenization is essential to map high-dimensional inputs into compact discrete tokens for autoregressive processing. However, existin...