Beyond Token Importance: Preserving Spatial Scaffolds for Efficient Vision-Language-Action Inference
Existing VLA pruning strategies primarily select individual visual tokens according to task-level semantic relevance, while overlooking the spatial information required for robotic manipulation. To examine this limitation, we construct a simple Stride baseline that uniformly samples tokens along the flattened one-dimen...