Task-Oriented Visual Feature Compression via Residual Vector Quantization for Device-Edge Multimodal Inference
Large multimodal models (LMMs) support diverse visual understanding and reasoning tasks but are often impractical to run entirely on resource-constrained devices. Device-edge co-inference reduces device computation, yet transmitting visual data over bandwidth-limited uplinks can introduce substantial delay. Task-orient...