Preprint
Aug 2026
MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
This work systematically study MoE designs for vision encoder scaling and finds that fine-grained MoE topologies yield substantial gains over both dense and standard MoE counterparts, and proposes an auxiliary-loss-free balancing variant for better expert utilization, and designs a specialized MoE kernel to mitigate inference latency overhead.
Bonan Zhang, Shiyu Dong, Quan Hung Tran et al.
· 0 citations