Preprint
Aug 2026
CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models
Experiments on multiple representative video benchmarks show that CRAFT consistently outperforms prior state-of-the-art token-compression methods and shows significant efficiency improvement.
Yu Chen, Xiaohong Li, Xiaole Wang et al.
· 0 citations