Video world models require persistent scene memory to maintain consistency during long-horizon video generation. Existing spatial memories accumulate RGB observations or latent features, increasing storage requirements as generation proceeds. We introduce Honeycomb, a video world model built on HexMemory, our proposed...
J. Shi, Kai-Chen Zhou, Haoyu Chen et al.· 0 citations
Medical image interpretation is central to diagnosis and care, yet adapting general-purpose multimodal large language models (MLLMs) often requires resource-intensive domain-specific fine-tuning. Here we introduce representation-guided in-context learning (RG-ICL), a training-free inference framework that retrieves que...
Min-Da Zhao, Fang-Yu Hu, Yan Luo et al.· 0 citations
A reasoning-driven vision-language framework that explicitly models the ophthalmologist's diagnostic workflow by generating structured clinical reasoning prior to diagnosis is developed, demonstrating that explicitly modeling expert clinical reasoning simultaneously improves interpretability and diagnostic performance.