Preprint
Aug 2026
LocAnyMed: Vision-Language Grounding for Multimodal Medical Images
LocAnyMed-CoT-20K is derived, a rationale-augmented subset that connects anatomical context, visual observations, and spatial conclusions through structured reasoning and further improves cross-source generalization through fine-tuning.
Zi-hao Wang, Tong Liu, Zhiwei Wang et al.
· 0 citations