Preprint
Aug 2026
AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models
AlignJEPA provides a parameter-efficient route for aligning Earth observation foundation models with language by using a pretrained AnySat visual encoder and a RemoteCLIP text encoder while training only a lightweight predictive alignment network.
Md Aminur Hossain, Omkumar Vaghasiya, R. Dwivedi et al.
· 0 citations