AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models
AlignJEPA provides a parameter-efficient route for aligning Earth observation foundation models with language by using a pretrained AnySat visual encoder and a RemoteCLIP text encoder while training only a lightweight predictive alignment network.