Open access
Sep 2026
Unified vision-centric pedestrian crossing action prediction via adaptive patch projection and proactive spatial rectification
ViCross is proposed, a vision-centric pedestrian crossing action prediction framework powered by multimodal large language models, which maintains target-centric reasoning from video frames without additional perception modules beyond first-frame target initialization.
Yao Tian, Le Yang, Bing-Lu Wang
· Pattern Recognition · 0 citations