When VLMs Trust Context: Evaluating Scene Text Recognition under Misleading Context
These results show that reliable scene-text recognition requires VLMs to balance visual character evidence with contextual information, preserving clear text while using context mainly when the visual evidence is uncertain.
Yu-Xing Cheng, Yuan Wu, Yi Chang
· 0 citations