Preprint
Aug 2026
Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution
It is found that vision is necessary but does not replace text extraction, that missing pages bound accuracy while distractors cost little, and that reasoners fail to integrate evidence across pages even when it is fully supplied.
Lewei Xu, Yihao Ding, Zihan Xu et al.
· 0 citations