Open access
2026
VQA-Guided Diffusion: Enhancing Text-to-Image Generation With Semantic Feedback From Visual Question Answering
It is shown that VQA can serve as an effective semantic feedback to significantly enhance prompt-image alignment without retraining the diffusion model, providing a powerful, interpretable and self-correcting strategy for text-to-image production.
Debashish Bhowmik, Ishika Maity, Ashis Kumar Pati
· IEEE Access · 0 citations