Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration
arXiv:2609.29940v1 Announce Type: cross Abstract: Multimodal large language models (MLLMs) achieve strong performance on visual reasoning tasks, yet remain prone to hallucinations and over-reliance on language priors, often generating answers without adequately using task-relevant visual evidence…