Less is More: Encoder-only Audio-Visual Segmentation
arXiv:2609.29121v1 Announce Type: cross Abstract: Audio-Visual Semantic Segmentation (AVSS) aims to identify, segment, and classify sound-emitting objects in video frames. Previous Transformer-based AVSS approaches largely inherit design principles from image segmentation models. Recent studies…