SOTAVerified

Audio-visual Question Answering

Papers

Showing 21–27 of 27 papers

TitleStatusHype
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering—0
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering—0
CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering—0
CAD -- Contextual Multi-modal Alignment for Dynamic AVQA—0
Learning Sparsity for Effective and Efficient Music Performance Question Answering—0
Patch-level Sounding Object Tracking for Audio-Visual Question Answering—0
OMCAT: Omni Context Aware Transformer—0
Show:102550
← PrevPage 3 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1VASTAcc80.7—Unverified
2CoQo(Internvideo2)Acc79.6—Unverified
3VALORAcc78.9—Unverified
4CADAcc78.26—Unverified
5LAVISHAcc77.08—Unverified
6ST-AVQAAcc71.52—Unverified