SOTAVerified

Audio-visual Question Answering

Papers

Showing 11–20 of 27 papers

TitleStatusHype
Question-Aware Gaussian Experts for Audio-Visual Question AnsweringCode1
Pano-AVQA: Grounded Audio-Visual Question Answering on 360^ VideosCode1
Progressive Spatio-temporal Perception for Audio-Visual Question AnsweringCode1
PAVE: Patching and Adapting Video Large Language ModelsCode1
Answering Diverse Questions via Text Attached with Key Audio-Visual CluesCode0
AVQACL: A Novel Benchmark for Audio-Visual Question Answering Continual LearningCode0
Music's Multimodal Complexity in AVQA: Why We Need More than General Multimodal LLMsCode0
Object-aware Adaptive-Positivity Learning for Audio-Visual Question AnsweringCode0
Target-Aware Spatio-Temporal Reasoning via Answering Questions in Dynamics Audio-Visual ScenariosCode0
Towards Multilingual Audio-Visual Question AnsweringCode0
Show:102550
← PrevPage 2 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1VASTAcc80.7—Unverified
2CoQo(Internvideo2)Acc79.6—Unverified
3VALORAcc78.9—Unverified
4CADAcc78.26—Unverified
5LAVISHAcc77.08—Unverified
6ST-AVQAAcc71.52—Unverified