SOTAVerified

Video Question Answering

Papers

Showing 226–250 of 460 papers

TitleStatusHype
Zero-Shot Video Question Answering with Procedural Programs—0
KeyVideoLLM: Towards Large-scale Video Keyframe Selection—0
Keyword-Aware Relative Spatio-Temporal Graph Networks for Video Question Answering—0
KnowIT VQA: Answering Knowledge-Based Questions about Videos—0
Video Instruction Tuning With Synthetic Data—0
Knowledge-Based Visual Question Answering in Videos—0
Knowledge Proxy Intervention for Deconfounded Video Question Answering—0
Koala: Key frame-conditioned long video-LLM—0
Language-aware Visual Semantic Distillation for Video Question Answering—0
Language Models are Causal Knowledge Extractors for Zero-shot Video Question Answering—0
(2.5+1)D Spatio-Temporal Scene Graphs for Video Question Answering—0
Video Language Co-Attention with Multimodal Fast-Learning Feature Fusion for VideoQA—0
LAVIS: A Library for Language-Vision Intelligence—0
AGQA: A Benchmark for Compositional Spatio-Temporal Reasoning—0
Learning from Inside: Self-driven Siamese Sampling and Reasoning for Video Question Answering—0
Learning Question-Guided Video Representation for Multi-Turn Video Question Answering—0
Adversarial Multimodal Network for Movie Question Answering—0
Advancing Egocentric Video Question Answering with Multimodal Large Language Models—0
Neural Reasoning, Fast and Slow, for Video Question Answering—0
Learning to Rehearse in Long Sequence Memorization—0
Learning Trajectory-Word Alignments for Video-Language Tasks—0
Leveraging LLMs with Iterative Loop Structure for Enhanced Social Intelligence in Video Question Answering—0
EVQAScore: Efficient Video Question Answering Data Evaluation—0
E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer—0
Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment—0
Show:102550
← PrevPage 10 of 19Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Accuracy85.5—Unverified
2InternVL-2.5(8B)Accuracy85.5—Unverified
3VideoLLaMA3(7B)Accuracy84.5—Unverified
4PLM-8BAccuracy84.1—Unverified
5BIMBA-LLaVA-Qwen2-7BAccuracy83.73—Unverified
6PLM-3BAccuracy83.4—Unverified
7LLaVA-VideoAccuracy83.2—Unverified
8NVILA(8B)Accuracy82.2—Unverified
9Oryx-1.5(7B)Accuracy81.8—Unverified
10Qwen2-VL(7B)Accuracy81.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-2 + CLIP-14 + CLIP-multilingual (Zero-Shot)Accuracy61.2—Unverified
2GPT-2 + CLIP-32 (Zero-Shot)Accuracy58.4—Unverified
3VideoCoCaAccuracy56.1—Unverified
4Mirasol3BAccuracy51.13—Unverified
5VASTAccuracy50.4—Unverified
6COSAAccuracy49.9—Unverified
7MA-LMMAccuracy49.8—Unverified
8VideoChat2Accuracy49.1—Unverified
9VALORAccuracy48.6—Unverified
10UMT-L (ViT-L/16)Accuracy47.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VL thinkingAverage Accuracy63.6—Unverified
2PLM-8BAverage Accuracy63.5—Unverified
3Seed1.5-VLAverage Accuracy61.5—Unverified
4V-JEPA 2 ViT-g 8BAverage Accuracy60.6—Unverified
5PLM-3BAverage Accuracy58.9—Unverified
6RRPOAverage Accuracy56.5—Unverified
7Tarsier-34BAverage Accuracy55.5—Unverified
8Tarsier2-7BAverage Accuracy54.7—Unverified
9Qwen2-VL-72BAverage Accuracy52.7—Unverified
10IXC-2.5 7BAverage Accuracy51.6—Unverified
#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Avg.69.3—Unverified
2Tarsier (34B)Avg.67.6—Unverified
3InternVideo2Avg.67.2—Unverified
4LongVU (7B)Avg.66.9—Unverified
5Oryx(34B)Avg.64.7—Unverified
6VideoLLaMA2 (72B)Avg.62—Unverified
7VideoChat-T (7B)Avg.59.9—Unverified
8mPLUG-Owl3(7B)Avg.59.5—Unverified
9PPLLaVA (7b)Avg.59.2—Unverified
10VideoGPT+Avg.58.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy50.42—Unverified
2VASTAccuracy50.1—Unverified
3COSAAccuracy49.2—Unverified
4VALORAccuracy49.2—Unverified
5MA-LMMAccuracy48.5—Unverified
6mPLUG-2Accuracy48—Unverified
7FrozenBiLMAccuracy47—Unverified
8HBIAccuracy46.2—Unverified
9EMCL-NetAccuracy45.8—Unverified
10VindLUAccuracy44.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VLAP (4 frames)Average Accuracy67.1—Unverified
2LLaMA-VQAAverage Accuracy65.4—Unverified
3SeViLAAverage Accuracy64.9—Unverified
4InternVideoAverage Accuracy58.7—Unverified
5GF(sup)Average Accuracy53.94—Unverified
6GF(uns)Average Accuracy53.86—Unverified
7MISTAverage Accuracy51.13—Unverified
8Temp[ATP]Average Accuracy48.37—Unverified
9AnyMAL-70B (0-shot)Average Accuracy48.2—Unverified
10All-in-oneAverage Accuracy47.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VLAVG60—Unverified
2VideoChat-Online (4B)AVG54.9—Unverified
3Gemini-1.5-FlashAVG50.7—Unverified
4Qwen2-VL (7B)AVG49.7—Unverified
5LLaVA-OneVision (7B)AVG49.5—Unverified
6InternVL2 (7B)AVG48.7—Unverified
7InternVL2 (4B)AVG44.1—Unverified
8LongVA (7B)AVG43.6—Unverified
9LLaMA-VID (7B)AVG41.9—Unverified
10MiniCPM-V 2.6 (7B)AVG39.1—Unverified
#ModelMetricClaimedVerifiedStatus
1GF (sup) - Faster RCNNAverage Accuracy55.08—Unverified
2MIST - CLIPAverage Accuracy54.39—Unverified
3GF (uns) - S3DAverage Accuracy53.33—Unverified
4SViTTAverage Accuracy52.7—Unverified
5MIST - AIOAverage Accuracy50.96—Unverified
6SHG-VQA (trained from scratch)Average Accuracy49.2—Unverified
7AIO - ViTAverage Accuracy48.59—Unverified
8MMTFAverage Accuracy44.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Text + Text (no Multimodal Pretext Training)Accuracy93.2—Unverified
2FrozenBiLMAccuracy86.7—Unverified
3Just AskAccuracy84.4—Unverified
4SeViLAAccuracy83.7—Unverified
5Hero w/ pre-trainingAccuracy77.75—Unverified
6ATPAccuracy65.1—Unverified
7FrozenBiLM (0-shot)Accuracy58.4—Unverified
8Just Ask (0-shot)Accuracy51.1—Unverified