SOTAVerified

Video Question Answering

Papers

Showing 376–400 of 460 papers

TitleStatusHype
Temporal Pyramid Transformer with Multimodal Interaction for Video Question AnsweringCode1
The Multi-Modal Video Reasoning and Analyzing Competition—0
Mounting Video Metadata on Transformer-based Language Model for Open-ended Video Question Answering—0
Multi-Scale Progressive Attention Network for Video Question Answering—0
CogME: A Cognition-Inspired Multi-Dimensional Evaluation Metric for Story Understanding—0
DualVGR: A Dual-Visual Graph Reasoning Unit for Video Question AnsweringCode1
iReason: Multimodal Commonsense Reasoning using Videos and Natural Language with Interpretability—0
Hierarchical Object-oriented Spatio-Temporal Reasoning for Video Question Answering—0
NExT-QA: Next Phase of Question-Answering to Explaining Temporal ActionsCode1
Attend What You Need: Motion-Appearance Synergistic Networks for Video Question AnsweringCode0
VALUE: A Multi-Task Benchmark for Video-and-Language Understanding EvaluationCode1
Learning to Rehearse in Long Sequence Memorization—0
DeCEMBERT: Learning from Noisy Instructional Videos via Dense Captions and Entropy MinimizationCode1
NExT-QA:Next Phase of Question-Answering to Explaining Temporal ActionsCode1
Relation-aware Hierarchical Attention Framework for Video Question AnsweringCode0
Bridge to Answer: Structure-aware Graph Interaction Network for Video Question Answering—0
Object-Centric Representation Learning for Video Question Answering—0
FIBER: Fill-in-the-Blanks as a Challenging Video Understanding Evaluation FrameworkCode0
Video Question Answering with Phrases via Semantic Roles—0
CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning—0
AGQA: A Benchmark for Compositional Spatio-Temporal Reasoning—0
SUTD-TrafficQA: A Question Answering Benchmark and an Efficient Network for Video Reasoning over Traffic EventsCode1
A Comprehensive Review of the Video-to-Text ProblemCode1
On the hidden treasure of dialog in video question answeringCode1
Less is More: ClipBERT for Video-and-Language Learning via Sparse SamplingCode1
Show:102550
← PrevPage 16 of 19Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Accuracy85.5—Unverified
2InternVL-2.5(8B)Accuracy85.5—Unverified
3VideoLLaMA3(7B)Accuracy84.5—Unverified
4PLM-8BAccuracy84.1—Unverified
5BIMBA-LLaVA-Qwen2-7BAccuracy83.73—Unverified
6PLM-3BAccuracy83.4—Unverified
7LLaVA-VideoAccuracy83.2—Unverified
8NVILA(8B)Accuracy82.2—Unverified
9Oryx-1.5(7B)Accuracy81.8—Unverified
10Qwen2-VL(7B)Accuracy81.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-2 + CLIP-14 + CLIP-multilingual (Zero-Shot)Accuracy61.2—Unverified
2GPT-2 + CLIP-32 (Zero-Shot)Accuracy58.4—Unverified
3VideoCoCaAccuracy56.1—Unverified
4Mirasol3BAccuracy51.13—Unverified
5VASTAccuracy50.4—Unverified
6COSAAccuracy49.9—Unverified
7MA-LMMAccuracy49.8—Unverified
8VideoChat2Accuracy49.1—Unverified
9VALORAccuracy48.6—Unverified
10UMT-L (ViT-L/16)Accuracy47.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VL thinkingAverage Accuracy63.6—Unverified
2PLM-8BAverage Accuracy63.5—Unverified
3Seed1.5-VLAverage Accuracy61.5—Unverified
4V-JEPA 2 ViT-g 8BAverage Accuracy60.6—Unverified
5PLM-3BAverage Accuracy58.9—Unverified
6RRPOAverage Accuracy56.5—Unverified
7Tarsier-34BAverage Accuracy55.5—Unverified
8Tarsier2-7BAverage Accuracy54.7—Unverified
9Qwen2-VL-72BAverage Accuracy52.7—Unverified
10IXC-2.5 7BAverage Accuracy51.6—Unverified
#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Avg.69.3—Unverified
2Tarsier (34B)Avg.67.6—Unverified
3InternVideo2Avg.67.2—Unverified
4LongVU (7B)Avg.66.9—Unverified
5Oryx(34B)Avg.64.7—Unverified
6VideoLLaMA2 (72B)Avg.62—Unverified
7VideoChat-T (7B)Avg.59.9—Unverified
8mPLUG-Owl3(7B)Avg.59.5—Unverified
9PPLLaVA (7b)Avg.59.2—Unverified
10VideoGPT+Avg.58.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy50.42—Unverified
2VASTAccuracy50.1—Unverified
3COSAAccuracy49.2—Unverified
4VALORAccuracy49.2—Unverified
5MA-LMMAccuracy48.5—Unverified
6mPLUG-2Accuracy48—Unverified
7FrozenBiLMAccuracy47—Unverified
8HBIAccuracy46.2—Unverified
9EMCL-NetAccuracy45.8—Unverified
10VindLUAccuracy44.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VLAP (4 frames)Average Accuracy67.1—Unverified
2LLaMA-VQAAverage Accuracy65.4—Unverified
3SeViLAAverage Accuracy64.9—Unverified
4InternVideoAverage Accuracy58.7—Unverified
5GF(sup)Average Accuracy53.94—Unverified
6GF(uns)Average Accuracy53.86—Unverified
7MISTAverage Accuracy51.13—Unverified
8Temp[ATP]Average Accuracy48.37—Unverified
9AnyMAL-70B (0-shot)Average Accuracy48.2—Unverified
10All-in-oneAverage Accuracy47.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VLAVG60—Unverified
2VideoChat-Online (4B)AVG54.9—Unverified
3Gemini-1.5-FlashAVG50.7—Unverified
4Qwen2-VL (7B)AVG49.7—Unverified
5LLaVA-OneVision (7B)AVG49.5—Unverified
6InternVL2 (7B)AVG48.7—Unverified
7InternVL2 (4B)AVG44.1—Unverified
8LongVA (7B)AVG43.6—Unverified
9LLaMA-VID (7B)AVG41.9—Unverified
10MiniCPM-V 2.6 (7B)AVG39.1—Unverified
#ModelMetricClaimedVerifiedStatus
1GF (sup) - Faster RCNNAverage Accuracy55.08—Unverified
2MIST - CLIPAverage Accuracy54.39—Unverified
3GF (uns) - S3DAverage Accuracy53.33—Unverified
4SViTTAverage Accuracy52.7—Unverified
5MIST - AIOAverage Accuracy50.96—Unverified
6SHG-VQA (trained from scratch)Average Accuracy49.2—Unverified
7AIO - ViTAverage Accuracy48.59—Unverified
8MMTFAverage Accuracy44.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Text + Text (no Multimodal Pretext Training)Accuracy93.2—Unverified
2FrozenBiLMAccuracy86.7—Unverified
3Just AskAccuracy84.4—Unverified
4SeViLAAccuracy83.7—Unverified
5Hero w/ pre-trainingAccuracy77.75—Unverified
6ATPAccuracy65.1—Unverified
7FrozenBiLM (0-shot)Accuracy58.4—Unverified
8Just Ask (0-shot)Accuracy51.1—Unverified