SOTAVerified

Video Question Answering

Papers

Showing 401–450 of 460 papers

TitleStatusHype
iReason: Multimodal Commonsense Reasoning using Videos and Natural Language with Interpretability—0
Attend What You Need: Motion-Appearance Synergistic Networks for Video Question AnsweringCode0
Learning to Rehearse in Long Sequence Memorization—0
Relation-aware Hierarchical Attention Framework for Video Question AnsweringCode0
Bridge to Answer: Structure-aware Graph Interaction Network for Video Question Answering—0
Object-Centric Representation Learning for Video Question Answering—0
FIBER: Fill-in-the-Blanks as a Challenging Video Understanding Evaluation FrameworkCode0
Video Question Answering with Phrases via Semantic Roles—0
CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning—0
AGQA: A Benchmark for Compositional Spatio-Temporal Reasoning—0
HySTER: A Hybrid Spatio-Temporal Event Reasoner—0
Recent Advances in Video Question Answering: A Review of Datasets and Methods—0
End-to-End Video Question-Answer Generation with Generator-Pretester NetworkCode0
HAIR: Hierarchical Visual-Semantic Relational Reasoning for Video Question Answering—0
Env-QA: A Video Question Answering Benchmark for Comprehensive Understanding of Dynamic Environments—0
Video Question Answering Using Language-Guided Deep Compressed-Domain Video Feature—0
Trying Bilinear Pooling in Video-QA—0
On Modality Bias in the TVQA DatasetCode0
Open-Ended Multi-Modal Relational Reasoning for Video Question AnsweringCode0
iPerceive: Applying Common-Sense Reasoning to Multi-Modal Dense Video Captioning and Video Question Answering—0
ActBERT: Learning Global-Local Video-Text RepresentationsCode0
Co-attentional Transformers for Story-Based Video Understanding—0
Hierarchical Conditional Relation Networks for Multimodal Video Question Answering—0
Self-supervised pre-training and contrastive representation learning for multiple-choice video QA—0
Data augmentation techniques for the Video Question Answering task—0
Video Question Answering on Screencast Tutorials—0
What Gives the Answer Away? Question Answering Bias Analysis on Video QA Datasets—0
Auto-captions on GIF: A Large-scale Video-sentence Dataset for Vision-language Pre-training—0
Modality Shifting Attention Network for Multi-modal Video Question Answering—0
DramaQA: Character-Centered Video Story Understanding with Hierarchical QACode0
Knowledge-Based Visual Question Answering in Videos—0
Noise Estimation Using Density Estimation for Self-Supervised Multimodal LearningCode0
Multimodal Transformer with Pointer Network for the DSTC8 AVSD Challenge—0
TutorialVQA: Question Answering Dataset for Tutorial VideosCode0
Video Dialog via Progressive Inference and Cross-Transformer—0
KnowIT VQA: Answering Knowledge-Based Questions about Videos—0
A Better Way to Attend: Attention with Trees for Video Question AnsweringCode0
Learning Question-Guided Video Representation for Multi-Turn Video Question Answering—0
OmniNet: A unified architecture for multi-modal multi-task learningCode0
Neural Reasoning, Fast and Slow, for Video Question Answering—0
Video Question Generation via Cross-Modal Self-Attention Networks Learning—0
Open-Ended Long-Form Video Question Answering via Hierarchical Convolutional Self-Attention Networks—0
Adversarial Multimodal Network for Movie Question Answering—0
ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question AnsweringCode0
Gaining Extra Supervision via Multi-task learning for Multi-Modal Video Question Answering—0
TVQA+: Spatio-Temporal Grounding for Video Question AnsweringCode0
Heterogeneous Memory Enhanced Multimodal Attention Model for Video Question AnsweringCode0
Holistic Multi-modal Memory Network for Movie Question Answering—0
TVQA: Localized, Compositional Video Question AnsweringCode0
A Joint Sequence Fusion Model for Video Question Answering and RetrievalCode0
Show:102550
← PrevPage 9 of 10Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Accuracy85.5—Unverified
2InternVL-2.5(8B)Accuracy85.5—Unverified
3VideoLLaMA3(7B)Accuracy84.5—Unverified
4PLM-8BAccuracy84.1—Unverified
5BIMBA-LLaVA-Qwen2-7BAccuracy83.73—Unverified
6PLM-3BAccuracy83.4—Unverified
7LLaVA-VideoAccuracy83.2—Unverified
8NVILA(8B)Accuracy82.2—Unverified
9Oryx-1.5(7B)Accuracy81.8—Unverified
10Qwen2-VL(7B)Accuracy81.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-2 + CLIP-14 + CLIP-multilingual (Zero-Shot)Accuracy61.2—Unverified
2GPT-2 + CLIP-32 (Zero-Shot)Accuracy58.4—Unverified
3VideoCoCaAccuracy56.1—Unverified
4Mirasol3BAccuracy51.13—Unverified
5VASTAccuracy50.4—Unverified
6COSAAccuracy49.9—Unverified
7MA-LMMAccuracy49.8—Unverified
8VideoChat2Accuracy49.1—Unverified
9VALORAccuracy48.6—Unverified
10UMT-L (ViT-L/16)Accuracy47.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VL thinkingAverage Accuracy63.6—Unverified
2PLM-8BAverage Accuracy63.5—Unverified
3Seed1.5-VLAverage Accuracy61.5—Unverified
4V-JEPA 2 ViT-g 8BAverage Accuracy60.6—Unverified
5PLM-3BAverage Accuracy58.9—Unverified
6RRPOAverage Accuracy56.5—Unverified
7Tarsier-34BAverage Accuracy55.5—Unverified
8Tarsier2-7BAverage Accuracy54.7—Unverified
9Qwen2-VL-72BAverage Accuracy52.7—Unverified
10IXC-2.5 7BAverage Accuracy51.6—Unverified
#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Avg.69.3—Unverified
2Tarsier (34B)Avg.67.6—Unverified
3InternVideo2Avg.67.2—Unverified
4LongVU (7B)Avg.66.9—Unverified
5Oryx(34B)Avg.64.7—Unverified
6VideoLLaMA2 (72B)Avg.62—Unverified
7VideoChat-T (7B)Avg.59.9—Unverified
8mPLUG-Owl3(7B)Avg.59.5—Unverified
9PPLLaVA (7b)Avg.59.2—Unverified
10VideoGPT+Avg.58.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy50.42—Unverified
2VASTAccuracy50.1—Unverified
3COSAAccuracy49.2—Unverified
4VALORAccuracy49.2—Unverified
5MA-LMMAccuracy48.5—Unverified
6mPLUG-2Accuracy48—Unverified
7FrozenBiLMAccuracy47—Unverified
8HBIAccuracy46.2—Unverified
9EMCL-NetAccuracy45.8—Unverified
10VindLUAccuracy44.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VLAP (4 frames)Average Accuracy67.1—Unverified
2LLaMA-VQAAverage Accuracy65.4—Unverified
3SeViLAAverage Accuracy64.9—Unverified
4InternVideoAverage Accuracy58.7—Unverified
5GF(sup)Average Accuracy53.94—Unverified
6GF(uns)Average Accuracy53.86—Unverified
7MISTAverage Accuracy51.13—Unverified
8Temp[ATP]Average Accuracy48.37—Unverified
9AnyMAL-70B (0-shot)Average Accuracy48.2—Unverified
10All-in-oneAverage Accuracy47.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VLAVG60—Unverified
2VideoChat-Online (4B)AVG54.9—Unverified
3Gemini-1.5-FlashAVG50.7—Unverified
4Qwen2-VL (7B)AVG49.7—Unverified
5LLaVA-OneVision (7B)AVG49.5—Unverified
6InternVL2 (7B)AVG48.7—Unverified
7InternVL2 (4B)AVG44.1—Unverified
8LongVA (7B)AVG43.6—Unverified
9LLaMA-VID (7B)AVG41.9—Unverified
10MiniCPM-V 2.6 (7B)AVG39.1—Unverified
#ModelMetricClaimedVerifiedStatus
1GF (sup) - Faster RCNNAverage Accuracy55.08—Unverified
2MIST - CLIPAverage Accuracy54.39—Unverified
3GF (uns) - S3DAverage Accuracy53.33—Unverified
4SViTTAverage Accuracy52.7—Unverified
5MIST - AIOAverage Accuracy50.96—Unverified
6SHG-VQA (trained from scratch)Average Accuracy49.2—Unverified
7AIO - ViTAverage Accuracy48.59—Unverified
8MMTFAverage Accuracy44.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Text + Text (no Multimodal Pretext Training)Accuracy93.2—Unverified
2FrozenBiLMAccuracy86.7—Unverified
3Just AskAccuracy84.4—Unverified
4SeViLAAccuracy83.7—Unverified
5Hero w/ pre-trainingAccuracy77.75—Unverified
6ATPAccuracy65.1—Unverified
7FrozenBiLM (0-shot)Accuracy58.4—Unverified
8Just Ask (0-shot)Accuracy51.1—Unverified