SOTAVerified

Video Question Answering

Papers

Showing 401–450 of 460 papers

TitleStatusHype
Flexible Frame Selection for Efficient Video Reasoning—0
Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering—0
Frame-Subtitle Self-Supervision for Multi-Modal Video Question Answering—0
Frame-Voyager: Learning to Query Frames for Video Large Language Models—0
FLAASH: Flow-Attention Adaptive Semantic Hierarchical Fusion for Multi-Modal Tobacco Content Analysis—0
First Place Solution to the Multiple-choice Video QA Track of The Second Perception Test Challenge—0
Leveraging Static Relationships for Intra-Type and Inter-Type Message Passing in Video Question Answering—0
Lightweight Recurrent Cross-modal Encoder for Video Question AnsweringCode0
ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question AnsweringCode0
FIBER: Fill-in-the-Blanks as a Challenging Video Understanding Evaluation FrameworkCode0
Listen Then See: Video Alignment with Speaker AttentionCode0
Vamos: Versatile Action Models for Video UnderstandingCode0
Multilevel Hierarchical Network with Multiscale Sampling for Video Question AnsweringCode0
Exploring Temporal Concurrency for Video-Language Representation LearningCode0
Heterogeneous Memory Enhanced Multimodal Attention Model for Video Question AnsweringCode0
A Joint Sequence Fusion Model for Video Question Answering and RetrievalCode0
Verbs in Action: Improving verb understanding in video-language modelsCode0
ActBERT: Learning Global-Local Video-Text RepresentationsCode0
LLaVA-OneVision: Easy Visual Task TransferCode0
Enhancing Temporal Modeling of Video LLMs via Time GatingCode0
Question-Instructed Visual Descriptions for Zero-Shot Video Question AnsweringCode0
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC VideosCode0
VideoQA in the Era of LLMs: An Empirical StudyCode0
Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language RetrievalCode0
Noise Estimation Using Density Estimation for Self-Supervised Multimodal LearningCode0
Reading Between the Lanes: Text VideoQA on the RoadCode0
VidCtx: Context-aware Video Question Answering with Image ModelsCode0
Long Story Short: a Summarize-then-Search Method for Long Video Question AnsweringCode0
End-to-End Video Question-Answer Generation with Generator-Pretester NetworkCode0
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question AnsweringCode0
EgoVLM: Policy Optimization for Egocentric Video UnderstandingCode0
OmniNet: A unified architecture for multi-modal multi-task learningCode0
Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue ReasoningCode0
ANetQA: A Large-scale Benchmark for Fine-grained Compositional Reasoning over Untrimmed VideosCode0
Efficient End-to-End Video Question Answering with Pyramidal Multimodal TransformerCode0
MaMMUT: A Simple Architecture for Joint Learning for MultiModal TasksCode0
Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMsCode0
Visual Choice of Plausible Alternatives: An Evaluation of Image-based Commonsense Causal ReasoningCode0
CRIPP-VQA: Counterfactual Reasoning about Implicit Physical Properties via Video Question AnsweringCode0
On Modality Bias in the TVQA DatasetCode0
MemexQA: Visual Memex Question AnsweringCode0
MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation LearningCode0
A Better Way to Attend: Attention with Trees for Video Question AnsweringCode0
DramaQA: Character-Centered Video Story Understanding with Hierarchical QACode0
Relation-aware Hierarchical Attention Framework for Video Question AnsweringCode0
Exploring Models and Data for Image Question AnsweringCode0
Open-Ended Multi-Modal Relational Reasoning for Video Question AnsweringCode0
Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring TasksCode0
ViQAgent: Zero-Shot Video Question Answering via Agent with Open-Vocabulary Grounding ValidationCode0
ACQUIRED: A Dataset for Answering Counterfactual Questions In Real-Life VideosCode0
Show:102550
← PrevPage 9 of 10Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Accuracy85.5—Unverified
2InternVL-2.5(8B)Accuracy85.5—Unverified
3VideoLLaMA3(7B)Accuracy84.5—Unverified
4PLM-8BAccuracy84.1—Unverified
5BIMBA-LLaVA-Qwen2-7BAccuracy83.73—Unverified
6PLM-3BAccuracy83.4—Unverified
7LLaVA-VideoAccuracy83.2—Unverified
8NVILA(8B)Accuracy82.2—Unverified
9Oryx-1.5(7B)Accuracy81.8—Unverified
10Qwen2-VL(7B)Accuracy81.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-2 + CLIP-14 + CLIP-multilingual (Zero-Shot)Accuracy61.2—Unverified
2GPT-2 + CLIP-32 (Zero-Shot)Accuracy58.4—Unverified
3VideoCoCaAccuracy56.1—Unverified
4Mirasol3BAccuracy51.13—Unverified
5VASTAccuracy50.4—Unverified
6COSAAccuracy49.9—Unverified
7MA-LMMAccuracy49.8—Unverified
8VideoChat2Accuracy49.1—Unverified
9VALORAccuracy48.6—Unverified
10UMT-L (ViT-L/16)Accuracy47.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VL thinkingAverage Accuracy63.6—Unverified
2PLM-8BAverage Accuracy63.5—Unverified
3Seed1.5-VLAverage Accuracy61.5—Unverified
4V-JEPA 2 ViT-g 8BAverage Accuracy60.6—Unverified
5PLM-3BAverage Accuracy58.9—Unverified
6RRPOAverage Accuracy56.5—Unverified
7Tarsier-34BAverage Accuracy55.5—Unverified
8Tarsier2-7BAverage Accuracy54.7—Unverified
9Qwen2-VL-72BAverage Accuracy52.7—Unverified
10IXC-2.5 7BAverage Accuracy51.6—Unverified
#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Avg.69.3—Unverified
2Tarsier (34B)Avg.67.6—Unverified
3InternVideo2Avg.67.2—Unverified
4LongVU (7B)Avg.66.9—Unverified
5Oryx(34B)Avg.64.7—Unverified
6VideoLLaMA2 (72B)Avg.62—Unverified
7VideoChat-T (7B)Avg.59.9—Unverified
8mPLUG-Owl3(7B)Avg.59.5—Unverified
9PPLLaVA (7b)Avg.59.2—Unverified
10VideoGPT+Avg.58.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy50.42—Unverified
2VASTAccuracy50.1—Unverified
3COSAAccuracy49.2—Unverified
4VALORAccuracy49.2—Unverified
5MA-LMMAccuracy48.5—Unverified
6mPLUG-2Accuracy48—Unverified
7FrozenBiLMAccuracy47—Unverified
8HBIAccuracy46.2—Unverified
9EMCL-NetAccuracy45.8—Unverified
10VindLUAccuracy44.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VLAP (4 frames)Average Accuracy67.1—Unverified
2LLaMA-VQAAverage Accuracy65.4—Unverified
3SeViLAAverage Accuracy64.9—Unverified
4InternVideoAverage Accuracy58.7—Unverified
5GF(sup)Average Accuracy53.94—Unverified
6GF(uns)Average Accuracy53.86—Unverified
7MISTAverage Accuracy51.13—Unverified
8Temp[ATP]Average Accuracy48.37—Unverified
9AnyMAL-70B (0-shot)Average Accuracy48.2—Unverified
10All-in-oneAverage Accuracy47.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VLAVG60—Unverified
2VideoChat-Online (4B)AVG54.9—Unverified
3Gemini-1.5-FlashAVG50.7—Unverified
4Qwen2-VL (7B)AVG49.7—Unverified
5LLaVA-OneVision (7B)AVG49.5—Unverified
6InternVL2 (7B)AVG48.7—Unverified
7InternVL2 (4B)AVG44.1—Unverified
8LongVA (7B)AVG43.6—Unverified
9LLaMA-VID (7B)AVG41.9—Unverified
10MiniCPM-V 2.6 (7B)AVG39.1—Unverified
#ModelMetricClaimedVerifiedStatus
1GF (sup) - Faster RCNNAverage Accuracy55.08—Unverified
2MIST - CLIPAverage Accuracy54.39—Unverified
3GF (uns) - S3DAverage Accuracy53.33—Unverified
4SViTTAverage Accuracy52.7—Unverified
5MIST - AIOAverage Accuracy50.96—Unverified
6SHG-VQA (trained from scratch)Average Accuracy49.2—Unverified
7AIO - ViTAverage Accuracy48.59—Unverified
8MMTFAverage Accuracy44.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Text + Text (no Multimodal Pretext Training)Accuracy93.2—Unverified
2FrozenBiLMAccuracy86.7—Unverified
3Just AskAccuracy84.4—Unverified
4SeViLAAccuracy83.7—Unverified
5Hero w/ pre-trainingAccuracy77.75—Unverified
6ATPAccuracy65.1—Unverified
7FrozenBiLM (0-shot)Accuracy58.4—Unverified
8Just Ask (0-shot)Accuracy51.1—Unverified