SOTAVerified

Video Question Answering

Papers

Showing 211–220 of 460 papers

TitleStatusHype
Leveraging LLMs with Iterative Loop Structure for Enhanced Social Intelligence in Video Question Answering—0
Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding—0
Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding—0
VITED: Video Temporal Evidence Distillation—0
TIME: Temporal-sensitive Multi-dimensional Instruction Tuning and Benchmarking for Video-LLMs—0
Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment—0
Towards Fine-Grained Video Question Answering—0
Parameter-free Video Segmentation for Vision and Language Understanding—0
M-LLM Based Video Frame Selection for Efficient Video Understanding—0
Multi-Modal Retrieval Augmentation for Open-Ended and Knowledge-Intensive Video Question Answering—0
Show:102550
← PrevPage 22 of 46Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Accuracy85.5—Unverified
2InternVL-2.5(8B)Accuracy85.5—Unverified
3VideoLLaMA3(7B)Accuracy84.5—Unverified
4PLM-8BAccuracy84.1—Unverified
5BIMBA-LLaVA-Qwen2-7BAccuracy83.73—Unverified
6PLM-3BAccuracy83.4—Unverified
7LLaVA-VideoAccuracy83.2—Unverified
8NVILA(8B)Accuracy82.2—Unverified
9Oryx-1.5(7B)Accuracy81.8—Unverified
10Qwen2-VL(7B)Accuracy81.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-2 + CLIP-14 + CLIP-multilingual (Zero-Shot)Accuracy61.2—Unverified
2GPT-2 + CLIP-32 (Zero-Shot)Accuracy58.4—Unverified
3VideoCoCaAccuracy56.1—Unverified
4Mirasol3BAccuracy51.13—Unverified
5VASTAccuracy50.4—Unverified
6COSAAccuracy49.9—Unverified
7MA-LMMAccuracy49.8—Unverified
8VideoChat2Accuracy49.1—Unverified
9VALORAccuracy48.6—Unverified
10UMT-L (ViT-L/16)Accuracy47.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VL thinkingAverage Accuracy63.6—Unverified
2PLM-8BAverage Accuracy63.5—Unverified
3Seed1.5-VLAverage Accuracy61.5—Unverified
4V-JEPA 2 ViT-g 8BAverage Accuracy60.6—Unverified
5PLM-3BAverage Accuracy58.9—Unverified
6RRPOAverage Accuracy56.5—Unverified
7Tarsier-34BAverage Accuracy55.5—Unverified
8Tarsier2-7BAverage Accuracy54.7—Unverified
9Qwen2-VL-72BAverage Accuracy52.7—Unverified
10IXC-2.5 7BAverage Accuracy51.6—Unverified
#ModelMetricClaimedVerifiedStatus
1LinVT-Qwen2-VL (7B)Avg.69.3—Unverified
2Tarsier (34B)Avg.67.6—Unverified
3InternVideo2Avg.67.2—Unverified
4LongVU (7B)Avg.66.9—Unverified
5Oryx(34B)Avg.64.7—Unverified
6VideoLLaMA2 (72B)Avg.62—Unverified
7VideoChat-T (7B)Avg.59.9—Unverified
8mPLUG-Owl3(7B)Avg.59.5—Unverified
9PPLLaVA (7b)Avg.59.2—Unverified
10VideoGPT+Avg.58.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Mirasol3BAccuracy50.42—Unverified
2VASTAccuracy50.1—Unverified
3COSAAccuracy49.2—Unverified
4VALORAccuracy49.2—Unverified
5MA-LMMAccuracy48.5—Unverified
6mPLUG-2Accuracy48—Unverified
7FrozenBiLMAccuracy47—Unverified
8HBIAccuracy46.2—Unverified
9EMCL-NetAccuracy45.8—Unverified
10VindLUAccuracy44.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VLAP (4 frames)Average Accuracy67.1—Unverified
2LLaMA-VQAAverage Accuracy65.4—Unverified
3SeViLAAverage Accuracy64.9—Unverified
4InternVideoAverage Accuracy58.7—Unverified
5GF(sup)Average Accuracy53.94—Unverified
6GF(uns)Average Accuracy53.86—Unverified
7MISTAverage Accuracy51.13—Unverified
8Temp[ATP]Average Accuracy48.37—Unverified
9AnyMAL-70B (0-shot)Average Accuracy48.2—Unverified
10All-in-oneAverage Accuracy47.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Seed1.5-VLAVG60—Unverified
2VideoChat-Online (4B)AVG54.9—Unverified
3Gemini-1.5-FlashAVG50.7—Unverified
4Qwen2-VL (7B)AVG49.7—Unverified
5LLaVA-OneVision (7B)AVG49.5—Unverified
6InternVL2 (7B)AVG48.7—Unverified
7InternVL2 (4B)AVG44.1—Unverified
8LongVA (7B)AVG43.6—Unverified
9LLaMA-VID (7B)AVG41.9—Unverified
10MiniCPM-V 2.6 (7B)AVG39.1—Unverified
#ModelMetricClaimedVerifiedStatus
1GF (sup) - Faster RCNNAverage Accuracy55.08—Unverified
2MIST - CLIPAverage Accuracy54.39—Unverified
3GF (uns) - S3DAverage Accuracy53.33—Unverified
4SViTTAverage Accuracy52.7—Unverified
5MIST - AIOAverage Accuracy50.96—Unverified
6SHG-VQA (trained from scratch)Average Accuracy49.2—Unverified
7AIO - ViTAverage Accuracy48.59—Unverified
8MMTFAverage Accuracy44.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Text + Text (no Multimodal Pretext Training)Accuracy93.2—Unverified
2FrozenBiLMAccuracy86.7—Unverified
3Just AskAccuracy84.4—Unverified
4SeViLAAccuracy83.7—Unverified
5Hero w/ pre-trainingAccuracy77.75—Unverified
6ATPAccuracy65.1—Unverified
7FrozenBiLM (0-shot)Accuracy58.4—Unverified
8Just Ask (0-shot)Accuracy51.1—Unverified