Visual Question Answering

MLLM Leaderboard

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1176–1200 of 2177 papers

Title	Date	Tasks	Status
Analysis of Visual Question Answering Algorithms with attention model	May 4, 2023	Question AnsweringVisual Question Answering	—Unverified
EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought	May 24, 2023	Image CaptioningLanguage Modelling	—Unverified
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning	Sep 30, 2024	Mixture-of-ExpertsOptical Character Recognition (OCR)	—Unverified
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training	Mar 14, 2024	In-Context LearningMixture-of-Experts	—Unverified
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling	Oct 14, 2024	DenoisingImage Generation	—Unverified
ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders	Aug 2, 2023	Contrastive LearningQuestion Answering	—Unverified
Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention	Oct 14, 2024	Contrastive Learningcounterfactual	—Unverified
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models	Oct 13, 2024	Cross-Modal RetrievalQuestion Answering	—Unverified
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning	May 28, 2024	Decision MakingVideo Understanding	—Unverified
Eliminating Catastrophic Interference with Biased Competition	Jul 3, 2020	Question AnsweringVisual Question Answering	—Unverified
MMED: A Multi-domain and Multi-modality Event Dataset	Apr 4, 2019	ArticlesQuestion Answering	—Unverified
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning	Nov 5, 2024	MMEQuestion Answering	—Unverified
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?	Nov 27, 2024	Question AnsweringVisual Question Answering	—Unverified
Efficient Multi-modal Large Language Models via Visual Token Grouping	Nov 26, 2024	Image CaptioningQuestion Answering	—Unverified
EfficientLLaVA: Generalizable Auto-Pruning for Large Vision-language Models	Jan 1, 2025	MM-VetMultimodal Reasoning	—Unverified
EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models	Mar 19, 2025	MM-VetMultimodal Reasoning	—Unverified
MMIU: Dataset for Visual Intent Understanding in Multimodal Assistants	Oct 13, 2021	intent-classificationIntent Classification	—Unverified
MMKB-RAG: A Multi-Modal Knowledge-Based Retrieval-Augmented Generation Framework	Apr 14, 2025	Question AnsweringRAG	—Unverified
Efficient Few-Shot Continual Learning in Vision-Language Models	Feb 6, 2025	Continual LearningImage Captioning	—Unverified
Where To Look: Focus Regions for Visual Question Answering	Nov 23, 2015	Question AnsweringVisual Question Answering	—Unverified
AMXFP4: Taming Activation Outliers with Asymmetric Microscaling Floating-Point for 4-bit LLM Inference	Nov 15, 2024	QuantizationQuestion Answering	—Unverified
MM-R^3: On (In-)Consistency of Multi-modal Large Language Models (MLLMs)	Oct 7, 2024	Question AnsweringVisual Question Answering	—Unverified
Efficient Bilinear Attention-based Fusion for Medical Visual Question Answering	Oct 28, 2024	Computational EfficiencyDecision Making	—Unverified
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs	Jun 24, 2024	Question AnsweringVisual Question Answering	—Unverified
Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models	Apr 25, 2024	Medical Visual Question Answeringparameter-efficient fine-tuning	—Unverified

Show:10 25 50

← PrevPage 48 of 88Next →

All datasets MM-Vet ViP-Bench VQA v2 test-dev BenchLMM MMBench V*bench VQA v2 val MSRVTT-QA VQA v2 test-std MMHal-Bench MSVD-QA PlotQA-D1

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	MMCTAgent (GPT-4 + GPT-4V)	GPT-4 score	74.24	—	Unverified
2	Qwen2-VL-72B	GPT-4 score	74	—	Unverified
3	InternVL2.5-78B	GPT-4 score	72.3	—	Unverified
4	GPT-4o +text rationale +IoT	GPT-4 score	72.2	—	Unverified
5	Lyra-Pro	GPT-4 score	71.4	—	Unverified
6	GLM-4V-Plus	GPT-4 score	71.1	—	Unverified
7	Phantom-7B	GPT-4 score	70.8	—	Unverified
8	InternVL2.5-38B	GPT-4 score	68.8	—	Unverified
9	InternVL2-26B (SGP, token ratio 64%)	GPT-4 score	65.6	—	Unverified
10	Baichuan-Omni (7B)	GPT-4 score	65.4	—	Unverified