Visual Question Answering

MLLM Leaderboard

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1276–1300 of 2177 papers

Title	Date	Tasks	Status
MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation	Dec 4, 2023	Instruction FollowingLanguage Modeling	—Unverified
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering	Jun 18, 2025	Multimodal ReasoningQuestion Answering	—Unverified
Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry	Nov 17, 2024	Question AnsweringScene Understanding	—Unverified
Memory Augmented Neural Networks for Natural Language Processing	Sep 1, 2017	AI AgentLanguage Modeling	—Unverified
Merlin:Empowering Multimodal LLMs with Foresight Minds	Nov 30, 2023	Visual Question Answering	—Unverified
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering	Jun 7, 2025	In-Context LearningMeta-Learning	—Unverified
MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification	May 29, 2024	HallucinationImage Captioning	—Unverified
MF2-MVQA: A Multi-stage Feature Fusion method for Medical Visual Question Answering	Nov 11, 2022	Medical Visual Question AnsweringQuestion Answering	—Unverified
MGA-VQA: Multi-Granularity Alignment for Visual Question Answering	Jan 25, 2022	Question AnsweringVisual Question Answering	—Unverified
MIMOQA: Multimodal Input Multimodal Output Question Answering	Jun 1, 2021	Question AnsweringVisual Question Answering	—Unverified
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis	Jul 3, 2024	PositionQuestion Answering	—Unverified
Mindstorms in Natural Language-Based Societies of Mind	May 26, 2023	3D GenerationImage Captioning	—Unverified
Mitigating Hallucination in Visual-Language Models via Re-Balancing Contrastive Decoding	Sep 10, 2024	HallucinationImage Captioning	—Unverified
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy	Mar 26, 2025	HallucinationImage Captioning	—Unverified
Data-augmented phrase-level alignment for mitigating object hallucination	May 28, 2024	Data AugmentationHallucination	—Unverified
Mitigating the Impact of Attribute Editing on Face Recognition	Mar 12, 2024	AttributeFace Recognition	—Unverified
MIVC: Multiple Instance Visual Component for Visual-Language Models	Dec 28, 2023	Question AnsweringVisual Question Answering	—Unverified
Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering	Jun 3, 2024	DiversityQuestion Answering	—Unverified
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning	Sep 30, 2024	Mixture-of-ExpertsOptical Character Recognition (OCR)	—Unverified
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training	Mar 14, 2024	In-Context LearningMixture-of-Experts	—Unverified
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling	Oct 14, 2024	DenoisingImage Generation	—Unverified
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models	Oct 13, 2024	Cross-Modal RetrievalQuestion Answering	—Unverified
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning	May 28, 2024	Decision MakingVideo Understanding	—Unverified
MMED: A Multi-domain and Multi-modality Event Dataset	Apr 4, 2019	ArticlesQuestion Answering	—Unverified
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning	Nov 5, 2024	MMEQuestion Answering	—Unverified

Show:10 25 50

← PrevPage 52 of 88Next →

All datasets MM-Vet ViP-Bench VQA v2 test-dev BenchLMM MMBench V*bench VQA v2 val MSRVTT-QA VQA v2 test-std MMHal-Bench MSVD-QA PlotQA-D1

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	MMCTAgent (GPT-4 + GPT-4V)	GPT-4 score	74.24	—	Unverified
2	Qwen2-VL-72B	GPT-4 score	74	—	Unverified
3	InternVL2.5-78B	GPT-4 score	72.3	—	Unverified
4	GPT-4o +text rationale +IoT	GPT-4 score	72.2	—	Unverified
5	Lyra-Pro	GPT-4 score	71.4	—	Unverified
6	GLM-4V-Plus	GPT-4 score	71.1	—	Unverified
7	Phantom-7B	GPT-4 score	70.8	—	Unverified
8	InternVL2.5-38B	GPT-4 score	68.8	—	Unverified
9	InternVL2-26B (SGP, token ratio 64%)	GPT-4 score	65.6	—	Unverified
10	Baichuan-Omni (7B)	GPT-4 score	65.4	—	Unverified