SOTAVerified

Multimodal Reasoning

Reasoning over multimodal inputs.

Papers

Showing 161–170 of 302 papers

TitleStatusHype
Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI—0
All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark—0
R1-Onevision:An Open-Source Multimodal Large Language Model Capable of Deep ReasoningCode4
Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models—0
Exploring Advanced Techniques for Visual Question Answering: A Comprehensive Comparison—0
SegSub: Evaluating Robustness to Knowledge Conflicts and Hallucinations in Vision-Language ModelsCode0
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought VerificationCode1
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base—0
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal ReasoningCode0
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation CapabilitiesCode1
Show:102550
← PrevPage 17 of 31Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GPT-4VAccuracy24—Unverified
2Gemini ProAccuracy13.2—Unverified
3LLaVa-1.5-13BAccuracy1.8—Unverified
4LLaVa-1.5-7BAccuracy1.5—Unverified
5BLIP2-FLAN-T5-XXLAccuracy0.9—Unverified
6QWENAccuracy0.9—Unverified
7CogVLMAccuracy0.9—Unverified
8InstructBLIPAccuracy0.6—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT4VAccuracy22.76—Unverified
2Gemini ProAccuracy17.66—Unverified
3Qwen-VL-MaxAccuracy15.59—Unverified
4InternLM-XComposer2-VLAccuracy14.54—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-4Acc30.3—Unverified