SOTAVerified

Visual Reasoning

Ability to understand actions and reasoning associated with any visual images

Papers

Showing 51–100 of 698 papers

TitleStatusHype
PALO: A Polyglot Large Multimodal Model for 5B PeopleCode2
AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPOCode2
Q-Insight: Understanding Image Quality via Visual Reinforcement LearningCode2
OmniCaptioner: One Captioner to Rule Them AllCode2
3D-VisTA: Pre-trained Transformer for 3D Vision and Text AlignmentCode2
NoisyRollout: Reinforcing Visual Reasoning with Data AugmentationCode2
Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM AgentsCode2
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought ReasoningCode2
Distill Visual Chart Reasoning Ability from LLMs to MLLMsCode2
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language ModelCode2
Learning Transferable Visual Models From Natural Language SupervisionCode2
ChatGPT Asks, BLIP-2 Answers: Automatic Questioning Towards Enriched Visual DescriptionsCode2
Learning to Compose Dynamic Tree Structures for Visual ContextsCode2
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal ModelsCode2
EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement LearningCode2
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMsCode2
Belief Revision based Caption Re-ranker with Visual Semantic InformationCode1
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video UnderstandingCode1
From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data SynthesisCode1
Forward Prediction for Physical ReasoningCode1
Forgotten Polygons: Multimodal Large Language Models are Shape-BlindCode1
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Pedagogical VisualizationCode1
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?Code1
FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression ComprehensionCode1
Attention-Based Context Aware Reasoning for Situation RecognitionCode1
GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEsCode1
FiLM: Visual Reasoning with a General Conditioning LayerCode1
Abstract Visual Reasoning: An Algebraic Approach for Solving Raven's Progressive MatricesCode1
FLAVA: A Foundational Language And Vision Alignment ModelCode1
KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal ModelsCode1
Large-Scale Adversarial Training for Vision-and-Language Representation LearningCode1
A Survey on Interpretable Cross-modal ReasoningCode1
Equivariant Similarity for Vision-Language Foundation ModelsCode1
IRFL: Image Recognition of Figurative LanguageCode1
Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized DataCode1
Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question AnsweringCode1
Expressive Scene Graph Generation Using Commonsense Knowledge Infusion for Visual Understanding and ReasoningCode1
Is BERT Blind? Exploring the Effect of Vision-and-Language Pretraining on Visual Language UnderstandingCode1
Efficient Vision-Language Pretraining with Visual Concepts and Hierarchical AlignmentCode1
Going Beyond Nouns With Vision & Language Models Using Synthetic DataCode1
DVD: A Diagnostic Dataset for Multi-step Reasoning in Video Grounded DialogueCode1
Divide and Conquer: Answering Questions with Object Factorization and Compositional ReasoningCode1
DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?Code1
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language ModelsCode1
Interpreting and Controlling Vision Foundation Models via Text ExplanationsCode1
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language ModelsCode1
ARB: A Comprehensive Arabic Multimodal Reasoning BenchmarkCode1
Dynamic Language Binding in Relational Visual ReasoningCode1
Benchmarking Robustness of Multimodal Image-Text Models under Distribution ShiftCode1
Inference Optimal VLMs Need Fewer Visual Tokens and More ParametersCode1
Show:102550
← PrevPage 2 of 14Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GPT-4o + CAText Score75.5—Unverified
2GPT-4V (CoT, pick b/w two options)Text Score75.25—Unverified
3GPT-4V (pick b/w two options)Text Score69.25—Unverified
4MMICL + CoCoTText Score64.25—Unverified
5GPT-4V + CoCoTText Score58.5—Unverified
6OpenFlamingo + CoCoTText Score58.25—Unverified
7GPT-4VText Score54.5—Unverified
8FIBER (EqSim)Text Score51.5—Unverified
9FIBER (finetuned, Flickr30k)Text Score51.25—Unverified
10MMICL + CCoTText Score51—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy91.51—Unverified
2X2-VLM (large)Accuracy88.7—Unverified
3XFM (base)Accuracy87.6—Unverified
4X2-VLM (base)Accuracy86.2—Unverified
5CoCaAccuracy86.1—Unverified
6VLMoAccuracy85.64—Unverified
7VK-OODAccuracy84.6—Unverified
8SimVLMAccuracy84.53—Unverified
9X-VLM (base)Accuracy84.41—Unverified
10VK-OODAccuracy83.9—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy92.58—Unverified
2X2-VLM (large)Accuracy89.4—Unverified
3XFM (base)Accuracy88.4—Unverified
4X2-VLM (base)Accuracy87—Unverified
5CoCaAccuracy87—Unverified
6VLMoAccuracy86.86—Unverified
7SimVLMAccuracy85.15—Unverified
8X-VLM (base)Accuracy84.76—Unverified
9BLIP-129MAccuracy83.09—Unverified
10ALBEF (14M)Accuracy82.55—Unverified
#ModelMetricClaimedVerifiedStatus
1AI CoreAverage-per ques.95.24—Unverified
2redherringAverage-per ques.91.14—Unverified
3VRDPAverage-per ques.90.24—Unverified
4FightttttAverage-per ques.88.71—Unverified
5neuralAverage-per ques.88.27—Unverified
6NERVAverage-per ques.88.05—Unverified
7DCLAverage-per ques.75.52—Unverified
8troublesolverAverage-per ques.73.3—Unverified
9v0.1Average-per ques.73.1—Unverified
10First_testAverage-per ques.69.65—Unverified
#ModelMetricClaimedVerifiedStatus
1Gemini-2.0 + CA2-Class Accuracy93.6—Unverified
2GPT-4o + CA2-Class Accuracy92.8—Unverified
3Human2-Class Accuracy91—Unverified
4SNAIL2-Class Accuracy64—Unverified
5InstructBLIP + GPT-42-Class Accuracy63.8—Unverified
6BLIP-2 + ChatGPT (Fine-tuned)2-Class Accuracy63.3—Unverified
7InstructBLIP + ChatGPT + Neuro-Symbolic2-Class Accuracy55.5—Unverified
8ChatCaptioner + ChatGPT2-Class Accuracy49.3—Unverified
9Otter2-Class Accuracy49.3—Unverified
#ModelMetricClaimedVerifiedStatus
1HumansJaccard Index90—Unverified
2ViLT (Zero-Shot)Jaccard Index52—Unverified
3X-VLM (Zero-Shot)Jaccard Index46—Unverified
4CLIP-ViT-B/32 (Zero-Shot)Jaccard Index41—Unverified
5CLIP-ViT-L/14 (Zero-Shot)Jaccard Index40—Unverified
6CLIP-RN50x64/14 (Zero-Shot)Jaccard Index38—Unverified
7CLIP-RN50 (Zero-Shot)Jaccard Index35—Unverified
8CLIP-ViL (Zero-Shot)Jaccard Index15—Unverified
#ModelMetricClaimedVerifiedStatus
1LXMERTaccuracy70.1—Unverified
2ViLTaccuracy69.3—Unverified
3CLIP (finetuned)accuracy65.1—Unverified
4CLIP (frozen)accuracy56—Unverified
5VisualBERTaccuracy55.2—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS42.2—Unverified
2Dec[Joint]1fAUCCESS40.3—Unverified
3Dynamics-Aware DQNAUCCESS39.9—Unverified
4DQNAUCCESS36.8—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS85.2—Unverified
2Dynamics-Aware DQNAUCCESS85.2—Unverified
3Dec[Joint]1fAUCCESS80—Unverified
4DQNAUCCESS77.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Swin1:1 Accuracy52.9—Unverified
2ConvNeXt1:1 Accuracy51.2—Unverified
3ViT1:1 Accuracy50.3—Unverified
4DEiT1:1 Accuracy47.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Humans1-of-100 Accuracy100—Unverified
#ModelMetricClaimedVerifiedStatus
1VisualBERTAccuracy (Dev)67.4—Unverified