SOTAVerified

Visual Reasoning

Ability to understand actions and reasoning associated with any visual images

Papers

Showing 301–350 of 698 papers

TitleStatusHype
SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection—0
What Is Missing in Multilingual Visual Reasoning and How to Fix ItCode0
Peacock: A Family of Arabic Multimodal Large Language Models and BenchmarksCode1
Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual ReasoningCode0
VISREAS: Complex Visual Reasoning with Unanswerable Questions—0
Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial ImageCode1
PALO: A Polyglot Large Multimodal Model for 5B PeopleCode2
Visual Reasoning in Object-Centric Deep Neural Networks: A Comparative Cognition ApproachCode0
Visual In-Context Learning for Large Vision-Language Models—0
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward ModelingCode0
CogCoM: Train Large Vision-Language Models Diving into Details through Chain of ManipulationsCode3
Neural networks for abstraction and reasoning: Towards broad generalization in machinesCode3
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA—0
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal ModelsCode1
Prompting Large Vision-Language Models for Compositional ReasoningCode0
Image Safeguarding: Reasoning with Conditional Vision Language Model and Obfuscating Unsafe Content CounterfactuallyCode0
Towards Generative Abstract Reasoning: Completing Raven's Progressive Matrix via Rule Abstraction and Selection—0
Language-Conditioned Robotic Manipulation with Fast and Slow Thinking—0
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs—0
Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers—0
Generate Subgoal Images before Act: Unlocking the Chain-of-Thought Reasoning in Diffusion Model for Robot Manipulation with Multimodal Prompts—0
ChartBench: A Benchmark for Complex Visual Reasoning in Charts—0
VCoder: Versatile Vision Encoders for Multimodal Large Language ModelsCode2
A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise—0
One Self-Configurable Model to Solve Many Abstract Visual Reasoning ProblemsCode0
GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific NarrativesCode0
BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal ModelsCode1
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal ReasoningCode1
Leveraging VLM-Based Pipelines to Annotate 3D Objects—0
Compositional Chain-of-Thought Prompting for Large Multimodal ModelsCode1
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGICode5
How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMsCode1
From Wrong To Right: A Recursive Approach Towards Vision-Language Explanation—0
SelfEval: Leveraging the discriminative nature of generative models for evaluation—0
The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task—0
Solving ARC visual analogies with neural embeddings and vector arithmetic: A generalized methodCode0
Adaptive recurrent vision performs zero-shot computation scaling to unseen difficulty levels—0
Visual Commonsense based Heterogeneous Graph Contrastive Learning—0
Towards A Unified Neural Architecture for Visual Recognition and Reasoning—0
GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEsCode1
NeuSyRE: Neuro-Symbolic Visual Understanding and Reasoning Framework based on Scene Graph EnrichmentCode1
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction TuningCode1
Weakly Supervised Semantic Parsing with Execution-based Spurious Program FilteringCode1
Myriad: Large Multimodal Model by Applying Vision Experts for Industrial Anomaly DetectionCode1
OC-NMN: Object-centric Compositional Neural Module Network for Generative Visual Analogical Reasoning—0
Open Visual Knowledge Extraction via Relation-Oriented Multimodality Model Prompting—0
ViCLEVR: A Visual Reasoning Dataset and Hybrid Multimodal Fusion Model for Visual Question Answering in VietnameseCode0
Multimodal Representations for Teacher-Guided Compositional Visual Reasoning—0
What's Left? Concept Grounding with Logic-Enhanced Foundation ModelsCode1
Superpixel Semantics Representation and Pre-training for Vision-Language Task—0
Show:102550
← PrevPage 7 of 14Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GPT-4o + CAText Score75.5—Unverified
2GPT-4V (CoT, pick b/w two options)Text Score75.25—Unverified
3GPT-4V (pick b/w two options)Text Score69.25—Unverified
4MMICL + CoCoTText Score64.25—Unverified
5GPT-4V + CoCoTText Score58.5—Unverified
6OpenFlamingo + CoCoTText Score58.25—Unverified
7GPT-4VText Score54.5—Unverified
8FIBER (EqSim)Text Score51.5—Unverified
9FIBER (finetuned, Flickr30k)Text Score51.25—Unverified
10MMICL + CCoTText Score51—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy91.51—Unverified
2X2-VLM (large)Accuracy88.7—Unverified
3XFM (base)Accuracy87.6—Unverified
4X2-VLM (base)Accuracy86.2—Unverified
5CoCaAccuracy86.1—Unverified
6VLMoAccuracy85.64—Unverified
7VK-OODAccuracy84.6—Unverified
8SimVLMAccuracy84.53—Unverified
9X-VLM (base)Accuracy84.41—Unverified
10VK-OODAccuracy83.9—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy92.58—Unverified
2X2-VLM (large)Accuracy89.4—Unverified
3XFM (base)Accuracy88.4—Unverified
4X2-VLM (base)Accuracy87—Unverified
5CoCaAccuracy87—Unverified
6VLMoAccuracy86.86—Unverified
7SimVLMAccuracy85.15—Unverified
8X-VLM (base)Accuracy84.76—Unverified
9BLIP-129MAccuracy83.09—Unverified
10ALBEF (14M)Accuracy82.55—Unverified
#ModelMetricClaimedVerifiedStatus
1AI CoreAverage-per ques.95.24—Unverified
2redherringAverage-per ques.91.14—Unverified
3VRDPAverage-per ques.90.24—Unverified
4FightttttAverage-per ques.88.71—Unverified
5neuralAverage-per ques.88.27—Unverified
6NERVAverage-per ques.88.05—Unverified
7DCLAverage-per ques.75.52—Unverified
8troublesolverAverage-per ques.73.3—Unverified
9v0.1Average-per ques.73.1—Unverified
10First_testAverage-per ques.69.65—Unverified
#ModelMetricClaimedVerifiedStatus
1Gemini-2.0 + CA2-Class Accuracy93.6—Unverified
2GPT-4o + CA2-Class Accuracy92.8—Unverified
3Human2-Class Accuracy91—Unverified
4SNAIL2-Class Accuracy64—Unverified
5InstructBLIP + GPT-42-Class Accuracy63.8—Unverified
6BLIP-2 + ChatGPT (Fine-tuned)2-Class Accuracy63.3—Unverified
7InstructBLIP + ChatGPT + Neuro-Symbolic2-Class Accuracy55.5—Unverified
8ChatCaptioner + ChatGPT2-Class Accuracy49.3—Unverified
9Otter2-Class Accuracy49.3—Unverified
#ModelMetricClaimedVerifiedStatus
1HumansJaccard Index90—Unverified
2ViLT (Zero-Shot)Jaccard Index52—Unverified
3X-VLM (Zero-Shot)Jaccard Index46—Unverified
4CLIP-ViT-B/32 (Zero-Shot)Jaccard Index41—Unverified
5CLIP-ViT-L/14 (Zero-Shot)Jaccard Index40—Unverified
6CLIP-RN50x64/14 (Zero-Shot)Jaccard Index38—Unverified
7CLIP-RN50 (Zero-Shot)Jaccard Index35—Unverified
8CLIP-ViL (Zero-Shot)Jaccard Index15—Unverified
#ModelMetricClaimedVerifiedStatus
1LXMERTaccuracy70.1—Unverified
2ViLTaccuracy69.3—Unverified
3CLIP (finetuned)accuracy65.1—Unverified
4CLIP (frozen)accuracy56—Unverified
5VisualBERTaccuracy55.2—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS42.2—Unverified
2Dec[Joint]1fAUCCESS40.3—Unverified
3Dynamics-Aware DQNAUCCESS39.9—Unverified
4DQNAUCCESS36.8—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS85.2—Unverified
2Dynamics-Aware DQNAUCCESS85.2—Unverified
3Dec[Joint]1fAUCCESS80—Unverified
4DQNAUCCESS77.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Swin1:1 Accuracy52.9—Unverified
2ConvNeXt1:1 Accuracy51.2—Unverified
3ViT1:1 Accuracy50.3—Unverified
4DEiT1:1 Accuracy47.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Humans1-of-100 Accuracy100—Unverified
#ModelMetricClaimedVerifiedStatus
1VisualBERTAccuracy (Dev)67.4—Unverified