SOTAVerified

Visual Reasoning

Ability to understand actions and reasoning associated with any visual images

Papers

Showing 1–50 of 698 papers

TitleStatusHype
LaViPlan : Language-Guided Visual Path Planning with RLVR—0
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning—0
PyVision: Agentic Vision with Dynamic Tooling—0
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning—0
Orchestrator-Agent Trust: A Modular Agentic AI Visual Classification System with Trust-Aware Orchestration and RAG-Based ReasoningCode0
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement LearningCode2
Skywork-R1V3 Technical ReportCode7
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning—0
Foundation Models for Zero-Shot Segmentation of Scientific Images without AI-Ready Data—0
MiCo: Multi-image Contrast for Reinforcement Visual Reasoning—0
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs—0
HalluSegBench: Counterfactual Visual Reasoning for Segmentation Hallucination Evaluation—0
World-aware Planning Narratives Enhance Large Vision-Language Model Planner—0
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual TokensCode3
VLM@school -- Evaluation of AI image understanding on German middle school knowledge—0
VGR: Visual Grounded Reasoning—0
LLMs Are Not Yet Ready for Deepfake Image Detection—0
Vision Matters: Simple Visual Perturbations Can Boost Multimodal Math ReasoningCode2
ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering—0
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions—0
VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward MechanismCode0
VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning—0
KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations—0
Language-Vision Planner and Executor for Text-to-Visual Reasoning—0
Synthetic Visual Genome—0
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning—0
Multi-Step Visual Reasoning with Visual Tokens Scaling and VerificationCode1
MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?—0
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought ReasoningCode2
ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual ReasoningCode0
Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark—0
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis—0
DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?Code1
Reinforcing Video Reasoning with Focused ThinkingCode1
ProxyThinker: Test-Time Guidance through Small Visual ReasonersCode1
Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM AgentsCode2
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic TasksCode1
MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM—0
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoTCode1
GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning—0
Grounded Reinforcement Learning for Visual Reasoning—0
Thinking with Generated ImagesCode0
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage TaskCode0
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning—0
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models—0
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning—0
VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models—0
VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection—0
Visual Abstract Thinking Empowers Multimodal ReasoningCode1
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning—0
Show:102550
← PrevPage 1 of 14Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GPT-4o + CAText Score75.5—Unverified
2GPT-4V (CoT, pick b/w two options)Text Score75.25—Unverified
3GPT-4V (pick b/w two options)Text Score69.25—Unverified
4MMICL + CoCoTText Score64.25—Unverified
5GPT-4V + CoCoTText Score58.5—Unverified
6OpenFlamingo + CoCoTText Score58.25—Unverified
7GPT-4VText Score54.5—Unverified
8FIBER (EqSim)Text Score51.5—Unverified
9FIBER (finetuned, Flickr30k)Text Score51.25—Unverified
10MMICL + CCoTText Score51—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy91.51—Unverified
2X2-VLM (large)Accuracy88.7—Unverified
3XFM (base)Accuracy87.6—Unverified
4X2-VLM (base)Accuracy86.2—Unverified
5CoCaAccuracy86.1—Unverified
6VLMoAccuracy85.64—Unverified
7VK-OODAccuracy84.6—Unverified
8SimVLMAccuracy84.53—Unverified
9X-VLM (base)Accuracy84.41—Unverified
10VK-OODAccuracy83.9—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy92.58—Unverified
2X2-VLM (large)Accuracy89.4—Unverified
3XFM (base)Accuracy88.4—Unverified
4X2-VLM (base)Accuracy87—Unverified
5CoCaAccuracy87—Unverified
6VLMoAccuracy86.86—Unverified
7SimVLMAccuracy85.15—Unverified
8X-VLM (base)Accuracy84.76—Unverified
9BLIP-129MAccuracy83.09—Unverified
10ALBEF (14M)Accuracy82.55—Unverified
#ModelMetricClaimedVerifiedStatus
1AI CoreAverage-per ques.95.24—Unverified
2redherringAverage-per ques.91.14—Unverified
3VRDPAverage-per ques.90.24—Unverified
4FightttttAverage-per ques.88.71—Unverified
5neuralAverage-per ques.88.27—Unverified
6NERVAverage-per ques.88.05—Unverified
7DCLAverage-per ques.75.52—Unverified
8troublesolverAverage-per ques.73.3—Unverified
9v0.1Average-per ques.73.1—Unverified
10First_testAverage-per ques.69.65—Unverified
#ModelMetricClaimedVerifiedStatus
1Gemini-2.0 + CA2-Class Accuracy93.6—Unverified
2GPT-4o + CA2-Class Accuracy92.8—Unverified
3Human2-Class Accuracy91—Unverified
4SNAIL2-Class Accuracy64—Unverified
5InstructBLIP + GPT-42-Class Accuracy63.8—Unverified
6BLIP-2 + ChatGPT (Fine-tuned)2-Class Accuracy63.3—Unverified
7InstructBLIP + ChatGPT + Neuro-Symbolic2-Class Accuracy55.5—Unverified
8ChatCaptioner + ChatGPT2-Class Accuracy49.3—Unverified
9Otter2-Class Accuracy49.3—Unverified
#ModelMetricClaimedVerifiedStatus
1HumansJaccard Index90—Unverified
2ViLT (Zero-Shot)Jaccard Index52—Unverified
3X-VLM (Zero-Shot)Jaccard Index46—Unverified
4CLIP-ViT-B/32 (Zero-Shot)Jaccard Index41—Unverified
5CLIP-ViT-L/14 (Zero-Shot)Jaccard Index40—Unverified
6CLIP-RN50x64/14 (Zero-Shot)Jaccard Index38—Unverified
7CLIP-RN50 (Zero-Shot)Jaccard Index35—Unverified
8CLIP-ViL (Zero-Shot)Jaccard Index15—Unverified
#ModelMetricClaimedVerifiedStatus
1LXMERTaccuracy70.1—Unverified
2ViLTaccuracy69.3—Unverified
3CLIP (finetuned)accuracy65.1—Unverified
4CLIP (frozen)accuracy56—Unverified
5VisualBERTaccuracy55.2—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS42.2—Unverified
2Dec[Joint]1fAUCCESS40.3—Unverified
3Dynamics-Aware DQNAUCCESS39.9—Unverified
4DQNAUCCESS36.8—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS85.2—Unverified
2Dynamics-Aware DQNAUCCESS85.2—Unverified
3Dec[Joint]1fAUCCESS80—Unverified
4DQNAUCCESS77.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Swin1:1 Accuracy52.9—Unverified
2ConvNeXt1:1 Accuracy51.2—Unverified
3ViT1:1 Accuracy50.3—Unverified
4DEiT1:1 Accuracy47.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Humans1-of-100 Accuracy100—Unverified
#ModelMetricClaimedVerifiedStatus
1VisualBERTAccuracy (Dev)67.4—Unverified