SOTAVerified

Visual Reasoning

Ability to understand actions and reasoning associated with any visual images

Papers

Showing 351–400 of 698 papers

TitleStatusHype
Interpreting and Controlling Vision Foundation Models via Text ExplanationsCode1
Bongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real WorldCode1
Implicit Differentiable Outlier Detection Enable Robust Deep Multimodal AnalysisCode0
Visual Question Answering in the Medical Domain—0
A Continual Learning Paradigm for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks—0
MMICL: Empowering Vision-language Model with Multi-Modal In-Context LearningCode2
Collecting Visually-Grounded Dialogue with A Game Of SortsCode0
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language ModelsCode1
A Survey on Interpretable Cross-modal ReasoningCode1
Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following ModelsCode1
On the Potential of CLIP for Compositional Logical Reasoning—0
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE—0
An Examination of the Compositionality of Large Generative Vision-Language ModelsCode1
Seeing the Intangible: Survey of Image Classification into High-Level and Abstract Categories—0
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models—0
VL-PET: Vision-and-Language Parameter-Efficient Tuning via Granularity ControlCode1
Tree-of-Mixed-Thought: Combining Fast and Slow Thinking for Multi-hop Visual Reasoning—0
Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning—0
Uni-NLX: Unifying Textual Explanations for Vision and Vision-Language TasksCode1
Learning logic programs by discovering higher-order abstractionsCode0
Learning Abstract Visual Reasoning via Task Decomposition: A Case Study in Raven Progressive MatricesCode0
3D-VisTA: Pre-trained Transformer for 3D Vision and Text AlignmentCode2
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language ModelsCode2
Bridging the Gap: Exploring the Capabilities of Bridge-Architectures for Complex Visual Reasoning Tasks—0
LOIS: Looking Out of Instance Semantics for Visual Question Answering—0
Grounded Object Centric Learning—0
How is ChatGPT's behavior changing over time?Code4
Does Visual Pretraining Help End-to-End Reasoning?—0
Abstracting Concept-Changing Rules for Solving Raven's Progressive Matrix Problems—0
Learning Differentiable Logic Programs for Abstract Visual ReasoningCode1
Look, Remember and Reason: Grounded reasoning in videos with language models—0
Stop Pre-Training: Adapt Visual-Language Models to Unseen LanguagesCode0
PhD Thesis: Exploring the role of (self-)attention in cognitive and computer vision architecture—0
A Survey on Multimodal Large Language Models—0
V-LoL: A Diagnostic Dataset for Visual Logical LearningCode0
A Domain-Independent Agent Architecture for Adaptive Operation in Evolving Open Worlds—0
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image UnderstandingCode0
Systematic Visual Reasoning through Object-Centric Relational AbstractionCode0
Revisiting the Role of Language Priors in Vision-Language ModelsCode1
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language TransformersCode1
What You See is What You Read? Improving Text-Image Alignment EvaluationCode1
Measuring Progress in Fine-grained Vision-and-Language UnderstandingCode1
Simple Token-Level Confidence Improves Caption Correctness—0
Incorporating Structured Representations into Pretrained Vision & Language Models Using Scene Graphs—0
Otter: A Multi-Modal Model with In-Context Instruction TuningCode4
Visual Transformation TellingCode0
Visual Reasoning: from State to TransformationCode1
MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language ModelsCode7
Visual Instruction TuningCode6
The role of object-centric representations, guided attention, and external memory on generalizing visual relations—0
Show:102550
← PrevPage 8 of 14Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GPT-4o + CAText Score75.5—Unverified
2GPT-4V (CoT, pick b/w two options)Text Score75.25—Unverified
3GPT-4V (pick b/w two options)Text Score69.25—Unverified
4MMICL + CoCoTText Score64.25—Unverified
5GPT-4V + CoCoTText Score58.5—Unverified
6OpenFlamingo + CoCoTText Score58.25—Unverified
7GPT-4VText Score54.5—Unverified
8FIBER (EqSim)Text Score51.5—Unverified
9FIBER (finetuned, Flickr30k)Text Score51.25—Unverified
10MMICL + CCoTText Score51—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy91.51—Unverified
2X2-VLM (large)Accuracy88.7—Unverified
3XFM (base)Accuracy87.6—Unverified
4X2-VLM (base)Accuracy86.2—Unverified
5CoCaAccuracy86.1—Unverified
6VLMoAccuracy85.64—Unverified
7VK-OODAccuracy84.6—Unverified
8SimVLMAccuracy84.53—Unverified
9X-VLM (base)Accuracy84.41—Unverified
10VK-OODAccuracy83.9—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3Accuracy92.58—Unverified
2X2-VLM (large)Accuracy89.4—Unverified
3XFM (base)Accuracy88.4—Unverified
4X2-VLM (base)Accuracy87—Unverified
5CoCaAccuracy87—Unverified
6VLMoAccuracy86.86—Unverified
7SimVLMAccuracy85.15—Unverified
8X-VLM (base)Accuracy84.76—Unverified
9BLIP-129MAccuracy83.09—Unverified
10ALBEF (14M)Accuracy82.55—Unverified
#ModelMetricClaimedVerifiedStatus
1AI CoreAverage-per ques.95.24—Unverified
2redherringAverage-per ques.91.14—Unverified
3VRDPAverage-per ques.90.24—Unverified
4FightttttAverage-per ques.88.71—Unverified
5neuralAverage-per ques.88.27—Unverified
6NERVAverage-per ques.88.05—Unverified
7DCLAverage-per ques.75.52—Unverified
8troublesolverAverage-per ques.73.3—Unverified
9v0.1Average-per ques.73.1—Unverified
10First_testAverage-per ques.69.65—Unverified
#ModelMetricClaimedVerifiedStatus
1Gemini-2.0 + CA2-Class Accuracy93.6—Unverified
2GPT-4o + CA2-Class Accuracy92.8—Unverified
3Human2-Class Accuracy91—Unverified
4SNAIL2-Class Accuracy64—Unverified
5InstructBLIP + GPT-42-Class Accuracy63.8—Unverified
6BLIP-2 + ChatGPT (Fine-tuned)2-Class Accuracy63.3—Unverified
7InstructBLIP + ChatGPT + Neuro-Symbolic2-Class Accuracy55.5—Unverified
8ChatCaptioner + ChatGPT2-Class Accuracy49.3—Unverified
9Otter2-Class Accuracy49.3—Unverified
#ModelMetricClaimedVerifiedStatus
1HumansJaccard Index90—Unverified
2ViLT (Zero-Shot)Jaccard Index52—Unverified
3X-VLM (Zero-Shot)Jaccard Index46—Unverified
4CLIP-ViT-B/32 (Zero-Shot)Jaccard Index41—Unverified
5CLIP-ViT-L/14 (Zero-Shot)Jaccard Index40—Unverified
6CLIP-RN50x64/14 (Zero-Shot)Jaccard Index38—Unverified
7CLIP-RN50 (Zero-Shot)Jaccard Index35—Unverified
8CLIP-ViL (Zero-Shot)Jaccard Index15—Unverified
#ModelMetricClaimedVerifiedStatus
1LXMERTaccuracy70.1—Unverified
2ViLTaccuracy69.3—Unverified
3CLIP (finetuned)accuracy65.1—Unverified
4CLIP (frozen)accuracy56—Unverified
5VisualBERTaccuracy55.2—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS42.2—Unverified
2Dec[Joint]1fAUCCESS40.3—Unverified
3Dynamics-Aware DQNAUCCESS39.9—Unverified
4DQNAUCCESS36.8—Unverified
#ModelMetricClaimedVerifiedStatus
1RPINAUCCESS85.2—Unverified
2Dynamics-Aware DQNAUCCESS85.2—Unverified
3Dec[Joint]1fAUCCESS80—Unverified
4DQNAUCCESS77.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Swin1:1 Accuracy52.9—Unverified
2ConvNeXt1:1 Accuracy51.2—Unverified
3ViT1:1 Accuracy50.3—Unverified
4DEiT1:1 Accuracy47.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Humans1-of-100 Accuracy100—Unverified
#ModelMetricClaimedVerifiedStatus
1VisualBERTAccuracy (Dev)67.4—Unverified