SOTAVerified

Visual Grounding

Visual Grounding (VG) aims to locate the most relevant object or region in an image, based on a natural language query. The query can be a phrase, a sentence, or even a multi-round dialogue. There are three main challenges in VG:

  • What is the main focus in a query?
  • How to understand an image?
  • How to locate an object?

Papers

Showing 201250 of 571 papers

TitleStatusHype
Veagle: Advancements in Multimodal Representation LearningCode1
How Do Multimodal Large Language Models Handle Complex Multimodal Reasoning? Placing Them in An Extensible Escape GameCode1
Mask Grounding for Referring Image SegmentationCode1
Visual Grounding of Learned Physical ModelsCode1
EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models0
Dynamic MDETR: A Dynamic Multimodal Transformer Decoder for Visual Grounding0
Dynamic Inference With Grounding Based Vision and Language Models0
LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering0
Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation0
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding0
ACTRESS: Active Retraining for Semi-supervised Visual Grounding0
Language learning using Speech to Image retrieval0
MNER-QG: An End-to-End MRC framework for Multimodal Named Entity Recognition with Query Grounding0
MMR: Evaluating Reading Ability of Large Multimodal Models0
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models0
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs0
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models0
Data-Efficient 3D Visual Grounding via Order-Aware Referring0
Don't Look Only Once: Towards Multimodal Interactive Reasoning with Selective Visual Revisitation0
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration0
I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs0
INVIGORATE: Interactive Visual Grounding and Grasping in Clutter0
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs0
Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding0
A Systematic Evaluation of GPT-4V's Multimodal Capability for Medical Image Analysis0
3D Spatial Understanding in MLLMs: Disambiguation and Evaluation0
Interpretable Visual Question Answering via Reasoning Supervision0
Interpretable Visual Question Answering by Visual Grounding from Attention Supervision Mining0
Interactive Visual Grounding of Referring Expressions for Human-Robot Interaction0
Differentiable Parsing and Visual Grounding of Natural Language Instructions for Object Placement0
Interactive Reinforcement Learning for Object Grounding via Self-Talking0
Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention0
Differentiable Disentanglement Filter: an Application Agnostic Core Concept Discovery Probe0
Align2Ground: Weakly Supervised Phrase Grounding Guided by Image-Caption Alignment0
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level0
Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding0
Differentiable Disentanglement Filter: an Application Agnostic Core Concept Discovery Probe0
Knowledge Supports Visual Language Grounding: A Case Study on Colour Terms0
Benchmarking Diverse-Modal Entity Linking with Generative Models0
AIFit: Automatic 3D Human-Interpretable Feedback Models for Fitness Training0
Individuation in Neural Models with and without Visual Grounding0
Language-Guided 3D Object Detection in Point Cloud for Autonomous Driving0
Detecting Concrete Visual Tokens for Multimodal Machine Translation0
Being data-driven is not enough: Revisiting interactive instruction giving as a challenge for NLG0
LanguageRefer: Spatial-Language Model for 3D Visual Grounding0
DSM: Building A Diverse Semantic Map for 3D Visual Grounding0
Improving Visually Grounded Sentence Representations with Self-Attention0
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding0
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding0
3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment0
Show:102550
← PrevPage 5 of 12Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)95.3Unverified
2mPLUG-2Accuracy (%)92.8Unverified
3X2-VLM (large)Accuracy (%)92.1Unverified
4XFM (base)Accuracy (%)90.4Unverified
5X2-VLM (base)Accuracy (%)90.3Unverified
6X-VLM (base)Accuracy (%)89Unverified
7HYDRAIoU61.7Unverified
8HYDRAIoU61.1Unverified
#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)92Unverified
2mPLUG-2Accuracy (%)86.05Unverified
3X2-VLM (large)Accuracy (%)81.8Unverified
4XFM (base)Accuracy (%)79.8Unverified
5X2-VLM (base)Accuracy (%)78.4Unverified
6X-VLM (base)Accuracy (%)76.91Unverified
#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)93.4Unverified
2mPLUG-2Accuracy (%)90.33Unverified
3X2-VLM (large)Accuracy (%)87.6Unverified
4XFM (base)Accuracy (%)86.1Unverified
5X2-VLM (base)Accuracy (%)85.2Unverified
6X-VLM (base)Accuracy (%)84.51Unverified