SOTAVerified

Visual Grounding

Visual Grounding (VG) aims to locate the most relevant object or region in an image, based on a natural language query. The query can be a phrase, a sentence, or even a multi-round dialogue. There are three main challenges in VG:

  • What is the main focus in a query?
  • How to understand an image?
  • How to locate an object?

Papers

Showing 1–25 of 571 papers

TitleStatusHype
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition—0
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding—0
VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation—0
GTA1: GUI Test-time Scaling AgentCode2
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement LearningCode2
DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real WorldCode2
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding—0
DrishtiKon: Multi-Granular Visual Grounding for Text-Rich Document ImagesCode0
HalluSegBench: Counterfactual Visual Reasoning for Segmentation Hallucination Evaluation—0
GroundFlow: A Plug-in Module for Temporal Reasoning on 3D Point Cloud Sequential Grounding—0
GEMeX-ThinkVG: Towards Thinking with Visual Grounding in Medical VQA via Reinforcement Learning—0
I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs—0
Unified Representation Space for 3D Visual Grounding—0
Semantic Localization Guiding Segment Anything Model For Reference Remote Sensing Image Segmentation—0
Revisit What You See: Disclose Language Prior in Vision Tokens for Efficient Guided Decoding of LVLMsCode1
EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments—0
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs—0
Perceptual Decoupling for Scalable Multi-modal Reasoning via Reward-Optimized Captioning—0
From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes—0
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought—0
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents—0
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs—0
D2AF: A Dual-Driven Annotation and Filtering Framework for Visual Grounding—0
mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation—0
Zero-Shot 3D Visual Grounding from Vision-Language Models—0
Show:102550
← PrevPage 1 of 23Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)95.3—Unverified
2mPLUG-2Accuracy (%)92.8—Unverified
3X2-VLM (large)Accuracy (%)92.1—Unverified
4XFM (base)Accuracy (%)90.4—Unverified
5X2-VLM (base)Accuracy (%)90.3—Unverified
6X-VLM (base)Accuracy (%)89—Unverified
7HYDRAIoU61.7—Unverified
8HYDRAIoU61.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)92—Unverified
2mPLUG-2Accuracy (%)86.05—Unverified
3X2-VLM (large)Accuracy (%)81.8—Unverified
4XFM (base)Accuracy (%)79.8—Unverified
5X2-VLM (base)Accuracy (%)78.4—Unverified
6X-VLM (base)Accuracy (%)76.91—Unverified
#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)93.4—Unverified
2mPLUG-2Accuracy (%)90.33—Unverified
3X2-VLM (large)Accuracy (%)87.6—Unverified
4XFM (base)Accuracy (%)86.1—Unverified
5X2-VLM (base)Accuracy (%)85.2—Unverified
6X-VLM (base)Accuracy (%)84.51—Unverified