SOTAVerified

Visual Grounding

Visual Grounding (VG) aims to locate the most relevant object or region in an image, based on a natural language query. The query can be a phrase, a sentence, or even a multi-round dialogue. There are three main challenges in VG:

  • What is the main focus in a query?
  • How to understand an image?
  • How to locate an object?

Papers

Showing 1–50 of 571 papers

TitleStatusHype
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition—0
VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation—0
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding—0
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement LearningCode2
GTA1: GUI Test-time Scaling AgentCode2
DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real WorldCode2
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding—0
HalluSegBench: Counterfactual Visual Reasoning for Segmentation Hallucination Evaluation—0
GroundFlow: A Plug-in Module for Temporal Reasoning on 3D Point Cloud Sequential Grounding—0
DrishtiKon: Multi-Granular Visual Grounding for Text-Rich Document ImagesCode0
GEMeX-ThinkVG: Towards Thinking with Visual Grounding in Medical VQA via Reinforcement Learning—0
I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs—0
Unified Representation Space for 3D Visual Grounding—0
Semantic Localization Guiding Segment Anything Model For Reference Remote Sensing Image Segmentation—0
Revisit What You See: Disclose Language Prior in Vision Tokens for Efficient Guided Decoding of LVLMsCode1
EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments—0
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs—0
Perceptual Decoupling for Scalable Multi-modal Reasoning via Reward-Optimized Captioning—0
From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes—0
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought—0
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents—0
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs—0
D2AF: A Dual-Driven Annotation and Filtering Framework for Visual Grounding—0
mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation—0
Zero-Shot 3D Visual Grounding from Vision-Language Models—0
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration—0
Unveiling the Compositional Ability Gap in Vision-Language Reasoning ModelCode0
Two Causally Related Needles in a Video Haystack—0
Don't Look Only Once: Towards Multimodal Interactive Reasoning with Selective Visual Revisitation—0
CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-raysCode0
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models—0
OrionBench: A Benchmark for Chart and Human-Recognizable Object Detection in InfographicsCode3
Training-Free Reasoning and Reflection in MLLMs—0
Redemption Score: An Evaluation Framework to Rank Image Captions While Redeeming Image Semantics and Language Pragmatics—0
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI AgentsCode1
Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding—0
InstructSAM: A Training-Free Framework for Instruction-Oriented Remote Sensing Object RecognitionCode2
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning—0
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement LearningCode3
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding—0
TinyRS-R1: Compact Multimodal Language Model for Remote Sensing—0
UniMoCo: Unified Modality Completion for Robust Multi-Modal EmbeddingsCode0
HumaniBench: A Human-Centric Framework for Large Multimodal Models EvaluationCode0
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous DrivingCode1
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UICode0
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding—0
AS3D: 2D-Assisted Cross-Modal Understanding with Semantic-Spatial Scene Graphs for 3D Visual GroundingCode0
3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment—0
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?—0
Revisiting Data Auditing in Large Vision-Language Models—0
Show:102550
← PrevPage 1 of 12Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)95.3—Unverified
2mPLUG-2Accuracy (%)92.8—Unverified
3X2-VLM (large)Accuracy (%)92.1—Unverified
4XFM (base)Accuracy (%)90.4—Unverified
5X2-VLM (base)Accuracy (%)90.3—Unverified
6X-VLM (base)Accuracy (%)89—Unverified
7HYDRAIoU61.7—Unverified
8HYDRAIoU61.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)92—Unverified
2mPLUG-2Accuracy (%)86.05—Unverified
3X2-VLM (large)Accuracy (%)81.8—Unverified
4XFM (base)Accuracy (%)79.8—Unverified
5X2-VLM (base)Accuracy (%)78.4—Unverified
6X-VLM (base)Accuracy (%)76.91—Unverified
#ModelMetricClaimedVerifiedStatus
1Florence-2-large-ftAccuracy (%)93.4—Unverified
2mPLUG-2Accuracy (%)90.33—Unverified
3X2-VLM (large)Accuracy (%)87.6—Unverified
4XFM (base)Accuracy (%)86.1—Unverified
5X2-VLM (base)Accuracy (%)85.2—Unverified
6X-VLM (base)Accuracy (%)84.51—Unverified