SOTAVerified

Referring Expression Comprehension

Papers

Showing 76–100 of 167 papers

TitleStatusHype
Exploring Spatial Language Grounding Through Referring Expressions—0
FLORA: Formal Language Model Enables Robust Training-free Zero-shot Object Referring Analysis—0
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks—0
Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension—0
DViN: Dynamic Visual Routing Network for Weakly Supervised Referring Expression Comprehension—0
Task-aware Cross-modal Feature Refinement Transformer with Large Language Models for Visual Grounding—0
Harlequin: Color-driven Generation of Synthetic Data for Referring Expression Comprehension—0
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models—0
Make Graph-based Referring Expression Comprehension Great Again through Expression-guided Dynamic Gating and Regression—0
A Lightweight Modular Framework for Low-Cost Open-Vocabulary Object Detection TrainingCode0
Revisiting Multi-Modal LLM Evaluation—0
MaskInversion: Localized Embeddings via Optimization of Explainability Maps—0
Learning Visual Grounding from Generative Vision and Language Model—0
The Solution for the 5th GCAIAC Zero-shot Referring Expression Comprehension Challenge—0
M^2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension—0
Segment Anything Model for automated image data annotation: empirical studies using text prompts from Grounding DINO—0
ScanFormer: Referring Expression Comprehension by Iteratively Scanning—0
Adversarial Robustness for Visual Grounding of Multimodal Large Language ModelsCode0
Text-driven Affordance Learning from Egocentric Vision—0
PropTest: Automatic Property Testing for Improved Visual Programming—0
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar—0
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training—0
Revisiting Counterfactual Problems in Referring Expression ComprehensionCode0
Compositional Zero-Shot Learning for Attribute-Based Object Reference in Human-Robot Interaction—0
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects—0
Show:102550
← PrevPage 4 of 7Next →

No leaderboard results yet.