SOTAVerified

Referring Expression Comprehension

Papers

Showing 101–150 of 167 papers

TitleStatusHype
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects—0
M^2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension—0
Make Graph-based Referring Expression Comprehension Great Again through Expression-guided Dynamic Gating and Regression—0
ArraMon: A Joint Navigation-Assembly Instruction Interpretation Task in Dynamic Environments—0
MaskInversion: Localized Embeddings via Optimization of Explainability Maps—0
A Real-Time Cross-modality Correlation Filtering Method for Referring Expression Comprehension—0
Compositional Zero-Shot Learning for Attribute-Based Object Reference in Human-Robot Interaction—0
Commands 4 Autonomous Vehicles (C4AV) Workshop Summary—0
Evaluating and Improving Interactions with Hazy Oracles—0
Modular Graph Attention Network for Complex Visual Relational Reasoning—0
Webly Supervised Concept Expansion for General Purpose Vision Models—0
MUTATT: Visual-Textual Mutual Guidance for Referring Expression Comprehension—0
Neighbourhood Watch: Referring Expression Comprehension via Language-guided Graph Attention Networks—0
Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks—0
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks—0
One for All: One-stage Referring Expression Comprehension with Dynamic Reasoning—0
Co-Grounding Networks with Semantic Attention for Referring Expression Comprehension in Videos—0
Parallel Attention: A Unified Framework for Visual Object Discovery through Dialogs and Queries—0
Playing Lottery Tickets with Vision and Language—0
VQD: Visual Query Detection in Natural Scenes—0
PPGN: Phrase-Guided Proposal Generation Network For Referring Expression Comprehension—0
Proposal-free One-stage Referring Expression via Grid-Word Cross-Attention—0
PropTest: Automatic Property Testing for Improved Visual Programming—0
Real-Time Referring Expression Comprehension by Single-Stage Grounding Network—0
ReCLIP: A Strong Zero-Shot Baseline for Referring Expression Comprehension—0
UNITER: Learning UNiversal Image-TExt Representations—0
RefCLIP: A Universal Teacher for Weakly Supervised Referring Expression Comprehension—0
RefCrowd: Grounding the Target in Crowd with Referring Expressions—0
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar—0
Referring Expression Comprehension: A Survey of Methods and Datasets—0
Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension—0
Referring Expression Instance Retrieval and A Strong End-to-End Baseline—0
Video Referring Expression Comprehension via Transformer with Content-aware Query—0
RefTeacher: A Strong Baseline for Semi-Supervised Referring Expression Comprehension—0
Revisiting Multi-Modal LLM Evaluation—0
ScanFormer: Referring Expression Comprehension by Iteratively Scanning—0
Segment Anything Model for automated image data annotation: empirical studies using text prompts from Grounding DINO—0
Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding—0
Dynamic Graph Attention for Referring Expression Comprehension—0
Dynamic Inference With Grounding Based Vision and Language Models—0
A Lightweight Modular Framework for Low-Cost Open-Vocabulary Object Detection TrainingCode0
Referring Expression Comprehension Using Language Adaptive InferenceCode0
Continual Referring Expression Comprehension via Dual Modular MemorizationCode0
AttnGrounder: Talking to Cars with AttentionCode0
WeakMCN: Multi-task Collaborative Network for Weakly Supervised Referring Expression Comprehension and SegmentationCode0
Towards Language-guided Visual Recognition via Dynamic ConvolutionsCode0
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language ModelsCode0
Whether you can locate or not? Interactive Referring Expression GenerationCode0
Learning Better Visual Dialog Agents with Pretrained Visual-Linguistic RepresentationCode0
Language Adaptive Weight Generation for Multi-task Visual GroundingCode0
Show:102550
← PrevPage 3 of 4Next →

No leaderboard results yet.