SOTAVerified

Referring Expression Segmentation

The task aims at labeling the pixels of an image or video that represent an object instance referred by a linguistic expression. In particular, the referring expression (RE) must allow the identification of an individual object in a discourse or scene (the referent). REs unambiguously identify the target instance.

Papers

Showing 76–100 of 145 papers

TitleStatusHype
Extending CLIP's Image-Text Alignment to Referring Image Segmentation—0
LoSh: Long-Short Text Joint Prediction Network for Referring Video Object SegmentationCode1
GRES: Generalized Referring Expression SegmentationCode2
SOC: Semantic-Assisted Object Cluster for Referring Video Object SegmentationCode1
Referred by Multi-Modality: A Unified Temporal Transformer for Video Object SegmentationCode1
Advancing Referring Expression Segmentation Beyond Single ImageCode1
Meta Compositional Referring Expression Segmentation—0
Zero-shot Referring Image Segmentation with Global-Local Context FeaturesCode1
Universal Instance Perception as Object Discovery and RetrievalCode3
Unleashing Text-to-Image Diffusion Models for Visual PerceptionCode2
PolyFormer: Referring Image Segmentation as Sequential Polygon GenerationCode1
Segment Every Reference Object in Spatial and Temporal Spaces—0
Learning To Segment Every Referring Object Point by PointCode0
Generalized Decoding for Pixel, Image, and LanguageCode3
Fully and Weakly Supervised Referring Expression Segmentation with End-to-End Learning—0
A Unified Mutual Supervision Framework for Referring Expression Segmentation and Generation—0
VLT: Vision-Language Transformer and Query Generation for Referring SegmentationCode2
Exploring Modulated Detection Transformer as a Tool for Action Recognition in VideosCode0
Multi-Attention Network for Compressed Video Referring Object SegmentationCode1
Towards Robust Referring Video Object Segmentation with Cyclic Relational ConsensusCode1
GLIPv2: Unifying Localization and Vision-Language UnderstandingCode4
Weakly-supervised segmentation of referring expressions—0
Modeling Motion with Multi-Modal Features for Text-Based Video SegmentationCode1
ReSTR: Convolution-free Referring Image Segmentation Using Transformers—0
SeqTR: A Simple yet Universal Network for Visual GroundingCode1
Show:102550
← PrevPage 4 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1DeRIS-LOverall IoU85.41—Unverified
2HyperSegOverall IoU84.8—Unverified
3PSALMOverall IoU83.6—Unverified
4MLCD-Seg-7BOverall IoU83.6—Unverified
5HIPIEOverall IoU82.8—Unverified
6EVF-SAMOverall IoU82.4—Unverified
7UNINEXT-HOverall IoU82.19—Unverified
8UniLSeg-100Overall IoU81.74—Unverified
9DETRISOverall IoU81—Unverified
10C3VGOverall IoU80.89—Unverified
#ModelMetricClaimedVerifiedStatus
1DeRIS-LOverall IoU86.49—Unverified
2HyperSegOverall IoU85.7—Unverified
3MLCD-Seg-7BOverall IoU85.3—Unverified
4EVF-SAMOverall IoU84.2—Unverified
5HyperSegOverall IoU83.5—Unverified
6C3VGOverall IoU83.18—Unverified
7MLCD-Seg-7BOverall IoU82.9—Unverified
8DeRIS-LOverall IoU82.34—Unverified
9DETRISOverall IoU81.9—Unverified
10MaskRIS (Swin-B, combined DB)Overall IoU80.64—Unverified
#ModelMetricClaimedVerifiedStatus
1MPG-SAM 2J&F73.9—Unverified
2VRS-HQ (Chat-UniVi-13B)J&F71—Unverified
3GLEE-ProJ&F70.6—Unverified
4UNINEXT-HJ&F70.1—Unverified
5ReferDINO (Swin-B)J&F69.3—Unverified
6MUTRJ&F68.4—Unverified
7VLP (VLMo-L)J&F67.6—Unverified
8UniRef-L (Swin-L)J&F67.4—Unverified
9HTR (Pre-training)J&F67.1—Unverified
10DsHmp (Video-Swin-Base)J&F67.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeRIS-LMean IoU78.59—Unverified
2MLCD-Seg-7BOverall IoU75.6—Unverified
3HyperSegOverall IoU75.2—Unverified
4EVF-SAMOverall IoU71.9—Unverified
5DETRISOverall IoU70.2—Unverified
6C3VGOverall IoU68.95—Unverified
7UniLSeg-100Overall IoU68.15—Unverified
8UniLSeg-20Overall IoU66.99—Unverified
9UNINEXT-HOverall IoU66.22—Unverified
10GROUNDHOGOverall IoU64.9—Unverified
#ModelMetricClaimedVerifiedStatus
1HINetIoU overall0.68—Unverified
2RefVOSIoU overall0.67—Unverified
3ClawCraneNetIoU overall0.64—Unverified
4CMSA+CFSAIoU overall0.62—Unverified
5RefVOSIoU overall0.6—Unverified
6SgMg (Video-Swin-B)AP0.59—Unverified
7SOC (Video-Swin-B)AP0.57—Unverified
8ReferFormer (Video-Swin-B)AP0.55—Unverified
9SOC (Video-Swin-T)AP0.5—Unverified
10MANETAP0.47—Unverified