SOTAVerified

Referring Expression Segmentation

The task aims at labeling the pixels of an image or video that represent an object instance referred by a linguistic expression. In particular, the referring expression (RE) must allow the identification of an individual object in a discourse or scene (the referent). REs unambiguously identify the target instance.

Papers

Showing 101–125 of 145 papers

TitleStatusHype
Deeply Interleaved Two-Stream Encoder for Referring Video Segmentation—0
Local-Global Context Aware Transformer for Language-Guided Video SegmentationCode1
Language as Queries for Referring Video Object SegmentationCode2
Multi-Level Representation Learning With Semantic Alignment for Referring Video Object Segmentation—0
Image Segmentation Using Text and Image PromptsCode1
LAVT: Language-Aware Vision Transformer for Referring Image SegmentationCode1
CRIS: CLIP-Driven Referring Image SegmentationCode1
End-to-End Referring Video Object Segmentation with Multimodal TransformersCode1
Hierarchical interaction network for video object segmentation from referring expressions—0
MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation—0
Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual ConceptsCode1
Vision-Language Transformer and Query Generation for Referring SegmentationCode1
SynthRef: Generation of Synthetic Referring Expressions for Object SegmentationCode1
Referring Transformer: A One-step Approach to Multi-task Visual GroundingCode1
Cross-Modal Progressive Comprehension for Referring SegmentationCode1
Collaborative Spatial-Temporal Modeling for Language-Queried Video Actor Segmentation—0
MDETR -- Modulated Detection for End-to-End Multi-Modal UnderstandingCode1
Comprehensive Multi-Modal Interactions for Referring Image SegmentationCode0
ClawCraneNet: Leveraging Object-level Relation for Text-based Video Segmentation—0
OCID-Ref: A 3D Robotic Dataset with Embodied Language for Clutter Scene GroundingCode1
Referring Segmentation in Images and Videos with Cross-Modal Self-Attention Network—0
Actor and Action Modular Network for Text-based Video Segmentation—0
RefVOS: A Closer Look at Referring Expressions for Video Object SegmentationCode1
Referring Image Segmentation via Cross-Modal Progressive ComprehensionCode1
PhraseCut: Language-based Image Segmentation in the WildCode1
Show:102550
← PrevPage 5 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1DeRIS-LOverall IoU85.41—Unverified
2HyperSegOverall IoU84.8—Unverified
3PSALMOverall IoU83.6—Unverified
4MLCD-Seg-7BOverall IoU83.6—Unverified
5HIPIEOverall IoU82.8—Unverified
6EVF-SAMOverall IoU82.4—Unverified
7UNINEXT-HOverall IoU82.19—Unverified
8UniLSeg-100Overall IoU81.74—Unverified
9DETRISOverall IoU81—Unverified
10C3VGOverall IoU80.89—Unverified
#ModelMetricClaimedVerifiedStatus
1DeRIS-LOverall IoU86.49—Unverified
2HyperSegOverall IoU85.7—Unverified
3MLCD-Seg-7BOverall IoU85.3—Unverified
4EVF-SAMOverall IoU84.2—Unverified
5HyperSegOverall IoU83.5—Unverified
6C3VGOverall IoU83.18—Unverified
7MLCD-Seg-7BOverall IoU82.9—Unverified
8DeRIS-LOverall IoU82.34—Unverified
9DETRISOverall IoU81.9—Unverified
10MaskRIS (Swin-B, combined DB)Overall IoU80.64—Unverified
#ModelMetricClaimedVerifiedStatus
1MPG-SAM 2J&F73.9—Unverified
2VRS-HQ (Chat-UniVi-13B)J&F71—Unverified
3GLEE-ProJ&F70.6—Unverified
4UNINEXT-HJ&F70.1—Unverified
5ReferDINO (Swin-B)J&F69.3—Unverified
6MUTRJ&F68.4—Unverified
7VLP (VLMo-L)J&F67.6—Unverified
8UniRef-L (Swin-L)J&F67.4—Unverified
9HTR (Pre-training)J&F67.1—Unverified
10DsHmp (Video-Swin-Base)J&F67.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeRIS-LMean IoU78.59—Unverified
2MLCD-Seg-7BOverall IoU75.6—Unverified
3HyperSegOverall IoU75.2—Unverified
4EVF-SAMOverall IoU71.9—Unverified
5DETRISOverall IoU70.2—Unverified
6C3VGOverall IoU68.95—Unverified
7UniLSeg-100Overall IoU68.15—Unverified
8UniLSeg-20Overall IoU66.99—Unverified
9UNINEXT-HOverall IoU66.22—Unverified
10GROUNDHOGOverall IoU64.9—Unverified
#ModelMetricClaimedVerifiedStatus
1HINetIoU overall0.68—Unverified
2RefVOSIoU overall0.67—Unverified
3ClawCraneNetIoU overall0.64—Unverified
4CMSA+CFSAIoU overall0.62—Unverified
5RefVOSIoU overall0.6—Unverified
6SgMg (Video-Swin-B)AP0.59—Unverified
7SOC (Video-Swin-B)AP0.57—Unverified
8ReferFormer (Video-Swin-B)AP0.55—Unverified
9SOC (Video-Swin-T)AP0.5—Unverified
10MANETAP0.47—Unverified