SOTAVerified

Referring Expression Segmentation

The task aims at labeling the pixels of an image or video that represent an object instance referred by a linguistic expression. In particular, the referring expression (RE) must allow the identification of an individual object in a discourse or scene (the referent). REs unambiguously identify the target instance.

Papers

Showing 11–20 of 145 papers

TitleStatusHype
Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive ReinforcementCode4
PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?Code1
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations—0
MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object SegmentationCode1
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling—0
Densely Connected Parameter-Efficient Tuning for Referring Image SegmentationCode2
The Devil is in Temporal Token: High Quality Video Reasoning SegmentationCode2
Multi-task Visual Grounding with Coarse-to-Fine Consistency ConstraintsCode1
IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression SegmentationCode1
Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension—0
Show:102550
← PrevPage 2 of 15Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1DeRIS-LOverall IoU85.41—Unverified
2HyperSegOverall IoU84.8—Unverified
3PSALMOverall IoU83.6—Unverified
4MLCD-Seg-7BOverall IoU83.6—Unverified
5HIPIEOverall IoU82.8—Unverified
6EVF-SAMOverall IoU82.4—Unverified
7UNINEXT-HOverall IoU82.19—Unverified
8UniLSeg-100Overall IoU81.74—Unverified
9DETRISOverall IoU81—Unverified
10C3VGOverall IoU80.89—Unverified
#ModelMetricClaimedVerifiedStatus
1DeRIS-LOverall IoU86.49—Unverified
2HyperSegOverall IoU85.7—Unverified
3MLCD-Seg-7BOverall IoU85.3—Unverified
4EVF-SAMOverall IoU84.2—Unverified
5HyperSegOverall IoU83.5—Unverified
6C3VGOverall IoU83.18—Unverified
7MLCD-Seg-7BOverall IoU82.9—Unverified
8DeRIS-LOverall IoU82.34—Unverified
9DETRISOverall IoU81.9—Unverified
10MaskRIS (Swin-B, combined DB)Overall IoU80.64—Unverified
#ModelMetricClaimedVerifiedStatus
1MPG-SAM 2J&F73.9—Unverified
2VRS-HQ (Chat-UniVi-13B)J&F71—Unverified
3GLEE-ProJ&F70.6—Unverified
4UNINEXT-HJ&F70.1—Unverified
5ReferDINO (Swin-B)J&F69.3—Unverified
6MUTRJ&F68.4—Unverified
7VLP (VLMo-L)J&F67.6—Unverified
8UniRef-L (Swin-L)J&F67.4—Unverified
9HTR (Pre-training)J&F67.1—Unverified
10DsHmp (Video-Swin-Base)J&F67.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DeRIS-LMean IoU78.59—Unverified
2MLCD-Seg-7BOverall IoU75.6—Unverified
3HyperSegOverall IoU75.2—Unverified
4EVF-SAMOverall IoU71.9—Unverified
5DETRISOverall IoU70.2—Unverified
6C3VGOverall IoU68.95—Unverified
7UniLSeg-100Overall IoU68.15—Unverified
8UniLSeg-20Overall IoU66.99—Unverified
9UNINEXT-HOverall IoU66.22—Unverified
10GROUNDHOGOverall IoU64.9—Unverified
#ModelMetricClaimedVerifiedStatus
1HINetIoU overall0.68—Unverified
2RefVOSIoU overall0.67—Unverified
3ClawCraneNetIoU overall0.64—Unverified
4CMSA+CFSAIoU overall0.62—Unverified
5RefVOSIoU overall0.6—Unverified
6SgMg (Video-Swin-B)AP0.59—Unverified
7SOC (Video-Swin-B)AP0.57—Unverified
8ReferFormer (Video-Swin-B)AP0.55—Unverified
9SOC (Video-Swin-T)AP0.5—Unverified
10MANETAP0.47—Unverified