SOTAVerified

Video Object Segmentation

Video object segmentation is a binary labeling problem aiming to separate foreground object(s) from the background region of a video.

For leaderboards please refer to the different subtasks.

Papers

Showing 1–50 of 551 papers

TitleStatusHype
SeC: Advancing Complex Video Object Segmentation via Progressive Concept Construction—0
Memory-Augmented SAM2 for Training-Free Surgical Video Segmentation—0
MUVOD: A Novel Multi-view Video Object Segmentation Dataset and A Benchmark for 3D Segmentation—0
M^3-VOS: Multi-Phase, Multi-Transition, and Multi-Scenery Video Object SegmentationCode1
THU-Warwick Submission for EPIC-KITCHEN Challenge 2025: Semi-Supervised Video Object Segmentation—0
VideoMolmo: Spatio-Temporal Grounding Meets PointingCode2
InterRVOS: Interaction-aware Referring Video Object Segmentation—0
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System CollaborationCode2
ThinkVideo: High-Quality Reasoning Video Segmentation with Chain of ThoughtsCode0
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation—0
Video-GPT via Next Clip DiffusionCode1
6D Pose Estimation on Spoons and Hands—0
Accelerating Volumetric Medical Image Annotation via Short-Long Memory SAM 2Code1
MoSAM: Motion-Guided Segment Anything Model with Spatial-Temporal Memory Selection—0
RGB-D Video Object Segmentation via Enhanced Multi-store Feature Memory—0
Few-Shot Referring Video Single- and Multi-Object Segmentation via Cross-Modal Affinity with Instance Sequence MatchingCode0
DC-SAM: In-Context Segment Anything in Images and Videos via Dual ConsistencyCode1
PVUW 2025 Challenge Report: Advances in Pixel-level Understanding of Complex Videos in the Wild—0
MASSeg : 2nd Technical Report for 4th PVUW MOSE TrackCode0
FVOS for MOSE Track of 4th PVUW Challenge: 3rd Place Solution—0
STSeg-Complex Video Object Segmentation: The 1st Solution for 4th PVUW MOSE Challenge—0
Multi-person Physics-based Pose Estimation for Combat Sports—0
GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video SegmentationCode2
Saliency-Motion Guided Trunk-Collateral Network for Unsupervised Video Object Segmentation—0
The 1st Solution for 4th PVUW MeViS Challenge: Unleashing the Potential of Large Multimodal Models for Referring Video SegmentationCode5
Zero-Shot 4D Lidar Panoptic Segmentation—0
CamoSAM2: Motion-Appearance Induced Auto-Refining Prompts for Video Camouflaged Object Detection—0
4th PVUW MeViS 3rd Place Report: Sa2VACode5
ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025Code0
One-Shot Medical Video Object Segmentation via Temporal Contrastive Memory NetworksCode0
Reducing Annotation Burden: Exploiting Image Knowledge for Few-Shot Medical Video Object Segmentation via Spatiotemporal Consistency RelearningCode0
AUTV: Creating Underwater Video Datasets with Pixel-wise Annotations—0
Leveraging Motion Information for Better Self-Supervised Video Correspondence Learning—0
Investigation of Frame Differences as Motion Cues for Video Object Segmentation—0
Find First, Track Next: Decoupling Identification and Propagation in Referring Video Object SegmentationCode2
An Analysis of Data Transformation Effects on Segment Anything 2—0
Wandering around: A bioinspired approach to visual attention through object motion sensitivityCode0
HD-EPIC: A Highly-Detailed Egocentric Video Dataset—0
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations—0
MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object SegmentationCode1
Learning Motion and Temporal Cues for Unsupervised Video Object SegmentationCode1
Multi-Context Temporal Consistent Modeling for Referring Video Object SegmentationCode0
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and VideosCode5
Decoupled Motion Expression Video Segmentation—0
DTOS: Dynamic Time Object Sensing with Large Multimodal ModelCode0
Semantic and Sequential Alignment for Referring Video Object Segmentation—0
M^3-VOS: Multi-Phase, Multi-Transition, and Multi-Scenery Video Object SegmentationCode1
Stable Mean Teacher for Semi-supervised Video Action DetectionCode0
Video Decomposition Prior: A Methodology to Decompose Videos into Layers—0
Referring Video Object Segmentation via Language-aligned Track SelectionCode1
Show:102550
← PrevPage 1 of 12Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1AOC-MF (val)F-Score94.7—Unverified
2ISVOS (BL30K, MS)J&F93.4—Unverified
3XMem (BL30K, MS)J&F93.3—Unverified
4BATMAN (val)J&F92.5—Unverified
5STCN (val)J&F91.6—Unverified
6XMemJ&F91.5—Unverified
7MobileVOS (val)J&F91.4—Unverified
8AOT (val)J&F91.1—Unverified
9LCM (val)J&F90.7—Unverified
10RPCMVOS (val)J&F90.6—Unverified
#ModelMetricClaimedVerifiedStatus
1XMem (BLK30K, MS)Mean Jaccard & F-Measure89.5—Unverified
2LCMF-measure86.5—Unverified
3XMemMean Jaccard & F-Measure86.2—Unverified
4BATMANMean Jaccard & F-Measure86.2—Unverified
5STCNMean Jaccard & F-Measure85.4—Unverified
6AOTMean Jaccard & F-Measure84.9—Unverified
7STMF-measure84.3—Unverified
8TransVOSMean Jaccard & F-Measure83.9—Unverified
9RPCMVOSMean Jaccard & F-Measure83.7—Unverified
10RMNMean Jaccard & F-Measure83.5—Unverified
#ModelMetricClaimedVerifiedStatus
1XMem (BL30K, MS)Mean Jaccard & F-Measure86.9—Unverified
2AOTMean Jaccard & F-Measure84.1—Unverified
3RPCMVOSMean Jaccard & F-Measure84—Unverified
4STCNMean Jaccard & F-Measure83—Unverified
5CFBI+Mean Jaccard & F-Measure82.8—Unverified
6RMNJaccard (Seen)82.1—Unverified
7LCMMean Jaccard & F-Measure82—Unverified
8TransVOSMean Jaccard & F-Measure81.8—Unverified
9SSTMean Jaccard & F-Measure81.7—Unverified
10LWLMean Jaccard & F-Measure81.5—Unverified
#ModelMetricClaimedVerifiedStatus
1XMem (BL30K, MS)Mean Jaccard & F-Measure83.7—Unverified
2XMemMean Jaccard & F-Measure81—Unverified
3BATMANJaccard78.4—Unverified
4AOTJaccard75.9—Unverified
5RPCMVOSJaccard75.8—Unverified
6LCMJaccard74.4—Unverified
7KMNJaccard74.1—Unverified
8TransVOSJaccard73—Unverified
9STCNJaccard72.7—Unverified
10RMNJaccard71.9—Unverified
#ModelMetricClaimedVerifiedStatus
1XMem (BL30K,MS)Mean Jaccard & F-Measure86.8—Unverified
2XMemMean Jaccard & F-Measure85.5—Unverified
3BATMANMean Jaccard & F-Measure85—Unverified
4AOTMean Jaccard & F-Measure84.1—Unverified
5RPCMVOSMean Jaccard & F-Measure83.9—Unverified
6MobileVOSMean Jaccard & F-Measure83.3—Unverified
7STCNMean Jaccard & F-Measure82.7—Unverified
8CFBI+Mean Jaccard & F-Measure82.6—Unverified
9SSTMean Jaccard & F-Measure81.8—Unverified
10CFBIMean Jaccard & F-Measure81—Unverified
#ModelMetricClaimedVerifiedStatus
1AOC-MF (val)Jaccard (Mean)81.7—Unverified
2ViTAE-T-StageJaccard (Mean)79.4—Unverified
3DINO (ViT-B/8, ImageNet retrain)J&F71.4—Unverified
4VOSwL (Mask+Language)mIoU59—Unverified
5UniTrackmIoU58.4—Unverified
#ModelMetricClaimedVerifiedStatus
1ReVOSAverage IOU75.6—Unverified
2Cutie-baseAverage IOU74.6—Unverified
3XMemAverage IOU70.4—Unverified
4SAM 2Average IOU69.5—Unverified
#ModelMetricClaimedVerifiedStatus
1DFNetF-Score82.3—Unverified
2oursJaccard (Mean)76.7—Unverified
#ModelMetricClaimedVerifiedStatus
1OursAverage74.9—Unverified
2FEELVOSmIoU0.82—Unverified
#ModelMetricClaimedVerifiedStatus
1LOCATEmIoU68.8—Unverified
#ModelMetricClaimedVerifiedStatus
1CutieJ&F68.3—Unverified
#ModelMetricClaimedVerifiedStatus
1LOCATEmIoU79.9—Unverified