SOTAVerified

Video Instance Segmentation

The goal of video instance segmentation is simultaneous detection, segmentation and tracking of instances in videos. In words, it is the first time that the image instance segmentation problem is extended to the video domain.

To facilitate research on this new task, a large-scale benchmark called YouTube-VIS, which consists of 2,883 high-resolution YouTube videos, a 40-category label set and 131k high-quality instance masks is built.

Papers

Showing 76–100 of 148 papers

TitleStatusHype
Two-Level Temporal Relation Model for Online Video Instance SegmentationCode0
TIVE: A Toolbox for Identifying Video Instance Segmentation ErrorsCode1
InstanceFormer: An Online Video Instance Segmentation FrameworkCode1
Occlusion-Aware Instance Segmentation via BiLayer Network ArchitecturesCode2
Instance As Identity: A Generic Online Paradigm for Video Instance SegmentationCode1
MinVIS: A Minimal Video Instance Segmentation Framework without Video-based TrainingCode2
Video Mask Transfiner for High-Quality Video Instance SegmentationCode1
DeVIS: Making Deformable Transformers Work for Video Instance SegmentationCode1
In Defense of Online Models for Video Instance SegmentationCode2
Online Video Instance Segmentation via Robust Context Fusion—0
Video Sparse Transformer With Attention-Guided Memory for Video Object DetectionCode1
Consistent Video Instance Segmentation with Inter-Frame Recurrent Attention—0
VITA: Video Instance Segmentation via Object Token AssociationCode1
Tag-Based Attention Guided Bottom-Up Approach for Video Instance Segmentation—0
Less than Few: Self-Shot Video Instance Segmentation—0
Temporally Efficient Vision Transformer for Video Instance SegmentationCode2
Video K-Net: A Simple, Strong, and Unified Baseline for Video SegmentationCode1
Human Instance Segmentation and Tracking via Data Association and Single-stage Detector—0
Video Instance Segmentation via Multi-scale Spatio-temporal Split Attention TransformerCode1
Deformable VisTR: Spatio temporal deformable attention for video instance segmentationCode0
One-stage Video Instance Segmentation: From Frame-in Frame-out to Clip-in Clip-outCode0
RankSeg: Adaptive Pixel Classification with Image Category Ranking for SegmentationCode1
End-to-end video instance segmentation via spatial-temporal graph neural networksCode0
Efficient Video Instance Segmentation via Tracklet Query and Proposal—0
Efficient Video Segmentation Models with Per-frame Inference—0
Show:102550
← PrevPage 4 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1CAVIS(VIT-L, Offline)mask AP57.1—Unverified
2DVIS-DAQ(VIT-L, Offline)mask AP57.1—Unverified
3DVIS++(VIT-L,Offline)mask AP53.4—Unverified
4GLEE-Promask AP50.4—Unverified
5DVIS(Swin-L, Offline)mask AP49.9—Unverified
6DVIS++(VIT-L, Online)mask AP49.6—Unverified
7UNINEXT (ViT-H, Online)mask AP49—Unverified
8DVIS(Swin-L, Online)mask AP47.1—Unverified
9CTVIS (Swin-L)mask AP46.9—Unverified
10RefineVIS (Swin-L, offline)mask AP46—Unverified
#ModelMetricClaimedVerifiedStatus
1CAVIS(ViT-L, Online)mask AP68.9—Unverified
2DVIS++(ViT-L, Online)mask AP67.7—Unverified
3DVISmask AP64.9—Unverified
4Tube-Linkmask AP64.6—Unverified
5MinVIS (Swin-L)mask AP61.6—Unverified
6Mask2Former (Swin-L)mask AP60.4—Unverified
7UniVS(Swin-L)mask AP60—Unverified
8MDQE(Swin-L)mask AP59.9—Unverified
9SeqFormer (Swin-L)mask AP59.3—Unverified
10DeVIS (Swin-L)mask AP57.1—Unverified
#ModelMetricClaimedVerifiedStatus
1CAVIS(VIT-L, Offline)mask AP65.3—Unverified
2DVIS-DAQ(VIT-L, Offline)mask AP64.5—Unverified
3DVIS++(VIT-L, Offline)mask AP63.9—Unverified
4DVIS++(VIT-L, Online)mask AP62.3—Unverified
5RefineVIS (Swin-L, online)mask AP61.4—Unverified
6GRAtt-VIS (Swin-L)mask AP60.3—Unverified
7TarViS (Swin-L)mask AP60.2—Unverified
8DVIS(Swin-L)mask AP60.1—Unverified
9GenVIS (Swin-L)mask AP60.1—Unverified
10NOVIS (Swin-L)mask AP59.8—Unverified
#ModelMetricClaimedVerifiedStatus
1DVIS++(VIT-L)mAP_L50.9—Unverified
2CAVIS (VIT-L)mAP_L48.6—Unverified
3CTVIS (Swin-L)mAP_L46.4—Unverified
4DVIS(Swin-L)mAP_L45.9—Unverified
5CTVIS (ResNet-50)mAP_L39.4—Unverified
6InstanceFormer (Swin)mAP_L26.3—Unverified
7InstanceFormer (Resnet-50)mAP_L24.8—Unverified
#ModelMetricClaimedVerifiedStatus
1PCANmMOTSA27.4—Unverified
2QDTrack-mots-fixmMOTSA23.5—Unverified
3QDTrack-motsmMOTSA22.5—Unverified
4MaskTrackRCNNmMOTSA12.3—Unverified
5STEm-SegmMOTSA12.2—Unverified
6SortIoUmMOTSA10.3—Unverified
#ModelMetricClaimedVerifiedStatus
1VMT (Swin-L)Tube-Boundary AP44.8—Unverified
2SeqFormer (Swin-L)Tube-Boundary AP43.3—Unverified
3VMT (R101)Tube-Boundary AP32.5—Unverified
4VMT (R50)Tube-Boundary AP30.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Temporal ROI Alignmask AP38—Unverified
#ModelMetricClaimedVerifiedStatus
1MaskFreeVISAP55.3—Unverified