SOTAVerified

Action Segmentation

Action Segmentation is a challenging problem in high-level video understanding. In its simplest form, Action Segmentation aims to segment a temporally untrimmed video by time and label each segmented part with one of pre-defined action labels. The results of Action Segmentation can be further used as input to various applications, such as video-to-text and action localization.

Source: TricorNet: A Hybrid Temporal Convolutional and Recurrent Network for Video Action Segmentation

Papers

Showing 26–50 of 219 papers

TitleStatusHype
ASQuery: A Query-based Model for Action SegmentationCode1
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks—0
Transformer with Controlled Attention for Synchronous Motion CaptioningCode0
3D Pose-Based Temporal Action Segmentation for Figure Skating: A Fine-Grained and Jump Procedure-Aware Annotation ApproachCode1
Long-Tail Temporal Action Segmentation with Group-wise Temporal Logit AdjustmentCode1
Faster Diffusion Action Segmentation—0
A study of animal action segmentation algorithms across supervised, unsupervised, and semi-supervised learning paradigmsCode0
Efficient Temporal Action Segmentation via Boundary-aware Query VotingCode0
MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models—0
Snippet-Aware Transformer With Multiple Action Elements for Skeleton-Based Action SegmentationCode0
HOIST-Former: Hand-held Objects Identification, Segmentation, and Tracking in the Wild—0
O-TALC: Steps Towards Combating Oversegmentation within Online Action Segmentation—0
LOGO: A Long-Form Video Dataset for Group Action Quality AssessmentCode1
Temporally Consistent Unbalanced Optimal Transport for Unsupervised Action SegmentationCode2
Efficient and Effective Weakly-Supervised Action Segmentation via Action-Transition-Aware Boundary AlignmentCode0
Hierarchical NeuroSymbolic Approach for Comprehensive and Explainable Action Quality AssessmentCode2
Coherent Temporal Synthesis for Incremental Action Segmentation—0
A Multimodal Handover Failure Detection Dataset and BaselinesCode0
ADL4D: Towards A Contextually Rich Dataset for 4D Activities of Daily Living—0
ViSTec: Video Modeling for Sports Technique Recognition and Tactical Analysis—0
Multi-granularity Correspondence Learning from Long-term Noisy VideosCode2
Friends Across Time: Multi-Scale Action Segmentation Transformer for Surgical Phase Recognition—0
Depth Over RGB: Automatic Evaluation of Open Surgery Skills Using Depth Camera—0
Robotic Imitation of Human Actions—0
Error Detection in Egocentric Procedural Task Videos—0
Show:102550
← PrevPage 2 of 9Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1AdaFocus (newly extracted I3D-features, LT-Context model)Average F176.2—Unverified
2FACT (efficient hybrid of convolution and transformer model)Average F174.7—Unverified
3ASQueryAverage F174.6—Unverified
4BITAverage F173.7—Unverified
5DiffActAverage F173.6—Unverified
6BaFormerAverage F172.4—Unverified
7CETNetAverage F171.8—Unverified
8SF-TMN(ASFormer)Average F171.6—Unverified
9RF++-SSTDAAcc70.8—Unverified
10ASPnetAverage F170.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Br-Prompt+ASPnet (RGB, flow, accelerometer)F1@50%88.5—Unverified
2Semantic2GraphF1@50%87.3—Unverified
3BaFormerF1@50%83.9—Unverified
4DiffActF1@50%83.7—Unverified
5SF-TMN(ASFormer)F1@50%82.9—Unverified
6LTContextF1@50%82—Unverified
7UVASTF1@50%81.7—Unverified
8Br-Prompt+ASFormerF1@50%81.3—Unverified
9EUTF1@50%81—Unverified
10CETNetF1@50%80.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Semantic2GraphF1@50%91.3—Unverified
2FACTF1@50%87.5—Unverified
3DiffActF1@50%84.7—Unverified
4BaFormerF1@50%83.5—Unverified
5SF-TMN(ASFormer)F1@50%83.1—Unverified
6Br-Prompt+ASFormerF1@50%83—Unverified
7DPRNF1@50%82.9—Unverified
8BITF1@50%82.6—Unverified
9CETNetF1@50%81.3—Unverified
10UVASTF1@50%81—Unverified
#ModelMetricClaimedVerifiedStatus
1UnLoc-LFrame accuracy72.8—Unverified
2UnivlFrame accuracy70—Unverified
3NortonFrame accuracy69.8—Unverified
4VideoClipFrame accuracy68.7—Unverified
5TACoFrame accuracy68.4—Unverified
6VLMFrame accuracy68.4—Unverified
7MIL-NCEFrame accuracy61—Unverified
8ActBERTFrame accuracy57—Unverified
9CBTFrame accuracy53.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ASQueryF1@10%37.8—Unverified
2LTContextF1@10%33.9—Unverified
3ASFormerF1@10%33.4—Unverified
4C2F-TCNF1@10%33.3—Unverified
5UVASTF1@10%32.1—Unverified
6MS-TCN++F1@10%31.6—Unverified
7ProTAS(Offline)F1@10%28.7—Unverified
#ModelMetricClaimedVerifiedStatus
1RL+TreeEdit Distance88.53—Unverified
2RL (full)Edit Distance87.96—Unverified
3TricorNetEdit Distance86.8—Unverified
4SDL+SC-CRFEdit Distance86.21—Unverified
5TCNEdit Distance83.1—Unverified
6ST-CNN+SegEdit Distance66.56—Unverified
#ModelMetricClaimedVerifiedStatus
1TSA (FINCH)Acc62.4—Unverified
2TSA (Kmeans)Acc59.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EUTAcc87.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Unsup. TW-FINCH (K=avg/activity)Accuracy42—Unverified