SOTAVerified

Action Segmentation

Action Segmentation is a challenging problem in high-level video understanding. In its simplest form, Action Segmentation aims to segment a temporally untrimmed video by time and label each segmented part with one of pre-defined action labels. The results of Action Segmentation can be further used as input to various applications, such as video-to-text and action localization.

Source: TricorNet: A Hybrid Temporal Convolutional and Recurrent Network for Video Action Segmentation

Papers

Showing 151–175 of 219 papers

TitleStatusHype
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos—0
UnLoc: A Unified Framework for Video Localization Tasks—0
Unsupervised Action Segmentation for Instructional Videos—0
SSCAP: Self-supervised Co-occurrence Action Parsing for Unsupervised Temporal Action Segmentation—0
Unsupervised Discriminative Embedding for Sub-Action Learning in Complex Activities—0
Video Action Segmentation via Contextually Refined Temporal Keypoints—0
Video Action Segmentation with Hybrid Temporal Networks—0
VideoCapsuleNet: A Simplified Network for Action Detection—0
VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding—0
Video LLMs for Temporal Reasoning in Long Videos—0
ViSTec: Video Modeling for Sports Technique Recognition and Tactical Analysis—0
VLM: Task-agnostic Video-Language Model Pre-training for Video Understanding—0
Watch-Bot: Unsupervised Learning for Reminding Humans of Forgotten Actions—0
Watch-n-Patch: Unsupervised Learning of Actions and Relations—0
Watch-n-Patch: Unsupervised Understanding of Actions and Relations—0
Weakly-Supervised Action Segmentation and Unseen Error Detection in Anomalous Instructional Videos—0
Weakly Supervised Actor-Action Segmentation via Robust Multi-Task Ranking—0
Weakly-Supervised Online Action Segmentation in Multi-View Instructional Videos—0
What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning—0
O-TALC: Steps Towards Combating Oversegmentation within Online Action Segmentation—0
Prompt-enhanced Hierarchical Transformer Elevating Cardiopulmonary Resuscitation Instruction via Temporal Action Segmentation—0
Reducing the Label Bias for Timestamp Supervised Temporal Action Segmentation—0
Relational Graph Learning on Visual and Kinematics Embeddings for Accurate Gesture Recognition in Robotic Surgery—0
Robotic Imitation of Human Actions—0
Robust Action Segmentation from Timestamp Supervision—0
Show:102550
← PrevPage 7 of 9Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1AdaFocus (newly extracted I3D-features, LT-Context model)Average F176.2—Unverified
2FACT (efficient hybrid of convolution and transformer model)Average F174.7—Unverified
3ASQueryAverage F174.6—Unverified
4BITAverage F173.7—Unverified
5DiffActAverage F173.6—Unverified
6BaFormerAverage F172.4—Unverified
7CETNetAverage F171.8—Unverified
8SF-TMN(ASFormer)Average F171.6—Unverified
9RF++-SSTDAAcc70.8—Unverified
10ASPnetAverage F170.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Br-Prompt+ASPnet (RGB, flow, accelerometer)F1@50%88.5—Unverified
2Semantic2GraphF1@50%87.3—Unverified
3BaFormerF1@50%83.9—Unverified
4DiffActF1@50%83.7—Unverified
5SF-TMN(ASFormer)F1@50%82.9—Unverified
6LTContextF1@50%82—Unverified
7UVASTF1@50%81.7—Unverified
8Br-Prompt+ASFormerF1@50%81.3—Unverified
9EUTF1@50%81—Unverified
10CETNetF1@50%80.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Semantic2GraphF1@50%91.3—Unverified
2FACTF1@50%87.5—Unverified
3DiffActF1@50%84.7—Unverified
4BaFormerF1@50%83.5—Unverified
5SF-TMN(ASFormer)F1@50%83.1—Unverified
6Br-Prompt+ASFormerF1@50%83—Unverified
7DPRNF1@50%82.9—Unverified
8BITF1@50%82.6—Unverified
9CETNetF1@50%81.3—Unverified
10UVASTF1@50%81—Unverified
#ModelMetricClaimedVerifiedStatus
1UnLoc-LFrame accuracy72.8—Unverified
2UnivlFrame accuracy70—Unverified
3NortonFrame accuracy69.8—Unverified
4VideoClipFrame accuracy68.7—Unverified
5TACoFrame accuracy68.4—Unverified
6VLMFrame accuracy68.4—Unverified
7MIL-NCEFrame accuracy61—Unverified
8ActBERTFrame accuracy57—Unverified
9CBTFrame accuracy53.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ASQueryF1@10%37.8—Unverified
2LTContextF1@10%33.9—Unverified
3ASFormerF1@10%33.4—Unverified
4C2F-TCNF1@10%33.3—Unverified
5UVASTF1@10%32.1—Unverified
6MS-TCN++F1@10%31.6—Unverified
7ProTAS(Offline)F1@10%28.7—Unverified
#ModelMetricClaimedVerifiedStatus
1RL+TreeEdit Distance88.53—Unverified
2RL (full)Edit Distance87.96—Unverified
3TricorNetEdit Distance86.8—Unverified
4SDL+SC-CRFEdit Distance86.21—Unverified
5TCNEdit Distance83.1—Unverified
6ST-CNN+SegEdit Distance66.56—Unverified
#ModelMetricClaimedVerifiedStatus
1TSA (FINCH)Acc62.4—Unverified
2TSA (Kmeans)Acc59.7—Unverified
#ModelMetricClaimedVerifiedStatus
1EUTAcc87.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Unsup. TW-FINCH (K=avg/activity)Accuracy42—Unverified