SOTAVerified

Action Recognition In Videos

Action Recognition in Videos is a task in computer vision and pattern recognition where the goal is to identify and categorize human actions performed in a video sequence. The task involves analyzing the spatiotemporal dynamics of the actions and mapping them to a predefined set of action classes, such as running, jumping, or swimming.

Papers

Showing 101–110 of 124 papers

TitleStatusHype
Temporal Sequence Distillation: Towards Few-Frame Action Recognition in Videos—0
An Information-rich Sampling Technique over Spatio-Temporal CNN for Classification of Human Actions in Videos—0
The impact of Compositionality in Zero-shot Multi-label action recognition for Object-based tasks—0
Learning Compact Recurrent Neural Networks with Block-Term Tensor Decomposition—0
Learning to Recognize 3D Human Action from A New Skeleton-based Representation Using Deep Convolutional Neural Networks—0
Learning Transferable Self-attentive Representations for Action Recognition in Untrimmed Videos with Weak Supervision—0
Top-down Attention Recurrent VLAD Encoding for Action Recognition in Videos—0
Toward Accurate Person-level Action Recognition in Videos of Crowded Scenes—0
Developing the Path Signature Methodology and its Application to Landmark-based Human Action Recognition—0
Knowledge Prompting for Few-shot Action Recognition—0
Show:102550
← PrevPage 11 of 13Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1CPNet Res34, 5 CPVal96.7—Unverified
2STM (Resnet-50, 16 frames)Val96.7—Unverified
3MFNetVal96.68—Unverified
4DINVal95.31—Unverified
5MultiScale TRNVal95.31—Unverified
6convSTARVal92.7—Unverified
73D-SqueezeNetVal90.77—Unverified
83D-ShuffleNetV2 0.25xVal86.91—Unverified
93D-MobileNetV2 0.2xVal86.43—Unverified
#ModelMetricClaimedVerifiedStatus
1DSCNet (RGB + Pose)X-Sub97.4—Unverified
2MMNetX-Sub97.4—Unverified
3EPAM-NetX-Sub96.2—Unverified
4DVANet (RGB only)X-Sub95.8—Unverified
5TSMFX-Sub95.8—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (ImageNet+Kinetics pretrain)3-fold Accuracy96.2—Unverified
23D-SqueezeNet3-fold Accuracy74.94—Unverified
33D-ShuffleNetV2 0.25x3-fold Accuracy56.52—Unverified
43D-MobileNetV2 0.2x3-fold Accuracy55.56—Unverified
5Baseline UCF1013-fold Accuracy43.9—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (16 frames, ImageNet pretraining)Top-1 Accuracy64.2—Unverified
2CPNet Res34, 5 CPTop-1 Accuracy57.65—Unverified
32-Stream TRNTop-1 Accuracy55.52—Unverified
4DINTop-1 Accuracy34.11—Unverified
#ModelMetricClaimedVerifiedStatus
1FlorenceTop-1 Accuracy86.5—Unverified
2ActionCLIP (ViT-B/16)Top-1 Accuracy83.8—Unverified
3Frozen Backbone, SwinV2-G-ext22K (Video-Swin)Top-1 Accuracy81.7—Unverified
#ModelMetricClaimedVerifiedStatus
1YOWO+LFB*mAP (Val)20.2—Unverified
2VideoMAE V2mAP (Val)18.24—Unverified
#ModelMetricClaimedVerifiedStatus
1ITANetTop-1 Accuracy(5-Way-1-Shot)49.2—Unverified
2OTAM[3]++Top-1 Accuracy(5-Way-1-Shot)42.8—Unverified
#ModelMetricClaimedVerifiedStatus
1ITANetTop-1 Accuracy(5-Way-1-Shot)39.8—Unverified
2CMN[35]Top-1 Accuracy(5-Way-1-Shot)36.2—Unverified
#ModelMetricClaimedVerifiedStatus
1G-BlendVideo hit@174.8—Unverified
2LSTM +Pretrained on YT-8MVideo hit@165.7—Unverified
#ModelMetricClaimedVerifiedStatus
1LSTM + Pretrained on YT-8MmAP75.6—Unverified
#ModelMetricClaimedVerifiedStatus
1YOWO+LFB*mAP (Val)19.2—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (ImageNet+Kinetics pretrain)Average accuracy of 3 splits72.2—Unverified
#ModelMetricClaimedVerifiedStatus
1FlorenceTop-1 Accuracy87.8—Unverified
#ModelMetricClaimedVerifiedStatus
1G-BlendClip Hit@149.7—Unverified
#ModelMetricClaimedVerifiedStatus
12D-3D-Softargmax (RGB only)Accuracy (CS)85.5—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (16 frames, ImageNet pretraining)Top 1 Accuracy50.7—Unverified