SOTAVerified

Action Recognition In Videos

Action Recognition in Videos is a task in computer vision and pattern recognition where the goal is to identify and categorize human actions performed in a video sequence. The task involves analyzing the spatiotemporal dynamics of the actions and mapping them to a predefined set of action classes, such as running, jumping, or swimming.

Papers

Showing 11–20 of 124 papers

TitleStatusHype
Action Class Relation Detection and Classification Across Multiple Video Datasets—0
Actor-agnostic Multi-label Action Recognition with Multi-modal QueryCode1
Hiera: A Hierarchical Vision Transformer without the Bells-and-WhistlesCode0
VideoMAE V2: Scaling Video Masked Autoencoders with Dual MaskingCode2
Dual-path Adaptation from Image to Video TransformersCode1
Video Action Recognition Collaborative Learning with Dynamics via PSO-ConvNet TransformerCode0
Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video LearningCode1
Knowledge Prompting for Few-shot Action Recognition—0
Could Giant Pretrained Image Models Extract Universal Representations?—0
Exploring Modulated Detection Transformer as a Tool for Action Recognition in VideosCode0
Show:102550
← PrevPage 2 of 13Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1CPNet Res34, 5 CPVal96.7—Unverified
2STM (Resnet-50, 16 frames)Val96.7—Unverified
3MFNetVal96.68—Unverified
4DINVal95.31—Unverified
5MultiScale TRNVal95.31—Unverified
6convSTARVal92.7—Unverified
73D-SqueezeNetVal90.77—Unverified
83D-ShuffleNetV2 0.25xVal86.91—Unverified
93D-MobileNetV2 0.2xVal86.43—Unverified
#ModelMetricClaimedVerifiedStatus
1DSCNet (RGB + Pose)X-Sub97.4—Unverified
2MMNetX-Sub97.4—Unverified
3EPAM-NetX-Sub96.2—Unverified
4DVANet (RGB only)X-Sub95.8—Unverified
5TSMFX-Sub95.8—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (ImageNet+Kinetics pretrain)3-fold Accuracy96.2—Unverified
23D-SqueezeNet3-fold Accuracy74.94—Unverified
33D-ShuffleNetV2 0.25x3-fold Accuracy56.52—Unverified
43D-MobileNetV2 0.2x3-fold Accuracy55.56—Unverified
5Baseline UCF1013-fold Accuracy43.9—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (16 frames, ImageNet pretraining)Top-1 Accuracy64.2—Unverified
2CPNet Res34, 5 CPTop-1 Accuracy57.65—Unverified
32-Stream TRNTop-1 Accuracy55.52—Unverified
4DINTop-1 Accuracy34.11—Unverified
#ModelMetricClaimedVerifiedStatus
1FlorenceTop-1 Accuracy86.5—Unverified
2ActionCLIP (ViT-B/16)Top-1 Accuracy83.8—Unverified
3Frozen Backbone, SwinV2-G-ext22K (Video-Swin)Top-1 Accuracy81.7—Unverified
#ModelMetricClaimedVerifiedStatus
1YOWO+LFB*mAP (Val)20.2—Unverified
2VideoMAE V2mAP (Val)18.24—Unverified
#ModelMetricClaimedVerifiedStatus
1ITANetTop-1 Accuracy(5-Way-1-Shot)49.2—Unverified
2OTAM[3]++Top-1 Accuracy(5-Way-1-Shot)42.8—Unverified
#ModelMetricClaimedVerifiedStatus
1ITANetTop-1 Accuracy(5-Way-1-Shot)39.8—Unverified
2CMN[35]Top-1 Accuracy(5-Way-1-Shot)36.2—Unverified
#ModelMetricClaimedVerifiedStatus
1G-BlendVideo hit@174.8—Unverified
2LSTM +Pretrained on YT-8MVideo hit@165.7—Unverified
#ModelMetricClaimedVerifiedStatus
1LSTM + Pretrained on YT-8MmAP75.6—Unverified
#ModelMetricClaimedVerifiedStatus
1YOWO+LFB*mAP (Val)19.2—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (ImageNet+Kinetics pretrain)Average accuracy of 3 splits72.2—Unverified
#ModelMetricClaimedVerifiedStatus
1FlorenceTop-1 Accuracy87.8—Unverified
#ModelMetricClaimedVerifiedStatus
1G-BlendClip Hit@149.7—Unverified
#ModelMetricClaimedVerifiedStatus
12D-3D-Softargmax (RGB only)Accuracy (CS)85.5—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (16 frames, ImageNet pretraining)Top 1 Accuracy50.7—Unverified