SOTAVerified

Action Recognition In Videos

Action Recognition in Videos is a task in computer vision and pattern recognition where the goal is to identify and categorize human actions performed in a video sequence. The task involves analyzing the spatiotemporal dynamics of the actions and mapping them to a predefined set of action classes, such as running, jumping, or swimming.

Papers

Showing 1–50 of 124 papers

TitleStatusHype
Body-Hand Modality Expertized Networks with Cross-attention for Fine-grained Skeleton Action RecognitionCode0
EPAM-Net: An Efficient Pose-driven Attention-guided Multimodal Network for Video Action RecognitionCode1
The impact of Compositionality in Zero-shot Multi-label action recognition for Object-based tasks—0
Simba: Mamba augmented U-ShiftGCN for Skeletal Action Recognition in VideosCode1
ActNetFormer: Transformer-ResNet Hybrid Method for Semi-Supervised Action Recognition in VideosCode0
Deep Learning Approaches for Human Action Recognition in Video Data—0
HaltingVT: Adaptive Token Halting Transformer for Efficient Video RecognitionCode0
A Dense-Sparse Complementary Network for Human Action Recognition based on RGB and Skeleton ModalitiesCode1
DVANet: Disentangling View and Action Features for Multi-View Action RecognitionCode0
CAST: Cross-Attention in Space and Time for Video Action RecognitionCode1
Action Class Relation Detection and Classification Across Multiple Video Datasets—0
Actor-agnostic Multi-label Action Recognition with Multi-modal QueryCode1
Hiera: A Hierarchical Vision Transformer without the Bells-and-WhistlesCode0
VideoMAE V2: Scaling Video Masked Autoencoders with Dual MaskingCode2
Dual-path Adaptation from Image to Video TransformersCode1
Video Action Recognition Collaborative Learning with Dynamics via PSO-ConvNet TransformerCode0
Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video LearningCode1
Knowledge Prompting for Few-shot Action Recognition—0
Could Giant Pretrained Image Models Extract Universal Representations?—0
Exploring Modulated Detection Transformer as a Tool for Action Recognition in VideosCode0
MMNet: A Model-Based Multimodal Network for Human Action Recognition in RGB-D VideosCode1
Class-Incremental Learning for Action Recognition in Videos—0
DirecFormer: A Directed Attention in Transformer Approach to Robust Action RecognitionCode1
A new face swap method for image and video domains: a technical reportCode3
Co-training Transformer with Videos and Images Improves Action Recognition—0
Self-supervised Video TransformerCode1
Florence: A New Foundation Model for Computer VisionCode1
Technical Report: Disentangled Action Parsing Networks for Accurate Part-level Action Parsing—0
Logsig-RNN: a novel network for robust and efficient skeleton-based action recognitionCode1
Class incremental learning for video action classification—0
ActionCLIP: A New Paradigm for Video Action RecognitionCode1
Self-supervised Video Representation Learning with Cross-Stream Prototypical ContrastingCode1
Space-time Mixing Attention for Video TransformerCode1
Multimodal Fusion via Teacher-Student Network for Indoor Action RecognitionCode1
Learning Implicit Temporal Alignment for Few-shot Video ClassificationCode1
VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and TextCode1
Busy-Quiet Video Disentangling for Video ClassificationCode1
NAS-TC: Neural Architecture Search on Temporal Convolutions for Complex Action Recognition—0
Video Transformer NetworkCode0
Temporal Difference Networks for Action Recognition—0
Tensor Representations for Action RecognitionCode1
TDN: Temporal Difference Networks for Efficient Action RecognitionCode1
Towards Improving Spatiotemporal Action Recognition in VideosCode0
Developing Motion Code Embedding for Action Recognition in Videos—0
Multi-Temporal Convolutions for Human Action Recognition in VideosCode1
Toward Accurate Person-level Action Recognition in Videos of Crowded Scenes—0
Pose And Joint-Aware Action RecognitionCode0
Skeleton-based Action Recognition via Spatial and Temporal Transformer NetworksCode1
Self-supervised Video Representation Learning Using Inter-intra Contrastive FrameworkCode1
Towards Efficient Coarse-to-Fine Networks for Action and Gesture Recognition—0
Show:102550
← PrevPage 1 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1CPNet Res34, 5 CPVal96.7—Unverified
2STM (Resnet-50, 16 frames)Val96.7—Unverified
3MFNetVal96.68—Unverified
4DINVal95.31—Unverified
5MultiScale TRNVal95.31—Unverified
6convSTARVal92.7—Unverified
73D-SqueezeNetVal90.77—Unverified
83D-ShuffleNetV2 0.25xVal86.91—Unverified
93D-MobileNetV2 0.2xVal86.43—Unverified
#ModelMetricClaimedVerifiedStatus
1DSCNet (RGB + Pose)X-Sub97.4—Unverified
2MMNetX-Sub97.4—Unverified
3EPAM-NetX-Sub96.2—Unverified
4DVANet (RGB only)X-Sub95.8—Unverified
5TSMFX-Sub95.8—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (ImageNet+Kinetics pretrain)3-fold Accuracy96.2—Unverified
23D-SqueezeNet3-fold Accuracy74.94—Unverified
33D-ShuffleNetV2 0.25x3-fold Accuracy56.52—Unverified
43D-MobileNetV2 0.2x3-fold Accuracy55.56—Unverified
5Baseline UCF1013-fold Accuracy43.9—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (16 frames, ImageNet pretraining)Top-1 Accuracy64.2—Unverified
2CPNet Res34, 5 CPTop-1 Accuracy57.65—Unverified
32-Stream TRNTop-1 Accuracy55.52—Unverified
4DINTop-1 Accuracy34.11—Unverified
#ModelMetricClaimedVerifiedStatus
1FlorenceTop-1 Accuracy86.5—Unverified
2ActionCLIP (ViT-B/16)Top-1 Accuracy83.8—Unverified
3Frozen Backbone, SwinV2-G-ext22K (Video-Swin)Top-1 Accuracy81.7—Unverified
#ModelMetricClaimedVerifiedStatus
1YOWO+LFB*mAP (Val)20.2—Unverified
2VideoMAE V2mAP (Val)18.24—Unverified
#ModelMetricClaimedVerifiedStatus
1ITANetTop-1 Accuracy(5-Way-1-Shot)49.2—Unverified
2OTAM[3]++Top-1 Accuracy(5-Way-1-Shot)42.8—Unverified
#ModelMetricClaimedVerifiedStatus
1ITANetTop-1 Accuracy(5-Way-1-Shot)39.8—Unverified
2CMN[35]Top-1 Accuracy(5-Way-1-Shot)36.2—Unverified
#ModelMetricClaimedVerifiedStatus
1G-BlendVideo hit@174.8—Unverified
2LSTM +Pretrained on YT-8MVideo hit@165.7—Unverified
#ModelMetricClaimedVerifiedStatus
1LSTM + Pretrained on YT-8MmAP75.6—Unverified
#ModelMetricClaimedVerifiedStatus
1YOWO+LFB*mAP (Val)19.2—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (ImageNet+Kinetics pretrain)Average accuracy of 3 splits72.2—Unverified
#ModelMetricClaimedVerifiedStatus
1FlorenceTop-1 Accuracy87.8—Unverified
#ModelMetricClaimedVerifiedStatus
1G-BlendClip Hit@149.7—Unverified
#ModelMetricClaimedVerifiedStatus
12D-3D-Softargmax (RGB only)Accuracy (CS)85.5—Unverified
#ModelMetricClaimedVerifiedStatus
1STM (16 frames, ImageNet pretraining)Top 1 Accuracy50.7—Unverified