Action Recognition

Action Recognition is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.

In the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos.

Please note some benchmarks may be located in the Action Classification or Video Classification tasks, e.g. Kinetics-400.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2151–2200 of 2759 papers

Title	Date	Tasks	Status
Mutual Context Network for Jointly Estimating Egocentric Gaze and Actions	Jan 7, 2019	Action RecognitionGaze Prediction	—Unverified
MV2MAE: Multi-View Video Masked Autoencoders	Jan 29, 2024	Action RecognitionDecoder	—Unverified
MV-GMN: State Space Model for Multi-View Action Recognition	Jan 23, 2025	Action RecognitionMamba	—Unverified
MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human Captures	Dec 5, 2023	Action RecognitionImage Generation	—Unverified
MVP-Shot: Multi-Velocity Progressive-Alignment Framework for Few-Shot Action Recognition	May 3, 2024	Action RecognitionFew-Shot action recognition	—Unverified
MVSA-Net: Multi-View State-Action Recognition for Robust and Deployable Trajectory Generation	Nov 14, 2023	Action RecognitionActivity Recognition	—Unverified
NAS-TC: Neural Architecture Search on Temporal Convolutions for Complex Action Recognition	Mar 17, 2021	Action RecognitionAction Recognition In Videos	—Unverified
Natural Language Descriptions for Human Activities in Video Streams	Sep 1, 2017	Action RecognitionLanguage Modeling	—Unverified
Neural Graph Matching Networks for Fewshot 3D Action Recognition	Sep 1, 2018	3D Action RecognitionAction Recognition	—Unverified
Neuron: Learning Context-Aware Evolving Representations for Zero-Shot Skeleton Action Recognition	Nov 18, 2024	Action Recognition	—Unverified
No-audio speaking status detection in crowded settings via visual pose-based filtering and wearable acceleration	Nov 1, 2022	Action RecognitionPrivacy Preserving	—Unverified
Noise-Tolerant Learning for Audio-Visual Action Recognition	May 16, 2022	Action RecognitionNoise Estimation	—Unverified
Non-Linear Temporal Subspace Representations for Activity Recognition	Mar 27, 2018	Action RecognitionActivity Recognition	—Unverified
Non-local Recurrent Neural Memory for Supervised Sequence Modeling	Aug 26, 2019	Action RecognitionSentiment Analysis	—Unverified
Normalized Human Pose Features for Human Action Video Alignment	Jan 1, 2021	Action RecognitionMetric Learning	—Unverified
Nrityantar: Pose oblivious Indian classical dance sequence classification system	Dec 13, 2018	Action RecognitionClassification	—Unverified
NSNet: Non-saliency Suppression Sampler for Efficient Video Recognition	Jul 21, 2022	Action RecognitionVideo Classification	—Unverified
Nuisance-Label Supervision: Robustness Improvement by Free Labels	Oct 14, 2021	Action RecognitionActivity Recognition	—Unverified
NUTA: Non-uniform Temporal Aggregation for Action Recognition	Dec 15, 2020	Action Recognition	—Unverified
Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild	Jun 14, 2024	Action RecognitionGaze Estimation	—Unverified
Object-ABN: Learning to Generate Sharp Attention Maps for Action Recognition	Jul 27, 2022	Action RecognitionInstance Segmentation	—Unverified
Object Activity Scene Description, Construction and Recognition	May 1, 2018	Action RecognitionGeneral Classification	—Unverified
Object-based (yet Class-agnostic) Video Domain Adaptation	Nov 29, 2023	Action RecognitionDomain Adaptation	—Unverified
ObjectMix: Data Augmentation by Copy-Pasting Objects in Videos for Action Recognition	Apr 1, 2022	Action RecognitionData Augmentation	—Unverified
Object Properties Inferring from and Transfer for Human Interaction Motions	Aug 20, 2020	Action RecognitionFine-grained Action Recognition	—Unverified
Object-Relation Reasoning Graph for Action Recognition	Jan 1, 2022	Action RecognitionAttribute	—Unverified
ODN: Opening the Deep Network for Open-set Action Recognition	Jan 23, 2019	Action RecognitionOpen Set Action Recognition	—Unverified
OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning	Jan 1, 2024	3D Point Cloud ClassificationAction Classification	—Unverified
OmniVL:One Foundation Model for Image-Language and Video-Language Tasks	Sep 15, 2022	Action ClassificationAction Recognition	—Unverified
On Dropping Clusters to Regularize Graph Convolutional Neural Networks	Aug 1, 2020	Action RecognitionSkeleton Based Action Recognition	—Unverified
One-Shot Action Recognition via Multi-Scale Spatial-Temporal Skeleton Matching	Jul 14, 2023	Action Recognition	—Unverified
Online Action Recognition based on Incremental Learning of Weighted Covariance Descriptors	Nov 10, 2015	Action RecognitionIncremental Learning	—Unverified
Online hand gesture recognition using Continual Graph Transformers	Feb 20, 2025	Action RecognitionContinual Learning	—Unverified
Online Learnable Keyframe Extraction in Videos and its Application with Semantic Word Vector in Action Recognition	Sep 25, 2020	Action RecognitionGeneral Classification	—Unverified
Online pre-training with long-form videos	Aug 28, 2024	Action RecognitionContrastive Learning	—Unverified
On Negative Sampling for Audio-Visual Contrastive Learning from Movies	Apr 29, 2022	Action RecognitionAudio Classification	—Unverified
On the Impact of Lossy Image and Video Compression on the Performance of Deep Convolutional Neural Network Architectures	Jul 28, 2020	Action RecognitionDecoder	—Unverified
On the Importance of Spatial Relations for Few-shot Action Recognition	Aug 14, 2023	Action RecognitionFew-Shot action recognition	—Unverified
On the Importance of Video Action Recognition for Visual Lipreading	Mar 22, 2019	Action RecognitionLipreading	—Unverified
On the Integration of Optical Flow and Action Recognition	Dec 22, 2017	Action RecognitionOptical Flow Estimation	—Unverified
Performance Evaluation of Action Recognition Models on Low Quality Videos	Apr 19, 2022	Action Recognition	—Unverified
On the Role of Event Boundaries in Egocentric Activity Recognition from Photostreams	Sep 2, 2018	Action RecognitionActivity Recognition	—Unverified
Open Set Action Recognition via Multi-Label Evidential Learning	Feb 27, 2023	Action DetectionAction Recognition	—Unverified
Optical flow and scene flow estimation: A survey	Feb 1, 2021	Action RecognitionAutonomous Driving	—Unverified
Optimizing Human Pose Estimation Through Focused Human and Joint Regions	Jan 24, 2025	Action RecognitionPose Estimation	—Unverified
Optimizing ViViT Training: Time and Memory Reduction for Action Recognition	Jun 7, 2023	Action Recognition	—Unverified
Order-aware Convolutional Pooling for Video Based Action Recognition	Jan 31, 2016	Action RecognitionTemporal Action Localization	—Unverified
Ordered Pooling of Optical Flow Sequences for Action Recognition	Jan 12, 2017	Action RecognitionOptical Flow Estimation	—Unverified
Order-Preserving Wasserstein Discriminant Analysis	Oct 1, 2019	3D Action RecognitionAction Recognition	—Unverified
Origami: A 803 GOp/s/W Convolutional Network Accelerator	Dec 14, 2015	Action RecognitionObject Recognition	—Unverified

Show:10 25 50

← PrevPage 44 of 56Next →

All datasets Something-Something V2 UCF101 HMDB-51 Something-Something V1 AVA v2.2 EPIC-KITCHENS-100 NTU RGB+D NTU RGB+D 120 Diving-48 ActivityNet AVA v2.1 H2O (2 Hands and Objects)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	MViTv2-B (IN-21K + Kinetics400 pretrain)	Top-5 Accuracy	93.4	—	Unverified
2	RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)	Top-5 Accuracy	91.1	—	Unverified
3	MVD (Kinetics400 pretrain, ViT-H, 16 frame)	Top-1 Accuracy	77.3	—	Unverified
4	DejaVid	Top-1 Accuracy	77.2	—	Unverified
5	InternVideo	Top-1 Accuracy	77.2	—	Unverified
6	InternVideo2-1B	Top-1 Accuracy	77.1	—	Unverified
7	VideoMAE V2-g	Top-1 Accuracy	77	—	Unverified
8	MVD (Kinetics400 pretrain, ViT-L, 16 frame)	Top-1 Accuracy	76.7	—	Unverified
9	Hiera-L (no extra data)	Top-1 Accuracy	76.5	—	Unverified
10	TubeViT-L	Top-1 Accuracy	76.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	FTP-UniFormerV2-L/14	3-fold Accuracy	99.7	—	Unverified
2	OmniVec2	3-fold Accuracy	99.6	—	Unverified
3	VideoMAE V2-g	3-fold Accuracy	99.6	—	Unverified
4	OmniVec	3-fold Accuracy	99.6	—	Unverified
5	BIKE	3-fold Accuracy	98.8	—	Unverified
6	SMART	3-fold Accuracy	98.64	—	Unverified
7	OmniSource (SlowOnly-8x8-R101-RGB + I3D-Flow)	3-fold Accuracy	98.6	—	Unverified
8	PERF-Net (multi-distilled S3D)	3-fold Accuracy	98.6	—	Unverified
9	ZeroI2V ViT-L/14	3-fold Accuracy	98.6	—	Unverified
10	LGD-3D Two-stream	3-fold Accuracy	98.2	—	Unverified