Action Recognition

Action Recognition is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.

In the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos.

Please note some benchmarks may be located in the Action Classification or Video Classification tasks, e.g. Kinetics-400.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2151–2175 of 2759 papers

Title	Date	Tasks	Status
Mutual Context Network for Jointly Estimating Egocentric Gaze and Actions	Jan 7, 2019	Action RecognitionGaze Prediction	—Unverified
MV2MAE: Multi-View Video Masked Autoencoders	Jan 29, 2024	Action RecognitionDecoder	—Unverified
MV-GMN: State Space Model for Multi-View Action Recognition	Jan 23, 2025	Action RecognitionMamba	—Unverified
MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human Captures	Dec 5, 2023	Action RecognitionImage Generation	—Unverified
MVP-Shot: Multi-Velocity Progressive-Alignment Framework for Few-Shot Action Recognition	May 3, 2024	Action RecognitionFew-Shot action recognition	—Unverified
MVSA-Net: Multi-View State-Action Recognition for Robust and Deployable Trajectory Generation	Nov 14, 2023	Action RecognitionActivity Recognition	—Unverified
NAS-TC: Neural Architecture Search on Temporal Convolutions for Complex Action Recognition	Mar 17, 2021	Action RecognitionAction Recognition In Videos	—Unverified
Natural Language Descriptions for Human Activities in Video Streams	Sep 1, 2017	Action RecognitionLanguage Modeling	—Unverified
Neural Graph Matching Networks for Fewshot 3D Action Recognition	Sep 1, 2018	3D Action RecognitionAction Recognition	—Unverified
Neuron: Learning Context-Aware Evolving Representations for Zero-Shot Skeleton Action Recognition	Nov 18, 2024	Action Recognition	—Unverified
No-audio speaking status detection in crowded settings via visual pose-based filtering and wearable acceleration	Nov 1, 2022	Action RecognitionPrivacy Preserving	—Unverified
Noise-Tolerant Learning for Audio-Visual Action Recognition	May 16, 2022	Action RecognitionNoise Estimation	—Unverified
Non-Linear Temporal Subspace Representations for Activity Recognition	Mar 27, 2018	Action RecognitionActivity Recognition	—Unverified
Non-local Recurrent Neural Memory for Supervised Sequence Modeling	Aug 26, 2019	Action RecognitionSentiment Analysis	—Unverified
Normalized Human Pose Features for Human Action Video Alignment	Jan 1, 2021	Action RecognitionMetric Learning	—Unverified
Nrityantar: Pose oblivious Indian classical dance sequence classification system	Dec 13, 2018	Action RecognitionClassification	—Unverified
NSNet: Non-saliency Suppression Sampler for Efficient Video Recognition	Jul 21, 2022	Action RecognitionVideo Classification	—Unverified
Nuisance-Label Supervision: Robustness Improvement by Free Labels	Oct 14, 2021	Action RecognitionActivity Recognition	—Unverified
NUTA: Non-uniform Temporal Aggregation for Action Recognition	Dec 15, 2020	Action Recognition	—Unverified
Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild	Jun 14, 2024	Action RecognitionGaze Estimation	—Unverified
Object-ABN: Learning to Generate Sharp Attention Maps for Action Recognition	Jul 27, 2022	Action RecognitionInstance Segmentation	—Unverified
Object Activity Scene Description, Construction and Recognition	May 1, 2018	Action RecognitionGeneral Classification	—Unverified
Object-based (yet Class-agnostic) Video Domain Adaptation	Nov 29, 2023	Action RecognitionDomain Adaptation	—Unverified
ObjectMix: Data Augmentation by Copy-Pasting Objects in Videos for Action Recognition	Apr 1, 2022	Action RecognitionData Augmentation	—Unverified
Object Properties Inferring from and Transfer for Human Interaction Motions	Aug 20, 2020	Action RecognitionFine-grained Action Recognition	—Unverified

Show:10 25 50

← PrevPage 87 of 111Next →

All datasets Something-Something V2 UCF101 HMDB-51 Something-Something V1 AVA v2.2 EPIC-KITCHENS-100 NTU RGB+D NTU RGB+D 120 Diving-48 ActivityNet AVA v2.1 H2O (2 Hands and Objects)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	MViTv2-B (IN-21K + Kinetics400 pretrain)	Top-5 Accuracy	93.4	—	Unverified
2	RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)	Top-5 Accuracy	91.1	—	Unverified
3	MVD (Kinetics400 pretrain, ViT-H, 16 frame)	Top-1 Accuracy	77.3	—	Unverified
4	DejaVid	Top-1 Accuracy	77.2	—	Unverified
5	InternVideo	Top-1 Accuracy	77.2	—	Unverified
6	InternVideo2-1B	Top-1 Accuracy	77.1	—	Unverified
7	VideoMAE V2-g	Top-1 Accuracy	77	—	Unverified
8	MVD (Kinetics400 pretrain, ViT-L, 16 frame)	Top-1 Accuracy	76.7	—	Unverified
9	Hiera-L (no extra data)	Top-1 Accuracy	76.5	—	Unverified
10	TubeViT-L	Top-1 Accuracy	76.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	FTP-UniFormerV2-L/14	3-fold Accuracy	99.7	—	Unverified
2	OmniVec2	3-fold Accuracy	99.6	—	Unverified
3	VideoMAE V2-g	3-fold Accuracy	99.6	—	Unverified
4	OmniVec	3-fold Accuracy	99.6	—	Unverified
5	BIKE	3-fold Accuracy	98.8	—	Unverified
6	SMART	3-fold Accuracy	98.64	—	Unverified
7	OmniSource (SlowOnly-8x8-R101-RGB + I3D-Flow)	3-fold Accuracy	98.6	—	Unverified
8	PERF-Net (multi-distilled S3D)	3-fold Accuracy	98.6	—	Unverified
9	ZeroI2V ViT-L/14	3-fold Accuracy	98.6	—	Unverified
10	LGD-3D Two-stream	3-fold Accuracy	98.2	—	Unverified