Action Recognition

Action Recognition is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.

In the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos.

Please note some benchmarks may be located in the Action Classification or Video Classification tasks, e.g. Kinetics-400.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2726–2750 of 2759 papers

Title	Date	Tasks	Status
Cross-view Action Modeling, Learning and Recognition	May 12, 2014	Action RecognitionTemporal Action Localization	—Unverified
From Synsets to Videos: Enriching ItalWordNet Multimodally	May 1, 2014	Action RecognitionLanguage Acquisition	—Unverified
Shrinkage Optimized Directed Information using Pictorial Structures for Action Recognition	Apr 12, 2014	Action RecognitionTemporal Action Localization	—Unverified
KPCA Spatio-temporal trajectory point cloud classifier for recognizing human actions in a CBVR system	Mar 26, 2014	Action RecognitionRetrieval	—Unverified
Bregman Divergences for Infinite Dimensional Covariance Matrices	Mar 18, 2014	Action RecognitionGeneral Classification	—Unverified
Group sparsity and geometry constrained dictionary learning for action recognition from depth maps.	Mar 3, 2014	Action RecognitionDictionary Learning	—Unverified
Multiview Hessian regularized logistic regression for action recognition	Mar 3, 2014	Action RecognitionAttribute	—Unverified
A Hybrid Loss for Multiclass and Structured Prediction	Feb 9, 2014	Action RecognitionPrediction	—Unverified
Extrinsic Methods for Coding and Dictionary Learning on Grassmann Manifolds	Jan 31, 2014	Action RecognitionClassification	—Unverified
Actions in the Eye: Dynamic Gaze Datasets and Learnt Saliency Models for Visual Recognition	Dec 29, 2013	Action RecognitionTemporal Action Localization	—Unverified
EXMOVES: Classifier-based Features for Scalable Action Recognition	Dec 20, 2013	Action RecognitionGeneral Classification	—Unverified
Dictionary Learning and Sparse Coding on Grassmann Manifolds: An Extrinsic Solution	Oct 18, 2013	Action RecognitionDictionary Learning	—Unverified
Combining Spatio-Temporal Appearance Descriptors and Optical Flow for Human Action Recognition in Video Data	Oct 1, 2013	Action RecognitionOptical Flow Estimation	—Unverified
Seeing What You're Told: Sentence-Guided Activity Recognition In Video	Aug 19, 2013	Action RecognitionActivity Recognition	—Unverified
Sparse Dictionary-based Attributes for Action Recognition and Summarization	Aug 1, 2013	Action RecognitionDictionary Learning	—Unverified
Modeling Actions through State Changes	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
Sampling Strategies for Real-Time Action Recognition	Jun 1, 2013	Action RecognitionComputational Efficiency	—Unverified
Tracking Human Pose by Tracking Symmetric Parts	Jun 1, 2013	Action RecognitionPose Estimation	—Unverified
An Approach to Pose-Based Action Recognition	Jun 1, 2013	Action RecognitionAction Recognition In Videos	—Unverified
Cross-View Action Recognition via a Continuous Virtual Path	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
Expanded Parts Model for Human Attribute and Action Recognition in Still Images	Jun 1, 2013	Action RecognitionAction Recognition In Still Images	—Unverified
Multi-task Sparse Learning with Beta Process Prior for Action Recognition	Jun 1, 2013	Action RecognitionSparse Learning	—Unverified
Detection of Manipulation Action Consequences (MAC)	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
Motionlets: Mid-level 3D Parts for Human Motion Recognition	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
Hollywood 3D: Recognizing Actions in 3D Natural Scenes	Jun 1, 2013	Action RecognitionBenchmarking	—Unverified

Show:10 25 50

← PrevPage 110 of 111Next →

All datasets Something-Something V2 UCF101 HMDB-51 Something-Something V1 AVA v2.2 EPIC-KITCHENS-100 NTU RGB+D NTU RGB+D 120 Diving-48 ActivityNet AVA v2.1 H2O (2 Hands and Objects)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	MViTv2-B (IN-21K + Kinetics400 pretrain)	Top-5 Accuracy	93.4	—	Unverified
2	RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)	Top-5 Accuracy	91.1	—	Unverified
3	MVD (Kinetics400 pretrain, ViT-H, 16 frame)	Top-1 Accuracy	77.3	—	Unverified
4	DejaVid	Top-1 Accuracy	77.2	—	Unverified
5	InternVideo	Top-1 Accuracy	77.2	—	Unverified
6	InternVideo2-1B	Top-1 Accuracy	77.1	—	Unverified
7	VideoMAE V2-g	Top-1 Accuracy	77	—	Unverified
8	MVD (Kinetics400 pretrain, ViT-L, 16 frame)	Top-1 Accuracy	76.7	—	Unverified
9	Hiera-L (no extra data)	Top-1 Accuracy	76.5	—	Unverified
10	TubeViT-L	Top-1 Accuracy	76.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	FTP-UniFormerV2-L/14	3-fold Accuracy	99.7	—	Unverified
2	OmniVec2	3-fold Accuracy	99.6	—	Unverified
3	VideoMAE V2-g	3-fold Accuracy	99.6	—	Unverified
4	OmniVec	3-fold Accuracy	99.6	—	Unverified
5	BIKE	3-fold Accuracy	98.8	—	Unverified
6	SMART	3-fold Accuracy	98.64	—	Unverified
7	OmniSource (SlowOnly-8x8-R101-RGB + I3D-Flow)	3-fold Accuracy	98.6	—	Unverified
8	PERF-Net (multi-distilled S3D)	3-fold Accuracy	98.6	—	Unverified
9	ZeroI2V ViT-L/14	3-fold Accuracy	98.6	—	Unverified
10	LGD-3D Two-stream	3-fold Accuracy	98.2	—	Unverified