Action Recognition

Action Recognition is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.

In the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos.

Please note some benchmarks may be located in the Action Classification or Video Classification tasks, e.g. Kinetics-400.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2701–2750 of 2759 papers

Title	Date	Tasks	Status
A discussion on the validation tests employed to compare human action recognition methods using the MSR Action3D dataset	Jul 28, 2014	Action RecognitionTemporal Action Localization	—Unverified
Feature and Region Selection for Visual Learning	Jul 20, 2014	Action Recognitionfeature selection	—Unverified
A Hierarchical Context Model for Event Recognition in Surveillance Video	Jun 27, 2014	Action Recognition	—Unverified
Human Action Recognition by Representing 3D Skeletons as Points in a Lie Group	Jun 23, 2014	Action RecognitionDynamic Time Warping	CodeCode Available
Log-Euclidean Bag of Words for Human Action Recognition	Jun 9, 2014	Action RecognitionOptical Flow Estimation	—Unverified
Robust Estimation of 3D Human Poses from a Single Image	Jun 9, 2014	3D Human Pose Estimation3D Pose Estimation	—Unverified
Two-Stream Convolutional Networks for Action Recognition in Videos	Jun 9, 2014	Action ClassificationAction Recognition	CodeCode Available
Continuous Action Recognition Based on Sequence Alignment	Jun 2, 2014	Action RecognitionDynamic Time Warping	—Unverified
DL-SFA: Deeply-Learned Slow Feature Analysis for Action Recognition	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
3D Pose from Motion for Cross-view Action Recognition via Non-linear Circulant Temporal Encoding	Jun 1, 2014	Action RecognitionTemporal Action Localization	CodeCode Available
Human Action Recognition Based on Context-Dependent Graph Kernels	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
Unsupervised Spectral Dual Assignment Clustering of Human Actions in Context	Jun 1, 2014	Action RecognitionClustering	—Unverified
Leveraging Hierarchical Parametric Networks for Skeletal Joints Based Action Segmentation and Recognition	Jun 1, 2014	Action RecognitionAction Segmentation	—Unverified
Range-Sample Depth Feature for Action Recognition	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
Simplex-Based 3D Spatio-Temporal Feature Description for Action Recognition	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
Human Action Recognition Across Datasets by Foreground-weighted Histogram Decomposition	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
Multi-View Super Vector for Action Recognition	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
A Cause and Effect Analysis of Motion Trajectories for Modeling Actions	Jun 1, 2014	Action ClassificationAction Recognition	—Unverified
Efficient Nonlinear Markov Models for Human Motion	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
Depth and Skeleton Associated Action Recognition without Online Accessible RGB-D Cameras	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
Efficient Feature Extraction, Encoding and Classification for Action Recognition	Jun 1, 2014	Action ClassificationAction Recognition	—Unverified
Efficient Action Localization with Approximately Normalized Fisher Vectors	Jun 1, 2014	Action LocalizationAction Recognition	—Unverified
Towards Good Practices for Action Video Encoding	Jun 1, 2014	Action RecognitionTemporal Action Localization	—Unverified
Feature sampling and partitioning for visual vocabulary generation on large action classification datasets	May 29, 2014	Action ClassificationAction Recognition	—Unverified
Bag of Visual Words and Fusion Methods for Action Recognition: Comprehensive Study and Good Practice	May 18, 2014	Action RecognitionAction Recognition In Videos	—Unverified
Cross-view Action Modeling, Learning and Recognition	May 12, 2014	Action RecognitionTemporal Action Localization	—Unverified
From Synsets to Videos: Enriching ItalWordNet Multimodally	May 1, 2014	Action RecognitionLanguage Acquisition	—Unverified
Shrinkage Optimized Directed Information using Pictorial Structures for Action Recognition	Apr 12, 2014	Action RecognitionTemporal Action Localization	—Unverified
KPCA Spatio-temporal trajectory point cloud classifier for recognizing human actions in a CBVR system	Mar 26, 2014	Action RecognitionRetrieval	—Unverified
Bregman Divergences for Infinite Dimensional Covariance Matrices	Mar 18, 2014	Action RecognitionGeneral Classification	—Unverified
Group sparsity and geometry constrained dictionary learning for action recognition from depth maps.	Mar 3, 2014	Action RecognitionDictionary Learning	—Unverified
Multiview Hessian regularized logistic regression for action recognition	Mar 3, 2014	Action RecognitionAttribute	—Unverified
A Hybrid Loss for Multiclass and Structured Prediction	Feb 9, 2014	Action RecognitionPrediction	—Unverified
Extrinsic Methods for Coding and Dictionary Learning on Grassmann Manifolds	Jan 31, 2014	Action RecognitionClassification	—Unverified
Actions in the Eye: Dynamic Gaze Datasets and Learnt Saliency Models for Visual Recognition	Dec 29, 2013	Action RecognitionTemporal Action Localization	—Unverified
EXMOVES: Classifier-based Features for Scalable Action Recognition	Dec 20, 2013	Action RecognitionGeneral Classification	—Unverified
Dictionary Learning and Sparse Coding on Grassmann Manifolds: An Extrinsic Solution	Oct 18, 2013	Action RecognitionDictionary Learning	—Unverified
Combining Spatio-Temporal Appearance Descriptors and Optical Flow for Human Action Recognition in Video Data	Oct 1, 2013	Action RecognitionOptical Flow Estimation	—Unverified
Seeing What You're Told: Sentence-Guided Activity Recognition In Video	Aug 19, 2013	Action RecognitionActivity Recognition	—Unverified
Sparse Dictionary-based Attributes for Action Recognition and Summarization	Aug 1, 2013	Action RecognitionDictionary Learning	—Unverified
An Approach to Pose-Based Action Recognition	Jun 1, 2013	Action RecognitionAction Recognition In Videos	—Unverified
Evaluation of Color STIPs for Human Action Recognition	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
3D R Transform on Spatio-temporal Interest Points for Action Recognition	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
Expanded Parts Model for Human Attribute and Action Recognition in Still Images	Jun 1, 2013	Action RecognitionAction Recognition In Still Images	—Unverified
Multi-task Sparse Learning with Beta Process Prior for Action Recognition	Jun 1, 2013	Action RecognitionSparse Learning	—Unverified
Better Exploiting Motion for Better Action Recognition	Jun 1, 2013	Action RecognitionImage Retrieval	—Unverified
Sampling Strategies for Real-Time Action Recognition	Jun 1, 2013	Action RecognitionComputational Efficiency	—Unverified
Detection of Manipulation Action Consequences (MAC)	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
Action Recognition by Hierarchical Sequence Summarization	Jun 1, 2013	Action RecognitionTemporal Action Localization	—Unverified
Tracking Human Pose by Tracking Symmetric Parts	Jun 1, 2013	Action RecognitionPose Estimation	—Unverified

Show:10 25 50

← PrevPage 55 of 56Next →

All datasets Something-Something V2 UCF101 HMDB-51 Something-Something V1 AVA v2.2 EPIC-KITCHENS-100 NTU RGB+D NTU RGB+D 120 Diving-48 ActivityNet AVA v2.1 H2O (2 Hands and Objects)

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	MViTv2-B (IN-21K + Kinetics400 pretrain)	Top-5 Accuracy	93.4	—	Unverified
2	RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)	Top-5 Accuracy	91.1	—	Unverified
3	MVD (Kinetics400 pretrain, ViT-H, 16 frame)	Top-1 Accuracy	77.3	—	Unverified
4	DejaVid	Top-1 Accuracy	77.2	—	Unverified
5	InternVideo	Top-1 Accuracy	77.2	—	Unverified
6	InternVideo2-1B	Top-1 Accuracy	77.1	—	Unverified
7	VideoMAE V2-g	Top-1 Accuracy	77	—	Unverified
8	MVD (Kinetics400 pretrain, ViT-L, 16 frame)	Top-1 Accuracy	76.7	—	Unverified
9	Hiera-L (no extra data)	Top-1 Accuracy	76.5	—	Unverified
10	TubeViT-L	Top-1 Accuracy	76.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	FTP-UniFormerV2-L/14	3-fold Accuracy	99.7	—	Unverified
2	OmniVec2	3-fold Accuracy	99.6	—	Unverified
3	VideoMAE V2-g	3-fold Accuracy	99.6	—	Unverified
4	OmniVec	3-fold Accuracy	99.6	—	Unverified
5	BIKE	3-fold Accuracy	98.8	—	Unverified
6	SMART	3-fold Accuracy	98.64	—	Unverified
7	OmniSource (SlowOnly-8x8-R101-RGB + I3D-Flow)	3-fold Accuracy	98.6	—	Unverified
8	PERF-Net (multi-distilled S3D)	3-fold Accuracy	98.6	—	Unverified
9	ZeroI2V ViT-L/14	3-fold Accuracy	98.6	—	Unverified
10	LGD-3D Two-stream	3-fold Accuracy	98.2	—	Unverified