Temporal Action Localization

Temporal Action Localization aims to detect activities in the video stream and output beginning and end timestamps. It is closely related to Temporal Action Proposal Generation.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 101–150 of 1477 papers

Title	Date	Tasks	Status	Hype
Logsig-RNN: a novel network for robust and efficient skeleton-based action recognition	Oct 25, 2021	Action RecognitionAction Recognition In Videos	CodeCode Available	1
M2A: Motion Aware Attention for Accurate Video Action Recognition	Nov 18, 2021	Action RecognitionTemporal Action Localization	CodeCode Available	1
ASM-Loc: Action-aware Segment Modeling for Weakly-Supervised Temporal Action Localization	Mar 29, 2022	Temporal Action LocalizationWeakly-supervised Temporal Action Localization	CodeCode Available	1
Modeling Multi-Label Action Dependencies for Temporal Action Localization	Mar 4, 2021	Action DetectionAction Localization	CodeCode Available	1
MS-TCT: Multi-Scale Temporal ConvTransformer for Action Detection	Dec 7, 2021	Action DetectionTemporal Action Localization	CodeCode Available	1
Multi-dataset Training of Transformers for Robust Action Recognition	Sep 26, 2022	Action RecognitionTemporal Action Localization	CodeCode Available	1
CoLA: Weakly-Supervised Temporal Action Localization with Snippet Contrastive Learning	Mar 30, 2021	Action LocalizationCoLA	CodeCode Available	1
Multivariate LSTM-FCNs for Time Series Classification	Jan 14, 2018	Action RecognitionActivity Recognition	CodeCode Available	1
ACTION-Net: Multipath Excitation for Action Recognition	Mar 11, 2021	Action RecognitionTemporal Action Localization	CodeCode Available	1
MVFNet: Multi-View Fusion Network for Efficient Video Recognition	Dec 13, 2020	Action ClassificationAction Recognition	CodeCode Available	1
A Dense-Sparse Complementary Network for Human Action Recognition based on RGB and Skeleton Modalities	Dec 28, 2023	Action RecognitionAction Recognition In Videos	CodeCode Available	1
A Closer Look at Spatiotemporal Convolutions for Action Recognition	Nov 30, 2017	Action ClassificationAction Recognition	CodeCode Available	1
CBR-Net: Cascade Boundary Refinement Network for Action Detection: Submission to ActivityNet Challenge 2020 (Task 1)	Jun 13, 2020	Action DetectionAction Localization	CodeCode Available	1
On the spatial attention in Spatio-Temporal Graph Convolutional Networks for skeleton-based human action recognition	Nov 7, 2020	Action RecognitionTemporal Action Localization	CodeCode Available	1
ACM-Net: Action Context Modeling Network for Weakly-Supervised Temporal Action Localization	Apr 7, 2021	Action LocalizationTemporal Action Localization	CodeCode Available	1
ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning	Jun 27, 2022	Action ClassificationAction Recognition	CodeCode Available	1
Complex Sequential Understanding through the Awareness of Spatial and Temporal Concepts	May 30, 2020	Action RecognitionTemporal Action Localization	CodeCode Available	1
POCO: 3D Pose and Shape Estimation with Confidence	Aug 24, 2023	Action RecognitionPose Estimation	CodeCode Available	1
Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight Detection	Nov 28, 2023	Contrastive LearningHighlight Detection	CodeCode Available	1
Proposal-Based Multiple Instance Learning for Weakly-Supervised Temporal Action Localization	May 29, 2023	Action LocalizationMultiple Instance Learning	CodeCode Available	1
Re^2TAL: Rewiring Pretrained Video Backbones for Reversible Temporal Action Localization	Nov 25, 2022	Action LocalizationGPU	CodeCode Available	1
ReAct: Temporal Action Detection with Relational Queries	Jul 14, 2022	Action ClassificationAction Detection	CodeCode Available	1
Relational Self-Attention: What's Missing in Attention for Video Understanding	Nov 2, 2021	Action RecognitionTemporal Action Localization	CodeCode Available	1
ResFormer: Scaling ViTs with Multi-Resolution Training	Dec 1, 2022	Action Recognitionimage-classification	CodeCode Available	1
Revisiting Foreground and Background Separation in Weakly-supervised Temporal Action Localization: A Clustering-based Approach	Dec 21, 2023	Action LocalizationClassification	CodeCode Available	1
RGB Stream Is Enough for Temporal Action Detection	Jul 9, 2021	Action DetectionData Augmentation	CodeCode Available	1
Boosting Weakly-Supervised Temporal Action Localization with Text Information	May 1, 2023	Action LocalizationSentence	CodeCode Available	1
BSN: Boundary Sensitive Network for Temporal Action Proposal Generation	Jun 8, 2018	Action DetectionTemporal Action Localization	CodeCode Available	1
Compressing Recurrent Neural Networks with Tensor Ring for Action Recognition	Nov 19, 2018	Action RecognitionTemporal Action Localization	CodeCode Available	1
A Large-scale Study of Spatiotemporal Representation Learning with a New Benchmark on Action Recognition	Mar 23, 2023	Action RecognitionDomain Adaptation	CodeCode Available	1
BABEL: Bodies, Action and Behavior with English Labels	Jun 17, 2021	3D Action RecognitionAction Classification	CodeCode Available	1
Background-Click Supervision for Temporal Action Localization	Nov 24, 2021	Action LocalizationPosition	CodeCode Available	1
An Empirical Study of End-to-End Temporal Action Detection	Apr 6, 2022	Action ClassificationAction Detection	CodeCode Available	1
1st place solution for AVA-Kinetics Crossover in AcitivityNet Challenge 2020	Jun 16, 2020	Action LocalizationRelation Network	CodeCode Available	1
BasicTAD: an Astounding RGB-Only Baseline for Temporal Action Detection	May 5, 2022	Action Detectionobject-detection	CodeCode Available	1
BMN: Boundary-Matching Network for Temporal Action Proposal Generation	Jul 23, 2019	Action DetectionAction Recognition	CodeCode Available	1
A Lie Group Approach to Riemannian Batch Normalization	Mar 17, 2024	Action RecognitionEEG	CodeCode Available	1
Boundary-sensitive Pre-training for Temporal Localization in Videos	Nov 21, 2020	Action ClassificationClassification	CodeCode Available	1
BSN++: Complementary Boundary Regressor with Scale-Balanced Relation Modeling for Temporal Action Proposal Generation	Sep 15, 2020	Action LocalizationRelation	CodeCode Available	1
CAKES: Channel-wise Automatic KErnel Shrinking for Efficient 3D Networks	Mar 28, 2020	3D Medical Imaging SegmentationAction Recognition	CodeCode Available	1
CDFSL-V: Cross-Domain Few-Shot Learning for Videos	Sep 7, 2023	Action RecognitionCross-Domain Few-Shot	CodeCode Available	1
Challenges in Video-Based Infant Action Recognition: A Critical Examination of the State of the Art	Nov 21, 2023	Action RecognitionSkeleton Based Action Recognition	CodeCode Available	1
Convex Combination Consistency between Neighbors for Weakly-supervised Action Localization	May 1, 2022	Action LocalizationData Augmentation	CodeCode Available	1
Co-occurrence Feature Learning from Skeleton Data for Action Recognition and Detection with Hierarchical Aggregation	Apr 17, 2018	Action RecognitionRF-based Pose Estimation	CodeCode Available	1
Cross-modal Consensus Network forWeakly Supervised Temporal Action Localization	Jul 27, 2021	Action LocalizationTemporal Action Localization	CodeCode Available	1
CZU-MHAD: A multimodal dataset for human action recognition utilizing a depth camera and 10 wearable inertial sensors	Feb 7, 2022	Action RecognitionTemporal Action Localization	CodeCode Available	1
Decoupled Spatial-Temporal Attention Network for Skeleton-Based Action Recognition	Jul 7, 2020	Action RecognitionSkeleton Based Action Recognition	CodeCode Available	1
Deep Analysis of CNN-based Spatio-temporal Representations for Action Recognition	Oct 22, 2020	Action RecognitionTemporal Action Localization	CodeCode Available	1
Depth Guided Adaptive Meta-Fusion Network for Few-shot Video Recognition	Oct 20, 2020	Action RecognitionFew Shot Action Recognition	CodeCode Available	1
B2C-AFM: Bi-Directional Co-Temporal and Cross-Spatial Attention Fusion Model for Human Action Recognition	Aug 30, 2023	Action RecognitionSkeleton Based Action Recognition	CodeCode Available	1

Show:10 25 50

← PrevPage 3 of 30Next →

All datasets THUMOS14 ActivityNet-1.3 HACS FineAction MultiTHUMOS CrossTask EPIC-KITCHENS-100 MUSES ActivityNet-1.2 Ego4D MQ test Ego4D MQ val MEXaction2

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AdaTAD (VideoMAEv2-giant)	Avg mAP (0.3:0.7)	76.9	—	Unverified
2	RDFA-S6 (InternVideo2-6B)	Avg mAP (0.3:0.7)	74.2	—	Unverified
3	ActionMamba(InternVideo2-6B)	Avg mAP (0.3:0.7)	72.72	—	Unverified
4	GCM	mAP IOU@0.1	72.5	—	Unverified
5	AGT (Ours)	mAP IOU@0.1	72.1	—	Unverified
6	InternVideo2-6B	Avg mAP (0.3:0.7)	72	—	Unverified
7	ActionFormer (InternVideo features)	Avg mAP (0.3:0.7)	71.58	—	Unverified
8	TriDet (VideoMAE v2-g feature)	Avg mAP (0.3:0.7)	70.1	—	Unverified
9	InternVideo2-1B	Avg mAP (0.3:0.7)	69.8	—	Unverified
10	ActionFormer (VideoMAE V2-g features)	Avg mAP (0.3:0.7)	69.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	UnLoc-L	mAP IOU@0.5	59.3	—	Unverified
2	RDFA-S6 (InternVideo2-6B)	mAP	42.9	—	Unverified
3	ActionMamba (InternVideo2-6B)	mAP	42.02	—	Unverified
4	PRN+BMN (ensemble)	mAP	42	—	Unverified
5	AdaTAD (VideoMAEv2-giant)	mAP	41.93	—	Unverified
6	InternVideo2-6B	mAP	41.2	—	Unverified
7	InternVideo2-1B	mAP	40.4	—	Unverified
8	UniMD+Sync.	mAP	39.83	—	Unverified
9	PRN (CSN)	mAP	39.4	—	Unverified
10	InternVideo	mAP	39	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	RDFA-S6 (InternVideo2-6B)	Average-mAP	45.8	—	Unverified
2	ActionMamba(InternVideo2-6B)	Average-mAP	44.56	—	Unverified
3	DyFADet(VideoMAEv2)	Average-mAP	44.3	—	Unverified
4	InternVideo2-6B	Average-mAP	43.3	—	Unverified
5	TriDet (VideoMAEv2)	Average-mAP	43.1	—	Unverified
6	InternVideo2-1B	Average-mAP	42.4	—	Unverified
7	InternVideo	Average-mAP	41.55	—	Unverified
8	TriDet (SlowFast)	Average-mAP	38.6	—	Unverified
9	TriDet (I3D RGB)	Average-mAP	36.8	—	Unverified
10	TadTr (I3D RGB)	Average-mAP	32.09	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	RDFA-S6 (InternVideo2-6B)	mAP	29.6	—	Unverified
2	ActionMamba(InternVideo2-6B)	mAP	29.04	—	Unverified
3	InternVideo2-6B	mAP	27.7	—	Unverified
4	DyFADet (VideoMAE v2-g)	mAP	23.8	—	Unverified
5	VideoMAE V2-g	mAP	18.24	—	Unverified
6	InternVideo	mAP	17.57	—	Unverified
7	BMN (i3d feaure)	mAP	9.25	—	Unverified
8	G-TAD (i3d feature)	mAP	9.06	—	Unverified
9	DBG (i3d feature)	mAP	6.75	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TriDet (VideoMAEv2)	Average mAP	37.5	—	Unverified
2	DualDETR (I3D-rgb)	Average mAP	32.64	—	Unverified
3	TriDet (I3D-rgb)	Average mAP	30.7	—	Unverified
4	TemporalMaxer	Average mAP	29.9	—	Unverified
5	PointTAD	Average mAP	23.5	—	Unverified
6	PDAN	Average mAP	17.3	—	Unverified
7	MS-TCT	Average mAP	16.2	—	Unverified
8	MLAD	Average mAP	14.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	VideoCLIP	Recall	47.3	—	Unverified
2	VLM	Recall	46.5	—	Unverified
3	TACo	Recall	42.5	—	Unverified
4	Text-Video Embedding	Recall	33.6	—	Unverified
5	Fully-supervised upper-bound	Recall	31.6	—	Unverified
6	Zhukov	Recall	22.4	—	Unverified
7	Alayrac	Recall	13.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	AdaTAD (verb, VideoMAE-L)	Avg mAP (0.1-0.5)	29.3	—	Unverified
2	TriDet (verb)	Avg mAP (0.1-0.5)	25.4	—	Unverified
3	TemporalMaxer (verb)	Avg mAP (0.1-0.5)	24.5	—	Unverified
4	ActionFormer (verb)	Avg mAP (0.1-0.5)	23.5	—	Unverified
5	G-TAD (verb)	Avg mAP (0.1-0.5)	9.4	—	Unverified
6	BMN (verb)	Avg mAP (0.1-0.5)	8.4	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TemporalMaxer	mAP	27.2	—	Unverified
2	MUSES	mAP	18.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DeepMetricLearner	mAP IOU@0.5	35.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ActionFormer (SlowFast+Omnivore+EgoVLP)	Average mAP	21.76	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ActionFormer (SlowFast+Omnivore+EgoVLP)	Average mAP	21.4	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	S-CNN	mAP	7.4	—	Unverified