SOTAVerified

Temporal Action Localization

Temporal Action Localization aims to detect activities in the video stream and output beginning and end timestamps. It is closely related to Temporal Action Proposal Generation.

Papers

Showing 401–450 of 1477 papers

TitleStatusHype
An Empirical Study of End-to-End Temporal Action DetectionCode1
Direct Dense Pose Estimation—0
TALLFormer: Temporal Action Localization with a Long-memory TransformerCode1
Fine-grained Temporal Contrastive Learning for Weakly-supervised Temporal Action LocalizationCode1
ASM-Loc: Action-aware Segment Modeling for Weakly-Supervised Temporal Action LocalizationCode1
Unsupervised Pre-training for Temporal Action Localization TasksCode1
Continual Spatio-Temporal Graph Convolutional NetworksCode1
LocATe: End-to-end Localization of Actions in 3D with Transformers—0
DirecFormer: A Directed Attention in Transformer Approach to Robust Action RecognitionCode1
Gate-Shift-Fuse for Video Action RecognitionCode0
Context-LSTM: a robust classifier for video detection on UCF101—0
End-to-End Semantic Video Transformer for Zero-Shot Action RecognitionCode0
OpenTAL: Towards Open Set Temporal Action LocalizationCode1
Weakly Supervised Temporal Action Localization via Representative Snippet Knowledge PropagationCode1
Continuous Human Action Recognition for Human-Machine Interaction: A Review—0
On Modality Bias Recognition and ReductionCode0
ActionFormer: Localizing Moments of Actions with TransformersCode2
When Did It Happen? Duration-informed Temporal Localization of Narrated Actions in VlogsCode0
OWL (Observe, Watch, Listen): Audiovisual Temporal Context for Localizing Actions in Egocentric Videos—0
Joint-bone Fusion Graph Convolutional Network for Semi-supervised Skeleton Action Recognition—0
CZU-MHAD: A multimodal dataset for human action recognition utilizing a depth camera and 10 wearable inertial sensorsCode1
Benchmarking Conventional Vision Models on Neuromorphic Fall Detection and Action Recognition Dataset—0
Semantically Video Coding: Instill Static-Dynamic Clues into Structured Bitstream for AI Tasks—0
Semantic Labeling of Human Action For Visually Impaired And Blind People Scene Interaction—0
Recurring the Transformer for Video Action Recognition—0
Complex Video Action Reasoning via Learnable Markov Logic Network—0
Exploring Denoised Cross-Video Contrast for Weakly-Supervised Temporal Action Localization—0
Interact Before Align: Leveraging Cross-Modal Knowledge for Domain Adaptive Action Recognition—0
Object-Relation Reasoning Graph for Action Recognition—0
ACGNet: Action Complement Graph Network for Weakly-supervised Temporal Action LocalizationCode0
Precondition and Effect Reasoning for Action RecognitionCode0
Analysis and Evaluation of Kinect-based Action Recognition AlgorithmsCode0
Temporal Action Proposal Generation with Background ConstraintCode1
Temporal Shuffling for Defending Deep Action Recognition Models against Adversarial AttacksCode0
Temporal Transformer Networks with Self-Supervision for Action Recognition—0
Multi-Expert Human Action Recognition with Hierarchical Super-Class Learning—0
Contextualized Spatio-Temporal Contrastive Learning with Self-SupervisionCode0
MS-TCT: Multi-Scale Temporal ConvTransformer for Action DetectionCode1
DCAN: Improving Temporal Action Detection via Dual Context AggregationCode1
STSM: Spatio-Temporal Shift Module for Efficient Action Recognition—0
Graph Convolutional Module for Temporal Action Localization in Videos—0
Low-Fidelity Video Encoder Optimization for Temporal Action Localization—0
Dynamic Normalization and Relay for Video Action RecognitionCode0
Learning from Temporal Gradient for Semi-supervised Action RecognitionCode1
Background-Click Supervision for Temporal Action LocalizationCode1
Evaluating Transformers for Lightweight Action Recognition—0
M2A: Motion Aware Attention for Accurate Video Action RecognitionCode1
Real-time 3D human action recognition based on Hyperpoint sequenceCode1
Multi-Scale Semantics-Guided Neural Networks for Efficient Skeleton-Based Human Action Recognition—0
KORSAL: Key-point Detection based Online Real-Time Spatio-Temporal Action LocalizationCode0
Show:102550
← PrevPage 9 of 30Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1AdaTAD (VideoMAEv2-giant)Avg mAP (0.3:0.7)76.9—Unverified
2RDFA-S6 (InternVideo2-6B)Avg mAP (0.3:0.7)74.2—Unverified
3ActionMamba(InternVideo2-6B)Avg mAP (0.3:0.7)72.72—Unverified
4GCMmAP [email protected]72.5—Unverified
5AGT (Ours)mAP [email protected]72.1—Unverified
6InternVideo2-6BAvg mAP (0.3:0.7)72—Unverified
7ActionFormer (InternVideo features)Avg mAP (0.3:0.7)71.58—Unverified
8TriDet (VideoMAE v2-g feature)Avg mAP (0.3:0.7)70.1—Unverified
9InternVideo2-1BAvg mAP (0.3:0.7)69.8—Unverified
10ActionFormer (VideoMAE V2-g features)Avg mAP (0.3:0.7)69.6—Unverified
#ModelMetricClaimedVerifiedStatus
1UnLoc-LmAP [email protected]59.3—Unverified
2RDFA-S6 (InternVideo2-6B)mAP42.9—Unverified
3ActionMamba (InternVideo2-6B)mAP42.02—Unverified
4PRN+BMN (ensemble)mAP42—Unverified
5AdaTAD (VideoMAEv2-giant)mAP41.93—Unverified
6InternVideo2-6BmAP41.2—Unverified
7InternVideo2-1BmAP40.4—Unverified
8UniMD+Sync.mAP39.83—Unverified
9PRN (CSN)mAP39.4—Unverified
10InternVideomAP39—Unverified
#ModelMetricClaimedVerifiedStatus
1RDFA-S6 (InternVideo2-6B)Average-mAP45.8—Unverified
2ActionMamba(InternVideo2-6B)Average-mAP44.56—Unverified
3DyFADet(VideoMAEv2)Average-mAP44.3—Unverified
4InternVideo2-6BAverage-mAP43.3—Unverified
5TriDet (VideoMAEv2)Average-mAP43.1—Unverified
6InternVideo2-1BAverage-mAP42.4—Unverified
7InternVideoAverage-mAP41.55—Unverified
8TriDet (SlowFast)Average-mAP38.6—Unverified
9TriDet (I3D RGB)Average-mAP36.8—Unverified
10TadTr (I3D RGB)Average-mAP32.09—Unverified
#ModelMetricClaimedVerifiedStatus
1RDFA-S6 (InternVideo2-6B)mAP29.6—Unverified
2ActionMamba(InternVideo2-6B)mAP29.04—Unverified
3InternVideo2-6BmAP27.7—Unverified
4DyFADet (VideoMAE v2-g)mAP23.8—Unverified
5VideoMAE V2-gmAP18.24—Unverified
6InternVideomAP17.57—Unverified
7BMN (i3d feaure)mAP9.25—Unverified
8G-TAD (i3d feature)mAP9.06—Unverified
9DBG (i3d feature)mAP6.75—Unverified
#ModelMetricClaimedVerifiedStatus
1TriDet (VideoMAEv2)Average mAP37.5—Unverified
2DualDETR (I3D-rgb)Average mAP32.64—Unverified
3TriDet (I3D-rgb)Average mAP30.7—Unverified
4TemporalMaxerAverage mAP29.9—Unverified
5PointTADAverage mAP23.5—Unverified
6PDANAverage mAP17.3—Unverified
7MS-TCTAverage mAP16.2—Unverified
8MLADAverage mAP14.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoCLIPRecall47.3—Unverified
2VLMRecall46.5—Unverified
3TACoRecall42.5—Unverified
4Text-Video EmbeddingRecall33.6—Unverified
5Fully-supervised upper-boundRecall31.6—Unverified
6ZhukovRecall22.4—Unverified
7AlayracRecall13.3—Unverified
#ModelMetricClaimedVerifiedStatus
1AdaTAD (verb, VideoMAE-L)Avg mAP (0.1-0.5)29.3—Unverified
2TriDet (verb)Avg mAP (0.1-0.5)25.4—Unverified
3TemporalMaxer (verb)Avg mAP (0.1-0.5)24.5—Unverified
4ActionFormer (verb)Avg mAP (0.1-0.5)23.5—Unverified
5G-TAD (verb)Avg mAP (0.1-0.5)9.4—Unverified
6BMN (verb)Avg mAP (0.1-0.5)8.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TemporalMaxermAP27.2—Unverified
2MUSESmAP18.6—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepMetricLearnermAP [email protected]35.2—Unverified
#ModelMetricClaimedVerifiedStatus
1ActionFormer (SlowFast+Omnivore+EgoVLP)Average mAP21.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ActionFormer (SlowFast+Omnivore+EgoVLP)Average mAP21.4—Unverified
#ModelMetricClaimedVerifiedStatus
1S-CNNmAP7.4—Unverified