SOTAVerified

Action Localization

Action Localization is finding the spatial and temporal co ordinates for an action in a video. An action localization model will identify which frame an action start and ends in video and return the x,y coordinates of an action. Further the co ordinates will change when the object performing action undergoes a displacement.

Papers

Showing 151–200 of 369 papers

TitleStatusHype
Boundary Uncertainty in a Single-Stage Temporal Action Localization Network—0
Bridge the Gap: From Weak to Full Supervision for Temporal Action Localization with PseudoFormer—0
Bullying10K: A Large-Scale Neuromorphic Dataset towards Privacy-Preserving Bullying Recognition—0
CAG-QIL: Context-Aware Actionness Grouping via Q Imitation Learning for Online Temporal Action Localization—0
Can MLLMs Guide Weakly-Supervised Temporal Action Localization Tasks?—0
Cascaded Pyramid Mining Network for Weakly Supervised Temporal Action Localization—0
Cascade Evidential Learning for Open-World Weakly-Supervised Temporal Action Localization—0
CFAD: Coarse-to-Fine Action Detector for Spatiotemporal Action Localization—0
Chain-of-Thought Textual Reasoning for Few-shot Temporal Action Localization—0
Class Semantics-based Attention for Action Detection—0
CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization—0
Complementary Boundary Generator with Scale-Invariant Relation Modeling for Temporal Action Localization: Submission to ActivityNet Challenge 2020—0
Contrastive Language-Action Pre-training for Temporal Localization—0
Co-Occurrence Matters: Learning Action Relation for Temporal Action Localization—0
Cricket stroke extraction: Towards creation of a large-scale cricket actions dataset—0
Cross-Attentional Audio-Visual Fusion for Weakly-Supervised Action Localization—0
Cross-Video Contextual Knowledge Exploration and Exploitation for Ambiguity Reduction in Weakly Supervised Temporal Action Localization—0
Cutup and Detect: Human Fall Detection on Cutup Untrimmed Videos Using a Large Foundational Video Understanding Model—0
DAP3D-Net: Where, What and How Actions Occur in Videos?—0
DAVE: Diverse Atomic Visual Elements Dataset with High Representation of Vulnerable Road Users in Complex and Unpredictable Environments—0
Decomposed Cross-modal Distillation for RGB-based Temporal Action Detection—0
DeepLocalization: Using change point detection for Temporal Action Localization—0
Deep Motion Prior for Weakly-Supervised Temporal Action Localization—0
Density-Guided Label Smoothing for Temporal Localization of Driving Actions—0
Detecting Parts for Action Localization—0
Distilling Vision-Language Pre-training to Collaborate with Weakly-Supervised Temporal Action Localization—0
Distributed Adaptive Learning of Graph Signals—0
Divide and Conquer for Single-Frame Temporal Action Localization—0
Efficient Action Detection in Untrimmed Videos via Multi-Task Learning—0
Efficient Action Localization with Approximately Normalized Fisher Vectors—0
Egocentric Activity Recognition and Localization on a 3D Map—0
Ego-Only: Egocentric Action Detection without Exocentric Transferring—0
Enabling Weakly-Supervised Temporal Action Localization from On-Device Learning of the Video Stream—0
Equivalent Classification Mapping for Weakly Supervised Temporal Action Localization—0
Exploring Denoised Cross-Video Contrast for Weakly-Supervised Temporal Action Localization—0
Exploring Feature Representation and Training strategies in Temporal Action Localization—0
Exploring Frame Segmentation Networks for Temporal Action Localization—0
Exploring Stronger Feature for Temporal Action Localization—0
Exploring Temporal Context and Human Movement Dynamics for Online Action Detection in Videos—0
Exploring Temporally Dynamic Data Augmentation for Video Recognition—0
Exploring Temporal Preservation Networks for Precise Temporal Action Localization—0
Few-Shot Common Action Localization via Cross-Attentional Fusion of Context and Temporal Dynamics—0
Few-Shot Transformation of Common Actions into Time and Space—0
Forcing the Whole Video as Background: An Adversarial Learning Strategy for Weakly Temporal Action Localization—0
Generic Tubelet Proposals for Action Localization—0
Graph Convolutional Module for Temporal Action Localization in Videos—0
Hierarchical Self-Attention Network for Action Localization in Videos—0
HTNet: Anchor-free Temporal Action Localization with Hierarchical Transformers—0
Human Action Localization with Sparse Spatial Supervision—0
Human Action Sequence Classification—0
Show:102550
← PrevPage 4 of 8Next →

No leaderboard results yet.