SOTAVerified

Action Anticipation

Next action anticipation is defined as observing 1, ... , T frames and predicting the action that happens after a gap of T_a seconds. It is important to note that a new action starts after T_a seconds that is not seen in the observed frames. Here T_a=1 second.

Papers

Showing 51–100 of 110 papers

TitleStatusHype
Inductive Attention for Video Action Anticipation—0
Interaction Region Visual Transformer for Egocentric Action AnticipationCode0
Anticipative Feature Fusion Transformer for Multi-Modal Action AnticipationCode1
Rethinking Learning Approaches for Long-Term Action AnticipationCode1
Text-Derived Knowledge Helps Vision: A Simple Cross-modal Distillation for Video-based Action AnticipationCode0
Learning State-Aware Visual Representations from Audible InteractionsCode1
MECCANO: A Multimodal Egocentric Dataset for Humans Behavior Understanding in the Industrial-like Domain—0
Real-time Online Video Detection with Temporal Smoothing TransformersCode1
Predicting the Next Action by Modeling the Abstract GoalCode0
Intention-Conditioned Long-Term Human Egocentric Action ForecastingCode1
1st Place Solution to the EPIC-Kitchens Action Anticipation Challenge 2022—0
Video + CLIP Baseline for Ego4D Long-term Action AnticipationCode1
Pedestrian 3D Bounding Box PredictionCode1
NVIDIA-UNIBZ Submission for EPIC-KITCHENS-100 Action Anticipation Challenge 2022—0
Precise Affordance Annotation for Egocentric Action Video Datasets—0
Unified Recurrence Modeling for Video Action AnticipationCode0
Future Transformer for Long-term Action AnticipationCode1
A-ACT: Action Anticipation through Cycle Transformations—0
Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural ActivitiesCode0
Untrimmed Action Anticipation—0
MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video RecognitionCode1
Weakly-Supervised Dense Action AnticipationCode0
Towards Streaming Egocentric Action Anticipation—0
Learning to Discriminate Information for Online Action Detection: Analysis and Application—0
SlowFast Rolling-Unrolling LSTMs for Action Anticipation in Egocentric Videos—0
Shifted Chunk Transformer for Spatio-Temporal Representational Learning—0
TransAction: ICL-SJTU Submission to EPIC-Kitchens Action Anticipation Challenge 2021Code0
Multi-Modal Temporal Convolutional Network for Anticipating Actions in Egocentric Videos—0
A Dynamic Spatial-temporal Attention Network for Early Anticipation of Traffic AccidentsCode1
Technical Report: Temporal Aggregate RepresentationsCode1
Anticipative Video TransformerCode1
Anticipating human actions by correlating past with the future with Jaccard similarity measures—0
Higher Order Recurrent Space-Time Transformer for Video Action PredictionCode1
Forecasting Action through Contact Representations from First Person Video—0
Learning to Anticipate Egocentric Actions by Imagination—0
Deep Sequence Learning for Video Anticipation: From Discrete and Deterministic to Continuous and Stochastic—0
Video Representation Learning with Visual Tempo ConsistencyCode1
Rescaling Egocentric VisionCode1
Egocentric Object Manipulation Graphs—0
Temporal Aggregate Representations for Long-Range Video UnderstandingCode1
Pedestrian Action Anticipation using Contextual Feature Fusion in Stacked RNNsCode1
Rolling-Unrolling LSTMs for Action Anticipation from First-Person VideoCode1
Knowledge Distillation for Action Anticipation via Label Smoothing—0
TTPP: Temporal Transformer with Progressive Prediction for Efficient Action Anticipation—0
Predicting the Future: A Jointly Learnt Model for Action Anticipation—0
HalluciNet-ing Spatiotemporal Representations Using a 2D-CNNCode0
Forecasting Human-Object Interaction: Joint Prediction of Motor Attention and Actions in First Person VideoCode0
Action Anticipation with RBF Kernelized Feature Mapping RNN—0
Action Anticipation for Collaborative Environments: The Impact of Contextual Information and Uncertainty-Based Prediction—0
Delving into 3D Action Anticipation from Streaming Videos—0
Show:102550
← PrevPage 2 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PlausiVLRecall@527.6—Unverified
2InAViTRecall@525.89—Unverified
3UADTRecall@523—Unverified
4S-GEARRecall@519.9—Unverified
5AFFTRecall@518.5—Unverified
6MeMViT-24Recall@517.7—Unverified
7AVT+Recall@515.9—Unverified
8TempAggRecall@514.73—Unverified
9RU-LSTMRecall@513.94—Unverified
#ModelMetricClaimedVerifiedStatus
1InAViTrecall@523.75—Unverified
2AVT++recall@516.7—Unverified
3AFFTrecall@514.9—Unverified
4Abstract Goalrecall@514.29—Unverified
5AVT+recall@512.6—Unverified
6TempAggrecall@512.6—Unverified
7RULSTMrecall@511.2—Unverified
8TBNrecall@511—Unverified
#ModelMetricClaimedVerifiedStatus
1Abstract GoalTop 1 Accuracy - Act.22.03—Unverified
2AVT+Top 1 Accuracy - Act.16.84—Unverified
3ImagineRNNTop 1 Accuracy - Act.14.66—Unverified
4RULSTM [24, 23]Top 1 Accuracy - Act.14.39—Unverified
5EDTop 1 Accuracy - Act.8.08—Unverified
6ATSNTop 1 Accuracy - Act.6—Unverified
72SCNNTop 1 Accuracy - Act.4.32—Unverified
#ModelMetricClaimedVerifiedStatus
1Abstract GoalTop 1 Accuracy - Act.13.28—Unverified
2AVT+Top 1 Accuracy - Act.10.41—Unverified
3ImagineRNNTop 1 Accuracy - Act.9.25—Unverified
4RULSTM [24, 23]Top 1 Accuracy - Act.8.16—Unverified
5EDTop 1 Accuracy - Act.2.65—Unverified
6ATSNTop 1 Accuracy - Act.2.39—Unverified
72SCNNTop 1 Accuracy - Act.2.29—Unverified
#ModelMetricClaimedVerifiedStatus
1UADTTop-1 Accuracy68.4—Unverified
2InAViTTop-1 Accuracy67.8—Unverified
3Abstract GoalTop-1 Accuracy49.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Goal ConsistencyVerbs Recall@560.04—Unverified
2TempAggVerbs Recall@559.11—Unverified
#ModelMetricClaimedVerifiedStatus
1Action anticipation baseline (co-training, with gaze)Accuracy45.45—Unverified
2Action anticipation baseline (co-training, no gaze)Accuracy38.7—Unverified
#ModelMetricClaimedVerifiedStatus
1UADTTop-1 Accuracy62.7—Unverified