SOTAVerified

Zero-Shot Action Recognition

Papers

Showing 1–50 of 83 papers

TitleStatusHype
LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic AlignmentCode4
Expanding Language-Image Pretrained Models for General Video RecognitionCode3
Leveraging Temporal Contextualization for Video Action RecognitionCode2
Revisiting Classifier: Transferring Vision-Language Models for Video RecognitionCode2
Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language ModelsCode2
TDSM: Triplet Diffusion for Skeleton-Text Matching in Zero-Shot Action RecognitionCode1
Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIPCode1
Rethinking Zero-shot Video Classification: End-to-end Training for Realistic ApplicationsCode1
Part-aware Unified Representation of Language and Skeleton for Zero-shot Action RecognitionCode1
ActionCLIP: A New Paradigm for Video Action RecognitionCode1
Elaborative Rehearsal for Zero-shot Action RecognitionCode1
OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video RecognitionCode1
Actor-agnostic Multi-label Action Recognition with Multi-modal QueryCode1
Vita-CLIP: Video and text adaptive CLIP via Multimodal PromptingCode1
Learning Spatiotemporal Features via Video and Text Pair DiscriminationCode1
MILES: Visual BERT Pre-training with Injected Language Semantics for Video-text RetrievalCode1
MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language KnowledgeCode1
Alignment-Uniformity aware Representation Learning for Zero-shot Video ClassificationCode1
A CLIP-Hitchhiker's Guide to Long Video RetrievalCode1
EVA-CLIP: Improved Training Techniques for CLIP at ScaleCode1
Tell me what you see: A zero-shot action recognition method based on natural language descriptionsCode1
EZ-CLIP: Efficient Zeroshot Video Action RecognitionCode1
Bridging Video-text Retrieval with Multiple Choice QuestionsCode1
Zero-Shot Skeleton-based Action Recognition with Dual Visual-Text Alignment—0
A Cross-Dataset Study for Text-based 3D Human Motion Retrieval—0
Action2Vec: A Crossmodal Embedding Approach to Action Learning—0
ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition—0
Action Recognition in Untrimmed Videos with Composite Self-Attention Two-Stream Framework—0
A Generative Approach to Zero-Shot and Few-Shot Action Recognition—0
All About Knowledge Graphs for Actions—0
Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception—0
Alternative Semantic Representations for Zero-Shot Human Action Recognition—0
An Information Compensation Framework for Zero-Shot Skeleton-based Action Recognition—0
Can masking background and object reduce static bias for zero-shot action recognition?—0
CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action Recognition—0
Continual Learning Improves Zero-Shot Action Recognition—0
Cross-modal Representation Learning for Zero-shot Action Recognition—0
DeViSE: A Deep Visual-Semantic Embedding Model—0
Fine-Grained Side Information Guided Dual-Prompts for Zero-Shot Skeleton Action Recognition—0
GAN for Vision, KG for Relation: a Two-stage Deep Network for Zero-shot Action Recognition—0
Improving Zero-Shot Action Recognition using Human Instruction with Text Description—0
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation—0
Learning a Pose Lexicon for Semantic Action Recognition—0
Learning Using Privileged Information for Zero-Shot Action Recognition—0
Semantic-guided Cross-Modal Prompt Learning for Skeleton-based Zero-shot Action Recognition—0
Skeleton based Zero Shot Action Recognition in Joint Pose-Language Semantic Space—0
Synthetic Sample Selection for Generalized Zero-Shot Learning—0
TARN: Temporal Attentive Relation Network for Few-Shot and Zero-Shot Action Recognition—0
Text-Enhanced Zero-Shot Action Recognition: A training-free approach—0
The impact of Compositionality in Zero-shot Multi-label action recognition for Object-based tasks—0
Show:102550
← PrevPage 1 of 2Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OTI(ViT-L/14)Top-1 Accuracy92.8—Unverified
2IMP-MoE-LTop-1 Accuracy91.5—Unverified
3MOV (ViT-L/14)Top-1 Accuracy87.1—Unverified
4VideoCoCaTop-1 Accuracy86.6—Unverified
5BIKETop-1 Accuracy86.6—Unverified
6Text4VisTop-1 Accuracy85.8—Unverified
7TC-CLIPTop-1 Accuracy85.4—Unverified
8EVA-CLIP-E/14+Top-1 Accuracy83.1—Unverified
9MOV (ViT-B/16)Top-1 Accuracy82.6—Unverified
10OSTTop-1 Accuracy79.7—Unverified
#ModelMetricClaimedVerifiedStatus
1MOV (ViT-L/14)Top-1 Accuracy64.7—Unverified
2OTI(ViT-L/14)Top-1 Accuracy64—Unverified
3BIKETop-1 Accuracy61.4—Unverified
4MOV (ViT-B/16)Top-1 Accuracy60.8—Unverified
5IMP-MoE-LTop-1 Accuracy59.1—Unverified
6VideoCoCaTop-1 Accuracy58.7—Unverified
7Text4VisTop-1 Accuracy58.4—Unverified
8TC-CLIPTop-1 Accuracy56—Unverified
9OSTTop-1 Accuracy55.9—Unverified
10MAXITop-1 Accuracy52.3—Unverified
#ModelMetricClaimedVerifiedStatus
1TC-CLIPTop-1 Accuracy78.1—Unverified
2IMP-MoE-LTop-1 Accuracy76.8—Unverified
3OSTTop-1 Accuracy75.1—Unverified
4MAXITop-1 Accuracy71.6—Unverified
5OTI(ViT-L/14)Top-1 Accuracy70.6—Unverified
6VideoCoCaTop-1 Accuracy70.1—Unverified
7Text4VisTop-1 Accuracy68.9—Unverified
8BIKETop-1 Accuracy68.5—Unverified
9X-CLIPTop-1 Accuracy65.2—Unverified
10LanguageBindTop-1 Accuracy64.1—Unverified
#ModelMetricClaimedVerifiedStatus
1SPOTTop-1 Accuracy68.7—Unverified
2CLASTERTop-1 Accuracy68.4—Unverified
3ER-ZSARTop-1 Accuracy60.2—Unverified
4ZSECOCTop-1 Accuracy59.8—Unverified
5TS-GCNTop-1 Accuracy56.5—Unverified
6SJE(Atrribute)Top-1 Accuracy47.5—Unverified
7MTETop-1 Accuracy44.3—Unverified
8ESZSLTop-1 Accuracy39.6—Unverified
9SJE(Word Embedding)Top-1 Accuracy28.6—Unverified
#ModelMetricClaimedVerifiedStatus
1BIKETop-1 Accuracy86.2—Unverified
2Text4VisTop-1 Accuracy84.6—Unverified
3LoCATe-GATTop-1 Accuracy73.8—Unverified
4ResTTop-1 Accuracy32.5—Unverified
5E2ETop-1 Accuracy26.6—Unverified
#ModelMetricClaimedVerifiedStatus
1MSQNetmAP35.59—Unverified
2VideoCoCamAP25.8—Unverified
3MAXImAP23.8—Unverified
4CLIP-Hitchhiker (ViT-B/16, 32 frames)mAP21.1—Unverified
#ModelMetricClaimedVerifiedStatus
1MSQNetAccuracy75.33—Unverified