SOTAVerified

Video Captioning

Video Captioning is a task of automatic captioning a video by understanding the action and event in the video which can help in the retrieval of the video efficiently through text.

Source: NITS-VC System for VATEX Video Captioning Challenge 2020

Papers

Showing 151–200 of 473 papers

TitleStatusHype
LongCaptioning: Unlocking the Power of Long Caption Generation in Large Multimodal Models—0
DVCFlow: Modeling Information Flow Towards Human-like Video Captioning—0
Bridge Video and Text with Cascade Syntactic Structure—0
An Integrated Approach for Video Captioning and Applications—0
Dual-Level Decoupled Transformer for Video Captioning—0
Boosting Video-Text Retrieval with Explicit High-Level Semantics—0
Diverse Video Captioning Through Latent Variable Expansion—0
Boosting Video Representation Learning with Multi-Faceted Integration—0
AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction—0
Discourse Analysis for Evaluating Coherence in Video Paragraph Captions—0
Boosting Video Captioning with Dynamic Loss Network—0
Activitynet 2019 Task 3: Exploring Contexts for Dense Captioning Events in Videos—0
Directed Domain Fine-Tuning: Tailoring Separate Modalities for Specific Training Tasks—0
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement—0
Bidirectional Multirate Reconstruction for Temporal Modeling in Videos—0
Describe Anything: Detailed Localized Image and Video Captioning—0
Improving Interpretability of Deep Neural Networks with Semantic Information—0
Bidirectional Long-Short Term Memory for Video Description—0
Beyond Caption To Narrative: Video Captioning With Multiple Sentences—0
Dense Video Captioning: A Survey of Techniques, Datasets and Evaluation Protocols—0
End-to-End Video Captioning—0
Image-to-Video Person Re-Identification by Reusing Cross-modal Embeddings—0
IcoCap: Improving Video Captioning by Compounding Images—0
HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation—0
Learning Interactive Real-World Simulators—0
Learning to Compose Topic-Aware Mixture of Experts for Zero-Shot Video Captioning—0
Less Is More: Picking Informative Frames for Video Captioning—0
Best Vision Technologies Submission to ActivityNet Challenge 2018-Task: Dense-Captioning Events in Videos—0
Deep Reinforcement Learning for NLP—0
LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision—0
HiVLP: Hierarchical Interactive Video-Language Pre-Training—0
An Attempt towards Interpretable Audio-Visual Video Captioning—0
HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training—0
An Efficient Keyframes Selection Based Framework for Video Captioning—0
Rethinking and Improving Natural Language Generation with Layer-Wise Multi-View Decoding—0
Hierarchical Recurrent Neural Network for Video Summarization—0
Hierarchical Recurrent Neural Encoder for Video Representation with Application to Captioning—0
Hierarchical Multimodal Transformer to Summarize Videos—0
Human Action Sequence Classification—0
Human-centric Behavior Description in Videos: New Benchmark and Model—0
CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning—0
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding—0
Hierarchical Memory Decoding for Video Captioning—0
Hierarchical memory decoder for visual narrating—0
Imperial College London Submission to VATEX Video Captioning Task—0
Implicit and Explicit Commonsense for Multi-sentence Video Captioning—0
Dense Video Captioning using Graph-based Sentence Summarization—0
Crowd Video Captioning—0
Hierarchical LSTM with Adjusted Temporal Attention for Video Captioning—0
Hierarchical LSTMs with Adaptive Attention for Visual Captioning—0
Show:102550
← PrevPage 4 of 10Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1mPLUG-2CIDEr80—Unverified
2VASTCIDEr78—Unverified
3GIT2CIDEr75.9—Unverified
4VLABCIDEr74.9—Unverified
5COSACIDEr74.7—Unverified
6VALORCIDEr74—Unverified
7MaMMUT (ours)CIDEr73.6—Unverified
8VideoCoCaCIDEr73.2—Unverified
9RTQCIDEr69.3—Unverified
10HowToCaptionCIDEr65.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MaMMUTCIDEr195.6—Unverified
2VLABCIDEr179.8—Unverified
3COSACIDEr178.5—Unverified
4VALORCIDEr178.5—Unverified
5mPLUG-2CIDEr165.8—Unverified
6HowToCaptionCIDEr154.2—Unverified
7HiTeACIDEr146.9—Unverified
8Vid2SeqCIDEr146.2—Unverified
9VIOLETv2CIDEr139.2—Unverified
10RTQCIDEr123.4—Unverified
#ModelMetricClaimedVerifiedStatus
1VASTBLEU-418.2—Unverified
2UniVL + MELTRBLEU-417.92—Unverified
3UniVLBLEU-417.35—Unverified
4VideoCoCaBLEU-414.2—Unverified
5VLMBLEU-412.27—Unverified
6E2vidD6-MASSvid-BiDBLEU-412.04—Unverified
7TextKGBLEU-411.7—Unverified
8COOTBLEU-411.3—Unverified
9COSABLEU-410.1—Unverified
10HowToCaptionBLEU-48.8—Unverified
#ModelMetricClaimedVerifiedStatus
1VALORBLEU-445.6—Unverified
2VASTBLEU-445—Unverified
3COSABLEU-443.7—Unverified
4VideoCoCaBLEU-439.7—Unverified
5IcoCap (ViT-B/16)BLEU-437.4—Unverified
6IcoCap (ViT-B/32)BLEU-436.9—Unverified
7VASTA (Kinetics-backbone)BLEU-436.25—Unverified
8CoCap (ViT/L14)BLEU-435.8—Unverified
9ORG-TRLBLEU-432.1—Unverified
10NITS-VCBLEU-420—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoCoCaBLEU414.7—Unverified
2VLTinT (ae-test split) C3D/LingBLEU414.5—Unverified
3VLCap (ae-test split) - Appearance + LanguageBLEU413.38—Unverified
4COOT (ae-test split) - Only Appearance featuresBLEU410.85—Unverified
5MART (ae-test split) - Appearance + FlowBLEU410.33—Unverified
#ModelMetricClaimedVerifiedStatus
1CENCIDEr49.87—Unverified
2GITCIDEr32.43—Unverified
3SEM-POSCIDEr26.01—Unverified
4AKGNNCIDEr25.9—Unverified
#ModelMetricClaimedVerifiedStatus
1CENCIDEr63.51—Unverified
2GITCIDEr45.63—Unverified
3SEM-POSCIDEr37.16—Unverified
4AKGNNCIDEr35.08—Unverified
#ModelMetricClaimedVerifiedStatus
1SBD_KeyframeBLEU441.01—Unverified
2V+S-Att-basedBLEU436.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VASTBLEU-419.9—Unverified
2COSABLEU-418.8—Unverified
#ModelMetricClaimedVerifiedStatus
1GVTBLEU417.7—Unverified
#ModelMetricClaimedVerifiedStatus
1VNS-GRU (Cross-Lingual)BLEU-458.68—Unverified
#ModelMetricClaimedVerifiedStatus
1Shot2StoryCIDEr37.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Vid2SeqCIDEr120.5—Unverified