SOTAVerified

Video Captioning

Video Captioning is a task of automatic captioning a video by understanding the action and event in the video which can help in the retrieval of the video efficiently through text.

Source: NITS-VC System for VATEX Video Captioning Challenge 2020

Papers

Showing 201–250 of 473 papers

TitleStatusHype
Active Learning for Video Description With Cluster-Regularized Ensemble Ranking—0
Activitynet 2019 Task 3: Exploring Contexts for Dense Captioning Events in Videos—0
AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction—0
AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction—0
Adaptive Feature Abstraction for Translating Video to Text—0
A Dataset for Telling the Stories of Social Media Videos—0
Agent-based Video Trimming—0
Aligning Source Visual and Target Language Domains for Unpaired Video Captioning—0
Amortized Context Vector Inference for Sequence-to-Sequence Networks—0
Analyzing Zero-Shot Abilities of Vision-Language Models on Video Understanding Tasks—0
An Attempt towards Interpretable Audio-Visual Video Captioning—0
An Efficient Keyframes Selection Based Framework for Video Captioning—0
End-to-End Video Captioning—0
An Integrated Approach for Video Captioning and Applications—0
A Recipe for Scaling up Text-to-Video Generation with Text-free Videos—0
A Restricted Visual Turing Test for Deep Scene and Event Understanding—0
A Review of Deep Learning for Video Captioning—0
ARGUS: Hallucination and Omission Evaluation in Video-LLMs—0
A Shared Task on Multimodal Machine Translation and Crosslingual Image Description—0
A Toolchain for Comprehensive Audio/Video Analysis Using Deep Learning Based Multimodal Approach (A use case of riot or violent context detection)—0
Attend and Interact: Higher-Order Object Interactions for Video Understanding—0
Attention Based Encoder Decoder Model for Video Captioning in Nepali (2023)—0
Attention based video captioning framework for Hindi—0
Attention is all you need for Videos: Self-attention based Video Summarization using Universal Transformers—0
Attract me to Buy: Advertisement Copywriting Generation with Multimodal Multi-structured Information—0
Auto-captions on GIF: A Large-scale Video-sentence Dataset for Vision-language Pre-training—0
Automatic Generation of Descriptive Titles for Video Clips Using Deep Learning—0
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding—0
Best Vision Technologies Submission to ActivityNet Challenge 2018-Task: Dense-Captioning Events in Videos—0
Beyond Caption To Narrative: Video Captioning With Multiple Sentences—0
Bidirectional Long-Short Term Memory for Video Description—0
Bidirectional Multirate Reconstruction for Temporal Modeling in Videos—0
Boosting Video Captioning with Dynamic Loss Network—0
Boosting Video Representation Learning with Multi-Faceted Integration—0
Boosting Video-Text Retrieval with Explicit High-Level Semantics—0
Bridge Video and Text with Cascade Syntactic Structure—0
Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives—0
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning—0
Prediction and Description of Near-Future Activities in Video—0
Capturing Rich Behavior Representations: A Dynamic Action Semantic-Aware Graph Transformer for Video Captioning—0
Characterizing the impact of using features extracted from pre-trained models on the quality of video captioning sequence-to-sequence models—0
Chinese Whispers: Cooperative Paraphrase Acquisition—0
Classifier-Guided Captioning Across Modalities—0
CLIP4Caption: CLIP for Video Caption—0
CoCo-BERT: Improving Video-Language Pre-training with Contrastive Cross-modal Matching and Denoising—0
Collaborative Three-Stream Transformers for Video Captioning—0
Consensus-based Sequence Training for Video Captioning—0
Learning Video Representations using Contrastive Bidirectional Transformer—0
CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation—0
CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation—0
Show:102550
← PrevPage 5 of 10Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1mPLUG-2CIDEr80—Unverified
2VASTCIDEr78—Unverified
3GIT2CIDEr75.9—Unverified
4VLABCIDEr74.9—Unverified
5COSACIDEr74.7—Unverified
6VALORCIDEr74—Unverified
7MaMMUT (ours)CIDEr73.6—Unverified
8VideoCoCaCIDEr73.2—Unverified
9RTQCIDEr69.3—Unverified
10HowToCaptionCIDEr65.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MaMMUTCIDEr195.6—Unverified
2VLABCIDEr179.8—Unverified
3COSACIDEr178.5—Unverified
4VALORCIDEr178.5—Unverified
5mPLUG-2CIDEr165.8—Unverified
6HowToCaptionCIDEr154.2—Unverified
7HiTeACIDEr146.9—Unverified
8Vid2SeqCIDEr146.2—Unverified
9VIOLETv2CIDEr139.2—Unverified
10RTQCIDEr123.4—Unverified
#ModelMetricClaimedVerifiedStatus
1VASTBLEU-418.2—Unverified
2UniVL + MELTRBLEU-417.92—Unverified
3UniVLBLEU-417.35—Unverified
4VideoCoCaBLEU-414.2—Unverified
5VLMBLEU-412.27—Unverified
6E2vidD6-MASSvid-BiDBLEU-412.04—Unverified
7TextKGBLEU-411.7—Unverified
8COOTBLEU-411.3—Unverified
9COSABLEU-410.1—Unverified
10HowToCaptionBLEU-48.8—Unverified
#ModelMetricClaimedVerifiedStatus
1VALORBLEU-445.6—Unverified
2VASTBLEU-445—Unverified
3COSABLEU-443.7—Unverified
4VideoCoCaBLEU-439.7—Unverified
5IcoCap (ViT-B/16)BLEU-437.4—Unverified
6IcoCap (ViT-B/32)BLEU-436.9—Unverified
7VASTA (Kinetics-backbone)BLEU-436.25—Unverified
8CoCap (ViT/L14)BLEU-435.8—Unverified
9ORG-TRLBLEU-432.1—Unverified
10NITS-VCBLEU-420—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoCoCaBLEU414.7—Unverified
2VLTinT (ae-test split) C3D/LingBLEU414.5—Unverified
3VLCap (ae-test split) - Appearance + LanguageBLEU413.38—Unverified
4COOT (ae-test split) - Only Appearance featuresBLEU410.85—Unverified
5MART (ae-test split) - Appearance + FlowBLEU410.33—Unverified
#ModelMetricClaimedVerifiedStatus
1CENCIDEr49.87—Unverified
2GITCIDEr32.43—Unverified
3SEM-POSCIDEr26.01—Unverified
4AKGNNCIDEr25.9—Unverified
#ModelMetricClaimedVerifiedStatus
1CENCIDEr63.51—Unverified
2GITCIDEr45.63—Unverified
3SEM-POSCIDEr37.16—Unverified
4AKGNNCIDEr35.08—Unverified
#ModelMetricClaimedVerifiedStatus
1SBD_KeyframeBLEU441.01—Unverified
2V+S-Att-basedBLEU436.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VASTBLEU-419.9—Unverified
2COSABLEU-418.8—Unverified
#ModelMetricClaimedVerifiedStatus
1GVTBLEU417.7—Unverified
#ModelMetricClaimedVerifiedStatus
1VNS-GRU (Cross-Lingual)BLEU-458.68—Unverified
#ModelMetricClaimedVerifiedStatus
1Shot2StoryCIDEr37.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Vid2SeqCIDEr120.5—Unverified