SOTAVerified

Dense Video Captioning

Most natural videos contain numerous events. For example, in a video of a “man playing a piano”, the video might also contain “another man dancing” or “a crowd clapping”. The task of dense video captioning involves both detecting and describing events in a video.

Papers

Showing 51–76 of 76 papers

TitleStatusHype
End-to-end Dense Video Captioning as Sequence Generation—0
Dense Video Captioning Using Unsupervised Semantic InformationCode0
DVCFlow: Modeling Information Flow Towards Human-like Video Captioning—0
End-to-End Dense Video Captioning with Parallel DecodingCode1
Global Object Proposals for Improving Multi-Sentence Video DescriptionsCode0
Sketch, Ground, and Refine: Top-Down Dense Video CaptioningCode0
Weakly Supervised Dense Video Captioning via Jointly Usage of Knowledge Distillation and Cross-modal Matching—0
TSP: Temporally-Sensitive Pretraining of Video Encoders for Localization TasksCode1
iPerceive: Applying Common-Sense Reasoning to Multi-Modal Dense Video Captioning and Video Question Answering—0
Multimodal Pretraining for Dense Video CaptioningCode1
SODA: Story Oriented Dense Video Captioning Evaluation FrameworkCode1
SACT: Self-Aware Multi-Space Feature Composition Transformer for Multinomial Attention for Video Captioning—0
Dense-Captioning Events in Videos: SYSU Submission to ActivityNet Challenge 2020Code1
Team RUC_AIM3 Technical Report at Activitynet 2020 Task 2: Exploring Sequential Events Detection for Dense Video Captioning—0
A Better Use of Audio-Visual Cues: Dense Video Captioning with Bi-modal TransformerCode1
Multi-modal Dense Video CaptioningCode1
Activitynet 2019 Task 3: Exploring Contexts for Dense Captioning Events in Videos—0
Attention is all you need for Videos: Self-attention based Video Summarization using Universal Transformers—0
Streamlined Dense Video CaptioningCode0
RUC+CMU: System Report for Dense Captioning Events in Videos—0
Jointly Localizing and Describing Events for Dense Video Captioning—0
End-to-End Dense Video Captioning with Masked TransformerCode0
Bidirectional Attentive Fusion with Context Gating for Dense Video CaptioningCode0
Joint Event Detection and Description in Continuous Video StreamsCode0
Weakly Supervised Dense Video Captioning—0
Towards Automatic Learning of Procedures from Web Instructional VideosCode0
Show:102550
← PrevPage 2 of 2Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1VTimeLLMCIDEr27.6—Unverified
2Vid2SeqMETEOR17—Unverified
3ADV-INF + GlobalMETEOR16.36—Unverified
4Bi-directional+intra captioningMETEOR11.28—Unverified
5GVLMETEOR10.03—Unverified
6TSRM-CMG-HRNN+SCSTMETEOR9.71—Unverified
7PDVC (TSP features, no SCST)METEOR9.03—Unverified
8TSPMETEOR8.75—Unverified
9CM²METEOR8.55—Unverified
10BMTMETEOR8.44—Unverified
#ModelMetricClaimedVerifiedStatus
1HiCM²CIDEr71.84—Unverified
2Vid2Seq (HowTo100M+VidChapters-7M PT)CIDEr67.2—Unverified
3Vid2SeqCIDEr47.1—Unverified
4E2vidD6-MASSalign-BiDROUGE-L39.03—Unverified
5CM²CIDEr31.66—Unverified
6GVLCIDEr26.52—Unverified
7PDVC (TSN features, no SCST)CIDEr22.71—Unverified
#ModelMetricClaimedVerifiedStatus
1E2ESGCIDEr25—Unverified
2Vid2Seq (VidChapters-7M PT)SODA0.15—Unverified
3HiCM²SODA0.15—Unverified
4Vid2SeqSODA0.14—Unverified
#ModelMetricClaimedVerifiedStatus
1Vid2SeqCIDEr55.7—Unverified