SOTAVerified

Video Summarization

Video Summarization aims to generate a short synopsis that summarizes the video content by selecting its most informative and important parts. The produced summary is usually composed of a set of representative video frames (a.k.a. video key-frames), or video fragments (a.k.a. video key-fragments) that have been stitched in chronological order to form a shorter video. The former type of a video summary is known as video storyboard, and the latter type is known as video skim.

Source: Video Summarization Using Deep Neural Networks: A Survey Image credit: iJRASET

Papers

Showing 101–150 of 280 papers

TitleStatusHype
DeVAn: Dense Video Annotation for Video-Language ModelsCode0
Video-Teller: Enhancing Cross-Modal Generation with Fusion and Decoupling—0
Mr. HiSum: A Large-scale Dataset for Video Highlight Detection and Summarization—0
Does Video Summarization Require Videos? Quantifying the Effectiveness of Language in Video Summarization—0
Saliency-based Video Summarization for Face Anti-spoofing—0
Self-Attention Based Generative Adversarial Networks For Unsupervised Video Summarization—0
Query-based Video Summarization with Pseudo Label Supervision—0
Causal Video Summarizer for Video Exploration—0
Key Frame Extraction with Attention Based Deep Neural Networks—0
Masked Autoencoder for Unsupervised Video Summarization—0
Motion-Based Sign Language Video Summarization using Curvature and Torsion—0
Causalainer: Causal Explainer for Automatic Video Summarization—0
SELF-VS: Self-supervised Encoding Learning For Video SummarizationCode0
Learning to Summarize Videos by Contrasting Clips—0
Adaptive frame selection in two dimensional convolutional neural network action recognitionCode0
Role of Audio in Audio-Visual Video Summarization—0
Video Summarization Overview—0
TL;DW? Summarizing Instructional Videos with Task Relevance & Cross-Modal Saliency—0
Multimodal Frame-Scoring Transformer for Video Summarization—0
Multimodal Intent Discovery from Livestream Videos—0
A Multi-stage deep architecture for summary generation of soccer videos—0
Towards Practical and Efficient Long Video SummaryCode0
Relational Reasoning Over Spatial-Temporal Graphs for Video Summarization—0
NEWSKVQA: Knowledge-Aware News Video Question Answering—0
Exploring Global Diversity and Local Context for Video Summarization—0
Joint Video Summarization and Moment Localization by Cross-Task Sample Transfer—0
Fast Graph Sampling for Short Video Summarization using Gershgorin Disc Alignment—0
A Stacking Ensemble Approach for Supervised Video Summarization—0
Hierarchical Multimodal Transformer to Summarize Videos—0
ERA: Entity Relationship Aware Video Summarization with Wasserstein GANCode0
Unsupervised multi-latent space reinforcement learning framework for video summarization in ultrasound imagingCode0
Use of Affective Visual Information for Summarization of Human-Centric Videos—0
CLIP-It! Language-Guided Video SummarizationCode0
Video Summarization through Reinforcement Learning with a 3D Spatio-Temporal U-Net—0
APES: Audiovisual Person Search in Untrimmed VideoCode0
Unsupervised Video Summarization with a Convolutional Attentive Adversarial Network—0
AudioVisual Video Summarization—0
DeepQAMVS: Query-Aware Hierarchical Pointer Networks for Multi-Video Summarization—0
Reconstructive Sequence-Graph Network for Video Summarization—0
GPT2MVS: Generative Pre-trained Transformer-2 for Multi-modal Video SummarizationCode0
The Power of Subsampling in Submodular Maximization—0
Distance Metric-Based Learning with Interpolated Latent Features for Location Classification in Endoscopy Image and Video—0
Visual Question Answering: which investigated applications?Code0
Audiovisual Highlight Detection in Videos—0
Efficient Video Summarization Framework using EEG and Eye-tracking Signals—0
How Good is a Video Summary? A New Benchmarking Dataset and Evaluation Framework Towards Realistic Video Summarization—0
Video Summarization: Study of various techniques—0
Video Summarization Using Deep Neural Networks: A Survey—0
Multiple Pairwise Ranking Networks for Personalized Video Summarization—0
A New Action Recognition Framework for Video Highlights Summarization in Sporting Events—0
Show:102550
← PrevPage 3 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PGL-SUMF1-score (Canonical)55.6—Unverified
2RR-STGF1-score (Canonical)54.5—Unverified
3DSNetF1-score (Canonical)53—Unverified
4VASNetF1-score (Canonical)49.71—Unverified
5M-AVSF1-score (Canonical)44.4—Unverified
6CSTAKendall's Tau0.25—Unverified
#ModelMetricClaimedVerifiedStatus
1RR-STGF1-score (Canonical)63—Unverified
2DSNetF1-score (Canonical)62.1—Unverified
3VASNetF1-score (Canonical)61.42—Unverified
4PGL-SUMF1-score (Canonical)61—Unverified
5M-AVSF1-score (Canonical)61—Unverified
6CSTAKendall's Tau0.19—Unverified
#ModelMetricClaimedVerifiedStatus
1Shotluck-Holmes (3.1B)CIDEr152.3—Unverified
2Shotluck-Holmes (3.1B)CIDEr63.2—Unverified
3SUM-shotCIDEr8.6—Unverified
#ModelMetricClaimedVerifiedStatus
1EgoVLPv2F1 (avg)52.08—Unverified
2EgoVLPF1 (avg)49.72—Unverified
#ModelMetricClaimedVerifiedStatus
1PGL-SUMMAP (50%)61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VTSUM-BLIP1 shot Micro-F123.5—Unverified