SOTAVerified

Video Summarization

Video Summarization aims to generate a short synopsis that summarizes the video content by selecting its most informative and important parts. The produced summary is usually composed of a set of representative video frames (a.k.a. video key-frames), or video fragments (a.k.a. video key-fragments) that have been stitched in chronological order to form a shorter video. The former type of a video summary is known as video storyboard, and the latter type is known as video skim.

Source: Video Summarization Using Deep Neural Networks: A Survey Image credit: iJRASET

Papers

Showing 126–150 of 280 papers

TitleStatusHype
R^2-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding—0
Realistic Video Summarization through VISIOCITY: A New Benchmark and Evaluation Framework—0
Realizing Video Summarization from the Path of Language-based Semantic Understanding—0
Real-time Video Summarization on Commodity Hardware—0
Reconstructive Sequence-Graph Network for Video Summarization—0
REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing—0
Reinforcement Learning for Ultrasound Image Analysis A Comprehensive Review of Advances and Applications—0
Relational Reasoning Over Spatial-Temporal Graphs for Video Summarization—0
Representative Selection for Big Data via Sparse Graph and Geodesic Grassmann Manifold Distance—0
Retrospective Encoders for Video Summarization—0
Role of Audio in Audio-Visual Video Summarization—0
Saliency-based Video Summarization for Face Anti-spoofing—0
SalSum: Saliency-based Video Summarization using Generative Adversarial Networks—0
Scaling Submodular Maximization via Pruned Submodularity Graphs—0
Scaling Up Video Summarization Pretraining with Large Language Models—0
Scene Summarization: Clustering Scene Videos into Spatially Diverse Frames—0
Segmentation of Bleeding Regions in Wireless Capsule Endoscopy Images an Approach for inside Capsule Video Summarization—0
Self-Attention Based Generative Adversarial Networks For Unsupervised Video Summarization—0
Semantics for Large-Scale Multimedia: New Challenges for NLP—0
Semantic Video Trailers—0
Sequence-to-Segment Networks for Segment Detection—0
Show and Recall: Learning What Makes Videos Memorable—0
Distance Metric-Based Learning with Interpolated Latent Features for Location Classification in Endoscopy Image and Video—0
Story-Driven Summarization for Egocentric Video—0
Stream Clipper: Scalable Submodular Maximization on Stream—0
Show:102550
← PrevPage 6 of 12Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PGL-SUMF1-score (Canonical)55.6—Unverified
2RR-STGF1-score (Canonical)54.5—Unverified
3DSNetF1-score (Canonical)53—Unverified
4VASNetF1-score (Canonical)49.71—Unverified
5M-AVSF1-score (Canonical)44.4—Unverified
6CSTAKendall's Tau0.25—Unverified
#ModelMetricClaimedVerifiedStatus
1RR-STGF1-score (Canonical)63—Unverified
2DSNetF1-score (Canonical)62.1—Unverified
3VASNetF1-score (Canonical)61.42—Unverified
4PGL-SUMF1-score (Canonical)61—Unverified
5M-AVSF1-score (Canonical)61—Unverified
6CSTAKendall's Tau0.19—Unverified
#ModelMetricClaimedVerifiedStatus
1Shotluck-Holmes (3.1B)CIDEr152.3—Unverified
2Shotluck-Holmes (3.1B)CIDEr63.2—Unverified
3SUM-shotCIDEr8.6—Unverified
#ModelMetricClaimedVerifiedStatus
1EgoVLPv2F1 (avg)52.08—Unverified
2EgoVLPF1 (avg)49.72—Unverified
#ModelMetricClaimedVerifiedStatus
1PGL-SUMMAP (50%)61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VTSUM-BLIP1 shot Micro-F123.5—Unverified