SOTAVerified

Video Summarization

Video Summarization aims to generate a short synopsis that summarizes the video content by selecting its most informative and important parts. The produced summary is usually composed of a set of representative video frames (a.k.a. video key-frames), or video fragments (a.k.a. video key-fragments) that have been stitched in chronological order to form a shorter video. The former type of a video summary is known as video storyboard, and the latter type is known as video skim.

Source: Video Summarization Using Deep Neural Networks: A Survey Image credit: iJRASET

Papers

Showing 51–100 of 280 papers

TitleStatusHype
SD-VSum: A Method and Dataset for Script-Driven Video SummarizationCode0
Video Summarization with Large Language Models—0
Automatic Detection of Intro and Credits in Video using CLIP and Multihead Attention—0
FaVChat: Unlocking Fine-Grained Facail Video Understanding with Multimodal Large Language Models—0
A Novel Trustworthy Video Summarization Algorithm Through a Mixture of LoRA Experts—0
Parameter-free Video Segmentation for Vision and Language Understanding—0
CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion—0
Integrate the temporal scheme for unsupervised video summarization via attention mechanismCode0
Reinforcement Learning for Ultrasound Image Analysis A Comprehensive Review of Advances and Applications—0
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific PresentationsCode0
FullTransNet: Full Transformer with Local-Global Attention for Video Summarization—0
Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning—0
Agent-based Video Trimming—0
Video Summarization using Denoising Diffusion Probabilistic Model—0
Personalized Video Summarization by Multimodal Video Understanding—0
Your Interest, Your Summaries: Query-Focused Long Video SummarizationCode0
Exploring Efficient Foundational Multi-modal Models for Video Summarization—0
Realizing Video Summarization from the Path of Language-based Semantic Understanding—0
Video Summarization Techniques: A Comprehensive Review—0
Does SpatioTemporal information benefit Two video summarization benchmarks?Code0
EDSNet: Efficient-DSNet for Video Summarization—0
Personalized Video Summarization using Text-Based Queries and Conditional Modeling—0
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos—0
Multimodal Language Models for Domain-Specific Procedural Video Summarization—0
Unsupervised Video Summarization via Reinforcement Learning and a Trained Evaluator—0
UBiSS: A Unified Framework for Bimodal Semantic Summarization of VideosCode0
A Human-Annotated Video Dataset for Training and Evaluation of 360-Degree Video Summarization MethodsCode0
CSTA: CNN-based Spatiotemporal Attention for Video Summarization—0
"Previously on ..." From Recaps to Story Summarization—0
An Integrated Framework for Multi-Granular Explanation of Video SummarizationCode0
Language-Guided Self-Supervised Video Summarization Using Text Semantic Matching Considering the Diversity of the Video—0
Pegasus-v1 Technical Report—0
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning—0
Cluster-based Video Summarization with Temporal Context AwarenessCode0
Enhancing Video Summarization with Context AwarenessCode0
Scaling Up Video Summarization Pretraining with Large Language Models—0
R^2-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding—0
R^2-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding—0
FastPerson: Enhancing Video Learning through Effective Video Summarization that Preserves Linguistic and Visual Contexts—0
Large Model based Sequential Keyframe Extraction for Video Summarization—0
Previously on ... From Recaps to Story Summarization—0
Beyond the Frame: Single and mutilple video summarization method with user-defined length—0
An Integrated System for Spatio-Temporal Summarization of 360-degrees VideosCode0
Facilitating the Production of Well-tailored Video Summaries for Sharing on Social Media—0
A Challenging Multimodal Video Summary: Simultaneously Extracting and Generating Keyframe-Caption Pairs from VideoCode0
Video Summarization: Towards Entity-Aware CaptionsCode0
Scene Summarization: Clustering Scene Videos into Spatially Diverse Frames—0
Conditional Modeling Based Automatic Video Summarization—0
Unsupervised Video Summarization via Iterative Training and Simplified GANCode0
Dynamic Non-monotone Submodular Maximization—0
Show:102550
← PrevPage 2 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PGL-SUMF1-score (Canonical)55.6—Unverified
2RR-STGF1-score (Canonical)54.5—Unverified
3DSNetF1-score (Canonical)53—Unverified
4VASNetF1-score (Canonical)49.71—Unverified
5M-AVSF1-score (Canonical)44.4—Unverified
6CSTAKendall's Tau0.25—Unverified
#ModelMetricClaimedVerifiedStatus
1RR-STGF1-score (Canonical)63—Unverified
2DSNetF1-score (Canonical)62.1—Unverified
3VASNetF1-score (Canonical)61.42—Unverified
4PGL-SUMF1-score (Canonical)61—Unverified
5M-AVSF1-score (Canonical)61—Unverified
6CSTAKendall's Tau0.19—Unverified
#ModelMetricClaimedVerifiedStatus
1Shotluck-Holmes (3.1B)CIDEr152.3—Unverified
2Shotluck-Holmes (3.1B)CIDEr63.2—Unverified
3SUM-shotCIDEr8.6—Unverified
#ModelMetricClaimedVerifiedStatus
1EgoVLPv2F1 (avg)52.08—Unverified
2EgoVLPF1 (avg)49.72—Unverified
#ModelMetricClaimedVerifiedStatus
1PGL-SUMMAP (50%)61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1VTSUM-BLIP1 shot Micro-F123.5—Unverified