SOTAVerified

Visual Storytelling

( Image credit: No Metrics Are Perfect )

Papers

Showing 1–25 of 115 papers

TitleStatusHype
FlipSketch: Flipping Static Drawings to Text-Guided Sketch AnimationsCode3
Intelligent Grimm - Open-ended Visual Storytelling via Latent Diffusion ModelsCode3
Alfie: Democratising RGBA Image Generation With No $Code2
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and GenerationCode2
Animate-A-Story: Storytelling with Retrieval-Augmented Video GenerationCode2
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion ModelsCode2
StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story GenerationCode1
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual StorytellingCode1
Gorgeous: Create Your Desired Character Facial Makeup from Any IdeasCode1
inkn'hue: Enhancing Manga Colorization from Multiple Priors with Alignment Multi-Encoder VAECode1
TouchStone: Evaluating Vision-Language Models by Language ModelsCode1
Positional Diffusion: Ordering Unordered Sets with Diffusion Probabilistic ModelsCode1
Expressive Scene Graph Generation Using Commonsense Knowledge Infusion for Visual Understanding and ReasoningCode1
Plot and Rework: Modeling Storylines for Visual StorytellingCode1
Shape2Animal: Creative Animal Generation from Natural Silhouettes—0
JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent—0
Consistent Story Generation with Asymmetry Zigzag SamplingCode0
Camera Trajectory Generation: A Comprehensive Survey of Methods, Metrics, and Future Directions—0
LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers—0
Action2Dialogue: Generating Character-Centric Narratives from Scene-Level Prompts—0
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?—0
FLIP Reasoning ChallengeCode0
GenDoP: Auto-regressive Camera Trajectory Generation as a Director of Photography—0
Storybooth: Training-free Multi-Subject Consistency for Improved Visual Storytelling—0
DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description—0
Show:102550
← PrevPage 1 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GLAC NetMETEOR30.14—Unverified
2HEGRBLEU-416.7—Unverified
3HBSGBLEU-415.4—Unverified
4IRWBLEU-415.4—Unverified
5CoVSBLEU-415.2—Unverified
6SGEmbBLEU-414.8—Unverified
7SentiStoryBLEU-414.8—Unverified
8SGVSTBLEU-414.7—Unverified
9INetBLEU-414.7—Unverified
10TAVST (RL)BLEU-414.6—Unverified