SOTAVerified

Video Generation

( Various Video Generation Tasks. Gif credit: MaGViT )

Papers

Showing 1–50 of 1466 papers

TitleStatusHype
Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200kCode14
Open-Sora: Democratizing Efficient Video Production for AllCode13
CogVideoX: Text-to-Video Diffusion Models with An Expert TransformerCode11
LivePortrait: Efficient Portrait Animation with Stitching and Retargeting ControlCode11
Open-Sora Plan: Open-Source Large Video Generation ModelCode11
Wan: Open and Advanced Large-Scale Video Generative ModelsCode11
HunyuanVideo: A Systematic Framework For Large Video Generative ModelsCode11
LTX-Video: Realtime Video Latent DiffusionCode9
SkyReels-V2: Infinite-length Film Generative ModelCode9
MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal SamplingCode9
VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion ModelsCode9
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video GenerationCode9
MAGI-1: Autoregressive Video Generation at ScaleCode7
Champ: Controllable and Consistent Human Image Animation with 3D Parametric GuidanceCode7
SageAttention2++: A More Efficient Implementation of SageAttention2Code7
Let Them Talk: Audio-Driven Multi-Person Conversational Video GenerationCode7
Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation ModelCode7
Pyramidal Flow Matching for Efficient Video Generative ModelingCode7
SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference AccelerationCode7
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 QuantizationCode7
Real-Time Video Generation with Pyramid Attention BroadcastCode7
Goku: Flow Based Video Generative Foundation ModelsCode7
Aligning Anime Video Generation with Human FeedbackCode7
EasyAnimate: A High-Performance Long Video Generation Method based on Transformer ArchitectureCode7
DragAnything: Motion Control for Anything using Entity RepresentationCode7
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention TileCode7
EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human AnimationCode7
Fast Video Generation with Sliding Tile AttentionCode7
Vista: A Generalizable Driving World Model with High Fidelity and Versatile ControllabilityCode7
DSP: Dynamic Sequence Parallelism for Multi-Dimensional TransformersCode7
AniSora: Exploring the Frontiers of Animation Video Generation in the Sora EraCode7
VACE: All-in-One Video Creation and EditingCode7
Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image AnimationCode7
SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion ModelsCode6
CogVideo: Large-scale Pretraining for Text-to-Video Generation via TransformersCode6
DanceGRPO: Unleashing GRPO on Visual GenerationCode5
MagicTime: Time-lapse Video Generation Models as Metamorphic SimulatorsCode5
Matrix-Game: Interactive World Foundation ModelCode5
StableAnimator: High-Quality Identity-Preserving Human Image AnimationCode5
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video GenerationCode5
Latte: Latent Diffusion Transformer for Video GenerationCode5
Consistency ModelsCode5
Segment Anything for Videos: A Systematic SurveyCode5
ControlNeXt: Powerful and Efficient Control for Image and Video GenerationCode5
ShareGPT4Video: Improving Video Understanding and Generation with Better CaptionsCode5
GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera ControlCode5
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video GenerationCode5
Show-o2: Improved Native Unified Multimodal ModelsCode5
OmniV2V: Versatile Video Generation and Editing via Dynamic Content ManipulationCode5
Phantom: Subject-consistent video generation via cross-modal alignmentCode5
Show:102550
← PrevPage 1 of 30Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MCVDFVD162,460—Unverified
2VDMFVD161,396—Unverified
3TGAN-v2 (128x128)FVD161,209—Unverified
4MCVD (64x64)FVD161,143—Unverified
5MoCoGAN-HD (256x256, unconditional)FVD16700—Unverified
6MagicVideo (256x256, text-conditional)FVD16699—Unverified
7TATS (256x256)FVD16635—Unverified
8FIFO-DiffusionFVD128596.64—Unverified
9DIGAN (128x128, unconditional)FVD16577—Unverified
10LVDM (256x256, unconditional)FVD16552—Unverified
#ModelMetricClaimedVerifiedStatus
1MoCoGANFVD score503—Unverified
2Baseline (from LVT)FVD score320.9—Unverified
3SVG-FP (from FVD)FVD score315.5—Unverified
4CDNA (from FVD)FVD score296.5—Unverified
5SV2P (from FVD)FVD score262.5—Unverified
6SVG-LP (from vRNN)FVD score256.62—Unverified
7WAMFVD score159.6—Unverified
8VRNN 1LFVD score149.22—Unverified
9SAVP (from vRNN)FVD score143.43—Unverified
10Hier-VRNNFVD score143.4—Unverified
#ModelMetricClaimedVerifiedStatus
1MoCoGAN-HD (128x128)FVD 16183.6—Unverified
2TATS (128x128)FVD 16132.6—Unverified
3Long-video GAN (256x256)FVD 16116.5—Unverified
4DIGAN (128x128)FVD 16114.6—Unverified
5Long-video GAN (128x128)FVD 16107.5—Unverified
6LVDM (256x256)FVD 1695.2—Unverified
7DDMIFVD 1666.25—Unverified
8Latte + LeanVAEFVD 1649.59—Unverified
9StyleSV (256x256)FVD 1649—Unverified
#ModelMetricClaimedVerifiedStatus
1Video Diffusion ModelInception Score57—Unverified
2TGAN-ODEInception Score15.2—Unverified
3TGAN-FInception Score13.62—Unverified
4MoCoGANInception Score12.42—Unverified
5MoCoGAN-MDPInception Score11.86—Unverified
6TGAN-SVCInception Score11.85—Unverified
7VGANInception Score8.18—Unverified
#ModelMetricClaimedVerifiedStatus
1TGAN-FInception Score22.91—Unverified
2TGANv2Inception Score21.45—Unverified
3TGANv2-ODEInception Score21.02—Unverified
4MoCoGANInception Score12.42—Unverified
5MoCoGAN-MDPInception Score11.86—Unverified
6TGAN-SVCInception Score11.85—Unverified
7VGANInception Score8.18—Unverified
#ModelMetricClaimedVerifiedStatus
1Imagen original (constant=6)CLIP R-Precision92.12—Unverified
2Imagen fully distilled (oscillate (15,1))CLIP R-Precision90.97—Unverified
3Imagen distilled (constant=6)CLIP R-Precision90.88—Unverified
4Imagen original (oscillate(15,1))CLIP R-Precision89.91—Unverified
5Imagen fully distilled (constant=6)CLIP R-Precision89.68—Unverified
6Imagen distilled (oscillate (15,1))CLIP R-Precision88.78—Unverified
#ModelMetricClaimedVerifiedStatus
1DIGAN (256x256)FVD16156.7—Unverified
2MoCoGAN-HD (128x128)FVD16144.7—Unverified
3DIGAN (128x128)FVD16128.1—Unverified
4LVDM (256x256)FVD1699—Unverified
5TATS (128x128)FVD1694.6—Unverified
6StyleSV (256x256)FVD1682.6—Unverified
#ModelMetricClaimedVerifiedStatus
1TGANv2 (2020)Inception Score28.87—Unverified
2DVD-GANInception Score27.38—Unverified
3VideoGPTInception Score24.69—Unverified
4TGANv2Inception Score24.34—Unverified
5TGAN-FInception Score22.91—Unverified
6TGANv2-ODEInception Score21.02—Unverified
#ModelMetricClaimedVerifiedStatus
1DVD-GANFVD31.1—Unverified
2MAGVITFVD9.9—Unverified
#ModelMetricClaimedVerifiedStatus
1INR-VFVD16144—Unverified
#ModelMetricClaimedVerifiedStatus
1DVD-GANFID2.16—Unverified
#ModelMetricClaimedVerifiedStatus
1DVD-GANFID12.92—Unverified
#ModelMetricClaimedVerifiedStatus
1DiT-XL/2 + CVAE-FT-SEFID8.59—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoAssembler (Zero-Shot, 256x256, class-conditional)FVD16252—Unverified
#ModelMetricClaimedVerifiedStatus
1PG-SWGAN-3DFID404.1—Unverified
#ModelMetricClaimedVerifiedStatus
1StyleSVFVD16207.2—Unverified