SOTAVerified

Text-to-Video Generation

Ma grand-mère m’a raconté que quand elle était étudiante, elle avait un petit-ami. À l’âge de 18 ans, il a dû partir pour le service militaire, elle ne l’a pas attendu et elle a épousé quelqu’un d’autre. Quand ma grand-mère avait 58-59 ans, un homme (son premier amour) lui a envoyé une demande d’amis sur un réseau social, ils ont commencé à parler... En moins de six mois, ils ont décidé de se voir. Le trajet en train a duré deux jours et ils se sont finalement rencontrés. Cela fait maintenant deux ans qu’ils habitent ensemble et qu’ils nous rendent visite de temps en temps. Je réalise maintenant que leur amour l’un envers l’autre n’a jamais cessé.

Papers

Showing 151–175 of 201 papers

TitleStatusHype
VIMI: Grounding Video Generation through Multi-modal Instruction—0
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models—0
OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation—0
MotionBooth: Motion-Aware Customized Text-to-Video Generation—0
Zero-Shot Video Editing through Adaptive Sliding Score Distillation—0
I4VGen: Image as Free Stepping Stone for Text-to-Video Generation—0
DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control—0
The Lost Melody: Empirical Observations on Text-to-Video Generation From A Storytelling Perspective—0
MotionMaster: Training-free Camera Motion Transfer For Video Generation—0
AniClipart: Clipart Animation with Text-to-Video Priors—0
Grid Diffusion Models for Text-to-Video Generation—0
A Review of Multi-Modal Large Language and Vision Models—0
Tutorial on Diffusion Models for Imaging and Vision—0
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models—0
S2DM: Sector-Shaped Diffusion Models for Video Generation—0
Animate Your Motion: Turning Still Images into Dynamic Videos—0
FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing—0
Sora as an AGI World Model? A Complete Survey on Text-to-Video Generation—0
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis—0
CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects—0
Towards A Better Metric for Text-to-Video Generation—0
FlashVideo: A Framework for Swift Inference in Text-to-Video Generation—0
A Recipe for Scaling up Text-to-Video Generation with Text-free Videos—0
VideoPoet: A Large Language Model for Zero-Shot Video Generation—0
Photorealistic Video Generation with Diffusion Models—0
Show:102550
← PrevPage 7 of 9Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MagicVideoFVD998—Unverified
2VideoComposerFVD580—Unverified
3ModelScopeT2VFVD550—Unverified
4Show-1FVD538—Unverified
5TF-T2VFVD441—Unverified
6HiGenFVD406—Unverified
7PixelDanceFVD381—Unverified
8VideoPoetFVD213—Unverified
9Video-LaVITFVD188.36—Unverified
10Snap Video (288×288)FVD110.4—Unverified
#ModelMetricClaimedVerifiedStatus
1MagicVideo (Zero-shot, 256x256)FVD16699—Unverified
2Video LDM (Zero-shot, 320x512)FVD16550.61—Unverified
3LAVIE (Zero-shot, 320x512)FVD16526.3—Unverified
4PYoCo (Zero-shot, 64x64)FVD16355.19—Unverified
5VideoPoetFVD16355—Unverified
6Lumiere (Zero-shot, 1024x1024)FVD16332.49—Unverified
7Snap Video (Zero-shot, 288×288)FVD16260.1—Unverified
8W.A.L.T 3BFVD16258.1—Unverified
9PixelDance (Zero-shot, 256x256)FVD16242.82—Unverified
10Snap Video (Zero-shot, 512x288)FVD16200.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoCrafter2Visual Quality54.82—Unverified
2Show-1Visual Quality53.74—Unverified
3VideoCrafter1Visual Quality53.08—Unverified
4LavieVisual Quality52.83—Unverified
5ModelScopeVisual Quality52.47—Unverified
#ModelMetricClaimedVerifiedStatus
1MAGVITFVD79.1—Unverified
2MAGVITFVD28.5—Unverified
#ModelMetricClaimedVerifiedStatus
1NUWA (128×128)Accuracy77.9—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoFactoryFVD292.35—Unverified