SOTAVerified

Text-to-Video Generation

Ma grand-mère m’a raconté que quand elle était étudiante, elle avait un petit-ami. À l’âge de 18 ans, il a dû partir pour le service militaire, elle ne l’a pas attendu et elle a épousé quelqu’un d’autre. Quand ma grand-mère avait 58-59 ans, un homme (son premier amour) lui a envoyé une demande d’amis sur un réseau social, ils ont commencé à parler... En moins de six mois, ils ont décidé de se voir. Le trajet en train a duré deux jours et ils se sont finalement rencontrés. Cela fait maintenant deux ans qu’ils habitent ensemble et qu’ils nous rendent visite de temps en temps. Je réalise maintenant que leur amour l’un envers l’autre n’a jamais cessé.

Papers

Showing 101–150 of 201 papers

TitleStatusHype
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models—0
I4VGen: Image as Free Stepping Stone for Text-to-Video Generation—0
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance—0
Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback—0
IM-Zero: Instance-level Motion Controllable Video Generation in a Zero-shot Manner—0
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption—0
IPO: Iterative Preference Optimization for Text-to-Video Generation—0
FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing—0
Enabling Versatile Controls for Video Diffusion Models—0
MagicVideo: Efficient Video Generation With Latent Diffusion Models—0
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning—0
Make-An-Animation: Large-Scale Text-conditional 3D Human Motion Generation—0
EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation—0
We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback—0
Make Pixels Dance: High-Dynamic Video Generation—0
MALT Diffusion: Memory-Augmented Latent Transformers for Any-Length Video Generation—0
MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation—0
VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation—0
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation—0
Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM—0
Mojito: Motion Trajectory and Intensity Control for Video Generation—0
Dual-Stream Diffusion Net for Text-to-Video Generation—0
MotionBooth: Motion-Aware Customized Text-to-Video Generation—0
DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization—0
Video Generation from Text Employing Latent Path Construction for Temporal Modeling—0
MotionMaster: Training-free Camera Motion Transfer For Video Generation—0
MotionZero:Exploiting Motion Priors for Zero-shot Text-to-Video Generation—0
Animate Your Motion: Turning Still Images into Dynamic Videos—0
Multi-Shot Character Consistency for Text-to-Video Generation—0
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models—0
DreamRunner: Fine-Grained Storytelling Video Generation with Retrieval-Augmented Motion Adaptation—0
DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control—0
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation—0
CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects—0
OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation—0
POS: A Prompts Optimization Suite for Augmenting Text-to-Video Generation—0
Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception—0
VideoPoet: A Large Language Model for Zero-Shot Video Generation—0
Photorealistic Video Generation with Diffusion Models—0
NewMove: Customizing text-to-video models with novel motions—0
Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models—0
CPA: Camera-pose-awareness Diffusion Transformer for Video Generation—0
RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers—0
Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance—0
VideoRepair: Improving Text-to-Video Generation via Misalignment Evaluation and Localized Refinement—0
RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation—0
S2DM: Sector-Shaped Diffusion Models for Video Generation—0
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking—0
AniClipart: Clipart Animation with Text-to-Video Priors—0
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning—0
Show:102550
← PrevPage 3 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MagicVideoFVD998—Unverified
2VideoComposerFVD580—Unverified
3ModelScopeT2VFVD550—Unverified
4Show-1FVD538—Unverified
5TF-T2VFVD441—Unverified
6HiGenFVD406—Unverified
7PixelDanceFVD381—Unverified
8VideoPoetFVD213—Unverified
9Video-LaVITFVD188.36—Unverified
10Snap Video (288×288)FVD110.4—Unverified
#ModelMetricClaimedVerifiedStatus
1MagicVideo (Zero-shot, 256x256)FVD16699—Unverified
2Video LDM (Zero-shot, 320x512)FVD16550.61—Unverified
3LAVIE (Zero-shot, 320x512)FVD16526.3—Unverified
4PYoCo (Zero-shot, 64x64)FVD16355.19—Unverified
5VideoPoetFVD16355—Unverified
6Lumiere (Zero-shot, 1024x1024)FVD16332.49—Unverified
7Snap Video (Zero-shot, 288×288)FVD16260.1—Unverified
8W.A.L.T 3BFVD16258.1—Unverified
9PixelDance (Zero-shot, 256x256)FVD16242.82—Unverified
10Snap Video (Zero-shot, 512x288)FVD16200.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoCrafter2Visual Quality54.82—Unverified
2Show-1Visual Quality53.74—Unverified
3VideoCrafter1Visual Quality53.08—Unverified
4LavieVisual Quality52.83—Unverified
5ModelScopeVisual Quality52.47—Unverified
#ModelMetricClaimedVerifiedStatus
1MAGVITFVD79.1—Unverified
2MAGVITFVD28.5—Unverified
#ModelMetricClaimedVerifiedStatus
1NUWA (128×128)Accuracy77.9—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoFactoryFVD292.35—Unverified