SOTAVerified

Text-to-Video Generation

Ma grand-mère m’a raconté que quand elle était étudiante, elle avait un petit-ami. À l’âge de 18 ans, il a dû partir pour le service militaire, elle ne l’a pas attendu et elle a épousé quelqu’un d’autre. Quand ma grand-mère avait 58-59 ans, un homme (son premier amour) lui a envoyé une demande d’amis sur un réseau social, ils ont commencé à parler... En moins de six mois, ils ont décidé de se voir. Le trajet en train a duré deux jours et ils se sont finalement rencontrés. Cela fait maintenant deux ans qu’ils habitent ensemble et qu’ils nous rendent visite de temps en temps. Je réalise maintenant que leur amour l’un envers l’autre n’a jamais cessé.

Papers

Showing 151–200 of 201 papers

TitleStatusHype
Video-to-Audio Generation with Hidden Alignment—0
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis—0
Sora as an AGI World Model? A Complete Survey on Text-to-Video Generation—0
STDD: Spatio-Temporal Dual Diffusion for Video Generation—0
Compositional 3D-aware Video Generation with LLM Director—0
Structure and Content-Guided Video Synthesis with Diffusion Models—0
CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation—0
Can Text-to-Video Generation help Video-Language Alignment?—0
T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation—0
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models—0
Technical Report: Competition Solution For Modelscope-Sora—0
Advancing Video Quality Assessment for AIGC—0
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way—0
The Art of Storytelling: Multi-Agent Generative AI for Dynamic Multimodal Narratives—0
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation—0
The Lost Melody: Empirical Observations on Text-to-Video Generation From A Storytelling Perspective—0
Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform—0
Towards A Better Metric for Text-to-Video Generation—0
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization—0
BroadWay: Boost Your Text-to-Video Generation Model in a Training-free Way—0
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models—0
T-SVG: Text-Driven Stereoscopic Video Generation—0
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations—0
Tutorial on Diffusion Models for Imaging and Vision—0
Unlearning Concepts from Text-to-Video Diffusion Models—0
VIMI: Grounding Video Generation through Multi-modal Instruction—0
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation—0
A Survey of Emerging Approaches and Advances in Video Generation—0
Zero-Shot Video Editing through Adaptive Sliding Score Distillation—0
Gender Bias in Text-to-Video Generation Models: A case study of Sora—0
Free^2Guide: Gradient-Free Path Integral Control for Enhancing Text-to-Video Generation with Large Vision-Language Models—0
Astraea: A GPU-Oriented Token-wise Acceleration Framework for Video Diffusion Transformers—0
GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration—0
GenTron: Diffusion Transformers for Image and Video Generation—0
GiVE: Guiding Visual Encoder to Perceive Overlooked Information—0
ARTV: Auto-Regressive Text-to-Video Generation with Diffusion Models—0
GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning—0
GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation—0
Grid Diffusion Models for Text-to-Video Generation—0
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models—0
Magic 1-For-1: Generating One Minute Video Clips within One MinuteCode0
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video PromptingCode0
Mobius: A High Efficient Spatial-Temporal Parallel Training Paradigm for Text-to-Video Generation TaskCode0
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPOCode0
Protecting Your Video Content: Disrupting Automated Video-based LLM AnnotationsCode0
Sync-DRAW: Automatic Video Generation using Deep Recurrent Attentive ArchitecturesCode0
Neuro-Symbolic Evaluation of Text-to-Video Models using Formal VerificationCode0
MotionAura: Generating High-Quality and Motion Consistent Videos using Discrete DiffusionCode0
RecTable: Fast Modeling Tabular Data with Rectified FlowCode0
REGIS: Refining Generated Videos via Iterative Stylistic RedesigningCode0
Show:102550
← PrevPage 4 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MagicVideoFVD998—Unverified
2VideoComposerFVD580—Unverified
3ModelScopeT2VFVD550—Unverified
4Show-1FVD538—Unverified
5TF-T2VFVD441—Unverified
6HiGenFVD406—Unverified
7PixelDanceFVD381—Unverified
8VideoPoetFVD213—Unverified
9Video-LaVITFVD188.36—Unverified
10Snap Video (288×288)FVD110.4—Unverified
#ModelMetricClaimedVerifiedStatus
1MagicVideo (Zero-shot, 256x256)FVD16699—Unverified
2Video LDM (Zero-shot, 320x512)FVD16550.61—Unverified
3LAVIE (Zero-shot, 320x512)FVD16526.3—Unverified
4PYoCo (Zero-shot, 64x64)FVD16355.19—Unverified
5VideoPoetFVD16355—Unverified
6Lumiere (Zero-shot, 1024x1024)FVD16332.49—Unverified
7Snap Video (Zero-shot, 288×288)FVD16260.1—Unverified
8W.A.L.T 3BFVD16258.1—Unverified
9PixelDance (Zero-shot, 256x256)FVD16242.82—Unverified
10Snap Video (Zero-shot, 512x288)FVD16200.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoCrafter2Visual Quality54.82—Unverified
2Show-1Visual Quality53.74—Unverified
3VideoCrafter1Visual Quality53.08—Unverified
4LavieVisual Quality52.83—Unverified
5ModelScopeVisual Quality52.47—Unverified
#ModelMetricClaimedVerifiedStatus
1MAGVITFVD79.1—Unverified
2MAGVITFVD28.5—Unverified
#ModelMetricClaimedVerifiedStatus
1NUWA (128×128)Accuracy77.9—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoFactoryFVD292.35—Unverified