SOTAVerified

Text-to-Video Generation

Ma grand-mère m’a raconté que quand elle était étudiante, elle avait un petit-ami. À l’âge de 18 ans, il a dû partir pour le service militaire, elle ne l’a pas attendu et elle a épousé quelqu’un d’autre. Quand ma grand-mère avait 58-59 ans, un homme (son premier amour) lui a envoyé une demande d’amis sur un réseau social, ils ont commencé à parler... En moins de six mois, ils ont décidé de se voir. Le trajet en train a duré deux jours et ils se sont finalement rencontrés. Cela fait maintenant deux ans qu’ils habitent ensemble et qu’ils nous rendent visite de temps en temps. Je réalise maintenant que leur amour l’un envers l’autre n’a jamais cessé.

Papers

Showing 1–50 of 201 papers

TitleStatusHype
LoViC: Efficient Long Video Generation with Context Compression—0
M4V: Multi-Modal Mamba for Text-to-Video Generation—0
Astraea: A GPU-Oriented Token-wise Acceleration Framework for Video Diffusion Transformers—0
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality EvaluationCode1
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPOCode0
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking—0
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text InterpretationCode1
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models—0
DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization—0
T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation—0
We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback—0
Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform—0
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation—0
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation—0
Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM—0
H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models—0
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization—0
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile DevicesCode2
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models—0
Protecting Your Video Content: Disrupting Automated Video-based LLM AnnotationsCode0
VPO: Aligning Text-to-Video Generation Models with Prompt OptimizationCode1
RecTable: Fast Modeling Tabular Data with Rectified FlowCode0
Can Text-to-Video Generation help Video-Language Alignment?—0
Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance—0
Enabling Versatile Controls for Video Diffusion Models—0
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models—0
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation—0
VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video GenerationCode0
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models—0
RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers—0
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video GenerationCode1
MALT Diffusion: Memory-Augmented Latent Transformers for Any-Length Video Generation—0
CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation—0
Magic 1-For-1: Generating One Minute Video Clips within One MinuteCode0
FlashVideo:Flowing Fidelity to Detail for Efficient High-Resolution Video GenerationCode3
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile DevicesCode2
Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models—0
IPO: Iterative Preference Optimization for Text-to-Video Generation—0
RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation—0
Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion ModelsCode4
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations—0
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning—0
Magic Mirror: ID-Preserved Video Generation in Video Diffusion TransformersCode2
TransPixeler: Advancing Text-to-Video Generation with TransparencyCode4
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way—0
Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception—0
EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation—0
IM-Zero: Instance-level Motion Controllable Video Generation in a Zero-shot Manner—0
STDD: Spatio-Temporal Dual Diffusion for Video Generation—0
Gender Bias in Text-to-Video Generation Models: A case study of Sora—0
Show:102550
← PrevPage 1 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MagicVideoFVD998—Unverified
2VideoComposerFVD580—Unverified
3ModelScopeT2VFVD550—Unverified
4Show-1FVD538—Unverified
5TF-T2VFVD441—Unverified
6HiGenFVD406—Unverified
7PixelDanceFVD381—Unverified
8VideoPoetFVD213—Unverified
9Video-LaVITFVD188.36—Unverified
10Snap Video (288×288)FVD110.4—Unverified
#ModelMetricClaimedVerifiedStatus
1MagicVideo (Zero-shot, 256x256)FVD16699—Unverified
2Video LDM (Zero-shot, 320x512)FVD16550.61—Unverified
3LAVIE (Zero-shot, 320x512)FVD16526.3—Unverified
4PYoCo (Zero-shot, 64x64)FVD16355.19—Unverified
5VideoPoetFVD16355—Unverified
6Lumiere (Zero-shot, 1024x1024)FVD16332.49—Unverified
7Snap Video (Zero-shot, 288×288)FVD16260.1—Unverified
8W.A.L.T 3BFVD16258.1—Unverified
9PixelDance (Zero-shot, 256x256)FVD16242.82—Unverified
10Snap Video (Zero-shot, 512x288)FVD16200.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoCrafter2Visual Quality54.82—Unverified
2Show-1Visual Quality53.74—Unverified
3VideoCrafter1Visual Quality53.08—Unverified
4LavieVisual Quality52.83—Unverified
5ModelScopeVisual Quality52.47—Unverified
#ModelMetricClaimedVerifiedStatus
1MAGVITFVD79.1—Unverified
2MAGVITFVD28.5—Unverified
#ModelMetricClaimedVerifiedStatus
1NUWA (128×128)Accuracy77.9—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoFactoryFVD292.35—Unverified