SOTAVerified

Talking Face Generation

Talking face generation aims to synthesize a sequence of face images that correspond to given speech semantics

( Image credit: Talking Face Generation by Adversarially Disentangled Audio-Visual Representation )

Papers

Showing 76–100 of 110 papers

TitleStatusHype
CPNet: Exploiting CLIP-based Attention Condenser and Probability Map Guidance for High-fidelity Talking Face Generation—0
Cut Inner Layers: A Structured Pruning Strategy for Efficient U-Net GANs—0
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder—0
Diffused Heads: Diffusion Models Beat GANs on Talking-Face Generation—0
DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model—0
DREAM-Talk: Diffusion-based Realistic Emotional Audio-driven Method for Single Image Talking Face Generation—0
EAMM: One-Shot Emotional Talking Face via Audio-Based Emotion-Aware Motion Model—0
EMMN: Emotional Motion Memory Network for Audio-driven Emotional Talking Face Generation—0
EmoSpeaker: One-shot Fine-grained Emotion-Controlled Talking Face Generation—0
EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model—0
Emotional Conversation: Empowering Talking Faces with Cohesive Expression, Gaze and Pose Generation—0
Emotional Talking Faces: Making Videos More Expressive and Realistic—0
Emotion-Controllable Generalized Talking Face Generation—0
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation—0
Faces that Speak: Jointly Synthesising Talking Face and Speech from Text—0
FlowVQTalker: High-Quality Emotional Talking Face Generation through Normalizing Flow and Quantization—0
FT2TF: First-Person Statement Text-To-Talking Face Generation—0
FTFDNet: Learning to Detect Talking Face Video Manipulation with Tri-Modality Interaction—0
G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment—0
GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation—0
GLCF: A Global-Local Multimodal Coherence Analysis Framework for Talking Face Generation Detection—0
GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting—0
Hierarchical Cross-Modal Talking Face Generation With Dynamic Pixel-Wise Loss—0
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model—0
High-fidelity Generalized Emotional Talking Face Generation with Multi-modal Emotion Space Learning—0
Show:102550
← PrevPage 4 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1EmoGenEmoAcc83.2—Unverified
#ModelMetricClaimedVerifiedStatus
1LipGANLMD0.6—Unverified