SOTAVerified

Talking Head Generation

Talking head generation is the task of generating a talking face from a set of images of a person.

( Image credit: Few-Shot Adversarial Learning of Realistic Neural Talking Head Models )

Papers

Showing 1–50 of 119 papers

TitleStatusHype
MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding—0
Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss FunctionsCode1
Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head GenerationCode1
DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations—0
KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution—0
OmniTalker: Real-Time Text-Driven Talking Head Generation with In-Context Audio-Visual Style Replication—0
Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head GenerationCode3
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis—0
Dual Audio-Centric Modality Coupling for Talking Head Generation—0
Perceptually Accurate 3D Talking Head Generation: New Definitions, Speech-Mesh Representation, and Evaluation Metrics—0
Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation—0
InsTaG: Learning Personalized 3D Talking Head from Few-Second VideoCode2
Dimitra: Audio-driven Diffusion model for Expressive Talking Head Generation—0
VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control—0
UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control—0
Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with AdaptersCode1
VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization—0
GoHD: Gaze-oriented and Highly Disentangled Portrait Animation with Rhythmic Poses and Realistic ExpressionCode1
IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation—0
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion—0
ConsistentAvatar: Learning to Diffuse Fully Consistent Talking Head Avatar with Temporal Guidance—0
Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait SynthesisCode1
LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space—0
DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video GenerationCode3
Beyond Fixed Topologies: Unregistered Training and Comprehensive Evaluation Metrics for 3D Talking HeadsCode2
EmoGene: Audio-Driven Emotional 3D Talking-Head Generation—0
LaDTalk: Latent Denoising for Synthesizing Talking Head Videos with High Frequency Details—0
Learning Frame-Wise Emotion Intensity for Audio-Driven Talking-Head Generation—0
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis—0
DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures—0
EMOdiffhead: Continuously Emotional Control in Talking Head Generation via DiffusionCode0
SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model—0
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation—0
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model—0
Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head Generation—0
GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer—0
MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset—0
NLDF: Neural Light Dynamic Fields for Efficient 3D Talking Head Generation—0
SPEAK: Speech-Driven Pose and Emotion-Adjustable Talking Head Generation—0
NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior—0
Embedded Representation Learning Network for Animating Styled Video Portrait—0
EDTalk: Efficient Disentanglement for Emotional Talking Head Synthesis—0
MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head GenerationCode2
Adaptive Super Resolution For One-Shot Talking-Head GenerationCode2
EmoVOCA: Speech-Driven Emotional 3D Talking HeadsCode1
Style2Talker: High-Resolution Talking Head Generation with Emotion Style and Art Style—0
A Comparative Study of Perceptual Quality Metrics for Audio-driven Talking Head VideosCode1
VectorTalker: SVG Talking Face Generation with Progressive Vectorisation—0
AE-NeRF: Audio Enhanced Neural Radiance Field for Few Shot Talking Head Synthesis—0
DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic ModelsCode3
Show:102550
← PrevPage 1 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Few-shot Adversarial ModelFID48.5—Unverified
2CainGANFID35—Unverified
3Fast Bi-layer Avatars (medium size)CSIM0.65—Unverified
4First Order Motion Model (medium size)CSIM0.64—Unverified
5Few-shot Vid-to-vid (medium size)CSIM0.6—Unverified
#ModelMetricClaimedVerifiedStatus
1X2FaceFID45.8—Unverified
2Few-shot Adversarial ModelFID43—Unverified
#ModelMetricClaimedVerifiedStatus
1X2FaceFID56.5—Unverified
2Few-shot Adversarial ModelFID29.5—Unverified
#ModelMetricClaimedVerifiedStatus
1X2FaceFID51.5—Unverified
2Few-shot Adversarial ModelFID38—Unverified
#ModelMetricClaimedVerifiedStatus
1Few-shot Adversarial ModelFID42.2—Unverified
2CainGANFID24.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Ashok10%12—Unverified
#ModelMetricClaimedVerifiedStatus
1Few-shot Adversarial ModelFID30.6—Unverified