SOTAVerified

Talking Head Generation

Talking head generation is the task of generating a talking face from a set of images of a person.

( Image credit: Few-Shot Adversarial Learning of Realistic Neural Talking Head Models )

Papers

Showing 51–75 of 119 papers

TitleStatusHype
Text-to-Video: a Two-stage Framework for Zero-shot Identity-agnostic Talking-head GenerationCode0
Speaker Independent and Multilingual/Mixlingual Speech-Driven Talking Head Generation Using Phonetic Posteriorgrams—0
Style2Talker: High-Resolution Talking Head Generation with Emotion Style and Art Style—0
StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation—0
SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model—0
Synthesizing Photorealistic Virtual Humans Through Cross-modal Disentanglement—0
TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles—0
Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion—0
Talking Head Generation with Audio and Speech Related Facial Action Units—0
Talking Head Generation with Probabilistic Audio-to-Visual Diffusion Priors—0
Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation—0
Towards Realistic Visual Dubbing with Heterogeneous Sources—0
UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control—0
VectorTalker: SVG Talking Face Generation with Progressive Vectorisation—0
VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control—0
VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior—0
VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization—0
Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head Generation—0
X2Face: A network for controlling face generation using images, audio, and pose codes—0
GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer—0
3D-TalkEmo: Learning to Synthesize 3D Emotional Talking Head—0
AE-NeRF: Audio Enhanced Neural Radiance Field for Few Shot Talking Head Synthesis—0
Animating Face using Disentangled Audio Representations—0
AnyoneNet: Synchronized Speech and Talking Head Generation for Arbitrary Person—0
EmoGene: Audio-Driven Emotional 3D Talking-Head Generation—0
Show:102550
← PrevPage 3 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Few-shot Adversarial ModelFID48.5—Unverified
2CainGANFID35—Unverified
3Fast Bi-layer Avatars (medium size)CSIM0.65—Unverified
4First Order Motion Model (medium size)CSIM0.64—Unverified
5Few-shot Vid-to-vid (medium size)CSIM0.6—Unverified
#ModelMetricClaimedVerifiedStatus
1X2FaceFID45.8—Unverified
2Few-shot Adversarial ModelFID43—Unverified
#ModelMetricClaimedVerifiedStatus
1X2FaceFID56.5—Unverified
2Few-shot Adversarial ModelFID29.5—Unverified
#ModelMetricClaimedVerifiedStatus
1X2FaceFID51.5—Unverified
2Few-shot Adversarial ModelFID38—Unverified
#ModelMetricClaimedVerifiedStatus
1Few-shot Adversarial ModelFID42.2—Unverified
2CainGANFID24.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Ashok10%12—Unverified
#ModelMetricClaimedVerifiedStatus
1Few-shot Adversarial ModelFID30.6—Unverified