SOTAVerified

Visual Speech Recognition

Papers

Showing 1–25 of 182 papers

TitleStatusHype
VisualSpeaker: Visually-Guided 3D Avatar Lip Synthesis—0
ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition—0
Cocktail-Party Audio-Visual Speech Recognition—0
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing—0
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge—0
Transfer Learning from Visual Speech Recognition to Mouthing Recognition in German Sign LanguageCode0
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach—0
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition—0
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer—0
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative SynchronizationCode2
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides—0
Visual-Aware Speech Recognition for Noisy Scenarios—0
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech TokensCode1
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs—0
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech RepresentationsCode1
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing—0
MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition—0
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation ModelsCode1
Lightweight Operations for Visual Speech Recognition—0
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech RecognitionCode3
Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models—0
Evaluation of End-to-End Continuous Spanish Lipreading in Different Data ConditionsCode0
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech RepresentationCode1
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition—0
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech RecognitionCode0
Show:102550
← PrevPage 1 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1VTP with more dataWord Error Rate (WER)30.7—Unverified
2CTC/AttentionWord Error Rate (WER)19.1—Unverified
#ModelMetricClaimedVerifiedStatus
1VTP with more dataWord Error Rate (WER)22.6—Unverified