SOTAVerified

Lipreading

Lipreading is a process of extracting speech by watching lip movements of a speaker in the absence of sound. Humans lipread all the time without even noticing. It is a big part in communication albeit not as dominant as audio. It is a very helpful skill to learn especially for those who are hard of hearing.

Deep Lipreading is the process of extracting speech from a video of a silent talking face using deep neural networks. It is also known by few other names: Visual Speech Recognition (VSR), Machine Lipreading, Automatic Lipreading etc.

The primary methodology involves two stages: i) Extracting visual and temporal features from a sequence of image frames from a silent talking video ii) Processing the sequence of features into units of speech e.g. characters, words, phrases etc. We can find several implementations of this methodology either done in two separate stages or trained end-to-end in one go.

Papers

Showing 1–50 of 103 papers

TitleStatusHype
Learning Speaker-Invariant Visual Features for Lipreading—0
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation—0
OXSeg: Multidimensional attention UNet-based lip segmentation using semi-supervised lip contours—0
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation—0
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation ModelsCode1
Evaluation of End-to-End Continuous Spanish Lipreading in Different Data ConditionsCode0
Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual InputsCode1
RAL:Redundancy-Aware Lipreading Model Based on Differential Learning with Symmetric Views—0
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token SynchronizationCode2
Watch Your Mouth: Silent Speech Recognition with Depth SensingCode1
Audio-Visual Speech Recognition based on Regulated Transformer and Spatio-Temporal Fusion Strategy for Driver Assistive SystemsCode0
Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder—0
Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech ProcessingCode3
Cross-Attention Fusion of Visual and Geometric Features for Large Vocabulary Arabic Lipreading—0
ES3: Evolving Self-Supervised Learning of Robust Audio-Visual Speech Representations—0
Analysis of Visual Features for Continuous Lipreading in Spanish—0
Investigating the dynamics of hand and lips in French Cued Speech using attention mechanisms and CTC-based decoding—0
Audio-Visual Speech Enhancement with Score-Based Generative Models—0
Word-level Persian Lipreading Dataset—0
Auto-AVSR: Audio-Visual Speech Recognition with Automatic LabelsCode2
Conformers are All You Need for Visual Speech Recognition—0
LipLearner: Customizable Silent Speech Interactions on Mobile DevicesCode1
LipFormer: Learning to Lipread Unseen Speakers based on Visual-Landmark Transformers—0
Jointly Learning Visual and Auditory Speech Representations from Raw DataCode1
Relaxed Attention for Transformer Models—0
Training Strategies for Improved Lip-readingCode2
Visual Speech Recognition in a Driver Assistance System—0
Bayesian Neural Network Language Modeling for Speech RecognitionCode0
Towards MOOCs for Lipreading: Using Synthetic Talking Heads to Train Humans in Lipreading at Scale—0
Lip-Listening: Mixing Senses to Understand Lips using Cross Modality Knowledge Distillation for Word-Based Models—0
Is Lip Region-of-Interest Sufficient for Lipreading?—0
Accurate and Resource-Efficient Lipreading with Efficientnetv2 and Transformers—0
Multistream neural architectures for cued-speech recognition using a pre-trained visual feature extractor and constrained CTC decoding—0
Distinguishing Homophenes Using Multi-Head Visual-Audio Memory for Lip ReadingCode1
Self-supervised Transformer for Deepfake Detection—0
Visual Speech Recognition for Multiple Languages in the WildCode2
Leveraging Unimodal Self-Supervised Learning for Multimodal Audio-Visual Speech RecognitionCode1
Learning Contextually Fused Audio-visual Representations for Audio-visual Speech Recognition—0
Learning Audio-Visual Speech Representation by Masked Multimodal Cluster PredictionCode2
Robust Self-Supervised Audio-Visual Speech RecognitionCode2
Personalized One-Shot Lipreading for an ALS Patient—0
Sub-word Level Lip Reading With Visual Attention—0
LRWR: Large-Scale Benchmark for Lip Reading in Russian language—0
Large-vocabulary Audio-visual Speech Recognition in Noisy Environments—0
Sign Language Translation in a Healthcare Setting—0
End-to-end Audio-visual Speech Recognition with ConformersCode1
Part-based Lipreading for Audio-Visual Speech Recognition—0
Lips Don't Lie: A Generalisable and Robust Approach to Face Forgery DetectionCode1
Learn an Effective Lip Reading Model without PainsCode1
FastLR: Non-Autoregressive Lipreading Model with Integrate-and-Fire—0
Show:102550
← PrevPage 1 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Conv-seq2seqWord Error Rate (WER)60.1—Unverified
2CTC + KDWord Error Rate (WER)59.8—Unverified
3TM-seq2seqWord Error Rate (WER)58.9—Unverified
4EG-seq2seqWord Error Rate (WER)57.8—Unverified
5CTC-V2PWord Error Rate (WER)55.1—Unverified
6Hyb + ConformerWord Error Rate (WER)43.3—Unverified
7VTPWord Error Rate (WER)40.6—Unverified
8ES³ BaseWord Error Rate (WER)40.3—Unverified
9ES³ LargeWord Error Rate (WER)37.1—Unverified
10RNN-TWord Error Rate (WER)33.6—Unverified
#ModelMetricClaimedVerifiedStatus
1LIBSWord Error Rate (WER)65.29—Unverified
2TM-CTC + extLMWord Error Rate (WER)54.7—Unverified
3CTC + KD ASRWord Error Rate (WER)53.2—Unverified
4Conv-seq2seqWord Error Rate (WER)51.7—Unverified
5Hybrid CTC / AttentionWord Error Rate (WER)50—Unverified
6LF-MMI TDNNWord Error Rate (WER)48.86—Unverified
7TM-seq2seq + extLMWord Error Rate (WER)48.3—Unverified
8Multi-head Visual-Audio MemoryWord Error Rate (WER)44.5—Unverified
9MoCo + wav2vec (w/o extLM)Word Error Rate (WER)43.2—Unverified
10CTC/AttentionWord Error Rate (WER)32.9—Unverified
#ModelMetricClaimedVerifiedStatus
1SyncVSR (Word Boundary)Top-1 Accuracy95—Unverified
23D Conv + ResNet-18 + DC-TCN + KD (Ensemble & Word Boundary)Top-1 Accuracy94.1—Unverified
3SyncVSRTop-1 Accuracy93.2—Unverified
4AVCRFormerTop-1 Accuracy89.57—Unverified
53D Conv + EfficientNetV2 + Transformer + TCNTop-1 Accuracy89.52—Unverified
6Vosk + MediaPipe + LS + MixUp + SA + 3DResNet-18 + BiLSTM + Cosine WRTop-1 Accuracy88.7—Unverified
73D Conv + ResNet-18 + MS-TCN + Multi-Head Visual-Audio MemoryTop-1 Accuracy88.5—Unverified
83D Conv + ResNet-18 + MS-TCN + KD (Ensemble)Top-1 Accuracy88.5—Unverified
93D-ResNet + Bi-GRU + MixUp + Label Smoothing + Cosine LR (Word Boundary)Top-1 Accuracy88.4—Unverified
103D-ResNet + Bi-GRU + MixUp + Label Smoothing + Cosine LRTop-1 Accuracy85.5—Unverified
#ModelMetricClaimedVerifiedStatus
1SyncVSR (Word Boundary)Top-1 Accuracy58.2—Unverified
23D-ResNet + Bi-GRU + MixUp + Label Smooth + Cosine LR (Word Boundary)Top-1 Accuracy55.7—Unverified
33D Conv + ResNet-18 + MS-TCN + Multi-Head Visual-Audio MemoryTop-1 Accuracy53.8—Unverified
43D Conv + ResNet-18 + Bi-GRU + Visual-Audio MemoryTop-1 Accuracy50.82—Unverified
53D-ResNet + Bi-GRU + MixUp + Label Smooth + Cosine LRTop-1 Accuracy48.3—Unverified
63D Conv + ResNet-18 + Bi-GRU (Face Cutout)Top-1 Accuracy45.24—Unverified
7DFTNTop-1 Accuracy41.93—Unverified
8GLMIMTop-1 Accuracy38.79—Unverified
9PCPGTop-1 Accuracy38.7—Unverified
#ModelMetricClaimedVerifiedStatus
1WASCER38.93—Unverified
2LipCH-NetCER34.07—Unverified
3CSSMCMCER32.48—Unverified
4LIBSCER31.27—Unverified
5CTC/AttentionCER9.1—Unverified
#ModelMetricClaimedVerifiedStatus
1LipNetWord Error Rate (WER)4.6—Unverified
2WASWord Error Rate (WER)3—Unverified
3LCANetWord Error Rate (WER)2.9—Unverified
4LipNet (with Face Cutout)Word Error Rate (WER)2.9—Unverified
5CTC/AttentionWord Error Rate (WER)1.2—Unverified
#ModelMetricClaimedVerifiedStatus
13D Conv + ResNet-18 + MS-TCNTop-1 Accuracy41.4—Unverified
23D Conv + ResNet-34 + Bi-GRUTop-1 Accuracy38.19—Unverified
3DenseNet3D + Bi-GRUTop-1 Accuracy34.76—Unverified
4Multi-Tower LSTM-5Top-1 Accuracy25.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ES³ Base*Word Error Rate (WER)55.6—Unverified