SOTAVerified

Lipreading

Lipreading is a process of extracting speech by watching lip movements of a speaker in the absence of sound. Humans lipread all the time without even noticing. It is a big part in communication albeit not as dominant as audio. It is a very helpful skill to learn especially for those who are hard of hearing.

Deep Lipreading is the process of extracting speech from a video of a silent talking face using deep neural networks. It is also known by few other names: Visual Speech Recognition (VSR), Machine Lipreading, Automatic Lipreading etc.

The primary methodology involves two stages: i) Extracting visual and temporal features from a sequence of image frames from a silent talking video ii) Processing the sequence of features into units of speech e.g. characters, words, phrases etc. We can find several implementations of this methodology either done in two separate stages or trained end-to-end in one go.

Papers

Showing 51–100 of 103 papers

TitleStatusHype
Towards Practical Lipreading with Distilled and Efficient ModelsCode1
SpotFast Networks with Memory Augmented Lateral Transformers for LipreadingCode0
Audio-visual Multi-channel Recognition of Overlapped Speech—0
Discriminative Multi-modality Speech RecognitionCode1
Mutual Information Maximization for Effective Lip ReadingCode1
Deformation Flow Based Two-Stream Network for Lip ReadingCode1
Pseudo-Convolutional Policy Gradient for Sequence-to-Sequence Lip-Reading—0
Can We Read Speech Beyond the Lips? Rethinking RoI Selection for Deep Visual Speech RecognitionCode1
Lipreading using Temporal Convolutional NetworksCode1
Audio-visual Recognition of Overlapped speech for the LRS2 dataset—0
ASR is all you need: cross-modal distillation for lip reading—0
Hearing Lips: Improving Lip Reading by Distilling Speech Recognizers—0
Recurrent Neural Network Transducer for Audio-Visual Speech RecognitionCode0
Spatio-Temporal Fusion Based Convolutional Sequence Learning for Lip Reading—0
Alternative Visual Units for an Optimized Phoneme-Based Lipreading System—0
Multi-Grained Spatio-temporal Modeling for Lip-reading—0
A Cascade Sequence-to-Sequence Model for Chinese Mandarin Lip Reading—0
Lipper: Synthesizing Thy Speech using Multi-View Lipreading—0
LipReading with 3D-2D-CNN BLSTM-HMM and word-CTC models—0
Multi-Task Learning for Audio Visual Active Speaker Detection—0
Learning Spatio-Temporal Features with Two-Stream Deep 3D CNNs for Lipreading—0
Learning from Videos with Deep Convolutional LSTM Networks—0
On the Importance of Video Action Recognition for Visual Lipreading—0
Pushing the boundaries of audiovisual word recognition using Residual Networks and LSTMs—0
The speaker-independent lipreading play-off; a survey of lipreading machines—0
LRW-1000: A Naturally-Distributed Large-Scale Benchmark for Lip Reading in the WildCode0
3D Feature Pyramid Attention Module for Robust Visual Speech Recognition—0
Audio-Visual Speech Recognition With A Hybrid CTC/Attention Architecture—0
Visual Speech Language Models—0
Deep Audio-Visual Speech RecognitionCode1
Large-Scale Visual Speech Recognition—0
Towards Lipreading Sentences with Active Appearance Models—0
Can DNNs Learn to Lipread Full Sentences?—0
Comparing heterogeneous visual gestures for measuring the diversity of visual speech signals—0
Comparing phonemes and visemes with DNN-based lipreading—0
End-to-end Audiovisual Speech RecognitionCode0
Visual Speech Enhancement—0
Deep word embeddings for visual speech recognitionCode0
Decoding visemes: improving machine lipreading—0
Decoding visemes: improving machine lipreading—0
Understanding the visual speech signal—0
Visual gesture variability between talkers in continuous visual speech—0
Visual speech recognition: aligning terminologies for better understanding—0
End-to-End Multi-View Lipreading—0
Improving Speaker-Independent Lipreading with Domain-Adversarial Training—0
Combining Residual Networks with LSTMs for LipreadingCode0
Auxiliary Multimodal LSTM for Audio-visual Speech Recognition and Lipreading—0
Lip Reading Sentences in the Wild—0
LipNet: End-to-End Sentence-level LipreadingCode1
Lipreading with Long Short-Term Memory—0
Show:102550
← PrevPage 2 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Conv-seq2seqWord Error Rate (WER)60.1—Unverified
2CTC + KDWord Error Rate (WER)59.8—Unverified
3TM-seq2seqWord Error Rate (WER)58.9—Unverified
4EG-seq2seqWord Error Rate (WER)57.8—Unverified
5CTC-V2PWord Error Rate (WER)55.1—Unverified
6Hyb + ConformerWord Error Rate (WER)43.3—Unverified
7VTPWord Error Rate (WER)40.6—Unverified
8ES³ BaseWord Error Rate (WER)40.3—Unverified
9ES³ LargeWord Error Rate (WER)37.1—Unverified
10RNN-TWord Error Rate (WER)33.6—Unverified
#ModelMetricClaimedVerifiedStatus
1LIBSWord Error Rate (WER)65.29—Unverified
2TM-CTC + extLMWord Error Rate (WER)54.7—Unverified
3CTC + KD ASRWord Error Rate (WER)53.2—Unverified
4Conv-seq2seqWord Error Rate (WER)51.7—Unverified
5Hybrid CTC / AttentionWord Error Rate (WER)50—Unverified
6LF-MMI TDNNWord Error Rate (WER)48.86—Unverified
7TM-seq2seq + extLMWord Error Rate (WER)48.3—Unverified
8Multi-head Visual-Audio MemoryWord Error Rate (WER)44.5—Unverified
9MoCo + wav2vec (w/o extLM)Word Error Rate (WER)43.2—Unverified
10CTC/AttentionWord Error Rate (WER)32.9—Unverified
#ModelMetricClaimedVerifiedStatus
1SyncVSR (Word Boundary)Top-1 Accuracy95—Unverified
23D Conv + ResNet-18 + DC-TCN + KD (Ensemble & Word Boundary)Top-1 Accuracy94.1—Unverified
3SyncVSRTop-1 Accuracy93.2—Unverified
4AVCRFormerTop-1 Accuracy89.57—Unverified
53D Conv + EfficientNetV2 + Transformer + TCNTop-1 Accuracy89.52—Unverified
6Vosk + MediaPipe + LS + MixUp + SA + 3DResNet-18 + BiLSTM + Cosine WRTop-1 Accuracy88.7—Unverified
73D Conv + ResNet-18 + MS-TCN + Multi-Head Visual-Audio MemoryTop-1 Accuracy88.5—Unverified
83D Conv + ResNet-18 + MS-TCN + KD (Ensemble)Top-1 Accuracy88.5—Unverified
93D-ResNet + Bi-GRU + MixUp + Label Smoothing + Cosine LR (Word Boundary)Top-1 Accuracy88.4—Unverified
103D-ResNet + Bi-GRU + MixUp + Label Smoothing + Cosine LRTop-1 Accuracy85.5—Unverified
#ModelMetricClaimedVerifiedStatus
1SyncVSR (Word Boundary)Top-1 Accuracy58.2—Unverified
23D-ResNet + Bi-GRU + MixUp + Label Smooth + Cosine LR (Word Boundary)Top-1 Accuracy55.7—Unverified
33D Conv + ResNet-18 + MS-TCN + Multi-Head Visual-Audio MemoryTop-1 Accuracy53.8—Unverified
43D Conv + ResNet-18 + Bi-GRU + Visual-Audio MemoryTop-1 Accuracy50.82—Unverified
53D-ResNet + Bi-GRU + MixUp + Label Smooth + Cosine LRTop-1 Accuracy48.3—Unverified
63D Conv + ResNet-18 + Bi-GRU (Face Cutout)Top-1 Accuracy45.24—Unverified
7DFTNTop-1 Accuracy41.93—Unverified
8GLMIMTop-1 Accuracy38.79—Unverified
9PCPGTop-1 Accuracy38.7—Unverified
#ModelMetricClaimedVerifiedStatus
1WASCER38.93—Unverified
2LipCH-NetCER34.07—Unverified
3CSSMCMCER32.48—Unverified
4LIBSCER31.27—Unverified
5CTC/AttentionCER9.1—Unverified
#ModelMetricClaimedVerifiedStatus
1LipNetWord Error Rate (WER)4.6—Unverified
2WASWord Error Rate (WER)3—Unverified
3LCANetWord Error Rate (WER)2.9—Unverified
4LipNet (with Face Cutout)Word Error Rate (WER)2.9—Unverified
5CTC/AttentionWord Error Rate (WER)1.2—Unverified
#ModelMetricClaimedVerifiedStatus
13D Conv + ResNet-18 + MS-TCNTop-1 Accuracy41.4—Unverified
23D Conv + ResNet-34 + Bi-GRUTop-1 Accuracy38.19—Unverified
3DenseNet3D + Bi-GRUTop-1 Accuracy34.76—Unverified
4Multi-Tower LSTM-5Top-1 Accuracy25.76—Unverified
#ModelMetricClaimedVerifiedStatus
1ES³ Base*Word Error Rate (WER)55.6—Unverified