Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2751–2800 of 6433 papers

Title	Date	Tasks	Status
Insights on Neural Representations for End-to-End Speech Recognition	May 19, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Minimising Biasing Word Errors for Contextual ASR with the Tree-Constrained Pointer Generator	May 18, 2022	Dialogue State TrackingLanguage Modelling	—Unverified
Deploying self-supervised learning in the wild for hybrid automatic speech recognition	May 17, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Streaming Noise Context Aware Enhancement For Automatic Speech Recognition in Multi-Talker Environments	May 17, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Accented Speech Recognition: Benchmarking, Pre-training, and Diverse Data	May 16, 2022	Accented Speech RecognitionBenchmarking	—Unverified
Pretraining Approaches for Spoken Language Recognition: TalTech Submission to the OLR 2021 Challenge	May 14, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improved Consistency Training for Semi-Supervised Sequence-to-Sequence ASR via Speech Chain Reconstruction and Self-Transcribing	May 14, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Unified Modeling of Multi-Domain Multi-Device ASR Systems	May 13, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Who Are We Talking About? Handling Person Names in Speech Translation	May 13, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition	May 13, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Closer Look at Audio-Visual Multi-Person Speech Recognition and Active Speaker Selection	May 11, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
End-to-End Multi-Person Audio/Visual Automatic Speech Recognition	May 11, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improved Meta Learning for Low Resource Speech Recognition	May 11, 2022	Meta-Learningspeech-recognition	—Unverified
Separator-Transducer-Segmenter: Streaming Recognition and Segmentation of Multi-party Speech	May 10, 2022	Segmentationspeech-recognition	—Unverified
Best of Both Worlds: Multi-task Audio-Visual Automatic Speech Recognition and Active Speaker Detection	May 10, 2022	Active Speaker DetectionAutomatic Speech Recognition	—Unverified
Speaker Reinforcement Using Target Source Extraction for Robust Automatic Speech Recognition	May 9, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Highly Adaptive Acoustic Model for Accurate Multi-Dialect Speech Recognition	May 6, 2022	speech-recognitionSpeech Recognition	—Unverified
Online Model Compression for Federated Learning with Large Models	May 6, 2022	Federated LearningModel Compression	—Unverified
Hearing voices at the National Library -- a speech corpus and acoustic model for the Swedish language	May 6, 2022	speech-recognitionSpeech Recognition	—Unverified
A Conformer-based Waveform-domain Neural Acoustic Echo Canceller Optimized for ASR Accuracy	May 6, 2022	Acoustic echo cancellationAutomatic Speech Recognition	—Unverified
Design of a novel Korean learning application for efficient pronunciation correction	May 4, 2022	Sentencespeech-recognition	—Unverified
ON-TRAC Consortium Systems for the IWSLT 2022 Dialect and Low-resource Speech Translation Tasks	May 4, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
On monoaural speech enhancement for automatic recognition of real noisy speech using mixture invariant training	May 3, 2022	Robust Speech RecognitionSpeech Enhancement	—Unverified
A Meeting Transcription System for an Ad-Hoc Acoustic Sensor Network	May 2, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Novel Speech-Driven Lip-Sync Model with CNN and LSTM	May 2, 2022	Face Modelspeech-recognition	—Unverified
Self-supervised Semantic-driven Phoneme Discovery for Zero-resource Speech Recognition	May 1, 2022	Phoneme RecognitionRepresentation Learning	—Unverified
Discourse on ASR Measurement: Introducing the ARPOCA Assessment Tool	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Automatic Speech Recognition and Query By Example for Creole Languages Documentation	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
JHU IWSLT 2022 Dialect Speech Translation System Description	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Corpus Development of Kiswahili Speech Recognition Test and Evaluation sets, Preemptively Mitigating Demographic Bias Through Collaboration with Linguists	May 1, 2022	Diversityspeech-recognition	—Unverified
Phoneme transcription of endangered languages: an evaluation of recent ASR architectures in the single speaker scenario	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
NVIDIA NeMo Offline Speech Translation Systems for IWSLT 2022	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
SSNCSE_NLP@LT-EDI-ACL2022: Speech Recognition for Vulnerable Individuals in Tamil using pre-trained XLSR models	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CMU’s IWSLT 2022 Dialect Speech Translation System	May 1, 2022	DecoderKnowledge Distillation	—Unverified
Fine-tuning pre-trained models for Automatic Speech Recognition, experiments on a fieldwork corpus of Japhug (Trans-Himalayan family)	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Findings of the Shared Task on Speech Recognition for Vulnerable Individuals in Tamil	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Multimodal fusion via cortical network inspired losses	May 1, 2022	Emotion RecognitionImage Description	—Unverified
MTL-SLT: Multi-Task Learning for Spoken Language Tasks	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
How You Say It Matters: Measuring the Impact of Verbal Disfluency Tags on Automated Dementia Detection	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
SUH_ASR@LT-EDI-ACL2022: Transformer based Approach for Speech Recognition for Vulnerable Individuals in Tamil	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Enhancing Documentation of Hupa with Automatic Speech Recognition	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The Xiaomi Text-to-Text Simultaneous Speech Translation System for IWSLT 2022	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bilingual End-to-End ASR with Byte-Level Subwords	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The HW-TSC’s Offline Speech Translation System for IWSLT 2022 Evaluation	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition?	Apr 27, 2022	Self-Supervised LearningSpeaker Recognition	—Unverified
Mask scalar prediction for improving robust automatic speech recognition	Apr 26, 2022	Acoustic echo cancellationAutomatic Speech Recognition	—Unverified
Supervised Attention in Sequence-to-Sequence Models for Speech Recognition	Apr 25, 2022	speech-recognitionSpeech Recognition	—Unverified
Cleanformer: A multichannel array configuration-invariant neural enhancement frontend for ASR in smart speakers	Apr 25, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Enable Deep Learning on Mobile Devices: Methods, Systems, and Applications	Apr 25, 2022	AutoMLDeep Learning	—Unverified
Improved far-field speech recognition using Joint Variational Autoencoder	Apr 24, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 56 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified