Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4001–4050 of 6433 papers

Title	Date	Tasks	Status
Language Modeling with Deep Transformers	May 10, 2019	DecoderLanguage Modeling	—Unverified
Language Modeling with Functional Head Constraint for Code Switching Speech Recognition	Oct 1, 2014	Language IdentificationLanguage Modeling	—Unverified
Language Modeling with Highway LSTM	Sep 19, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Language modeling with Neural trans-dimensional random fields	Jul 23, 2017	Language ModelingLanguage Modelling	—Unverified
Language model integration based on memory control for sequence to sequence speech recognition	Nov 6, 2018	Language ModelingLanguage Modelling	—Unverified
Language Models of Spoken Dutch	Sep 12, 2017	Language ModelingLanguage Modelling	—Unverified
Language Recognition using Time Delay Deep Neural Network	Apr 13, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically	May 26, 2025	Retrievalspeech-recognition	—Unverified
Language-specific Characteristic Assistance for Code-switching Speech Recognition	Jun 29, 2022	speech-recognitionSpeech Recognition	—Unverified
Language-specific Effects on Automatic Speech Recognition Errors for World Englishes	Oct 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Language technology practitioners as language managers: arbitrating data bias and predictive bias in ASR	Feb 25, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Language-universal phonetic encoder for low-resource speech recognition	May 19, 2023	Decoderspeech-recognition	—Unverified
Language-Universal Phonetic Representation in Multilingual Speech Pretraining for Low-Resource Speech Recognition	May 19, 2023	DiversitySelf-Supervised Learning	—Unverified
LanSER: Language-Model Supported Speech Emotion Recognition	Sep 7, 2023	Automatic Speech RecognitionEmotion Recognition	—Unverified
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation	Sep 13, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large Corpus of Czech Parliament Plenary Hearings	May 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition	Sep 15, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large Language Models based ASR Error Correction for Child Conversations	May 22, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large Language Models for Dysfluency Detection in Stuttered Speech	Jun 16, 2024	Automatic Speech RecognitionLanguage Modeling	—Unverified
Large Language Models for Education: A Survey	May 12, 2024	Autonomous Drivingspeech-recognition	—Unverified
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction	Sep 20, 2024	Automatic Speech RecognitionLanguage Modeling	—Unverified
Large Linguistic Corpus Reduction with SCP Algorithms	Sep 1, 2015	Speech Recognition	—Unverified
Large Margin Neural Language Model	Aug 27, 2018	Language ModelingLanguage Modelling	—Unverified
Large, Pruned or Continuous Space Language Models on a GPU for Statistical Machine Translation	Jun 1, 2012	GPULanguage Modelling	—Unverified
Large-scale discriminative language model reranking for voice-search	Jun 1, 2012	Language ModelingLanguage Modelling	—Unverified
Large Scale Distributed Deep Networks	Dec 1, 2012	CPUObject Recognition	—Unverified
Large-Scale Domain Adaptation via Teacher-Student Learning	Aug 17, 2017	Domain Adaptationspeech-recognition	—Unverified
Large scale evaluation of importance maps in automatic speech recognition	May 21, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large-scale Language Model Rescoring on Long-form Data	Jun 13, 2023	FormLanguage Modeling	—Unverified
Large-Scale Mixed-Bandwidth Deep Neural Network Acoustic Modeling for Automatic Speech Recognition	Jul 10, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large Scale Multi-Domain Multi-Task Learning with MultiModel	Jan 1, 2018	Image Captioningimage-classification	—Unverified
Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model	Sep 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone	Mar 31, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large-scale Reordering Model for Statistical Machine Translation using Dual Multinomial Logistic Regression	Oct 1, 2014	Machine Translationregression	—Unverified
Large-Scale Syntactic Language Modeling with Treelets	Jul 1, 2012	Language ModelingLanguage Modelling	—Unverified
Large-scale Transfer Learning for Low-resource Spoken Language Understanding	Aug 13, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large-scale unsupervised audio pre-training for video-to-speech synthesis	Jun 27, 2023	speech-recognitionSpeech Recognition	—Unverified
Large-Scale Visual Speech Recognition	Jul 13, 2018	DecoderLipreading	—Unverified
Large scale weakly and semi-supervised learning for low-resource video ASR	May 16, 2020	Decoderspeech-recognition	—Unverified
Large-vocabulary Audio-visual Speech Recognition in Noisy Environments	Sep 10, 2021	Audio-Visual Speech RecognitionLipreading	—Unverified
Large Vocabulary Read Speech Corpora for Four Ethiopian Languages: Amharic, Tigrigna, Oromo and Wolaytta	May 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large Vocabulary Read Speech Corpora for Four Ethiopian Languages: Amharic, Tigrigna, Oromo, and Wolaytta	Jul 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large vocabulary speech recognition for languages of Africa: multilingual modeling and self-supervised learning	Aug 5, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Large Vocabulary Spontaneous Speech Recognition for Tigrigna	Oct 15, 2023	Automatic Speech RecognitionLanguage Modeling	—Unverified
Late fusion ensembles for speech recognition on diverse input audio representations	Dec 1, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Latency-Controlled Neural Architecture Search for Streaming Speech Recognition	May 8, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Latent Dirichlet Allocation Based Organisation of Broadcast Media Archives for Deep Neural Network Adaptation	Nov 16, 2015	Acoustic ModellingAutomatic Speech Recognition	—Unverified
Latent Dirichlet Allocation Based Acoustic Data Selection for Automatic Speech Recognition	Jul 2, 2019	2kAutomatic Speech Recognition	—Unverified
Latent Phrase Matching for Dysarthric Speech	Jun 8, 2023	speech-recognitionSpeech Recognition	—Unverified
Latent Sequence Decompositions	Oct 10, 2016	speech-recognitionSpeech Recognition	—Unverified

Show:10 25 50

← PrevPage 81 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified