Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1301–1350 of 6433 papers

Title	Date	Tasks	Status
A Complementary Joint Training Approach Using Unpaired Speech and Text for Low-Resource Automatic Speech Recognition	Apr 5, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Broadcast News Corpus for Evaluation and Tuning of German LVCSR Systems	Dec 15, 2014	Decoderspeech-recognition	—Unverified
BBS-KWS:The Mandarin Keyword Spotting System Won the Video Keyword Wakeup Challenge	Dec 3, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
BayesSpeech: A Bayesian Transformer Network for Automatic Speech Recognition	Jan 16, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bayes Risk Transducer: Transducer with Controllable Alignment Prediction	Aug 19, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bayesian Transformer Language Models for Speech Recognition	Feb 9, 2021	speech-recognitionSpeech Recognition	—Unverified
An End-to-End Mispronunciation Detection System for L2 English Speech Leveraging Novel Anti-Phone Modeling	May 25, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bayesian Reordering Model with Feature Selection	Jun 1, 2014	feature selectionMachine Translation	—Unverified
An End-to-end Architecture of Online Multi-channel Speech Separation	Sep 7, 2020	speech-recognitionSpeech Recognition	—Unverified
Bayesian Non-Homogeneous Markov Models via Polya-Gamma Data Augmentation with Applications to Rainfall Modeling	Jan 11, 2017	Data Augmentationspeech-recognition	—Unverified
Bayesian Neural Networks: An Introduction and Survey	Jun 22, 2020	BIG-bench Machine Learningregression	—Unverified
An Empirical Study of Language Model Integration for Transducer based Speech Recognition	Mar 31, 2022	Language ModelingLanguage Modelling	—Unverified
A Deep Dive into Deep Cluster	Jul 24, 2022	Clusteringspeech-recognition	—Unverified
A Comparison of Transformer, Convolutional, and Recurrent Neural Networks on Phoneme Recognition	Oct 1, 2022	Phoneme Recognitionspeech-recognition	—Unverified
Bayesian Learning of LF-MMI Trained Time Delay Neural Networks for Speech Recognition	Dec 8, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
An Empirical Study of Efficient ASR Rescoring with Transformers	Oct 24, 2019	Knowledge DistillationLanguage Modeling	—Unverified
Bayesian Language Model based on Mixture of Segmental Contexts for Spontaneous Utterances with Unexpected Words	Dec 1, 2016	Automatic Speech Recognition (ASR)Language Modeling	—Unverified
An Empirical Study of Automatic Chinese Word Segmentation for Spoken Language Understanding and Named Entity Recognition	Jun 1, 2016	Automatic Speech Recognition (ASR)Chinese Word Segmentation	—Unverified
A Decidability-Based Loss Function	Sep 12, 2021	Face Recognitionspeech-recognition	—Unverified
Batch Normalized Recurrent Neural Networks	Oct 5, 2015	Language Modellingspeech-recognition	—Unverified
Batch-normalized joint training for DNN-based distant speech recognition	Mar 24, 2017	Distant Speech RecognitionSpeech Enhancement	—Unverified
An empirical assessment of deep learning approaches to task-oriented dialog management	Aug 7, 2021	Managementspeech-recognition	—Unverified
Batched Low-Rank Adaptation of Foundation Models	Dec 9, 2023	Code Generationspeech-recognition	—Unverified
BAT: Boundary aware transducer for memory-efficient and low-latency ASR	May 19, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
An Empirical Analysis of Deep Audio-Visual Models for Speech Recognition	Dec 21, 2018	Lip ReadingSensitivity	—Unverified
A Comparison of Temporal Encoders for Neuromorphic Keyword Spotting with Few Neurons	Jan 24, 2023	Binary ClassificationKeyword Spotting	—Unverified
A brief history of AI: how to prevent another winter (a critical review)	Sep 3, 2021	speech-recognitionSpeech Recognition	—Unverified
Self-Supervised Learning for Multi-Channel Neural Transducer	Aug 6, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Basque Speecon-like and Basque SpeechDat MDB-600: speech databases for the development of ASR technology for Basque	May 1, 2014	speech-recognitionSpeech Recognition	—Unverified
BA-SOT: Boundary-Aware Serialized Output Training for Multi-Talker ASR	May 23, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
BART based semantic correction for Mandarin automatic speech recognition system	Mar 26, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
An efficient text augmentation approach for contextualized Mandarin speech recognition	Jun 14, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Additional Shared Decoder on Siamese Multi-view Encoders for Learning Acoustic Word Embeddings	Oct 1, 2019	Decoderspeech-recognition	—Unverified
BANSpEmo: A Bangla Emotional Speech Recognition Dataset	Dec 21, 2023	speech-recognitionSpeech Recognition	—Unverified
Bangla-Wave: Improving Bangla Automatic Speech Recognition Utilizing N-gram Language Models	Sep 13, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
An Efficient Self-Learning Framework For Interactive Spoken Dialog Systems	Sep 16, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech	Mar 20, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bangla Natural Language Processing: A Comprehensive Analysis of Classical, Machine Learning, and Deep Learning Based Methods	May 31, 2021	ArticlesBIG-bench Machine Learning	—Unverified
An efficient and perceptually motivated auditory neural encoding and decoding algorithm for spiking neural networks	Sep 3, 2019	Benchmarkingspeech-recognition	—Unverified
Adding Connectionist Temporal Summarization into Conformer to Improve Its Decoder Efficiency For Speech Recognition	Apr 8, 2022	Decoderspeech-recognition	—Unverified
An Efficient and Effective Online Sentence Segmenter for Simultaneous Interpretation	Dec 1, 2016	Automatic Speech Recognition (ASR)Machine Translation	—Unverified
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM	Feb 24, 2025	Automatic Speech RecognitionLanguage Modeling	—Unverified
Back-Translation-Style Data Augmentation for End-to-End ASR	Jul 28, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
AdaTranS: Adapting with Boundary-based Shrinking for End-to-End Speech Translation	Dec 17, 2022	Machine Translationspeech-recognition	—Unverified
An Effective Training Framework for Light-Weight Automatic Speech Recognition Models	May 22, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Back from the future: bidirectional CTC decoding using future information in speech recognition	Oct 7, 2021	Language ModelingLanguage Modelling	—Unverified
An Effective, Performant Named Entity Recognition System for Noisy Business Telephone Conversation Transcripts	Sep 27, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A comparison of streaming models and data augmentation methods for robust speech recognition	Nov 19, 2021	Data AugmentationRobust Speech Recognition	—Unverified
A Bilingual Interactive Human Avatar Dialogue System	Jul 1, 2018	Answer SelectionAutomatic Speech Recognition (ASR)	—Unverified
Babler - Data Collection from the Web to Support Speech Recognition and Keyword Search	Aug 1, 2016	Automatic Speech Recognition (ASR)Language Identification	—Unverified

Show:10 25 50

← PrevPage 27 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified