Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2751–2800 of 6433 papers

Title	Date	Tasks	Status
Fast, simple and accurate handwritten digit classification by training shallow neural network classifiers with the 'extreme learning machine' algorithm	Dec 29, 2014	General Classificationspeech-recognition	—Unverified
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation	Jun 2, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HESITA(te) in Portuguese	May 1, 2014	Acoustic ModellingAutomatic Speech Recognition	—Unverified
Heterogeneous Language Model Optimization in Automatic Speech Recognition	Nov 16, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Heterogeneous Reservoir Computing Models for Persian Speech Recognition	May 25, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hey ASR System! Why Aren't You More Inclusive? Automatic Speech Recognition Systems' Bias and Proposed Bias Mitigation Techniques. A Literature Review	Nov 17, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hierarchical Bayesian Language Modelling for the Linguistically Informed	Apr 1, 2012	Language ModellingMachine Translation	—Unverified
Hierarchical Conditional End-to-End ASR with CTC and Multi-Granular Subword Units	Oct 8, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hierarchical Cross-Modality Knowledge Transfer with Sinkhorn Attention for CTC-based ASR	Sep 28, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hierarchical Latent Words Language Models for Robust Modeling to Out-Of Domain Tasks	Sep 1, 2015	Language ModellingMachine Translation	—Unverified
Hierarchical Multitask Learning for CTC-based Speech Recognition	Jul 17, 2018	Decoderspeech-recognition	—Unverified
Hierarchical Multi Task Learning With CTC	Jul 18, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hierarchical Neural Network Architecture In Keyword Spotting	Nov 6, 2018	Keyword Spottingspeech-recognition	—Unverified
Hierarchical Recurrent Adapters for Efficient Multi-Task Adaptation of Large Speech Models	Mar 25, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
Chipmunk: A Systolically Scalable 0.9 mm^2, 3.08 Gop/s/mW @ 1.2 mW Accelerator for Near-Sensor Recurrent Neural Network Inference	Nov 15, 2017	speech-recognitionSpeech Recognition	—Unverified
Hierarchical Sequence to Sequence Voice Conversion with Limited Data	Jul 15, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Fast Real-time Personalized Speech Enhancement: End-to-End Enhancement Network (E3Net) and Knowledge Distillation	Apr 2, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hierarchical Summarization for Longform Spoken Dialog	Aug 21, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Fast offline Transformer-based end-to-end automatic speech recognition for real-world applications	Jan 14, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hierarchical Transformer-based Large-Context End-to-end ASR with Large-Context Knowledge Distillation	Feb 16, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Chinese Medical Speech Recognition with Punctuated Hypothesis	Oct 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
High-Accuracy and Low-Latency Speech Recognition with Two-Head Contextual Layer Trajectory LSTM Model	Mar 17, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Highland Puebla Nahuatl Speech Translation Corpus for Endangered Language Documentation	Jun 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Highly-Reverberant Real Environment database: HRRE	Mar 23, 2018	speech-recognitionSpeech Recognition	—Unverified
Arabic Diacritization with Recurrent Neural Networks	Sep 1, 2015	Language ModellingMorphological Analysis	—Unverified
Fast Node Embeddings: Learning Ego-Centric Representations	Jan 1, 2018	Link PredictionMachine Translation	—Unverified
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides	Apr 21, 2025	Audio-Visual Speech RecognitionAutomatic Speech Recognition	—Unverified
High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR	Nov 24, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Fast Labeling and Transcription with the Speechalyzer Toolkit	May 1, 2012	Audio ClassificationBenchmarking	—Unverified
Highway Long Short-Term Memory RNNs for Distant Speech Recognition	Oct 30, 2015	Distant Speech Recognitionspeech-recognition	—Unverified
Hindi-English Code-Switching Speech Corpus	Sep 24, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HinMA: Distributed Morphology based Hindi Morphological Analyzer	Dec 1, 2014	Morphological AnalysisSpeech Recognition	—Unverified
FastInject: Injecting Unpaired Text Data into CTC-based ASR training	Dec 14, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings	Apr 20, 2020	speaker-diarizationSpeaker Diarization	—Unverified
Arabic Code-Switching Speech Recognition using Monolingual Data	Jul 4, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HMM-Free Encoder Pre-Training for Streaming RNN Transducer	Apr 2, 2021	Speech Recognition	—Unverified
Adversarial Speaker Adaptation	Apr 29, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
homeService: Voice-enabled assistive technology in the home using cloud-based automatic speech recognition	Aug 1, 2013	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Homogeneous Speaker Features for On-the-Fly Dysarthric and Elderly Speaker Adaptation	Jul 8, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Homophone-based Label Smoothing in End-to-End Automatic Speech Recognition	Apr 7, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
FastGRNN: A Fast, Accurate, Stable and Tiny Kilobyte Sized Gated Recurrent Neural Network	Jan 8, 2019	Action ClassificationLanguage Modelling	—Unverified
Child Speech Recognition in Human-Robot Interaction: Problem Solved?	Apr 26, 2024	GPUspeech-recognition	—Unverified
Houdini: Fooling Deep Structured Prediction Models	Jul 17, 2017	General ClassificationPose Estimation	—Unverified
Houdini: Fooling Deep Structured Visual and Speech Recognition Models with Adversarial Examples	Dec 1, 2017	General ClassificationPose Estimation	—Unverified
Fast frequency modulation is encoded according to the listener expectations in the human subcortical auditory pathway	Aug 4, 2021	speech-recognitionSpeech Recognition	—Unverified
Faster Speech-LLaMA Inference with Multi-token Prediction	Sep 12, 2024	DecoderPrediction	—Unverified
How Accents Confound: Probing for Accent Information in End-to-End Speech Recognition Systems	Jul 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
How Bad Are Artifacts?: Analyzing the Impact of Speech Enhancement Errors on ASR	Jan 18, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
How Diachronic Text Corpora Affect Context based Retrieval of OOV Proper Names for Audio News	May 1, 2016	Retrievalspeech-recognition	—Unverified
Children's Speech Recognition through Discrete Token Enhancement	Jun 19, 2024	speech-recognitionSpeech Recognition	—Unverified

Show:10 25 50

← PrevPage 56 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified