Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4001–4050 of 6433 papers

Title	Date	Tasks	Status
Self-Attentional Models for Lattice Inputs	Jun 4, 2019	Computational Efficiencyspeech-recognition	—Unverified
Self-Attention Channel Combinator Frontend for End-to-End Multichannel Far-field Speech Recognition	Sep 10, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-Attention Transducers for End-to-End Speech Recognition	Sep 28, 2019	speech-recognitionSpeech Recognition	—Unverified
Self-consistent context aware conformer transducer for speech recognition	Feb 9, 2024	Automatic Speech RecognitionLanguage Modeling	—Unverified
Self-critical Sequence Training for Automatic Speech Recognition	Apr 13, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self Generated Wargame AI: Double Layer Agent Task Planning Based on Large Language Model	Dec 2, 2023	Decision MakingLanguage Modeling	—Unverified
Self-Normalized Importance Sampling for Neural Language Modeling	Nov 11, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-regularised Minimum Latency Training for Streaming Transformer-based Speech Recognition	Apr 24, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-reinforcing Unsupervised Matching	Aug 23, 2019	Continual LearningDiversity	—Unverified
Self-supervised Adaptive Pre-training of Multilingual Speech Models for Language and Dialect Identification	Dec 12, 2023	Automatic Speech RecognitionDialect Identification	—Unverified
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition	Jul 3, 2024	Alzheimer's Disease DetectionSelf-Supervised Learning	—Unverified
Self-Supervised Learning-Based Source Separation for Meeting Data	Apr 3, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-supervised learning with bi-label masked speech prediction for streaming multi-talker speech recognition	Nov 10, 2022	Representation LearningSelf-Supervised Learning	—Unverified
Self-supervised Learning with Speech Modulation Dropout	Mar 22, 2023	Automatic Speech RecognitionSelf-Supervised Learning	—Unverified
Self-Supervised Masked Digital Elevation Models Encoding for Low-Resource Downstream Tasks	Sep 6, 2023	Self-Supervised Learningspeech-recognition	—Unverified
Self-Supervised Models for Phoneme Recognition: Applications in Children's Speech for Reading Learning	Mar 6, 2025	Phoneme RecognitionSelf-Supervised Learning	—Unverified
Self-supervised Neural Factor Analysis for Disentangling Utterance-level Speech Representations	May 14, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-supervised reinforcement learning for speaker localisation with the iCub humanoid robot	Nov 12, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-Supervised Representations Improve End-to-End Speech Translation	Jun 22, 2020	Cross-Lingual Transferspeech-recognition	—Unverified
Self-supervised representations in speech-based depression detection	May 20, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-supervised Semantic-driven Phoneme Discovery for Zero-resource Speech Recognition	May 1, 2022	Phoneme RecognitionRepresentation Learning	—Unverified
Semi-supervised Sequence-to-sequence ASR using Unpaired Speech and Text	Apr 30, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric	Jun 2, 2025	Automatic Speech Recognitionspeech-recognition	—Unverified
Self-Supervised Speech Recognition via Local Prior Matching	Sep 25, 2019	Language ModelingLanguage Modelling	—Unverified
Self-Supervised Speech Representation Learning: A Review	May 21, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Self-Supervised Speech Representations Preserve Speech Characteristics while Anonymizing Voices	Apr 4, 2022	Speaker Verificationspeech-recognition	—Unverified
Self-Teaching Networks	Sep 9, 2019	speech-recognitionSpeech Recognition	—Unverified
Self-Training for End-to-End Speech Recognition	Sep 19, 2019	DiversityLanguage Modeling	—Unverified
Self-Training for End-to-End Speech Translation	Jun 3, 2020	speech-recognitionSpeech Recognition	—Unverified
Self-training improves Recurrent Neural Networks performance for Temporal Relation Extraction	Oct 1, 2018	Feature EngineeringMachine Translation	—Unverified
SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions	Jan 31, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic Communications for Speech Recognition	Jul 22, 2021	Semantic Communicationspeech-recognition	—Unverified
Semantic Data Augmentation for End-to-End Mandarin Speech Recognition	Apr 26, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding	Apr 5, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic Language Model for Tunisian Dialect	Sep 1, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic parsing of speech using grammars learned with weak supervision	May 1, 2015	Language ModellingSemantic Parsing	—Unverified
Semantic-preserved Communication System for Highly Efficient Speech Transmission	May 25, 2022	Semantic Communicationspeech-recognition	—Unverified
Semantic Role Labeling Improves Incremental Parsing	Jul 1, 2015	Information RetrievalMachine Translation	—Unverified
Semantic sentence similarity: size does not always matter	Jun 16, 2021	Grounded language learningImage Retrieval	—Unverified
Semantics for Large-Scale Multimedia: New Challenges for NLP	Jun 1, 2014	Active LearningInformation Retrieval	—Unverified
Semantic VAD: Low-Latency Voice Activity Detection for Speech Interaction	May 21, 2023	Action DetectionActivity Detection	—Unverified
Semantic-WER: A Unified Metric for the Evaluation of ASR Transcript for End Usability	Jun 3, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
SeMaScore : a new evaluation metric for automatic speech recognition tasks	Jan 15, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
SememeASR: Boosting Performance of End-to-End Speech Recognition against Domain and Long-Tailed Data Shift with Sememe Semantic Knowledge	Sep 4, 2023	Domain Generalizationspeech-recognition	—Unverified
Semi-automatic annotation of the UCU accents speech corpus	May 1, 2014	Event DetectionSpeech Recognition	—Unverified
Semi-Autoregressive Streaming ASR With Label Context	Sep 19, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition	Apr 5, 2020	Language ModelingLanguage Modelling	—Unverified
Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition	May 1, 2020	Language ModelingLanguage Modelling	—Unverified
Semi-supervised acoustic modelling for five-lingual code-switched ASR using automatically-segmented soap opera speech	Apr 8, 2020	Acoustic ModellingAction Detection	—Unverified
Semi-supervised acoustic model training for speech with code-switching	Oct 23, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 81 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified