Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 5301–5350 of 6433 papers

Title	Date	Tasks	Status
Self-Supervised Speech Representations Preserve Speech Characteristics while Anonymizing Voices	Apr 4, 2022	Speaker Verificationspeech-recognition	—Unverified
Self-Teaching Networks	Sep 9, 2019	speech-recognitionSpeech Recognition	—Unverified
Self-Training for End-to-End Speech Recognition	Sep 19, 2019	DiversityLanguage Modeling	—Unverified
Self-Training for End-to-End Speech Translation	Jun 3, 2020	speech-recognitionSpeech Recognition	—Unverified
Self-training improves Recurrent Neural Networks performance for Temporal Relation Extraction	Oct 1, 2018	Feature EngineeringMachine Translation	—Unverified
SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions	Jan 31, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic Communications for Speech Recognition	Jul 22, 2021	Semantic Communicationspeech-recognition	—Unverified
Semantic Data Augmentation for End-to-End Mandarin Speech Recognition	Apr 26, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding	Apr 5, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic Language Model for Tunisian Dialect	Sep 1, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semantic parsing of speech using grammars learned with weak supervision	May 1, 2015	Language ModellingSemantic Parsing	—Unverified
Semantic-preserved Communication System for Highly Efficient Speech Transmission	May 25, 2022	Semantic Communicationspeech-recognition	—Unverified
Semantic Role Labeling Improves Incremental Parsing	Jul 1, 2015	Information RetrievalMachine Translation	—Unverified
Semantic sentence similarity: size does not always matter	Jun 16, 2021	Grounded language learningImage Retrieval	—Unverified
Semantics for Large-Scale Multimedia: New Challenges for NLP	Jun 1, 2014	Active LearningInformation Retrieval	—Unverified
Semantic VAD: Low-Latency Voice Activity Detection for Speech Interaction	May 21, 2023	Action DetectionActivity Detection	—Unverified
Semantic-WER: A Unified Metric for the Evaluation of ASR Transcript for End Usability	Jun 3, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
SeMaScore : a new evaluation metric for automatic speech recognition tasks	Jan 15, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
SememeASR: Boosting Performance of End-to-End Speech Recognition against Domain and Long-Tailed Data Shift with Sememe Semantic Knowledge	Sep 4, 2023	Domain Generalizationspeech-recognition	—Unverified
Semi-automatic annotation of the UCU accents speech corpus	May 1, 2014	Event DetectionSpeech Recognition	—Unverified
Semi-Autoregressive Streaming ASR With Label Context	Sep 19, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition	Apr 5, 2020	Language ModelingLanguage Modelling	—Unverified
Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition	May 1, 2020	Language ModelingLanguage Modelling	—Unverified
Semi-supervised acoustic modelling for five-lingual code-switched ASR using automatically-segmented soap opera speech	Apr 8, 2020	Acoustic ModellingAction Detection	—Unverified
Semi-supervised acoustic model training for speech with code-switching	Oct 23, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semi-supervised ASR by End-to-end Self-training	Jan 24, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semi-Supervised Discriminative Language Modeling with Out-of-Domain Text Data	Jun 1, 2013	Language ModelingLanguage Modelling	—Unverified
Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter	Jul 5, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semi-supervised Learning with Sparse Autoencoders in Phone Classification	Oct 3, 2016	Acoustic ModellingAutomatic Speech Recognition	—Unverified
Semi-Supervised Model Training for Unbounded Conversational Speech Recognition	May 26, 2017	Language ModelingLanguage Modelling	—Unverified
Semi-Supervised Speech Recognition via Graph-based Temporal Classification	Oct 29, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semi-supervised transfer learning for language expansion of end-to-end speech recognition models to low-resource languages	Nov 19, 2021	Data Augmentationspeech-recognition	—Unverified
Semi-tied Units for Efficient Gating in LSTM and Highway Networks	Jun 18, 2018	speech-recognitionSpeech Recognition	—Unverified
SeniorTalk: A Chinese Conversation Dataset with Rich Annotations for Super-Aged Seniors	Mar 20, 2025	speaker-diarizationSpeaker Diarization	—Unverified
Senone-aware Adversarial Multi-task Training for Unsupervised Child to Adult Speech Adaptation	Feb 23, 2021	speech-recognitionSpeech Recognition	—Unverified
Sentence Boundary Augmentation For Neural Machine Translation Robustness	Oct 21, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Sentence Compression For Automatic Subtitling	May 1, 2015	SentenceSentence Compression	—Unverified
Sentence segmentation of aphasic speech	May 1, 2015	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Sentence selection for automatic scoring of Mandarin proficiency	Jul 1, 2015	SentenceSpeech Recognition	—Unverified
Sentence-Select: Large-Scale Language Model Data Selection for Rare-Word Speech Recognition	Mar 9, 2022	Language ModelingLanguage Modelling	—Unverified
Sentiment Analysis using Imperfect Views from Spoken Language and Acoustic Modalities	Jul 1, 2018	Automatic Speech Recognition (ASR)General Classification	—Unverified
Sentiment-Aware Automatic Speech Recognition pre-training for enhanced Speech Emotion Recognition	Jan 27, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
SEP-28k: A Dataset for Stuttering Event Detection From Podcasts With People Who Stutter	Feb 24, 2021	Event Detectionspeech-recognition	—Unverified
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation	May 6, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Separator-Transducer-Segmenter: Streaming Recognition and Segmentation of Multi-party Speech	May 10, 2022	Segmentationspeech-recognition	—Unverified
Sequence-based Multi-lingual Low Resource Speech Recognition	Feb 21, 2018	speech-recognitionSpeech Recognition	—Unverified
Sequence Discriminative Training for Deep Learning based Acoustic Keyword Spotting	Aug 2, 2018	Deep LearningKeyword Spotting	—Unverified
Sequence-level Confidence Classifier for ASR Utterance Accuracy and Application to Acoustic Models	Jun 30, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Sequence-Level Knowledge Distillation for Model Compression of Attention-based Sequence-to-Sequence Speech Recognition	Nov 12, 2018	Knowledge DistillationModel Compression	—Unverified
Sequence-level self-learning with multiple hypotheses	Dec 10, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 107 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified