Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1801–1850 of 6433 papers

Title	Date	Tasks	Status
Development of a TV Broadcasts Speech Recognition System for Qatari Arabic	May 1, 2014	Arabic Speech RecognitionLanguage Modeling	—Unverified
Development of Automatic Speech Recognition for the Documentation of Cook Islands Māori	Jun 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Development of Hybrid Algorithm for Automatic Extraction of Multiword Expressions from Monolingual and Parallel Corpus of English and Punjabi	Dec 1, 2020	Information RetrievalMachine Translation	—Unverified
Development of Natural Language Processing Tools for Cook Islands M\=aori	Dec 1, 2018	Machine TranslationPart-Of-Speech Tagging	—Unverified
Development of Speech corpora for different Speech Recognition tasks in Malayalam language	Dec 1, 2015	speech-recognitionSpeech Recognition	—Unverified
Development of Text and Speech database for Hindi and Indian English specific to Mobile Communication environment	May 1, 2012	Language IdentificationSpeech Recognition	—Unverified
Clean Label Attacks against SLU Systems	Sep 13, 2024	Data Poisoningspeech-recognition	—Unverified
Device Directedness with Contextual Cues for Spoken Dialog Systems	Nov 23, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cleanformer: A multichannel array configuration-invariant neural enhancement frontend for ASR in smart speakers	Apr 25, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Device-directed Utterance Detection	Aug 7, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DEXTER: Deep Encoding of External Knowledge for Named Entity Recognition in Virtual Assistants	Aug 15, 2021	named-entity-recognitionNamed Entity Recognition	—Unverified
DFSMN-SAN with Persistent Memory Model for Automatic Speech Recognition	Oct 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DiaBiz – an Annotated Corpus of Polish Call Center Dialogs	Jun 1, 2022	speech-recognitionSpeech Recognition	—Unverified
Automatic Speech Recognition and Topic Identification for Almost-Zero-Resource Languages	Feb 23, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Are disentangled representations all you need to build speaker anonymization systems?	Aug 22, 2022	AllAutomatic Speech Recognition	—Unverified
Diacritic Recognition Performance in Arabic ASR	Feb 27, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Diagonal State Space Augmented Transformers for Speech Recognition	Feb 27, 2023	speech-recognitionSpeech Recognition	—Unverified
Dialect Adaptation and Data Augmentation for Low-Resource ASR: TalTech Systems for the MADASR 2023 Challenge	Oct 26, 2023	Automatic Speech RecognitionData Augmentation	—Unverified
Class LM and word mapping for contextual biasing in End-to-End ASR	Jul 10, 2020	speech-recognitionSpeech Recognition	—Unverified
Classist Tools: Social Class Correlates with Performance in NLP	Mar 7, 2024	Automatic Speech RecognitionLanguage Modelling	—Unverified
Dialect Identification through Adversarial Learning and Knowledge Distillation on Romanian BERT	Apr 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialect-Specific Models for Automatic Speech Recognition of African American Vernacular English	Sep 1, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialog act guided contextual adapter for personalized speech recognition	Mar 31, 2023	Automatic Speech Recognitionspeech-recognition	—Unverified
Dialog-context aware end-to-end speech recognition	Aug 7, 2018	Sentencespeech-recognition	—Unverified
Dialog Generation Using Multi-Turn Reasoning Neural Networks	Jun 1, 2018	Constituency ParsingImage Captioning	—Unverified
Dialog state tracking, a machine reading approach using Memory Network	Jun 13, 2016	dialog state trackingManagement	—Unverified
Dialogue Act Classification in Domain-Independent Conversations Using a Deep Recurrent Neural Network	Dec 1, 2016	Automatic Speech Recognition (ASR)Dialogue Act Classification	—Unverified
Dialogue Act Segmentation for Vietnamese Human-Human Conversational Texts	Aug 16, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialogue-Based Simulation For Cultural Awareness Training	Feb 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialogue Management based on Multi-domain Corpus	Sep 1, 2015	Dialogue ManagementManagement	—Unverified
Dialogue Strategy Learning in Healthcare: A Systematic Approach for Learning Dialogue Models from Data	Jun 1, 2014	Decision MakingSpeech Recognition	—Unverified
Dialogue Systems Can Generate Appropriate Responses without the Use of Question Marks? -- Investigation of the Effects of Question Marks on Dialogue Systems	Aug 7, 2023	Sentencespeech-recognition	—Unverified
A Recorded Debating Dataset	Sep 19, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models	Jun 6, 2025	Automatic Speech Recognitionspeaker-diarization	—Unverified
Adversarial Training for Multilingual Acoustic Modeling	Jun 17, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Distributed Hessian-Free Optimization for Deep Neural Network	Jun 2, 2016	CPUspeech-recognition	—Unverified
Automatic speech recognition for launch control center communication using recurrent neural networks with data augmentation and custom language model	Apr 24, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Differences in User Responses to a Wizard-of-Oz versus Automated System	Jun 1, 2013	Speech Recognition	—Unverified
Automatic Speech Recognition for Non-Native English: Accuracy and Disfluency Handling	Mar 10, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Differentiable Pooling for Unsupervised Acoustic Model Adaptation	Mar 31, 2016	modelspeech-recognition	—Unverified
Classifying Dialogue Acts in Multi-party Live Chats	Nov 1, 2012	Dialogue Act ClassificationSpeech Recognition	—Unverified
Differentially Private Speaker Anonymization	Feb 23, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Classifying Arab Names Geographically	Jul 1, 2015	Speech RecognitionTransliteration	—Unverified
Digits micro-model for accurate and secure transactions	Feb 2, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dilated U-net based approach for multichannel speech enhancement from First-Order Ambisonics recordings	Jun 2, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Automatic Speech Recognition for the Ika Language	Oct 1, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Real-time Robot-based Auxiliary System for Risk Evaluation of COVID-19 Infection	Aug 18, 2020	Diagnosticspeech-recognition	—Unverified
Direct Acoustics-to-Word Models for English Conversational Speech Recognition	Mar 22, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Directed Speech Separation for Automatic Speech Recognition of Long Form Conversational Speech	Dec 10, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Classification of Closely Related Sub-dialects of Arabic Using Support-Vector Machines	May 1, 2018	Automatic Speech Recognition (ASR)General Classification	—Unverified

Show:10 25 50

← PrevPage 37 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified