Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 3351–3400 of 6433 papers

Title	Date	Tasks	Status
The USTC-NEL Speech Translation system at IWSLT 2018	Dec 6, 2018	Machine Translationspeech-recognition	—Unverified
The USTC-NERCSLIP Systems for the CHiME-7 DASR Challenge	Aug 28, 2023	speaker-diarizationSpeaker Diarization	—Unverified
The USTC-NERCSLIP Systems for the CHiME-8 NOTSOFAR-1 Challenge	Sep 3, 2024	speech-recognitionSpeech Recognition	—Unverified
The USTC-NERCSLIP Systems for the CHiME-8 MMCSG Challenge	Oct 8, 2024	speech-recognitionSpeech Recognition	—Unverified
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge	Jul 2, 2024	Automatic Speech RecognitionPseudo Label	—Unverified
The Virtual Doctor: An Interactive Artificial Intelligence based on Deep Learning for Non-Invasive Prediction of Diabetes	Mar 9, 2019	Prognosisspeech-recognition	—Unverified
The VoicePrivacy 2022 Challenge: Progress and Perspectives in Voice Anonymisation	Jul 16, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
The Volcspeech system for the ICASSP 2022 multi-channel multi-party meeting transcription challenge	Feb 9, 2022	Data AugmentationLanguage Modelling	—Unverified
The WaveSurfer Automatic Speech Recognition Plugin	May 1, 2014	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The WAW Corpus: The First Corpus of Interpreted Speeches and their Translations for English and Arabic	May 1, 2018	Automatic Speech Recognition (ASR)Machine Translation	—Unverified
The Xiaomi Text-to-Text Simultaneous Speech Translation System for IWSLT 2022	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The X-LANCE Technical Report for Interspeech 2024 Speech Processing Using Discrete Speech Unit Challenge	Apr 9, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The ZevoMOS entry to VoiceMOS Challenge 2022	Jun 15, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition	Jun 17, 2025	Data AugmentationLanguage Modeling	—Unverified
"This is Houston. Say again, please". The Behavox system for the Apollo-11 Fearless Steps Challenge (phase II)	Aug 4, 2020	Action DetectionActivity Detection	—Unverified
Thoughts on the potential to compensate a hearing loss in noise	Feb 24, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HAINAN: Fast and Accurate Transducer for Hybrid-Autoregressive ASR	Oct 3, 2024	speech-recognitionSpeech Recognition	—Unverified
Three-Module Modeling For End-to-End Spoken Language Understanding Using Pre-trained DNN-HMM-Based Acoustic-Phonetic Model	Apr 7, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Thutmose Tagger: Single-pass neural model for Inverse Text Normalization	Jul 29, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Tied Probabilistic Linear Discriminant Analysis for Speech Recognition	Nov 4, 2014	speech-recognitionSpeech Recognition	—Unverified
Tigrinya Automatic Speech recognition with Morpheme based recognition units	Jul 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection	Sep 20, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Time-Contrastive Learning Based Deep Bottleneck Features for Text-Dependent Speaker Verification	May 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Progressive Learning for Stabilizing Label Selection in Speech Separation with Mapping-based Method	Oct 20, 2021	Speech RecognitionSpeech Separation	—Unverified
Time-Domain Speech Enhancement for Robust Automatic Speech Recognition	Oct 24, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Time-Domain Speech Extraction with Spatial Information and Multi Speaker Conditioning Mechanism	Feb 7, 2021	Speech Extractionspeech-recognition	—Unverified
Time-Frequency Localization Using Deep Convolutional Maxout Neural Network in Persian Speech Recognition	Aug 9, 2021	speech-recognitionSpeech Recognition	—Unverified
Time Series Classification using the Hidden-Unit Logistic Model	Jun 16, 2015	Action RecognitionAction Unit Detection	—Unverified
Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge	Nov 21, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
TinySpeech: Attention Condensers for Deep Speech Recognition Neural Networks on Edge Devices	Aug 10, 2020	speech-recognitionSpeech Recognition	—Unverified
TLT-school: a Corpus of Non Native Children Speech	Jan 22, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
T-NGA: Temporal Network Grafting Algorithm for Learning to Process Spiking Audio Sensor Events	Feb 7, 2022	speech-recognitionSpeech Recognition	—Unverified
TOD-DA: Towards Boosting the Robustness of Task-oriented Dialogue Modeling on Spoken Conversations	Dec 23, 2021	Data Augmentationspeech-recognition	—Unverified
TODM: Train Once Deploy Many Efficient Supernet-Based RNN-T Compression For On-device ASR Models	Sep 5, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Token-Level Ensemble Distillation for Grapheme-to-Phoneme Conversion	Apr 6, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Token-Level Serialized Output Training for Joint Streaming ASR and ST Leveraging Textual Alignments	Jul 7, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
TokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript-Conditioned Speech Separation and Recognition	Aug 21, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Top-down training for neural networks	Sep 25, 2019	speech-recognitionSpeech Recognition	—Unverified
Topic Classification on Spoken Documents Using Deep Acoustic and Linguistic Features	Jun 16, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Topic Identification and Discovery on Text and Speech	Sep 1, 2015	Dimensionality ReductionSpeech Recognition	—Unverified
Topic Identification for Speech without ASR	Mar 22, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Topic Model Robustness to Automatic Speech Recognition Errors in Podcast Transcripts	Sep 25, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Topological Deep Learning for Speech Data	May 27, 2025	Deep LearningPhoneme Recognition	—Unverified
TopologyNet: Topology based deep convolutional neural networks for biomolecular property predictions	Mar 31, 2017	speech-recognitionSpeech Recognition	—Unverified
To Reverse the Gradient or Not: An Empirical Comparison of Adversarial and Multi-task Learning in Speech Recognition	Dec 9, 2018	Multi-Task LearningSpeaker Recognition	—Unverified
TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch	Dec 20, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Tourist Guidance Robot Based on HyperCLOVA	Oct 19, 2022	speech-recognitionSpeech Recognition	—Unverified
Toward Automated Content Feedback Generation for Non-native Spontaneous Speech	Aug 1, 2019	speech-recognitionSpeech Recognition	—Unverified
Toward Automated Detection of Biased Social Signals from the Content of Clinical Conversations	Jul 1, 2024	Fairnessspeech-recognition	—Unverified
Toward a Web-based Speech Corpus for Algerian Dialectal Arabic Varieties	Apr 1, 2017	Speech RecognitionSpeech Synthesis	—Unverified

Show:10 25 50

← PrevPage 68 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified