Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 6001–6050 of 6433 papers

Title	Date	Tasks	Status
Best of Both Worlds: Robust Accented Speech Recognition with Adversarial Transfer Learning	Mar 10, 2021	Accented Speech RecognitionAutomatic Speech Recognition	—Unverified
Best Practices for Crowdsourcing Dialectal Arabic Speech Transcription	Jul 1, 2015	Speech Recognition	—Unverified
Best Practices for Noise-Based Augmentation to Improve the Performance of Deployable Speech-Based Emotion Recognition Systems	Apr 18, 2021	Adversarial AttackAutomatic Speech Recognition	—Unverified
Best Practices for Noise-Based Augmentation to Improve the Performance of Deployable Speech-Based Emotion Recognition Systems	Jun 16, 2021	Data AugmentationEmotion Recognition	—Unverified
Better Pseudo-labeling with Multi-ASR Fusion and Error Correction by SpeechLLM	Jun 5, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Better Transcription of UK Supreme Court Hearings	Nov 29, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Beyond Binary: Multiclass Paraphasia Detection with Generative Pretrained Transformers and End-to-End Models	Jul 16, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems	Nov 20, 2023	Autonomous DrivingAutonomous Vehicles	—Unverified
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs	Jun 7, 2025	Emotion Recognitionspeech-recognition	—Unverified
Beyond Manual Transcripts: The Potential of Automated Speech Recognition Errors in Improving Alzheimer's Disease Detection	May 26, 2025	Alzheimer's Disease DetectionAutomatic Speech Recognition	—Unverified
Beyond Novelty Detection: Incongruent Events, when General and Specific Classifiers Disagree	Dec 1, 2008	Novelty DetectionObject Recognition	—Unverified
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets	Mar 12, 2024	speech-recognitionSpeech Recognition	—Unverified
Beyond Universal Transformer: block reusing with adaptor in Transformer for automatic speech recognition	Mar 23, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bi-APC: Bidirectional Autoregressive Predictive Coding for Unsupervised Pre-training and Its Application to Children's ASR	Feb 12, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Biased Self-supervised learning for ASR	Nov 4, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Biber Redux: Reconsidering Dimensions of Variation in American English	Aug 1, 2014	Domain AdaptationInformation Retrieval	—Unverified
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR	Jun 16, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bidirectional Representations for Low Resource Spoken Language Understanding	Nov 24, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bidirectional RNN for Medical Event Detection in Electronic Health Records	Jun 1, 2016	Event DetectionIntrusion Detection	—Unverified
Bifocal Neural ASR: Exploiting Keyword Spotting for Inference Optimization	Aug 3, 2021	Inference OptimizationKeyword Spotting	—Unverified
BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition	Sep 27, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition	Dec 11, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
Bilingual End-to-End ASR with Byte-Level Subwords	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bilingual Streaming ASR with Grapheme units and Auxiliary Monolingual Loss	Aug 11, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Binarized LSTM Language Model	Jun 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Binary classification of spoken words with passive phononic metamaterials	Nov 14, 2021	Binary ClassificationClassification	—Unverified
BioDCA Identifier: A System for Automatic Identification of Discourse Connective and Arguments from Biomedical Text	Dec 1, 2016	Named Entity Recognition (NER)Speech Recognition	—Unverified
Bio-Inspired Mamba: Temporal Locality and Bioplausible Learning in Selective State Space Models	Sep 17, 2024	Language ModelingLanguage Modelling	—Unverified
Birzeit Arabic Dialect Identification System for the 2018 VarDial Challenge	Aug 1, 2018	Dialect IdentificationLanguage Modeling	—Unverified
Catch Me If You Can: Blackbox Adversarial Attacks on Automatic Speech Recognition using Frequency Masking	Dec 3, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Blank-regularized CTC for Frame Skipping in Neural Transducer	May 19, 2023	Automatic Speech Recognitionspeech-recognition	—Unverified
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024	Jun 24, 2024	Action DetectionActivity Detection	—Unverified
Blending LSTMs into CNNs	Nov 19, 2015	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Blind and neural network-guided convolutional beamformer for joint denoising, dereverberation, and source separation	Aug 4, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Blind dereverberation of single channel speech signal based on harmonic structure	Apr 6, 2003	speech-recognitionSpeech Recognition	—Unverified
Blind phoneme segmentation with temporal prediction errors	Aug 1, 2016	Predictionspeech-recognition	—Unverified
Blind Signal Dereverberation for Machine Speech Recognition	Sep 30, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Block-Sparse Recurrent Neural Networks	Nov 8, 2017	Language ModellingMachine Translation	—Unverified
Blockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation	Apr 19, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
BLSTM-Based Confidence Estimation for End-to-End Speech Recognition	Dec 22, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Book Reviews: Robots that Talk and Listen edited by Judith A. Markowitz	Jun 1, 2015	Speech Recognition	—Unverified
Boosting Chinese ASR Error Correction with Dynamic Error Scaling Mechanism	Aug 7, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM	Sep 24, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Boosting End-to-End Multilingual Phoneme Recognition through Exploiting Universal Speech Attributes Constraints	Sep 16, 2023	AttributeAutomatic Speech Recognition	—Unverified
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding	Sep 30, 2024	speech-recognitionSpeech Recognition	—Unverified
Boosting Local Spectro-Temporal Features for Speech Analysis	May 17, 2023	Classificationobject-detection	—Unverified
Boosting LSTM Performance Through Dynamic Precision Selection	Nov 7, 2019	Machine Translationspeech-recognition	—Unverified
Boosting Noise Robustness of Acoustic Model via Deep Adversarial Training	May 2, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Boosting Norwegian Automatic Speech Recognition	Jul 4, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Boosting Punctuation Restoration with Data Generation and Reinforcement Learning	Jul 24, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 121 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified